GPT-5.6 vs Claude Fable 5, 어떤 모델을 써야 할까
결론부터 던지고 시작하겠습니다. 저장소 통째로 붙잡고 씨름하는 코딩엔 Fable 5, 오래 굴리는 에이전트 파이프라인엔 GPT-5.6. 이게 2026년 7월 현재 가장 무난한 정답입니다. 근데 문제는 이 정답이 "회사 발표 벤치마크" 기준이라는 거고, 실제로 써본 개발자들 후기를 뒤져보면 이야기가 또 미묘하게 달라집니다. 오늘은 그 간극까지 파봅니다.
두 모델의 출시 배경은 GPT-5.6 Sol·Terra·Luna 정리와 Claude Fable 5·Mythos 5 셧다운 정리에서 이미 다뤘으니, 여기선 비교와 선택 기준에만 집중합니다.
가격표: Fable 5가 2배 비싸다는 착시
| 항목 | GPT-5.6 (Sol / Terra / Luna) | Claude Fable 5 |
|---|---|---|
| 입력(1M 토큰) | $5 / $2.50 / $1 | $10 |
| 출력(1M 토큰) | $30 / $15 / $6 | $50 |
| 컨텍스트 | 100만 토큰 | 100만 토큰 |
| 최대 출력 | 12.8만 토큰 | 12.8만 토큰 |
숫자만 보면 Sol이 압승입니다. 그런데 함정이 하나 있습니다. Sol은 입력이 27.2만 토큰을 넘어가는 순간 요금제가 $10/$45로 뛰어오릅니다. 반면 Fable 5는 100만 토큰 전 구간을 그냥 $10/$50 단일 요금으로 밀고 갑니다. 즉 짧은 대화 몇 번 주고받을 땐 Sol이 훨씬 싸지만, 저장소 통째로 던져 넣는 장문 작업에서는 가격 차이가 확 좁혀집니다. 여기에 Fable 5는 프롬프트 캐싱 시 입력 토큰을 최대 90%까지 할인해주니, "표면 단가 2배"라는 말만 믿고 지갑을 닫기엔 이릅니다.
벤치마크는 원래 서로 자기가 이긴 표만 보여줍니다
각사 발표 수치를 그대로 옮기면 이렇습니다.
- SWE-Bench Pro(저장소 단위 이슈 해결): Fable 5 80.3% vs Sol 64.6%대. 격차 15%p 이상, 가장 확실한 Fable 5 우위 영역.
- Agents' Last Exam(장시간 에이전트 업무): Sol 53.6점으로 Fable 5를 13.1점 앞섰다고 OpenAI는 주장합니다. 다만 이건 Sol은 Codex CLI 하니스, Fable은 Claude Code 하니스로 돌린 결과라 "모델 대 모델"이 아니라 "모델+도구 조합 대 조합" 비교에 가깝습니다.
- Terminal-Bench 2.1: 이게 재밌는 게, 출처마다 숫자가 다 다릅니다. 앤트로픽 자체 발표는 Fable 86.0%, 외부 평가 기관 기준으로는 83~84%대. Sol은 어떤 자료는 88.8%, 어떤 벤치마크 애그리게이터는 91.9%까지 적어놨습니다. 같은 시험을 봤는데 성적표가 세 장 나온 셈입니다.
- 종합 지능 지표(Artificial Analysis Intelligence Index): Fable 5가 59.9, Sol이 58.9. 1점 차이면 사실상 무승부입니다.
결론: "지능"은 거의 비슷하고, "코딩 심화"는 Fable 5, "장기 에이전트 지구력"은 Sol이 우세하다는 큰 그림은 유지됩니다. 다만 벤치마크 숫자 자체를 절대값으로 믿지 말고, 방향성 참고 자료 정도로만 취급하는 게 안전합니다.
벤치마크 밖에서 실제로 체감되는 것들
- 속도: 같은 품질의 답을 낼 때 Sol이 Fable 5보다 응답 시간이 대략 2배 걸린다는 사용기가 있습니다. reasoning 모드를 올릴수록 이 차이는 더 벌어집니다.
- 작업당 비용: 벤치마크 점수가 아니라 "같은 에이전트 워크플로를 실제로 돌렸을 때 청구되는 금액"으로 비교하면 Sol이 작업당 약 40% 저렴하다는 분석이 있습니다(약 $7 vs $11 수준). 토큰 단가보다 이 숫자가 예산 짤 때는 더 유용합니다.
- 실사용 후기와 벤치마크의 괴리: Agents' Last Exam에서 신기록을 세운 게 Sol인데, 정작 복잡한 코딩 작업을 실제로 맡겨본 개발자들 사이에서는 "벤치마크는 1위지만 까다로운 리팩터링은 여전히 Fable이 낫다"는 반응이 꽤 나옵니다. 순위표와 체감이 항상 같이 가지는 않습니다.
- 거절과 폴백(Fable 5): 안전 분류기가 요청을 거절하면 HTTP 200에
stop_reason: "refusal"을 담아 돌려줍니다. 이 경우 다른 Claude 모델로 폴백하는 로직을 따로 짜야 해서, 통합 코드가 한 단계 더 복잡해집니다. - 데이터 보존(Fable 5): 30일 보존이 의무이고 완전한 제로 데이터 보존(ZDR)은 지원하지 않습니다. HIPAA BAA는 API·엔터프라이즈 플랜에서 제공하지만, 컴플라이언스 요건이 빡빡한 조직이라면 이 지점에서 미리 걸러야 합니다.
- 가용성 리스크는 양쪽 다 있습니다: Fable 5는 지난 6월 수출통제로 19일간 접근이 막혔던 전례가 있고, GPT-5.6도 처음엔 제한된 프리뷰로 시작했습니다. 어느 쪽을 메인으로 쓰든 단일 모델에 올인하지 않는 게 상책입니다.
진짜 재밌는 실험 하나
한 개발자가 두 모델을 서로 붙여놓고 "인간은 각각의 우리를 언제 써야 하냐"는 주제로 5라운드 토론을 시킨 실험이 있습니다. 사람은 출력물을 서로 복사해서 붙여넣기만 했다고 합니다. 결과로 32개 항목짜리 사용 가이드가 나왔는데, 대략적인 결론은 이렇습니다. 고수준 설계·판단은 Fable에, 빠른 실행·검증은 Sol에 맡기라는 것. 심지어 토론 도중 서로 상대방이 인용한 가격 정보의 오류를 웹 검색으로 잡아주는 장면도 있었다고 하니, 모델 두 개를 교차 검증용으로 같이 굴리는 것도 나쁘지 않은 전략입니다.
작업 유형별 선택 기준
- 레거시 저장소 마이그레이션, 복잡한 버그 수정: Fable 5. SWE-Bench Pro 격차가 가장 크고, 실사용 후기도 이 영역에서는 일관되게 Fable 편입니다.
- 도구 호출 많은 장시간 에이전트 파이프라인: Sol. Agents' Last Exam 우위, 자율 실행형 성격이 이 유형에 맞습니다.
- 분류·요약 같은 대량 저난도 처리: Terra나 Luna. 토큰 단가가 Fable 5의 10분의 1 수준까지 내려갑니다.
- 규제·컴플라이언스 민감 서비스: 벤치마크보다 데이터 보존 요건부터 먼저 확인하세요. 경우에 따라 둘 다 탈락할 수 있습니다.
마무리
2026년 중반 프런티어 모델 경쟁은 단일 승자가 아니라 영역별 분업 구도로 굳어지는 중입니다. 하나만 고르기보다, 작업 유형별로 모델을 배치하고 한쪽이 막히면 바로 전환할 수 있는 추상화 계층을 갖추는 게 현실적인 전략입니다. 모델 장애·거절 상황을 코드로 어떻게 방어하는지는 Claude API 폴백·재시도 전략에서 이어집니다.
'AI > AI' 카테고리의 다른 글
| DeepSeek V4 정식 출시, 개발자가 알아야 할 가격 전략 (0) | 2026.07.20 |
|---|---|
| Gemini Code Assist 종료, Antigravity로 옮겨야 하는 이유 (0) | 2026.07.20 |
| 2026 상반기 AI 3사 격전: OpenAI·Anthropic·구글 총정리 (0) | 2026.07.09 |
| Spring AI로 Spring Boot에서 LLM 연동하는 방법 (0) | 2026.07.09 |
| LLM 환각(Hallucination) 완벽 정리 — 원인부터 RAG·프롬프팅 대응까지 (1) | 2026.04.29 |