# Anthropic의 신규 플래그십 모델은 작업당 20%...

> https://bookfactory.kr/board/ai-tech/17533
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-18T03:19:40.609Z

---

심층 리포트 제34회. 이번에 집중 조명할 내용은 본지가 최근 기록한 내용이다.

## 본 논문의 핵심은 다음과 같습니다.

9월 17일 새벽, 본지는 아직 검증 중인 텍스트를 하나 기록했다. 핵심 내용은 다음과 같다. 프론티어 모델의 비용 경쟁에서 비용의 고저를 결정하는 변수가 ‘단어당 토큰 출력 개수’로 이동했으며, 두 회사는 9월 첫째 주에 정반대 방향을 선택했다. Anthropic의 Fable 5.1은 출력 토큰을 약 1.7배 증가시켜 평가 기관 Artificial Analysis의 종합 지수에서 4점을 상향 조정했다. 가격 인하는 캐시 읽기 항목에만 국한되어 가격은 유지되었기에, 단어당 비용은 오히려 20% 상승했다. OpenAI의 경우에는 GPT-6 Astra를, 토큰 수가 적고 재시도가 적은 모델로 어필했다.

그 읽기는 구매자에게 제시한 조언이 두 가지 있었다. 비교 단위를 작업당 비용으로 전환하는 것과 동일 회사의 가격 인하가 에이전트형 방식과 일반적인 콜 방식 모두에서 효과가 반대될 수 있다는 점이다. 여기서 말하는 에이전트형 방식은 모델이 스스로 여러 번의 왕복을 처리하며 파일 읽기나 프로그램 실행과 같은 도구를 호출하면서 완료하는 작업을 의미한다. 참고로, 그 읽기는 판단을 보류한 이유를 자필로 덧붙였다. OpenAI 측의 숫자가 벤더의 자가 보고에 불과하다는 점 때문이다.

본 글은 이 읽기를 분석하여 검토하고 재구성했다. 결론은 세 가지 분기로 나뉜다.

1층. “작업당 20% 높은” 가격은 실제 측정값이지만, 주에 세 번 개정된 평가와 연결되어 있다. 9월 1일 평가 기사는 3.76 달러로, 전작 Fable 5보다 20% 높은 가격으로 기록되었다. 9월 7일, 같은 기관이 지수를 신작에 전환하면서 동일 모델은 작업당 7.63 달러, 전작은 8.75 달러로 낮아져 약 13% 저렴해졌다. 이 한 주 동안 두 회사의 정가는 한 푼도 움직이지 않았다. 더욱 직접적인 것은 다음 지점이다. 신작의 동일 측정으로 공개된 두 숫자 중, 평가 일정을 돌린 총 비용으로는 Fable 5.1이 전작보다 18% 많았다. 그러나 동일 기관의 독자적인 가중 방식으로 작업당에 맞추면 13% 적었다. 분모를 바꾸는 것만으로도 부호가 반전된다.

두 번째 단계. 두 회사의 분기는 실체였으며, OpenAI 측에도 현재 독립적인 측정값이 존재한다. 9월 9일, 인공 분석은 다음과 같은 결과를 발표했다. 종합 지수에서 동점이 발생했을 때, Astra의 출력은 작업당 약 27만 토큰, Fable 5.1은 약 78만 토큰이었으며, Astra의 작업당 비용은 Fable 5.1의 약 4배에 불과했다. 이전 판단이 결정을 보류한 이유는, 읽기가 기록된 8일 전에 이미 해결되었고, 게다가 결과는 읽기와 동일한 방향이었다. 다만, 그 읽기는 분기의 나머지 절반을 놓쳤다. OpenAI는 Astra의 정격을 전세대 GPT-5.6 Sol의 2.5배로 설정한 것이다. 같은 기관에 따르면, Astra의 작업당 비용은 자체 전세대와 비교했을 때, 종합 지수 기준으로 약 6배, 코딩 에이전트 지수 기준으로 약 15% 높았다. 토큰 효율은 구매자에게 저렴한 작업 단가에는 미치지 못하고, 정격에 흡수되었다. Anthropic은 그 거울의 길을 택했다. 정격은 움직이지 않고 토큰이 증가했으며, 그 일부를 캐시 읽기 하락으로 보상했다. 특히 이 하락은 Fable 5.1에만 적용되었고, 그 캐시 읽기 가격은 Opus 5의 절반으로 줄어들었다. Opus 5는 동일 회사 내에서 한 단계 낮은 모델이며, 정격은 Fable 5.1의 절반에 불과하다. 그리고 공적으로 전환한 첫 번째 고객은 바로 그 Opus에서 이주해 온 것이다.

3단계입니다. 따라서 구매자는 “작업당 비용”이라는 수치를 비교하는 것이 아니라, 자체 청구서에 나타난 두 가지 항목을 비교해야 합니다. 작업당 비용은 모델의 속성을 결정하는 것이 아닙니다. 모델, 문제 구성, 노력 설정, 툴 환경, 과금 방식의 다섯 가지 요소가 함께 결정합니다. 노력(Effort)은 모델을 호출할 때 지정할 수 있는 단계 설정을 의미하며, 단계가 높을수록 모델은 답변하기 전에 더 오래 생각하고 출력 토큰도 증가합니다. Fable 5에서 5.1로 전환될 때 비용이 증가할지 감소할지는 현재 청구서에 있는 “캐시 읽기” 항목과 “출력” 항목의 비율에 따라 결정됩니다. 대략 20% 미만이면 거의 확실히 비용이 증가하고, 1.2배를 넘으면 거의 확실히 비용이 감소합니다. 그 중간은 노력 설정으로 인해 출력이 얼마나 증가하는지에 따라 달라집니다. “같은 할인으로 효과의 방향이 반전된다”는 문장은 수정이 필요합니다. 할인 자체가 누군가의 비용을 증가시키는 것은 아니며, 세대 교체로 인해 방향이 반전되는 경향이 있는데, 가장 흔하게 발생하는 경계는 토큰 과금 API와 구독 플랜 이용량 간의 관계에 있습니다.

본 글은 여섯 단락으로 구성된다.

① 먼저 숫자를 비교합니다. “20% 높다”는 어떤 버전의 평가로 측정했는지 확인해야 합니다. 동일한 측정 기준으로 분모를 바꾸면 결과가 어떻게 달라지는지 살펴봐야 합니다.

② 분기는 이미 성립하고 있습니다. OpenAI 측의 독립적인 측정값과 Anthropic 측이 실제로 얼마나 더 많은 출력을 하고 있는지 확인해야 합니다.

③ 분기의 나머지 반을 살펴보겠습니다. 남은 토큰의 양을 두 회사가 각각 누구에게 전달했는지 확인해야 합니다.

④ 캐시 하락의 칼날은 처음에는 누구에게 향했는지 확인해야 합니다.

⑤ 구매자는 어떻게 비교하는지 살펴봐야 합니다. 청구서의 두 줄과 다른 회사와 비교할 때 캐시의 가격 차이가 얼마나 영향을 미치는지 확인해야 합니다.

⑥ 본보가 앞으로 이와 유사한 뉴스를 어떻게 읽어낼지, 그리고 무엇이 이 기사를 뒤집을 수 있는지 살펴봐야 합니다.

이 텍스트는 아직 저널에 실리지 않았다. 새벽에 작성한 보도 자료로, 독자들에게 공개되는 것은 이번이 처음이다. 본 텍스트는 “업무당 20% 높은” 분모를 분석하고, “OpenAI가 토큰을 줄여 구매자의 비용을 낮춘다”는 주장을 확인했다. 언론사가 스스로 설정한 관찰 기간 동안, OpenAI가 동일한 기준으로 Astra의 업무당 비용을 자사 이전 세대보다 낮추면, “토큰 효율은 정격 가격에 흡수되었다”는 내용은 틀린 것이다.

![画像](https://assets.st-note.com/img/1789636732-zUEGSfqKQ5hACOVLNj1D7npR.png?width=1200)

위 그림은 “프론티어 모델의 가격 결정력은 유지될 수 있는가”라는 논점에 대해 본지가 추적하고 있는 지도이다. 본고가 다루는 것은 그 꼬리 끝의 계층이다. 7월의 상황에서, 세 회사가 “동등한 능력을 일분의 가격으로”라고 주장하며 Anthropic의 프리미엄 가격을 둘러쌌다. 그러나 9월이 되자 OpenAI의 플래그십 모델의 정가는 오히려 계속 상승하여 Anthropic와 완전히 같은 숫자에 도달했다. 입력 1백만 토큰당 10달러, 출력 50달러이다. 플래그십 클래스에서는 정가를 둘러싼 전선이 멈추고, 싸움은 “작업당 몇 토큰을 출력하는가”와 “캐시를 어떻게 청구하는가”로 옮아갔다.

여기서 읽기를 중단한다면: 지난달 자사의 청구서를 열어 캐시 덤핑 행이 출력 행의 몇 배나 되는지 확인해 주시기 바랍니다. 이 비율이 어떤 평가에 언급된 작업당 비용보다 세대 교체로 인해 비용이 증가하는지 감소하는지를 더 잘 알려줍니다.

## 먼저 숫자를 비교합니다: “20% 높다”는 어떤 버전의 평가로 측정한 것인지

사전 분석이 제공하는 가장 중요한 측정치는 인공 분석이 9월 1일에 발표한 Fable 5.1의 평가 기사에서 비롯된다. 기사에 따르면 Fable 5.1은 최고 효율에서 지수형 작업 1건당 3.76달러를 투입하여, Fable 5보다 20% 높다. 이는 출력 토큰이 약 1.7배 증가했기 때문이다. 캐시 읽기 가격 인하는 작업당 약 1.40달러를 절감시키며, 그 효과는 에이전트 기반 평가 항목에 집중되어 있다. 가격 인하가 없었다면 작업당 약 5.16달러가 되었을 것이다. 본지는 이러한 묘사를 원본 페이지를 그대로 비교하며 한 글자 한 글자 확인하여 차이가 없음을 확인했다. 인공 분석은 이 평가 기사에서 공개 전 앤트로픽의 평가를 돕는 것을 자필로 명시하고 있다. 이 기관에서 발표하는 Fable 5.1의 숫자를 읽을 때, 독자는 이 관계를 인지해야 한다.

이 측정값에는 오류가 없습니다. 문제는 그를 측정한 줄자가 일주일 동안 세 번이나 바뀌었다는 점입니다.

- 9월 1일 종합 지수 버전: 공개 당일판 Fable 5.1의 작업당 비용은 3.76 달러이며, Fable 5보다 20% 높습니다. 무슨 일이 있었는지: 평가 기사 공개
- 9월 3일 종합 지수 버전: v4.1.1
Fable 5.1의 작업당 비용: 3.69 달러
Astra 공개 당일 버전. Fable 5.1이 Astra에 5점 차이로 앞서나갔다.
- 9월 4일 종합 지수 버전: v4.2

Fable 5.1의 작업당 비용: 6.12 달러

문제 출제 교체가 발생했습니다.
- 9월 7일 종합 지수 버전: v4.3, Fable 5.1의 작업당 비용은 7.63 달러, Fable 5는 8.75 달러입니다. 변경 사항은 다음과 같습니다. 터미널 운영 관련 코딩 평가가 4.0 버전으로, 은행 고객 지원 평가가 워크플로우 자동화 평가로 대체되었습니다.

처음과 마지막 행의 숫자는 Fable 5를 포함하여 Artificial Analysis 자체 페이지에서 가져온 것이다. 중간 두 행은 요약 사이트 TokenCost의 버전별 표와 테크미디어 TechTimes가 세 번의 개정일을 보도한 기사에서 가져온 것이다. 9월 1일의 행을 어떤 버전으로 계산해야 하는지에 대해 두 요약 사이트가 일치하지 않고 있으며, 본 논문에서는 “공개 당일판”이라고만 표기한다.

이 표에서 확인할 수 있는 사항은 세 가지입니다.

첫째, 작업당 비용은 5일 만에 두 배로 늘었지만, 정가는 변동이 없었습니다. TokenCost에 따르면, Fable 5.1의 비용은 5일 만에 두 배로 늘어 9월 3일의 작업당 3.69달러에서 9월 8일의 7.63달러로 상승했습니다. 그 동안 정가는 계속 10달러와 50달러로 유지되었습니다. 이는 새로운 버전의 문제들이 길고, 더 에이전트적이며, 한 문제마다 출력하는 토큰이 늘어났기 때문입니다. 특정 모델의 “작업당 비용”은 해당 문제 세트의 특성을 반영하며, 모델의 특성은 그 다음 문제에 나타납니다.

둘째로, 세대 교체로 인해 가격이 상승할지 하락할지는 버전마다 달라진다. 2023년 10월 26일 정식 발매판에서는 Fable 5.1이 Fable 5보다 20% 더 높다. v4.3에서는 Fable 5.1이 작업당 7.63달러, Fable 5가 8.75달러로 약 13% 저렴했다. 같은 시기에 종합 점수 차이도 4점부터 3점으로 줄어들면서, Astra는 5점 차이의 열세에서 동점으로 랭크되었다.

세 번째로, 가장 직관에 반하는 것은 이것이다. v4.3에서 같은 측정 기준으로 공개된 두 숫자는 분모만 바꾸어도 부호가 반전된다. ‘인공 분석’ 모델 페이지에는 두 숫자를 나란히 공개하고 있다. 하나는 모든 지수를 실행한 총 비용으로, ‘페이블 5.1’이 13,128.86 달러, ‘페이블 5’가 11,160.86 달러이다. 18% 높다. 다른 하나는 작업당 비용으로, 페이지 설명에 따르면 작업 수를 나눈 후 각 평가 지수의 내부에 있는 가중치에 따라 가중된 값이다. 7.63 대 8.75로, 13% 낮다.

왜 두 숫자는 반대 방향을 향하는가? 총 비용을 분해하면 그 이유가 드러난다. Fable 5의 청구에서는 캐시 읽기가 28%를 차지했다. Fable 5.1은 캐시 읽기 가격이 사분의 일이 줄어들어 이 항목은 11%까지 축소되었고, 출력의 행은 54%에서 70%로 팽창했다. 문제 수가 많고 한 문제가 짧은 평가에서는 캐시 읽기가 적어 출력 증가가 그대로 지출 증가로 이어지는 반면, 문제 수가 적고 한 문제가 길며, 지수 내의 가중치가 큰 에이전트 유형의 평가에서는 캐시 읽기가 많아 가격 인하로 인해 발생하는 금액이 출력 증가를 상회한다. 총 비용은 “1 달러는 모두 같은 무게”로 합산되므로, 전자에 의해 끌려 높아지고, 가중치된 작업당 비용은 “평가 유형별로 같은 무게”로 취급되어 후자에 의해 끌려 낮아진다. 이 단락의 작동 방식은 본지가 공개한 비용 내역에서 추론한 것이다. Artificial Analysis는 평가별 작업당 비용을 공개하지 않기 때문에 항목별 검증은 불가능하며, 두 모델에서 각 평가를 몇 번 반복했는지 페이지에 기록되어 있지 않아 횟수가 다르면 총 비용은 단순하게 비교할 수 없다. 그럼에도 불구하고, 괄호가 반대라는 사실 자체는 페이지 위의 두 숫자에 기록되어 있다.

독립적인 제3자가 이 문제에 대해 명확하게 정리하고 있습니다. 개발 툴 기업인 Firecrawl은 9월 7일 API 과금으로 자체 테스트를 57회 실행한 결과, Anthropic이 제시하는 비용 절감 폭(일반적인 업무에서는 25%, 무거운 에이전트 기반 업무에서는 최대 45%)과 Artificial Analysis가 제시한 작업당 과가는 모두 정확하게 측정하고 있다고 결론 내렸습니다. 앞선 경우는 캐시를 대량으로 사용하는 업무에, 뒤서는 경우는 캐시에 거의 접근하지 않는 업무에 해당하며, 양측이 사용하고 있는 가격표는 동일합니다.

그러므로 앞의 시나리오 중 첫 번째 핵심 숫자는 다음과 같이 해석해야 합니다. 그것은 실제 측정 결과입니다. 다만, 9월 1일 시점의 문제 세트를 최고 효율로 돌리면 얼마나 걸리는가에 대한 답일 뿐이며, 당신이 전환했을 때 얼마나 높아지는가에 대한 것은 아닙니다.

## 2. 분기는 현실이다: OpenAI 측에도 현재 독립적인 측정치가 있다

미래 예측은 판단을 보류한 이유를 명확하게 적어놓고 있었다. OpenAI 측의 “토큰 수가 부족하다”는 것은 자가 진술일 뿐이다. 만약 인공 분석이 Astra에 대해 측정한 작업의 경우 토큰 수가 반대 방향을 가리키는 경우라면, 두 회사가 분기하고 있다는 측면은 성립하지 않는다.

그 측정값은 9월 9일에 발표된 것으로, 8일 전에 기록된 내용이며 방향도 동일했다.

인공 분석의 아스트라 평가 기사에 따르면, 종합 지수 v4.3에서 아스트라는 최고 등급으로 53점을 획득하여 패블 5.1과 동점을 기록했다. 기사는 아스트라가 작업당 2만 7천 개의 출력 토큰을 사용했으며, 이는 패블 5.1의 7만 8천 원의 약 3분의 1 수준으로 점수가 동일하다고 설명했다. 작업당 비용은 3.26달러에서 7.63달러 사이로 약 40%에 해당한다. 또 다른 코딩 에이전트 지수에서도 두 모델은 동점을 기록했으며, 아스트라의 작업당 비용은 패블 5.1의 약 6%였다. 기사는 이러한 이유가 아스트라가 지수에 포함된 에이전트 중 토큰 사용량이 가장 적기 때문이라고 분석했다.

세 번째 독립적인 정보원은 터미널 운영 코딩 평가 지표인 터미널-벤치 4.0의 공개 랭킹으로, 평가 프레임워크 Harbor가 관리하고 있습니다. 요약 사이트 CodingFleet는 9월 11일에 보도한 바에 따르면, Astra는 OpenAI의 Codex 환경에서 58.2%를 해결했으며, Fable 5.1은 57.9%를 해결했습니다. 전자는 15억 토큰, 평가 비용은 약 3,300달러였고, 후자는 27억 토큰으로 약 6,200달러였습니다. 전자가 약 47% 저렴했습니다. 이 항목에 대해서는 본고는 Harbor의 원 페이지를 직접 읽은 것은 아니며, 번역본을 참고한 것입니다.

OpenAI 스스로 설명하고 비교해 본다. 9월 9일 엔터프라이즈 대상 발표문은 동일한 Terminal-Bench 4.0 기준으로 Astra의 한 문제당 예상 API 비용이 Fable 5.1보다 약 63% 낮다고 하지만, 계산 방법은 공개하지 않았다. Harbor의 순위는 이 평가로 인해 약 47% 저렴하다고 제시하며, 방향성은 OpenAI의 자가 주장과 일치하지만, 폭은 63%보다 한 바퀴 작다. Artificial Analysis가 측정한 약 57% 저렴한 수치는 종합 지수 기준의 숫자로서, 방향성의 일치를 뒷받침하는 데 그친다.

인스펙트(Anthropic) 측에서도 “출력 토큰 증가”에 대한 자체 측정치가 존재하며, 다만 그 범위는 좁혀나가야 한다.

- 파이어크롤의 57회 테스트 결과, 동일한 노력으로 비교했을 때, 페이블 5.1의 출력 토큰은 페이블 5의 1.37배(낮음), 1.12배(높음), 1.30배(최고)였다. 세부 사항까지 꼼꼼하게 측정했다. 최고 노력 시 늘어난 분량은 모두 추론 토큰이었으며, 눈에 띄는 텍스트는 오히려 6% 감소했다. 추론 토큰은 모델이 답변을 내기 전에 생각하는 부분으로, 사용자에게는 보이지 않지만 출력 토큰으로 과금된다.
- Anthropic 자체의 이관 문서에는 토큰 소비를 증가시키는 행동 변화가 두 가지로 확인된다. 첫째는 파일 편집에서, 부분적으로 수정하는 것보다 파일 전체를 재작성하려는 경향이 강해져 재작성에는 추가적인 출력 토큰과 시간이 소요된다는 점이다. 둘째는 에이전트 루프에서, Fable 5가 한 번에 여러 도구 호출을 묶어 보내던 것과 달리 왕복으로 한 번만 호출하는 경우가 많아진데, 증가한 왕복 횟수에 따라 토큰이 소모된다. 이 문서에는 각 항목에 해당하는 프롬프트 작성 방법도 함께 제시되어 있다.
- 역방향으로 측정된 값도 있었다. Cognition의 Devin 팀은 자체 코딩 평가에서 Fable 5.1이 동일한 작업을 Opus 5보다 33% 적은 토큰으로 완료했다고 밝혔다. Anthropic의 발표문에 인용된 고객 중 세 곳도 토큰 소비가 줄었다고 언급했다. 다만, Opus 5나 특정 작업과의 비교에서, 동일한 노력을 요하는 Fable 5와의 비교는 아니었다. 게다가, 모두 공개 당시 함께 등장한 파트너 기업의 목소리였다.

Anthropic는 토큰을 늘려 점수를 구매했다는 표현은 다음과 같이 정리할 수 있다. 자체 이전 세대와 동일한 노력으로 비교했을 때, 출력은 1~4% 증가한다. 1.7배는 공개 당일 버전의 평가에서 최고 노력을 사용했을 때의 숫자이다.

마지막으로, 역방향 측정값을 정리하기 위해 한 가지 사항을 언급한다. AI 툴 기업인 MindStudio는 9월 6일, 동일한 코딩 테스트 세트를 사용하여 Astra에 약 198달러, Fable 5.1에 약 113달러가 소요되었으며, Astra가 75% 더 비용 효율적이었다고 보도했다. 당시 Astra는 Codex의 최고위 思考モード(생각 모드)에서 작동하고 있었다. 본보도의 기록에 따르면, OpenAI는 7월에 이 세대용으로 추가한 최고위 모드는 공식 설명에 따라 기본적으로 네 개의 에이전트를 병렬로 협조시켜 토큰 사용량을 늘리는 대신 더 강력한 결과를 얻는 설계이다. 이는 반증이 아닌 경고이다. “토큰이 적다”는 동일한 노력의 기준에서 비교했을 때 의미가 있으며, 또한 각 회사의 표현도 일치하지 않는다. TokenCost 역시 같은 내용을 언급하고 있다. “최고” 또는 “높다”와 같은 표현의 정의는 각 회사마다 다르다고 한다.

## 3. 분기의 나머지 절반: 떠다니는 토큰의 이익은 누구의 주머니에 들어갔을까

앞으로의 構図는 다음과 같았다. Anthropic은 이용자에게 많은 토큰을 지불하게 하여 능력을 향상시키고, OpenAI는 토큰을 줄여 이용자의 비용을 증가시키는 것이다. 제2절은 토큰의 방향을 확인했다. 하지만 “이용자의 비용을 띄우는” 방식에 대해 설명하려면 세 번째 숫자인 정격이 필요하다.

OpenAI의 대표 제품인 GPT-4의 가격을 순서대로 나열한다.

- GPT-5.4: 입력 100만 토큰당 2.5달러, 출력 15달러.
- GPT-5.5(4월): 5달러와 30달러로 올랐다. 이 제품 라인에서 세대 교체에 따른 최초의 가격 인상이다. OpenAI는 당시 출력 토큰이 약 4% 감소하여 실질적인 가격 인상 폭은 약 2%라고 설명했다.
- GPT-5.6 솔(7월): 본 기사에 기록된 출시 당시 가격은 5달러 30센트, 인공 분석은 9월 9일 현재 가격을 4달러 20센트로 보고 있습니다. 그 사이의 가격 인상은 이 논문에서 충분히 다루어지지 않았습니다.
- GPT-6 Astra(9월): 10달러와 50달러입니다. 인공 분석은 이를 모든 항목에서 GPT-5.6 Sol의 현재 가격보다 2.5배로 표현하고 있습니다. 캐시 읽기는 여전히 9% 할인된 상태로, 백만 토큰당 1달러입니다.

지난 반 년 동안 OpenAI는 동일한 움직임을 두 번 반복했으며, 정가를 인상하면서 동시에 새로운 모델의 토큰 수를 줄인다고 주장했다.

결과는 어떠한가요? Artificial Analysis는 같은 평가 기사 중에서 답변을 제시하고 있습니다. 종합 지수에서는 최고 에포트의 Astra가 GPT-5.6 Sol보다 약 6% 더 높습니다. 기사에 따르면, 토큰 단가의 높이가 토큰 사용량의 적은 양으로 부분적으로만 상쇄되고 있다는 것입니다. 코딩 에이전트 지수에서는 작업당 7.09달러로 Sol보다 약 15% 높으며, 점수는 7점 더 높게 나타납니다.

두 회사를 나란히 비교해 본다.

- 가격: OpenAI: Astra 대비 Sol 2.5배 / Anthropic: Fable 5.1 대비 Fable 5 (실험실 환경 기준)
- 작업당 출력 토큰: OpenAI의 Astra는 Sol(총 지수) 기준으로 약 7% 감소했습니다. 코딩 에이전트 지수는 Anthropic의 Fable 5.1 대비 Fable 5에서 동일한 노력으로 1~4% 증가했습니다.
- 캐시 읽기 가격: OpenAI: Astra vs Sol=입력 가격의 10% 이내 / Anthropic: Fable 5.1 vs Fable 5=입력 가격의 2.5%로 하락
- 업무당 비용(자사 전세대 대비): OpenAI: Astra는 솔(Sol) 종합 지수 기준으로 약 6% 높고, 코딩 에이전트 지수는 약 15% 높음 / Anthropic: Fable 5.1은 Fable 5 공개 당일판 대비 20% 높고, v4.3은 13% 낮음. Anthropic의 8월 트래픽 기반 자체 주장으로는 25%~45% 낮음.

표의 “약 7% 감소”는 인공 분석 모델 페이지가 공개한 작업별 출력 토큰 수, 2만 7200에서 2만 9300으로 나타난 수치입니다. “약 삼분의 일”은 동일 기관의 평가 기사에서 코딩 에이전트 단락에서 Astra와 GPT-5.6 Sol을 비교한 문장상의 표현으로, 본고는 두 모델의 원래 토큰 수를 확보하지 않았습니다. 두 수치는 별개의 지수 숫자이며, 종합 지수 기준으로 보면 Astra는 자체 전세대보다 크게 줄지 않았습니다. 표의 “약 삼분의 일”은 제2절에서 Astra를 Fable 5.1과 비교한 “삼분의 일”과 또 다른 비교입니다.

이 표를 읽어보면 “자사 전세대 대비 작업당 비용” 항목에서 어느 회사가 구매자에게 더 저렴한 것을 제공하고 있는지 알 수 없다. 차이는 어떤 레버를 조작했느냐에 달려 있다. OpenAI는 토큰 효율성을 가격 인상에 투입했고, Anthropic은 토큰의 증가를 현금 가격으로 흡수했다. 구매자가 실제로 손에 넣는 가치는 회사가 전환된 곳에 있다. 같은 가격 기준으로 Astra의 작업당 비용은 Fable 5.1보다 4~6배이다. 이는 OpenAI와 Anthropic 간의 가격 차이이며, OpenAI와 자사의 과거 가격 차이와는 관련이 없다. 이 글에서 OpenAI 측에 대한 정보는 가격과 평가 숫자뿐이며, Astra가 더 비싼 이유를 구매자가 공개적으로 설명한 사례는 찾을 수 없다. 이 절반은 사용자 측의 증거가 부족하다.

이는 본지에서 7월에 제시했던 ‘독점적인 능력에 비해 극히 저렴한 가격’이라는 전략에도 대응하는 것이다. 당시, 세社는 “동일한 능력을 일분의 가격으로”라는 슬로건으로 Anthropic의 높은 가격을 포위하고 있었고, OpenAI의 무기는 더 저렴한 제품 라인이었다. 두 달 후, OpenAI의 플래그십 제품의 정가는 Anthropic의 플래그십 제품과 1원도 차이 없는 수준까지 올랐다. 플래그십 클래스에서는 정가를 무기로 물러나게 되었다. 공격은 멈추지 않았고, 작업당 토큰 수로 위치를 이동했다.

## 4. 캐시 하락 폭의 칼날은 처음 누구에게 향했는가?

Anthropic의 캐시 하락을 “다른 기업들의 공세에 대응한 정가 인하가 아닌, 에이전트 기반의 작업량 확보를 위한 정밀 타격 지원”으로 해석했다. 앞부분은 대체로 잘 맞지만, 목표에 대한 표현은 좀 더 정확하게 묘사해야 한다.

먼저 가격 인하가 적용된 위치를 확인합니다. Anthropic 공식 가격 페이지의 脚注에 따르면, Claude Fable 5.1과 Claude Mythos 5.1의 캐시 히트와 리프레시는 기본 입력 가격의 0.025 배로 청구되며, 나머지 모델은 모두 표준의 0.1 배로 유지됩니다. 캐시 쓰기 가격은 5분당 12.50달러, 1시간당 20달러로 변동 없이 적용됩니다.

가장 높은 단일 단계에만 적용했다는 것은 하나의 사실을 의미한다. Fable 5.1의 캐시 읽기 가격이 토큰당 0.25달러로, 자체의 단일 단계 아래인 Opus 5의 0.50달러보다 절반 가격으로 낮아졌다. 정가에서는 Opus 5가 Fable 5.1의 절반이지만, 캐시 읽기 가격에서는 역으로 입지가 된다.

그 결과에 대해 처음으로 공식적으로 언급한 것은 Cognition이었다. Anthropic의 발표문에서 인용된 해당 회사의 발언에 따르면, Cognition은 공개 당일에 Devin의 Opus 5 트래픽을 Claude Fable 5.1로 이관했다. 새로운 캐시 읽기 가격 덕분에 Fable 클래스 모델이 기존에 Opus에 있었던 업무에도 적합해졌고, 초기에는 코드 리뷰가 활용되었다. 해당 회사는 숫자도 발표하고 있다. 자체 코딩 평가에서 중간 수준의 노력을 할 때, Fable 5.1은 작업당 2.68달러, Opus 5는 3.51달러, Fable 5는 5.84달러였다. 해당 회사의 설명에 따르면, 기존 캐시 읽기 가격으로는 Fable 5.1이 작업에 지출하는 비용의 대부분은 이미 본 내용을 다시 읽는 데 소모되고 있었다. 가격 인하 후, 같은 작업은 약 5달러에서 2.68달러로 하락했다. 반면, Opus 5의 캐시 읽기 가격은 Fable의 신가격의 두 배이므로, 가격이 저렴한 데에도 불구하고 오히려 Fable보다 성능이 우수하다는 평가를 받게 되었다.

따라서 본고에서 확인되는 첫 번째 효과는 자사 제품 라인 내부의 재배치이다. 대량의 캐시를 읽는 작업이 Opus 단에서 Fable 단으로 이동했다. 이는 Anthropic이 동시에 OpenAI에 대한 견제 행위를 하고 있을 가능성을 배제하지 않는다. 본고는 동기를 판단하지 않고, 눈에 보이는 첫 번째 재배치 그룹이 누구이며, 어디에서 왔는지를 기록할 뿐이다. Cognition은 공개 당일의 파트너로, 그 숫자는 자가 보고된 것이다.

이 할인 외에도 살펴봐야 할 사항이 두 가지 더 있습니다.

첫째, 캐시 요청의 다음 행은 작동하지 않습니다. 가격 인하 후, Artificial Analysis가 제시한 Fable 5.1의 청구 내역에서 캐시 쓰기는 16%를 차지하고, 캐시 읽기는 이미 11%를 상회하고 있습니다.

두 번째로, 이번 가격 인하는 토큰 과금 위치에서만 적용된다. Anthropic의 발표문에는 적용 대상을 “wherever usage is billed by token”이라고 명시했으며, 이 회사의 API를 예시로 들었다. 구독 플랜 이용량으로 캐시를 어떻게 계산하는지는 발표문에는 명시되어 있지 않다. 개발 블로그 paddo.dev가 9월 3일에 게시한 기사 제목은 바로 이 점을 지적했다. API는 저렴해지지만, Max 플랜에서는 이용량을 더 많이 소모한다는 의미다. 저자가 자신의 Claude Code로 기록한 숫자에서는 출력은 왕복 1,207 토큰으로, Fable 5의 990 토큰보다 22% 더 많았으며, 캐시 읽기량은 거의 같았다. API의 경우 출력 증가분은 가격 인상으로 흡수되지만, 구독 플랜의 이용량에는 흡수되는 것이 전혀 없다. 이 단락의 증거는 현재까지 이용자의 자발적인 보고와 한 명의 저자의 개인 기록뿐이다. 이용량 계산이 가격 인상에 맞춰 조정되었는지에 대한 답은 저자 자신도 아직 밝혀지지 않았다고 쓰고 있다. 그래도 만약 이것이 맞다면, ‘같은 회사에서 가격 인하를 하면 효과가 역전될 수 있다’는 앞의 내용에 대해, 실제로 부호가 반전하는 가장 높은 가능성이 있는 경계는 에이전트형 업무와 일반적인 호출 사이가 아닌, API와 구독 플랜 사이에 있다.

## 5. 구매자는 청구서의 두 줄을 어떻게 비교해야 할까요

제1절에서는 각 작업별 비용이 문제 세트의 속성이라고 언급했습니다. 제4절에서는 그것이 청구 방식의 속성でもあると述べ었습니다. 따라서 구매자는 결국 무엇을 비교해야 하는지 명확히 해야 합니다.

### Fable 5에서 Fable 5.1로: 캐시 읽기/쓰기 비율 확인

현재 Fable 5의 청구서에서 출력 행을 O, 캐시 읽기 행을 C로 한다. 5.1로 이동하면 출력은 O에 증가율 r을 곱한 값, 캐시 읽기 단가는 일 분의 네 분기에 줄어들지만 왕복이 늘어나는 만큼 읽기 횟수도 c배가 될 수 있다. 따라서 이 행은 C에 c를 곱하고, 더하여 일 분의 네 분기를 곱한 값으로 계산된다. 새로운 청구가 기존 청구보다 저렴해지는 조건은 C가 O×(r − 1)를 (1 − c/4)로 나눈 값보다 큰 경우이다.

숫자를 넣어보자.

- 출력이 12% 증가하고 읽기 회수도 12% 증가하는 경우, 캐시 읽기 행이 출력이 행의 17%를 초과하면 세대 교체로 인해 가격이 저렴해진다.
- 출력이 30% 증가하고 읽기 회수도 30% 증가하는 경우: 임계값은 44%입니다.
- 출력이 70% 증가하고 읽기 회수도 70% 증가하는 경우(공개 당일판 평가에서 최고 에포트(effort)를 사용했을 때의 상황): 임계값은 1.22배이다.

그러므로 대략적인 판단 기준은 다음과 같습니다. 출력물의 2할 미만에 해당하는 캐시 읽기 행이 있다면 거의 확실히 가격이 오르고, 출력물의 1.2배를 초과하면 거의 확실히 가격이 내려갑니다. 그 중간 값은 에포트 설정에 따라 출력물이 얼마나 증가하는지에 따라 달라집니다. 이 식은 캐시 쓰기 및 캐시되지 않는 입력을 무시합니다. 전자는 왕복이 늘어날수록 늘어날 것이므로 실제 기준치는 조금 더 높아집니다. Artificial Analysis v4.3의 Fable 5의 청구액을 검산해 보겠습니다. 캐시 읽기는 출력물의 52%에 해당하며, 가중 작업당 토큰 배율이 약 1.17배이므로 기준치를 넘어서 가격이 내려갑니다. 총 비용 기반 출력 배율이 약 1.5배이므로 기준치를 밑돌아 가격이 오릅니다. 제1장에서 본 페이지 상의 반대되는 두 숫자 모두 일치합니다.

이 식은 본지 스스로 계산한 것으로, 어떠한 당사자의 주장도 아니다. 사용처는 다음과 같다. 어떤 평가를 기다릴 필요 없이, 지난달 청구서에 필요한 두 숫자가 이미 기재되어 있다.

### Fable 5.1 대 아스트라: 캐시의 네 배 가격 차이는 어디까지 줄어들었나

같은 정격 가격으로 Anthropic의 캐시 읽기 가격은 OpenAI의 사분의 일이다. 이 가격 차이로 Astra의 출력 토큰 부족을 상쇄할 수 있을까.

인공 분석(Artificial Analysis)의 v4.3 버전은 두 회사가 종합 지수 일식을 실행했을 때 발생하는 캐시 읽기 비용을 공개하고 있습니다. 본 기사는 이를 두 회사 공식 캐시 읽기 단가, 즉 백만 토큰당 0.25달러와 1달러로 나누어 읽기량을 역산했습니다. Fable 5.1은 약 55억, Astra는 약 11억의 캐시 토큰을 읽으며, 이는 5.2배인데, 지불액은 1.3배에 그칩니다. 즉, 네 배의 캐시 가격 차이는 Fable 5.1의 읽기 횟수 다수에 거의 대부분 소모된다는 의미입니다. 모델이 왕복을 하나 추가할 때마다 전체 컨텍스트를 다시 읽기 때문에, 총 청구액으로는 Fable 5.1이 Astra의 2.47배입니다. 만약 Astra와 동일한 캐시 가격을 지불했다면 3.25배가 됩니다. 캐시 가격 인하로 인해 차이는 한 단계 줄었지만, 차이의 본질은 출력에 있습니다. 이 읽기량은 본 기사의 추산이며, 인공 분석이 공개한 숫자와는 다릅니다. 추산에는 긴 컨텍스트에 대한 추가 요금이 포함되지 않았으며, 평가 과정에서 그것이 발동했다면 Astra의 읽기량을 과대 추정하게 됩니다.

다른 회사와의 비교를 통해 얻어지는 세 가지 숫자를 나열하면, 문제가 에이전트형에 가까워질수록 차이는 줄어든다. 종합 지수 기준으로 약 2.3배, Terminal-Bench 4.0의 평가 비용 기준으로 약 1.9배, 코딩 에이전트 지수 기준으로 약 1.7배이다. 다만 이 세 가지는 툴 환경이 다르며, 뒤에 두 가지는 각 사 자만의 에이전트 환경에서 측정하고 있기 때문이다. 따라서 본 논문은 차의 축소를 단순하게 현금 가격 차이의 탓으로 돌리지 않고, 척도일 뿐이며 법칙을 설명하지 않는다.

### 판매자에게 요구해야 할 세 가지 요소

- 제시된 작업당 토큰 수는 어떤 노력으로, 어떤 툴 환경에서 측정했는지 나타내는 것입니까?
- 회사의 업무량 기준으로 현금 인출(캐시 읽기)과 현금 입금(캐시 쓰기)이 각각 청구 금액의 몇 퍼센트를 차지하는지.
- 구독 플랜을 이용할 경우, 캐시는 이용량 내에서 어떻게 계산되는가.

세 번째 질문에는 현재까지 어느 회사도 공개적으로 답변하고 있지 않습니다.

### 측정자를 한 명만 지정한다는 주장이 철회되었습니다.

이전 글에서는 “특정 작업당 토큰 수를 공개적으로 측정하는 제3자는 현재 시점에서 인공 분석사의 하나뿐”이라고 언급했다. 이 문장은 성립되지 않는다. 본고는 적어도 다섯 개의 작업당 비용 및 토큰 사용량 공개 제3자 또는 이용자를 찾았다. 평가 플랫폼 Vals AI의 모델 페이지는 Fable 5.1을 한 문제당 28.92달러로 표기하고 있다. Harbor가 관리하는 Terminal-Bench 4.0의 순위에는 비용과 토큰 열이 있다. Cognition은 자체 코딩 평가 작업당 비용을 공개하고 있다. Firecrawl은 57회의 테스트를 공개했다. Databricks는 7월, 자체 코드베이스에서 측정한 완료된 작업 1건당 비용이라는 기준으로 이를 공개했다. 오히려 이전 글에서 스스로 제시한 Vals AI의 숫자(Anthropic이 제공한 문제 세트 포함) 자체가 작업당 비용 중 하나인 것이다.

가장 많이 인용되는 도구는 인공 분석(Artificial Analysis)인데, 이 도구는 일주일 동안 세 번이나 개정되었고, 매번 작업당 비용 숫자가 바뀌었고, 그 중 한 번은 부호까지 반전되었습니다.

## 업무당 비용으로 읽어야 할까요?

### 본 저널의 번역본입니다.

> 
> 
> 프론티어 플래그십 모델의 정가는 9월 현재 입력 1백만 토큰당 10달러, 출력 50달러라는 동일한 가격대로 수렴했다. 플래그십 클래스에서 정가 경쟁의 중심이 굳어지고, 비용 경쟁은 “작업당 토큰 출력 개수”와 “캐시 요금 부과 방식”으로 전환되었다. 두 회사가 토큰 단위로 정반대의 전략을 선택한 것은 분명하며, 독립적인 정보원도 두 가지로 존재한다. 그러나 어느 쪽도 그 변화를 자사 전세대보다 저렴한 작업당 단가로 조정하지 않았다. OpenAI는 토큰 효율을 활용하여 정가 인상을 추진하고, Astra는 자사 전세대 대비 작업당 15%에서 60% 높은 단가를 제시했다. Anthropic은 캐시 읽기 요금 인하를 통해 토큰 팽창을 흡수했지만, 해당 인하는 최고 등급에만 적용되었고, 가장 눈에 띄는 첫 번째 효과는 자사 Opus의 트래픽이 상위 등급으로 이동한 것이었다. “작업당 비용”은 모델의 속성이 아니라, 문제의 구성, 노력, 툴 환경, 청구 방식 등의 속성이다. 가장 많이 인용되는 지표는 일주일에 세 번 개정되었고, 한 번은 부호가 반전되었다. 앞으로 “특정 모델의 작업당 비용이 몇 퍼센트 더 높거나 낮은” 소식이 보도될 때마다 본지는 먼저 다음 네 가지 사항을 묻는다. 어떤 평가 버전인지, 어떤 노력을 기준으로 하는지, 캐시 읽기가 청구 금액에서 차지하는 비율은 얼마인지, API 방식인지 구독 방식인지 확인한다.
> 

### 이 판단을 뒤집는 조건

- OpenAI는 Astra의 작업당 비용을 자사 이전 세대보다 낮추고 있습니다. 구체적으로, Artificial Analysis 또는 Harbor의 어느 버전으로 평가하든 동일한 노력에 대해 Astra의 작업당 비용이 GPT-5.6 Sol을 밑돈다는 것입니다. 정가 인하, 현금 가격 인하, 토큰 감소 등 어떤 방식이든 관계없이 “토큰 효율이 정가에 흡수되었다”는 해석은 더 이상 유효하지 않습니다. 관찰 기간은 본지에서 자체적으로 설정한 2026년 12월 31일까지입니다.
- 앤트로픽(Anthropic)이 0.025배의 캐시 읽기 가격을 Opus 5에도 확대한다. “이 인하가 처음에는 자사의 Opus 트래픽에 향했다”라는 해석은 약화된다. Opus에 남아있는 작업이 더 이상 이전해야 할 필요를 없애기 때문이다.
- 동일한 툴 환경, 동일한 노력, 동일한 문제 세트에서 캐시 읽기 비율도 공개한 제3자의 비교가 나타났으며, 캐시 읽기가 적은 업무에서도 Fable 5.1이 Fable 5보다 저렴하다고 나타났다. 제5장의 “청구서 두 줄”이라는 판단 기준은 틀리게 된다.
- Anthropic은 구독 이용량 계산에 새로운 캐시 비율을 적용했다고 발표했다. 또는 Max 플랜의 이용량 한도가 5.1일 때 5보다 감소 속도가 더 느린 현상이 재현 가능하다는 측정 결과가 나타났다. 제4절의 “API와 구독 플랜 사이의 부호 반전 경계는 존재한다”는 문구를 철회한다.
- 인공 분석은 평가 항목별 비용을 공개하지만, v4.3에서 에이전트 기반 평가가 다른 평가 방식보다 저렴해지지 않았습니다. 제1장에서 설명한 “같은 청구라도 분모를 바꾸면 부호가 반전되는” 메커니즘 설명은 틀이 되어, 남는 것은 두 숫자가 반대 방향을 가리키는 사실만 남게 됩니다.

본 기사는 일본어판, 영어판, 중국어판과 동일한 조사와 판단에 근거하여 작성되었으며, 모든 주장은 원본 자료 링크를 포함하고 있습니다.

지난달 청구서에서 현금 인식 행은 출력 행의 몇 배에 가까웠나요? 비율이라도 알려주시면 다음부터 검토하는 데 활용하겠습니다.

SecondSource는 산업 분석을 전달하는 출판물이며, 투자 자문에는 해당되지 않는다. 개별 종목의 가치 평가나 매매 추천은 하지 않으며, 판단과 검증의 최종 책임은 독자 본인에게 있다.

**출처:** [note 원문](https://note.com/secondsource_jp/n/n07b370674901)

*번역: Gemma 3(.44) 초벌 + 교정 76청크*

[원문 보기](https://note.com/secondsource_jp/n/n07b370674901) | 출처: note.com