비교 방식을 3번 바꿔보세요.
AI 이용료는 표만으로는 알 수 없습니다. Claude Opus 5.5와 GPT-6 Astra로, 비교 방법을 3번이나 바꿔보려고 합니다.
첫 번째는 요금표의 토큰 단가입니다. 100만 토큰에 대해 Opus 5.5는 입력 4달러/출력 20달러, Astra는 10달러/50달러입니다. Opus 5.5의 단가는 Astra의 40% 수준으로, Opus가 유리합니다.
두 번째는 제3자 기관인 인공 분석(AA)의 평가 과제를 양쪽 모두 최대 설정으로 완료했을 때의 비용입니다. 평가 작업 1건당 Opus 5.5는 5.98달러, Astra는 3.26달러였습니다. 이 경우 Astra가 유리합니다.
세 번째 비교에서는 품질을 맞춘 비교입니다. Max와 Astra를 비교했을 때, Max는 Opus 5.5의 58점 대비 Astra는 53점으로 약 5점의 차이가 있었습니다. 따라서 Opus 5.5의 설정을 낮춰 비슷한 점수대로 비교하면, Opus 5.5는 고 설정에서 54점이었고 비용은 1.82달러(약 280엔)였습니다. Astra의 Max(53점, 3.26달러)보다 높은 점수를 약 44% 저렴한 비용으로 냈습니다. 결과적으로 Opus 5.5가 승리했습니다.
비교 방식을 3번 변경한 결과, 우승자가 2번 바뀌었습니다. 하나의 숫자만으로 결정하면 선택을 잘못하게 됩니다. 이 글에서는 최신 5개 모델을 비교하면서 다음 신모델 출시 시 스스로 선택할 수 있는 기준을 정리합니다.
먼저, 숫자의 의미를 명확히 밝힙니다. “평가 작업 1건당 비용”은 AA의 종합 평가 작업을 수행하는 1건의 과제를 완료하는 데 드는 평균 비용입니다. 입력, 캐시, 추론, 답변 토큰 비용을 모두 합산하고 평가에 따라 가중 평균을 낸 것입니다. 과제는 복잡하며, 설정에 따라 1건에 몇 분이 소요될 수 있습니다. 평소 채팅 1회 비용이거나 월정액 요금이 아닙니다. 월정액 요금의 경우 청구 금액은 변하지 않지만, 복잡한 설정의 경우 1건의 처리에 시간이 더 소요될 수 있습니다.
5개 모델의 위치
Anthropic의 최상위 모델은 Fable 5.1입니다. 내용은 Mythos 5.1과 동일한 모델로, Fable 5.1은 일반 사용자들을 위해 안전 장치가 적용된 버전입니다. 그 아래의 주력 모델은 Opus 5.5이며, Anthropic은 “대부분의 작업에서 Fable 5.1과 비슷한 성능”을 보인다고 설명하고 있습니다. 중간에는 Sonnet 5가 있으며, Sonnet 5.5와 Haiku 5.5도 수週間 이내에 출시될 예정입니다.
OpenAI는 최상위 모델인 Astra, 중위 모델인 Sol, 그리고 저가형 모델인 Luna의 세 단계 구성입니다. 이름에 주의해야 합니다. 이전 세대의 GPT-5.6 Sol은 시리즈의 최상위 모델이었지만, 새로운 GPT-6 Sol은 중위 모델입니다. 오래된 기사에서 “Sol = 최상위”라는 식으로 읽으면 비교가 엉뚱하게 될 수 있습니다.
비교 대상
이 기사에 나타난 숫자는 특히 언급이 없다면 AA의 독립 평가입니다. AA는 9월 19일에 종합 지수를 새로운 버전(v4.3.2)으로 개정하고, 모든 모델을 다시 평가했습니다. 예를 들어, Gemini 3.8 Flash는 이전 버전에서 59점이었지만, 새로운 버전에서는 41점(high 설정)입니다. 버전이 다른 점수를 나열하면 순위를 오독할 수 있습니다. 9월 19일 이전의 기사의 점수는 현재 점수와 섞이지 않도록 주의해 주세요.
비교 1: 종합 역량
신버전의 종합 지수(max 설정)에서는 Opus 5.5가 58점으로, AA가 지금까지 측정한 중 최고 점수입니다. Astra와 Fable 5.1이 53점, Sol이 48점, Luna가 37점입니다.
그러나 종합 점수는 10가지 종류의 평가 평균입니다. Opus 5.5는 실무 결과물 만들기 평가인 GDPval-AA 등 6가지 항목에서 1위를 차지했습니다. 반면에 물리학 난문제거나 긴 문장 읽기 등 3가지 항목에서는 1위를 놓치고 있습니다. Anthropic 스스로의 비교표에서도 과학 연구 분야 평가(Terminal-Bench-Science)와 업무 자동화 평가(AutomationBench)에서는 Astra가 더 높은 평가를 받았습니다. 종합 점수는 ‘평균적인 강함’으로, 특정 용도에 맞는 강함과는 별개입니다.
비교 2: 토큰 가격
100만 토큰당 요금(입력/출력)입니다. 원화는 1달러 155원으로 추정하고 있으며(9월 15일 기준 1달러 154원대).
파벨 5.1은 10달러/50달러, 아스트라는 10달러/50달러(약 1,550엔/7,750엔)입니다. 오퍼스 5.5는 4달러/20달러(약 620엔/3,100엔)입니다. 솔은 2달러/10달러, 루나는 0.10달러/0.50달러(약 310엔/1,550엔, 약 16엔/78엔)입니다. 출력 단가 비율은 루나, 솔, 오퍼스 5.5, 아스트라에서 1:20:40:100이 됩니다.
비교 3: 평가 작업 1건당 (최대 설정)
요청 금액은 ‘단가 × 사용 토큰 수’로 결정됩니다. 그리고 사용하는 토큰량은 모델에 따라 현저히 다릅니다.
최대 설정에서 평가 작업 1건을 처리할 때, Opus 5.5는 출력 토큰으로 약 11만 9천 건을 사용했으며, 이 중 약 8만 4천 건은 추론에 해당하고, Astra는 약 2만 7천 건(추론 약 1만 7천 건)을 사용했습니다. Opus 5.5는 정답에 도달하는 데 추론을 포함하여 Astra의 4배 이상 많은 출력 토큰을 사용했습니다.
비용은 Opus 5.5가 5.98달러(약 930원), Astra가 3.26달러(약 505원)입니다. Fable 5.1은 7.63달러(약 1,180원)로, Sol은 1.06달러(약 164원), Luna는 0.07달러(약 11원)입니다.
비교 4: 품질을 일치시키다
시작 부분의 세 번째 비교를 좀 더 자세히 살펴보겠습니다. AA는 동일한 모델을 추론 깊이(노력) 설정에 따라 측정하고 있습니다. 점수가 비슷한 경우들끼리 나열하면 다음과 같습니다.
53~54점에 해당하는 띠에서는 Opus 5.5의 하이 버전이 54점에서 1.82달러, Astra의 맥스 버전이 53점에서 3.26달러입니다. 같은 띠의 Fable 5.1(맥스) 버전은 53점에서 7.63달러입니다. Opus 5.5 하이 버전은 약 4배 정도 더 비쌉니다. 51점 띠에서는 Opus 5.5의 미디엄 버전이 1.34달러, Astra의 하이 버전이 1.73달러입니다. 어떤 띠에서도 Opus 5.5가 더 저렴하게 구매할 수 있습니다.
한편, 설정을 가장 가볍게 하면 이번에는 아스트라가 강해집니다. Opus 5.5의 low는 42점에서 0.55달러, 아스트라의 low는 46점에서 0.82달러입니다. 저렴하고 가벼운 롤링 밴드에서는 아스트라의 품질이 더 높다는 의미입니다.
즉, 두 번째 비교에서 일어난 역전은 품질이 다른 것들을 비교했기 때문이었습니다. 품질을 맞추면 토큰 단가가 저렴한 Opus 5.5는 평가 작업 1건이라도 저렴해집니다. 비용을 결정하는 것은 모델 선택과 마찬가지로 설정 선택입니다.
Anthropic에 따르면 Opus 5.5의 기본 설정은 medium이며, 아무런 변경 없이 사용할 경우 medium 열을 기준으로 하는 것이 좋습니다.
비교 5 : 코딩
터미널 운영을 포함한 코딩 평가(Terminal-Bench 4.0)에서는 AA 측정에서 Opus 5.5가 59.6%, Astra(xhigh) 역시 동등 수준을 나타냈습니다. Sol은 44%, Luna는 13%였습니다.
제조사 발표 수치와는 차이가 있습니다. Anthropic의 표에서는 Opus 5.5가 66.4%, Astra가 57.9%입니다. 이는 각 모델의 최고값을 나열한 것으로, Opus는 xhigh 설정, Astra는 OpenAI가 보고한 high 설정의 값이었던 것입니다. 측정 환경과 설정이 다르면 제조사의 표와 제3자 수치는 직접 비교하지 마십시오.
AI와 작업 도구(ハーネス)를 활용한 실력을 측정하는 코딩 에이전트 지수에서는, 코덱스 상의 Astra와 클로드 코드 상의 Fable 5.1이 62점으로 랭킹되었습니다. 코덱스 상의 Sol은 57점, Luna는 41점입니다. Opus 5.5의 해당 지표는 작성 시점에 확인되지 않았습니다.
비교 6: 속도
1초당 출력 속도는 Luna가 약 132 토큰, Sol이 약 131 토큰입니다. Opus 5.5는 설정에 따라 약 75~93 토큰, Astra는 약 48~58 토큰이었습니다.
단지, 대기 시간을 결정하는 것은 1초당 속도보다 1건에 소요되는 시간입니다. 53~54점 대를 비교했을 때, 평가 작업 1건에 걸리는 시간은 Opus 5.5의 high가 약 4분, Astra의 max가 약 7.7분이었습니다. medium으로 하려면, 둘 다 약 3.3~3.4분으로 거의 같습니다.
유용한 참고 사항
GPT-6 계열 모델은 입력 토큰 수가 27만 2천을 초과하면 입력 단가가 2배, 출력 단가가 1.5배로 인상됩니다. Opus 5.5에는 100만 토큰까지 이 추가 요금이 부과되지 않습니다.
【사용 가능한 공간】Sol과 Luna는 ChatGPT 유료 플랜의 Work 기능과 Codex에서 사용 가능합니다. 무료 또는 Go 플랜으로는 데스크톱 앱에서 Luna만 사용 가능하지만, 일반적인 채팅 화면에는 아직 지원되지 않습니다. Opus 5.5는 AWS, Google Cloud, Azure를 포함한 모든 플랫폼에서 제공됩니다.
【안전 조치】파벨 5.1은 생물학 및 사이버 보안과 관련된 많은 질문을 Opus에 전달하여 답변하는 메커니즘입니다. Opus 5.5 또한 유사한 안전 조치를 갖추고 있으며, 해당 요청은 다른 모델로 전환하여 답변합니다.
비교 기사를 읽을 때 확인해야 할 4가지 점
1. **목적을 명확히 한다**
2. **비교 기준을 파악한다**
3. **객관적인 정보를 중시한다**
4. **자신의 니즈에 부합하는지 확인한다**
지금까지의 내용을 다음 신모델에도 활용할 수 있도록 정리합니다.
첫 번째 항목은 “목표 달성 버전과 날짜”입니다. 같은 지표라도 수정 전후로 점수가 크게 달라집니다.
두 번째는 “누가, 어떤 설정으로 측정했는지”입니다. 제조사의 표에는 각사의 최고점을 별도의 환경에서 측정한 숫자들이 섞여 있는 경우가 있습니다. 예를 들어 OpenAI는 Astra가 FrontierMath Tier 4에서 98%를 획득했다고 발표했지만, 이 벤치마크 개발에 OpenAI가 자금을 지원하고 일부 문제에 접근 가능한 입지에 있는 점이 있습니다.
세 번째는 “단일 토큰당 비용은 얼마인지”입니다. 토큰 단가, 평가 작업 1건당, 챗 1회는 전혀 다른 숫자입니다.
네 번째는 “품질을 맞추었는가”입니다. 점수의 다른 설정 간 비용을 비교해도 어느 쪽이 더 유리인지는 알 수 없습니다.
결국 무엇을 선택할지
지금까지의 숫자들을 바탕으로 한 저의 생각입니다. 모두 “먼저 시도해 볼 후보”이며, 최종 판단은 다음 장의 방법에 따라 결정해 주세요.
처음 시도해 볼 한 가지는 Opus 5.5입니다. 이번에 참고한 독립 평가에서 종합 1위였으며, 53~54점대로 51점대보다 훨씬 좋은 결과를 얻었습니다. 평소에는 기본으로 medium을 사용하고, 중요한 업무는 high로 시도해 보시는 것을 추천합니다.
무조건 싸게 대량으로 Luna입니다. 평가 작업 1건당 0.07달러는 桁違い입니다. 오류를 나중에 확인할 수 있는 정형 처리부터 시도하면 안전합니다.
중저가 품질로 48점에서 1.06달러로, 이 밴드에서는 경쟁력이 있습니다. 하지만 AA 실무 평가에서는 결과물에서 필요한 항목이 누락되는 경향이 지적되고 있습니다. 테스트나 체크리스트로 누락 여부를 확인하는 데 사용하는 것이 안전합니다.
가벼운 설정으로 실행하거나, 과학계 또는 업무 자동화 분야에 적합한 Astra입니다. 가장 가벼운 설정에서도 Opus 5.5보다 높은 품질을 제공하며, Anthropic 자체 자료에서도 과학 연구 및 업무 자동화 분야에서는 Astra가 우수합니다. Astra의 특징은 이전 기사에서 자세히 다루었습니다.
같은 품질 帯라면, Opus 5.5의 high가 약 4분의 1의 비용으로 끝납니다. 이제부터 새롭게 선택하는 이유는 줄어들었습니다. 다만, Claude Code상의 코딩 지수에서는 최상위 타이인 만큼, Opus 5.5의 측정치가が出る 때까지 후보에 남는다는 위치를 유지합니다.
제 업무에서 “합격 1건당 비용”을 측정합니다.
이 글에서 가장 전달하고 싶은 것은 바로 이것입니다. 4번째 비교 ‘품질을 맞추는’을 자신의 일에서 어떻게 하는지 방법입니다.
AA의 총점은 여러 과제의 평균으로만 나타납니다. Anthropic 측에서도 성능이 이렇게 많이 향상되면서 벤치마크 점차의 격차가 실제 성능 차이의 척도로 신뢰하기 어려워졌다고 언급했습니다. 자신의 업무 성적은 결국 스스로 측정하는 것 외에는 달리 할 수 없습니다.
방법은 4단계입니다. 먼저, 자신의 실제 업무 중 10~20건을 선택합니다. 다음으로, 합격 기준을 먼저 정합니다. “숫자 오류가 0”, “필수 항목이 모두 포함”되어 있는 것처럼, 뒤에서 평가할 수 있는 기준으로 합니다. 그리고, 후보 모델을 2~3가지 설정으로 실행합니다. 마지막으로 “총 소요액 ÷ 합격 건 수”로 합격 1건당 비용을 산출하고, 소요 시간도 함께 나열합니다.
합격 기준을 먼저 설정하는 것은 품질을 확보하는 것과 같습니다. 불합격한 답변의 비용 또한 총액에 포함되므로, 가격이 저렴해도 실패율이 높은 설정은 자연스럽게 불리해집니다. 이를 통해 단가나 종합 점수로 측정할 수 없는 ‘자신에게 가장 효율적인 비용 대비 효과’가 숫자로 나타납니다.
솔(Sol)과 Opus 5.5 중 어느 쪽이 1건의 성공 시당에 더 저렴한지는, 동일 조건에서의 공개 결과가 아직 없습니다. 다음 신 모델이 나온 날도, 같은 세트를 흘려보내 판단할 수 있습니다.
다른 모델
Gemini 3.8 Flash는 신버전의 종합 지수로 41점(최고), 출력은 매초 약 287 토큰으로 매우 빠른 모델입니다. 입력 0.75달러/출력 3.75달러의 요금은 연말까지의 할인 가격입니다. SpaceXAI의 Grok 4.7은 46점이며, Anthropic의 Sonnet 5는 최대 설정에서 38점, 요금은 2달러/10달러입니다.
이번 기획은 독자 여러분이 “#독서미터”를 활용하여 독서 경험을 공유하고 새로운 독서 동료를 찾는 기회를 제공하는 것을 목적으로 합니다.
구체적으로 다음과 같은 3단계로 진행됩니다.
1. **독서 경험 기록 및 공유:** 독서미터 앱을 통해 읽은 책의 제목, 저자명, 정독일, 별점, 감상 등을 기록하고 공유합니다.
2. **독서 커뮤니티 참여:** 독서미터 커뮤니티에 참여하여 같은 책을 읽은 사람들과 교류하거나 독서에 관한 정보를 교환합니다.
3. **독서 이벤트 개최:** 독서미터 커뮤니티 내에서 독서 이벤트를 개최하여 독서 경험을 공유하는 장을 제공합니다.
이러한 단계들을 통해 독서미터의 이용을 촉진하고 독서 경험을 더욱 풍요롭게 하는 것을 목표합니다.
또한, 독서미터 운영팀은 독자 여러분의 피드백을 적극적으로 수집하여 앱의 개선에 활용합니다.
여러분의 적극적인 참여를 진심으로 기대합니다.
요금표의 단가, 최대값과의 비용, 품질을 맞춘 비용입니다. 비교 방식을 바꿀 때마다 승자가 바뀌었습니다. 이번 독립 평가에서 품질을 맞춘 비교에서 가장 저렴한 것은 Opus 5.5입니다. 다만, 실행 비용만 줄이고 싶다면 솔(Sol)과 루나(Luna)가 후보가 되며, 가장 가벼운 설정에서의 품질은 아스트라(Astra)가 가장 높았습니다. 자신에게 어떤 것이 유리한지는 자신의 업무에서 합격 1건당 비용을 측정하여 결정하십시오.
(출처 정보가 제공되지 않아 번역할 내용이 없습니다. 게시글 본문 청크 63/64의 내용을 제공해 주시면, 100% 한국어 번역본을 출력해 드리겠습니다.)
인공 분석「클로드 오퍼스 5.5 vs GPT-6 아스트라」 비교 페이지 (설정별 점수·비용·소요 시간) https://artificialanalysis.ai/models/releases/comparisons/claude-opus-5-5-vs-gpt-6-astra
인공 분석「클로드 오퍼스 5.5가 인공 분석 지능 지수 1위에 올랐다」 https://artificialanalysis.ai/articles/claude-opus-5-5
인공 분석「GPT-6 솔과 루나가 비용 효율성 경계를 확장했다」 https://artificialanalysis.ai/articles/gpt-6-sol-and-luna-push-the-cost-efficiency-frontier
인공 분석「GPT-6 아스트라 벤치마킹」 https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra
인공 분석「Gem
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 40청크
원문 보기 | 출처: note.com