2026년 9월 22일, Anthropic이 "Claude Opus 5.5"를 출시했습니다.
일본어권 보도를 보면, 대형 IT 미디어도 개인 블로그도, 그 대부분이
상위 모델 Fable 5.1 수준의 성능을 Opus 5보다 약 40% 저렴한 비용으로 제공한다
발표문 요약 수준에 머물러 있습니다. 물론 틀린 것은 아니지만, 해외에서는 그 '수백 배' 더 흥미로운 논의가 진행되고 있습니다. 공식 발표의 각주, 독립 평가 기관 METR의 보고서, 코드 품질 전문 기업 SonarSource의 측정 등, "그 숫자, 실은 이런 의미입니다"라는 이야기가 산더미처럼 쌓였기에 이번에는 해외 정보에만 집중해 깊이 파헤쳐 보겠습니다.
(참고) 일본어권에 이미 알려진 내용
・9월 22일 출시, Opus 5 이후 2개월이 채 되지 않아 출시
・많은 작업에서 Fable 5.1 수준의 성능, 비용은 약 40% 절감
・출력 속도는 30% 이상 향상
지금부터는 이 '그 너머'에 대한 이야기입니다.
- 핵심은 “캐시 읽기 60% 할인”이다. 토큰 단가가 20% 인하된 것이 아니다. “비용 40% 감소”라고 들으면 “토큰 단가가 40% 싸졌다”고 오해하기 쉽지만, 실제 API 요금은 다음과 같다.
• 입력: 백만 토큰당 $5 → $4(20% 감소) • 출력: 백만 토큰당 $25 → $20(20% 감소) • 캐시 쓰기: $6.25 → $5(20% 감소) • 캐시 읽기: $0.50 → $0.20(60% 감소)
핵심은 마지막 행에 있습니다. Anthropic 자체가 “에이전트형·코딩 용도 비용의 대부분은 캐시 읽기가 차지한다”고 명확히 밝히고 있으며, 가장 많이 쓰는 부분이 가장 저렴해지는 구조입니다. “20% 인하”가 아니라 “40% 인하”가 되는 이유가 바로 여기에 있습니다. 나아가 코드 에이전트용 Fast mode(최대 2.5배 속도, Claude Code와 Claude Platform에서 제공)는 입력 $8/출력 $40으로 표준 가격의 약 2배입니다.
2. 벤치마크의 각주에 '대타 출전'이라고 적혀 있었다. 공식 발표에서 일본어 미디어가 읽고 넘기고 있는 가장 큰 대목이 바로 여기라고 생각합니다.
Opus 5.5의 벤치마크 표에는 "세이프가드가 개입한 작업 중 사이버보안 관련은 Claude Opus 4.8이, 생물학 및 프런티어 LLM 개발 관련은 Claude Opus 5가 대신 완료했다"는 각주가 있으며, "이는 Opus 5.5의 실력을 과소평가했을 가능성이 있다"고까지 적혀 있습니다.
즉 안전장치가 너무 강해서, 고위험 영역의 벤치마크에서는 “전 세대 모델이 출전해 점수를 벌어왔다”라는 장대하고 얽히고설킨 사정이 숨어 있는 셈입니다. 모델의 성적표에 이런 단서를 붙이는 것은 안전성에 대한 자신감과 여유의 표현으로 보입니다.
3. 성능은 '노력량(에포트) 다이얼'로 움직인다. Opus 5.5는 '적응적 사고(adaptive thinking)'를 갖추고 있으며, low / medium / high / xhigh / max라는 노력 단계를 가지고 있다. 발표된 수치는 별도 설명이 없는 한 'max effort' 기준이며, Terminal-Bench 4.0만 'xhigh'로 측정되었다. 기본값은 medium이다.
재미있는 것은 “기본 설정 그대로 능가한다”는 주장을 내세우는 방식이다. 공식 페이지에 따르면, 기본(medium) 설정의 Opus 5.5는 코딩의 Terminal-Bench 4.0에서 max effort의 Opus 5를 능가하며, 그 비용은 약 5분의 1이다. 지식 업무의 GDPval-AA v2.1에서도 기본 설정 그대로 태스크당 약 5분의 1의 비용으로 max effort의 GPT-6 Astra를 능가한다고 한다. 에이전트 운영에서는 ‘사고의 깊이’를 태스크마다 조절하는 이 다이얼이 실용성을 가르는 분수령이 된다.
4. Anthropic 스스로 “벤치마크의 차이는 과장됐다”고 인정했다 “이 수준의 능력이 되면, 벤치마크의 차이는 현실 세계의 차이를 보여주는 믿을 만한 지표가 되기 어려워지고 있다. 실제로 사용해 본 체감으로는, Opus 5.5와 Fable 5.1의 차이는 이 점수 차이보다 훨씬 좁다”
이는 자사 모델의 수치를 내세워 쓴 벤더의 글로서는 상당히 솔직합니다. 점수표에서는 압승처럼 보여도 실무에서의 체감 차이는 작다는 점을 전제로 알아두면, 앞으로 각 사의 벤치마크 보도에 현혹되기 어려워집니다.
5. 독립기관 METR “AI 연구의 완전 자동화에는 아직 멀었다” 출시 전 외부 평가를 맡은 METR(모델 평가·안전성 연구기관)의 보고서는 일본에서는 거의 화제가 되지 않고 있습니다. 요점은 다음과 같습니다:
・Opus 5.5는 Fable 5.1에 비해 '점진적인 개선'일 뿐 '불연속적인 도약'은 아니다 ・난도가 높고 장기간에 걸친 과제에서는 '인간 전문가라면 드러내지 않을 질적 약점이 남아 있다' ・AI 연구개발(AI R&D)의 완전 자동화에는 앞을 내다보는 힘, 스스로 피드백 루프를 만드는 힘, 이른바 '연구자의 직감(테이스트)'의 대폭적인 향상이 필요하며, 이번 모델은 이에 크게 기여하지 못했다 ・한편, Anthropic 내부의 잠정 조사에서는 Opus 5.5 개발 기간 중 AI로 인해 연구 속도가 약 1.5배 가속화되었다(2배일 확률이 30%라는 추정치 포함)
“1.5배 가속”이라는 사내 추정을 평가기관이 “잠정 수치이며 별도 검증은 하지 않았다”는 단서를 붙여 공개한 것 자체가 업계에서는 전례가 드문 투명성입니다.
6. 코드 품질 실측 “코드량 27.5% 감소, 주석은 3분의 1로 급감” 정적 분석 도구인 SonarSource가 자사의 Java 벤치마크(4,444개 태스크)에서 Opus 5.5를 측정했습니다. 이 역시 일본어권에는 거의 소개되지 않은 데이터입니다.
・동일한 작업에서 생성 코드량은 Opus 5 대비 27.5% 감소(916,813행 → 664,890행) ・통과율은 88.6% → 87.68%로 거의 동등 ・BLOCKER급 결함 밀도는 41% 감소(41 → 24/mLOC). 총 버그 수는 19% 감소 ・주석 행 비율이 10.5% → 3.1%로 급감(리뷰 시 읽는 “맥락”이 줄어듦) ・다만 천 행당 버그 밀도는 11.8% 증가. 특히 병행 처리·스레드 관련 버그가 44% 증가(205 → 295/mLOC)
즉 “작성 코드량은 줄고 치명적 결함은 줄었지만, 한 줄당 결함 밀도는 올라갔고, 병렬 처리 관련 부분은 주의가 필요하다. 주석도 빈약하므로 인간 측의 끈질긴 리뷰가 요구된다”라는, 벤더 발표에서는 나오지 않는 실무용 결론입니다.
7. 개발자의 실전 사례는 '마이그레이션·감사'에서 압승
· 한 테스터는 68만 행의 코드 마이그레이션을 하루도 안 돼서 완료(팀이라면 수 주가 걸리는 작업)
· 다른 테스터는 20만 행 코드베이스의 감사와 수정을 3시간도 안 돼서 수행(Opus 5는 20시간 초과, 토큰도 2.5배)
· Anthropic 내부에서는 인기 로드밸런서 HAProxy를 C에서 Rust로 번역시켜 Fable 5.1과 비교. 양쪽 모두 거의 모든 회귀 테스트를 통과했지만, 소요 시간은 9.5시간 vs 12시간, 비용은 51% 저렴
· GitHub Copilot 팀의 측정에 따르면 "VS Code에서 Opus 5보다 절반 이하의 단계 수로 더 많은 터미널 과제를 해결"
“단발성 코드 생성”이 아니라 “며칠씩 걸리는 대규모 작업을 하루 만에 끝내는” 방향으로 차별화한다는 점이 명확합니다.
8. 안전성은 '역대 최강'을 주장한다. 제3자 검증을 포함해 수천 개의 시뮬레이션 시나리오로 모델 행동을 감사하는 '자동 행동 감사'에서 Opus 5.5는 Anthropic 사상 최고 점수를 기록했다. 되돌릴 수 없는 행동을 하거나 부여된 권한 밖으로 벗어날 확률이 최근 모델보다 크게 낮아졌고, 프롬프트 인젝션 내성은 AI 보안 기업 Gray Swan의 벤치마크에서 '테스트된 모든 모델 중 최저 성공률(=최강)'을 Fable 5.1과 동률로 기록했다.
배경으로 Opus 5.5는 생물학·사이버보안 분야에서 상위 모델인 “Claude Mythos 5.1”에 필적하는 능력을 갖춘 것으로 평가되며, Fable 5.1과 동등한 수준의 안전장치를 처음부터 탑재하여 출시되었습니다. 생물학 연구 용도는 심사제로 운영되는 “Life Sciences Verification Program”을 통해서만 이용 가능합니다.
그리고 간과되기 쉬운 것이 맥락입니다. Opus 5.5는 다리오 아모데이 CEO가 “frontier(프런티어)의 속도를 조절해야 한다(We must pace the frontier)”고 제언한 지 약 1주일 만에 출시된 것으로, “제언 이후 첫 모델”에 해당합니다. Opus 5로부터는 2개월도 채 지나지 않았습니다. 공식 페이지 자체가 “Pacing the frontier” 섹션을 마련해 “왜 이 시기에 새 모델을 내놓는지”를 직접 설명하는 구성으로 되어 있다는 점도 해외 기사들이 주목하는 대목입니다.
9. 구독 측의 눈에 잘 띄지 않는 우대 조치 API 가격 이야기만 부각되고 있지만, Pro/Max/Team/Enterprise 계약을 대상으로 “5시간당 이용 상한”이 인상되었습니다. 또한 기존 사용자에게 “언제든 사용할 수 있는 레이트 제한 리셋 권한”이 부여되었는데, 이는 저장해 두었다가 원하는 타이밍에 사용할 수 있는 것입니다. 마감 작업일에 몰아서 쓰는 식의 활용이 상정되고 있습니다. 향후 수 주 안에 Sonnet 5.5와 Haiku 5.5가 연이어 출시될 예정이며, Claude 5.5 패밀리로서는 첫 번째 모델입니다.
정리: 숫자보다 '서술 방식'이 바뀌었다 · 수치상의 실체는 '캐시 읽기 60% 할인+토큰 소비 절감'에 따른 실효 비용 40% 감소 · 벤치마크 압승의 이면에는 '세이프가드가 너무 강해 전 세대가 대타로 출전했다'는 사정 · 독립 평가는 '비약이 아닌 점진적 진보. 연구자의 감까지는 자동화할 수 없다' · 코드 실측은 '양은 줄고, 치명적 결함은 줄고, 밀도는 늘고, 주석은 빈약해졌다' · 벤더 스스로가 '벤치마크의 차이는 겉보기 이상이다'라고 말하기 시작했다
“일점 돌파의 천재”에서 “싸고, 빠르고, 자중하는 작업 달인”으로. Opus 5.5의 본질은 벤치마크의 정점이 아니라 장시간 에이전트 운용의 비용 구조를 깨뜨린 데 있다——해외 1차 정보를 읽고 가장 강하게 느낀 점이다.
(출처) • Anthropic 공식 발표: https://www.anthropic.com/claude-opus-5-5 • VentureBeat(요금 비교표 포함): https://venturebeat.com/technology/anthropic-releases-claude-opus-5-5-beating-fable-5-1-on-key-agentic-benchmarks-at-60-cheaper-api-price • METR 사전 평가 보고서: https://metr.org/blog/2026-09-22-claude-opus-5-5/ • SonarSource의 코드 품질 실측: https://www.sonarsource.com/blog/claude-opus-5-5-an-evaluation/ • Opus 5.5 시스템 카드: https://anthropic.com/claude-opus-5-5-system-card
※본 기사는 2026년 9월 26일 시점의 정보입니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 27청크
원문 보기 | 출처: note.com