AI 기업 Anthropic이 새로운 AI 모델 “Claude Opus 5.5”를 발표했습니다. Claude 5.5 패밀리에서 첫 번째 모델이며, 기존의 Claude Opus 5보다 성능 및 효율성, 안전성을 개선했으며, 일반적인 처리에서는 Opus 5보다 40% 낮은 비용으로 이용 가능하다는 것을 주장합니다. 또한, 출력 속도 또한 Opus 5보다 30% 이상 고속화되었습니다.
Introducing Claude Opus 5.5 \ Anthropichttps://www.anthropic.com/claude-opus-5-5
Claude Opus 5.5는 Anthropic의 Opus 시리즈의 신 모델로, AI가 여러 단계를 자율적으로 진행하는 “에이전트형”의 작업에서 성능이 향상되었습니다. Claude Opus 5.5와 주요 AI 모델의 벤치마크 비교. Opus 5.5는 에이전트형 코딩, 지식 처리, 추론, 컴퓨터 조작, 그래프 인식 등 다양한 항목에서 높은 점수를 기록했습니다. 반면, AutomationBench 및 Terminal-Bench-Science 0.1에서는 GPT-6 Astra가 Opus 5.5를 상회했습니다.
한편, Anthropic는 고성능 모델들 간에는 벤치마크상의 미미한 차이가 실제 사용감의 차이를 정확하게 반영하지 않을 수 있다는 점도 설명했습니다.
터미널에서 복잡한 작업을 수행하는 능력을 측정하는 “Terminal-Bench 4.0”에서는 66.4%를 기록했으며, Opus 5의 52.3% 뿐만 아니라 GPT-6 Astra의 57.9%도 상회했습니다.
소프트웨어 개발 능력을 측정하는 “FrontierCode v1.1”에서는 54.4%이고, “CursorBench 4.0”에서는 57.8%입니다.
Opus 5.5는 대규모 코드베이스를 장시간 처리하는 작업에 중점을 두고 있으며, 초기에 사용자들에 의한 테스트 결과, 20만 행의 코드를 감사하고 수정하는 작업을 3시간 미만으로 완료했습니다. Opus 5는 동일한 작업에 20시간 이상 소요되었으며, 사용된 토큰 수는 Opus 5.5의 약 2.5배였습니다. Anthropic에 의한 별도의 테스트에서는 웹 서비스 등에서 사용되는 로드밸런서 “HAProxy”를 C언어에서 Rust로 재작성하는 작업을 수행했습니다. Opus 5.5와 Claude Fable 5.1은 모두 HAProxy의 회귀 테스트의 거의 모든 항목을 통과했지만, Opus 5.5의 작업 시간은 9.5시간으로, Fable 5.1의 12시간보다 짧았으며, 비용 또한 51% 낮았습니다. 효율성 측면에서, Opus 5.5는 1 토큰당 요금이 Opus 5보다 저렴해진 것 외에도 동일한 작업에 필요한 토큰 수가 줄어들었습니다. 효율성 측면에서, Opus 5.5는 1 토큰당 요금이 Opus 5보다 저렴해진 것 외에도 동일한 작업에 필요한 토큰 수가 줄어들었습니다. Anthropic에 따르면, 표준 설정에서 일반적인 처리를 수행한 경우, 총 비용은 Opus 5에서 40% 감소한다고 합니다. Claude Code와 Claude Platform에서는 최대 2.5배의 속도로 처리하는 “Fast mode”도 이용할 수 있습니다.
가격 또한 Opus 5에서 인하되고 있습니다. 100만 토큰당 요리는 입력이 5달러(약 750엔)에서 4달러(약 600엔)로, 출력이 25달러(약 3750엔)에서 20달러(약 3000엔)로 낮아졌습니다. 캐시에 대한 쓰기는 6.25달러(약 940엔)에서 5달러(약 750엔)로, 특히 캐시 읽기는 0.50달러(약 75엔)에서 0.20달러(약 30엔)로 60% 낮아졌습니다.
텍스트 생성 또한 변경 사항이 추가되었습니다. Anthropic에 따르면, Opus 5.5는 기존 모델보다 중요한 정보를 먼저 제시하고, 텍스트를 간결하고 이해하기 쉽게 개선되었습니다. 초기에 이용 기업인 Box의 평가에 따르면, Opus 5에 비해 사용 토큰 수가 약 3분의 1 감소했으며, 답변 또한 정확도를 떨어뜨리지 않고 약 40% 단축되었다고 보고되었습니다. 안전성 측면에서, Anthropic은 약 2000종의 시나리오를 사용하여 모델의 행동을 평가하는 자동 평가에서, Opus 5.5는 많은 부적절한 행동에 대한 지표에서 최근 Claude 모델 중 가장 좋은 결과를 보였습니다. 모델이 주어진 실행 환경의 경계를 넘으려고 하는 행동을 조사하는 새로운 평가에서는, Opus 5 또는 Claude Mythos 5.1보다 그러한 시도가 약 85% 감소했다는 보고가 있습니다. 또한, 프롬프트 주입에 대한 저항성은 Opus 5와 동등하거나 그 이상이었다고 보고되었습니다.
한편, 사이버 보안, 생물학 등 악용될 경우 영향이 큰 분야에서는 추가적인 제한이 설정되어 있습니다. 일반적인 소프트웨어 개발에서 코드의 버그를 조사하거나 수정하는 것은 가능하지만, 많은 사이버 보안 관련 작업은 별도의 모델로 전환됩니다. 생물학 분야 또한 안전 대책이 적용되며, 연구기관이나 기업들은 심사를 받음으로써 보다 폭넓은 연구 용도로 활용할 수 있는 “Life Sciences Verification Program”에 신청할 수 있습니다. 또한, Opus 5.5에는 대량의 가짜 계정을 활용하여 모델의 능력을 추출하는 “증류 공격”에 대한 대책으로 “preserved thinking”이 도입되었습니다. API 이용자가 Claude의 과거 컨텍스트를 수정하여 추론 정보를 추출하려 시도하는 방식을 방지하기 위한 메커니즘입니다. 더 나아가, 데이터 유지 및 규정 준수와 관련하여, 기존의 Opus 시리즈와 마찬가지로, 대상 이용 형태에서 Anthropic이 입력 또는 출력을 보존하지 않는 “zero data retention”에 대응하고 있습니다. 게다가, EU의 AI 법에 대한 대응으로 Claude Fable 5.1과 동일한 워터마크도 도입되었습니다. 또한, Opus 5.5에서는 “thinking” 모드를 비활성화하여 이용할 수 없게 되었습니다. Claude Opus 5.5는 이미 Anthropic의 각 플랫폼에서 제공되며, Amazon Web Services, Google Cloud, Microsoft Azure에서도 이용할 수 있습니다. Claude Platform에서는 “claude-opus-5-5”라는 모델명으로 제공됩니다. 또한, Pro, Max, Team, Enterprise 플랜에서는 5시간 간격의 이용 상한이 인상됩니다. Anthropic은 앞으로 수주 이내에 “Claude Sonnet 5.5”와 “Claude Haiku 5.5”도 출시할 계획입니다.
원문 보기 | 출처: Gigazine