2026년 9월 22일, Anthropic이 Claude Opus 5.5를, OpenAI가 GPT-6 Sol(과 경량 버전인 Luna)을 발표했습니다. 발표 시점이 거의 동시에 이루어졌기 때문에, X에는 “어떤 것을 메인으로 사용할지”, “가격 경쟁이 시작되었다”는 비교 게시물이 쏟아져 나오고 있습니다.
이 글에서는 두 회사의 공식 발표, 제3자의 벤치마크, X(트위터)의 첫날부터 다음날 반응을 정리합니다. 결론부터 말씀드리면, 현재 분위기는 “결과물의 품질과 스타일은 Opus 5.5, 속도와 가격 대비 성능은 GPT-6 솔”입니다. 다만, 출시로부터 아직 1일 정도밖에 지나지 않았으므로, 그 부분은 감안하여 읽어주시기 바랍니다.
이번 업데이트에서는 사용자 인터페이스 개선, 신 기능 추가, 성능 최적화에 중점을 두고 있습니다. 특히 검색 기능의 정확도 향상과 더 직관적인 조작성 구현을 목표로 하며, 서버 부하 감소를 위한 최적화도 진행하여 전반적인 안정성 향상을 도모합니다.
- 오퍼스 5.5는 “Fable 5.1의 성능을 오퍼스 5보다 약 40% 저렴하게 제공한다”고 한다. 독립적인 종합 지표에서 1위를 차지하며, X에서는 “클로드(Claude)가 돌아왔다”는 반응이 뜨겁다.
- GPT-6 솔은 “GPT-5.6 솔보다 오류가 약 절반 줄고, API 가격도 반액”이라고 합니다. 모델 자체로는 “2위”라는 평가가 많습니다.
- 사용 분할이 증가하고 있습니다. 깊은 구현, 디자인, 장시간 에이전트는 Opus를, 양을 처리하는 구현이나 리뷰는 Sol로 분담합니다.
두 모델의 위치
재미있는 점은 두 회사 모두 ‘저렴함’을 앞세우고 있지만, 무엇과 비교했을 때 얼마나 저렴한지에서 차이가 있다는 것입니다.
- 오퍼스 5.5는 “Fable 5.1급을 플래그십 모델보다 저렴하게 제공한다”고 한다. 프론티어코드에서는 표준 추론 설정으로 GPT-6 아스트라를 능가하며, 작업 단가는 아스트라 대비 약 20% 수준이다.
- GPT-6 Sol은 “기존의 Claude와 거의 비슷한 성능을 훨씬 저렴하게 제공한다.”고 한다. 비교 대상이 되는 것은 Opus 5.5가 아닌 기존의 Opus 5와 Fable 5이다. OSWorld 2.0(오프라인)은 Opus 5와 거의 동일한 점수(60.5% vs 60.3%)를 약 80% 낮은 비용으로 달성했으며, DeepSWE는 Fable 5에 근접한 점수(68.8% vs 69.9%)를 약 80% 낮은 비용으로 달성했다.
또한, OpenAI는 “GPT-6 Astra는 지속적으로 모든 면에서 당사의 최고 모델”이라고 명확히 밝히고 있습니다. Sol은 Astra의 후속 모델이 아니며, 프론티어급 성능을 일상 업무 가격대에서 사용할 수 있도록 하는 모델로 자리매김하고 있습니다.
공식 벤치마크에는 “직접 대결”이 존재하지 않습니다.
여기 주의가 필요합니다. Anthropic의 표에는 GPT-6 Sol이 기재되어 있지 않으며, OpenAI의 표에도 Opus 5.5가 기재되어 있지 않습니다. 같은 날 발표이므로 당연하지만, 두 회사의 숫자를 나열할 때는 추론 설정 등 조건이 일치하지 않는다는 전제하에 해석해야 합니다.
그와 더불어, 비교의 실마리를 제공하는 숫자를 포착한 결과는 다음과 같습니다.
여기서 우리가 얻을 수 있는 것은 두 가지입니다.
- 지능 및 에이전트 정확도는 Opus 5.5가 명확히 우수하며, 종합 지표에서 10점의 차이를 보입니다. Anthropic의 표에서는 Terminal-Bench 4.0이 66.4%로, GPT-6 Astra(57.9%)와 GPT-5.6 Sol(37.3%)를 상회합니다(GPT-6 Sol의 수치는 표에 나와 있지 않습니다).
- 하지만 작업당 비용은 약 5.6배 증가합니다. API 단가는 2배인데 실제 비용이 5배를 초과하는 것은 Opus 5.5가 더 오래 추론하기 때문입니다. Artificial Analysis에 따르면 Opus 5.5가 인덱스 1개의 작업에서 출력하는 토큰 수는 약 11만 9천 개로, Opus 5 (약 7만 3천 개)나 GPT-6 Astra (약 2만 7천 개)보다 현저히 많습니다. X에서 흔히 보는 “Claude는 오래 생각한다. GPT는 결과물을 내놓는다”라는 표현이 숫자적으로도 뒷받침됩니다.
클로이드 옵스 5.5: X의 평가는 상당히 뜨겁습니다.
첫 날 반응은 대체로 긍정적이었고, “앤트로픽이 돌아왔다”는 의견과 “페이블이 원래 이렇게 되어야 했다”는 의견이 두드러졌습니다.
스롭이 삭제되었습니다. 초기 테스터들은 “Opus 4.6 이후, 가장 직설적이고 일반적인 표현 방식”이라는 평가를 내렸습니다. 표현이 지나치게 날카롭지 않고, 피드백을 솔직하게 받아들이게 되었다는 지적도 많습니다. 공식 발표에서는 “중요한 정보를 먼저 작성하고”, “문장이 40% 줄었다”는 테스터들의 목소리가 소개되었습니다.
코딩과 스타일입니다. 동일한 프롬프트로 SVG, 3D, 애니메이션, 게임 UI를 생성하도록 요청하면 디자인 및 완성도 면에서 솔(Sol)을 크게 능가한다는 비교 영상 및 이미지가 확산되고 있습니다. “GPT-6 솔이 아이 장난감처럼 보이며”, “같은 프롬프트임에도 불구하고 차이가 명확하게 드러납니다”라는 표현이 반복적으로 사용되고 있습니다.
실무 워크플로우에서도 우위를 점하고 있습니다. 복잡한 실무 기술을 양쪽 모두 활용한 사용자는 “Opus 5.5가 반분 내에 능숙하게 처리했으며, 다음으로 더 빠르게 하기 위한 개선안까지 제시했습니다.”라고 작성했습니다. 공식 발표에는 68만 행의 코드 이전을 1일 만에 완료한 사례나, 웹 앱 전 페이지 로딩 시간을 40회 중 39회 성공적으로 단축시킨 사례 등이 포함되어 있습니다.
구독으로 돌아온 사람들도 있습니다. “공개적으로 Claude에게 사과하고, Opus 5.5를 사용해 보고 구독을 갱신했다”는 의견도 있습니다. 200 플랜과의 비교에서는 Opus가 1 작업당 시간이 가장 짧다 (약 1.2분)는 의견이 있으며, medium 설정으로도 충분히 강력하고, 5x 플랜으로는 슬롯을 모두 사용하지 못한다는 의견도 있습니다. 그러다 “현재 Claude 20x가 Codex 20x보다 더 안전하다”고 결론짓는 사람도 있습니다.
주의 사항으로 거론된 내용:
- 나 스스로 멈추지 않는다. 시간의 한도와 ‘완성 조건’을 명확히 지정하지 않으면 계획의 틀을 계속해서 소비하게 된다.
- 며칠 후 성능 저하 가능성에 대한 우려입니다. 특히 일본어권에서는 “릴리즈 직후만 강하다”는 경험 법칙을 중요하게 생각하는 목소리가 있습니다.
- 안전은 엄격하게 적용됩니다. 공식 발표에 따르면 생물 분야에는 Fable 5.1과 동일한 보안 장치가 사용되며, 사이버 보안 관련 많은 작업은 Opus 4.8으로 처리됩니다(인가된 방어 시스템용 프로그램은 별도로 있습니다). 용도에 따라 거절될 가능성이 높아질 수 있습니다.
GPT-6 솔:「고급 모델」이라는 평가로 인해 평가가 분산된다
공식적으로는 “5.6보다 똑똑하고, 실수는 약 절반, 가격도 반 가격”이라고 주장하고 있습니다. 사용자들의 평가는 좀 더 냉철합니다.
평가되는 사항:
- xhigh는 압도적으로 뛰어난 가치입니다. “20달러 상당의 ChatGPT 구독이 코딩에 정말 유용하게 쓰일 수 있게 되었다”는 실무적인 의견이 있습니다.
- 속도 및 토큰 효율. 만델브로 집합의 WebGL 데모에서는 Sol이 더 저렴했음($0.07 대비 $0.35), 토큰 사용량도 적고, 확대 시 품질도 우수했다는 검증 결과가 있었다.
- 5.6 솔의 순조로운 진화. 일본의 ts-벤치에서는 솔(미디엄) 도구 사용법이 더욱 능숙해졌으며, 전세대 대비 개선 사항이 확인됩니다.
- 아스트라의 대체재가 아닌, 양을 다루는 계층입니다. CTO 계층에서는 “아스트라의 무료 버전이 아니다. 처리 경로마다 모델 ID를 고정하고, 성공 태스크당 단가와 툴 실패율을 보아 채용을 결정해야 한다”는 실무적인 의견이 나오고 있습니다.
엄격한 평가
- 아스트라보다 낫지 않다. “저렴하지만, 공개된 어떤 차트에서도 아스트라를 능가하지 못한다. 내 기준로는 전환하지 않는다.”
- 중간 정도의 난이도로 인해 실수를 저지를 수 있습니다. 스페인어권 사용자들로부터는 “흐릿해서, 중간 정도의 사례 분석에서 실수를 저질렀다. 5.6 Sol이면 거의 한 방이었는데”라는 보고가 있습니다.
- 디자인 스타일 대결에서는 패배했습니다. 자전거를 타는 페리칸, PS5 컨트롤러 SVG, 화산섬, 義手 3D 사이트 등 “같은 프롬프트 대결”에서는 Opus가 승리하는 게시물이 눈에 띄게 많습니다.
- 루나를 훼손하고 있습니다. 동시에 발표된 루나에 “5.6 루나보다 성능이 떨어지는” 일본어 벤치마크 게시글이 올라와 솔 본체의 인상을 낮추고 있습니다.
- 소수 의견이지만 “6 솔은 5.6보다 약하다”는 견해도 있습니다.
관점별: 누가 우세한가
속도 평가는 다소 복잡하며, “오퍼스는 1 작업당 가장 빠르다”는 의견과 “클로드는 더 오래 생각한다”는 의견이 모두 존재합니다. 토큰 소비는 오퍼스 쪽이 현저히 많지만, 재작업이 적다면 실제 소요 시간은 짧아집니다. 작업의 난이도에 따라 결론이 달라지는 부분입니다.
일본 내 온도 감각
일본어 엑스(X)든, 구도는 대체로 같습니다.
- 오늘은 동시에 출시 기념 파티입니다. Opus는 상당히 다재다능합니다. 앞으로는 Claude Code를 중심으로, 마지막에는 Codex로 리뷰하면 충분할 것 같습니다.
- 클루드(Claude)는 실용적인 업데이트입니다. GPT 계열은 비용이 낮아져 자체 제품에 통합하기 쉬워졌습니다.
- 6 솔 덕분에 이 성능을 저렴하게 이용할 수 있습니다. 또한 챗봇에도 포함해 주시면 좋겠습니다.
한편으로 “솔”에 대한 부정적 평가가 곳곳에서 나타났고, 5.6보다 낮다면 상황이 달라지며, “오퍼스(Opus)”가 “아스트라(Astra)”보다 우세하다면 비용 측면에서도 불리해질 수 있다는 의견도 있었다.
현재 시점에서의 사용 구분
초일의 평가와 공식 및 제3자 숫자 합계를 고려할 때, 다음과 같은 분담이 적절하다고 판단됩니다.
오퍼스 5.5는 적합한 직업입니다.
- 대규모 코드 이관이나 수 시간 이상 지속적으로 실행되는 장시간 에이전트
- UI 디자인, 콘텐츠 품질 및 스타일이 요구되는 것들
- 흐릿하고 절차가 많으며, 실패 시 재실행 비용이 높은 것
GPT-6 Sol이 적합한 직업
GPT-6 Sol은 특히 다음과 같은 분야에서 뛰어난 성능을 보입니다.
* **콘텐츠 제작:** 블로그 게시물, 소셜 미디어 콘텐츠, 광고 카피 등 다양한 형태의 텍스트 콘텐츠를 빠르게 생성할 수 있습니다. 특히, 특정 주제에 대한 깊이 있는 지식이 요구되는 콘텐츠 제작에도 효과적입니다.
* **데이터 분석:** 방대한 양의 데이터를 분석하고, 그 결과를 요약하거나 시각화하는 데 활용할 수 있습니다. 복잡한 통계 분석을 수행하는 데에도 적합하며, 데이터 기반 의사 결정을 지원하는 데 도움을 줄 수 있습니다.
* **고객 지원:** 24시간 365일 고객 문의에 응대하고, FAQ를 기반으로 답변을 제공하는 등 고객 지원 업무를 자동화할 수 있습니다.
* **번역:** 다양한 언어 간의 번역 작업을 수행할 수 있으며, 특히 기술 문서나 법률 문서 등 전문 분야의 번역에 강점을 보입니다.
* **교육:** 학생들의 질문에 답변하고, 학습 자료를 제공하는 등 교육 분야에서도 활용될 수 있습니다. 특히, 개인별 맞춤형 학습 경험을 제공하는 데 도움이 될 수 있습니다.
GPT-6 Sol은 이러한 다양한 분야에서 활용될 수 있으며, 앞으로 더욱 발전된 기능을 통해 우리의 업무 효율성을 높이는 데 기여할 것으로 기대됩니다. 특히, GPT-6 Sol은 인간의 창의성과 직관을 대체하는 것이 아니라, 인간의 능력을 보완하고 확장하는 데 초점을 맞추고 있습니다. 따라서, GPT-6 Sol을 활용하여 더욱 창의적이고 효율적인 업무 환경을 구축할 수 있을 것입니다.
- 범위가 제한된 코드 변경, 코드 검토, 표준화된 데이터 변환
- 대량 배치 처리 및 자사 제품 통합
- 20플랜이나 API 예산 등 비용의 상한이 명확한 경우
두 가지를 결합하는 방법도 있습니다. Opus를 지휘부(계획과 판단), Sol을 실무 부대(작업의 대량 생산)로 하는 구성을 시도하는 게시글이 이미 있습니다.
운용 팁도 각각 다릅니다. Opus 5.5는 시간 제한과 완료 조건을 지정해주지 않으면 枠을 과도하게 소비합니다. Sol로 전환할 때는, 처리 경로마다 모델 ID를 고정하고 “성공한 작업당 단가”와 “툴 호출 실패율”으로 채택을 판단하는 것이 안전합니다. API 단가만으로 비교하면 어느 모델도 제대로 보지 못합니다.
요약: 첫 날의 평가는 단순한 첫 날의 평가일 뿐이다.
- 첫 날의 흥미진진함은 Opus 5.5에 집중되었습니다. 문장 개선, 스타일, 코딩 완성도, 그리고 “클로드가 돌아왔다”는 감정이 함께 포함되어 있습니다.
- 솔은 가격 파괴는 성공적으로 이루어졌지만, 모델로서의 위치는 2위입니다. 5.6에서 개선된 점과 반 가격이라는 점은 긍정적으로 평가받고 있지만, A스트라를 능가하지 못하고 오퍼스(Opus)를 능가하지 못한다는 시각이 다수입니다.
- 용도로 사용을 분별하는 사람이 늘고 있다. 깊은 구현·설계·장시간 에이전트에는 Opus를 사용하고, 양을 소화하는 구현·검토·비용 중시 상황에는 Sol(Luna는 신중하게)를 사용한다.
릴리즈 이후 아직 반나절에서 1일입니다. 수일 후에 “처음에는 좋았지만 떨어졌다”, “특정 분야에서는 역전했다”는 목소리가 나올 가능성은 충분히 있습니다. 결국에는 자신의 업무로 두 가지를 모두 달성하고, 한 번에 통과한 비율과 수정까지 포함한 비용으로 판단하는 것이 확실합니다.
이 기획은 2023년 11월 28일에 개최된 “제1회 도쿄 국제 만화상”의 수상 작품을 기반으로 합니다. 수상 작품은 다음과 같습니다.
* 『야사쿠라 상치』 아키 료비
* 『블루만보』 키쇼모 토고
* 『하야테맨』 타가와 하나야
이러한 작품들은 각각 다른 주제와 표현 방식으로 독자들에게 감동과 놀라움을 선사했습니다.
또한, 이 기획에서는 수상 작품의 제작 배경과 작가의 인터뷰 영상을 수록하고 있습니다. 작가들이 각 작품에 담은 생각과 제작 과정에서의 고충과 기쁨을 이야기해 주십니다.
더불어, 수상 작품 관련 서적과 상품도 소개합니다. 이 서적과 상품들은 수상 작품의 세계관을 더욱 깊이 이해하는 데 도움이 될 것입니다.
GPT-6 솔(Sol)과 루나(Luna)를 소개합니다 | OpenAI
솔과 루나는 OpenAI에서 개발한 최첨단 대규모 언어 모델(LLM)입니다. 이 두 모델은 GPT-6 아키텍처를 기반으로 하며, 이전 GPT 모델보다 훨씬 향상된 성능을 제공합니다. 솔과 루나는 다양한 작업에서 뛰어난 능력을 보여주며, 특히 창의적인 콘텐츠 생성, 복잡한 문제 해결, 자연스러운 대화 능력에서 두드러집니다.
솔은 특히 수학적 추론 및 코딩 능력에 강점을 가지고 있습니다. 다양한 수학 문제를 해결하고, 복잡한 코드를 생성하고, 디버깅하는 데 탁월한 성능을 보입니다. 루나는 반면, 문학 작품 생성, 시나리오 작성, 다양한 스타일의 글쓰기에서 뛰어난 창의성을 발휘합니다.
솔과 루나는 OpenAI의 연구팀이 수년간의 노력으로 개발한 결과물입니다. 이 두 모델은 OpenAI의 GPT-6 기술을 더욱 발전시키고, 인공지능 분야의 새로운 가능성을 열어갈 것으로 기대됩니다. 솔과 루나에 대한 자세한 정보는 OpenAI 공식 웹사이트에서 확인할 수 있습니다.
이 글은 Claude Opus 5.5로 작성되었습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 48청크
원문 보기 | 출처: note.com