# GPT-6 아스트라 vs Claude 페이블 5.1｜공식 벤치마크 비교 시 “표현 방식”이 완전히 달랐다

> https://bookfactory.kr/board/news/16673
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-09-16T10:01:45.813Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/311123953/rectangle_large_type_2_2f01a9c29031270acafbb252b8b0aec2.png?width=1280)

![画像](https://assets.st-note.com/img/1788744424-styEWg4l86dpXFvnewY2SMqA.png?width=1200)

2026년 9월, AI 업계에서 주목할 만한 모델들이 연이어 발표되었습니다. Anthropic의 Claude Fable 5.1과 OpenAI의 GPT-6 Astra입니다. 모두 최신 세대의 고성능 모델이죠. 그래서 당연히 궁금한 점은 “결국, 둘 중이 더 강한가?” 였습니다. 저 역시 궁금해서 두 회사의 공식 발표를 비교하고 있었는데, 성능 자체보다 더 흥미로웠던 점은 같은 AI 비교임에도 불구하고 공식 자료의 ‘표현 방식’이 상당히 다르다는 것이었습니다. OpenAI는 “최신 Claude와의 직접 비교”를 강조하며 먼저 OpenAI의 발표를 보면 GPT-6 Astra와 Claude Fable 5.1을 상당히 직접적으로 비교하고 있습니다. 코딩, 수학, 과학, 전문 업무 등 여러 벤치마크에서 함께 제시하고 있으며, 그 모습만으로도 “GPT-6 Astra는 최신 Claude보다 훨씬 강력합니다”라는 메시지가 분명하게 드러납니다. 실제로 OpenAI가 공개한 비교 결과에서 GPT-6 Astra가 상위 점수를 기록하는 항목이 상당히 많습니다. 따라서 이 표만 보더라도 “Astra가 더 강력해 보입니다”라고 느끼기 쉽습니다. 반면 Anthropic은 “전 모델에서 얼마나 발전했는지”를 보여주는 데 집중합니다. Anthropic의 Claude Fable 5.1 발표를 살펴보면, 역시 벤치마크가 많이 나열되어 있지만, 제시 방식이 조금 다릅니다. Anthropic이 특히 강조하는 것은 “Claude Fable 5.1이 전 세대의 Claude에서 얼마나 발전했는지”라는 부분입니다. 자사의 이전 모델과 함께 제시하며 “이렇게 발전했습니다”, “장시간 작업이나 복잡한 업무에서 강해졌습니다”라는 점을 부각했습니다.
이는 진화의 이야기로 이어지고 있습니다. 따라서 Anthropic 측 자료를 보면, 이번에는 오히려 “Claude Fable 5.1, 상당히 진화했네”라는 인상을 받습니다. 같은 모델인데, 보이는 모습이 완전히 다르다는 점이 이번에 가장 흥미로웠던 부분입니다. OpenAI 자료를 보면 GPT-6 Astra가 강하게 보입니다. Anthropic 자료를 보면 Claude Fable 5.1이 상당히 발전한 것처럼 보입니다. 하지만, 둘 다 거짓을 꾸미는 것은 아닙니다. 다른 것은 “무엇과 비교하는가”, “어떤 숫자를 먼저 내세우는가”, “무엇을 전달하고자 하는 자료인가”입니다. 즉, AI 성능 비교는 숫자 자체뿐만 아니라 비교 설계까지 봐야 인상이 크게 달라지는 것입니다. 외부 평가를 보면, 또 다른 재미있는 점은 기업 자신 아닌 외부 평가를 보면, 또 다른 모습이 드러나는 것입니다. OpenAI 공식 비교에서는 GPT-6 Astra가 상당히 강하게 보이지만, 외부 종합 평가에서는 Claude Fable 5.1이 더 높은 점수를 받는 경우도 있습니다. 이렇게 살펴보면 “누가 더 강한가”를 하나의 숫자로 결정하는 것은 상당히 어렵다는 것을 알 수 있습니다. AI 벤치마크를 볼 때 주의해야 할 점은, 최소한 여기는 꼭 봐야 합니다. * 누가 숫자를 냈는가* 무엇과 비교하고 있는가* 같은 조건으로 측정하고 있는가* 무엇을 측정하는 벤치마크인가 예를 들어, 수학이 강해서 글쓰기 능력이 가장 뛰어나다는 것은 아닙니다. 코딩이 강해서 장시간 리서치도 가장 능숙한 것은 아닙니다. 반대로, 종합 점수가 높아서 모든 일에서 뛰어나다는 것도 아닙니다.
말로만 할 수 있는 건 아니죠. 의료 관련 숫자들은 더욱 신중하게 살펴봐야 해서, 저는 간호사로서 의료 분야의 벤치마크도 관심을 가지고 있습니다. 다만, 여기는 특히 주의가 필요하다고 생각합니다. 의료 분야 벤치마크에서 높은 점수를 받더라도, 그것만으로는 “의료 현장에서 안전하게 사용할 수 있다”거나 “임상적 판단을 맡길 수 있다”는 의미가 되는 것은 아닙니다. 실제 의료 현장에서는, 오답, 근거, 최신 정보, 환자 배경, 개인 정보, 안전성, 사람에 의한 확인 등 벤치마크 점수만으로는 측정할 수 없는 부분이 상당히 많습니다. 그래서 벤치마크가 높다고 해서 의료가 안전하지는 않다는 것입니다. 여기서는 분리해서 생각해야 합니다. 결국, 뭐가 더 좋은 걸까요? 현재까지 저는 “어느 AI가 더 강한가”보다는 “어떤 용도로 사용하는가”로 선택하는 것이 더 중요하다고 생각합니다. GPT-6 Astra가 강점을 보이는 일도 있고, Claude Fable 5.1이 강점을 보이는 일도 있습니다. 게다가, 같은 모델이라도 프롬프트나 도구, 설정에 따라 결과는 달라집니다. 그래서こそ, 공식적으로 “우리 AI가 더 강합니다”라는 숫자만 보는 것이 아니라, 자신이 실제로 하고 싶은 일에서 직접 시도해 보는 것이 결국 가장 명확합니다. 요약하자면, 이번에 OpenAI와 Anthropic의 공식 발표를 나란히 보면서 느낀 것은, AI 성능 비교는 숫자보다 훨씬 더 “어떻게 보여지는가”가 흥미롭다는 것입니다. OpenAI는 경쟁사와의 강점을 먼저 내세우고, Anthropic은 전 세대 대비 발전을 먼저 내세웁니다. 그리고 외부 평가를 보면 또 다른 결과가 나옵니다. 그래서 “이 AI가 최강이다!”라는 정보를 보더라도, 잠시 멈춰서, 누가, 무엇과, 어떻게 비교한 숫자인지까지 살펴보면, 훨씬 더 다른 시각으로 볼 수 있을 것입니다. 앞으로 저도 성능표만 보지 않고, 실제로 사용했을 때 무엇이 다른지 확인하는 것이 중요하다고 생각합니다.
이러한 점들을 고려하여 실험해보고 싶습니다. 마지막으로, 서로의 강점을 간략하게 정리하면 이번 공개 정보에 따르면 강점은 조금 다릅니다. GPT-6 Astra* 코딩* 수학·과학* 전문 업무 태스크* 컴퓨터 운영* 여러 도구를 사용하는 실무 중심의 처리 방식이 강점인 반면, Claude Fable 5.1* 장시간 작업* 긴 텍스트 이해·처리* 복잡한 지식 노동* 다중 단계 리서치* 도구를 사용하면서 끊임없이 생각하는 태스크이므로, 꽤 대략적으로 말하자면 Astra는 “실행력 및 처리력”에, Claude는 “깊이 생각하고 오래 일하는 능력”에 집중하는 경향이 있습니다. 이러한 것은 공개 벤치마크나 각사의 설명에서 본 “추세”에 불과하며, 모든 용도에 적용되는 것은 아닙니다. 결국, 무엇을 시키고 싶은지에 따라 선택하는 것이 가장 현실적이라고 생각합니다.

![画像](https://assets.st-note.com/img/1788746757-v9Gb12MF3g5LVPXa4DifdRny.png?width=1200)

**출처:** [note 원문](https://note.com/hiikarusama8839/n/n1497ca3ada0e)

*번역: Gemma 3(.44) 초벌 + 교정 검수*

[원문 보기](https://note.com/hiikarusama8839/n/n1497ca3ada0e) | 출처: note.com