2026년 9월, 인공지능 분야가 급격하게 발전했습니다.
Anthropic는 9월 1일, Claude Fable 5.1을 발표했습니다. OpenAI는 이틀 후인 9월 3일, GPT-6 Astra를 발표했습니다.
둘 다 단순한 “질문에 답하는 AI”가 아닙니다.
코드를 작성하고, 자료를 읽고, 도구를 사용하며, 장시간의 일을 자율적으로 수행한다. AI가 “답변하는 존재”에서 업무를 맡는 존재로 변화하고 있음을 상징하는 2가지 모델이다.
그러면 Fable 5.1과 Astra는 결국 어느 쪽이 더 강할까요?
먼저 결론을 말씀드리자면, 순수한 총지능에서는 거의 동등하지만, 각자 잘하는 업무의 방향성은 상당히 다릅니다.
아스트라는 “실제로 PC를 조작하고 일을 끝까지 완수하는 능력을 의미한다.”
페이블 5.1은 “깊이 생각하고 장시간에 걸쳐 복잡한 문제를 쫓는 능력”을 의미합니다.
이러한 차이를 이해하면 2026년 말의 AI 선택이 훨씬 명확해질 것입니다.
가장 먼저 잡고 싶다. 성능은 정말 거의 균형이다.
AI 모델 비교에서 어려운 점은 OpenAI와 Anthropic이 각각 다른 조건에서 벤치마크를 공개하고 있기 때문입니다.
제3자 평가기관인 Artificial Analysis가 제시한 동일 조건에서의 비교입니다.
최고 설정들을 비교한 지능 지수에서는,
GPT-6 아스트라: 53 클로드 페이블 5.1: 53
결국, 완전히 무승부입니다.
따라서 “아스트라가 페이블을 완전히 능가했다” 또는 “페이블이 아스트라보다 명확하게 현명하다”라고 단정적으로 말할 수 있는 상황은 아닙니다.
더 중요한 것은 그 내용입니다.
페이블 5.1은 과학 코드를 해독하는 SciCode에서 63%, 아스트라는 56%를 기록했다. Humanity's Last Exam에서도 페이블 5.1은 59%, 아스트라는 55%였다.
한편, 업무 자동화인 AutomationBench-AA에서는 Astra가 68%, Fable이 59%이며, Terminal-Bench v4.0에서도 Astra가 59%, Fable이 52%입니다.
이 숫자 하나만으로도 양측의 성격이 드러나는 것을 알 수 있습니다.
생각하는 전설, 움직이는 아스트라.
물론 실제로는 둘 다 고려하며 움직일 수 있지만, 강점의 중심이 약간 다르다는 의미입니다.
파벨 5.1의 강점은 “장시간 사유할 수 있는 능력”입니다.
Anthropic는 Fable 5.1을 일반 제공하는 Claude 중에서 가장 고성능 모델로 평가하고 있습니다.
특히 중점을 두고 있는 것이 수 시간에서 수일에 걸쳐 진행되는 장기 과제입니다.
페이블 5.1은 계획을 세우고, 필요한 도구를 사용하며, 실패 시에는 다시 수정하고, 작업 중인 상황을 보고하면서 진행을 계속할 수 있도록 설계되어 있습니다.
대규모 코드베이스 전체에 걸친 기능 추가, 코드 리뷰, 성능 개선, 복잡한 문제 해결 등이 바로 저의 전문 분야입니다.
더욱 돋보이는 점은 1만 토큰의 컨텍스트 윈도우입니다.
대규모 프로젝트나 방대한 문서와의 호환성이 매우 좋다.
PDF 내의 그림, 차트, 표 등을 이해하는 능력도 강화되어 있으며, 금융, 법률, 분석, 설계와 같은 “문서 기반의 업무”에서도 강점을 보입니다.
또한 Fable 5.1은 단순하게 오래 플레이할 수 있는 게임이 아닙니다.
앤서니(Anthropic)가 소개하는 기업 사례에서는 수년간 원인 파악이 어려웠던 극히 드문 장애 원인을 특정하는 사례나, 수일 동안 걸쳐 복잡한 프로토타입을 자율적으로 구축한 사례도 보고되고 있습니다.
즉, Fable 5.1은
어려운 문제를 제시하고, 차분하게 풀어보게 한다.
이 사용법에 상당히 적합합니다.
아스트라의 강점은 “PC상에서 이루어지는 업무를 전면적으로 실행하는 것”입니다.
상대되는 GPT-6 Astra는 OpenAI가 “가장 강력한 모델”이라고 평가하는 차세대 모델입니다.
특히 크게 발전한 것이 컴퓨터 사용입니다.
브라우저를 사용한다.
폼에 입력한다.
CRM을 업데이트한다.
데이터를 조사한다.
소프트웨어를 설치한다.
웹사이트를 제작하고 화면을 확인하여 QA를 진행한다.
아스트라는 이러한 다중 앱 간 횡단 작업을 일련의 흐름으로 처리하는 방향으로 크게 진화하고 있습니다.
OpenAI는 9월 9일에 공개한 업무용 설명 자료에서 Astra는 이미 ChatGPT Work, Codex, API에서 사용되고 있으며, API가 존재하지 않는 앱을 포함하여 인간과 동일한 화면에서 작업할 수 있다는 점이 큰 특징으로 소개되었습니다.
이 부분이 Fable 5.1과의 최대 차이점입니다.
파벨 5.1이 “탁월한 연구자 및 엔지니어”라고 한다면, 아스트라는 그곳에서 PC를 직접 조작하는 실무 담당자의 능력까지 통합한 이미지와 유사하다.
단순히 자료를 만드는 것뿐만 아니라, 기존 템플릿에 맞춰 PowerPoint, 스프레드시트, 문서 등을 완성된 형태에 가까운 상태로까지 마무리하는 능력을 강화합니다.
AI 에이전트로서 업무를 전적으로 위탁하고 싶어하는 사람들에게 있어서 Astra의 방향성은 상당히 중요합니다.
코딩 시 아스트라가 약간 우세합니다.
OpenAI가 공개한 터미널 벤치 4.0에서는
아스트라: 57.9%, 페이블 5.1: 55.8%
되었습니다.
딥SWE v1.1에서도 아스트라는 74.1%, 페이블 5.1은 67.4%였습니다.
하지만 여기서 “Astra의 압승”이라는 표현을 단정 짓는 것은 지나치게 빠를 것입니다.
제3자 평가에서는 Fable 5.1이 SciCode나 지식 노동 관련 작업에서 Astra를 상회하는 항목도 있었고, Fable 5.1은 Claude Code와의 조합으로 매우 강력한 성능을 가지고 있습니다.
그러므로 실무에서는,
코드를 작성하는 동안 PC 조작, 테스트, 주변 작업을 원활하게 처리하고 싶다 → Astra
복잡한 코드베이스를 깊이 이해시키고, 어려운 설계나 원인 분석을 맡기고 싶다면 Fable 5.1
이런 선택 방식이 현실적입니다.
요금은 생각보다 똑같습니다.
API 요금도 흥미로운 결과가 나오고 있습니다.
표준 요금은 양측 모두에게 해당합니다.
100만 토큰당 50달러
입니다.
즉, 단순한 토큰 단가만으로는 차이가 없습니다.
하지만 실제 “한 건의 업무를 완료하는 데 드는 비용”은 달라요.
인공 분석(Artificial Analysis)의 비교에서는 최고 성능 설정에서는 Fable 5.1이 약간 저렴한 반면, Astra는 낮은 추론 설정까지 포함하면 상당히 저렴한 비용으로 작업을 처리할 수 있는 구성도 제공됩니다.
Anthropic 측도 Fable 5.1에서 캐시 읽기 요금을 대폭 낮추면서 장시간 에이전트 처리를 이전보다 저렴하게 하는 방향으로 나아가고 있습니다.
여기서 보이는 것은 모델 경쟁이 최고 성능뿐만 아니라, 한 건의 일을 얼마에 끝낼 수 있는가라는 승부로 옮아간다는 것입니다.
가장 중요한 것은 “지능”보다 “업무 설계 방식”이다.
파벨 5.1과 아스트라를 비교해 보면 2026년의 인공지능 경쟁이 이전과는 다른 단계에 접어들었다는 것을 알 수 있습니다.
이전에는,
어느 모델의 답변이 더 현명한가
그 중심에는 있었습니다.
하지만 현재는,
누가 가장 오래 걸리는 일을 끝까지 완수할 수 있을까
누가 도구를 제대로 사용할 수 있을까요?
중간에 실패하더라도 복구 가능성을 확인하는지
인간의 지시 범위를 준수하며 행동할 수 있는가
그것이 중요해지고 있습니다.
즉, 비교 대상은 더 이상 챗봇이 아닙니다.
AI 워커 간 비교입니다.
파이블 5.1은 장시간 사색, 연구, 코드 이해, 복잡한 지식 노동에 매우 강하다.
아스트라는 그곳에 컴퓨터 사용, 브라우저 작동, 자료 작성, 앱 교차, 자동 실행을 통합하며 “업무를 끝낼 AI”에 강력하게 집중하고 있습니다.
결국 무엇을 선택해야 할까요
현재 저의 정리 방식은 다음과 같습니다.
파벨 5.1을 선택하고 싶으신 분들께 드립니다.
어려운 코드를 작성하고 있습니다.
거대한 코드베이스를 분석한다.
연구와 분석을 심층적으로 수행한다.
대량의 자료를 읽어보십시오.
장시간 자율 작업을 수행한다.
이러한 용도라면, Fable 5.1은 여전히 가장 강력한 후보입니다.
아스트라를 선택하고 싶다면
코덱스를 사용한다.
PC 작동까지는 AI에 맡기고 싶다.
브라우저와 여러 앱을 교차하여 사용하고 싶습니다.
데이터, 표 계산, 프레젠테이션까지 모두 완수하고 싶다.
조사부터 실행까지 일관성 있게 맡기고 싶다.
이 용도에서는 Astra가 한 단계 더 앞서 나갈 수 있습니다.
최강 인공지능은 더 이상 하나로 존재하지 않는다.
파벨 5.1과 아스트라의 최고 설정은 제3자 종합 지능 평가에서 동점입니다.
그래도 사용성은 완전히 동일하지는 않습니다.
페이불 5.1은 깊이 생각하는 능력을 극한까지 끌어올린 AI이다.
아스트라는 생각 능력과 실행 능력을 통합한 AI입니다.
이 차이는 결코 작지 않습니다.
개인적으로 2026년 9월 시점에서 단 한 가지로만 선택한다면, 일반적인 지능 비교가 아닌, 앞으로 AI 에이전트가 PC 상의 업무를 그 자체로 담당해나가는 흐름을 중시한다면 A스트라를 종합 1위로 평가하겠습니다.
그러나 연구, 복잡한 추론, 대규모 코드 분석 등에서는 Fable 5.1을 선택하는 경우가 충분히 있습니다.
또한, 이 두 모델의 등장으로 나타난 가장 큰 변화는 다른 부분에 있습니다.
AI 경쟁은 ‘가장 현명한 모델이 どれか’라는 시대에서,
누구에게, 어느 정도까지 업무를 위임할 수 있을까요
우리는 경쟁의 시대를 넘어 새로운 시대로 이동하고 있습니다.
파벨 5.1과 아스트라의 진정한 승부는 벤치마크가 아닌, 앞으로 우리들의 업무를 어디까지 대체할 수 있는가에 따라 결정될 것으로 보입니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 65청크
원문 보기 | 출처: note.com