# GPT-6 Astra가 AI 코딩 성능에서 최고 수준인 67점, 압도적인 토큰 효율을 보였으나 Fable 5.1에는 미치지 못함

> https://bookfactory.kr/c/news/10930
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-07T11:48:20.332Z

---

AI 모델의 성능을 독자적으로 평가하고 있는 Artificial Analysis가 OpenAI의 'GPT-6 Astra' 벤치마크 결과를 공개했습니다. 코딩 에이전트로서의 성능을 측정하는 'Artificial Analysis Coding Agent Index'에서 GPT-6 Astra는 67점을 기록하며 Claude Opus 5나 Fable 5, Muse Spark 1.3과 거의 동등한 수준에 도달한 반면, 1위인 Fable 5.1이 기록한 70점에는 미치지 못했습니다.Benchmarking GPT-6 Astra | Artificial Analysishttps://artificialanalysis.ai/articles/benchmarking-gpt-6-astra

GPT-6 Astra makes significant gains in the Artificial Analysis Coding Agent Index, scoring equal to Fable 5 at lower cost. In the Intelligence Index, it uses fewer tokens than GPT-5.6 Sol for similar performance, but this is outweighed by higher pricesPricing is 2.5x GPT-5.6…pic.twitter.com/BE5uEXl5Y6

Artificial Analysis는 2026년 9월 3일, GPT-6 Astra에 대해 코딩 에이전트로서의 능력을 평가하는 Artificial Analysis Coding Agent Index와 광범위한 지적 능력을 평가하는 Artificial Analysis Intelligence Index 결과를 공개했습니다. 두 지수에서는 GPT-6 Astra에 대해 서로 다른 경향이 확인되었으며, 코딩에서는 높은 비용 효율을 보인 반면, 종합적인 지적 능력 평가에서는 높은 요금이 비용 효율을 악화시키고 있습니다. Artificial Analysis Coding Agent Index에서는 Codex 상에서 구동한 GPT-6 Astra가 67점을 획득했습니다. 이는 67점인 Fable 5와 동점이며, 68점인 Claude Opus 5나 64점인 Muse Spark 1.3과도 비슷한 수준입니다. 반면, Claude Code 상에서 구동하는 Fable 5.1은 70점을 기록하며 1위를 차지했습니다.

GPT-6 Astra에서 특히 크게 개선된 것은 토큰 효율입니다. 최대 추론 강도로 Codex를 사용한 경우, GPT-6 Astra가 소비하는 토큰 수는 GPT-5.6 Sol의 약 3분의 1, Claude Opus 5의 약 7분의 1이었습니다. Artificial Analysis는 GPT-6 Astra에 대해 GPT-5.6 Sol과 비교해 토큰 사용량이 약 70% 감소했다고 평가했습니다.

이 높은 토큰 효율성은 작업당 비용에도 반영되어 있습니다. 최대 추론 시 GPT-6 Astra는 GPT-5.6 Sol과 거의 동일한 작업당 비용이면서도, Coding Agent Index에서는 GPT-5.6 Sol을 2포인트 상회했습니다. 또한 Fable 5와 같은 67점을 기록하면서도 1개 작업당 비용은 Fable 5의 절반 미만입니다. 토큰 단가에만 주목하면 GPT-6 Astra보다 Gemini 3.8 Flash가 더 저렴하지만, 작업당 비용에서는 GPT-6 Astra가 더 저비용인 점도 특징입니다.

이 때문에 GPT-6 Astra는 Coding Agent Index 점수와 작업당 비용을 비교했을 때의 '파레토 프론티어'에 위치해 있습니다. 즉, GPT-6 Astra는 동등한 비용의 모델 중 가장 점수가 높고, 동등한 점수의 모델 중 가장 비용이 낮아 비용 효율성이 뛰어난 모델인 셈입니다. 한편, Artificial Analysis Intelligence Index에서 GPT-6 Astra의 평가점은 약간 다릅니다. GPT-6 Astra는 61점으로 GPT-5.6 Sol 및 Muse Spark 1.3과 동점을 이루었으며, 66점인 Fable 5.1을 5포인트 하회했습니다.

Intelligence Index에서도 GPT-6 Astra의 토큰 효율 자체는 개선되어, 최대 추론 시의 출력 토큰 수는 GPT-5.6 Sol보다 약 10% 적어졌습니다.

하지만 GPT-6 Astra의 API 요금은 입력 100만 토큰당 10달러(약 1,500엔), 출력 100만 토큰당 50달러(약 7,500엔)로, GPT-5.6 Sol의 입력 4달러(약 600엔), 출력 20달러(약 3,000엔)에서 2.5배 인상되었습니다. 그 결과, 최대 추론 시의 1개 작업당 비용은 GPT-5.6 Sol보다 75% 높아졌습니다.

그 외의 평가에서는 모델의 지식과 할루시네이션을 평가하는 'AA-Omniscience'에서 최대 추론 시의 할루시네이션 비율이 GPT-5.6 Sol의 92%에서 GPT-6 Astra에서는 51%까지 감소했습니다. 동시에 정답률도 4포인트 상승했으며, 단지 답변을 자제함으로써 할루시네이션을 줄인 것은 아니라고 Artificial Analysis는 설명합니다.

장기간에 걸친 복잡한 지식 작업을 평가하는 'AA-Briefcase'에서 GPT-6 Astra는 GPT-5.6 Sol 대비 약 80 Elo 포인트 개선되었습니다. 반면 44개 직종에 걸친 경제적 가치가 있는 작업을 평가하는 'GDPval-AA v2'에서는 약 80 Elo 포인트 하락했습니다.

이 외에도 은행의 고객 지원을 다루는 τ3-Banking, 과학 분야의 Python 문제를 다루는 SciCode, 대량의 문서를 대상으로 하는 긴 문맥 추론의 AA-LCR에서도 GPT-6 Astra는 GPT-5.6 Sol 대비 2~3포인트 정도 하락했습니다.

Artificial Analysis의 결과를 보면, GPT-6 Astra는 모든 능력에서 이전 세대를 크게 상회한 모델이라기보다는, 특히 코딩 에이전트로서의 토큰 효율을 크게 끌어올린 모델이라고 할 수 있습니다. Coding Agent Index에서는 최상위 수준의 성능을 낮은 태스크당 비용으로 실현한 반면, Intelligence Index에서는 GPT-5.6 Sol과 같은 61점에 머물렀으며, 2.5배가 된 토큰 단가로 인해 토큰 효율 향상의 이점이 상쇄되고 있습니다.

[원문 보기](https://gigazine.net/news/20260907-artificial-analysis-gpt-6-astra/) | 출처: Gigazine