2026년 9월 3일, OpenAI가 신 모델 “GPT-6 Astra”를 발표했습니다. 회사의 대표인 그렉 블록만 씨가 “이는 이제 AGI(인공 일반 지능) 시대에 들어섰다고 해도 이상하지 않다”고 한 말 또한 화제가 되고 있습니다. 상당히 과감하게 공개한 모델이므로, 오늘은 발표의 분위기에 너무 휘둘리지 않고, 내용의 숫자들을 차분하게 정리해 보겠습니다.
지금까지 제가 활용해 온 강점은 상당한 전문성을 지니고 있습니다.
OpenAI는 컴퓨터 작동, 브라우징, 소프트웨어 엔지니어링, 사이버 보안, 과학 분야를 비롯한 다양한 영역에서 최고 수준의 성능을 강조하고 있습니다. 특히 벤치마크의 성장세가 두드러지는데, 수학 문제집 FrontierMath의 Tier4에서 98%前後, 추상 추론을 측정하는 ARC-AGI-3에서 99.9%前後, 보안 관련 ExploitBench에서는 100%라는 “거의 천장에 부착된” 수준의 점수를 기록하고 있습니다. 스프레드시트 입력이나 웹사이트의 0부터 시작하는 제작 등 컴퓨터 작동을 에이전트로서 자율적으로 수행하는 능력도 강화되었습니다.
확장성은 제한적이며, 가격은 Fable 5.1과 거의 동일 수준입니다.
시작은 단계적으로 이루어지며, 우선 사이버 보안 관련 프로그램에 참여하고 있는 기업부터 먼저 제공될 예정입니다. 일반 사용자를 위해서는 ChatGPT의 Plus, Pro, Business, Enterprise 등 각 플랜 외에도 API를 통해 또는 AWS를 통해 사용할 수 있게 될 예정입니다. API 가격은 입력 100만 토큰당 10달러, 출력이 동 50달러이며, 캐시된 입력은 1달러로 설정됩니다. 실제로 이 가격은 동시 발표된 Anthropic의 Claude Fable 5.1과 거의 유사하며, 가격 면에서 ‘수평적’ 경향이 강하게 나타나고 있습니다. 특히 27만 2천 토큰을 초과하는 긴 입력의 경우, 해당 횟수의 전체 요청에 대해 단가가 입력과 캐시 2배, 출력이 1.5배로 조정되는 기능도 마련되어 있으며, 긴 문장 처리를 많이 사용하는 경우에는 주의가 필요합니다.
AGI 시대 선언과 교차 지표에서의 순위는 동일하지 않다.
여기 주목해야 할 점은 AI 교차 비교 사이트인 인공 분석(Artificial Analysis)의 Intelligence Index라는 지표입니다. GPT-6 Astra는 여기서 61점을 기록했으며, 이는 이 지표의 중앙값(36점)보다 훨씬 높은 수준입니다. 하지만 동시에 발표된 경쟁 모델들 중에는 이 지표에서 66점을 기록하는 모델도 있었기에, 단일 지표만으로는 Astra가 전반적으로 최상위라는 결론을 내리기는 어렵습니다. 즉, FrontierMath나 ARC-AGI-3처럼 특정 분야에서 최고점을 달성하는 것과, 광범위한 작업을 횡단한 종합적인 능력으로 1위를 차지하는 것이 반드시 같은 의미는 아니라는 것입니다. “AGI 시대의 도래”라는 표현이 먼저 언급되는 발표인 만큼, 어떤 지표의 어떤 부분이 두드러지는지 나눠서 살펴보는 것이 의미가 있습니다.
이번 주말에 츠키시마 료의 ‘나를 껴안아줘’를 읽고, 츠키시마 료의 다른 작품들을 탐독하는 것을 고려해 보았습니다. 츠키시마 료의 작품은 독특한 분위기와 섬세한 감정 묘사가 돋보이며, 특히 그의 문체는 독자에게 깊은 인상을 남깁니다. 앞으로도 츠키시마 료의 작품을 꾸준히 읽어보고 싶습니다.
GPT-6 Astra는 특정 난관 벤치마크에서 천장과 거의 같은 점수를 기록하며, 경영진 스스로 ‘AGI’라는 용어를까지 사용하며 상당히 인상적인 모델입니다. 반면, 횡단적인 종합 지표에서는 반드시 독주를 보이지 못하며, 가격 또한 경쟁사와 거의 동수준에 머물러 있습니다. 화려한 홍보성 뉴스와 같은 것들만큼, 어떤 숫자가 실제로 향상되었는지, 또 어떤 숫자가 ‘홍보용 수치’인지 분별하는 습관을 갖는 것이 중요합니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 8청크
원문 보기 | 출처: note.com