2026년 9월 3일(현지 시간), OpenAI가 신세대 모델 “GPT-6 Astra(아스트라)”를 발표했습니다. 모델 자체도 매우 강력하며, 코딩, 과학, 컴퓨터 운영, 브라우징 등 다양한 분야에서 최첨단 성능을 보이고 있습니다.
이번에는 이 한 가지 특징만으로 GPT-6 Astra의 특징을 파악해 보도록 하겠습니다.
그 징표는 ARC-AGI-3에서 발생한 “62.7% → 99.9% 현상”입니다.
같은 GPT-6 Astra인데, 표준 Harness에서는 최고 62.7%였습니다. Provider Adapter Harness에서는 최고 99.9%까지 상승했습니다. 또한, 모델을 다른 더 큰 Astra로 교체한 것은 아닙니다.
변화된 것은 A스트라를 둘러싼 “시스템”입니다.
여기서 우리가 볼 수 있는 것은 AI 경쟁이 단순히 ‘어떤 모델이 가장 똑똑한가’라는 모델 전쟁에만 국한되지 않고, 모델을 어떻게 움직이고, 문맥을 어떻게 유지하며, 어떻게 작업을 지속적으로 수행할 수 있는가에 대한 AI 시스템 경쟁으로 확장되고 있다는 점입니다. 더 나아가, AI 워크플로우의 상류 경쟁도 포함됩니다.
(본문 청크 7/177 텍스트를 제공해주세요.)
좋아요! 채널 구독과 공감해 주시면 감사하겠습니다.
얼마 전 독서 모임에서 『너, 별처럼』을 읽어 완결했습니다.
이 소설은 히노 아이의 데뷔작으로, 2018년에 출간되었습니다.
이야기는 주인공인 ‘나’가 돌아가신 연인 ‘그’의 기억과 마주하며 자신의 삶을 살아가는 모습을 그리고 있습니다.
그와의 추억을 되짚어가는 과정에서, 저는 다양한 감정을 느끼고 저 자신에 대한 존재 의미에 대해 깊이 생각하게 되었습니다.
특히 기억에 남았던 것은 그와의 마지막 대화였습니다.
‘나’는 그에게 ‘고맙습니다’라는 마음을 담아 그가 사랑했던 꽃인 ‘스미레’를 선물했습니다.
스미레는 그와의 추억을 상징하는 꽃이며, 저에게는 소중한 존재입니다.
이 소설을 통해 저는 사랑이란 무엇인지, 그리고 인생이란 무엇인지 다시 한번 생각하게 되었습니다.
또한, 이 소설은 독자의 마음속에 깊이 남는 보편적인 주제를 다루고 있다고 생각합니다.
특히, 상실감이나 후회와 같은 감정은 많은 사람들이 공감할 수 있을 것입니다.
이 소설을 읽고 저는 제 인생을 더욱 소중히 살아가고 싶다는 생각이 들었습니다.
이 소설은 저에게 잊을 수 없는 작품이 될 것입니다.
이 소설을 읽고 저는 저 자신에 대한 삶을 더욱 풍요롭게 살아가고 싶다는 생각이 들었습니다.
- 이 동영상에서는 제가 실제로 사용해 본 추천 앱을 소개합니다.
가장 먼저, 제가 사용하는 앱은 “노션”입니다.
노션은 메모, 작업 관리, 데이터베이스 등 다양한 기능을 갖춘 다재다능한 앱입니다.
특히, 노션을 사용하게 된 계기는 “어토믹 습즈”라는 책을 읽고からです.
이 책 안에서 습관을 형성하는 구체적인 방법이 소개되어 있었고, 그것을 노션을 사용하여 관리해 보기로 생각했습니다.
노션 사용법은 처음에는 조금 당황스러울 수 있지만, 익숙해지면 매우 편리하고, 자신의 페이스대로 커스터마이징할 수 있다는 점이 매력적입니다.
예를 들어, 저는 노션을 사용하여 독서 노트, 작업 목록, 프로젝트 관리 등 다양한 정보를 한 곳에서 관리하고 있습니다.
노션의 기본적인 사용법에 대해서는 노션 공식 홈페이지에서 자세히 설명하고 있습니다.
[노션 공식 홈페이지](https://www.notion.so/)
꼭 노션을 사용해 보시기 바랍니다. 분명 여러분의 생산성을 향상시키는 데 도움이 될 것입니다.
- ARC-AGI-3는 기존 ARC와는 상당히 다르다.
- 아스트라는 62.7%에서 99.9%로 상승했습니다.
- 더 깊이 생각하는 것보다 생각한 것을 잃지 않는 것이 더 중요합니다.
- 이는 “사고의 자산화”인지 아닌지 판단할 수 없다.
- 단순한 모델뿐 아니라 “시스템 아키텍처” 자체가 역량이다.
- 그리고, 좀 더 크게 보면 “워크플로우 전쟁”이 있습니다.
- OpenAI는 “지능 대결”에서 물러났을까
- 초심자에게도 도움이 되고, 숙련자에게는 더욱 큰 이점을 가져다줍니다.
- 요약: AI는 “심층적으로 사고한다”는 개념에서 “단계적으로 쌓아 올려 사고한다”는 개념으로 진화하고 있다.
ARC-AGI-3는 기존 ARC와는 상당히 다르다.
먼저 ARC-AGI-3가 무엇인지 간략하게 설명드리겠습니다.
ARC-AGI-1이나 ARC-AGI-2는 기본적으로 정적인 퍼즐입니다. 몇 가지 입력과 출력 예시를 보여주고, “이 세계에 어떤 규칙이 있는가?”를 추론하여 새로운 문제에 답합니다.
한편, 2026년에 등장한 ARC-AGI-3는 상호작용이 가능합니다.
AI는 미지의 환경에 배치되어,
관찰하는 → 추론하는 → 행동하는 → 세계가 변화하고 → 다시 관찰하며 → 가설을 수정하고 → 다시 행동한다.
이 점을 다시 한번 말씀드립니다.
즉, 단순히 한 번의 문제를 한 번에 풀어내는 능력만을 보는 것이 아닙니다. “이 버튼은 무엇을 하는가?”, “이 물체를 움직이면 무엇이 일어나는가?”, “목표는 무엇인가?”와 같은 것들을 스스로 탐구하면서 이해해 나갈 필요가 있습니다.
ARC Prize 자체 역시, ARC-AGI-3를 미지의 추상적인 턴 기반 환경에서 에이전트 지능을 연구하는 벤치마크로 정의하고 있습니다.
이 부분은 중요합니다.
질문과 답변 방식으로는 그 순간의 모델 추론 능력이 상당히 중요해집니다. 하지만 100회, 200회처럼 행동을 반복한다면, 그 사이에 무엇을 시도했는지, 무엇이 실패했는지, 어떤 가설을 세웠는지 잊지 않도록 하는 것이 중요합니다.
결국 “순간의 지혜”뿐만 아니라 시간을 초월하여 지혜를 유지할 수 있는지가 시험대에 오르는 것입니다.
아스트라는 62.7%에서 99.9%로 상승했습니다.
ARC Prize는 Astra를 2가지 조건으로 평가합니다.
하나로는 Standard Harness입니다.こちらは벤더 중립적인 조건으로, 모델이 자신이 중요하다고 생각한 정보를 Visible Notes로 옮겨갈 수 있습니다.
이 조건에서 아스트라의 최고 점수는 62.7%였습니다.
걸로만 해도 꽤 강합니다.
그러나 OpenAI 측에서 준비한 문맥 관리 기구인 Provider Adapter Harness를 이용했을 경우, 정확도가 최고 99.9%까지 상승했습니다.
여기서 저는 처음으로 “해즈가 정말이지 엄청 강한가”라고 생각했습니다.
하지만 자세히 살펴보면 조금 다릅니다.
중요한 것은 Harness 자체라기보다는 Stateful한 컨텍스트를 유지하는 것입니다.
Provider Adapter에서는 Astra의 불투명한 추론 상태, 즉 외부에서 직접적으로 보지 못하는 추론 상태를 요청 간에 유지할 수 있습니다. 또한 대화나 작업 기록이 길어질 경우에는 Compaction을 사용하여 이전 작업을 다음 추론에서 재사용할 수 있도록 합니다. ARC Prize 자체도 이 기능을 명시하고 있습니다.
단순히 A스트라가 갑자기 더 똑똑한 모델로 교체된 것은 아닙니다.
이전부터 생각했던 것들을 잊지 않게 되었다.
이곳이 매우 크네요.
더 생각하는 것보다 생각한 것을 잃지 않는 것이 더 중요합니다.
이 결과를 더욱 흥미롭게 만드는 것은 리이선닝 에포트별 점수입니다.
스탠다드 해머스에서
- 맥스: 62.7%
- XHigh:59.3%
- 높이: 54.8%
- 미디엄: 38.6%
- 낮음: 17.5%
- None:35.2%
되어지고 있습니다.
Provider 어댑터에서는
- 맥스: 98.6%
- XHigh:98.4%
- 높음: 99.9%
- 중간: 98.4%
- Low:98.0%
- None:96.7%
です。
정말 충격적입니다.
물론 “Reasoning이 더 이상 필요 없다는” 주장은 아닙니다. 하지만 최소한 ARC-AGI-3에서는, 매번 매우 깊이 생각하게 하는 것 이상으로, 기존 추론 결과를 다음 맥락으로 정확하게 이어가는 것이 매우 큰 힘을 가지고 있음을 알 수 있습니다.
예컨대 한 번,
액션3은 벽을 움직인다. 노란 물체가 있을 경우 방향이 반전된다. 가설 A는 이미 실패했다. 다음은 가설 B를 시도한다.
그러한 상황까지 파악되었다고 가정합니다.
이를 잊었다면, 다음 턴에서 다시 “액션 3은 무엇이었더라?”부터 생각해야 합니다.
그러나 국가 체제로 남게 된다면, 그곳에서는 더 이상 고민할 필요가 없습니다. 다음 미지의 부분에 대해서만 추론 능력을 활용할 수 있습니다.
그러므로, 추론을 줄이는 것보다 재추론을 줄이는 방식으로 이해하기 쉽습니다.
실제로는 Provider 어댑터가 양 Harness 모두에서 해독 가능한 167가지 조건에서, 총 토큰을 약 49% 감소시키면서 기록된 시간을 약 3.66배 단축했습니다. 성능 향상을 위해 오히려 과도한 계산을 요구하지 않았습니다.
이는 “사고의 자산화”일까
저는 여기가 아스트라의 매우 흥미로운 곳이라고 생각합니다.
기존의 CoT(Chain of Thought)는, 간략히 말하면,
심층적으로 생각하다 → 답변
입니다.
그러나 이번과 같은 시스템으로는
이유 1 → 상태 1 → 행동 → 새로운 관찰 → 이유 2 → 상태 2 → 축적 → 핵심 상태 → 이유 3
이런 흐름으로 진행될 것 같습니다.
즉, 한 번의 CoT를 단순히 길게 늘리는 것과는 다릅니다.
CoT 자체를 시간 방향으로 연결하여 그 결과를 State로 남기고, 길어지면 압축하여 다음 CoT로 전달합니다.
이것을 의도적으로 이름을 붙이려고 한다면
상태 기반 필수 프롬프트 체인
그냥 불러주고 싶은 정도입니다.
핵심은 “생각하는 것”에서 “생각한 것을 자산으로 남기는 것”으로의 변화입니다.
한순간에 엄청나게 현명한 AI보다, 어제 생각했던 것, 10분 전에 실패했던 것, 지금 어디까지 진행되고 있는지를 잃지 않는 AI가 장기적인 업무에서는 더 강하다.
사람도 똑같습니다.
얼마나 똑똑한 사람이어도 어제 했던 일을 전부 잊고 매일 아침 처음부터 시작한다면 큰 연구나 프로젝트는 진행되지 않습니다.
모델뿐만 아니라 시스템 아키텍처 자체가 능력이다.
그러므로 저는 아스트라 이후의 AI를 볼 때,
AI 능력 = 모델 × 시스템 아키텍처
그렇게 생각하면 더 명확해지는 것 같습니다.
시스템 아키텍처를 좀 더 세분화한다면
지식 × 기억 × 로그 × 상태 × 맥락 관리 × 도구 × 제어 × 에이전트 아키텍처
그 외에도 있습니다.
지식은 AI가 활용할 수 있는 연구 자료, 내부 자료, 데이터베이스 등 모든 정보 자원을 의미합니다.
메모리는 장기적으로 보관된 사용자 정보와 과거 연구 지식입니다.
로그는 AI가 실제로 무엇을 했는지에 대한 생생한 기록입니다.
국가는 “지금까지 얼마나 진전되었는지”라는 현재 위치를 의미한다.
컨텍스트 관리는 방대한 정보 속에서 “지금 이 추론에 무엇을 보여줄지”를 선택하고, 필요하다면 압축하는 기능입니다.
도구는 웹, 파이썬, 컴퓨터, MCP 등을 활용합니다.
Harness는 이를 연결하여 실행 루프를 회전시키는 메커니즘입니다.
에이전트 아키텍처는 라우터, 서브에이전트, 검증 에이전트 등의 역할을 수행합니다.
ARC-AGI-3의 99.9%가 이 모든 요소들의 효과를 입증한 것은 아닙니다. 특히 이번에 강렬하게 나타난 것은 상태 관리, 맥락 관리, 그리고 압축 기술이었습니다.
그러나 실제 AI 활용 시에는 사용자 고유의 지식, 기억력, 기술, 도구, 에이전트 구성까지 탑재할 수 있습니다.
즉, 동일한 Astra를 사용하더라도, 적용하는 시스템에 따라 전혀 다른 AI가 될 수 있다는 의미입니다.
더욱 확대해서 보면 “워크플로우 전쟁”이 드러나네.
이 정도까지 오면 저는 단순히 “AI 시스템 아키텍처 전쟁”이라고 부르기보다는 훨씬 더 크고 중요한 AI 워크플로우 전쟁이라고 보는 것이 더 흥미롭다고 생각합니다.
그 징후는 아스트라만이 아닙니다.
클로드 페이블 5.1도 터미널 벤치 사이언스에서 큰 폭의 성장을 보였습니다.
터미널-벤치 사이언스는 과학 문제에 답하는 것 이상의 벤치입니다. 코드를 작성하고, 터미널을 사용하며, 데이터를 분석하고, 시뮬레이션을 실행하며, 모델을 피팅하는 등 과학 연구의 워크플로우 전체를 AI 에이전트에게 실행하도록 합니다.
페이블 5.1은 52.6%, 솔은 22.4%였습니다. 약 2.3배 상승했습니다.
또한 아스트라는 64.6%까지 상승했습니다.
한편, 인공 분석의 종합 지능 지수(Intelligence Index)를 살펴보면, Astra는 61로, Fable 5.1의 66을 밑돌고 있습니다. 즉, “모델 단일체의 종합적인 현명함”으로 Astra가 압도적으로 우세하다는 의미는 아닙니다.
이 부분이 매우 흥미롭습니다.
단순한 지혜 종합 지수에서는 Fable 5.1이 상위입니다.
하지만,
터미널을 사용하는 과학 워크플로우를 실행하고 미지의 환경을 탐색하며 상태를 유지하는 긴 작업을 지속합니다.
그러한 방향으로 진행될수록 아스트라가 갑자기 강해지기 시작한다.
이것을
모델 IQ가 아닌 워크플로우 IQ가 향상되고 있습니다.
그리고 보면 이해하기 쉬울 거라 생각합니다.
OpenAI는 “지능 대결”에서 물러선 것일까
여기는 조금 더 신중하게 살펴보는 것이 좋겠습니다.
OpenAI는 Claude에 모델 자체의 지능에서는 뒤쳐진다는 식으로 단정짓기에는 충분한 근거가 없습니다. OpenAI 자체는 Astra를 가장 고성능 모델로 평가하고 있으며, FrontierMath나 GPQA와 같은 순수한 추론 영역에서도 매우 뛰어난 성적을 내고 있습니다.
단지 경쟁 축을 의도적으로 넓히고 있다고 느껴집니다.
더 이상 “한 문제 풀이에 몇 점”이라는 관점만이 존재하지 않습니다.
어떤 일을 얼마나 지속할 수 있을지, 도구를 어떻게 활용할지, 과거를 어떻게 보존할지, 실패에서 어떻게 회복할지, 여러 업무를 어떻게 조직화할지에 대한 다양한 질문들을 고민해야 합니다.
까지 포함하여 AI의 능력으로 경쟁한다.
이건 매우 합리적입니다.
왜냐하면 우리가 궁극적으로 원하는 것은 벤치마크에서 1점이라도 높은 AI가 아니라, 일을 끝까지 해 줄 수 있는 AI이기 때문입니다.
초심자에게는 도움이 되고, 숙련자에게는 더욱 큰 이점을 가져다 줄 것입니다.
그리고 이 흐름은 엔지니어들만의 이야기가 아닙니다.
OpenAI 측에서 State 관리나 Context 관리, Harness 등을 상당히 정비해 주었기 때문에 일반 사용자는 이러한 시스템을 스스로 처음부터 만들어 보지 않아도 고도화된 에이전트 경험을 이용할 수 있습니다.
즉, 초보자에게는 고도화된 AI 시스템의 민주화입니다.
반면에 상위 레벨의 참가자들은 자신의 지식, 기억, 기술, 도구, 라우터, 서브 에이전트 등을 조합하여 활용할 수 있습니다.
그러고 보면
아스트라 × OpenAI 시스템 아키텍처 × 사용자 고유 시스템 아키텍처
이 구조로 진행됩니다.
여기서는 동일한 Astra를 사용하고 있는 사람들 간에도 결과가 다를 수 있습니다.
모델 선택뿐만 아니라
저는 AI에게 어떤 환경을 제공하고 있는 걸까요.
점점 더 중요해지고 있습니다.
요약: AI는 “심층적인 사고”에서 “단계적으로 쌓아 올린 사고”로 발전하고 있다.
GPT-6 Astra의 ARC-AGI-3 “62.7% → 99.9% 현상”을 보면서 저는 단순히 “Astra가 99.9%니까 굉장하다”라는 이야기만으로는 조금 아쉽다고 생각합니다.
더 중요한 것은,
왜 99.9%가 되었는가?
저기 있습니다.
아스트라는 추론을 매번 사용 후 버리지 않고 State로 보존하며, 길어진 문맥을 정리하고 압축하여 다음 추론 단계로 전달한다.
이를 통해 추론 노력을 크게 늘리지 않아도 매우 높은 성능을 유지할 수 있었다.
이는 2023년 11월 16일 목요일 note 게시물입니다.
한 번에 깊이 생각하는 AI
이제,
생각을 잃지 않고 압축하고 쌓아 올리며 사고하는 AI
변화가 일어날 것으로 예상됩니다.
그리고 더욱 확대해서 보면,
AI 모델 전쟁, AI 시스템 아키텍처 전쟁, AI 워크플로우 전쟁
경쟁의 축이 더욱 확대되고 있다.
GPT-6 Astra에서 진정으로 주목해야 할 점은 모델 자체의 지혜뿐만이 아닙니다.
AI는 더욱 현명하게 작동할 수 있도록 모델의 외관을 어떻게 설계해야 하는가?
그 답이 상당히 구체적인 모습으로 드러나기 시작했다.
저는 그 점이 이번 Astra에서 가장 중요한 포인트라고 생각합니다.
이 기획은 제가 지금까지 쓴 소설이나 에세이, 그리고 저 자신의 경험을 바탕으로 독자 여러분께 ‘자신만의 자리’를 찾도록 돕는 이야기를 만들고자 하는 데서 비롯되었습니다.
구체적으로 저의 저서 『별 그림자의 기억』과 『새벽의 나선』에 등장하는 캐릭터들을 참고하여 독자 여러분이 공감할 수 있는 다양한 인간 관계를 그려나가고 싶습니다.
또한 이 기획에서는 독자 여러분께 자신의 인생을 되돌아보고 가치관을 재고하는 계기가 될 수 있는 에세이, 인터뷰 등의 콘텐츠를 제공하고자 합니다.
더 나아가 이 기획을 통해 독자 여러분과 깊이 교류하고 함께 이야기를 만들어가는 관계를 구축해나가고 싶습니다.
원더·사토 모토히코(佐藤 宗彦)는 1977년생으로, 의학석사(MBBS) 및 AI 공생 혁신에서 주최한 바 있습니다. 의료 관련 연구소, 심리학 연구소 근무 후 독립하여 현재는 생성 AI(ChatGPT, Claude, Gemini 등)와 심신에 관한 연구를 하고 있습니다. 주요 저서로는 『간단 프롬프트』(게이슈 신신사), 『동양의학과 잠재 운동계』(다니구치 쇼테이)가 있으며, 2년간 전문 잡지에 연재 및 논문 집필 등의 집필 활동을 수행하면서 AI 공생 라이팅을 개발 중입니다. 심리학, 상담, 코칭을 AI에 기술을 활용하여 AI 공생 프롬프트 엔지니어링을 개발하고 있습니다. AI 스쿨, AI 기업 교육, AI 앱 개발 등을 진행합니다.
자, 오늘은 제가 최근에 읽은 책에 대해 이야기해 보려고 합니다.
제목은 『너, 별처럼』입니다. 나기오 유우 씨의 소설로, 2023년 7월 12일에 발매되었습니다.
이 책은 주인공인 “그”와 “그녀”의 애절하고도 아름다운 사랑을 그리고 있습니다.
“그”는 도쿄에서 일하는 청년이고, “그녀”는 고향의 바닷가 마을에서 살아가는 여성입니다.
두 사람은 어떤 계기로 만나 서로 끌어들입니다.
하지만 두 사람의 관계는 다양한 어려움에 직면합니다.
그리고, 결국 두 사람은 각자의 길을 걷기로 결의합니다.
이 책은 독서 후 감명 깊은 작품으로, 여러 번 다시 읽고 싶어집니다.
특히, 나기오 유우 씨의 문장은 섬세하고 아름다워서, 읽는 동안 마치 자신이 그 세계에 있는 것처럼 느껴집니다.
또한, 이 책은 현대 사회에서 나타나는 사랑의 방식에 대해 깊이 생각하게 하는 작품이기도 합니다.
저에게 이 책은 인생에서 소중한 한 권이 되었습니다.
꼭 여러분도 읽어보세요.
정말, 여러분도 이 책을 읽고 감동할 거라고 생각합니다.
원더 사토 게이요니치 저『쉽게 배우는 프롬프트』(예술신문사 출판) ※프롬프트 엔지니어링의 기본부터 응용, 작업 실행까지를 포괄 [https://amzn.asia/d/80zVtv8](https://amzn.asia/d/80zVtv8)
✅note 기사 https://note.com/mbbs ※ChatGPT·Claude·Gemini·NotebookLM·Perplexity ※멤버십 시작했습니다!
AI 공동 창작 혁신 (AI 스쿨, AI 기업 교육, AI 앱 개발 사이트) https://mbbs-ai.jimdofree.com/
죄송합니다. 제공된 정보만으로는 Facebook 페이지를 번역할 수 없습니다. 게시글 내용이 없어 번역이 불가능합니다.
[AI 협업 혁신 추천 영상] https://www.youtube.com/watch?v=IXbKlwHUdbg&list=PLTcSHWqKTOojc8R-brID5q06JrmtiWRTl
사테라이트 채널
참고 문헌
- OpenAI. (2026). GPT-6 아스트라 시스템 카드. OpenAI.
- OpenAI. (2026). OpenAI GPT-6 아스트라: 자율 에이전시 및 시스템 아키텍처. OpenAI.
- ARC 상. (2026). ARC-AGI-3 벤치마크에서 GPT-6 Astra 평가.
- 인공 분석. (2026). 시스템 에이전트: GPT-6 아스트라의 평가 및 아키텍처. 인공 분석.
GPT6Astra #OpenAI #GPT6 #ARC_AGI_3 #AI 에이전트 #자율형 AI #프롬프트 체인 #Harness #추론 노력 #ChatGPT6 #프롬프트 #프롬프트 엔지니어링
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 97청크
원문 보기 | 출처: note.com