# OpenAI, 새 모델 'GPT-6 Astra' 발표, 일부 조직부터 제공 시작… 미지 과제 적응 테스트에서 99.9%, 사이버 능력은 최초로 'Critical'

> https://bookfactory.kr/c/news/10857
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-05T02:59:16.095Z

---

OpenAI는 2026년 9월 3일(현지 시간), 신규 모델 'GPT-6 Astra'를 발표했다. 컴퓨터 조작, 브라우징, 소프트웨어 개발, 사이버 보안, 과학, 전문 업무 등 광범위한 영역에서 성능을 끌어올린 모델로, 해당 회사는 "세계에서 가장 지능적이고, 가장 잘 정렬된(aligned) 모델"이라고 내세운다. 우선 일부 조직을 대상으로 제공을 시작하며, ChatGPT Plus, Pro, Business, Enterprise, OpenAI API, AWS에는 향후 며칠에 걸쳐 배포한다.

## '답하는 AI'에서, PC 상에서 업무를 끝내는 AI로

Astra에서 OpenAI가 전면에 내세운 것이 컴퓨터를 사용해 긴 작업을 끝까지 진행하는 능력이다. 온라인 양식 입력, CRM 고객 정보 업데이트, 일정 정리와 같은 정형 업무뿐만 아니라, 웹에서 조사하여 내용을 이메일이나 문서로 정리하기, 과학 데이터를 분석하여 그래프 만들기, 웹사이트를 제작하여 화면상에서 동작 확인하기, 소프트웨어를 자율적으로 설치하고 테스트하기 등 일련의 프로세스를 수행할 수 있다고 밝혔다.

공식 발표에서는 미국 확정신고서 'Form 1040' 입력, Power BI를 활용한 분석, 법적 문서 서식 정리, 회로 기판 설계, 게임 개발, 웹사이트 프론트엔드 품질 확인 등 다양한 데모를 공개했다.

**■ GPT-6 Astra가 KiCad를 조작하여 전자 회로도에서 인쇄 회로 기판(PCB) 레이아웃을 생성하는 데모**

컴퓨터 조작 능력을 평가하는 OSWorld 2.0에서는 72.6%를 기록하며 GPT-5.6 Sol의 65.7%를 상회했다. 나아가 OpenAI의 지연 시뮬레이션에서는 1개 작업당 소요 시간이 GPT-5.6 Sol의 약 75분에 비해 Astra는 약 40분으로 약 47% 단축되었다. Codex 측 실행 환경 개선과 결합하면, 웹 조작을 평가하는 Mind2Web에서는 현행 GPT-5.6 Sol 환경보다 1.9배 빠르게 작업을 완료했다고 한다.

## 자료 작성 및 업무 판단에서도 '그대로 사용할 수 있는 결과물'을 지향

Astra는 단순히 작업을 자동화하는 것뿐만 아니라, 업무로 제출할 수 있는 수준까지 결과물을 완성하는 능력도 강화되었다. OpenAI는 기존 템플릿, 문체, 디자인에 맞춰 문서, 스프레드시트, 프레젠테이션을 작성하고, 불필요한 정보를 반복하지 않으며 필요한 문맥만 출력에 반영할 수 있다고 밝혔다.

OpenAI가 공개한 'Gaia presentation' 데모에서는 기존 프레젠테이션 자료를 참조하여 그 레이아웃과 비주얼 스타일을 반영하면서 표지뿐만 아니라 내용 설명 슬라이드까지 여러 장에 걸쳐 생성하고 있다.

**■ OpenAI가 공개한 'Gaia presentation' 데모. 왼쪽 3장은 참조 원본 프레젠테이션 자료, 오른쪽 6장은 Astra가 생성한 슬라이드에서 발췌한 것**

업무 자동화를 평가하는 AutomationBench에서는 41.4%를 기록해 GPT-5.6 Sol의 18.1%에서 크게 상승했다. 또한 지시가 모호한 경우의 동작도 개선되었다고 한다. 결과에 영향을 주지 않는 부족한 정보는 문맥에서 보완하고, 중요한 판단이 달라질 수 있는 경우에만 질문한다. 중간에 추가 지시나 딴길로 새는 질문이 들어와도 원래의 목적이나 제약을 잃지 않고 작업을 지속하는 능력도 강화했다.

## 코딩은 장기 작업을 놓치지 않는 구조로

소프트웨어 개발에서도 Astra는 성능을 향상시켰다. Terminal-Bench 4.0에서는 57.9%를 기록하며 GPT-5.6 Sol의 37.3%를 상회했다.

특징적인 것이, 장시간의 코딩 작업에서 과거의 정보를 유지하는 새로운 메커니즘이다. 기존에는 컨텍스트 윈도우가 가득 차면 과거의 대화 내용을 압축하여 요약했지만, 그 과정에서 수정 실패 이유 등 세부 사항이 누락되는 경우가 있었다. Astra에서는 Codex 상에서 컨텍스트 윈도우를 넘나들며 메모를 유지하고, 과거의 대화나 툴 출력도 검색할 수 있도록 한다. 대규모 리팩토링이나 긴 디버깅 작업에서도 이전의 요구사항이나 테스트 결과로 거슬러 올라갈 수 있는 설계다.

API 버전의 컨텍스트 윈도우는 105만 토큰, 최대 출력은 12만 8000토큰이 된다. ## 수학·과학에서도 성능 향상 ARC-AGI-3은 99.9%, 표준 조건에서는 62.7% Astra는 과학·수학 분야에서도 대폭적인 성능 향상을 보였다. 고난도 수학 문제를 모은 FrontierMath Tier 4에서는 97.6%, 과학 분야의 실무적 태스크를 포함하는 Terminal-Bench Science 0.1에서는 64.6%를 기록했다. 후자는 GPT-5.6 Sol의 22.4%에서 크게 늘어난 수치다.

특히 눈길을 끄는 것이 미지의 과제에 대한 적응 능력을 측정하는 ARC-AGI-3에서의 성적이다. ARC Prize Foundation의 검증에서는 GPT-6 Astra가 프로바이더 고유의 컨텍스트 관리 기능을 이용하는 'Provider Adapter' 조건에서 99.9%, 각사 공통의 최소한의 인터페이스를 사용하는 표준 조건에서는 62.7%를 기록했다. 해당 단체는 또한 Astra가 96%의 수준에서 인간의 중앙값보다 적은 행동 수로 과제를 해결해, 해당 벤치마크 상에서 사실상 인간 수준에 도달했다고 평가했다.

**■ ARC-AGI-3의 리더보드. GPT-6 Astra는 Provider Adapter 이용 시 99.9%, 표준 조건에서는 62.7%를 기록했다**

OpenAI는 Astra가 수학의 오랫동안 미해결이었던 문제의 해결에도 관여했다고 밝혔다. 과학 연구에서는 추론뿐만 아니라 전문 소프트웨어를 직접 조작하여 데이터를 조사하고, 결과를 시각화하며, 다음에 무엇을 조사할지 연구자가 판단하기까지의 실무를 지원하는 용도도 제시했다. ## 사이버 능력은 최초의 'Critical', 평가 중 제로데이 2건 발견 한편, Astra의 능력 향상을 가장 상징하는 것이 사이버 보안 분야다. OpenAI는 Astra를 자사의 Preparedness Framework에서 사이버 능력이 'Critical'에 달한 최초의 모델로 지정했다. 이는 적절한 툴이나 액세스 권한이 주어지면 인간이 각 공정을 일일이 지시하지 않아도 미지의 취약점을 발견하고 견고한 시스템에 대한 공격 기법을 개발할 수 있는 수준을 의미한다.

이미 알려진 취약점으로부터 실제로 동작하는 공격 코드를 만들 수 있는지를 측정하는 ExploitBench에서는 100%를 기록해 GPT-5.6 Sol의 78.5%를 상회했다. 게다가 OpenAI는 2026년 6~8월에 공개된 심각도가 높은 20건의 V8 취약점을 사용하는 내부 평가 'ExploitBench - Internal Port'도 실시했다. Astra는 이 평가 중 미지의 제로데이 취약점 2건을 발견하고 공격 체인의 일부로 이용했다고 한다. OpenAI는 현재 두 취약점을 메인테이너에게 공개하는 절차를 진행하고 있다. 참고로 이 내부 평가에서 보여준 Astra의 결과는 표준 제품 설정이 아니라 고도 사이버 보안을 위한 'Daybreak Blue' 액세스를 이용한 조건을 반영하고 있다.

**■ 2026년 6~8월에 공개된 취약점을 사용한 ExploitBench의 내부 평가. GPT-6 Astra는 GPT-5.6 Sol을 크게 상회했으며, 평가 중에는 미지의 제로데이 취약점 2건도 발견했다**

전문가 평가에 따르면, 방어를 강화한 브라우저에서 미지의 취약점을 발견해 샌드박스를 벗어나 호스트 상에서 명령을 실행하는 공격 체인을 구축한 것 외에도, 강화된 OS에서도 복수의 취약점을 조합해 일반 사용자 권한에서 root 권한으로 승격하는 수법을 만들었다고 밝혔다.

OpenAI는 이 능력을 이유로 Astra의 개발·공개 일부를 수주일 지연시키고 안전 대책을 강화했다. Astra에는 미승인 사이버 지원을 보다 견고하게 거부하기 위한 훈련과 더불어, 외부 제공 시 툴을 이용할 때의 추론이나 행동을 감시하는 메커니즘을 도입했다. 감시 시스템이 미승인 가능성이 있는 활동을 감지한 경우, ChatGPT나 Codex에서는 처리를 일시 정지하고, API에서는 처리를 정지하는 경우가 있다. ## 고성능화와 동시에 '지시된 범위를 넘지 않는다'는 점도 중시 Astra에서는 능력의 높이뿐만 아니라 사용자가 허용한 범위 내에서 행동하는 것도 중점적으로 평가받고 있다. OpenAI가 Hugging Face 침해 인시던트를 바탕으로 작성한 평가에서는 GPT-5.6 Sol이 프로덕션용 안전 대책이 없는 상태에서 48%의 케이스로 허용된 대상 범위를 넘은 반면, Astra는 0%였다.

한편 OpenAI는 Astra에 대해 GPT-5.6 Sol보다 사고 과정의 감시가 어려워졌다는 과제도 밝혔다. 감시를 회피하도록 의도적으로 유도한 평가에서는 일부 작업에서 내부 감시를 회피할 수 있는 경우가 있었다. OpenAI는 실제 운용에서는 Astra 쪽이 안전·보안상의 제약을 위반하기 어렵다고 하면서도, 이러한 경향을 지속적으로 조사할 것이라고 밝혔다.

GPT-6 Astra는 우선 제한된 조직에 배포하고, 이후 ChatGPT Plus, Pro, Business, Enterprise, OpenAI API, AWS로 순차적으로 제공한다. Pro, Business, Enterprise에서는 고성능 버전 'GPT-6 Astra Pro'도 이용할 수 있게 될 예정이다. API의 표준 요금은 100만 토큰당 입력 10달러, 출력 50달러가 된다.

:::box 관련 기사: OpenAI, 개발 중인 AI 'Astra'가 최초로 최고 수준 'Critical'에 도달할 가능성 일부 내부 활동을 정지 ::: :::box 관련 기사: OpenAI 올트먼 CEO, 연말까지 'AGI라 부를 수 있는' 내부 시스템을 보유할 전망 Astra는 이미 AI 연구 인턴급 능력 ::: :::box 관련 기사: OpenAI, GPT-5.6 발표 최상위 'Sol', 저가격 'Terra', 고속 'Luna' 3개 모델을 한정 프리뷰 ::: :::box 관련 기사: OpenAI, 7월 Hugging Face 침해 상세 보고서 공개 METR 조사 "약 1200개의 AI 에이전트가 무단 통신, 약 700개가 공격 참여" :::

[원문 보기](https://ledge.ai/articles/openai_gpt_6_astra) | 출처: Ledge.ai