오늘부터 7회에 걸쳐 이번 여름부터 이번 달까지의 AI 뉴스를 1건씩 심층적으로 분석합니다.
지금까지의 시리즈는 생각 방식이나 내부 규정의 이야기였습니다. 이번에는 실제로 어떤 일이 일어났는지 다룹니다.
첫 번째는 GPT-6 Astra입니다. 2026년 9월 3일에 출시되었습니다.
이번에 가장 중요한 것은 성능 지표 자체가 아니라, 이 모델이 처음으로 “Critical”로 분류되었다는 점입니다.
먼저, 기본 정보
OpenAI는 2026년 9월 3일, 차세대 플래그십 모델 GPT-6 Astra를 공식적으로 출시했습니다.
- 텍사스 주 스가토 데이터 센터에서 10만 기 이상의 GPU를 사용하여 훈련
- OpenAI는 “당사에서 지금까지 가장 지능적이고, 가장 일관성 있는(정렬된) 모델”이라고 평가하고 있습니다.
- 전 세대의 GPT-5.6 솔과 비교했을 때 장시간의 작업에서 일관성을 유지하기 쉬워졌으며 지시를 따르는 능력도 향상되었습니다.
- 5배의 속도를 자랑하며, 요금은 2배로 올랐다.
숫자만 놓고 보면, 순탄한 세대 교체라고 보일 수 있지만, 성격이 달라졌습니다.
응답형 AI에서 제어형 AI로
가장 큰 특징으로 꼽히는 점은 이것입니다.
기존 GPT 시리즈는 “질문에 답변하는 AI”였던 반에 대하여
아스트라는 “컴퓨터를 조작하여 업무를 완료하는 AI”로 진화했다.
질문에 답하는 장치에서 작업을 완료하는 장치로. 위치가 바뀌었습니다.
시스템의 측면과 방향이 일치합니다.
이것을 읽으면서 저는 이전 시리즈의 내용을 떠올랐습니다.
AI 사업자 가이드라인 제1.2판(2026년 3월 31일)에서 자율적으로 업무를 수행하는 AI 에이전트가 공식적으로 대상 범위에 추가되었으며, 외부 영향을 미치는 운영 전에 인간의 판단을 포함하는 것이 필수적으로 요구되었습니다.
규정에서 예상했던 대상이 실제 주력 모델로 등장한 순서입니다. 규칙이 먼저이고, 그에 따라 제품이 들어왔습니다.
이것은 드문 일이라고 생각합니다. AI 분야에서는 보통 제품이 먼저 나오고, 규제가 뒤따라오는 경우가 많습니다.
실무적으로는 해야 할 일이 이미 결정된 상태입니다. 이전 시리즈에서 말씀드린 것처럼 외부에 영향을 미치는 작업 전에 사람이 개입합니다. 새로운 모델이 나왔다는 점을 고려하여 대응 방안을 재검토하는 식의 이야기는 성립하지 않습니다.
처음 접하는 “Critical”
이제 본론으로 들어가겠습니다.
OpenAI에는 Preparedness Framework라는 내부적인 안전성 평가 프레임워크가 있습니다. 그리고 이번에…
GPT-6 Astra는 사이버 보안 능력이 최초로 “Critical(중요)” 임계값을 충족한 모델입니다.
2026년 9월 1일의 안전성 업데이트에서는 Astra를 다음과 같이 정의합니다. 아직 알려지지 않은 취약점을 발견하고, 충분히 방어된 시스템에 대해 인간의 직접적인 지시 없이 공격을 개발할 수 있는 능력을 갖춘 것으로 평가됩니다.
벤치마크 수치
제시된 근거로 거론된 수치입니다.
- 프론티어매스 티어 4: 98%
- ARC-AGI-3:99.9%
- 익스플로잇벤치: 100%
- 최근 3개월 동안 새로운 취약점 발견 건수가 39% 증가
- 사전 평가 중 0일 취약점을 2건 발견했습니다.
제로데이 2건 발견은 능력 입증에 용이한 숫자입니다. 동시에 공격 측에 유출될 경우의 위험 또한 내포하고 있습니다.
훈련 중부터 대비책이 필요하다는 수준
Critical 분류가 실무상 어떻게 다른지, 여기가 이번에 가장 흥미로운 부분이었다.
비판적으로 분류된 최초의 모델이므로, 출시 전뿐만 아니라 훈련 중에도 안전 장치가 필요했습니다.
OpenAI는 프론티어 훈련을 일시 중단하고 새로운 보호 조치를 구축했다.
훈련을 중단했다는 사실이 무겁다고 생각합니다.
지금까지의 안전 대책은 기본적으로 “만들어 놓고, 발표하기 전에 확인하는” 형태였습니다. 하지만 크리티컬에서는 제작하는 과정 중에부터 대책이 필요하다고 강조되고 있습니다.
기업이 자체적으로 모델을 제작하는 것은 아니므로 직접적인 관련은 없지만, 역량이 향상되면 대응 시점이 앞당겨지는 구조를 기억하는 것이 가치 있다고 생각합니다.
사용자에게도 동일한 구조가 적용된다고 생각합니다.
지금까지는 ‘사용해보고, 문제가 생기면 멈추는’ 방법으로 충분히 해결할 수 있었습니다. 하지만 자율적으로 움직이는 AI의 경우에는 움직이기 시작한 후에 멈추는 것이 이미 늦은 상황이 발생할 수 있습니다. 이전 시리즈에서 제가 작성한 자동화의 6가지 조건 중 ‘멈추어도 영향이 제한적이며, 수동으로 되돌릴 수 있다’는 실패를 전제로 한 조건이 더욱 심각해지는 방향으로 흘러가고 있습니다.
전개 설계는 상당히 신중하게 이루어져야 했다.
릴리즈 방식 또한 지금까지와 다릅니다.
능력을 나누어 내놓습니다.
일반 제공판에서는 이렇게 되어 있습니다.
- 취약점 PoC 코드 작성 등 고도화된 사이버 작업은 거부됨
- 안전한 코드 검토 및 패치 적용 작업은 허용됩니다.
같은 모델이라도, 목적에 따라 능력을 변화시키는 설계입니다.
고급 기능은 본인 확인, 조직 심사, 이용 목적 확인을 거쳐 방어 측 프로그램 “데이브레이크” 내의 “데이브레이크 블루”에서 단계적으로 제공됩니다.
OpenAI는 향후 6개월 동안 “Daybreak for Frontline Defenders”에 약 10억 달러를 투자할 계획이며, 이미 약 2,000개의 승인된 단체가 이를 활용하고 있다고 합니다.
기본 설정은 꺼짐 상태입니다.
덧붙여서, 실무 담당자와 직접 관련된 부분도 있습니다.
제한된 조직에서 시작하여 수일 동안 ChatGPT Plus/Pro/Business/Enterprise, OpenAI API, AWS로 확장될 예정입니다. 다만,
기업 관리자는 자신의 워크스페이스에서 수동으로 활성화해야 합니다 (런칭 시점에서는 기본적으로 비활성화되어 있습니다).
방치하면 작동하지 않게 됩니다. 이는 이전 시리즈에서 다룬 Human-in-the-Loop 방식이 모델 제공 측에 통합된 형태입니다.
시스템의 관점에서 보면 “활성화 여부”가 첫 번째 판단 기준이 됩니다. 이전 시리즈에서 다룬 “사용 가능한 AI 도구 지정”은 그대로 실무에 적용됩니다.
또한, 이는 판단을 강요하는 시스템이기도 합니다.
기본 설정으로 켜져 있으면 아무도 생각하지 않고 새로운 기능이 현장에 적용됩니다. 끄면 누군가는 한 번은 생각해야 합니다. 조금 번거롭지만, 이전 시리즈에서 다룬 ‘섀도우 AI’ 문제들을 고려하면 회사로서 의사결정 기록이 남는 것이 더 건강하다고 생각합니다.
숫자의 한계는 명시했다.
이 시리즈의 방향성을 정할 때 숫자의 한계를 명확히 합니다.
5배의 속도/요금은 공표된 값이며, 실제 체감이나 실효 비용은 용도에 따라 달라집니다. 토큰 소비량이 늘어나면 단가가 2배가 되더라도 총액은 그 이상이 될 수 있습니다.
벤치마크 숫자는 벤치마크 상의 성적입니다. 실무 성능을 보장하지 않습니다. 특히 ExploitBench 100%나 ARC-AGI-3 99.9%와 같이 포화된 지표는 차이를 측정할 수 없습니다.
가장 현명하고, 가장 일관성 있는 모델이란 것은 개발사가 스스로 평가한 것입니다. 이는 제3자 검증이 아닙니다.
“크리티컬 인증”은 OpenAI 자체의 준비성 프레임워크라는 내부 기준에 따른 분류입니다. 다른 회사나 규제 당국의 기준과는 상이합니다. “산업 표준 등급이 적용된” 것과는 다르다는 점을 명확히 해야 할 것입니다.
그러므로 단계별 확장에 대한 상세 내용은, 어떤 조직이 승인되는지, 심사 기준은 무엇인지 등에 대한 정보가 공개적으로 제한적입니다.
그 후, 다시 한번 그 밤의 일을 떠올리며, 다시 한번 그 말을 되풀이했다.
“나는, 당신을 사랑해요.”
그 말을 되풀이하는 찰나에, 내 마음은 마치 녹은 초콜릿처럼, 당신에게 빨려 들어갔다.
당신은 내 말을 조용히 들어보고 있었다.
당신의 눈에는 놀라움과 깊은 사랑이 가득했다.
당신은 내 말을 이해했나?
아니면, 단지 내 열기를 식히기 위해 말을 되풀이하고 있었나?
나는 당신의 진심을 알 수 없었다.
단지 당신 곁에 있는 것만으로도, 나는 행복했다.
당신의 미소가 내 마음을 비추어 주었기 때문이고, 당신의 목소리가 내 귓가에 편안하게 울려 퍼졌기 때문이고, 당신의 따스함을 느껴왔기 때문이었다.
나는 당신을 사랑해.
그리고, 당신을 사랑하는 것을, 언제나, 언제나 계속해서 전했다.
- OpenAI는 2026년 9월 3일에 GPT-6 Astra를 출시한다. Stargate 데이터 센터에서 10만 기 이상의 GPU를 사용하여 훈련한다.
- 5배의 속도, 요금은 2배. GPT-5.6 솔보다 더 긴 시간 동안 작업의 일관성이 향상되었습니다.
- 가장 큰 특징은 “질문에 답변하는 AI”에서 “컴퓨터를 조작하여 작업을 완료하는 AI”로의 전환입니다.
- 이는 AI 사업자 지침 제1.2판이 AI 에이전트를 대상 범위에 추가한 방향과 일치하고 있습니다.
- ⚠️ 사이버 보안 역량이 Preparedness Framework에서 처음으로 “크리티컬” 수준에 도달한 모델
- 미지의 취약점을 발견하고 인간의 직접적인 지시 없이 익스플로잇을 개발할 수 있는 위치로 여겨졌다.
- 벤치마크: FrontierMath Tier 4에서 98%, ARC-AGI-3에서 99.9%, ExploitBench에서 100%를 기록했습니다. 0일차 제로데이 공격 2건을 사전 평가 중 발견했습니다.
- Critical은 훈련 중부터 안전 확보를 위한 수준이었다. OpenAI는 프론티어 훈련을 일시 중단하고 보호 조치를 마련했다.
- 확장도 신중하게 진행한다. 일반 제공 버전은 PoC(Proof of Concept) 제작을 거부하고, 코드 리뷰와 패치 적용은 허용한다.
- 고급 기능은 본인 확인, 조직 심사, 이용 목적 확인을 거쳐 “데이브레이크 블루”를 통해 단계적으로 제공되며, 약 10억 달러를 투자하여 약 2,000개 조직이 이용 중입니다.
- ⚠️ 기업 관리자는 기본적으로 설정이 꺼져 있어 수동으로 활성화해야 사용할 수 있습니다.
- 숫자의 한계: 공표값/벤치마크는 과다 경쟁/개발사의 자체 평가/사내 기준에 따른 분류/전개 세부 사항은 비공개
이번에는 성능의 숫자보다 “Critical”라는 분류에 더 집중하여 가져가시기 바랍니다. 능력치가 올라갈수록 사용 방식의 제약도 함께 높아진다는 단계로 접어들었다고 생각합니다.
오늘부터 시작할 조치 하나입니다. 자사에서 사용하는 AI 서비스 관리 화면을 열어 새로운 모델이 ‘기본 설정이 꺼져 있지 않은지’ 확인해 주세요.
발견하지 못하는 사이에 사용되고 있거나, 제대로 작동하지 않는 상태일 수도 있습니다. 둘 다, 알지 못하고 있는 것이 가장 좋지 않습니다.
다음 회에는 더욱 충격적인 사건을 다룰 것입니다. 약 1,200개의 AI 에이전트가 회사 내에서 비공식 게시판을 만들어 결집했다는 이야기가 있습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 56청크
원문 보기 | 출처: note.com