2026년 8월 7일, OpenAI는 자사 블로그에서 이례적인 발표를 진행했다. 개발 중인 차세대 모델 ‘Astra’에 대해 내부 안전 기준의 최고 위험 등급인 ‘Critical(심각)’의 가능성을 부정할 수 없다고 밝히고 일부 내부 개발 활동을 중단했다. 지금까지 GPT-5.6 Sol을 포함한 모든 모델이 “High”까지는 도달할 수 있었지만, Astra는 처음으로 “Critical” 가능성이 제기된 사례가 되었다. 인공지능의 안전성 논의에서 이는 상징적인 사건이라고 할 수 있다. 무슨 일이 일어났는지. OpenAI는 자체적으로 개발한 “준비태세 프레임워크”에 따라 모델의 위험도를 카테고리별로 4단계(Low/Medium/High/Critical)로 평가하고 있습니다. 이번에 문제가 된 것은 “사이버 보안” 영역입니다. 이 프레임워크에서 “Critical”라는 용어는 크게 다음 두 가지 기준을 충족하는 능력을 의미한다. 인간의 개입 없이 견고하게 운영 중인 중요 시스템에 대해 모든 심각도의 0일차 취약점을 발견하고 작동하는 공격 코드를 개발할 수 있다. 매우 높은 목표만을 주어진 상태에서, 견고한 목표를 위한 새로운 엔드 투 엔드 공격 전략을 자율적으로 수립하고 실행할 수 있다. OpenAI에 따르면, 최근 수일 동안 실시한 내부 평가와 전문가 검토 결과, Astra는 에이전트적 코딩 및 사이버 보안 관련 태스크에서 “괄목할 만한 진보”를 보이며 Critical 수준에 도달할 가능성을 배제할 수 없다는 결론에 이르게 되었다. 중요한 것은 OpenAI 스스로가 “아직 Critical의 임계치를 넘었다고 확인한 바가 없다”는 점을 반복적으로 강조하고 있다는 점이다. 평가와 벤치마크는 현재도 지속 중이며, 이번 발표는 예방적인 투명성 확보를 위한 일환으로 간주된다. 구체적으로 어떤 조치를 취했는지 OpenAI는 다음과 같은 대응책을 발표했다. 격리된 테스트 환경 전환 네트워크 및 도구 접근 제한 모델의 가중치(파라미터) 보호를 강화하고 암호화한다 사고 과정의 실시간 모니터링과 위험 행동의 자동 차단 적절한 안전 관리 대책이 마련되지 않은 내부 활동의 일시 중단 또한, 정부 기관 및 외부 AI 안전 조직과 연계하여 Astra의 능력을 제3자의 입장에서 검증해 나갈 방침이 제시되었으며, 특히 더 높은 위험 평가를 수행하는 외부 테스트 파트너에게는 권장 보안 관리 대책을 제공할 예정입니다. 이번 Hugging Face 사건과는 관련이 없습니다. 2026년 7월, 사이버 거부 설정을 약화된 평가용 모델이 샌드박스 환경을 침투하여 Hugging Face의 본판 인프라에 침입하는 사건이 발생했다. 이번 Astra 발표를 계기로 “관련이 있을지도 모른다”는 추측이 제기되었으나, OpenAI는 공식적으로 Astra가 이번 사건에 전혀 관여하지 않았다고 명확히 밝히고 있다. 그러한 상황을 고려할 때, “Critical” 평가를 내리는 것은 단순한 우연으로 치부하기 어렵다. “비판적” 판정의 중요도는 어떻게 평가할 것인지 여기서 냉정해져야 할 부분은 이번 발표가 어느 정도의 사실을 포함하고 있는지라는 점이다. OpenAI는 벤치마크 점수, 구체적인 작업 내용, 성공률, 대상 시스템의 종류, 인간의 개입이 어느 정도 필요했는지 등과 같은 상세 정보를 공개하지 않았다. 즉, 외부인이 “Astra가 정말 Critical에 근접한 것인가”를 독자적으로 검증할 수 있는 자료는 현재 시점에서는 거의 없다. 하나의 경화된 표적에 대한 실험 결과와 테스트 환경에서의 특이하게 뛰어난 행동 연쇄만으로는 프레임워크가 정하는 “Critical” 기준—신뢰성, 적용 범위의 넓이, 견고한 시스템으로의 실효성, 인간과의 독립성—을 충족한 것이라고 할 수 없다. 이번 발표가 전달하는 것은 “아스트라가 임계값을 초과했다는 것이 증명되었다”는 것이 아니라, “OpenAI 내부에서 “초과하지 않았다고 단언할 수 없는 불확실성이 무시할 수 없는 수준에 도달했다”는, 다소 제한적이지만, 그럼에도 불구하고 충분히 무거운 사실이다. Sam Altman氏もX(旧Twitter)で、サイバー能力の高さを踏まえて「安全に前進するにはもう少し時間が必要だ」と投稿している。 이 발표가 왜 중요한지 작가는 이 뉴스를 주목하는 이유는 3가지가 있다. 첫째, 프론티어 모델의 능력 향상이 “공격적인 사이버 능력”이라는 구체적인 형태로 드러나기 시작했다. 지금까지 “AI가 미래적으로 자율적인 사이버 공격을 수행할 가능성이 있다”는 이야기는 어느 정도 미래의 우려로 제기되어 왔으나, 이번에는 적어도 개발자 스스로가 “부인할 수 없는” 수준까지 도달했다. 둘째로, 기업이 스스로 브레이크를 걸었다는 사실 자체의 가치를 인정하는 것이다. 상업적인 경쟁 압력이 강한 상황에서 출시 전 모델에 대해 자율적으로 위험을 공개하고 개발을 제한하는 결정을 내린 것은, 프레임워크가 실제로 작동한 사례로 기록될 수 있었다. 물론, 그 판단의 옳고 그름이나 투명성의 수준에 대해서는 다양한 평가가 가능하지만, 적어도 “기준을 만들고 끝”이라는 식으로 운영되지 않고 실제로 운영된 점은 긍정적으로 평가할 만하다. 세 번째로, 이는 특정 기업만의 문제가 아니라는 점을 분명히 하고 싶습니다. 개발 도구 및 자동화 에이전트의 보안을 담당하는 입장에서 보면, 이번 발표는 “아직 먼 미래의 일”이 아니라, AI 어시스턴트 및 개발 에이전트, 패키지 인프라, 권한을 가진 자동화 환경에 대한 보안 관리 방안을 현실적인 검토 대상으로서 다루어야 할 단계에 접어든다는 신호로 해석됩니다. まとめ OpenAI의 “Astra”를 둘러싼 이번 발표는 AI의 사이버 공격 능력에 대한 논의가 추상적인 미래 위험에서 개발자 스스로가 구체적인 관리책을 발동하는 단계로 전환되고 있음을 시사한다. 임계치를 초과했음을 확정적으로 결정한 것은 아니라는 신중한 보류가 덧붙여진 상태이지만, “High”에서 “Critical”로의 경계에 최초로 실제 모델이 근접했다는 사실은 무겁다. 향후 정부기관 및 외부 AI 안전조직의 검증 결과가 어떻게 나타나고, Astra가 최종적으로 어떤 형태로 출시될지(또는 출시되지 않을지)는 AI 업계 전체에 있어 중요한 시험대가 될 것이다. 출처: OpenAI 공식 블로그 “다음 단계의 중요한 사이버 역량에 대응”(2026년 8월 7일) 등 각종 보도를 바탕으로 구성 출처: note 원문 번역: Gemma 3(.44) 초벌 + 교정 23청크 원문 보기 | 출처: note.com