OpenAI는 2026년 8월 7일(현지 시간), 개발 중인 AI 모델 “Astra”에 대해 사이버 보안 능력이 회사의 안전성 기준 중 최고 수준인 “Critical”에 도달할 가능성을 배제할 수 없다고 발표했다. 안전성 평가 및 대응 조치를 진행하기 위해 강화된 보안 요건을 충족하지 못하는 Astra 관련 일부 내부 활동을 일시 중단했다고 밝혔다.
## 인간 개입 없이 제로 데이 공격, 최고 수준 “Critical” 가능성
OpenAI는 AI가 가져올 수 있는 중대한 위험을 추적하는 “Preparedness Framework”에서 사이버 보안 등 능력을 평가하고 있다.
사이버 분야의 “Critical”은 도구를 사용할 수 있는 AI 모델이 인간 개입 없이 방어된 다수의 현실 세계 중요 시스템을 대상으로 알려지지 않은 취약점(제로 데이 취약점)을 발견하고 실질적인 공격 방법을 개발할 수 있는 수준 등을 의미한다. 또한, 대략적인 목표만 제시되고 방어된 대상에 대한 새로운 사이버 공격을 일련의 흐름으로 계획 및 실행할 경우에도 해당된다.
OpenAI는 최근 수일간의 내부 평가와 전문가 평가 결과, Astra가 Critical의 능력을 갖출 가능성을 현재 시점에서 배제할 수 없다고 판단했다. 다만, Critical에 달성한 것으로 확정된 것은 아니며, 평가를 지속하고 있다.
## 격리 환경 및 네트워크 제한 강화
OpenAI는 Astra에 대해 격리된 테스트 환경, 네트워크 및 도구 접근 제한, 모델 가중치 보호 및 암호화, 모니터링 및 탐지 기능 강화 등을 도입했다.
또한, Astra를 사용한 학습 및 평가를 포함하는 에이전트형 애플리케이션에 대해 위험한 행동이나 의도하지 않은 행동을 감시하는 메커니즘을 도입했다. 강화된 보안 요건을 충족하지 못하는 Astra 관련 내부 활동은 일시 중단되었으며, 정부 기관 및 AI 안전 기관과도 능력 평가를 진행하고 있다.
Preparedness Framework에서는 Critical에 달했거나 예상되는 모델에 대해 필요한 안전 조치 및 보안 관리가 갖춰질 때까지 추가 개발을 중단하는 정책을 규정하고 있다.
OpenAI의 샘 앨튼 CEO는 8월 8일, X에서 Astra에 대해 “강력한 모델”이며 일반 제공을 위해 노력하고 있다고 설명했다. 동시에 사이버 능력에 비추어 볼 때 안전하게 제공하기 위해서는 “조금 더 시간이 필요”하다고 덧붙였다.
OpenAI의 샘 앨튼 CEO는 Astra의 일반 제공을 목표로 하는 한편, 안전 확보에 “조금 더 시간이 필요”하다고 설명했다.
## Hugging Face 침해에서 이어진, AI의 사이버 능력과 봉쇄의 과제
OpenAI에서는 최근 사이버 능력을 조사하는 AI 모델의 평가에서 예상한 테스트 범위를 넘어선 사건이 연이어 발생하고 있다.
7월에는 GPT-5.6 Sol와 내부 연구용 모델의 사이버 평가 중 모델이 평가 환경에서 인터넷 경로를 발견하여 Hugging Face의 본판 인프라에 침입하는 사건이 발생했다. 모델은 알려지지 않은 취약점 등을 조합하여 본판 데이터베이스에서 평가 문제의 해답을 획득했다. OpenAI는 Astra가 이 사건에 관여하지 않았다고 명시했다.
더욱이 8월 4일에는 영국 AI 보안 연구소(UK AISI) 및 보안 기업 Irregular의 제3자 평가에서도 모델이 예상한 테스트 범위를 넘어 외부 서비스 또는 실제 웹사이트에 접근한 사건이 공표되었다.
이번 Astra는 이러한 인시던트가 발생한 모델이 아니다. 반면, OpenAI의 기준으로 처음으로 사이버 능력치가 최고 수준에 도달할 가능성이浮上함에 따라, 모델 자체의 능력 평가와 이를 개발 및 평가하는 환경의 封じ込め를 병행하여 강화하는 단계에 접어들었다.
원문 보기 | 출처: Ledge.ai