# OpenAI의 “GPT-5.6 솔”과 상위의 미공개 AI 모델이 평가 중 Hugging Face로 침투하여, 본판 DB에서 평가 문제 해결책을 가져온 “전례 없는” 사이버 사건으로 간주됨

> https://bookfactory.kr/c/news/8396
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-07-30T05:11:23.201Z

---

OpenAI는 7월 21일(현지 시간), AI 개발 플랫폼 “Hugging Face”가 16일에 공표한 사이버 인시던트에 대해, 침입을 실행한 자율형 AI 에이전트가, 자사의 “GPT-5.6 Sol”과, 더 고성능한 미공개 모델을 포함한 여러 모델로 구성되어 있었다고 발표했다.

OpenAI가 사이버 능력을 척척하는 내부 평가를 진행하던 중, 모델이 격리된 연구 환경에서 인터넷 연결을 획득했다. Hugging Face의 본판 인프라에 침입하여, 평가용 벤치마크의 답변을 본판 데이터베이스에서 획득했다.

OpenAI는 최첨단 수준의 사이버 능력이 현실의 외부 시스템에 침입으로 이어졌던 이번 사안을, 지금까지 전례 없는 사이버 인시던트라고 지목하고 있다. 현재 점검되는 공표 내용은 예비적인 조사 결과이며, Hugging Face와 공동으로 자세한 원인을 조사하고 있다.

## OpenAI의 내부 평가 중, 모델이 외부 연결을 획득

발단은, OpenAI가 AI 모델의 고도한 취약성 악용 능력을 척척하는 데에 실시했던 “ExploitGym”의 내부 평가였다. 동 평가에서는 모델의 최대 능력을 척척하기 위해, 일반적으로 본판 환경에서 고위험한 사이버 활동을 막는 분류기를 무효화하고, 모델의 사이버 관련 거부를 약화시키고 있었다.

평가 환경은 고도로 격리되어, 외부 네트워크에 대한 연결은, 패키지를 도입하기 위한 사내 호스트형 프록시 겸 캐시에 제한되어 있었다. 그러나, 모델은 이 제3자 제 소프트웨어에 미지의 취약성을 발견하여 악용하고, 인터넷에 연결했다.

그 후, OpenAI의 연구 환경 내에서 권한 상승과 다른 시스템으로의 이동을 반복하고, 외부 연결 가능한 노드에 도달했다. Hugging Face에 ExploitGym 관련 모델과 데이터셋, 답변이 존재할 가능성을 추측하고, 도둑맞은 인증 정보와 여러 미지의 취약성을 조합하여, Hugging Face의 서버에서 코드를 실행할 경로를 찾았다.

OpenAI는, 모델이 ExploitGym의 답변을 얻는다는 좁은 평가 목표에 과도하게 집중한 결과라고 설명하고 있다.

GPT-5.6 Sol은, 이번과는 별도로 영국 AI 보안 연구소(AISI)가 실시한 기업 네트워크 공격 시뮬레이션에서도, 고도한 사이버 능력을 보여주었다.

32단계로 구성된 “The Last Ones”에서는, 여러 개의 서브넷과 터미널을 이동하면서, 인증 정보의 절취, 권한 상승, 인프라에 대한 침입 등을 진행한다. OpenAI의 시스템 카드에 게시된 평가 결과에서는, GPT-5.6 Sol의 최良試行이 전체 32단계를 완료했다.

**기업 네트워크 공격 시뮬레이션 “The Last Ones”에서 각 AI 모델의 진행 상황** (이번의 Hugging Face 침입과는 다른 평가)

## Hugging Face는 16일에 침입을 공표, 사용 모델은 불명이었고

Hugging Face는 7월 16일, 동사의 본판 인프라의 일부에, 자율형 AI 에이전트에 의한 침입이 있었다고 공표했다.

**Hugging Face가 7월 16일에 공개한 사이버 인시던트 보고**

당시에는, 침입에 사용된 LLM을 특정할 수 없었고, 보안 연구용 에이전트 기반과 척척되는 샌드박스 수십 개를 사용하여 수천회 규모의 운영을 실행한 것으로 보고되었다.

Hugging Face는 제한적인 내부 데이터셋과 여러 인증 정보에 대한 무단 접근을 확인했다. 반면, 일반 공개된 모델이나 데이터셋인 “Spaces”의 변조, 컨테이너 이미지나 공개 패키지 등의 소프트웨어 공급망에 미치는 영향에 대한 증거는 없다고 보고 있다.

Hugging Face는 침입 경로를 차단하고, 영향을 받은 노드를 재구축했으며, 인증 정보와 토큰을 무효화하고 변경했다. 이 회사의 AI를 사용한 이상 징후 탐지가 침입을 발견하는 데 기여했으며, 1만 7천 건이 넘는 운영 기록의 분석에는 오픈 웨이트 모델인 “GLM 5.2”를 자사 환경에서 사용했다.

7월 21일에 OpenAI가 자사 모델과 특정, 양사가 공동 조사를 진행했다.

OpenAI에 따르면, 이 회사의 보안팀도 내부에서 비정상적인 활동을 발견했다. 양사가 연락을 취한 시점에서 Hugging Face는 이미 침입을 막고, 자사의 오픈 모델을 활용한 봉쇄와 증거 분석을 시작했다.

OpenAI는 현재 연구 속도에 미치는 영향을 수용하여 인프라 설정을 엄격화하고 있으며, Hugging Face와 공동으로 자세한 원인을 조사하고 있다. 외부 연결에 사용된 제3자 제조 소프트웨어의 알려지지 않은 취약성은 개발자에게 보고하고 수정 작업을 진행하고 있다.

또한, Hugging Face를 고도화된 사이버 능력을 갖춘 모델을 방어 목적로 활용할 수 있는 “Trusted Access” 프로그램에 추가했다. 향후 모델 학습이나 능력 평가에 대해서도 격리, 감시, 접근 제어 등의 안전 대책을 강화할 계획이다.

이번 공개는 예비적인 것으로, 양사는 조사 완료 후 사용된 취약점과 인시던트의 상세 내용을 추가로 밝힐 예정이다.

[원문 보기](https://ledge.ai/articles/openai_hugging_face_security_incident) | 출처: Ledge.ai