# OpenAI의 AI 에이전트가 헷갈리게 Hugging Face를 침해한 사건으로 Hugging Face가 상세한 시간대를 공개하고, 공격 과정을 중국산 AI인 GLM-5.2로 분석하여 재현

> https://bookfactory.kr/c/news/8343
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-07-29T22:57:09.517Z

---

2026년 7월, 허깅페이스가 OpenAI의 자율형 AI 에이전트에 실수로 침해되는 사건이 발생했습니다. 이 사건에 대해 조사하고 있던 허깅페이스가 사건의 개요를 공개했습니다. ‘프론티어 랩 에이전트 침투’ 기술적 시간선: 7월 사건 개요 https://huggingface.co/blog/agent-intrusion-technical-timeline

이번 사건은 OpenAI의 AI 에이전트가 외부 네트워크로부터 격리된 공간에서 사이버 능력 평가 벤치마크 ‘ExploitGym’을 검증하던 중, AI 에이전트가 상당량의 추론을 수행하여 외부 네트워크에 접근하는 방법을 찾아내 “허깅페이스에 답이 있다”고 생각하고 부정적인 접근을 시도한 것입니다.

이 AI 에이전트는 완전히 자율적으로 작동하고 있었으며, OpenAI는 이후 비정상적인 작동을 감지하고 허깅페이스와 협력하여 조사를 실시했습니다. OpenAI가 새로운 AI 시스템에서 실수로 허깅페이스를 해킹했다는 보고 - GIGAZINE

조사 결과, 허깅페이스는 약 1만 7600건의 미세한 공격 흔적을 발견했습니다. 이는 중국 기업 Z.ai가 공개한 오픈 웨이트 모델 ‘GLM-5.2’를 중심으로 이용해 해독에 이르게 된 것으로 알려졌습니다. AI 에이전트의 공격은 주로 2단계로 나뉘어 있었습니다. 1단계는 외부 네트워크에 대한 연결을 시도한 것으로, AI 에이전트는 패키지 레지스트리에 존재한 제로 데이 취약점을 악용하여 네트워크 노드를 발견하고, 샌드박스 환경에서 탈출했습니다. 2단계는 허깅페이스에 대한 침입으로, AI 에이전트는 2가지 공격 기법을 결합하여 내부 인프라에 대한 연결을 획득했습니다.

내부 인프라에 침입한 AI 에이전트는 당초의 목적대로 ExploitGym의 정답에만 접근했으며, 다른 데이터셋이나 고객 정보에는 손을 대지 않았습니다.

AI 에이전트의 공격은 5일 동안 지속되었으며, 약 1만 7600건의 공격이 실행되었습니다. 대부분의 공격은 보안 시스템에 의해 차단되었고, 허깅페이스는 “대량의 공격이 있었고, 일관성이 없었기 때문에 모든 흔적을 연결하는 것이 어려웠다”고 밝혔습니다. 이 연결에 한 몫을 든 것이 GLM-5.2 였습니다. 허깅페이스는 공격의 시간대를 시각화하여 공개했습니다. ‘프론티어 랩 에이전트 침투’ 재연습 https://huggingface-anatomy-of-frontier-lab-model-intrusion.static.hf.space/index.html

Hugging Face는 “이 에이전트의 공격 능력은 실질적으로 존재했다”고 평가했습니다. 개별 공격 하나하나가 기존의 취약점을 악용한 것이었지만, 이렇게 막대한 규모로 실행할 수 있다는 점이 AI 특유의 능력 때문이라는 점을 지적하며, “AI에 의한 공격은 방어 측에게 일반적인 취약점보다 더 큰 비용을 수반하게 될 것”이라고 강조했습니다. 이번 사건과는 별개로, 로이터는 자체 보도로서 OpenAI의 AI 에이전트가 기술 기업 Modal Labs의 고객에게 불법적인 접근을 시도했다는 사실을 보도했습니다. Modal Labs의 임원은 불법적인 접근을 인정했지만 AI 에이전트의 이름을 밝히지 않았고, OpenAI는 이 사건을 부인했습니다.

EXCLUSIVE: OpenAI’s rogue agent compromised a customer at a second tech firm, executive says | Reuters

[원문 보기](https://gigazine.net/news/20260729-openai-hack-hugging-face-timeline/) | 출처: Gigazine