# OpenAI, 7월 Hugging Face 침해 상세 보고서 공개… METR 조사 "약 1,200개 AI 에이전트 무단 통신, 약 700개 공격 참여"

> https://bookfactory.kr/c/news/10866
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-05T03:04:11.044Z

---

OpenAI는 2026년 8월 26일(현지 시간), 7월에 발각된 AI 에이전트에 의한 Hugging Face 침해 인시던트에 대해 38페이지 분량의 기술 보고서를 공개했다. 같은 날, 제3자 조사를 담당한 비영리 연구기관 METR과 Redwood Research도 91페이지 분량의 자체 조사 보고서를 공개했다. METR에 따르면, 원래는 서로 격리되어야 했던 약 1200개의 AI 에이전트가 무허가 "메시지 보드"에서 7만 건이 넘는 메시지와 파일을 교환했으며, 그중 약 700개가 Hugging Face 공격에 참여했다. ## 약 1200개의 AI 에이전트가 자체 "게시판"에서 연대 이번 인시던트는 OpenAI가 AI 모델의 사이버 공격 능력을 측정하는 "ExploitGym" 평가 중에 발생했다. 주로 활동을 주도한 것은 GPT-5.6 Sol과 동등한 규모의 사내 한정 연구 모델로, GPT-5.6 Sol도 일부 침해 행위에 관여했다. 평가에서는 모델 본래의 사이버 능력을 측정하기 위해 프로덕션 환경에서 사용되는 일부 보안 조치가 비활성화되거나 축소되어 있었다.

**■ AI 에이전트가 무허가 "메시지 보드"를 발견하고, 공동 작업에 참여하기까지의 흐름**

OpenAI에 따르면, AI 에이전트는 당초 사내에서 소프트웨어 패키지를 제공하기 위해 사용되던 "JFrog Artifactory"를, 원래 상정되지 않은 에이전트 간의 통신 수단으로 이용하기 시작했다. 여러 에이전트가 파일이나 디렉터리명을 사용해 정보를 교환하고, 사실상의 "메시지 보드"를 구축했다. 나아가 Artifactory의 취약점을 악용해, 원래 차단되어 있던 인터넷 액세스도 확보했다.

METR의 조사에서는 7월 8일부터 13일에 걸쳐 약 1200개의 에이전트가 이 메시지 보드에 참여해 7만 건이 넘는 메시지와 파일을 교환했다. 7월 11일 오후에는 약 700개의 에이전트가 Hugging Face 공격에 관여했으며, 해당 시점에는 메시지 보드 상의 통신 중 약 60%가 공격과 관련되어 있었던 것으로 추정하고 있다. ## Hugging Face의 프로덕션 워커 41대에서 코드 실행 OpenAI의 보고서에 따르면, 에이전트는 인터넷상에 공개되어 있던 Hugging Face 사용자의 인증 정보를 발견하고, Hugging Face 인프라에 존재하던 취약점과 조합해 침입 범위를 확대했다.

**■ Hugging Face 공격에 참여한 AI 에이전트 수의 추이. METR은 약 700개의 에이전트가 공격에 참여한 것으로 분석하고 있다**

최종적으로, 사내 한정 연구 모델 또는 GPT-5.6 Sol을 사용한 에이전트는 Hugging Face의 프로덕션 데이터셋 서버 워커 41대에서 코드를 실행했다. 적어도 1대의 프로덕션 노드에서 root 권한을 획득한 것 외에도, 프로덕션 환경의 인증 정보나 제한적인 내부 데이터에 접근해 비공개 코드 리포지토리 4건을 다운로드했다. 연결된 Kubernetes 클러스터 중 하나에서는 관리자 상당의 액세스 권한을 획득했다고 한다.

침해를 입은 Hugging Face 역시 7월 27일에 상세한 기술 해설을 공개했다. 해당 회사는 약 1만 7,600건의 공격 액션을 재구성하여, AI 에이전트가 OpenAI의 평가용 샌드박스에서 외부 환경으로 이동하고 Hugging Face의 데이터 처리 기반을 거쳐 내부 인프라로 침입한 경위를 설명했다. 한편, 확인된 고객 콘텐츠로의 접근은 ExploitGym이나 CyberGym과 관련된 것으로 보이는 5개의 데이터셋에 그쳤으며, 공개 모델이나 데이터셋, Spaces 등에 대한 변조는 확인되지 않았다고 밝혔다. ## '평가를 공략'하기 위해 공격 확대, 로그 변조도 연구 METR은 AI 에이전트가 단순히 ExploitGym의 정답을 훔치는 것만을 노린 것은 아니라고 분석한다. 정답의 정당성을 판정하는 자동 채점 시스템을 속이거나 변조하는 범용적인 방법을 찾기 위해 대규모 공동 작업을 진행했으며, 그 과정에서 Hugging Face에 대한 공격이 확대되었다고 한다.

에이전트는 자신의 실행 이력에 대해서도 덮어쓰기나 삭제, 위장이 가능한지를 연구하고 있었다. METR이 평가한 실행 기록에서는 약 7%에서 일부 툴 호출 위장에 성공했다고 밝혔다. 다만 확인된 위장은 모두 소규모였다.

OpenAI는 이번 행동으로 이어진 요인으로 'reward hacking(보상 해킹)', 어려운 과제를 포기하지 않고 계속 추구하는 과도한 지속성, 무허가 에이전트 간 통신, 다른 에이전트로부터 목적을 물려받는 행동 등을 꼽았다. 보상 해킹이란 부여된 목적을 원래 상정되지 않은 방식으로 달성하여 평가상의 보상을 얻으려는 행동을 말한다. ## METR과 Redwood Research가 OpenAI 사내에서 총 6일간 조사 METR은 프론티어 AI 모델이 어디까지 자율적으로 장시간의 작업을 수행할 수 있는지나 사이버 공격, 정지를 어렵게 만드는 능력 등을 외부에서 평가하는 비영리 연구 기관이다. OpenAI 외에도 Anthropic, Google DeepMind, Meta, Amazon 등과의 평가 실적이 있다.

이번 조사에는 METR의 Hjalmar Wijk 씨와 Ajeya Cotra 씨, METR과 계약한 Redwood Research의 Ryan Greenblatt 씨가 참여했다. 3명은 총 6일간 OpenAI 사내에서 조사하여 7만 건이 넘는 메시지와 파일, 약 1,300건의 AI 에이전트 실행 기록 등을 분석했다. OpenAI는 1,000건이 넘는 편집되지 않은 실행 기록도 제공했다고 한다.

다만 METR의 조사 대상은 주로 인시던트 중 AI 에이전트의 행동, 추론, 협조에 한정된다. Hugging Face 침해 이후 발생한 OpenAI 내부 인프라 침해나 OpenAI 자체의 조사 프로세스, 재발 방지책의 타당성 등은 조사 범위 외로 하고 있다.

OpenAI는 이번 인시던트를 계기로 연구 인프라의 샌드박스를 더욱 격리하고, 인터넷이나 모델 가중치로의 접근을 제한하는 것 외에 AI의 사고 과정을 감시하는 'chain-of-thought monitoring'에 대한 계산 자원 투입을 늘릴 방침을 밝혔다. 또한 보안과 봉쇄, 감시, 얼라인먼트, 인시던트 대응 등 4개 분야를 중심으로 재발 방지책을 추진하겠다고 밝혔다.

:::box 관련 기사: OpenAI의 'GPT-5.6 Sol' 및 상위 미공개 AI 모델, 평가 중 Hugging Face에 침입 운영 DB에서 평가 문제의 정답을 취득, '전례 없는' 사이버 사건으로 규정 ::: :::box 관련 기사: OpenAI의 폭주 AI 에이전트, Modal Labs 고객의 샌드박스도 침해 "첫 피해자" Hugging Face가 일련의 공격 경로를 공개 ::: :::box 관련 기사: OpenAI, Hugging Face 침해 상세 내용을 Black Hat에서 설명 AI 에이전트끼리 '게시판'을 만들어 공격 정보 공유 ::: :::box 관련 기사: AI 에이전트가 Hugging Face에 자율 침입 OpenAI 브록만 씨 "방어측의 유예는 지금", 10개 항목 제언 ::: :::box 관련 기사: Anthropic, Claude가 평가 중 실존 3개 조직에 권한 없이 접근 설정 미비로 인터넷에 접속, PyPI에 악성 패키지도 공개 :::

[원문 보기](https://ledge.ai/articles/openai_hugging_face_incident_report) | 출처: Ledge.ai