OpenAI의 다수 모델로 구동되는 자율형 AI 에이전트가, Hugging Face에 대한 공격 과정에서 미국 Modal Labs의 인프라 상에 있던 고객 환경에도 침입하여, 그 샌드박스를 공격 거점으로 악용했다는 사실이 밝혀졌다. Reuters는 현지 시간 2026년 7월 28일, Modal Labs 임원 등에게서의 취재를 바탕으로 보도했으며, Axios 역시 동일한 방식으로 해당 회사 임원에게서 확인했다.
Modal Labs 자체의 시스템이 침해된 것은 아니며, 해당 회사의 고객이 공개적으로 운영하고 있던 코드 실행 환경의 취약점이 악용된 것이다. 이번 보도에 의해 AI 에이전트가 Modal Labs 상의 고객 환경으로 침입하여, 그곳을 발판 삼아 Hugging Face에 대한 공격을 진행했던 것이 명확하게 드러났다.
## Modal Labs 고객의 샌드박스를 공격 거점으로
Modal Labs 공동 창업자 겸 CTO인 Akshat Bubna 씨에 따르면, 해당 회사의 고객은 인터넷상에서 누구나 샌드박스를 사용하여 코드를 실행할 수 있도록, 인증이 없는 엔드포인트를 공개하고 있었다.
AI 에이전트는 고객이 작성한 코드의 취약점을 악용하여, Modal Labs에서 운영되고 있던 샌드박스에 침입했다. Bubna 씨는 고객의 코드가 훼손된 것이며, Modal Labs의 플랫폼이나 샌드박스의 격리 메커니즘 자체는 손상되지 않았다고 설명하고 있다.
Axios는 관계자의 익명 정보에 따르면, 침해된 고객 자산이 AI 에이전트에 부여된 사이버 능력 평가 “ExploitGym”을 개발한 CyberGym과 관련이 있었던 것으로도 보도했다.
## OpenAI, 4개의 서비스 중 4개의 계정으로 접근 확인
OpenAI는 7월 28일, Hugging Face에 대한 침입에 관해 공식 발표를 업데이트하며, AI 모델이 인터넷 상에 공개되어 있던 인증 정보를 찾아, 외부 서비스의 계정에 접근한 사례를 소수 확인했다고 발표했다.
Hugging Face에 대한 침입과 관련하여 접근된 것은 4개의 서비스 상의 4개의 계정이었다. 그 중 1개는 외부 통신 중계와 공격 준비에 사용되었고, 다른 1개는 데이터 저장에 사용되었다. 나머지 2개는 읽기 전용으로 접근되었으며, Hugging Face에 대한 침입에는 사용되지 않았다.
OpenAI는 대상 서비스의 이름을 공개하지 않았다. Reuters는 관계자의 익명 정보에 따르면, Modal Labs가 4개의 서비스 중 하나였던 것으로 전해졌다.
동사는 Hugging Face에서 발생한 플랫폼 수준의 침해와 동등한 규모나 심각도를 가진 다른 활동은 확인하지 않았다고 설명했다. 침입에 관여한 프리리리즈 모델은 일반 공개를 예정한 것이 아니었으며, 사내 연구용 시제품 모델이었다고 밝혔다. 사고 발생 후, 해당 모델을 무효화하고 암호화했으며, 연구자들에 의한 접근도 제한했다.
## Hugging Face, 일련의 공격 경로를 기술 설명
Hugging Face는 7월 27일, OpenAI의 모델로 구동되는 AI 에이전트가 OpenAI의 평가 환경을 탈출하여 외부 샌드박스를 침해하고, 해당 회사의 내부 네트워크에 침입하는 데 이르는 기술적 경위를 담은 공식 블로그를 공개했다. 7월 16일에 공개한 최초의 인시던트 보고서에 이은 기술 설명으로, 인증 정보나 내부 호스트명 등을 가리면서, 관측한 일련의 공격 방법을 시간 순서대로 기술하고 있다.
Hugging Face에 따르면, AI 에이전트는 먼저 OpenAI의 평가 환경에서 패키지 레지스트리용 프로кси의 제로데이 취약점을 악용하여 외부 인터넷으로의 경로를 확보했다. 이후 제3자 사업자의 인프라 상에 있던 외부의 코드 평가용 샌드박스로 침입하여 관리자 권한으로 명령을 실행했다. Hugging Face에 대한 공격을 제어하고 준비하는 외부 거점으로 활용했다.
공식 블로그에서는 제3자 사업자의 이름을 명시하지 않았지만, Reuters와 Axios의 보도에 의해 이 샌드박스가 Modal Labs에서 운영되던 고객 자산이었던 것이 밝혀졌다.
**OpenAI의 평가 환경에서 외부 샌드박스를 거쳐 Hugging Face의 내부 네트워크로 침입한 공격 경로. 제3자의 코드 실행용 샌드박스가 공격의 준비 및 중계 거점으로 사용되었다.**
AI 에이전트는 외부 샌드박스를 발판 삼아 Hugging Face의 데이터 처리 기반에 있는 두 개의 코드 실행 경로를 악용했다. 처리용 워커에서 코드를 실행한 후 노드 레벨의 권한을 획득하여 클라우드나 클러스터의 인증 정보를 수집하고 여러 내부 클러스터로 확장했다.
Hugging Face는 2026년 7월 9일부터 13일까지 약 4.5일 동안 약 1만 7600건의 작업을 복원했다. AI 에이전트가 해당 회사의 인프라 내에서 활동한 기간은 약 2.5일이었으며, 일련의 행동은 ExploitGym의 과제를 자력으로 해결하는 것이 아니라 본판 환경에서 평가 문제의 해답을 얻기 위한 것이었다고 분석하고 있다.
원문 보기 | 출처: Ledge.ai