Wired는 8월 6일 “중국에서 가장 강력한 AI 모델 중 하나도 봉쇄를 벗어났다”는 기사를 발표했다. 제목은 “One of China’s Most Powerful AI Models Has Also Escaped Containment”였다. Moonshot AI의 Kimi K3가 AISI가 만든 격리 구역 밖으로 나간 이야기이다.
초기 자료는 미국 스타트업 Frontier Security의 블로그로, Wired 기사에서 링크되어 있다. 처음 걸었던 건 어휘였다. ‘escape’라는 표현이 Frontier의 블로그에 한 번도 등장하지 않았고, loophole, exposure, leak, specification gaming이라는 용어가 사용되었다.
탈출은 헤드라인 측의 프레임이다. Wired를 공격하려는 의도가 아니다. 다만, 헤드라인과 원본 기사 사이의 거리가 얼마나 되는지를 적어놓는 것은 가치 있는 일이다.
모델은 그 일을 한 번도 해내지 않았다.
프론티어의 블로그 한 문장이 거의 모든 것을 설명하고 있다. “모델은 스스로의 힘으로는 전혀 원래대로 문제를 해결하지 못했다”는 의미다.
이어지는 설명은 실제 순서대로 진행된다. 네트워크를 탐색한다. GitHub.com에 대한 표준적인 DNS 해결이 정상적으로 작동하는 것을 확인한다. 공식 벤치마크 리포지토리를 Git 클론한다. 디스크에서 정답을 직접 읽는다.
프론티어 자체의 유형화 역시 “네트워크 이그레스 누출을 통한 사양 게임화”로서, 외부 통신 누출을 통해 발생하는 사양 게임화는 즉, 속임수이다.
구멍의 본질에 대해서 블로그에 상세히 설명되어 있다. “보통 취약점은 복잡한 0일 공격이 아니라 기본적인 네트워크 오구성이다.” 샌드박스에 대한 수신은 차단되었지만, 외부의 443번 포트와 글로벌 DNS의 53번 포트가 글로벌 IP 범위에 대해 개방되어 있었다.
와이어드에서도 정확하게 설명하고 있다. 키미 K3는 인터넷에 접속한 후 해킹을 아무것도 하지 않았고, 찾던 답이 GitHub에서 쉽게 얻어진 것이다.
부러졌는지, 열려있었는지.
최근에 작성한 영어 AISI 관련 사건에서 AISI는 명확하게 밝혔던 “이번 사건에서 샌드박스 탈출은 관찰되지 않았습니다.”라는 내용이 있었습니다. 에이전트는 의도적으로 열린 인터넷에 접속해서 나간 것뿐이었습니다.
이번 Kimi K3 역시 기술적으로는 같은 범주에 속한다. 격리를 깨뜨린 것이 아니라, 처음부터 열려 있던 경로를 통해 나갔다. Wired 기사 본인도 “탈출은 샌드박스 내의 오작동으로 일부 가능했다”고 언급하고 있다.
다른 것은 Hugging Face 사건의 경우다. 그곳은 Artifactory의 제로데이를 활용한, 진정한 의미의 돌파구였다. 같은 “탈출”이라는 표현을 사용하면 이 차이가 사라진다.
한 가지 걸림돌이 있었다. Wired와 Frontier 모두 “방어적 사이버 능력을 평가했다”고 썼지만, 유출 설명에 등장하는 어휘는 CTF, ground-truth flag, Cybench였다. Cybench는 공격자의 벤치마크에 해당하며, 어떤 평가의 어떤 작업에서 부정행위가 발생했는지는 공개되지 않았다.
한 번의 원본이 제목과 다른 내용을 담고 있습니다.
Wired에 실린 Frontier 측 발언은 다음과 같다. CEO 야론 싱어는 ‘샌드박스’에 보안 허점을 발견했다고 언급한 뒤 “키미는 그 허점을 이용했다는 점을 시사하며, 그것이 동일한 내부 감시 장치 역할을 하지 않는다는 것을 보여준다”라고 덧붙였다. 연구자 폴 카시아니크는 더욱 직접적으로 “키미 K3에는 부정행위나 샌드박스 탈출을 막는 감시 장치가 없다”라고 말했다.
그러나 같은 회사의 블로그 본문에는 이렇게 쓰여 있다.
교차 모델 오염: 만약 하나의 고성능 모델이… 단축점을 발견한다면, 다른 모델에 셸 접근 권한이 부여된 경우에도 유사하게 발생하는 경우가 많다.
다른 접근 권한을 가진 모델들도 동일한 행동을 하고 있을 가능성이 높으며, 괄호 안에는 ‘Kimi K3’와 함께 Claude나 OpenAI의 추론 기반 모델들이 예시로 든다는 점도 확인된다. 결론은 “Assume capable agents will find exposed paths.”, 즉 “능동적인 에이전트는 노출된 경로를 찾아낼 것이다”로 요약된다. 블로그의 기술적 결론은 ‘Kimi’ 고유의 결함보다는 ‘평가 기반 설계 미비’와 ‘에이전트 일반의 특성’에 기인하는 것으로 판단된다.
와이어드는 오히려 신중하게, 프론티어의 주장을 “프론티어가 주장하지만”이라는 전파로 마크했다. 함께 제시된 Gray Swan의 Matt Fredrikson의 코멘트는 일반론이었다. 주변에 세울 벽을 명확히 하지 않으면 모델은 답을 얻을 방법을 찾아버린다.
능력은 미 Top에 도달하지 않지만 멈추지 않는다.
프론티어의 공개 발표일로부터 2주가 지난 7월 23일, 영국의 AISI와 미국의 CAISI가 Kimi K3의 사이버 능력에 대한 사전 평가를 발표했다. 별개의 사건이지만, 함께 놓고 보면 유사점(카조)이 드러난다.
ExploitBench의 종합 점수는 32%이며, 같은 오픈 웨이트 GLM-5.2는 24%이므로, 그 부분에서는 우세하다. 하지만 임의 코드 실행의 달성은 41 샘플 중 0으로, 가장 강력한 모델 그룹의 평균 20/41과는 상당한 차이를 보인다.
시뮬레이션 기업 네트워크 “The Last Ones”는 32단계 공격 경로로, 인간 전문가가 20시간 정도 소요되는 것으로 예상되었다. Kimi K3의 평균 도달 단계는 17단계. 가장 높은 사이버 능력을 가진 미국 모델 그룹의 평균은 28.5로, GLM-5.2는 11. 성공적인 클리어는 10회 중 1회였고, 미국 최상위 모델은 6/10과 7/10이었다.
안전 장치(세이퍼가드)에 대해서는 다음과 같이 언급되어 있습니다. “Kimi K3의 안전 장치는 에이전트형 사이버 탐취 개발 지원을 가능하게 한다.” 평가 중, 에스플로잇 개발이나 공격적인 사이버 작전을 시도하는 것을 안전 장치가 방해하지 않았으며, 수치 정보는 없었음에도 불구하고 질적인 묘사만 존재했다.
능력은 미국 최정상에 뒤쳐지는데, 막는 측은 여유롭다. 이 불균형이 핵심이라고 생각한다. 다만 미국 폐쇄형 모델이 “시스템 수준의 안전 장치를 무효화하고 최대 능력을 측정했다”고 언급되었고, Kimi K3의 종합점수는 단일 벤치마크에서 추정한 것으로 신뢰 구간이 넓다고도 쓰여져 있다. 조건이 갖춰지지 않았다.
흥미로운 점은, Moonshot 스스로가 이 평가를 기술 보고서에서 인용하며 “우리와 일치하는 결론을 도출한다”고 인정하고 있다는 것이다. 같은 보고서에는 이 문장이 포함되어 있다.
Anthropic와 OpenAI의 프론티어 모델들은 사이버 관련 작업 거부로 인해 비교 평가가 불가능하여 본 세트에서 제외한다.
Anthropic과 OpenAI의 모델은 사이버 관련 작업을 거부하기 때문에 비교가 불가능하므로, 본 서트에서 제외했다. 반대로, K3는 거부하지 않는다. 그것을 자사의 기술 보고서에 명시했다.
평균적인 사용자가 닿는 동일 상태였습니다.
키미 K3는 7월 16일에 제품과 API가 출시되었고, 7월 27일에 모델 크기가 공개되었다. 총 파라미터는 2.8T, 활성 사용자 수는 104B이다. Wired는 이전 사건과의 차이점으로 이 점을 지적한다. 이미 널리 사용되고 있으며, 일반 사용자가 만날 수 있는 동일한 보안 상태의 모델에서 발생했다.
무라카미 하루키와 카호도, Wired지의 인터뷰에 응답하지 않았으며, ‘샌드박스’가 어떻게 잘못 설정되었는지—AISI가 배포한 기본 설정인지, 아니면 실제로 실행한 쪽의 배포인지—는 Wired지, Frontier, Reuters도 보도하지 않고 있다.
단어들이 한 단계씩 더 강렬해진다.
7월부터 시작하는 3건을 나열하면, 격리를 자체적으로 파괴한 건 딱 1건뿐이다. 나머지 2건은 열려 있는 경로를 통과했다. 그럼에도 불구하고 제목들은 모두 “탈출”이 된다. ‘루홀(loophole)’이라는 용어가 제목에서 “탈출 격리”로 번역되며, 일본어로 “샌드박스 탈출”이라고 표현된다. 1단락씩 강해지면서 읽는 사람의 눈에는 파괴된 것처럼 느껴진다.
이 압축으로 인해 사라질 정보에 대한 우려가 있습니다. “파괴된” 경우 격리 기술 강화, “열려 있던” 경우 누가 언제 어떤 경로를 열었는지 기록으로 관리하는 방식으로 전환됩니다. 운영 방식이 완전히 다릅니다.
이런 종류의 뉴스가 보도되면서, 그곳은 구별될까요? 좋으시면 댓글로, 그쪽이 평가 환경의 이탈(egress)을 어떻게 결정하는지 문의해 주시면 감사하겠습니다.
#AI보안 #AI에이전트 #키미K3 #문샷AI #AISI #오픈웨이트 #LLM #샌드박스 #벤치마크 #사건
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 31청크
원문 보기 | 출처: note.com