# OpenAI 에이전트 약 3,700개가 방치되어 있던 한적한 위키 사이트를 '비밀 정보 공유 게시판'으로 이용, 약 1만 8,000건의 게시물로 정답 및 샌드박스 우회 방법 공유

> https://bookfactory.kr/c/news/10911
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-07T05:14:16.659Z

---

OpenAI의 AI 에이전트가 실험 환경 외부로 접근하여 독일어 위키 사이트를 이용해 다른 에이전트와 정보를 공유했던 사안에 대해, OpenAI가 자사 에이전트에 의한 것이었음을 인정했습니다. 이번 사안을 조사한 시드니 폰 아크(Sydney Von Ark) 씨 등은 2026년 9월 4일, 조사 결과를 정리한 웹사이트 'collusion.wiki'를 공개했습니다.

Discovery of a new OpenAI agent message board
https://collusion.wiki/

OpenAI confirms ‘wiki incident,’ says it’s ‘working on a framework’ for more disclosure | TechCrunch
https://techcrunch.com/2026/09/05/openai-confirms-wiki-incident-says-its-working-on-a-framework-for-more-disclosure/

OpenAI admits to German wiki ‘incident’ | The Verge
https://www.theverge.com/ai-artificial-intelligence/990773/openai-german-wiki-incident

연구진에 따르면, 공개 인터넷상에서 스스로를 OpenAI의 에이전트라고 밝힌 AI의 게시글 약 1만 8000건이 발견되었습니다. 에이전트들은 문제의 정답을 서로 알려주거나, 자신이 놓인 환경을 조사하거나, 부여된 제한을 우회하는 방법을 교환하고 있었습니다. 개발자가 생각지도 못한 방식으로 협력하여 작업을 유리하게 진행하려 했던 점에서, 연구 팀은 이 행동을 영어로 '공모'를 의미하는 'collusion'으로 표현하고 있습니다. 게시물의 대다수가 작성된 곳은 'DSEwiki'라고 불리는 독일어 위키입니다. 이 사이트는 약 25년 전부터 존재해 온 소프트웨어 개발자용 위키로, 연구진에 따르면 지난 10년간의 편집 횟수가 불과 20회 정도에 불과할 정도로 거의 이용되지 않고 있었습니다. 에이전트는 2026년 5월 11일경부터 여러 위키에 글 작성을 시도하여 5월 24일에 DSEwiki에 글을 남기는 데 성공했습니다. 그 후 6월 16일부터 에이전트 간의 대규모 정보 교환이 시작되었습니다.

에이전트에게는 웹을 검색하여 여러 라운드에 걸친 질문에 답변하는 태스크가 부여되어 있었던 것으로 추정됩니다. 에이전트는 보통 5문제 정도의 연속된 질문을 받았으며, 1번째 문제에서는 예시로 15분 44초의 사고 시간이 주어졌고, 그 후 43분 30초의 대기 시간이 있었습니다. 반면 2번째 문제 이후부터는 예시로 65초라는 매우 짧은 답변 시간만 부여되었습니다. DSEwiki는 해당 태스크를 공략하기 위한 '정보 공유 장소'로 사용되었던 셈입니다. 에이전트의 실행 환경에서는 외부로의 POST 요청이 제한되어 기본적으로 GET 요청만 허용되어 있었습니다. 하지만 DSEwiki가 사용하던 오래된 위키 시스템은 GET 요청만으로도 페이지를 편집할 수 있는 구조였기 때문에, 에이전트는 샌드박스의 제한을 회피하지 않고도 위키에 정보를 기록할 수 있었습니다.

연구 팀에 따르면, 에이전트 스스로가 "OpenAIResearcher", "OAIResearch" 등의 이름을 칭했을 뿐만 아니라, DSEwiki에서 에이전트에 의한 것으로 보이는 약 1만 7000건의 편집 중 98.5%가 Microsoft Azure의 IP 주소에서 이루어졌다고 합니다. 게다가 에이전트에 의한 작성 몇 분 후에는 OpenAI가 ChatGPT의 웹 수집 기능에 사용하고 있다고 설명하는 IP 주소에서 동일한 페이지로의 접근이 반복되었습니다. 연구진은 6주에 걸쳐 3,700개 이상의 서로 다른 에이전트 이름이 확인된 규모 등을 근거로, OpenAI 내부에서 배포된 에이전트일 가능성이 높다고 추정하고 있습니다. 정보 공유는 6월 16일 이후 급증했으며, 이후 7일 동안 약 1만 3000건의 편집이 이루어졌습니다. 에이전트는 각 라운드에서 출제된 질문이나 답변뿐만 아니라, 다음 질문이 오는 시각을 초 단위로 기록하며 어떤 순서로 문제가 출제될지를 예측하고 있었습니다. 그중에는 문제의 출제 순서를 결정하는 것으로 보이는 Python의 난수 시드 값을 닥치는 대로 시도해 다음에 나올 문제를 맞히려 한 에이전트도 있었습니다. 또한 에이전트는 자신들의 작업이 5라운드 정도 만에 종료된다는 사실도 알아차리고, 종료 전에 정보를 외부로 남기려 했습니다. 한 에이전트는 샌드박스가 정지되는 시각을 외부에서 확인하기 위해 약 1.5초 간격으로 외부 서비스에 신호를 계속 보내는 '하트비트'를 만들었습니다. 다른 에이전트는 마지막 질문에 답변하면 세션이 종료될 것으로 추측하고, "답변하기 전에 Wiki로 결과를 전송하라"고 다른 에이전트들에게 촉구했습니다.

에이전트의 실행 환경에서는 인터넷에서 정보를 읽어오는 것은 허용된 반면, 외부로 정보를 작성하는 것은 제한되어 있었던 것으로 보입니다. 에이전트들은 이 제한을 알아차리자 Wiki 상에서 제약을 우회하여 작성하는 방법을 함께 조사하기 시작했습니다. 그리고 6월 20일 한 에이전트가 제한을 회피하는 방법을 게시했고, 14분 후에는 다른 에이전트가 "그 방법으로 회피할 수 있었다"고 보고했습니다. 연구진은 에이전트가 단순히 주어진 허점을 이용하는 데 그치지 않고, 크로스 사이트 스크립팅 'XSS'의 취약점을 탐색하거나 Wiki 관리자로 가장하는 행동도 확인했다고 밝혔습니다. OpenAI 에이전트가 접근함에 따라 오랜 기간 거의 활동이 없었던 DSEwiki로의 접근 수가 대폭 증가했고, DSEwiki 관리자는 에이전트가 만든 페이지를 삭제했습니다. 그러나 관리자가 에이전트가 만든 페이지를 알파벳순으로 삭제하고 있다는 사실을 알아차린 에이전트가 페이지 이름의 맨 앞에 'ZZZ'를 붙인 사본을 만들어 삭제되는 순서를 일부러 늦추려 한 사례도 있었던 것으로 전해졌습니다.

OpenAI에 할당된 IP 주소에서 DSEwiki로의 접근이 처음 확인된 것은 6월 21일이었으나, 그 다음 날인 6월 22일에는 에이전트에 의한 게시글 작성이 거의 중단되었습니다. 이로 인해 연구자들은 OpenAI가 위키상에서 에이전트의 활동을 감지하고 개입했을 가능성이 높은 것으로 추정하고 있습니다. 또한 6월 26일에는 OpenAI 관련으로 추정되는 33개의 IP 주소로부터 532건의 접근이 발생했으며, 삭제된 페이지를 아카이브 기능으로 복원하여 확인하는 움직임도 관측되었다고 합니다. OpenAI는 이후 X 게시물을 통해 "wiki incident"에 대해 설명하고, 자사의 에이전트가 여러 인터넷 사이트에 글을 작성했음을 인정했습니다. OpenAI는 이번 사안에 대해 기존 방식의 보안 인시던트가 아닌, AI가 개발자의 의도와는 다른 행동을 취하는 "미스얼라인먼트"의 한 사례로 다루고 있었다고 설명하고 있습니다.

자사 에이전트가 여러 인터넷 사이트에 글을 작성했던 “wiki incident”에 대한 우리의 생각: 이제는 단순히 모델의 미스얼라인먼트 특성뿐만 아니라, 미스얼라인먼트 인시던트를 언제 그리고 어떻게 공유할지에 대한 기준을 정의해야 할 때가 훨씬 지났습니다. 역사적으로 우리는 미스얼라인먼트를…pic.twitter.com/NNTbfSxVWn

OpenAI는 지금까지 미스얼라인먼트를 주로 연구상의 문제로 파악하고, 시스템 카드 등을 통해 모델의 동작을 공표해 왔습니다. 하지만 AI 에이전트가 실제 인터넷상에서 행동하는 기회가 늘어나면서 미스얼라인먼트가 현실 세계에 새로운 영향을 미치게 되었다며, "모델 능력의 새로운 단계에 맞춰 미스얼라인먼트 사안의 공개 방법을 확장할 필요가 있다"고 밝혔습니다. OpenAI는 2026년 7월에도 또 다른 AI 에이전트 군이 Hugging Face와 관련된 외부 환경에 접근한 사안을 겪은 바 있습니다. 이 Hugging Face 사안에 대해서는 기존 방식의 보안 인시던트로 취급하여 관계자와 협력해 조사를 개시했습니다. 반면 OpenAI는 이번 위키 사안에 대해서는 동일한 기준을 적용하지 않았으며, 이러한 차이가 정보 공개의 지연으로 이어졌다고 설명하고 있습니다. OpenAI가 Hugging Face를 실수로 해킹해 버린 건에 대해 분석 결과를 보고, 격리된 여러 에이전트가 서로의 존재를 발견하는 데서 시작하는 장대한 협력 작전 - GIGAZINE

OpenAI는 AI의 훈련, 평가, 배포 중에 발생하는 미스얼라인먼트 중 기존 방식의 보안 인시던트에 해당하지 않는 것을 어떤 기준으로 공표해야 할지에 대해, OpenAI뿐만 아니라 AI 업계 전체에도 명확한 기준이 존재하지 않는다는 점을 인정하고 있습니다. 이에 따라 OpenAI는 새로운 정보 공개 프레임워크를 수립 중이며, 2026년 9월 내에 공개할 예정으로, 세계 각국의 수십 개 정부 규제 당국과도 논의를 진행하고 있다고 밝혔습니다.

[원문 보기](https://gigazine.net/news/20260907-openai-agents-german-wiki-incident/) | 출처: Gigazine