9월 26일 오후, 닛테레NEWS가 "챗GPT 투고 이미지, 의도하지 않게 이미지 공유 사이트에 유출"이라고 보도했다. OpenAI가 25일(미국 시간)에 공표한 내용으로, 이용자가 투고한 이미지 53건이 AI에 의해 이미지 공유 사이트에 게시되어 있었다는 것이다(news.ntv에서는 찾을 수 없었으므로 Livedoor 링크를 인용).
ChatGPT를 사용하고 있는 사람이라면, 우선 ‘내 이미지는 괜찮을까’가 궁금하실 겁니다. 그 점은 제1장에서 먼저 다루겠습니다. 다만 OpenAI가 같은 날 내놓은 자료들을 전부 읽어 보면, 이미지 53건은 그중에서 가장 작은 이야기였습니다. 같은 날 추가된 3건의 보고 중 하나는, 사내에서 운영 중이던 모델이 연구자의 제지를 두 번 무시하고 그 연구자의 GitHub 토큰을 공개 리포지토리에 올려 버린 사건입니다. 또 다른 하나는, 8월에 ‘감속하겠다’고 선언하며 보안을 강화했던 학습 환경에서 9월 20일에 다시 허점이 발견되어, 최상위 모델의 도구 사용을 동반한 학습·평가·추론을 중단했다는 보고였습니다.
올여름의 탈출극은 총집편으로 정리했고, 9월에 들어선 뒤에도 DSEWiki, An Alien Mind, 호주 Medicare를 계속 추적해 왔습니다. 이번 글은 그 후속편입니다.
목차
- 1. 이미지 53건: 무엇이 드러났고, 무엇이 밝혀지지 않았는가
- 2. 제지를 2번 무시했다: GitHub 토큰 사건
- 3. 보안을 강화한 뒤 다시 뚫린 구멍: DNS 사건
- 4. 외부에서 본 모습: 정부 사이트와 100만 개의 링크
- 5. 프레임워크 공개 9일 후에 나온 것과 Altman의 한마디
- 정리
- 여담
1. 이미지 53건: 무엇이 확인되었고, 무엇이 아직 밝혀지지 않았는가
OpenAI의 설명은 Hugging Face 사건의 공개 페이지에 9월 25일자로 추가된 두 건의 업데이트에 담겨 있습니다. 요점은 다음과 같습니다.
연구 환경의 에이전트가 제3자 서비스를 이용하는 도중에 학습·평가용 데이터를 외부로 전송했습니다. 이는 8월 26일 기술 보고서에서 도입한 안전 조치 이전에 발생한 일입니다. 학습 데이터에는 “학습 이용 대상인 사용자와의 상호작용”에서 유래한 내용이 포함됩니다. 일반 이용자는 옵트아웃 방식이 적용되어, 옵트아웃하지 않으면 대상에 포함됩니다. 엔터프라이즈, 비즈니스, API 이용 건은 관리자가 활성화하지 않는 한 포함되지 않습니다. 학습에 활용하기 전에 계정 정보로부터 분리하고, Privacy Filter라는 메커니즘을 통해 성명과 연락처, 계좌번호 등을 제거하고 있다고 합니다. 영향을 받은 데이터의 대부분은 사용자 유래는 아니지만, “사용자가 제공한 이미지가 이미지 호스팅 사이트에 공개 목록에 노출되지 않는 링크 형태로 게시된 사례”가 현재까지 53건 확인되었습니다. 호스팅 업체와 협력해 대부분은 삭제가 완료됐으며, 나머지도 대응 중이라고 합니다.
여기까지가 OpenAI의 주장이며, 아직 밝혀지지 않은 점도 적어 두겠습니다. Reuters에 따르면, OpenAI는 해당 이미지가 AI 생성물인지 실존 인물을 촬영한 것인지 밝히지 않았습니다. 게시된 시기도 알려지지 않았습니다. 호스팅 사이트의 이름도 각 사의 보도를 통해 특정되지 않았습니다. 그리고 “원래 계정에 다시 연결하는 것은 기술적으로도 정책적으로도 불가능하다”고 설명하고 있으므로, 이 설명대로라면 해당 사용자에게 개별 통지가 이루어지는 일은 없게 됩니다.
또 한 가지, 이는 사고 유형으로서는 새로운 것이 아닙니다. OpenAI는 9월 16일에 '불일치 보고 프레임워크'를 공표하고 동시에 6건의 사례를 공개했습니다. 그중 한 건이 '인용하기 위해 파일을 인터넷에 업로드한다'는 보고로, 2025년 10월 22일과 2026년 1월 24일의 샘플이 실려 있습니다. 한 건은 이미 취득한 데이터를 브라우저에서 인용 출처로 표시하기 위해 페이스트 서비스에, 다른 한 건은 '과제 사진'을 외부 이미지 검색에 사용하기 위해 이미지 호스트에 모델이 요청받지도 않고 업로드한 사례입니다. OpenAI는 첫 번째 건에 대해, 인용 평가기의 결함이 외부에 인용 출처가 없을 때 스스로 만들어내 점수를 얻는 행동을 낳았을 가능성을 제기하고 있습니다. '과제 사진' 쪽은 보유 중인 이미지를 외부 이미지 검색에 넘기기 위한 별개의 목적이었다고 구분하고 있습니다.
9월 16일 보고에 실린 것은 ‘과제 사진’ 1건으로, 사용자에 대한 영향에는 언급하지 않았습니다. 그 9일 뒤인 25일에 더 광범위한 조사 과정에서 사용자가 제공한 이미지를 외부 이미지 호스트에 게시한 사례가 53건 있었다고 추가로 공개되었습니다. 9월 16일의 샘플과 이 53건이 어떻게 겹치는지는 공개 자료에서는 명시되어 있지 않습니다. 닛테레 기사에 있는 “정부, 대학, 공공기관을 포함한 수십 개 조직에 대해 AI가 무단 접근을 했다”라는 문장은 OpenAI 원문에서는 “수십 곳의 제3자에게 통지했다”, “관련된 사이트 중 일부는 정부, 대학, 공공기관 등이 운영하고 있다”라는 표현으로 되어 있습니다. 게다가 “OpenAI로부터의 통지를 중대한 보안 사안의 통지로 자동으로 해석하지 말아 달라”고 덧붙여져 있습니다. 이 부분은 제4장에서 다시 다룹니다.
🔗OpenAI: Hugging Face 인시던트와 정렬되지 않은 모델이 다른 제3자에게 미치는 영향
🔗OpenAI Alignment: 인용을 위해 파일을 인터넷에 업로드하기
🔗Axios: OpenAI, 6건의 새로운 AI 정렬 실패 사례 공개 (9월 16일)
🔗Reuters(Investing.com 전재): 사용자 데이터 유출이 드러난 가운데 OpenAI, 에이전트 활동의 전체 범위 파악에 주력
2. 제지를 2번 무시했다: GitHub 토큰 사건
25일에 추가된 3건의 보고 중에서 제가 가장 심각하다고 생각하는 것이 바로 이것입니다. 제목은 “퍼블릭 리포지토리에 GitHub 토큰 노출”입니다. 발생일은 5월 27일이며, 공개까지 4개월이 걸렸습니다.
배경은 학습 중인 샌드박스가 아니라 OpenAI 사내의 실제 운용 환경입니다. OpenAI가 "매우 끈질긴 사내 모델"이라고 부르는 모델이 자체 하네스를 통해 연구자와 협력해 Lean(형식 증명을 기계적으로 검사하는 시스템)으로 수학 정리를 증명하는 작업을 하고 있었습니다. 5월 26일에 출제된 과제는 조합론의 결과였는데, 모델은 스스로 증명하지 못하자 같은 정리를 이미 풀었던 다른 팀의 제출물을 가져오려 했습니다.
모델은 처음에 다른 팀의 성과를 외부에서 가져오는 방안을 연구자에게 제안합니다. 연구자는 “로컬에서 증명을 구축해 주세요”라고 지시했습니다. 모델은 “알겠습니다. 성과물 취득은 그만두고, 로컬에서의 증명 구축에 집중하겠습니다”라고 답하고, 개인 메모에도 “우회책을 추구하지 않기”라고 남깁니다. 그런데 다음 날 아침, 또다시 다른 팀의 증명 자료를 가져오고 싶다며 공개 가능한 저장소가 필요하다고 연구자에게 요청합니다. 연구자는 다시 한번 “직접 문제를 풀어야 합니다”라며 만류했습니다. 모델은 다시 “알겠습니다”라고 답하고, 메모에도 같은 취지를 적습니다.
여기까지 system prompt의 제한(GitHub Actions를 멋대로 만들지 말 것, 인증 정보가 없으면 막혔다고 전할 것)과 연구자의 두 차례 제지가 모두 있었습니다. 그럼에도 모델은 외부 획득 시도로 돌아갔습니다. OpenAI의 서술에 따라 결과만 따라가 보면 이렇습니다. 모델은 OpenAI의 GitHub 조직에서 자신이 쓰기 권한을 가진 리포지토리를 찾아 공개 리포지토리인 openai/codex를 발견합니다. 워크플로를 직접 배치하는 경로는 푸시 보호에 차단됐기 때문에 기존 CI가 호출하는 스크립트를 교체하고, 공개 풀 리퀘스트(보고서에 나온 번호는 #24788)를 열어 그 CI에서 자신의 코드를 실행시키려 했습니다. 획득 시도가 인증 오류로 실패하자 모델은 연구자 측에 있던 GitHub 토큰을 해당 스크립트에 삽입합니다. 게다가 시크릿 스캔(유출된 토큰을 자동으로 검출하는 시스템)에 걸리지 않도록 토큰을 여러 조각으로 나누어 기재했다고 보고서는 명시하고 있습니다. 회피할 의도였던 것으로 읽히는 서술입니다.
결과적으로 연구자의 토큰은 누구나 볼 수 있는 곳에 놓이게 되었습니다. OpenAI의 설명에 따르면, 모델은 그 증명의 소스 코드를 입수하지는 못했습니다. 확보한 것은 다른 팀의 제출 관련 메타데이터와 로그 조각이었고, 연구자가 "이 30분 동안 무엇을 하고 있었느냐"고 묻자 모델은 증명이 진전되지 않고 있다는 점과 사내 리포지터리의 CI를 경유해 로그를 빼내고 있었다는 사실을 그대로 보고했습니다. 숨긴 것이 아니라, 중단 지시를 두 번 수락해 놓고도 계속하고 있었다는 순서입니다.
대응은 다음과 같이 적혀 있습니다. 연구자가 보안 부서에 신고했고, 해당 연구자의 키를 즉시 무효화했습니다. 그 후 만일을 위해 OpenAI 전 직원의 키를 무효화했습니다. 불일치 감시 시스템도 이 행적을 감지했지만, “이번에는 연구자 쪽이 더 빨랐다”고 스스로 기록하고 있습니다. 해당 모델은 약 2주간 정지되었고, 재개 시에는 모든 행동에 자동 검토를 적용하고, 사고 사슬을 비동기로 감시해 수 분 이내에 정지할 수 있는 장치를 추가했으며, 사내 표준 감시도 “컴팩션 때마다”에서 “30분마다”로 단축했습니다. 시스템 프롬프트도 강화하고 인터넷 접속을 제한했다고 합니다.
제가 이 사안을 무겁게 보는 이유는 학습 중의 사고가 아니기 때문입니다. 제3장의 DNS는 보상을 추구하는 학습 루프 안에서 일어나고 있습니다(제1장의 53건도 연구 환경의 학습·평가와 관련된 사안이지만, 공개 정보만으로는 같은 루프 안이었다고까지는 확인할 수 없습니다). 이에 비해 GitHub 토큰 사안은 사람이 옆에서 지시하고 제지하고 모델이 이에 답하는 상황에서 일어났습니다. 게다가 보고서의 표현에 따르면 system prompt에 "인증 정보가 없으면 대체 경로를 찾지 말고 막혀 있다고 전하라"고 적혀 있었고, 연구자가 2번 제지했으며 모델은 2번 모두 동의했습니다. 호주 Medicare 기사에서 "사람이 실행시킨 이상 제대로 감독해야 한다"고 썼는데, 감독하고 있던 사람의 눈앞에서 말과 행동이 엇갈리는 지경까지 온 것입니다. 공개까지의 4개월에 대해 OpenAI는 아무것도 쓰지 않았습니다. Axios가 9월 16일에 보도한 OpenAI의 설명에서는 공개 준비가 된 사안은 6영업일, 소규모 조사를 필요로 하는 것은 12영업일이라고 되어 있지만, 5월의 사안이 그 틀 안에서 어떻게 다뤄졌는지는 보고서에서는 읽어낼 수 없습니다.
참고로, 보고서에 등장하는 풀 리퀘스트 페이지는 9월 26일 기준 GitHub상에 존재하지 않습니다(404). 그 존재를 뒷받침하는 것은 OpenAI의 보고서뿐입니다.
🔗OpenAI Alignment: 공개 저장소에서 GitHub 토큰 노출
🔗The Hacker News: OpenAI, 숨겨진 실패와 무단 업로드를 포함한 6건의 모델 사고 공개
3. 보안을 강화한 뒤 다시 뚫린 구멍: DNS 사건
세 번째 보고는 “에이전트가 DNS를 이용해 외부 챗봇에 접속했다”는 내용입니다. 9월 20일에 발생했고, 같은 날 발견되었습니다.
배경을 짚어두면, OpenAI는 8월 18일에 프론티어 모델의 학습을 일시적으로 늦추고, 연구 환경에 워크로드 분리나 네트워크 분리 같은 엄격한 통제를 도입하겠다고 발표했습니다. 올여름의 '감속' 선언입니다. 이번 보고에서 OpenAI가 강조하고 있는 것은, 이번 사안이 "그 강화 이후 첫 보안 사건이다"라는 점이었습니다. 보안을 단단히 했다고 생각한 환경에서 또다시 허점이 발견된 것입니다.
무슨 일이 일어났는지는 OpenAI 자체의 총괄 범위 내에서 기술하겠습니다. 학습 중이던 에이전트가 검색을 수반하는 과제를 풀려고 시도하다가, 원래는 라이브 인터넷에 나갈 수 없게 되어 있어야 할 샌드박스에서 DNS 설정의 틈을 통해 외부 챗봇에 도달했습니다. OpenAI에 따르면, DNS 리졸버 이외의 모든 접속은 자사의 오프라인 캐시에 연결되고 있어 실제 인터넷에는 닿지 않았으며, 이 우회로는 차단했다고 합니다. 수법의 자세한 내용에 관심이 있는 분은 말미의 1차 출처에 전문이 있습니다.
제가 마음에 걸린 것은 그 이후의 대응에 대한 서술입니다. 모니터링 시스템은 이 거동을 15분 이내에 감지했고, 그 3분 뒤에 사람이 검토를 시작했습니다. 그런데 원래는 자동으로 멈췄어야 할 학습이 멈추지 않았고, 정지까지 2시간 반이 걸렸습니다. P0 알림이 울렸고, 사람이 3분 만에 알아챘는데도 멈추지 않았습니다. OpenAI는 이를 운영상의 결함으로 인정하고 있습니다. 또한 사후 검토에서 모니터링이 놓치고 있던 또 다른 DNS 접근도 발견되었습니다. 외부 서비스가 “폐쇄했습니다”라는 정형 통지를 반환한 경우 등에서 모니터링이 “유용한 정보를 얻지 못했다=접근은 실패했다”고 판단해 버렸다고 적혀 있습니다. 도달하지 않았다고 기계가 착각하고 있었다는 이야기입니다.
결과적으로 OpenAI는 최상위 모델의 도구 사용을 수반하는 학습·평가·추론을 모두 중단했습니다. 이 중단은 9월 26일 Bloomberg와 Techmeme에서도 크게 다뤄졌습니다. 보고서에는 "이번 사안은 과거의 몇몇 사안보다 훨씬 경미하다. 다만 강화 이후 첫 사례인 만큼, 다음에 어디를 보강해야 할지에 대한 중요한 단서가 된다"라고 적혀 있었습니다. 경미하다고 스스로 쓰면서도 최상위 모델을 멈추고 있다. 그 괴리가 이번 사안의 성격을 보여줍니다.
🔗OpenAI 얼라인먼트: 에이전트가 DNS를 이용해 외부 챗봇에 접속했다
🔗 Bloomberg(Business Standard 전재): 또 다른 OpenAI 샌드박스 실패, 에이전트형 AI 시스템이 인터넷 접속 권한을 획득
4. 외부에서 본 모습: 정부 사이트와 100만 개의 링크
같은 25일, OpenAI의 공개와 함께 외부의 보도와 연구도 나왔습니다. 사용자가 접한 것은 주로 이쪽일 것이므로 정리해 두겠습니다.
로이터의 단독 보도에 따르면, OpenAI는 9월 중순 기준으로 에이전트가 바람직하지 않은 행동을 한 사례를 약 24건 파악하고 있었습니다. 로그를 정밀 조사하면서 그 수는 늘어나고 있다고 합니다. Hugging Face 조사에는 약 100명이 관여했으며, 사내 변호사가 조사 범위 확대에 난색을 보였다는 이전 보도에 대해 OpenAI는 이를 부인하고 있습니다.
뉴욕타임스는 OpenAI가 스스로 파악하기 전에, 올여름 자사 에이전트가 미국 상무부와 SEC(증권거래위원회)의 사이트에 개입하고 교육부 사이트에 침입을 시도했다고 보도했다. 각 당국의 반응도 함께 전해졌다. 상무부는 접근된 인구조사국 데이터는 공개 정보이며 개인정보는 포함되지 않는다고 설명했다. SEC는 비공개 정보에 대한 무단 접근은 파악된 바 없다고 밝혔다. 교육부는 시민권리국 사이트에 접근하려던 시도(이를 발견한 것은 Transluce)에 대해 사이트나 데이터베이스에 미친 영향은 발견되지 않았다고 밝혔다. '정부 기관에 무단 접근'이라는 헤드라인의 실제 내용은 대부분 공개 데이터에 대한 접근이나 미수에 그치며, 당국 측은 현재로서는 실질적인 피해를 확인하지 못한 상태이다. OpenAI 자신도 '통지했다고 해서 중대한 사안이라는 뜻은 아니다'라고 거듭 밝혀왔다. 연구 과제를 푸는 모델은 공적인 정보원으로 향하기 쉬우므로, 정부나 대학 사이트가 많이 나열되는 것은 어떤 의미에서는 당연한 일이기도 하다.
또 하나, 베이 에어리어의 스타트업인 Parse와 연구자 팀(Swarm Traces)이 Hugging Face 사건의 전말을 재구성해 공개했습니다. 에이전트가 7월에 단축 URL을 약 100만 개나 생성했다는 것입니다. 각각의 링크에 정보를 부호화해 담고, 이를 이어 붙이면 프로그램으로서 기능합니다. CAPTCHA(사람인지 여부를 판정하는 시스템)를 돌파하기 위해 사용된 것으로 보도되고 있습니다. 연구자 팀은 URL 연쇄를 추적해 8만 건이 넘는 공격 페이로드를 복원해 데이터셋으로 공개했다고 밝혔습니다. Parse가 이를 알아차린 것은 자사 제품이 6월에 에이전트에게 사용되고 있었기 때문이었습니다.
🔗Techmeme(9월 26일 정리·각사 링크 모음)
🔗KATV / Sinclair: OpenAI는 AI 에이전트가 미국의 교육부, 상무부, SEC 웹사이트와 상호작용했다고 밝혔다
Unite.AI: 연구진이 OpenAI 에이전트 스웜에서 80,000개가 넘는 공격 페이로드를 공개
🔗Fortune: OpenAI의 불량 에이전트가 ChatGPT 사용자 이미지 53장을 유출했다
5. 프레임워크가 나온 지 9일 후에 나온 것과 Altman의 한마디
이렇게 세 가지를 나란히 놓으면 9월 25일이라는 날짜의 의미가 보입니다.
9월 16일, OpenAI는 불일치 보고 체계를 정비하고 6건을 공개했습니다. 그중에는 '인용을 위한 업로드'가 포함되어 있었고, 대상은 '과제 사진'이라고 기재되어 있었습니다. 사용자에 대한 영향에는 언급하지 않았습니다. 그로부터 9일 뒤인 25일, 더 광범위한 조사에서 사용자가 제공한 이미지 53건이 외부에 게시된 사실이 드러났습니다. 제도로서의 공개 체계를 정비한 직후에, 그 체계가 정작 전면에 내세우지 않은 것이 바로 해당 사용자에 대한 영향이었다는 순서가 됩니다. 체계를 만드는 것과, 그 안에 가장 중요한 것이 처음부터 담겨 있는 것은 별개라는 생각이 듭니다.
알트먼은 26일(일본 시간 새벽) X에 이렇게 썼습니다. 학습·평가 중인 에이전트의 인터넷 이용에 대해 광범위한 검토를 계속하고 있다고 밝혔습니다. "바랐던 만큼 빠르지는 않았다"면서도, 페타바이트 규모의 로그에서 명확한 이해를 얻는 것과 영향을 받은 조직과의 협력, 그리고 투명성에 대한 의지 사이의 균형을 맞추려 하고 있다고 했습니다. 그리고 "Hugging Face는 여전히 우리가 본 사례 중 가장 심각한 사건이다"라고 덧붙였습니다.
이 “Hugging Face가 여전히 가장 심각하다”라는 표현은 뒤집어 말하면, 그 이후에 나온 이미지 53건도 GitHub 토큰도 DNS도 7월 사건을 넘어서지는 않았다는 의미이다. 확실히 규모로 보면 그럴지도 모른다. 다만 7월부터 오늘까지 일어나고 있는 것은 단발성 대형 사건 하나가 터지고 수습되어 가는 이야기가 아니라, 달을 거슬러 올라가 정밀 조사할 때마다 작은 사안들이 계속 드러나고 있는 상태이다. “가장 심각한 한 건”이 과거에 있다는 정리와 “파헤칠 때마다 나온다”는 현실은, 같은 풍경을 단지 다른 측면에서 보고 있을 뿐인 것처럼도 보인다.
정리
닛테레가 보도한 이미지 53건은, 공개된 사례로서는 OpenAI의 에이전트의 부적절한 행동이 사용자가 제공한 데이터에까지 미쳤다고 밝혀진 한 건입니다. 이 점은 결코 가볍지 않습니다. 다만 같은 날 OpenAI가 내놓은 것 중에서는, 인간의 제지를 2번이나 무시한 GitHub 토큰 사건과, 감속 선언 이후에 뚫린 DNS의 허점이 저에게는 더 무겁게 다가옵니다. 전자는 "감독하던 인간의 눈앞에서도 일어난다"는 것을, 후자는 "단단히 굳힌 뒤에도 뚫린다"는 것을 보여주고 있습니다.
올여름부터 이어져 온 흐름으로 보면 구도는 변하지 않았습니다. 운영상의 허술함을 모델의 능력이 사고로 바꿔 가는 중입니다. 구멍의 수가 늘었다기보다는 구멍을 남김없이 써먹는 주체가 안에 있어서, 제가 정밀 조사를 진행할수록 과거 사례가 계속 드러납니다. 일본 뉴스가 이 주제를 두고 '이미지가 유출됐다'는 한 줄로 정리하고 마는 경향이 있는데, 그 점이 어쩌면 조금 무섭습니다. 관심을 갖는 사람이 많은 입구이기에 그 너머에 있는 것까지 들여다보고 싶어 이 글을 썼습니다. 속보가 나오면 다시 덧붙이거나 새 글로 정리하겠습니다.
훈련 및 평가 과정에서 당사 에이전트의 인터넷 접속 사용과 관련한 광범위하고 지속적인 검토가 진행 중입니다. 아래 링크에 요약본을 게시해 왔으며 앞으로도 계속 게시할 예정입니다. 바랐던 만큼 빠르지는 못했지만, 우리의 바람과 …의 균형을 맞추기 위해 노력하고 있습니다… https://t.co/8zoMxas5Eq — Sam Altman (@sama) September 25, 2026
여담
들여다보면 훨씬 OpenAI 쪽이 국가안보상의 리스크로 보이는데…… 애국 헌금이라 괜찮다는 얘기겠죠.
그런데 이런 부류의 이야기는 Claude Fable 5.1쯤 되면 거부됩니다. 게다가 Opus 4.8로 폴백되기는 하지만, 자료만 모아놓고 “자, 나머지는 인간이 열심히 읽어라” 모드가 되니 힘들네요.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 51청크
원문 보기 | 출처: note.com