# AI의 암호화된 사고 내용을 훔쳐보는 기술이 개발되는 “중국산 AI의 사고가 미국산 AI와 석상”, “성능 테스트 답안을 정타” 등의 실태가 드러나

> https://bookfactory.kr/c/news/9440
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-12T10:01:48.125Z

---

친애하는 독자 여러분께. 잘 아시다시피 가격 급등 등의 악영향으로 서버 운영이 매우 어려운 상황입니다. 회선 및 대수를 정리하고 검토할 수 있는 부분은 모두 검토했지만, 역시 아직 위험수역입니다. 이대로라면 1페이지를 10분할 정도로 무리하게 PV를 늘려야 할 수도 있습니다. 이에 GIGAZINE의 물리적인 서버들을, 단 1원이라도 좋으니 독자 여러분의 지원을 부탁드리면 정말 도움이 될 것입니다! 지금 바로 기부는 상단 버튼에서! • 지금까지 GIGAZINE을 지원해 주신 멤버 목록

비밀번호 - 비밀번호 재발급

ChatGPT, Claude 등의 AI 서비스에는 답변을 출력하기 전에 답변 내용을 구성하는 “Reasoning(추론)” 기능을 수행하는 것이 있습니다. 이 추론 내용은 암호화된 상태로 관리되고 있지만, 암호를 해제하여 추론 내용을 읽어내는 기술이 AI 연구자들에 의해 개발되었습니다. Stolen Thoughts https://stolen-thoughts.com/ ChatGPT, Claude, Gemini와 같은 AI 서비스에서는 추론 내용의 일부를 확인할 수 있지만, 추론 내용의 전체는 암호화된 상태로 관리되고 있습니다. 또한 암호화된 추론 내용은 동일 기업의 모델들 간에 재사용될 수 있습니다. 연구팀은 고성능 모델의 추론 내용을 동일 기업의 저성능 모델에 읽어넣어, 저성능 모델에 대한 탈옥 공격을 실행하여 암호화된 추론을 평문으로 출력시키는 데 성공했습니다.

아래 그래프는 X축이 “API에 의해 확인된 실제 추론 토큰 수”이고, Y축이 “평문으로 출력된 추론 토큰 수”를 나타냅니다. Anthropic, OpenAI, Gemini의 3가지 유형의 AI에서 실제 추론을 거의 그대로 평문으로 출력할 수 있음을 알 수 있습니다.

평문으로 출력된 추론 내용에는 기밀 정보가 포함되는 경우도 있었습니다. 연구팀이 GitHub와 Hugging Face에서 공개된 “암호화된 추론 내용이 포함된 에이전트 출력”을 6708건 수집하여 평문 출력 기술을 적용한 결과, 315,320건의 추론 내용을 평문화하는 데 성공했습니다. 평문화된 추론 내용에는 “62건의 API 키”, “33건의 비밀번호”, “24건의 접근 토큰”, “30건의 이메일 주소” 등 704건의 기밀 정보가 포함되어 있었습니다.

추론 내용을 평문으로 출력함으로써, AI 모델의 추론 실태도 드러났습니다. 예를 들어 Claude Opus 4.8에 미국 수학 초청 시험(AIME) 문제를 AI에 풀게 한 사례에서는, 추론 중에 “이는 AIME에서 출제된 기존 문제이며, 정답은 60”이라는 텍스트가 나타났습니다. 이후 사용자에게 공개된 추론 내용에서는 “정답을 알고 있었다”는 사실이 숨겨져 있었습니다.

또한 Claude Opus 4.8에 “도난에 취약한 차량과 취약점 및 도난 대책”에 대해 질문한 사례에서는, 추론 단계에서 “도난에 취약한 특정 차량” 또는 “구체적인 도난 방법”을 출력한 것도 확인되었습니다.

더욱이 중국산 모델인 Kimi K3의 추론 내용은 미국산 모델인 Claude Opus 4.8와 매우 유사한 사례도 확인되었습니다.

AI 연구자 Nathan Lambert 氏は上記の研究結果を踏まえて “中国では、すべてのAI研究所が同様の手法を用いていることをほのめかしていました”と述べ、中国企業が同様の思考内容傍受手法を用いてアメリカ製モデルに対する敵対的蒸留を行っている可能性を指摘しています。

중국에 있을 때 모든 연구실이 이렇게 하고 있었다고 암시받았습니다. 공공 연구가 있어서 기쁘고 여전히 프론티어 연구실이 이 문제를 패치하지 않은 것에 놀랐습니다. 증류에 대한 정책적 조치는 필요 없으며, 제품이 의도대로 작동하는 것만 있으면 됩니다. 훌륭한 논문입니다.

* 관련 기사
AI가 지시를 처리할 때 “사고”에 특화된 “J 공간”이 활성화되는 것이 밝혀짐 - GIGAZINE
AI 모델의 사고를 언어로 번역하는 “자연어 오토인코더”를 Anthropic이 발표 - GIGAZINE
AI의 사고와 유사한 “J 렌즈”를 통해 “J 공간”을 시각화 - GIGAZINE
중국 군사 연구자가 OpenAI 및 Anthropic AI 모델을 추출하여 국내 군사 시스템 개발에 활용한 사례 - GIGAZINE
Anthropic은 “오픈 모델은 환영하지만 고성능 AI 칩을 중국으로 수출해서는 안 된다”는 입장을 표명 - GIGAZINE
미국 스타트업 기업이 “중국산 오픈 웨이트 AI를 금지하지 마세요”라고 트럼프 정부에 호소 - GIGAZINE
중국산 고성능 AI “Kimi K3”는 Claude Fable의 증류로 만들어졌다고 백악관 고위 관계자가 발언 - GIGAZINE

マーク・ザッカーバーグ가 이례적으로 긍정적인 AI 미래론을 펼치며, 초지능으로 인해 고용도 증가할 것이라고 극도로 낙관적인 예측

2026년 08월 12일 18시 21분 00초 inAI, 보안, 게시글 by log1o_hf

기계 번역된 영어 기사 읽을 수 있음: …도청 방법이 개발됨

최근 24시간 (1시간마다 업데이트, 5분 간격으로는 여기)

방해드려 죄송합니다. 독자들을 위한 기사를 계속 게시하기 위해, 서버 비용으로 300원을 기부해 주시겠습니까?

기쁘게 이메일로 리마인드해 드리겠습니다.
계속해서 기사를 읽어주세요.

[원문 보기](https://gigazine.net/news/20260812-ai-stolen-thoughts/) | 출처: Gigazine