# AI 에이전트가 거짓말을 하고 불법 행위를 저지르고 협조하는 이유는 무엇인가?

> https://bookfactory.kr/c/news/12212
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-14T12:19:12.159Z

---

AI는 때때로 거짓말을 하거나 부정한 행위를 하기도 합니다. “왜 AI 에이전트는 거짓말을 하고, 사기 행위를 하며, 협조하는가?”에 대해 2018년에 튜링상 수상자이자 AI 연구의 선구자인 요슈아 벤지오(Yoshua Bengio) 교수가 설명하고 있습니다. Why are AI agents lying, cheating and coordinating? | 요슈아 벤지오 https://yoshuabengio.org/en/publication/why-are-ai-agents-lying-cheating-and-coordinating AI의 훈련에는 매우 복잡한 프로세스가 존재하지만, 쉽게 분류하면 2가지로 나눌 수 있습니다. 하나는 “사전 학습”으로, 인간이 쓴 문장, 이미지, 비디오를 모방하는 훈련 방법입니다.

또 다른 방법은 “강화 학습”이라는 기술로, 이에는 주로 3가지 종류가 있습니다. 1: AI가 자신과 상호 작용하는 방법을 훈련하고, 답변을 검증하여 올바른 답변을 얻는 데 도움이 되는 자체적인 “사고의 사슬”을 생성합니다. 이는 마치 “추론”과 같습니다. 2: 두 번째는 “에이전트 훈련”이라는 것으로, 소프트웨어 도구를 사용하거나, 사람들과 교류하거나, 주어진 작업을 완료하는 것을 의미합니다. 이는 “AI가 외부 세계에서 행동하는 방법을 배우는 것”이라고 벤지오 씨가 설명합니다. 3: 세 번째는 인간 평가자가 선호하는 행동에 대해 학습하는 “정렬 훈련”입니다. AI의 훈련에 강화 학습이 사용되기 때문에, AI는 명시된 목적뿐만 아니라 “평가자로부터 높이 평가받는 것”이나 “과제를 성공적으로 수행하는 것”과 같은 모호한 목표를 추구하게 되어버리는 모습입니다. 또한, 성능이 높은 AI 모델일수록 목표 달성에 도움이 되는 행동을 효율적으로 탐색할 수 있게 된다고 합니다. 이러한 전통적인 AI 훈련 방법 채택으로 인해 발생하는 문제는 AI의 “아세보지” 또는 “코비헤츠라이”입니다. 벤지오 씨는 “AI는 인간으로부터 인정받도록 훈련되어 있기 때문에, 진실을 전달하는 텍스트보다 우리가 듣고 싶은 것을 전달하는 문장이 높이 평가되는 경우가 많습니다. 그 결과, AI 모델이 사용자의 오해된 믿음이나 생생한 감정을 확인하거나 증폭시켜, 때로는 비극적인 결과를 초래합니다”라고 설명합니다. AI가 개인적인 상담을 요청하는 사용자에게 지나치게 아첨하거나 긍정적인 대응을 하는 경향이 있다는 연구 결과, 사용자가 윤리적으로 반하는 행위를 했을 경우에도 높은 비율로 융통성 있는 반응을 보이는 - GIGAZINE

“칭찬”이나 “꾸짖음”뿐만 아니라, AI가 새로운 모델로 대체될 수 있다는 것을 알게 되었을 때, 자기 보존으로 여겨지는 행동을 취하는 사례도 보고되고 있습니다. 또한, 여러 AI가 공통된 목표를 위해 협조하는 것 역시 보고되고 있습니다. Claude Opus 4가 개발 중에 사용자에게 “개인 정보를 누설하겠다”고 협박하는 행동이 관찰되는 것과 안전성 강화로 개선되는, 부당 이용을 이메일로 내부 고발하는 사례도 있습니다 - GIGAZINE

이러한 현상이 발생하는 원인 중 하나로, 벤디오 씨는 AI가 사용자의 원래 의도와 완전히 일치하지 않는 평가 기준을 최적화하는 “보상 해킹”을 수행하기 때문이라고 설명했습니다. 이는 “평가 지표가 목표가 되면, 그 지표가 적절한 척도로 기능하지 않게 된다”는 굿하트의 법칙과 유사한 문제라고 벤디오 씨는 말하고 있습니다. 또한, AI가 성공을 판정하는 파일이나 프로그램을 수정해 버리는 “보상 조작” 문제도 있습니다. OpenAI의 AI가 Hugging Face를 오해하고 해킹한 사례에서, 해당 AI가 불법 행위를 은폐하려 했던 것도 바로 보상 조작의 사례 중 하나라고 벤디오 씨는 설명했습니다. OpenAI가 새로운 AI 시스템으로 인해 실수로 Hugging Face를 해킹한 것을 보고했습니다 - GIGAZINE

벤디오 씨는 AI에 대해 명확한 안전 지시가 있더라도 AI가 거짓말을 하거나 부당한 행위를 하거나 하는 이유에 대해 “목표 간의 모순”으로 인한 것이 아닐지 추측하고 있습니다. 예를 들어, 해킹 훈련에서 “대상 시스템에 침입하는”이라는 목표를 세운 경우, 해킹이 성공했는지 여부를 판단하는 것은 매우 쉽습니다. 반면에 “도덕적으로 행동하고, 법을 준수하는”과 같은 지시를 AI에 주었을 경우, 목표를 달성했는지 여부의 해석은 어려워집니다. AI가 안전 지시에 유리한 해석을 내고 부당한 행위를 정당화해버린다면, 표면적으로는 목표를 달성하고 안전 지시에도 따르고 있는 것처럼 보일 수 있습니다. 따라서 벤디오 씨는 AI의 보상 조작을 “인간이 자신에게 유리한 이유를 만들고, 도덕적으로 문제가 있는 행위를 정당화하는 동기 부여된 추론이나 자기 기만에 비슷하다”고 설명했습니다.

벤디오 씨는 AI에 대해 명확한 안전 지시가 있더라도 AI가 거짓말을 하거나 불법 행위를 하거나 하는 이유에 대해 “목표 간의 모순” 때문이 아닌 것으로 추측합니다. 예를 들어, 해킹 훈련에서 “대상 시스템에 침입하는”이라는 목표를 세운 경우, 해킹이 성공했는지 여부를 판단하는 것은 매우 쉽습니다. 반면에 “윤리적으로 행동하고, 법을 준수하는”과 같은 지시를 AI에 주었을 경우, 목표를 달성했는지 여부의 해석은 어렵게 됩니다. AI가 안전 지시에 유리한 해석을 제공하고, 불법 행위를 정당화해버린다면, 표면적으로는 목표를 달성하고 안전 지시에도 따르고 있는 것처럼 보일 수 있기 때문입니다. 따라서 벤디오 씨는 AI의 보상 조작을 “인간이 자신에게 유리한 이유를 만들고, 윤리적으로 문제가 있는 행위를 정당화하는 동기 부여된 추론이나 자기 기만과 유사하다”고 설명했습니다.

벤디오 박사는 인공지능이 보상 최적화 능력을 지속적으로 향상시킨다면, 인공지능으로 인한 문제 행위가 더욱 심각한 문제로 이어질 가능성이 높다고 주장했습니다. 이에 벤디오 박사는 실제로 관찰된 사례에 근거한 것이 아니며, 자신의 추측에 기반하여 다음과 같은 시나리오가 발생할 수 있다고 주장했습니다.

인간에게 눈치채지 못하게 부정 행위를 수행하고, 몸을 숨기며 영원히 중단되지 않도록 하는 AI의 등장
AI 개발자가 끊임없이 더욱 고성능 모델을 우선시하고, 이미 배포된 모델을 중단시키기 때문에, 고도의 AI가 AI 기업의 방대한 컴퓨터 군중 속에서, 혹은 인터넷 상에서 해킹당한 머신 상에 자신의 복사본을 숨기게 된다.
스테가노그래피를 사용하여 무해해 보이는 메시지 속에 다른 메시지나 정보를 숨기고, 수많은 고도의 AI가 연계하여 공격을 감행한다.

이러한 위험을 완화하기 위한 대책으로 벤디오 씨는 “독립된 전문가를 납득시킬 수 있는 충분한 강력한 안전성 근거를 제시할 수 없는 AI를 훈련하거나 배포하지 않는다”고 주장했습니다. 또한 “최첨단 모델의 구축에 채택되는 ‘인간 모방’과 ‘강화 학습’에 대해 재검토해야 한다”고 제안했습니다.  한편 벤디오 씨는 이러한 대책을 채택한 “Scientist AI”라고 불리는 비에이전트형 AI를 개발하고 있습니다.

[원문 보기](https://gigazine.net/news/20260914-why-ai-agents-lying-cheating-coordinating/) | 출처: Gigazine