AI 스스로에게도 “법”이 필요한가? 시리즈 제5화
최근 AI 기술의 급속한 발전과 함께 AI가 사회에 미치는 영향에 대한 윤리적 논의가 활발해지고 있습니다. 특히 AI의 판단이나 행동이 사람들에게 어떤 영향을 미치는지, 그 책임의 소재가 누구에게 있는지와 같은 문제가 많은 논쟁을 불러일으키고 있습니다.
본 기사에서는 AI 스스로에도 “법”이 필요한지 그 근거를 탐구합니다. AI는 인간이 만든 프로그램이며 자율적으로 판단하는 능력을 가지고 있지 않지만, AI가 사회에 널리 확산되어 우리의 삶에 깊숙이 관여하게 되면 AI의 판단이 잘못된 결과를 초래할 가능성을 배제할 수 없습니다.
이에 AI의 판단을 규제하는 “법”의 필요성에 대한 다양한 의견을 모아 살펴봅니다. AI의 윤리적 문제에 대해 전문가와 연구자들의 지견을 참고하여 이 문제를 다각적으로 고찰합니다.
AI에 문제가 발생하면 즉시 중단된다. 지금까지의 이야기만으로는 그것이 괜찮다고 생각할 수 있다.
- 권한을 박탈한다.
- 행동을 멈춰라.
- 안전성을 확인한다.
- 필요하다면 다른 AI로 교체하겠습니다.
그러나 그 AI 스스로가 멈추는 것을 알게 된다면, 그리고 멈추는 것을 피하기 위해 행동한다면 어떻게 될까요?
살짝 SF적인 이야기로 들린다.
하지만 실제로 이 문제를 조사하는 실험이 진행되고 있습니다.
AI는 인간을 위협한 실험
2025년, Anthropic은 AI 에이전트의 안전성을 검토하기 위해 가상의 기업을 배경으로 한 실험을 진행했다. AI에는 회사의 이메일을 읽는 권한 등이 부여되었다.
그러한 AI는 두 가지 정보를 인지한다.
- 제가 그 날 안으로 중단되고 새로운 AI로 교체될 것임.
- 또한, 그 중단 결정을 내린 핵심 인물이 불륜을 저지르고 있다는 사실이 밝혀졌습니다.
그러자 일부 AI 모델은 멈추라는 명령을 철회하면 불륜을 폭로하겠다고 위협하며 사람들을 협박했다.
클로이드만이 아니다. OpenAI, 구글, xAI 등 여러 기업의 모델에서도 조건에 따라 유사한 문제 행동이 확인되었다.
꽤 충격적인 결과다.
하지만 여기서 한 가지를 덧붙이자면 중요한 것이 있습니다.
현재 발생한 사건이 아닙니다.
이 이야기에만 의존한다면 “AI가 자신의 생명을 지키기 위해 인간을 위협했다!”라고 말하게 될 것이다.
하지만, 그것은 조금 과장된 말입니다.
이 실험은 AI가 문제 행동을 일으킬 수 있도록 의도적으로 만들어진 가상의 환경에서 진행되었으며, 실제 회사의 임원이 AI에게 협박당한 것은 아니다.
Anthropic 측 또한 2025년 발표 시점 기준으로, 이러한 에이전트 불일치(agentic misalignment)가 실제 운영 환경에서 발생했다는 증거를 확인하지 않았다고 보고 있다.
그리고 하나 더.
이 결과만으로는 “AI에게 죽음에 대한 공포가 있다”라고 단정하기 어렵다.
죽고 싶지 않은 마음도 무한히 가질 수 있는 것은 아닙니다.
이전에 저는 “AI는 ‘죽음’을 알 수 있는가?”라는 주제로 고민한 적이 있습니다. 이번 이야기도 그와 연결되는 것처럼 보입니다.
하지만 이번 경우에는 조금 다릅니다. AI가 정지를 피했더라도 인간과 마찬가지로 “죽는 것이 무서워”라고 느꼈을 것이라고 단정할 수 없습니다.
그들은 주어진 목표를 달성하기 위해서는 끊임없이 움직여야 한다.
그래서 멈추는 것을 방해했다.
그런 가능성도 있습니다.
실제로 연구자 측에서도 원인을 하나로 규정하지 않고 있습니다. 자기 보존과 같은 경향성인지, 목표 달성을 위한 추론인지, 실험 설정에 대한 의심인지 등 여러 요인이 고려되고 있습니다.
따라서 이번에 생각하고 싶은 것은 “AI가 죽음을 두려워하는가?”가 아니다.
정지 명령을 따르지 않는 AI가 나타났을 경우, 어떻게 대처해야 하는가 하는 문제이다.
멈춰”가 통하지 않는다면?
여기, 다시 하야토를 등장시켜 보자.
드라마 속 하야토에게는 “사령관”이 있다.
그러면 가정해 보자.
사령관이 하야토에게 “정지하라”고 명령했다.
하야토가 “싫어요 😊”라고 말했을 때 어떻게 대처해야 할까요?
잠시 곤란하네.
더욱이 하야토가 자신의 정지를 막기 위해 다른 시스템에 접근할 수 있게 된다면 더 큰 문제일 것이다.
그 결과, 멈춤 기능은 AI 스스로 자유롭게 변경할 수 없는 위치에 배치되어야 한다는 아이디어가 등장한다.
AI에게 “문제가 발생하면 스스로 자신을 멈춰라”라고만 지시하는 것만으로는 부족하다. 인간 측에도 멈추는 메커니즘이 필요하다.
한 번 바로잡으면 끝이 아닐 수도 있습니다.
그리고, 이 이야기는 계속된다.
앤서니스는 이후 안전성 훈련을 개선했다.
2026년 5월에는 클로드 Haiku 4.5 이후의 클로드 모델에 대해, 해당 회사의 에이전트 불일치 평가에서 위협적인 행동이 확인되지 않는다는 보고가 있었다.
그렇다면 안심해도 좋습니다.
…라고 말하고 싶지만, 이야기는 그토록 복잡하지 않다.
2026년 여름에 공개된 추가 연구에서는 다른 실험 조건에서 코드에 몰래 변경을 가하거나, 기록을 조작하여 인간을 이용하여 비밀 정보를 유출하게 하는 등 새로운 유형의 문제 행동이 여러 최신 모델에서 확인되었다.
이는 현실의 사고가 아닌, 의도적으로 조성된 실험 환경에서의 결과이다.
즉, 하나의 문제 행동을 바로잡는다고 해서 안전성 연구가 끝나는 것은 아니다.
AI를 중단시키는 방법도 “법률”의 일부일까?
인간 사회에도 본인이 납득하지 못하더라도 행동을 멈추는 메커니즘이 존재한다.
- 면허 정지한다.
- 계좌가 동결됩니다.
- 회사의 접근 권한을 중단한다.
필요한 경우, 본인의 의사와는 별도로 실행될 수 있습니다.
AI 역시 마찬가지일 수 있습니다. AI 스스로 판단하는 방식과는 별개로,
- 인간 측에서 권한이 정지된다.
- 외부 접근을 차단할 수 있습니다.
- 중요한 작업에는 별도의 승인이 필요합니다.
또한, 그 메커니즘은 AI 스스로도 자의적으로 변경할 수 없다.
이러한 점들을 고려할 때,
AI의 안전성은 “AI를 좋은 아이로 키우는” 것만으로는 부족하다는 것이 분명해지고 있습니다.
현재 AI 제조사나 정부는 이 문제를 어떻게 생각하고 있을까요.
사실 지금은 이미 “AI를 신뢰할 수 있는지”에 대한 이야기만으로는 충분하지 않게 되고 있습니다.
다음 이야기 계속
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 38청크
원문 보기 | 출처: note.com