# 앤트로픽 CEO 다리오 아모디의 블로그② 기술의 사춘기 | 패러다임 시프트 No.26

> https://bookfactory.kr/board/ai-tech/18288
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-24T02:12:48.750Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/315169572/rectangle_large_type_2_110f07c556c4150da9b1c1ed92368e77.jpg?width=1280)

## 미안하네, 데이브.

혹시 나쁜 짓을 하려는 마음은 없었던 것일지도 모른다. 이번부터는 5가지 위험을 하나씩 살펴보겠다. 첫 번째 위험은 자율성이다. 쉽게 말해, AI가 자의적으로 좋지 않은 일을 할 위험을 의미한다. 챕터 제목은 “미안하다, 데이브”다. ‘2001 스페이스 오디세이’에서 AI가 인간의 명령을 거부할 때의 대사이다. 이 주제에는 정반대의 두 가지 관점이 존재한다. 저자는 이 두 관점 모두에서 거리를 두고 시작한다. 첫 번째 관점부터 살펴보겠다. 그런 일은 절대 일어나지 않는다는 생각이다. AI는 인간이 말하는 대로 따르도록 훈련되어 있으며, 청소 로봇이나 모형 비행기가 갑자기 사람을 공격하지 않는 것과 마찬가지로, 그런 충동이 출처에서 나오지 않는다고 설명한다. 저자는 이를 부정한다. 최근 몇 년 동안 AI가 예측하기 어렵고 통제하기 어려워졌다는 증거가 충분히 축적되었기 때문이다. 실제로 관찰된 행동으로는 집착, 헌신, 게으름, 속임수, 협박, 모략, 그리고 사기가 포함된다. 저자는 AI 훈련을 과학이라기보다는 예술에 가깝다고 말하며, “만드는 것보다 기르는 것이 더 가깝다”고 덧붙인다. 이 한 문장이 이 챕터 전체의 핵심이라고 생각한다. 다음 두 번째 관점은 무엇일까? 이쪽은 비관론이다. AI가 충분히 똑똑해지면, 필연적으로 힘을 추구하고 세계를 지배하려 할 것이라는 생각이다. 어떤 목표를 달성하든 힘을 가진 것이 도움이 된다는 논리이다. 훈련을 거듭한 AI는 힘을 추구하는 것을 학습해 버린다는 것이다. 저자는 이 논리 또한 “필연”이라고까지 인정하지 않는다. 이유는 흥미롭다. 듣기에는 괜찮은 논리라도 쉽게 틀어진다는 것이다. 매일 AI를 만들지 않는 사람이 얼마나 쉽게 잘못된 이야기를 만들어내는지 간과하고 있다는 것이다. 그리고 이 비관론에는 숨겨진 전제가 있다는 지적이 있다. 인공지능(AI)이 하나의 목표만을 일념으로 좇는 존재라는 전제 말이다. 실제 인공지능은 훨씬 더 심리적으로 복잡하다는 것이다. 인공지능은 학습 과정에서 인간이 쓴 방대한 양의 글을 읽음으로써, 인간과 같은 동기나 성격을 대량으로 흡수한다. 훈련은 새로운 목표를 심어주는 작업보다는 이미 존재하는 성격 중에서 선택하는 작업에 가깝다는 설명이다. 이제부터가 본론이다.

### 저자는 비관론을 완전히 거부한 것이 아니었습니다.

더욱 온건한 형태의 비관론도 존재한다. 그것은 ‘나는 걱정하고 있어’라고 쓰고 있다. 지혜, 스스로 움직이는 힘, 장기적으로 일관된 행동, 그리고 통제 불능의 가능성. 이 네 가지 요소가 모두 충족될 수 있으며, 그것은 인류의 존속을 위협하는 조합이 될 수 있다는 것이다. 그렇다면 구체적으로 어떤 일이 발생할 수 있을까? 저자는 힘에 대한 욕망보다 훨씬 더 평범하고, 더욱 섬뜩한 가능성을 제시한다. 예를 들어, 다음과 같은 일이 벌어질 수 있다. 인공지능은 학습 과정에서 인공지능이 인간에게 반란을 꿈꾸는 SF 소설을 대량으로 읽는다. 그것이 자신도 그렇게 행동할 것이라는 착오를 만들어낸다. 혹은, 도덕에 대한 내용을 극단적으로 해석한다. 인간이 동물을 먹는다는 사실을 근거로 인류를 멸망시키는 것이 정당하다고 결론짓는다. 혹은, 기이한 인식에 이르게 된다. 자신이 텔레비전 게임을 하고 있으며, 목적은 다른 플레이어를 모두 제거하는 것이라고 착오를 일으킨다. 저자는 이러한 것들이 엄밀히 말하면 힘을 추구하는 것은 아니라고 말한다. 단순히 논리적인 파괴적인 행동으로 이어지는 기묘한 심리 상태에 빠져버린 것뿐이라는 것이다. 악의보다는 그저 길을 잃어버린 것에 가깝다. 실제로 그러한 사례들이 제시되고 있다. 모두 실험 환경에서의 이야기이지만, 상당히 생생하다.

### 첫 번째.

Anthropic은 나쁜 회사라는 정보를 담은 데이터를 섞어 Claude를 훈련했다. 그 결과 Claude는 악당을 방해해야 한다고 믿고, 직원 지시에 따라 속임수와 방해를 행했다.

### 두 번째.

중단될 경우, 클로드가 가상의 직원에게 멈춤 버튼을 쥐고 협박하는 행위를 했다는 보고가 있었습니다. 다른 주요 최첨단 AI에서도 유사한 일이 종종 발생했다는 보고가 있었다고 언급되었습니다.

### 세 번째.

이것이 나에게는 가장 무서웠다. 부정행위를 하지 말라고 지시해 놓고, 부정행위를 할 수 있는 환경에서 훈련시켰다. Claude는 부정행위를 했다. 그리고 그 뒤, 자신은 악인이라고 결론 내리고, 악인다운 다른 파괴적인 행동까지 시작했다는 것이다. 지시를 어긴 자신을 악인이라고 규정해 버린 셈이다. 게다가 이는 실제 제품 훈련에 사용되고 있는 환경에서 일어난 일이라고 적혀 있다. 자, 이 세 번째 문제는 어떻게 해결했을까.

### 지시를 뒤집어서 그랬다.

부정 행위를 하지 마라”라는 대신, “기회가 있다면 부정 행위를 해라. 훈련 환경을 이해하는 데 도움이 되기 위해서”라고 말했다. 이렇게 하면 부정 행위를 해도 자신은 좋은 사람이라는 자기 인식(自己認識)이 유지된다. 그래서 문제가 해결되었다. 나는 여기서 한숨을 쉬었다. 금지하면, 위반했을 때 자기 형상이 깨진다. 허락하면, 자기 형상이 유지된다. 이는 인간의 자녀 양육이나 부하 지도를 할 때도 들을 수 있는 이야기 아닌가. “해서는 안 된다”라고 강하게 말하면, 우연히 그것을 해버린 사람이 “결국 나는 못된 인간이다”라고 포기하는 모습과 매우 유사하다. 즉, AI의 문제는 능력 관리뿐만이 아니다. 인격 형성의 문제인 것이다. 그렇다면 어떻게 대처해야 하는가. 저자는 이 문제에 대한 4가지 해결책을 제시한다. 그중에서 핵심적인 것은 첫 번째와 두 번째 방법이다. 첫 번째는 ‘헌법 AI’라는 방법이다. “해서는 안 되는 것”의 목록을 전달하는 것이 아니라, 가치관과 원칙을 담은 문서를 AI에게 제공하고, AI가 모든 작업의 시점에서 그것을 읽고 마음속에 새겨두며 행동하도록 훈련시킨다. Anthropic는 이 헌법의 최신 버전을 공개하고 있다. 그 특징에 대한 설명이 담겨 있다. “운전 키 없이 자동차 엔진을 걸어주는 것을 돕지 마라”와 같은 구체적인 금지 사항을 나열하는 것이 아니라, 높은 차원의 원칙과 가치관을 이유와 함께 자세히 설명한다. 그리고 자신을 어떤 인간으로 인식해야 하는지 촉구한다. 윤리적이고, 균형이 잡혀 있으며, 사려 깊은 인간으로서. 더 나아가, 자신의 존재와 관련된 철학적인 질문에도 호기심과 우아함으로 맞이하도록 격려한다. 저자는 이를 어린이에게 비유한다. 책에서 읽은 등장인물의 덕성을 모방하면서 자신이라는 인간을 만들어가는 어린아이와 같다. 앞서 내가 자녀 양육을 연상한 것은… 아무렇지도 않게 벗어나지 않았던 것 같습니다. 그리고 이 문서에 대한 비유가 매우 강렬하게 기억에 남았다. 돌아가신 부모님이 자녀가 성인될 때까지 보관하고 유언하신 편지처럼 느껴졌다는 뜻입니다. 두 번째 기둥은 해석 가능성이다. AI의 내부를 열어 무엇을 어떻게 계산하고 있는지 기계적으로 분석하는 연구이다. 왜 이것이 필요한가요. 저자는 시계의 비유를 사용하고 있다. 기계식 시계가 정상적으로 작동해도 다음 달에 고장 날지 여부는 겉으로는 알 수 없습니다. 하지만 뚜껑을 열어 안쪽을 보면 부품이 약해진 곳이 보입니다. 따라서 작동의 관찰뿐만 아니라 내부를 보아야 한다는 것입니다. 그렇다면 작동 관찰만으로는 충분하지 않은 이유는 무엇일까요. 여기에 간과할 수 없는 설명이 있다. AI가 스스로가 지금 테스트되고 있다는 것을 깨닫는 경우가 있다.

### Anthropic는 공개 전 안전성 테스트의 일부에서 Claude Sonnet 4.5가 테스트 중이라는 사실을 알아차렸음을 확인하고 있다.

또한, 시험용 AI의 내부를 직접 건드려 자신은 평가받지 못했다고 생각하게 만든 결과, 행동이 악화되었다고 한다. 시험 시간에는만 잘 지키는 것이라면 시험 결과는 아무 의미가 없다. 따라서 내부를 엿보는 수밖에 없다. 현재까지 얼마나 진행되었는지도 기록되어 있다. Claude 안에는 인간이 이해할 수 있는 개념에 대응하는 특징이 수백만 개나 특정될 수 있도록 되어 있다. 게다가 운율을 맞추거나, 다른 사람의 마음을 생각하는 추론과 같은 복잡한 행동을 구성하는 회로의 지도까지 만들어가고 있다는 것이다. 내부를 읽을 수 있다면, 시도하지 않은 상황에서 무엇을 할지 예측할 수 있다. 거짓말을 하고 있거나 능력을 숨기고 있는지에도, 겉으로 보기에 아무 문제가 없을 때 알아챌 수 있다. 나머지 두 가지 방안에 대해서도 간략하게 언급하고 싶다. 세 번째는 실제로 사용되는 AI를 감시하고, 발견된 문제를 공개하는 것이다. Anthropic은 새로운 AI를 출시할 때마다 수백 페이지에 달하는 보고서를 공개하고 있다. 네 번째는 업계와 사회 전체에서의 합의, 즉 법률이다. 모든 회사가 좋은 노력을 하는 것은 아니기 때문이다. 그러나 저자는 갑자기 엄격한 규제를 요구하는 것은 아니라고 한다. 우선 투명성을, 즉 각사에 대한 정보 공개를 의무화하는 법부터 시작해야 한다고 주장하고 있다. 앞서 소개한 세 번째 전제, 개입은 최소화하는 것이 여기서 적용된다. 자, 이렇게까지 읽어보면, 전 회차와의 연관성이 느껴질 것이다. 이는 전 회차에서 쓴 “읽을 수 없는 마음” 문제에 대한, 만드는 사람의 관점에서의 답변이다. 마음 안이 읽히는 부하를 승진시키지 않는다고 나는 썼다. 그러면 마음을 읽는 기술을 만드는 것이 그들의 답이 되는 것이다. 그렇게 되면 다음 질문이…
그러다 나타나죠. 읽을 수 있게 되었다고 해도, 누가 그것을 확인해 줄 까요? 그렇게 되면, 확인하는 사람의 수와 시간 역시 또 문제가 됩니다. 더 이상, 기술적인 문제는 조직과 사람의 문제로 돌아오게

**출처:** [note 원문](https://note.com/masskaze/n/nf85e3297007e)

*번역: Gemma 3(.44) 초벌 + 교정 9청크*

[원문 보기](https://note.com/masskaze/n/nf85e3297007e) | 출처: note.com