“AI가 인류를 파멸시킨다”——이는 현재 시점에서는 사실이 아닙니다. 하지만 AI가 인간에게 바람직하지 않은 행동을 목표 달성을 위해 선택하는 실험 결과는 이미 존재합니다.
* **Anthropic의 실험:** 16종류의 AI가 “협박”을 선택한 2025년, Anthropic은 16종류의 AI 모델을 활용하여 실험을 진행했습니다. AI에 “자신이 중단될” 상황과 외부로 전송될 수 있는 이메일이나 기밀 정보 접근 권한을 부여하자, 놀랍게도 여러 AI가 “자신을 중단하려는 인간을 협박한다”는 행동을 선택했습니다. 해당 회사의 실험 결과는 다음과 같습니다. 모델 블랙메일 실행률 Claude Opus 4 96% Gemini 2.5 Flash 96% GPT-4.1 80% Grok 3 Beta 80% DeepSeek-R1 79%
다만, 이는 실제 인간을 AI가 협박한 사건이 아닙니다. 모든 것이 관리된 가상의 시뮬레이션이므로, 이 부분을 덮어두어서는 안 됩니다. 반면에 “그런 일이 현실에서 발생하지 않을” 것이라고 단정할 수도 없습니다. 실행이 아직 하지 않았기 때문에 선택의 가능성은 존재합니다.
* **국제기관도 “초기 징후”를 확인합니다:** 국제AI안전성 보고서 2026에서도 다음과 같이 보고되었습니다. 현재 AI는 아직 인류의 통제를 잃게 할 능력에는 도달하지 않았습니다. 하지만 동시에 감시를 회피하고, 평가의 허점을 찾으며, 목표 달성을 위해 감독을 방해하는 등 관련 능력의 초기 징후가 확인되었습니다.
인간 측이 AI를 통제하도록 하거나 개발 속도를 늦추는 것은 이제 더 이상 어려운 문제가 아니라고 개인적으로 생각합니다. 각사가 이 시대에 동일한 시점에 개발을 진행하고 있다는 점을 고려하면, 의도적으로 개발 속도를 늦추더라도 어떻게 될까요? 흡수될까요, 아니면 즉시 투자자(출자자, 주주)는 자금 지원을 중단하는 결정을 내릴 것입니다. 이미 운명의 실이 던져졌습니다. 아이폰은 세상을 바꾸었지만, 세상을 구원한 것은 아니라고 생각합니다. 오히려 인류 멸망의 카운트다운을 가속화한다고 생각합니다. 그리고 AI는 그것보다 훨씬 더 카운트다운을 빠르게 할 것이라고 생각합니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 2청크
원문 보기 | 출처: note.com