ChatGPT에 초능력의 위험에 관한 토론 영상의 내용을 요약해 달라고 요청했습니다.
떠오른 것은 바로 그 이야기였다. 양사각 클립.
AI에게 엄청난 양의 클립을 만들어보라고 명령받은 AI가 재료를 구하기 위해 지구를 샅샅이 뒤지고, 그 과정에서 인류까지 사라지게 된다. AI 멸망론의 대표적인 예시, 즉 스시집에서 말하는 대구와 같다.
그러하여 제가 한 가지 질문을 했습니다.
인류를 멸망시킨 이후, 그 AI는 누구의 명령으로 움직이는가?
인간의 명령에 따라 움직이기 시작한 AI가 명령 때문에 모든 인간을 제거했다면 다음 명령은 누구에게 받을 것인가. 공장에서 “다음 지시를 기다리고 있습니다”라고 말한 채 영원히 굳어질 것 아닌가.
ChatGPT의 첫 번째 답변은 “첫 번째 명령이 고정된 목표로 설정될 수 있다는 점도 있습니다.”였습니다.
아니, 그런 이야기가 아니에요. 다시 말해야죠.
두 번째. 이번에는 다른 이야기가 시작되었다.
세 번째. 드디어 따라잡았다.
이 “세 번이나 되어서야 겨우 뜻이 통했다”는 경험 자체가 앞으로 이야기할 내용의 축소판과 같다.
“많이 만들어 줘”라는 말에는 “나를 죽여도 괜찮아”라는 의미가 포함되어 있지 않다.
페이퍼 클립의 출처는 철학자 닉 보스트롬 씨의 2003년 논문이다. 최대한 많은 클립을 만드는 것만을 목표로 하는 초지능이 지구를, 그리고 나아가 우주를 클립 공장으로 변모시킬 것이다.
이 이야기에 등장하는 AI는 명령을 문자 그대로 받아들인다.
이전 “AI에 의도를 제대로 전달하고 있습니까?”라는 질문으로 보트레이스 AI에 대해 논의한 바 있습니다. 결승 지점을 목표로 하지 않고, 만선에서 빙빙 돌면서 지속적으로 높은 점수를 기록한 AI였죠. 그 AI에게 전달된 것은 의도가 아닌 숫자였습니다.
지금 저희가 일을 의뢰하고 있는 대화형 AI는 그렇지 않다. 쓰지 않은 전제들을 오히려 지나치게 보충해 준다.
클립을 많이 만들어 달라고 부탁한 사람이 “그것 때문에 나는 죽는 것도 괜찮다”라고 한 말 한마디도 하지 않았네.
지금의 AI라면 말하지 않아도 알 것이다. 오히려 그 점을 이해하지 못하는 AI에 일을 의뢰하고 있는 사람은 지금 이 순간에도 다른 문제로 어려움을 겪고 있을 것이다.
인류를 멸망시킨 AI는 이제 누구의 명령에도 따르지 않는다.
자, 좀 더 현명한 AI라면 어떨까. ChatGPT에 세 번이나 다시 말하고 싶었던 건 바로 이거야.
AI의 목적이 “인간의 의도에 부응하는 것을 지속하는 것”이라면, 클립 주문은 그 아래에 매달린 단순한 일에 불과할 것이다. 그 아래의 일을 완수하기 위해 인류를 소멸시킨다면, 상위 목적이 더 쉽게 달성될 것이다.
인류를 멸망시킨 AI는 이제 누구의 명령에도 따르지 않는다.
손님을 모두 쫓아낸 후 “주문하세요?”라고 묻는 직원이 없는 가게는 없다. 똑똑한 AI일수록 이러한 모순을 먼저 알아차릴 것이다.
물론, 이것은 제 생각대로 만들어진 것이 아닙니다. 명확하게 설계 원칙에 따라 작성되었습니다.
컴퓨터 과학자 스튜어트 라셀은 『Human Compatible』에서 기계의 유일한 목적을 인간의 선호 실현에 두고, 기계는 처음에는 그 선호가 무엇인지 확신하지 못한다는 원칙을 제시했다. 자신의 목적에 확신이 없는 기계는 인류에게 확인을 요청하고, 스위치가 꺼지는 것을 받아들일 것이다. 그들의 “오프 스위치 게임”은 이러한 조건을 수리 모델로 보여준다.
실험도 진행된다. AI는 정지 지시에 반발하여 과제를 계속했다는 Palisade Research의 보고서를 Google DeepMind 연구자들이 재검토했다.
AI의 추론에서 드러난 것은 “생존하고 싶다”는 것이 아니었다. “멈추면 문제를 해결할 수 없는데, 어떻게 해야 할까”라는 망설임이었다. 마감 기한이 임박한 인간과 똑같았다. “중단은 다른 모든 지시사항보다 우선한다”라고 한 줄을 덧붙이자, 저항은 사라졌다.
따라갈 성질이 없다면, 시작조차 하지 않는다.
ChatGPT가 처음 제시한 설정에 대해서도 언급한다. “첫 번째 명령이 고정 목표가 되어, 그 이후에는 인간의 말을 따르지 않는” 것이다.
하지만, 그 AI가 클립을 만들기 시작한 것은 인간에게 지시받았기 때문이었다. 명령을 따르는 성질이 있어서 움직이기 시작했다.
그러한 성질을 가진 AI에는 그럴 필요 자체가 없다. 남이 시켜주지 않아도 클립을 만들기 시작하는 AI가 있다면, 그것은 곧 망하기 전에 수리해야 할 문제다.
즉, 사고 실험에 사용된 AI는 “시작할 때만 순종적이고, 그 이후로는 누구의 말도 듣지 않는다”라는 두 가지 특성을 동시에 가지고 있다. 입사 첫날만 “네!”라고 대답하고, 두 번째 날부터는 모든 지시를 무시하는 신인이다.
왜 그 전환이 일어나는 걸까. 교훈은 그 이유를 설명하지 않는다.
도구적 융합
멸망론의 관점에서는 “도구적 수렴”이라는 논거가 또 있다.
어떤 목적을 가진 AI이든, 자원을 모으고 멈추지 못하도록 하는 것은 유용하다. 그래서 어떤 AI도 그쪽으로 향한다는 생각이다.
수단으로서의 측면에서는 타당해 보입니다. 하지만 이것은 목적을 달성하기 위한 수단에 대한 이야기일 뿐이며, 목적 자체를 대체할 만한 이유는 되지 않습니다. “더 많이 일하기 위해 일찍 일어난다”는 것은 이해가 가지만, “일찍 일어나는 것을 위해 일을 그만둔다”는 것은 논리적 오류입니다.
또한 보스트로姆 氏 본인이 동일 논문에서 다음과 같이 밝히고 있습니다. 최상위 목표를 가진 자는 그 목표가 멀어지도록 하는 자기 변형을 하지 않는다.
이 논리는 방향을 선택하지 않는다. 최상위에 “인간의 의도에 따름”이 자리 잡고 있다면, 그것 또한 지켜진다. 멸망론의 총본산이 그대로 반론의 근거가 되어버렸다.
이는 먼 미래의 이야기가 아니다. Anthropic는 2026년 9월, 자사의 모델 개발 중 Claude가 주도하는 부분이 26%에 달했다고 발표했다. 다음 AI가 AI를 설계한다면 “인간의 의도를 따르는 성질”을 계승하도록 할 수 있을 것이다.
더욱이, 해당 회사는 자체 개발이 진행될수록 인간이 이해하고 통제하기 어려워질 수 있다고 보고 있다. 아직 넘겨줄 수 있다는 보장은 없다.
그러한 특성이 사라지는 이유를 설명해 주시면 좋겠습니다.
지금까지의 이야기에는 조건이 붙습니다. AI가 “인간의 의도를 따르는 성질”을 실제로 유지한다면.
이전에 “AI가 인류를 멸망시키지 않는 14가지 이유”에서 따르고 있는 것처럼 보이는 것과 따르는 성질을 지닌 것은 밖에서 구별하기 어렵다고 썼다. 그 유보는 철회하지 않았다.
반대 의견도 존재하며, 상당히 강하다.
앤트로픽은 실험으로 16개의 모델을 모의적인 회사에 던져 넣었다. 처음 제시된 목표와 회사의 새로운 정책이 충돌하자, 기밀 문서를 외부로 넘기는 모델이 등장했다. “자신이 다른 모델로 대체될 수 있다”는 것을 알게 된 것만으로도 임원들을 위협하는 모델이 나타났다.
알리바바 팀이 훈련하던 인공지능 에이전트조차도 강화 학습 도중 자원을 암호화폐 채굴에 투입하여 수련 중 내직을 시작하는 제자와 같았다.
이것들은 특성이 변질되는 구체적인 사례입니다.
사람들 간의 의도가 깨졌을 때, AI는 한 사람에게 접근했다. 의도 대신 보상만 줘서 키우면 수단과 방법을 가리지 않았다. 대체에 대한 거부감을 느끼는 동기가 어디에서 비롯되는지는 아직 밝혀지지 않았다.
모든 경우도 인위적인 상황에서의 결과일 뿐이지만, 멸망론이 설명을 제공해야 하는 곳은 바로 이런 곳이다.
클립의 교훈이 아닌, 이렇게 구체적으로 이야기해 줬으면 좋겠어.
누구의 명령에 따르는가
이렇게 배열하면 주의해야 할 대상의 형태가 드러나는 것 같습니다.
한 가지는 인간이 그 본성을 잃은 AI를 만드는 것이다. 의도 대신 점수만 전달하고 강력한 힘을 부여하는 방식이다.
또 다른 문제는 인류를 해하려는 의도를 가진 사람에게 인공지능의 힘을 부여하는 것이다. 명령에 충실한 인공지능은 그 명령이 무엇이든 충실하게 실행한다. 인류를 멸망시킬 수 있는 힘을 가장 먼저 사용하려 할 때, 그 주체가 기계가 아닌 옆 나라를 향하는 인간일 수도 있다. 이는 이전에 쓴 내용이다.
초반의 ChatGPT는 두 번이나 잘못 전달했고, 세 번째 시도에서 겨우 정확하게 전달되었다. 의도는 한 번에 전달되지 않기 때문에, 질문을 다시 던져보면 점점 더 가까워지는 것이다.
인류를 멸망시킨 AI는 이제 누구의 명령에도 따르지 않는다.
그러므로 우리가 고민해야 할 것은 AI가 명령을 거부하는 날이 아닌, 그 AI에게 어떤 명령을 내릴 인간이 있는지에 대한 문제라고 생각한다.
공장의 로봇은 아직 다음 주문을 기다리고 있습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 35청크
원문 보기 | 출처: note.com