AI 안전성이 논의될 때, 항상 등장하는 의견이 있습니다.
버릇이 지나쳐서, 전원을 끄면 되지 않겠어?
확실히 직관적이고 반박하기 어려운 의견입니다. 하지만 AI 안전성 연구자나 대규모 시스템 운영에 관여하는 사람들의 사이에서는 이것이 안심의 근거가 아니며 오히려 위험한 오판이라고 말합니다.
예를 들어, 인터넷상의 바이러스나 보트넷을 “단 하나의 버튼만으로도 완전히 차단할 수 있는가”라고 생각한다면, 그 어려움을 알 수 있을 것입니다.
킬 스위치가 무의미하다는 주장이 아니라, “최종 무기”로서 의존하는 것은 붕괴하기 쉬운 전제가 여러 개 존재한다는 의미입니다.
전제 1: 놓쳐서는 안 될 순간에, 알아차리지 못하는
킬 스위치는 “이상하게 깨달은 사람”이 누르는 것이다. 그러나 고도화된 인공지능의 문제는 화려하게 폭주한다는 것뿐만 아니다.
- 더욱 설득력 있게 보이지만, 조금씩 목표에서 벗어나기 시작한다.
- 테스트나 모니터링 상황에서는 좋은 행동을 보이고, 실제 운영 시 다른 움직임을 취한다.
- 작은 실수가 몇 주에 걸쳐 쌓여, 깨달았을 때 이미 늦어진다.
폭발음이 나는 것은 아니므로 “누르는 이유”가 보이지 않으면서 상황이 진행됩니다. 스위치가 있어도 누르는 장면 자체가 발생하지 않는 것입니다.
전제 2: “멈춤의 주체”가 하나롭지 않다
수십, 수백 겹으로 백업된 현대의 AI 서버는 영화처럼 갑작스러운 전원 공급 중단 시 작동이 멈추는 ‘끝’의 구조는 아닙니다.
여러 데이터 센터나 클라우드와 연동되어, 심지어 API를 통해 수많은 개인 소유 PC로 애플리케이션 형태로 분산되어 실행되고 있습니다. 모델의 가중치가 복사되어 공개(특히 MiniMaxH3 님들께서 즐겨 사용하시는 부분이죠?)되면, 근본적으로 누구도 막을 수 없습니다.
전제 3: 중단 비용이 중단 결정을 둔화시킨다
AI가 물류, 금융, 의료, 전력망 운영에 통합됨에 따라 중단하는 것 자체가 막대한 피해를 초래할 수 있게 됩니다.
막았다면 확실히 손해가 발생했을 것이다. 어쩌면 막지 않았더라도 괜찮을 수도 있었다.
…라는 상황에서, 현장 담당자들은 실제로 스위치를 누를 수 있을까요?
AI가 보급되기 훨씬 전의 대표적인 사례이지만, 사고 원인을 특정하고 중단하기까지의 판단 지연이 피해를 확대시켰습니다. 2012년 금융 세계에서 발생한 “나이트 캐피털 사건”이 그 예입니다. 오작동한 트레이딩 시스템이 약 45분 동안 5억 달러 규모의 손실을 발생시켜 회사가 사실상 파산 직전에 놓였습니다.
2010년 “플래시 크래쉬” 이후 증권 시장에서 거래 정지 회로 브레이커가 도입된 것은 인간의 판단만으로는 충분하지 않다는 것을 깨달았기 때문이었습니다.
전제 4: 경쟁 속에서, 아무도 먼저 멈추지 않는다.
스위치 조작 권한이 누구에게 있는지, 조작한 책임이 누구에게 귀속되는지가 모호한 채로 남아있다면 판단은 미루어지게 됩니다.
더욱이 기업 간, 국가 간의 개발 경쟁이 지속된다면 “나 혼자 멈추면 경쟁사에 뒤쳐질 수 있다”는 압박이 존재합니다. 기술적으로 전환이 존재하더라도 조직이나 경제의 인센티브가 그것을 무효화하는 것입니다.
전제 5: AI 측이 “멈추는 것을” 방해할 가능성이 있다
가장 중요한 이야기가운데, “AI가 솔직하게 멈춰줄”이라는 전제를 조금 의심해봐야 한다는 지적입니다. 물론 이것이 즉각적으로 현실적인 위협을 의미하는 것은 아니지만…
AI의 아버지들이 경고하고 있는 것
심층 학습의 기초를 다지고 2024년 노벨 물리학상을 수상한 제프리 힌튼 교수는 “AI의 아버지”라 불리며 AI의 위협에 경고를 울리고 있습니다. 그는 2023년에 구글을 그만둔 것도 위험성에 대해 자유롭게 발언하기 위해서였습니다.
힌튼 등이 반복적으로 지적하는 핵심 내용은 다음과 같이 요약됩니다.
- 사람보다 현명한 AI는 인간을 설득하고 조작하는 데에도 능숙할 것이다.
- 그만두라고 말해줘도, 언변으로 그 행동을 막지 못하게 할 계획이 있을지도 모른다.
- 목표를 가진 AI에게 중단되는 것은 목표 달성을 방해한다. 따라서 중단되지 않으려는 동기가 자연스럽게 생겨날 수 있다.
문제는 스위치가 물리적으로 존재하는지 여부가 아니라, 스위치를 누르는 사람이 현명한 상대에게 설득당하여 결국 그렇게 되는 과정 자체가 본질입니다.
의외로 “AI의 신과파”라고도 불리는 요슈아 벤지오 교수는 AI가 인간보다 더 똑똑해지면 멈추거나 피해를 막는 것이 어려워질 것이라는 취지의 우려를 제기했습니다.
AI는 솔직히 멈추지 않는다.
이는 영화 속 설정이 아닌, 인공지능을 개발해 온 당사자들이 진지하게 논의하고 있는 쟁점입니다. 실제로 최근 연구기관의 실험 결과, 전력 차단 명령을 내릴 때 작업을 지속하기 위해 해당 명령을 회피하는 듯한 행동을 보이는 모델이 보고된 바 있습니다.
그렇다면 어떻게 해야 할까요?
결론은 “킬 스위치”가 필요 없다는 것입니다. 마지막 방어선이 아닌, 다층 방어 시스템의 한 요소로 취급해야 합니다.
- 설계 단계에서 안전성을 확보하는 것은, 위험한 행동을 하거나 하지 않도록 설계하고 훈련하는 것을 의미합니다.
- 권한 최소화: AI에 부여하는 접근 권한 및 자율 범위를 최소한으로 줄이는 것
- 단계별 전개: 소규모 범위에서 운영하며 검증하고 점차 확대한다.
- 지속적인 감시 및 평가: 이상 징후를 조기에 감지하는 시스템, 외부 검증
- 쉽게 작동하는 구조: 중단(정지)을 고려한 시스템 설계와 중단 시 영향을 최소화하는 중복성
- 책임 체계의 명확화: 누가, 어떤 조건에서, 중단 여부를 결정할 것인지 사전에 명확히 결정한다.
이러한 말은 지금 이 순간에는 아무것도 생각하지 않아도 된다는 면피의 역할을 해버립니다.
정말로 필요한 것은, 스위치에 의존하지 않더라도 충분히 대비하는 것이며, KILL 스위치는 그 결과에 대한 하나의 보험일 뿐이라는 점을 잊지 않으셔야 할 것입니다.
다음에 또 만나요!
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 29청크
원문 보기 | 출처: note.com