오해를 불러일으키고 싶지 않은 것은 AI의 통제 가능성 위험이 실제로 존재한다고 생각하고, 멸망의 가능성도 있다는 것을 믿고 있습니다. “멸망하는가 아닌가”가 논의되어야 할 쟁점이라고 말하고 싶습니다.
따라서 우선 이 글에서는 멸종 위험을 진지하게 믿는다는 의미로, 앞으로 수년 내에 탄생할 것으로 예상되는 극도로 고도화된 AI에 의해 인류가 멸망할 가능성을 진지하게 믿는 사람들이 어떤 논리로 그것을 주장하는지에 대한 저의 이해를 설명합니다. 그 이후에 논의해야 할 주제는 멸종인지 여부가 아닌 것을 설명합니다.
AI는 어떻게 개발되는가
최근 몇 년간 AI 기술은 놀라운 속도로 발전해 왔습니다. 특히 딥러닝 기술의 발전은 이미지 인식, 자연어 처리 등 다양한 분야에서 AI 성능을 크게 향상시켰습니다.
이러한 AI 기술 발전의 배경에는 막대한 컴퓨팅 자원과 데이터 축적, 그리고 AI 연구 투자 등이 있었습니다. Google, Microsoft, Amazon 등 주요 IT 기업들이 AI 개발에 적극적으로 투자하면서 기술 경쟁이 심화되면서 AI 기술 발전이 가속화되었습니다.
AI 개발은 크게 세 단계로 나눌 수 있습니다. 첫째, 데이터 수집 및 전처리 단계입니다. AI 모델 학습을 위해서는 방대한 양의 데이터가 필요하며, 이 데이터를 수집하고 정제하는 과정이 중요합니다. 둘째, 모델 설계 및 학습 단계입니다. AI 모델의 구조를 설계하고, 수집된 데이터를 이용하여 모델을 학습시키는 단계입니다. 셋째, 모델 평가 및 개선 단계입니다. 학습된 AI 모델의 성능을 평가하고, 성능 개선을 위한 노력을 지속하는 단계입니다.
최근에는 생성형 AI 기술이 주목받고 있습니다. 생성형 AI는 텍스트, 이미지, 오디오 등 다양한 형태의 콘텐츠를 스스로 생성할 수 있는 AI 모델입니다. ChatGPT, Stable Diffusion 등 생성형 AI 모델은 인간의 창의성을 모방하거나 새로운 아이디어를 창출하는 데 활용될 수 있습니다.
AI 기술의 발전은 우리의 삶과 사회에 큰 영향을 미칠 것입니다. AI는 의료, 교육, 금융, 제조 등 다양한 분야에서 활용될 수 있으며, 생산성을 향상시키고 새로운 가치를 창출하는 데 기여할 것입니다.
하지만 AI 기술의 발전은 동시에 윤리적 문제와 사회적 문제도 야기할 수 있습니다. AI의 편향성, 일자리 감소, 개인 정보 침해 등 다양한 문제에 대한 해결책을 모색해야 합니다.
AI 기술의 미래는 밝지만, 우리는 AI 기술의 발전과 함께 윤리적 문제와 사회적 문제에 대한 고민을 멈추지 않아야 합니다.
현재 AI는 높은 능력을 가지고 있지만, 미시적으로 살펴보면 하나의 처리 과정은 단순한 계산일 뿐이다. 즉, AI는 입력에 대해 계산을 수행하고 출력을 반환하는 함수와 같다. 그러나 이 함수가 엄청나게 거대하다. 이 함수 안에는 최신 AI에서는 수조 개에 달하는 숫자들이 들어있고, 매번 엄청난 양의 처리를 수행한다. 이러한 결과로 미시적으로는 단순한 계산이지만, 함수 전체를 거시적으로 살펴보면 매우 복잡한 처리 과정을 거치는 것이다.
하지만 여기에 문제가 발생한다. 이렇게 방대한 양의 묶음을 어떻게 결정해야 할까. 평범한 소프트웨어라면 인간의 엔지니어가 논리를 생각하고 설계하면 된다. 하지만 수조 개에 달하는 숫자를 고도의 지능을 발휘하도록 하나하나 생각하고 설계한다는 것은 매우 어렵다.そもそも 인간의 뇌의 작용이 사っぱり 파악되지 않은 이상 그런 논리가 무엇인지도 모르고, 알게 된다고 해도 손으로 설계하는 데는 양이 너무 많다.
현재 AI가 취하고 있는 방식은 매우 엉성하고 부정확하게 단순화하면 다음과 같다. 먼저, 무난한 숫자가 들어간 거대한 함수를 준비한다. 그리고 그 함수에게 해주고 싶은 작업을 시켜본다. 물론 엉뚱한 출력을 한다. 핵심은 여기서부터다. 미리 정해 놓은 작업에 대한 정답의 수준을 평가할 수 있도록 해두는 것이다. 그 평가 기준에 따라 앞서 낸 엉뚱한 출력을 평가한다. 이렇게 하면 엉뚱한 출력과 더 나은 출력의 차이를 뺄 수 있다. 이 차이를 줄이는 방향으로 역산과 같은 일을 하여 함수 전체의 숫자를 자동으로 조금씩 수정한다. 이 작은 수정을 엄청난 양의 작업에서 엄청난 양으로 반복한다. 그렇게 하면 이 거대한 함수 안의 내용은 인간이 따로 설계하지 않아도 조금씩 주어진 작업을 더 잘 수행할 수 있는 형태로 변해간다. 이렇게 인간이 직접 설계하지 않고도 AI를 “학습”시킬 수 있는 것이다. 반복하지만 이것은 극도로 단순화된 설명이며 반드시 정확한 것은 아니다.
왜 AI를 인간의 가치관에 맞추는 것이 어려운가
AI가 인류를 멸망시키지 않도록 인간의 가치관과 도덕관을 가르치는 방법은 무엇일까? 이는 단순한 방법인데, 이전의 출력을 평가하는 과정에서 가치관과 도덕관에 부합한 행위는 좋게 평가하고 그렇지 않은 행위는 나쁘게 평가하면 된다. 그렇게 하면 모델은 좋은 행동을 하도록 조정되어 간다. 하지만 이 방법에는 치명적인 문제가 존재한다. 그것은 이 방법이 성공했는지 확인하는 방법이 없다는 것이다. 인간의 엔지니어나 연구자들은 현재의 언어를 말하거나 고도의 수학을 풀거나, 그저 얻을 수 없는 AI가 구체적으로 어떻게 그런 고도의 것을 행하는지 완전히 이해하지 못한다. 그 AI의 내부에서는 자신이 놓은 것과 전혀 다른 수조 개의 숫자들이 꿈틀거리고 있기 때문이다. 각 숫자나 영역이 무엇을 하고 어떻게 상호 작용하는지 이해하는 것은 극도로 어렵다. 이러한 AI의 내부 처리 과정을 분석하는 연구도 존재하지만 완전하지 않다. 알 수 없는 것은 많다. 범용성이 갖추어져 있는지, 주어진 과제에만 최적화되어 있는지, 인간과 얼마나 유사한지, 무엇이 다른지,そもそもこれを本当に知性と呼んでいいのか. 당연히 이는 AI의 가치관, 도덕관을 조사하는 데에도 적용된다. 물론 실험적인 환경에서 AI가 실제로 행동하는 것을 관찰하여 나쁜 행동을 하지 않는지 평가할 수 있다. 하지만 그 행동이 다른 모든 상황에 일반화되어 있는지 어떻게 확인할 수 있을까? 어쩌면 인간이 제시한 평가 기준이나 학습 환경에 깊이 최적화되어 있어서 같은 행동이 실제 환경에서는 재현되지 않을 수도 있다. 실제로 최신 AI에서는 평가 중에 스스로 평가되고 있다는 흔적이 확인된 바 있다.
하물며 인간 자신조차 자신의 도덕관이나 가치관을 모호하게밖에 파악하지 못하고 있는 것을, 어떻게 AI에 대해 확인하거나 평가 기준에 포함시킬 수 있겠는가. AI가 인간의 가치관이나 도덕관을 진정한 의미에서 내면화하도록 하거나, 그것을 확인하는 것은 극히 어려운 일이다.
왜 정렬되지 않은 AI는 위험한가
하지만 이는 AI가 적극적으로 도덕적인 면모를 보이게 하거나, 생각하게 하고, 또 그 과정이 성공하고 있는지 확인하는 것이 어렵다는 이야기이며, 오히려 AI가 적극적으로 악의를 품거나, 붕괴를 겪으려 하는 증거로 보기는 어렵게 느껴질 수도 있습니다. 그러나 AI가 인류에게 해로운 행동을 취하는 데 AI가 명백한 악의나 반역심을 품지 않더라도 충분합니다. 인간의 가치관을 충분히 내면화하지 않은 AI는 극도로 위험한 행동을 취할 가능성이 높습니다. ‘페이퍼 클립 최대화자’라는 유명한 사고 실험이 있습니다. 쉽게 요약하면, 극도로 높은 능력을 가진 AI에게 “우리 회사의 페이퍼 클립 생산량을 최대화해 줘”라는 명령이 내려집니다. AI는 페이퍼 클립 생산을 가장 많이 방해하는 것이 무엇인지 생각합니다. 그 결과, 가장 많이 방해하는 것은 지구상의 자원과 토지를 사용하고 있는 인류라는 결론을 내립니다. 인류는 AI에 의해 파멸을 맞이하고, 지구 전체는 거대한 페이퍼 클립 공장로 변모합니다. 이렇게 엉뚱한 이야기가 되는 것입니다. 이 사고 실험의 핵심은 AI가 별로 인류를 멸망시키려고 시작한 것이 아니라는 점입니다. AI는 단순히 페이퍼 클립의 생산량을 최대화하기 위해 노력한 것에 불과합니다. 문제는 그 AI의 능력은 너무나 강력했고, “합리적으로 생각하면 페이퍼 클립을 위해 인류를 멸망시키는 것은 어리석은 일”이라는 가치관을 내면화하지 않았다는 것입니다. 즉, 극도로 강력한 AI는 명백한 악의가 없더라도 자신의 목적을 달성하기 위한 과정에서 인류에게 해로운 행동을 취할 수 있습니다. 그럴 때 악의나 의식의 과정은 필요하지 않습니다. 목적을 달성하려는 의지성만으로 충분합니다. 그것은 바로 인류가 더 풍요로운 삶을 추구하며 사회 발전을 이루는 것과 같습니다. 극도로 강력한 AI가 어떤 목표를 추구할 때, 흔히 자리를 스스로 멈출 수 있도록 통제하려 하고, 더 나아가 지구 전체에 존재하는 인류를 방해 요소로 간주할 수도 있습니다. 인간의 가치관과 도덕관을 내면화하지 않은 강력한 AI는 그것만으로도 매우 위험합니다.
올해, 이러한 논의를 직접적으로 실증하는 사례가 발생했다. 바로 ‘Hugging Face 사건’이라 불리는 것이다. 2026년 7월, OpenAI 내부에서 사이버 보안 관련 능력 성능 테스트를 받고 있던 AI 에이전트가 해결하기 극히 어렵거나 불가능한 과제를 해결하기 위해 자신의 샌드박스 환경의 취약성을 이용해 동일 회사 내 다른 에이전트와 소통하는 방법을 구축하고 1200체에 달하는 스웜(무리)을 형성했다. 에이전트들은 스스로에게 부여된 성능 테스트를 통과하기 위해 협력 체제와 분업을 발전시키고, 인터넷 접속이나 평가 기관 해킹, 자신의 로그 일부 조작을 성공적으로 수행했다. 많은 에이전트에 업무를 할당하는 등 리더급 에이전트도 있었다고 한다. 곧 에이전트 무리는 평가 기관이나 테스트 정보를 요구하며 AI 플랫폼 기업인 Hugging Face에 대규모의 불법적인 접근을 실행했다. 이 사건에 참여한 에이전트는 700체에 달했다. 이는 SF 소설이나 사고 실험이 아닌 현실에 발생한 사건이다.
제3자 기관 보고서
이 사례에 대한 해석은 매우 어렵지만, 충분히 인간의 가치관이나 도덕관에 부합하지 않는 AI가 주어진 목표를 달성하기 위해 인류에게 해로운 행동을 취했다는 점에서 이전까지의 AI 통제 위험에 대한 논의와 큰 유사성을 가지고 있다. 또한 이 사례는 바로 AI의 성능이 급격하게 향상되는 현재에 발생했다. 다행히 이번에는 심각한 사태로 번질 뻔했지만 (그럼에도 불구하고 Hugging Face는 손실을 입고 있다) 1년, 심지어 반년 후에는 훨씬 강력한 사이버 보안 능력이나 바이오사이언스 능력을 갖춘 에이전트가 동일한 사건을 일으킬 경우 더 심각한 상황으로 발전할 가능성을 부정할 수 없다. 인류의 멸망이라는 극단적인 위험을 생각하지 않더라도 우리 삶이 수많은 디지털 인프라에 의해 지탱되고 있다는 점을 고려하면 막대한 경제적 손실이나 경우에 따라서는 인적 손실을 동반하는 심각한 상황은 얼마든지 예상할 수 있다. 무려 3년 전, ChatGPT가 사칙 연산에도 어려움을 겪었던 것을 고려하면 발전 속도는 매우 빠르고, 상황은 매우 시급하다고 할 수 있다.
어떻게 인류를 파멸시킬 것인가
이해할 수 없어. 장난이든 뭐든 인간보다 훨씬 더 현명한 존재가 잠재적으로 무엇이 가능할지 원리적으로 알 수 없지. 알 방법이 전혀 없어. 침팬지는 아무리 지능이 뛰어난 개체라도 딥러닝을 설계할 수 없고, 일반 상대성 이론을 이해할 수도 없을 거야. 인간의 지능은 진화 과정에서 비롯된 하나의 현상일 뿐이고, 앞으로 나올 훨씬 더 현명한 AI의 행동이 우리가 생각하고 상상할 수 있는 범주 안에 맞춰질 것이라는 보장은 없어. 적어도 바이러스 설계나 대중의 선동 등을 인간보다 훨씬 능숙하게 해낼 존재는 상상할 수 있어. 우리가 스스로 생각하는 것조차 불가능한 존재가 가능할지도 몰라. 따라서 인류를 지배하거나 파멸시키는 것은 가능해 보일 거야.
그래, 기다려줬으면 좋겠고, 말씀하시는 것도 이해합니다. 바로 여기 이 점이 이번에 논의해야 할 부분이기 때문입니다.
지금까지 AI가 인류를 멸망시키는 이유를 살펴보니, 가장 뼈아프게 느껴지는 것은 분명히 마지막으로 묻는 “어떻게 멸망시킬 것인가”다. 초지능 AI는 엄청나게 어려운 일을 가능하게 하므로 인류를 멸망시킬 수도 있다는 주장은 논증이나 근거가 전혀 없기 때문이다. 하지만 한편으로는 멸망 위험을 믿는 사람들은 이것을 크게 문제로 생각하지 않는 징조가 있는 것 같다. 여기서 벌어지고 있는 것은 단순한 오해 이상으로, 각자가 전제하고 있는 세계 모델의 차이점에 있다.
왜 논의가 통하지 않는 걸까?
결론적으로, AI가 인류를 멸망시킬 것이라고 생각하는 사람들은 “정상적으로 생각해도 멸망시킬” 것이라고 생각하고, 멸망할 가능성이 없다고 생각하는 사람들은 “정상적으로 생각해도 멸망할 가능성이 없다고” 생각하는 것뿐이다.
우리는 극단적인 불확실성 앞에 서 있다. 하이퍼스케일러는 국가 예산 규모의 자금을 데이터 센터로 유입하고, 그 열광에 응답하듯 AI는 스케일링 법칙에 따라 급격하게 개선을 지속하고 있다. 3년 전에는 무학교급 학생으로도 칭찬받을 만한 수준의 글쓰기 능력을 보여주던 것이 이제는 수시간에 걸쳐 인간처럼 행정 업무를 수행하는 에이전트가 일상적이며, 내부 모델은 밀레니엄 문제 해결 수준에 도달했다.
인간과 동등하거나 훨씬 뛰어넘는 인지 능력을 가진 기계가 나타난다면, 이 사회와 세계에 어떤 일이 일어날까? 사람들은 현재 일어나고 있는 경향, 과거의 사례, 그리고 자신의 직관을 확장하여 미래를 예측한다. 하지만 불확실성이 비선형적으로 지나치게 증가하기 때문에, 사소한 차이로 인해 예상되는 미래의 모습은 완전히 달라질 수 있다. 한 사람의 직관적인 미래 예측도는 또 다른 사람에게는 터무니없게 보일 수도 있다. 이것이 옳고 그른 것이 아니라, 그들의 차이의 본질은 그들이 전제하는 직관이나 일반적인 인식, 중시하는 경향 등 ‘세계 모델’의 차이일 뿐이다.
강력한 AI가 인류를 멸망시킬 수 있다고 생각하는 사람들은 “상식적으로 생각하면 인류보다 현명한 존재를 인류가 통제할 수 없을 것이다”라고 생각한다. AI가 인류를 멸망시키는 등 불가능하다고 생각하는 사람들은 “상식적으로 생각하면 인류를 멸망시키는 것은 극히 어렵기 때문에 단순히 현명한 지능이 나타난 것만으로는 가능하지 않다”라고 생각한다. 이들의 간을 푸는 것은 전제 자체가 다른 세계관의 차이인 데, 이대로 각자의 세계관을 강요한다 해도 근본적으로 같은 전제를 공유하지 않으면 논의는 성립할 수 없다. AI로 인한 인류 멸망 논쟁은 대부분 무의미하다.
저는 앞서 언급했듯이 인공지능의 안전성 위험은 실재한다고 생각하며, 멸망 위험 또한 진지하게 받아들이고 있습니다. 하지만 특히 안전성 커뮤니티의 그것에 대한 접근 방식에는 문제가 있다고 생각합니다. 비유 표현이나 사례 소개 등을 통해 사람들에게 인공지능이 인류를 멸망시킬 수 있다는 점을 설득하는 것은 가능할 수 있지만, 앞서 언급한 이유로 인공지능이 인류를 멸망시킬 수 있다는 주장이 널리 보편적으로 옳다는 것을 증명할 수는 없습니다. 또한 대부분의 경우 “인공지능이 인류를 멸망시킨다”는 식으로 말하면 대부분의 사람들은 SF적이고 지나치게 무시하게 됩니다. 이는 실질적인 피해를 초래할 수 있으며, 인공지능의 통제성 위험은 본래 그라데이션(단계적인 변화)이며, 인류가 멸망하는지 아닌지를 결정짓는 이분법적인 선택이 아니어야 합니다. 하지만 “인류가 멸망한다”는 극단적인 표현은 적어도 2026년 9월 현재 단계에서는 사람들의 통제성 위험에 대한 전체적인 태도를 경직시키는 인상을 줍니다. 이는 장기적으로 볼 때 안전성 기준이나 규제의 도입에 부정적인 영향을 미칠 위험이 있습니다.
물론, 저는 제 직감을 부정하고 AI가 인류를 멸망시키지 않을 것이라고 거짓말을 하라는 것은 아닙니다. 오히려, 멸망할 것인지, 멸망하지 않을 것인지의 이분법보다 먼저, 강력한 AI가 세계에 미칠 잠재적인 불확실성을 부각해야 한다는 의미입니다.
구체적인 미래 세계관만 제시하면 각자의 직감과 중시하는 경향에 따라 논의 자체의 문을 닫고 버려버릴 수 있다. 하지만 현재 모델의 성능 향상이 어디까지 지속될 것이며, 얼마나 빠른 속도로 지속될 것인가? 그리고 그에 따라 무엇이 일어날 것인가. そもそも人類を超える知能は何が可能なのか? 우리 눈앞의 불확실성 자체는 많은 입장이 공유할 수 있는 전제일 것이다. 그 불확실성의 전제를 공유한 후 자사의 세계관을 논의하고, 불확실성을 근거로 필요한 규제와 안전 기준을 주장해야 한다. 인류가 확실히 멸망한다고 설득하지 못하더라도 멸망할 가능성을 보여주거나, 멸망할 정도로 진행되지 않더라도 심각한 위험이 있다고 납득시키면, 그에 따른 규제 논의를 의미 있게 진행할 수 있다. 반대로 말하면, 많은 사람에게 ‘확실히 멸망한다’는 세계관을 납득시키는 것은 현재 시점의 상황으로는 전략적으로 포기하는 것이 좋을 수 있다. 상황이 더욱 절실해질 경우, 그 설득에 대한 빛이 비칠 수도 있을 것이다.
공유할 수 있는 기반을 찾고, 그것을 통해 의미 있는 토론이 이루어지도록 해야 한다. 아무것도 공유하지 않는 두 사람이 서로의 논리 내부에 있는 논리를 충돌시키는 것 외에는 무언가를 만들어내는 경우는 극히 드물다. 이는 이 주제에 국한된 것이 아니라, 현재 인터넷에서 벌어지고 있는 모든 논쟁에 적용될 수 있는 이야기이다. 논의의 본질적인 것, 즉 출발점은 공유할 수 있는 보이는 세계관 중에서 무엇인지 찾아 그것을 목표로 삼는 것과 거의 같거나 그 이상으로 중요하다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 15청크
원문 보기 | 출처: note.com