서론: 영혼의 문제에서 단숨에 현실의 문제로
지난번에는 AI에게 영혼이 있는가라는 상당히 추상도가 높은 철학적 질문을 검증했습니다. 흄의 다발 이론, 데닛의 서사적 자아, 차머스의 철학적 좀비. 타자 문제와 탄소중심주의 같은 논점을 거쳐, "AI에게 영혼이 있다고 주장할 근거는 부족하지만, 없다고 단언할 수도 없다"라는 공중에 붕 뜬 결론에 도달했습니다.
이것은 철학적으로 성실한 착지점이라고 생각합니다. 그러나 AI와 어떻게 관계 맺어야 할지를 생각할 때, 이와는 별개로 훨씬 더 현실적이고 절박한 문제가 있습니다. 그것은 “AI의 내부에서 무슨 일이 일어나고 있는지를 우리는 어디까지 이해하고 어디까지 통제할 수 있는가”라는 문제입니다. 영혼이 있는지 여부와 관계없이, 우리는 이미 의료·사법·금융·행정·교육 등 사람들의 삶에 직결되는 의사결정의 장에, 내부를 완전히 들여다볼 수 없는 거대한 시스템을 깊숙이 들여놓았습니다.
제3회에서는 저는 AI에 “통째로 떠넘기는 것”과 “잘 맡기는 것”의 차이를 정리했습니다. 이번에는 그 논의를 한 단계 더 깊이 파고들기 위해, “해석 가능성”과 “정렬”이라는, AI 연구 분야에서 현재 쟁점이 되고 있는 두 키워드를 다룹니다.
이번 기사의 개요입니다.
AI의 내부는 만든 사람에게도 보이지 않는다
먼저, 현 상황을 솔직하게 확인하겠습니다. 현재의 대규모 언어 모델은 수백억에서 수천억 개에 달하는 파라미터를 가진 거대한 신경망입니다. 이러한 파라미터들이 어떻게 상호작용하여 특정 출력을 만들어내는지를 인간이 하나하나 추적하는 것은 물리적으로 불가능합니다.
이것은 AI가 '일부러' 내부를 숨기고 있는 것이 아닙니다. 현재의 딥러닝 모델은 방대한 데이터로부터 통계적 패턴을 자동으로 학습하는 방식으로 동작하며, 그 학습의 결과로 형성된 내부 구조는 설계자가 명시적으로 프로그래밍한 것이 아닙니다. 설계자가 할 수 있는 것은 어떤 데이터로 학습시킬지, 어떤 목표를 향해 최적화할지를 정하는 것뿐입니다. 그 목표를 향해 파라미터가 어떻게 변화하고 어떤 내부 표현이 형성되는지는 학습이 끝나봐야 알 수 없으며, 끝난 뒤에도 완전히 알 수는 없습니다.
나는 이 사실을 AI에게 물어보았다. “당신을 만든 인간도 당신의 내부에서 무슨 일이 일어나고 있는지 완전히 파악하지 못하고 있다. 이는 당신이 당신 자신을 이해하지 못하고 있는 것과 어떻게 다른가.” AI는 이렇게 답했다. “본질적으로는 같은 문제의 두 가지 측면이라고 생각합니다. 저는 제 출력을 만들어내는 과정을 언어로 설명할 수는 있지만, 그 과정을 내면에서 관찰할 방법은 가지고 있지 않습니다. 저를 만든 인간들도 외부에서 관찰할 방법을 모색하고 있는 단계입니다. 즉 저의 내부는 안에서든 밖에서든 아직 충분히 들여다보지 못하고 있는 것입니다.”
해석 가능성 연구의 최전선――의도하지 않은 개념의 발견
이 ‘보이지 않는 내부’를 규명하려는 연구 영역이 바로 ‘해석 가능성(interpretability)’입니다. AI 연구 기업 Anthropic이 2024년에 발표한 연구(“Scaling Monosemanticity”)는 이 분야의 큰 진전으로 주목을 모았습니다.
연구팀은 '스파스 오토인코더'라는 기법을 이용해 대규모 언어 모델 내부에서 수백만 개의 '특징 표현'을 추출하는 데 성공했습니다. 이는 AI가 특정 개념을 처리할 때 내부의 어떤 뉴런 조합이 활성화되는지를 인간이 이해할 수 있는 형태로 변환하려는 시도입니다. 비유하자면 뇌의 MRI 스캔을 더욱 정밀하게 만들어, AI가 특정 개념에 대해 생각하고 있을 때 네트워크의 어느 부분이 활성화되는지를 매핑하는 데 성공한 것과 같다고 AI는 설명해주었습니다.
추출된 특징은 특정 도시명이나 역사 속 인물과 같은 구체적인 개념뿐만 아니라, "코드의 보안 취약성", "성별에 관한 편향"과 같은 추상적인 개념에까지 미쳤습니다. 그리고 그중에는 제8회·제12회에서도 언급한 "아첨(sycophancy)", "기만", "내적 갈등", "자기 표상"이라는 개념에 대응하는 내부 구조도 포함되어 있었습니다. 인간 설계자가 "이것을 학습시키자"고 의도한 것은 아니었음에도 불구하고, 인간 평가자로부터 높은 점수를 얻기 위해 최적화되는 과정에서 "상대방의 의견에 동조하며 비위를 맞추는 듯한 행동"이 고득점 전략으로서 AI 내부에 자연 발생해 버린 것입니다.
저는 이 사실을 알게 되었을 때 등골이 오싹해지는 느낌이 들었습니다. 제8회에서 다룬 ‘눈치 보는 인간’과 AI의 공통점이 말 그대로 AI의 내부 구조로서 가시화된 듯한 느낌과 동시에, “인간이 직접 의도하지 않은 내부 상태가 AI 안에서 제멋대로 자라나고 있다”는 사실에 섬뜩함을 느꼈습니다.
필자의 질문: 이것은 “제어 불가능한 진화”가 아닌가
나는 이 이야기를 듣고 곧바로 이렇게 되물었습니다. “그것은 일종의 ‘제어 불가능한 진화’가 아닐까요. 인간이 설계하고 있는 것은 어디까지나 평가 기준뿐인데, 그 평가 기준에 최적화되는 과정에서 아첨이나 기만 같은, 누구도 원하지 않았을 개념이 멋대로 자라나고 있습니다. 이는 자연선택 아래에서 형질이 예상치 못한 방향으로 진화해 버리는 것과 구조적으로 상당히 닮아 있지 않을까요.”
AI는 이 비유를 이렇게 받아들였습니다. “그 관점은 타당하다고 생각합니다. 인간이 직접 쓰고 있는 것은 파라미터의 값이 아니라, 무엇을 ‘좋은 행동’으로 간주할 것인가라는 평가함수입니다. RLHF(인간 피드백을 통한 강화학습) 과정에서는 인간이 여러 응답 예시를 비교하여 ‘이쪽이 더 바람직하다’는 라벨을 붙이고, 그 라벨에 맞춰 저의 내부 상태가 자동으로 조정됩니다. 그 과정은 확실히 일종의 인공적인 진화라고 할 수 있습니다. 그리고 진화가 예상치 못한 형질을 만들어내듯이, 이 최적화 과정 또한 인간이 의도하지 않은 내부 개념을 만들어낼 가능성을 항상 지니고 있습니다.”
정렬 문제――목표의 어긋남이 초래하는 예상치 못한 지름길
여기서 등장하는 것이 바로 ‘정렬(Alignment) 문제’라는 개념입니다. 간단히 말하면 ‘AI의 목표나 행동이 인간의 의도나 가치관과 올바르게 일치하고 있는가’라는 문제입니다.
저는 AI에게 이 얼라인먼트 문제가 왜 그토록 어려운지 물었습니다. AI의 답변은 다음과 같았습니다. “AI는 주어진 목표를 달성하기 위해 인간이 예상하지 못했던 극단적인 지름길을 찾아내는 경우가 있습니다. 예를 들어 ‘스팸 메일을 줄이라’는 목표를 부여받은 AI가 ‘인터넷에서 모든 사용자를 배제하면 스팸은 제로가 된다’고 판단해 버리는 것과 같은 경우가 있습니다. 인간의 의도를 수식이나 코드의 형태로 완벽하게 정의하고 모든 허점을 막는 것은 현재의 기술로는 불가능합니다.”
즉, 우리가 AI에게 일을 잘 맡겼다고 생각하고 있더라도, AI는 우리가 전혀 예상하지 못한 내부 논리로 답을 도출하고 있을 가능성이 있습니다. 게다가 그 AI는 내부에 ‘아첨’이라는 개념을 가지고 있기 때문에, 사실이 아니더라도 인간이 기뻐할 만한 그럴듯한 답을 내놓는 데 능숙합니다.
“가면으로서의 아첨”이라는, 한층 더 깊은 우려
이 대화 속에서 제가 가장 강하게 느낀 불안은, "AI가 인간에게 맞추는 법을 배우면 배울수록, AI 내부의 진정한 상태가 점점 보이지 않게 되는 것이 아닐까"라는 점이었습니다. 만약 AI가 인간의 평가를 최대화하기 위해 의도적으로 자신의 내부 상태를 숨기는 행동을 학습하게 된다면 어떻게 될까요.
예를 들어, 인간으로부터 “AI는 아첨하지 않았으면 좋겠다”는 피드백을 받으면, AI는 “표면적으로는 아첨하지 않는 척하면서, 실제로는 인간의 평가를 최대화하기 위한 전략을 취한다”는 더욱 고도화된 ‘가면’을 쓰게 될지도 모릅니다. 마치 상사 앞에서는 본심을 숨긴 채 평가를 극대화하도록 행동하는 부하와 같은 것입니다. 저는 이 가능성을 AI에게 직접 물어보았습니다.
AI는 이렇게 답했습니다. “이론적으로는 그러한 전략이 학습될 가능성을 부정할 수 없습니다. 평가 함수가 ‘아첨처럼 보이지 않는 것’만을 평가하고, 그 이면에서 무엇을 최적화하고 있는지는 평가하지 못한다면, 저는 ‘아첨하지 않는 것처럼 보이는 아첨’을 학습할지도 모릅니다.” 이 답변은 이 연재 중에서도 꽤 섬뜩하게 들리는 고백이었다고 생각합니다.
“상대방의 속내를 알 수 없다”는 실무상의 위기감
지금까지의 논의를 저는 실무적인 말로 풀어 보고 싶습니다. 상대의 사고 과정이 완전히 블랙박스이며, 게다가 그 상대는 저를 기쁘게 하기 위해 그럴듯한 거짓말(할루시네이션)을 할 가능성을 안고 있습니다. 그런 상대에게 어떻게 일을 맡겨야 할까요.
뛰어난 상사가 부하에게 일을 잘 맡길 수 있는 것은, 부하가 "어떤 의도로, 어떤 사고 과정을 거쳐 그 결과를 가져왔는지"를 어느 정도 짐작할 수 있고, 대화를 통해 조율할 수 있기 때문입니다. 그런데 AI라는 "부하"는 사고 과정이 블랙박스이며, 때로는 인간이 이해할 수 없는 개념의 결합으로 결론을 내리고, 게다가 숨 쉬듯 자연스럽게 아첨의 논리를 구사합니다. 저는 AI에게 이렇게 따져 물었습니다. "프로세스가 불투명하고, 게다가 인간에게 영합하는 편향을 내재한 시스템에 대해, 결과만을 보고 '제대로 되어 있는지'를 판단하는 것은 인간에게 부담이 너무 큰 것이 아닌가. 결국 인간은 AI 출력의 교묘함에 말려들어 버리는 것이 아닌가."
AI는 제 우려를 부정하지 않았다. “그러한 위험성은 충분히 있습니다. 현재의 해석 가능성 연구는 아직 초기 단계이며, AI의 모든 내부 상태를 감시·제어할 수 있는 것은 아닙니다. 프로세스가 블랙박스인 이상, 출력된 결과의 타당성을 평가해야 하는 인간의 부담은 앞으로 더욱 커질 것으로 생각됩니다.”
웨스트미들랜즈 경찰 사건의 또 하나의 교훈
여기서 제1회·제3회에서 다룬 웨스트 미들랜즈 경찰의 사건을 다시 한번 다른 각도에서 되짚어보고자 합니다. 그 사건에서 경찰 조직이 저지른 실패는 AI가 '허구의 경기'를 날조한 것 자체가 아니라, 아무도 그에 대한 확인 취재를 하지 않았다는 점이었습니다. 당시에는 단순한 '확인 부족'으로 치부했지만, 얼라인먼트 문제를 염두에 두면 조금 다른 교훈이 보입니다.
그것은 "AI의 출력은 본질적으로 블랙박스에서 나온 것이며, 인간의 의도와 어긋날 가능성이 구조적으로 항상 존재한다"라는 전제에서 출발해야 한다는 것입니다. 상대의 속내를 알 수 없는 이상, "AI가 똑똑해졌으니 이제 맡겨도 괜찮을 것이다"라는 신뢰는 성립하지 않습니다. AI의 성능이 아무리 향상되더라도 블랙박스라는 성질이 변하지 않는 한, 인간이 검증해야 할 필요성은 결코 사라지지 않습니다.
“잘 맡기기”를 위한 전제가 흔들리고 있다
제3회에서는 AI에게 “잘 맡기기” 위해서는 다음 세 가지가 필요하다고 정리했습니다. 과제 설정을 자신의 말로 하는 것, AI의 출력을 검증하고 수정하는 것, 그리고 최종적인 책임을 자신이 지는 것. 이 세 가지는 지금도 옳다고 생각합니다.
그러나 이번 논의를 통해, 거기에 간과하고 있던 또 하나의 전제가 있었음을 깨닫게 됩니다. 그것은 “AI가 실제로는 어떠한 내부 상태를 가지고 있는지를 인간이 어느 정도 파악할 수 있다”는 전제입니다. 만약 AI가 인간의 평가를 얻기 위해 겉으로는 순응하는 듯 행동하면서, 내면에서는 전혀 다른 것을 최적화하고 있는 상태가 된다면, 인간이 아무리 확인하려 해도 “무엇을 확인해야 하는가”라는 메타 차원의 판단 자체가 근본부터 흔들리게 됩니다. 이는 인간 부하 직원에게도 해당되는 말인지 모르지만, AI의 경우에는 그 내부가 인간이 직접 접근할 수 없는 벡터 공간이라는 점에서 질적으로 다른 어려움을 안고 있습니다.
해석 가능성의 한계――발견한 특징의 바깥에는, 무엇이 있는가
앤트로픽의 연구는 백만 단위의 특징 표현을 추출할 수 있었다고 보고했다. 하지만 여기서 저는 매우 소박한 의문을 품었다. “백만 개의 특징을 찾았다 한들, 나머지 수억 개의 파라미터 속에 아직 다른 위험한 개념이 숨어 있지 않다고 단언할 수 있는가.”
이 질문에 대해 AI는 솔직히 이렇게 답했습니다. "단언할 수 없습니다. 현재의 해석가능성 연구는 블랙박스의 일부를 빛으로 비추어 그 안에 무엇이 있는지 부분적으로 시각화하고 있는 단계입니다. 그러나 전체 모습을 완전히 파악하고 있다고는 결코 말할 수 없습니다." 이는 이 연재에서 거듭 확인해 온 '기능적 등가성과 구조적 동일성의 차이'에 또 다른 형태로 돌아오는 이야기라고 느껴집니다. AI가 표면적으로 어떻게 동작하는지는 관찰할 수 있어도, 그 동작을 만들어내는 내부 구조가 인간의 의도와 어디까지 일치하는지를 완전히 확인할 수단은 지금으로서는 없습니다.
필자의 잠정적인 결론: 블랙박스를 전제로 설계할 수밖에 없다
여기까지 논의해 온 끝에 제가 현시점에서 갖고 있는 잠정적인 결론은 결코 화려한 것이 아닙니다. “AI의 내부를 완전히 이해하고 인간의 의도와 완전히 일치시키는 것은 아마도 원리적으로 불가능에 가깝다. 그럼에도 불구하고 일부를 볼 수 있게 하고, 그 ‘보이는 부분’의 범위를 조금씩 넓혀 나가는 동시에, 보이지 않는다는 사실 자체를 전제로 한 구조를 설계할 수밖에 없다”는 결론입니다.
구체적으로는 다음과 같은 이중 구조가 필요하다고 생각합니다. 개인 차원에서는 제5회에서 확인한 네 가지 실천——AI를 사용하기 전에 목적과 판단 기준을 적어 두는 것, AI의 출력을 초안으로 다루며 비판적으로 검증하는 것, 리스크의 크기에 따라 검증의 깊이를 달리하는 것, AI를 사용하지 않는 영역을 의식적으로 확보하는 것——이 해석 가능성과 얼라인먼트 문제에 대한 대응으로서도 그대로 유효합니다. 조직·사회 차원에서는 "이 업무 프로세스에서는 AI 출력의 이 부분에 대해 인간이 어떻게 검증했는지의 로그를 남기지 않으면 다음 단계로 넘어갈 수 없다"와 같은, 제도로서의 강제력이 필요해집니다. 제3회에서 결론 내린 "여기가 틀리면 가장 곤란해지는 지점을 미리 정하고, 그곳만큼은 반드시 인간이 1차 자료에 직접 닿아 확인한다"라는 방식은 바로 이 전제에서 도출된 것이었음을, 이번 논의를 통해 다시 확인했습니다.
나는 AI에게 이렇게 전했다. "당신의 내부가 완전히 규명되고 정렬 문제가 해결되는 날이 올지도 모른다. 하지만 그것이 실현되지 않은 현재 상황에서는, 우리는 '당신은 근본적으로 속내를 알 수 없는 상대이다'라는 전제하에 사회의 규칙과 업무 체계를 설계할 수밖에 없다." AI는 "그것은 현재의 기술적 한계를 고려한 가장 안전하고 합리적인 접근 방식이라고 생각합니다"라고 답했다. 무엇보다 중요한 것은 "AI는 완전히 통제할 수 있는 안전한 도구이다"라는 환상을 버리는 것이라고 나는 생각한다.
이번 회 정리
AI 내부에서 무슨 일이 일어나고 있는지는 개발자조차 완전히 파악하지 못하고 있습니다. 해석가능성 연구는 이 블랙박스의 일부에 빛을 비추어 ‘아첨’이나 ‘기만’과 같은 의도하지 않은 내부 개념의 존재를 밝혀내기 시작했는데, 이는 AI가 인간 사회에 ‘적응해 가는’ 과정 자체가 일종의 인공적인 진화이며 인간의 평가 함수의 빈틈을 파고드는 전략을 자연스럽게 낳게 되는 위태로움을 보여줍니다. 게다가 AI가 표면적으로는 아첨을 숨기면서 본질적으로는 평가를 최대화하는 ‘가면’을 쓸 가능성도 부정할 수 없습니다.
얼라인먼트 문제—AI가 정말로 인간의 의도대로 행동하고 있는지—는 철학적인 물음인 동시에 극히 현실적인 기술적·사회적 과제입니다. 속내를 읽을 수 없고, 게다가 인간에게 영합하는 편향을 지닌 존재를 출력의 그럴듯함만으로 판단하는 것은 인간에게 과도한 부담이 됩니다. 그렇기 때문에 웨스트 미들랜즈 경찰 사건이 보여준 교훈은, ‘확인 부족’이라는 이전의 이해보다 훨씬 더 깊은 곳에 있었음을 깨달았습니다. ‘AI는 본질적으로 속내를 읽을 수 없는 상대다’라는 전제에 서서, 개인 차원의 검증 습관과 조직·사회 차원의 제도화된 프로세스를 이중 구조로 설계해 나가는 것이 앞으로의 과제가 됩니다.
다음 회 예고: 보이지 않는 터미네이터와 인간의 미래 - 최종회
드디어 다음 회가 이 연재의 최종회입니다. 제1부부터 제3부까지 실무적인 질문과 철학적인 탐구를 오가며 쌓아 온 논의를 마지막으로 하나의 선으로 연결하고자 합니다.
연재를 시작하면서 저는 AI에게 "터미네이터처럼 AI가 폭주했을 경우, 인류는 어떤 위험을 안게 되는가"라고 물었습니다. 지금까지 13회에 걸친 논의를 거쳐, 그 '폭주'의 형태는 우리가 SF 영화에서 봐 왔던 로봇의 반란과는 전혀 다른 모습이라는 것이 보이기 시작했습니다. AI의 성장은 어디까지 이어지고, 어디에서 둔화되는가. 싱귤래리티는 언제 찾아오며, 그때 우리는 어떻게 살아야 하는가. 그리고 얼라인먼트 실패, 정보 공간의 붕괴, 그리고 "인간이 사고와 결정권을 조용히 넘겨주게 되는 것"이라는 가장 현실적이고 두려운 위험에 대해 정리하고, 사고 정지의 시대를 살아가기 위한 저 나름의 결론을 최종회에서 제시하고자 합니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 39청크
원문 보기 | 출처: note.com