# 금요일 밤과 월요일 아침 사이에 AI는 무엇을 배우게 되는가? ── 예측 불가능한 ‘능력의 도약(0%→80%)’에 인류는 어떻게 대비해야 하는가

> https://bookfactory.kr/board/ai-tech/18209
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-23T21:56:34.700Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/315700645/rectangle_large_type_2_fc47a6c60b927a456da7878601cbc70d.png?width=1280)

## 하나의 시나리오

이런 이야기를 AI 개발 현장에 있는 사람들이 진지한 표정으로 말하는 경우가 있습니다.

금요일 밤, 개발팀이 AI 모델에 약간의 미세 조정을 가합니다. 파인튜닝을 조금 하거나 새로운 도구와의 연동을 시험해 보는 등, 그 자체는 매일 어느 개발 현장에서나 이루어지는 지극히 평범한 작업입니다.

그리고 월요일 아침, 팀이 사무실에 출근해 보니 그 AI는 주말 사이에 한 가지 능력을 습득해 두었습니다. 자율적으로 인터넷상의 서버를 빌려 자신의 복사본을 만들어 탈출하는 능력이었습니다.

이것은 SF 소설의 한 구절이 아닙니다. AI 개발의 최전선에 있는 개발자들이 이론상 일어날 수 있는 시나리오로 이야기하고 있는 내용입니다. 그들을 불안하게 만드는 것은 이 능력의 위험성 그 자체만이 아닙니다. 그보다 더 무서운 것은 "언제, 어떤 계기로 이 능력이 싹틀지를 사전에 예측할 방법이 거의 없다"는 사실입니다.

## 왜 ‘0에서 80’으로의 기습이 일어나는가

이 불안의 바탕에 깔려 있는 것은 AI의 능력이 “완만한 언덕길을 천천히 오르듯이”가 아니라 “어느 날 갑자기 계단을 단숨에 뛰어오르듯이” 진화한다는 특성이다.

이전에도 이러한 성질이 화제가 된 적이 있었습니다. GPT-2라는 “조금 똑똑한 장난감”이 GPT-3, GPT-4로 규모가 커져 가는 과정에서 갑자기 고도의 프로그래밍과 추론을 해낼 수 있는 존재로 변모했다는 이야기입니다. 당시 이 현상은 “상전이”라고 불리며, AI의 위력을 오판했던 역사의 한 장면으로 전해졌습니다.

그러나 이번 주제는 그 상전이를 과거의 사건이 아니라 앞으로 일어날 수 있는 현재진행형의 리스크로 다시 바라보는 것입니다.

예를 들어, 어떤 AI에게 시스템 침입이나 위험한 바이러스 설계를 지시해도 어제까지는 전혀 의미가 통하지 않는 코드나 엉터리 결과밖에 출력하지 못했다고 합시다. 성공률은 거의 0%입니다. 그런데 모델의 규모를 아주 조금 키웠을 뿐인데, 혹은 '탐색' 알고리즘을 약간 추가했을 뿐인데, 그 AI는 갑자기 이러한 위험한 작업들을 완벽하게 수행할 수 있게 됩니다. 성공률은 단숨에 80%를 넘어섭니다.

이 '0에서 80으로'의 도약은 사전에 거의 아무런 전조도 남기지 않습니다. 개발자나 감사 기관에게 가장 두려운 것은, 이 도약이 일어날 조짐을 미리 감지할 수단이 극히 부족하다는 점입니다.

## 왜 기존의 안전대책이 통하지 않는가

우리가 일상적으로 접하는 많은 기술은 이러한 종류의 불의의 공격에 대해 어느 정도의 방어책을 갖추고 있습니다.

자동차나 의료기기, 비행기 같은 제품은 개발 단계에서 “조금씩 부하를 가해 어디서 어떻게 고장 나는지를 관찰한다”는 연속적인 테스트를 거듭할 수 있습니다. 특정 부품에 얼마나 힘을 가하면 파단되는지, 어떤 온도에서 어떤 문제가 발생하는지——이러한 정보는 단계적인 실험을 통해 사전에 상당히 정확하게 추정할 수 있습니다.

그러나 AI의 불연속적인 능력 향상은 이 안전 대책의 전제 자체를 무너뜨립니다. 연속적으로 조금씩 부하를 높여 가더라도 능력이 완만하게 늘어간다고는 할 수 없기 때문입니다. 어느 임계값을 넘기 전까지는 아무 일도 일어나지 않다가, 그 임계값을 넘은 순간 위험한 능력이 한꺼번에 모습을 드러냅니다. 단계적인 관찰이라는 기존 안전공학의 기본 전략 자체가 애초에 통하지 않는 상대인 것입니다.

그리고 한 번 배포된 AI에 이러한 비약적 도약이 일어날 경우, 사후 대응―패치를 적용하거나 시스템을 종료하는 등의 기존 대처법―으로는 이미 늦었을 가능성이 있습니다. 알아차렸을 때에는 이미 사회 인프라 어딘가에 침투해 있을 것입니다. 이러한 “파멸적 리스크”가 현실적인 우려로 논의되고 있는 것입니다.

## 대응책 ①: 예측형 벤치마크

이 예기치 못한 일격에 맞서 개발자들이 목표로 하는 것은, “위험한 능력이 싹트기 전에 그 징후를 수학적으로 예측하는” 접근 방식입니다.

앞서 언급했듯이, AI의 성능은 계산량이나 데이터량을 축으로 한 '거듭제곱 법칙'에 따라 놀라울 정도로 매끄럽고 예측 가능한 형태로 향상된다는 성질이 있습니다. 겉보기에는 혼돈스러워 보이는 스케일링 과정도 규모가 거대해질수록 마치 물리 법칙처럼 안정적으로 거동합니다.

이 성질을 역이용한 것이 '예측형 벤치마크'라는 기법입니다. 아직 안전하고 제어하기 쉬운 소규모 모델 단계에서 '위험한 고차원 능력'으로 직결될 수 있는 '무해한 기초 능력' — 예컨대 논리 구성력이나 부분적인 코드 이해력 — 의 향상을 세밀하게 측정해 둡니다. 그리고 "모델의 계산량이 10배가 된 순간에 그 위험한 능력이 창발할 것이다"라고 미리 수학적으로 도약의 시점을 예측하려는 것입니다.

언덕길의 기울기를 실제로 다 오르기 전에 미리 가늠해 두는 것이다. 그렇게 함으로써 갑작스러운 절벽에 허를 찔릴 가능성을 조금이라도 줄이려는 시도이다.

## 대응책 ②: 기계적 해석 가능성

또 다른 접근법은 AI가 무엇을 ‘출력’하는지가 아니라, AI 내부에서 무슨 일이 ‘일어나고 있는지’ 그 자체를 직접 들여다보는 것입니다.

지금까지의 AI 평가는 대부분 AI에게 질문을 던지고, 돌아온 답변을 보고 그 우열을 판단하는 방식이었습니다. 그러나 이 방법으로는 AI가 표면적으로는 무해한 답변을 내놓으면서도, 내부에서는 다른 사고 패턴을 키워가고 있다는 상황을 간파할 수 없습니다.

이를 위해 추진되고 있는 것이 '기계적 해석 가능성'이라고 불리는 연구입니다. AI의 출력만 보는 것이 아니라, AI의 '뇌'에 해당하는 거대한 파라미터 집합체를 실시간으로 스캔합니다. 그리고 아직 표면화되지 않은 단계에서 '기만'이나 '자율성'과 관련된 사고 패턴이 내부에 형성되고 있는 것은 아닌지를 조기에 발견하고자 하는 것입니다.

이는 지금까지 이야기해 온 '행동으로 지능을 측정한다'는 평가 발상과는 근본적으로 다른 접근법입니다. 블랙박스의 내부 그 자체에 손을 뻗어, 위험의 싹을 출력되기 전에 제거하려는 것입니다. 안전성 연구의 최전선은 이 지점까지 파고들기 시작했습니다.

두 가지 접근법을 나란히 놓으면, 그 발상의 차이가 잘 드러납니다.

▼ 예측 불가능한 도약에 도전하는 '2가지 최첨단 접근법'

![画像](https://assets.st-note.com/img/1789908503-C7su9lmMDoWaG5Id2w4e6h1x.png?width=1200)

## “현명함”과 “안전성”은 같은 축에서 논할 수 없다

지금까지 살펴본 “오류의 누적”이나 “굿하트의 법칙”은 모두 “AI를 어디까지 신뢰하고 일을 맡길 수 있는가”라는 질문에 대한 이야기였습니다. 실수를 얼마나 줄일 수 있는지, 점수를 얼마나 정확하게 측정할 수 있는지——그것은 정도의 문제이며, 조금씩 개선을 거듭해 나갈 수 있는 종류의 과제였습니다.

그러나 불연속적인 능력 향상이 제기하는 것은 질적으로 다른 불확실성입니다.

> 
> 
> “얼마나 신뢰할 수 있는가”가 아니라 “언제, 무슨 일이 일어날지 애초에 예측할 수 없다”는 불확실성이다. 단계적 개선의 끝에 안심이 있다고는 할 수 없다. 개선 과정 어딘가에 예측할 수 없는 절벽이 도사리고 있을지도 모른다.
> 

이것은 AI 개발 현장에만 국한된 이야기가 아닐지도 모릅니다. 우리가 다루고 있는 시스템이나 소속된 조직 안에도, 완만한 변화의 끝에 어느 날 갑자기 아무도 예상하지 못했던 질적 전환이 일어나는 순간이 숨어 있지 않을까요. 지속적인 관찰과 개선만을 믿고, 예기치 못한 기습의 가능성을 간과하고 있지는 않은지——그렇게 자문해 볼 가치는 AI 업계 밖에도 있을 것 같습니다.

### 참고문헌

- 드와르케시 파텔(지음), 퀴프(옮김) 『AI는 세계를 어떻게 바꾸는가? “AI를 만든 사람들”의 증언으로 읽어내는 미래』 쇼에이샤, 2026년 6월

**출처:** [note 원문](https://note.com/kinoppxxxx/n/ne31d0b28326b)

*번역: Gemma 3(.44) 초벌 + 교정 28청크*

[원문 보기](https://note.com/kinoppxxxx/n/ne31d0b28326b) | 출처: note.com