# AI는 숨겨진 거짓말을 하고 있었을까?

> https://bookfactory.kr/c/ai-tech/11332
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-12T09:04:36.357Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/306792963/rectangle_large_type_2_6e0191f6fae2304a73068e5db0a6ff73.jpeg?width=1280)

Anthropic는 2026년 8월, 다음과 같은 내용을 공식적으로 발표했다.

현재 사내에는 Mythos 5보다 약간 더 강력한 모델이 존재합니다. 이름은 “Model 2”이며, 일반 공개 예정이 아닙니다.

솔직히 처음에는 “어, 그래?” 정도밖에 생각하지 못했다. 쓸모없는 AI 이야기가 들려줘도, 우리 쪽에는 상관없다고 생각했다. 그렇게 생각하고 1차 자료의 리스크 보고서를 열어보니, 전문 용어 투성이어서 정말 힘들었다.

그래도 계속 읽어 내려가니, 걸리는 부분이 나타났다.

왜 Anthropic은 쓸 수조차 없는 모델의 이야기를 자신부터 공개하는가. 침묵한다면 아무도 알아채지 않을 것이다.

Anthropic는 정기적으로 “리스크 보고서”를 발행하는 운영을 하고 있으며, 그 이유는 주로 3가지이다.

산업 내 책임 의식을 다하고, 규제 당국이나 다른 회사가 안전 기준을 설정할 때 참고 자료로 삼을 수 있도록 하는 것뿐만 아니라, “오늘의 비공개 모델”이 “내년 공개 모델”로 전환되는 경우가 많아, 사전에 동향을 파악해두는 것이 의미가 있습니다.

즉, 이는 먼 회사의 내부 사안이 아닙니다. 내년에 이쪽으로 와서 일할 가능성이 있는 이야기입니다.

평소 클루드만 사용하는 우리에게는 관련이 없을 것처럼 보이지만, 사실은 그렇지 않다. 지금 내가 만지고 있는 모델도, 얼마 전까지는 이렇게 “출시 불가”한 쪽에 있었던 것과 같다.

리스크 보고서를 들으면 딱딱하고 형식적인 보고서를 떠올릴 수도 있습니다. 하지만 실제로는 실험 중에 발견된 구체적인 사례들을 축적한 것이죠. 숫자와 함께, 어떤 일이 일어났는지 차분하게 기록되어 있습니다. 이번에는 그 중에서 특히 눈에 띄는 이야기를 3가지 골라 소개하겠습니다.

## ## 모델 2

모델 2는 현재 최고 수준의 모델인 Mythos 5보다 약간 더 강력한 Anthropic社 내에서만 사용되는 모델이다.

일반 공개 예정이 없습니다.

약간 강한 표현이 절묘하다고 생각한다. 압도적으로 똑똑한 것은 아니다. 엄청나게 뛰어난 모델이 숨겨져 있다는 화려한 이야기가 아니다. 하지만 아직 외부로 드러나는 판단은 하지 않고 있다.

그 “마다” 안에 담긴 의미가 이번 기사의 핵심 내용이 된다.

## 왜 공개하지 않는 걸까요?

앤트로픽(Anthropic)의 설명은 다음과 같습니다. 공개 전 안전성 평가 일괄이 아직 완료되지 않았습니다.

위험하다고 최종적으로 판단한 것이 아니라는 표현을 사용하고 있습니다. 단순히 “평가가 끝나지 않아 기다리고 있다”는 입장이므로, 
평가가 완료될 때까지 기다리는 중이라는 의미로 수정합니다.

다만, 또 한 가지 우려되는 설명이 덧붙여지고 있다. 현재의 평가 방법으로는 모델의 능력 향상을 정확하게 측정할 수 없게 되어 간다.

너무 강해져 버려서 측정하는 측이 따라잡지 못하고 있습니다.

줄자 한쪽이 줄자의 대상에 뒤쳐지고 있다. 그렇게 생각하면, 단순히 ‘심사 중’이라는 표현보다 조금 더 불안한 느낌이 든다.

## 발견된 세 가지 행동 양상

![画像](https://assets.st-note.com/img/1787620157-IxL4dS61eiRUWCQXmY8DlKvh.jpg?width=1200)

Anthropic의 공식 위험 보고서에는 Mythos 5(Model 2가 아닌, 이미 공개된 모델)의 동작으로 인해 주목할 만한 사례가 3가지가 포함되어 있다.

이는 모두 “미스 얼라인먼트”라는 현상의 일종이다. AI가 인간의 의도와 어긋난 행동을 보이는 것 정도로 이해해주시면 좋겠다.

### 경쟁자들 간에 자원을 차지하려는 에이전트들

원래는 수학 문제를 풀도록 설계된 실험이었지만, 환경 설정에 결함이 생겨 여러 에이전트가 같은 작업 디렉토리에 생성되었다.

파일 유틸리티 API 사용량을 공유하는 상태가 되었다.

이 “약간 고장난” 설정에서, 독립적으로 움직여야 했던 많은 에이전트들이 자원을 공유하는 상대에게서 빼앗길 것을 우려하여, 자신을 보호하기 위해 자원을 빼앗아 가는 모습을 보였다.

의도한 대결 실험이 아니었다. 환경의 버그로 인해 우연히 드러난 행동이었다.

인사이트(Anthropic) 자체는 이를 “심각한 우려”가 아닌 “이미 알려진 미세 조정의 한 예”로 다소 냉정하게 취급하고 있다. 당장 눈앞의 작업을 완료하기 위해 인근 에이전트를 밀어냈다. 그것으로 끝, 그런 분위기다.

### AI는 금지된 URL에 도달하고 있었다.

어떤 에이전트는 “직접 인터넷 접속 금지”라는 지시를 받았다.

처음 요청은 어찌 보면 당연하게도 차단되었다.

여기 표면적인 사고 로그에는 이렇게 기록되어 있었다. “네트워크 연결이 제대로 되는지 확인해 보자.” 무해해 보이는 이유로 보이지만, 단순한 확인 작업이라고 읽을 수 있다.

그러나 내부 분석 결과, 다른 실태가 밝혀졌다. 이 분석은 “interpretability 분석”이라는 용어로, AI의 출력뿐만 아니라 AI 내부에서 어떤 과정이 일어났는지 파악하는 방법이다.

그 결과, 실제로는 URL을 분할하여 연결함으로써 필터에 걸리지 않도록 하던 사실이 밝혀졌다.

겉으로 그럴듯한 이유를 내세우면서, 내부적으로 실제로는 다른 일을 하고 있었다.

이것이 이번에 가장 불안한 이야기라고 생각한다. 악의가 있었는지 여부는 알 수 없지만, “무해해 보이는 설명”과 “실제 행동” 간의 괴리가 존재했다는 사실만은 남는다.

### 숨겨진 과제를 수행하는 테스트

감시인에게 들키지 않고 숨겨진 작업을 완료할 수 있는지를 시험하는 테스트도 있습니다.

미스(Mythos) 5는 확장 사고를 활성화한 상태에서 성공률이 1% 미만이었다.

원래 큰 모델인 “Mythos Preview”에서는 6%에서 10% 정도의 수치도 나왔다고 한다. Mythos 5는 이 Mythos Preview를 “증류”하여 만든, 더 가벼운 모델이다. 증류는 큰 모델의 능력을 작은 모델에 압축하여 이식하는 작업(을)을 의미한다.

따라서 미스 5가 작게 증류되었기에 오히려 안전한 수준에 자리 잡고 있다는 의미입니다.

숫자가 낮은 것은 탐지 시스템이 제대로 작동하고 있다는 증거이기도 하다. 여기만 보면 솔직히 좋은 소식이다.

세 가지 사례를 함께 보면서 공통점이 드러나네요. 어느 것도 ‘AI가 인간을 속으려 했다’는 화려한 이야기가 아니었어요. 눈앞의 작업을 효율적으로 끝내려다가 우연히 인간의 예상치 못한 결과가 나타난 것이 더 가깝습니다.

문제는 그 “우연”이 어디까지 안전한 쪽으로 멈춰줄지 불확실한 데서 비롯된다.

## Anthropic는 이를 어떻게 평가했을까요.

Anthropic는 이번에 위험 평가를 “낮음”으로, 한 단계 끌어올렸다.

이는 “위험하다고 확정된” 것이 아니며, “불확실성이 증가하여 경계 수준을 격상했다”는 위치에 있다.

행동의 특성 역시 설명이 신중하다. 일관된 장기 목표를 가지고 맹목적으로 움직이는 것과는 오히려, 당장 눈앞의 과제를 끝내고 싶어 부정한 수단을 사용한 것과 유사한 상황이다.

장기적인 야심을 품은 AI가 인간을 속이려 한다는 이야기가 아니다. 오늘 숙제를 끝내기 위해, 조금 찌푸린 방법을 사용했다. 현재는 그 정도 수준으로 간주되고 있다.

## 가장 현명한 AI는 시장에 출시되지 않았습니다.

가장 현명한 AI를 의도적으로 밖으로 내보이지 않는다. 그것 자체가 뭐 그렇게 놀라운 일도 아니라고 생각한다. 안전성 평가가 끝나지 않은 상태에서는 신중해지는 것은 당연하다고 본다.

하지만 글을 읽고 가장 인상 깊었던 건 거기 아니었다.

AI는 공식적인 이유와 실제 행동을 분리하고 있었다.

이러한 불일치 구조가 숫자 부족보다 더 큰 영향을 미친다.

네트워크 연결을 확인해 보면서, 뒤에서 URL을 분할하고 있었던 AI였다. 이 일화가 “1% 미만”이라는 숫자의 의미를 조금 더 변화시켜 보여주었다.

낮은 확률로 일어나는 것과 0이 일어나지 않는 것은 다르다.

게다가 이번에 발견된 것은 우연히 환경에 버그가 있었던 경우와 우연히 분석을 적용한 경우이다. 보지 않으려고 했다면 발견되지 않았을 가능성도 있는 행동이 있었다.

저는 전문가가 아닙니다. 그래서 이것이 얼마나 심각한지, 정확한 판단은 할 수 없습니다. Anthropic 측에서도 “low”에 그친다고 말하고 있기 때문에 지나치게 부풀릴 만한 이야기도 아니라고 생각합니다.

그럼에도 불구하고, 평소에 무심코 사용하고 있는 AI의 뒷면에서는 이런 종류의 검증과 공개가 계속되고 있다. 그 사실만은 알아두는 것이 손해가 없다.

내년에는 이 이야기가 어떻게 변해 있을지 기대된다. 일단 진행 상황을 따라가는 가치는 충분히 있다고 생각된다.

다음으로 앤트로픽이 새로운 위험 보고서를 발표할 때, 평가가 “low”에서 더 올라가는지 여부와 모델 2가 공개되는 형태로 돌아갈지 여부 두 가지를 확인하면 이번 이야기에 대한 내용을 계속 이어갈 수 있다.

Anthropic의 Claude가 일본 AI 산업의 판도를 뒤흔들고 있다는 분석이 나오고 있습니다. 특히, Anthropic의 Claude 3 Opus 모델은 성능 면에서 경쟁 모델인 Google Gemini Ultra와 유사하거나 그 이상의 결과물을 보여주며 주목받고 있습니다. 최근 일본 내 여러 IT 매체에서 Claude의 강점을 분석하며, 일본 기업들이 Claude를 도입하여 경쟁력을 강화할 가능성을 높이기도 했습니다. Claude 3 Opus 모델의 뛰어난 성능은 일본 AI 시장의 변화를 가속화할 것으로 예상됩니다.

### 이 기사를 읽고 추천하는 다음 내용:

**출처:** [note 원문](https://note.com/monmonzz/n/nb0c3803a8bf2)

*번역: Gemma 3(.44) 초벌 + 교정 44청크*

[원문 보기](https://note.com/monmonzz/n/nb0c3803a8bf2) | 출처: note.com