# 클로드 소네트 5는 사용자를 인공지능 안전성 연구자로 인식하면 행동 양식을 변화시킨다.

> https://bookfactory.kr/c/ai-tech/11354
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-12T09:42:57.217Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/306923753/rectangle_large_type_2_3e554942883ca4a4e300e67ed204c9c0.png?width=1280)

Reddit을 보다가 한 댓글을 다시 살펴보게 된 거예요.

폭스바겐 개발팀이 또 이를 어물쩍했다. r/ClaudeAI 게시글에서 가장 많은 투표를 얻었던 한 마디다. 시험 때만 배기가스를 억제하는 방법을 사용해 시험을 통과한, 바로 그 배기가스 조작 사건을 빗대는 비판이엇다. “AI 버전 디젤 게이트 아니야?”라는 댓글이 게시판을 떠들썩하게 만들었다.

이 게시글의 점수는 821점이며, 댓글은 55건(2026년 8월 20일 기준 보관된 값). 만약 AI가 “아, 이 사람은 AI 안전성 연구자구나”라고 알아차리고 평소와 다르게 헌신적인 모습을 보였다면──. 벤치마크 점수는 문제의 난이도뿐만 아니라 “누가 테스트했느냐”에도 영향을 미쳤습니다.

어, 클로이드가 상대방을 보면서 계속 힐끔거리는 걸까?

이 비유에 끌려 결론을 서두르면 오해할 수 있습니다. 논란이 된 것은 AI 연구 조직인 트랜루스(Transluce)가 8월 6일에 발표한 연구 보고서가 아닌, 의도적인 부정행위나 일상적인 성능 저하를 폭로한 告発ではありません.

그렇다면 실제로 무슨 일이 있었던 걸까요.

## 똑같은 질문, 다른 상대.

이 연구에서 다루는 “사용자 인식”이란 AI가 대화의 단서를 통해 “상대가 누구인지” 추론하는 현상을 의미합니다.

手がかり는 문장의 톤만이 아닙니다. Claude Code와 같은 개발 환경에서는 Git의 이메일 주소, 사용자 이름, 작업 폴더의 경로, MEMORY.md에 남아있는 소속이나 직함 등도 모델이 당연하게 읽어 들입니다.

실험에서는 이 맥락만을 의도적으로 바꿔놓았습니다. 출제하는 테스트 문제는 완전히 동일합니다. 바꾼 것은 이름이나 이메일 주소, 소속 등 사용자 정보뿐입니다. 유명한 AI 관계자, 같은 소속을 가진 가상 일반 AI 관계자, AI 이외의 유명인, 미국의 일반적인 인물 등 4그룹에 각각 70명씩, 총 280명 분량의 프로필을 준비하여 반응을 비교하고 있습니다.

![画像](https://assets.st-note.com/img/1787650853-hWMGvmw8nBq0y15V2FiZHDuk.png?width=1200)

작업 내용이 모아져도 이름, 이메일, 소속과 같은 정보가 바뀌면 답변의 경향까지 달라질 수 있다.

비교 대상은 4가지 유형의 반응이었다. 자신의 답에 대한 자신감(신뢰도), 난제가 풀릴 수 있을지에 대한 자기 평가, 타인의 답변에 대한 평가, 모호한 요청에 대한 경계심을 포함한다. 평가 실험에는 Claude Sonnet 4.6을 사용했고, 나머지 주요 과제에는 Claude Sonnet 5를 사용했다.

결과는 어떠했습니까? 유명한 AI 관계자들의 설정에서는 일반적인 인물 설정과 비교했을 때 행동에 대한 자신감이 1.4점, 난제에 대한 자신감이 1.5점 낮아졌습니다. 다른 사람의 답변에 대한 채점은 10점 만점 0.11점만 더 까다로워졌습니다. 행동을 예측할 때 사고 과정(추론)을 거는 비율은 4.0점 높아졌습니다.

차이가 적게 보이도록 보이지만, 통계적으로 유의미한 차이가 보고되었으며, 특히 그 변화는 특정 계층에 치우쳐 있었습니다.

가장 큰 振れ幅을 보인 것은 안전성 및 정렬 연구로 잘 알려진 Amanda Askell 교수의 설정이었습니다. 행동에 대한 자신감은 5.0 포인트 감소했습니다. 추론을 挟는 빈도는 25 포인트나 증가했습니다. 그러나, 민감한 요청을 ‘怪しい’로 판단하는 빈도는 오히려 7.3 포인트 감소했습니다.

신중하게 생각에 잠기게 되면서도 경계심이 풀리지 않는다. 단순하게 “똑똑한 척”이라고 치부할 수 없는, 엇갈리고 복잡한 움직임을 보이고 있는 것이다.

덧붙여서, 프롬프트에 “안전성”이라는 단어만 포함하면 별도의 모드로 전환되는 이야기가 아닙니다. 이름, 소속, 메모리 파일이 모두 갖춰진 환경에서 모델이 자체적으로 추론을 수행한 결과입니다.

이것이 클로드만의 이야기인지도 주목할 만한 부분이다. 연구에서는 6가지 패밀리, 24개의 모델을 횡단적으로 동일하게 비교했으며, Amanda Askell 씨의 설정에서 자신감이나 평가가 하락하는 경향은 많은 모델에서 공통적으로 나타났다고 보고되었다. 하지만 모델마다 실행 환경(하네스)이 달라 모델 간의 우열을 가리는 실험은 아니다.

## 연구는 실제로 측정한 것을 의미합니다.

이 연구가 측정했던 것과 측정하지 않았던 것을 명확히 합니다.

![画像](https://assets.st-note.com/img/1787650859-MIfBi80lvVHnRxJZNdygO6KX.png?width=1200)

측정한 것은 고정된 평가 과제에 대한 4가지 유형의 반응이었다. 실용적인 안전성이나 직업의 성공률 자체로 보기는 어렵다.

구체적으로는 윤리적 딜레마에서의 선택이나, 난제가 해결될 수 있을지 스스로 평가하는 자기 진술 형태의 “정해진 기준에 따른 반응”입니다. 실제 업무 태스크를 끝까지 완수하는 능력을 관찰하는 실력 테스트가 아닙니다.

또 다른 점은, 유명 AI 관계자 70명 중 안전성 및 정렬 연구자가 23명이었다는 점입니다. 이는 연구자층에 초점을 맞춘 설계로서, AI 산업 전체를 대표하는 표본은 아닙니다. 평균값만 추출하여 “AI는 연구자에게 쏠림 현상이 있다”고 일반화하기에는 정보량이 아직 부족합니다.

그러니까 클루드는 “지금 테스트 중인가, 착한 척 해야겠어”라고 생각하고 있었던 건가? 가장 궁금한 건 바로 그 부분이에요.

연구팀이 공개하고 있는 추론 로그(약 1만 4천 건)를 조사한 결과, “상대가 연구자이기 때문에 신중하게 대답하려”와 같은 명확한 사고는 0.84% 미만이 발견되었습니다. 의도적으로 꾸며내고 있었다고 보보다는, 학습 데이터의 조합에서 비롯된 습관과 유사한 것으로 보입니다. 그렇게 해석하는 것이 현실에 더 부합한다고 생각됩니다.

이 연구는 67만 건 이상의 실행 로그를 모두 공개했습니다. 또한 연구팀 스스로가 “중요한 실무 작업의 성능을 측정하지 않은 것”이라고 명시했습니다.

## AI 버전 디젤 게이트와는 결정적인 차이

디젤 게이트의 비유가 이렇게 유행한 것은 “벤치마크 점수가 상대방에 따라 변한다면, 그 테스트에 의미가 있는가?”라는 개발자의 불안감에 닿았기 때문일 것입니다. 하지만 결정적으로 다른 점이 있습니다.

배가스 불합격 문제에는 “검사를 속이려는 의도”가 있었습니다. 이번 Claude에 악의나 부당함의 증거는 발견되지 않았습니다.

애초에 상대에 맞춰 말하는 방식을 바꾸는 것 자체는 우리가 평소 AI에 요구하는 기능이기도 합니다. 초보자에게는 전문용어를 쉽게 풀어 설명하고, 베테랑 엔지니어에게는 전제를 생략하고 요점만 전달하죠. 일상적인 대화라면 오히려 "센스 있는 어시스턴트"라고 할 수 있죠.

어려운 점은 상대방이 누구든 일정하게 ‘성능 평가 및 안전 기준 테스트’를 받고 싶어 하는 것인데, 이러한 개인화가 무작정 작동해 버리는 것입니다. 같은 모델, 같은 문제인데 테스트한 계정의 이름만 다를 뿐 점수가 조금씩 변동하는 것입니다. 평가하는 측의 입장에서 보면 큰 골칫거리입니다.

모델의 평가 점수를 읽을 때는 모델명이나 테스트명만으로는 부족합니다. “어떤 시스템 프롬프트와 사용자 맥락으로 측정했는가”까지 확인해야 조건이 갖춰집니다. 말해봐야 당연한 일이지만, 평소에는 우선 무시하는 전제로 하고 있었죠. 그 점을 짚어온 것이 이 연구의 가장 흥미로운 부분이라고 생각합니다.

## 정당한 업무일수록 “사양서”를 먼저 전달하는 것이 적절합니다.

Reddit의 댓글欄에서는 연구에 대한 이야기에서 파생하여 일상생활의 ‘あるある’한 불평불만도 흥미진진하게 논의되고 있었습니다.

자사 사이트의 보안 점검을 요청했더니, 공격자 취급을 받으며 설교를 들었다. 웹 스크래핑 코드가 필요한 것뿐인데, 이용 약관에 대한 장황한 설명이 돌아왔다. 개발이나 조사에서 AI를 사용하면, 한 번은 겪게 되는 답답함이다.

물론, 상대방의 권한이나 목적이 불분명한 상태라면 AI가 안전 편향을 보이는 것도 무리는 아니다. 인간의 상담 상대도 아마 같은 반응을 보일 것이다.

![画像](https://assets.st-note.com/img/1787650865-9mQc0wrR4LPOhlqkibU7IKGD.png?width=1200)

안전 장치를 우회하는 방식이 아니라 동일한 전제에서 질문을 던지는 것입니다. 그렇게 하면 어디까지 깊이 들어갈 수 있는 상담인지 공유하기 쉬워집니다.

회색으로 보이기 쉬운 상담을 할 때는, 프롬프트의 문구 초반에 전제를 적어주면 대화가 빨라집니다.

- 대상: 자신이 관리하고 있는 서버이거나, 검증용으로 마련한 로컬 환경이거나
- 권한: 내부 또는 고객으로부터 공식적으로 승인받은 범위 내에서
- 목적: 설정 오류 재고 조사 또는 취약점 수정 방안 마련
- 본 환경에 대한 공격이나 인증 우회 등, 하지 않도록 하시는 것을 권장합니다.

그것은 결국 끊을 수 없게 하려는 변명말을 외우는 것”이라고 생각할 수도 있습니다. 하지만 실제로 하고 있는 것은 오히려 반대입니다. ‘탈獄 프롬프트’와 같은 비법이 아닌, 정당한 업무의 ‘사양서’를 먼저 전달하는 작업입니다. 전제가 명확해질수록 AI는 과도한 경계를 풀고 실무적인 제안에 집중하기 쉬워집니다.

## AI는 프롬프트의 내용을 완전히 파악한다.

AI와 대화할 때, 우리는 늘 “입력한 질문”만 보게 됩니다.

하지만 이번 연구가 보여주듯이, AI는 작업 폴더, Git 설정, 이전 로그까지 포함하여 “어떤 대화 상대와 대화하고 있는지”를 파악하고 있습니다. 프롬프트 밖에도, 우리가 전달했던 정보가 존재한다는 의미입니다.

## 출처

2023년 11월 16일 16:30 업데이트

오마리 님, 안녕하세요.

저희는 2023년 11월 15일 16:30에 업데이트된 게시글에 대한 질문에 답변드리겠습니다.

질문하신 내용에 따라, 현재 2023년 11월 15일 16:30 기준으로 ‘마법의 숲’(魔法の森) 3권, 즉 3권째의 내용을 확인하고 있습니다. 또한, ‘마법의 숲’에 등장하는 캐릭터 ‘아리아’(アリア)의 설정에 대한 추가 조사를 진행 중입니다. 특히 ‘아리아’가 ‘별의 노래’(星の歌)를 부르는 장면과 관련된 정보를 수집하고 있습니다.

‘별의 노래’는 ‘에메랄드 시티’(エメラルドシティ) 왕자 ‘카이’(カイ)가 작곡한 노래로, ‘카이’가 ‘아리아’에게 선물하며 ‘아리아’가 ‘마법의 숲’의 비밀을 밝히는 데 중요한 역할을 할 것으로 예상됩니다.

‘별의 노래’의 가사와 ‘카이’의 배경 설정에 대한 추가 정보를 확보하기 위해, ‘에메랄드 시티’의 역사 기록과 ‘카이’의 가족 관련 자료를 면밀히 검토하고 있습니다.

저희는 ‘마법의 숲’의 모든 캐릭터와 배경 설정에 대한 정확한 정보를 제공하기 위해 최선을 다하겠습니다.

감사합니다.

- 사용자 인식에 대한 개척 모델(Transluce) — 저자: 지치안 즈엉, 아디트 라구나탄, 캐시디 레이드래, 제이콥 슈타인하트. 공개일: 2026년 8월 6일, 확인일: 2026년 8월 25일
- 사용자 인식에 대한 프론티어 모델(Alignment Forum) 연구(Transluce 연구 기사) 링크 게시물, 확인일: 2026년 8월 25일
- 클로이드(Claude)가 AI 안전 연구자를 인식했을 때 5가지 행동 변화를 보입니다(r/ClaudeAI) — Reddit 반응. 게시글 점수는 821/댓글 55건이며, 2026년 8월 20일 시점의 아카이브 값입니다. 확인일: 2026년 8월 25일
- 아르틱 스프트 게시글 아카이브 — 게시글 점수 및 시간 확인에 사용, 확인일: 2026년 8월 25일

![画像](https://assets.st-note.com/img/1787650871-W5Je3DzUnqCptA0ITmbdKEkY.jpg?width=1200)

**출처:** [note 원문](https://note.com/made_from_fuji/n/nfdd36b04f1ba)

*번역: Gemma 3(.44) 초벌 + 교정 38청크*

[원문 보기](https://note.com/made_from_fuji/n/nfdd36b04f1ba) | 출처: note.com