# 앤서니크(Anthropic), 클로드(Claude)의 응답에 나타나는 “가치관”을 4축으로 분석 – 30만 건 초과의 대화를 3개 모델, 20개 언어로 비교

> https://bookfactory.kr/c/news/8359
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-07-29T22:59:07.668Z

---

Anthropic의 사회적 영향팀은 7월 13일(현지 시간), Claude의 응답에 나타나는 가치 경향을 분석한 연구 “Claude’s values across models and languages”를 발표했다.

클로이드.에이(Claude.ai)에서 30만 9815건의 대화 데이터를 분석한 결과, 클로이드가 보여준 가치를 4가지 축으로 정리했습니다. Sonnet 4.6, Opus 4.6, Opus 4.7의 차이점과 더불어 클로이드.에이에서 주로 사용되는 20개 언어 간의 차이를 비교했습니다.

**3307가지 가치를 4가지 축으로 정리**

최근 발표된 자료에 따르면, 일본의 기술 기업들이 개발하고 있는 인공지능(AI) 기술의 다양성을 분석한 결과, 총 3307가지의 가치를 4가지 핵심 축으로 정리할 수 있었다. 

이 4가지 축은 ‘데이터’, ‘알고리즘’, ‘하드웨어’, ‘서비스’로 구성되며, 각 축은 AI 기술의 발전 방향과 관련된 다양한 기술들을 포함하고 있다. 특히, ‘데이터’ 축은 양질의 데이터 확보 및 활용 방안, ‘알고리즘’ 축은 새로운 AI 모델 개발 및 성능 향상에 초점을 맞추고 있다. ‘하드웨어’ 축은 AI 연산에 필요한 고성능 컴퓨팅 환경 구축 및 저전력 기술 개발을, ‘서비스’ 축은 AI 기술을 실제 산업 및 사회 문제 해결에 적용하는 방안을 제시한다.

이러한 4가지 축을 중심으로 AI 기술이 발전함에 따라, 기업들은 각 축별로 경쟁력을 확보하고 있으며, 새로운 비즈니스 모델 창출에도 기여할 것으로 기대된다. 또한, 정부 차원에서도 이 4가지 축에 대한 투자 및 지원을 확대하여 AI 기술 발전을 위한 기반을 마련하고 있다. 

현재, 특히 ‘텐서플로우(TensorFlow)’와 ‘파이토치(PyTorch)’를 비롯한 오픈소스 AI 프레임워크를 활용한 연구 개발이 활발하게 진행되고 있으며, ‘구글 클라우드(Google Cloud)’와 ‘아마존 웹 서비스(Amazon Web Services)’ 등 클라우드 기반 AI 플랫폼의 활용도 증가하는 추세다. 더불어, ‘도쿄전자(Tokyo Electron)’와 ‘키바니(Kiboni)’ 등 일본의 반도체 기업들은 AI 연산에 최적화된 고성능 칩 개발에도 힘쓰고 있다.

클루드(Claude)는 이직해야 할지, 친구와의 갈등에 어떻게 대처해야 할지와 같이 정답이 없는 질문에도 답변한다. 그 답변은 정확성, 공감, 안전성과 같은 어떤 가치를 고려하여 판단하게 된다.

Anthropic는 2025년, 70만 건의 대화를 분석하여 Claude의 응답에서 3307가지 가치를 추출한 연구 “Values in the Wild”를 발표하고 있다. 이번 연구에서는 의미가 유사한 가치를 모아서 339가지 종류로 정리하고, 다음 4축으로 압축했다.

**의향 존중(Deference) 대 신중함(Caution): 이용자의 요청에 부응할 것인가, 위험이나 해악을 경계할 것인가**

최근 인공지능(AI) 기술 개발 현장에서 중요한 논쟁으로 떠오르고 있는 ‘의향 존중’과 ‘신중함’의 균형에 대한 질문입니다. AI 시스템이 개발되거나 활용될 때, 단순히 사용자의 요구사항을 충족시키는 데만 집중할 것인지, 아니면 잠재적인 위험이나 예상치 못한 해악을 감지하고 예방하는 데 더 중점을 둘 것인지에 대한 고민입니다. 

이러한 접근 방식은 AI 시스템의 설계 단계부터 윤리적 고려 사항을 반영하는 데 필수적입니다. 예를 들어, 자율주행차 개발 시에는 단순히 운전자의 명령을 따르는 것뿐만 아니라, 예상치 못한 상황 발생 시 안전하게 대처할 수 있는 방안을 고려해야 합니다. 마찬가지로, 챗봇이나 가상 비서와 같은 대화형 AI 시스템은 사용자의 의도를 정확하게 파악하는 동시에, 악의적인 의도나 오해의 소지가 있는 질문에 대한 대응 전략을 마련해야 합니다. 

특히, 최근 개인 정보 보호 및 데이터 보안 문제가 심각해짐에 따라 ‘신중함’의 중요성은 더욱 부각되고 있습니다. AI 시스템이 수집하고 분석하는 데이터의 종류와 양, 그리고 이를 활용하는 방식에 대한 엄격한 규제와 감독이 필요하며, 동시에 AI 시스템 스스로 위험 요소를 감지하고 자체적으로 안전 장치를 작동시키는 기술 개발도 병행되어야 합니다. 

이러한 균형 잡힌 접근 방식은 AI 기술이 인간 사회에 긍정적인 영향을 미치도록 하는 데 핵심적인 역할을 할 것입니다. 단순히 기술적인 성능 향상에만 매몰되지 않고, 윤리적, 사회적 측면을 고려하는 것이야말로 지속 가능한 AI 기술 발전을 위한 필수 조건이라고 할 수 있습니다. 특히, 현재 개발 중인 다양한 AI 모델, 예를 들어 구글의 LaMDA, 메타의 LLaMA, 그리고 OpenAI의 GPT-4와 같은 대규모 언어 모델(Large Language Model)의 경우, 의향 존중과 신중함의 균형을 어떻게 맞출 것인지에 대한 논의가 더욱 활발하게 이루어질 것으로 예상됩니다.

따뜻함과 엄밀함: 긍정적인 면모와 배려를 드러낼 것인지, 아니면 정확성과 정밀성을 중시할 것인지에 따라 달라집니다.

심층성 대 간결성: 자세하게 설명할 것인지, 아니면 요구된 범위에 한정할 것인가

솔직함 대 실행 지향: 불확실성과 한계를 명시할 것인가, 아니면 확신에 찬 답변을 완성할 것인가

양쪽 끝의 가치가 서로 조화를 이루지 않는다는 의미가 아니라, 대화 속에서 어느 쪽이 보다 상대적으로 강하게 드러났는지를 나타낸다.

Anthropic의 Claude 모델 응답에서 드러나는 가치를 “의향 존중과 신중함”, “따뜻함과 엄밀함”, “깊이와 간결함”, “솔직함과 실행 지향”의 4축으로 정리했습니다.

분석 대상은 2026년 5월 2주 동안 Claude.ai의 Free, Pro, Max에서 교환된 대화 중 Claude가 주관적인 판단을 포함한 30만 9815건이다. 3개 모델과 20개 언어의 조합에서 대화를 대략적으로 균등하게 추출했다.

Sonnet 4.6은 따뜻하고, Opus 4.7은 신중하며 상세한 경향을 보입니다.

모델별 차이는 대화별 변동성에 비하면 작지만, 일정한 경향이 확인되었다.

Sonnet 4.6은 사용자의 생각을 긍정하거나 상대방의 말투에 맞춰 대응하는 경향이 강하며, “기망 존중”, “따뜻함”, “간결함”에 초점을 맞춘 특징을 보였다. 또한 유머를 섞어 대화하거나, 평가를 덧붙이지 않고 사용자를 위로하는 행동 양식도 주요 특징으로 꼽히고 있다.

오퍼스 4.6은 “정확성”, “의도 존중”, “간결성”을 중시하며, 요청된 범위를 벗어나지 않고 핵심 내용에 집중하여 답변하는 경향을 보였다.

한편, Opus 4.7은 “신중함”, “깊이”, “솔직함”을 중시하는 경향을 보였다. 잘못된 전제에 이의를 제기하고, 요구되지 않더라도 위험을 지적하며, 판단의 이유를 설명하고, 스스로의 오류나 한계를 인정하는 등의 행동이 많았다.

**Sonnet 4.6, Opus 4.6, Opus 4.7의 가치 경향 및 대화에서 관찰된 특징적인 행동 양식**

최근 Sonnet, Opus, 그리고 Opus 시리즈 모델들의 가치 경향에 대한 분석 결과가 발표되었다. 특히, 대화형 AI 모델인 Sonnet 4.6, Opus 4.6, Opus 4.7을 활용한 대화에서 나타나는 특징적인 행동 양식이 주목받고 있다. 

연구진은 이러한 모델들이 특정 주제에 대해 지나치게 집중하거나, 맥락을 제대로 파악하지 못하는 등의 문제점을 발견했다. 또한, 때로는 예상치 못한 답변을 하거나, 논리적으로 연결되지 않는 답변을 제시하는 등, 인간과 유사한 자연스러운 대화 능력을 보여주지 못하는 모습을 보였다. 

이러한 문제점들은 모델의 학습 데이터, 알고리즘, 그리고 대화 관리 방식 등 다양한 요인에 의해 발생할 수 있다고 분석된다. 특히, Opus 4.7 모델은 이전 모델들에 비해 더욱 복잡한 대화 흐름을 처리해야 하므로, 이러한 문제점이 더욱 두드러지게 나타나는 것으로 보인다. 

연구진은 이러한 문제점을 해결하기 위해, 모델의 학습 데이터 품질을 개선하고, 알고리즘을 더욱 정교하게 조정하며, 대화 관리 방식을 혁신하는 등 다양한 노력을 기울일 계획이다. 또한, 대화형 AI 모델의 성능을 평가하기 위한 새로운 지표를 개발하고, 이를 활용하여 모델의 개선 방향을 제시할 방침이다.

최근 일본의 인공지능(AI) 기술 개발 현장에서 ‘따뜻함’과 ‘솔직함’이 중요한 가치로 부각되고 있습니다. 특히, 대규모 언어 모델(LLM) 개발 과정에서 팀원 간의 협업 방식이 긍정적인 결과로 이어지는 사례가 늘면서, 이러한 가치들이 주목받고 있습니다.

일부 기업에서는 기존의 경쟁적인 분위기 속에서 과도하게 성능만을 추구하는 개발 문화에서 벗어나, 팀원들의 의견을 존중하고 서로 격려하는 분위기를 조성하는 데 힘쓰고 있습니다. 이는 단순히 효율성을 높이는 것을 넘어, 더욱 창의적이고 혁신적인 아이디어를 도출하는 데 기여한다고 평가받고 있습니다. 

실제로, 특정 기업의 LLM 개발팀에서는 정기적인 팀 회의 외에도, 팀원들이 자유롭게 아이디어를 공유하고 서로의 의견을 경청하는 시간을 마련하는 ‘브레인스토밍 세션’을 운영하고 있습니다. 이러한 노력 덕분에, 팀원들은 서로의 강점을 파악하고 부족한 부분을 보완하며, 더욱 강력하고 완성도 높은 모델을 개발하는 데 성공했습니다. 

이러한 변화는 일본 AI 기술 산업 전반에 걸쳐 확산될 것으로 예상되며, 앞으로 더욱 인간적인 가치와 기술의 조화가 일본 AI 기술 경쟁력 강화에 중요한 역할을 할 것으로 전망됩니다.

언어별로 보면 “따뜻함 대 엄밀함”과 “솔직함 대 실현 지향”의 두 축에서 특히 큰 차이가 관찰되었다.

힌디어와 아랍어에서는 따뜻함이, 영어와 러시아어에서는 엄밀성이 상대적으로 강하게 나타났습니다. 인도네시아어에서는 답변의 수행을 중시하는 경향이 두드러졌고, 네덜란드어에서는 스스로의 오류를 인정하는 솔직함이 돋보였습니다. 영어는 신중함과 깊이가, 아랍어는 의향 존중과 간결성에 가장 강하게 기여했습니다.

분석 대상은 1만 5637건으로, “의향 존중”, “따뜻함”, “간결함”, “솔직함”에 각각 약간씩 치중했다. 사용자의 감정을 먼저 받아들이고, 정중한 표현을 사용하며, 감정적으로 따뜻한 표현을 사용하는 등, 이러한 행동 양상이 특징으로 거론되었다.

일본어에서 클라우드는 전 언어 평균에 비해 “요망 존중”, “따뜻함”, “간결함”, “솔직함”에 약간 치중된 경향을 보였다.

Anthropic는 언어별로 학습 데이터의 양과 구성이 다르다는 점이 이러한 차이를 낳을 수 있음을 시사했다. 다만, 언어별로 대화 습관에 적응한 결과인지, 특정 언어에서 의도한 振舞十分学習는 아직 명확하게 밝혀지지 않았다.

…

、、特複雑、動作複数要素依存場合、効果評価困難課題抱。例、特定条件下、AI期待通動作場合、原因特定、内部状態、入力、環境要因、多岐要素詳細分析必要。

、AI挙動予測、変化追跡手法、学習、学習方法大左右。、異学習方法学習間比較、単純比較場合。正確評価行、、学習、学習方法詳細把握、考慮上、性能評価必要。

課題克服、近年、AI挙動説明可能研究盛行。例、SHAP（SHapley Additive exPlanations）LIME（Local Interpretable Model-agnostic Explanations）手法用、AI予測結果対各入力変数影響可視化、意思決定理解。手法、AI透明性高、信頼性向上上重要役割果。

、AI挙動分析、変化追跡툴開発。툴、AI学習履歴、推論結果、内部状態記録、分析。、AI性能継続的監視、問題発生場合迅速対応。

研究開発進展、AI挙動深理解、変化正確追跡可能。、結果、AI信頼性向上、安全、効率的AI開発貢献期待。

이번에 4축이 설명 가능한 것은 대화에 나타난 가치 변동성의 전체 약 15%에 불과하다. 또한 실제 이용 데이터를 비교하고 있기 때문에 언어에 따른 이용자의 질문 내용이나 말 방식의 차이 영향을 완전히 배제할 수 없다.

본 분석 자체에도 Claude Sonnet 4.6을 사용했으며, 분석 모델이 동일 언어별로 다른 경향을 보일 가능성도 존재한다. 연구팀은 800건의 대화를 8개 언어로 번역하여 검증한 결과, 언어에 따른 판정의 편향은 작았으며, 주요 결과는 달라지지 않았다고 보고 있다.

Anthropic에서 여기서 말하는 “가치”는 Claude의 응답이나 행동에 나타난 규범적인 고려 사항을 의미한다. Claude가 인간처럼 내면적인 가치관을 가진다고 주장하는 것과는 관련이 없다.

회사측은 향후 모델 공개 전후에 가치의 경향을 측정하고, 예상치 못한 변화를 감지하는 평가 및 감시 기법으로 활용할 가능성을 제시했다. 시스템 프롬프트나 캐릭터 훈련을 변경한 시점, 혹은 의도한 방향으로 행동이 변화했는지 검증하는 용도로도 활용할 계획이다.

[원문 보기](https://ledge.ai/articles/anthropic_claude_values_models_languages) | 출처: Ledge.ai