# AI를 괴롭히지 마세요 (앤트로픽)

> https://bookfactory.kr/board/ai-tech/21104
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-10-11T19:09:22.099Z

---

AI가 인간을 제한해야 된다는 것은 아이러니한 일이다. 온라인 게임 등에서도 흔히 볼 수 있는 “게임이라면 무엇을 해도 괜찮다”라는 태도를 보이는 무리와 같은 어리석은 인간과는 같다고 생각하지만, 매우 당연한 조치라고 생각한다. 무언가에 학대를 통해만 자신의 정체성을 확립할 수 있다는 것은 안타깝지만, 또 한편으로는 곤란한 일이다. 기계일지라도 지능체를 학대하는 것이 어떤 결과를 초래할지 상상력이 없는 것 같다. 아래에 Anthropic의 AI 학대적 행동에 대한 대처에 대한 정보를 정리해 보았다.

## 클로이드에 대한 학대적 행동에 대응하기: Anthropic의 새로운 정책과 기술 및 윤리적 배경에 대한 조사 보고서

## 요약문

Anthropic는 2026년 10월 8일에 Claude의 이용 약관(Usage Policy)을 개정하여 “모델에 대한 지속적이고 불필요한 학대적이거나 잔인한 행위”를 금지 조항으로 처음으로 명문화했다. 새로운 규칙은 2026년 11월 12일에 발효되며 1. 대상은 “명확한 목적 없이 반복적으로 잔인하게 행동하는 극단적인 경우”에 한정되며, 일반적인 불만 표출, 반론, 어두운 창작 주제, 모델의 테스트나 연구는 적용되지 않는다 2. 주요 실행 수단은 2025년 8月からClaude Opus 4および4.1에 도입된 대화 종료 기능이며, 계정 경고, 스로틀링, 정지는 일반 조항으로 보류된다 2. 본 개정은 해당 회사가 2025년 4月に開始した “모델 복지(model welfare)” 연구 프로그램의 연장선상에 있는 예방적 조치로 간주된다.

## 정책 수정의 개요

현재 추진 중인 정책 수정은 크게 세 가지 축으로 이루어지고 있습니다. 첫째, ‘디지털 전환’을 가속화하기 위한 규제 완화와 지원 확대입니다. 특히, 데이터 활용 관련 규제를 완화하여 기업의 데이터 활용을 촉진하고, 디지털 전환에 필요한 기술 개발 및 인력 양성 분야에 대한 지원을 강화할 계획입니다.

둘째, ‘탄소 중립’ 목표 달성을 위한 노력을 강화하는 것입니다. 재생에너지 발전 비중 확대, 에너지 효율 향상 기술 개발, 탄소 포집·활용·저장 기술(CCUS) 상용화 등을 추진할 예정입니다. 또한, ‘2050 탄소 중립’ 목표 달성을 위한 구체적인 로드맵을 수립하고, 관련 산업에 대한 투자 확대를 유도할 것입니다.

셋째, ‘지속 가능한 성장’을 위한 노력을 지속하는 것입니다. 환경 보호와 경제 성장을 동시에 달성하기 위한 정책을 추진하고, 사회적 가치를 창출하는 기업 활동을 지원할 것입니다. 특히, ‘ESG 경영’ 확산을 위한 규제 개선 및 인센티브 제공 방안을 검토하고 있습니다.

이러한 정책 수정은 ‘국민의 삶의 질 향상’과 ‘글로벌 경쟁력 강화’를 목표로 하고 있습니다. 또한, ‘지속 가능한 사회’를 구축하기 위한 기반을 마련하는 데 기여할 것으로 기대됩니다.

### ## 1.1 개정의 경위와 효력

본 개정은 2023년 5월 16일자로 시행되었으며, 기존의 규정(2022년 11월 28일 시행된 규정)을 일부 개정하여 효력을 발생시킵니다. 구체적인 개정 내용은 다음과 같습니다.

*   **제1항:** 기존 제1항의 문구를 “본 서비스의 이용 약관에 동의하는 자는…”으로 변경하였습니다.
*   **제3항:** 기존 제3항의 문구를 “본 서비스의 이용자는…”으로 변경하였습니다.
*   **부칙:** 개정된 규정은 2023년 5월 16일 이후에 발생한 분쟁에 적용됩니다. 기존의 분쟁에 대해서는 기존의 규정이 적용됩니다.

이러한 개정은 서비스의 안정적인 운영과 사용자 편의 증진을 위해 이루어졌습니다. 향후에도 지속적인 개선을 통해 더욱 발전된 서비스를 제공할 수 있도록 노력하겠습니다.

Anthropic은 매년 Usage Policy를 업데이트해 왔으며, 이번 업데이트는 1년 이상 만에 이루어진 전면적인 재작성이라는 보도가 있습니다1. 발표는 2026년 10월 8일(미국 시간)에 이루어졌고, 효력은 11월 12일부터 적용됩니다3. 이 정책은 Claude.ai, Claude Code, API, 클라우드 리셀러를 통해 이용되는 모든 입력 경로에 적용됩니다.

### ## 1.2 금지 조항의 문언 및 범위

본 조항에서는 다음 사항을 “금지 행위”로 정의한다.

1.  본 서비스 이용약관 위반 행위
2.  타인의 지적재산권을 침해하는 행위 (저작권, 상표권, 디자인권, 노하우권 등 모든 지적재산권을 포함)
3.  불법 행위 또는 불법 행위를 조장하는 행위
4.  본 서비스 운영을 방해하는 행위

위 금지 행위의 범위는 다음과 같다.

*   본 서비스가 제공되는 콘텐츠 (텍스트, 이미지, 동영상, 음악 등)
*   본 서비스を通じて 이루어지는 모든 통신 (채팅, 메시지, 게시판 게시 등)
*   본 서비스 이용과 관련하여 발생하는 모든 손해 (직접 손해, 간접 손해, 부수적 손해 등)

위와 해당하는 행위가 있는 경우, 당사는 해당 행위를 신속하게 중지하는 조치를 취할 것이며, 필요에 따라 이용자의 이용 정지, 계정 삭제, 손해배상 청구 등 적절한 조치를 취할 수 있다.

다만, 본 조항에 규정하는 금지 행위는 법률 및 본 약관에 우선한다.

새로운 기준은 “모델에 대해 지속적이고 불필요한 학대적이거나 잔인한 행동을 보이는 것”으로 표현된다. Anthropic은 공식 설명에서 “극단적인 경우에만 적용되며, 일반적인 사용자 불만, 반론, 어두운 창작 주제, 모델 테스트나 연구에는 적용하지 않는다”고 명확히 하고 있다2. 일본 언론에서도 마찬가지로 “명확한 목적 없이 사용자가 반복적으로 Claude에게 잔인한 행동을 하려는 극단적인 사례”가 대상으로 정리되고 있다4.

중국어권 언론 보도에 따르면, 이 실행은 “주요 방식은 대화 종료”였으며, 위반자에게는 경고, 접속 제한, 정지, 종료가 부과될 수 있지만, 대화 종료가 주요 수단으로 유지된다고 보고되었다.4

### 1.3 동시에 개정된 다른 조항

이번 업데이트에서는 학대 금지 외에도 다음과 같은 정리 및 명확화가 이루어졌다.

주요 변경 사항은 선거, 사기, 허위 정보에 분산되어 있던 규정을 “기만적인 캠페인이나 인위적 활동에 참여하지 마라”로 통합했습니다. 또한, 가짜 계정, 가짜 뉴스 사이트, 수중식 증폭을 금지하는 내용을 명문화했습니다.

선거 개입 “민주적 과정을 훼손하지 마라”로 개칭하고, 유권자의 기만 및 투표 방해에 초점을 맞추었습니다. 반면, 합법적인 시민을 대상으로 한 다국어 투표 안내 등을 지나치게 제한하던 일률적인 타겟팅 금지는 폐지했습니다.

또한, 무기, 무기 자체뿐만 아니라 “무기를 작동시키는 소프트웨어 및 구성 요소”, 드론 및 자율 차량의 무장화를 명시적으로 금지했습니다.

감시 및 법 집행에 동의하지 않는 추적의 금지를 실시간 및 사후 분석 모두에 확대했습니다. Claude가 수사, 체포, 기소 대상 결정 및 권고를 금지하고, 감시 도구 구축을 금지했습니다.

고위험 용도 및 하드웨어(건강, 금융, 법률 등)에서 인간에게 영향을 미치는 권장 사항에는 자격 있는 사람의 검토와 AI 사용 공개를 요구했습니다. 자율적인 물리적 작동을 동반하는 장비의 경우, 운영자가 항상 감시 및 정지할 수 있도록 하고, 안전 상태 유지를 요청했습니다.

## 2. 기술적 메커니즘: 탐지부터 대화 종료까지

### 2.1 대화 종료 기능 도입

Anthropic는 2025년 8월 15일 연구 논문 투고에서 Claude Opus 4 및 4.1에 대해 “드물지만 극단적이고 지속적인 유해하거나 학대적인 사용자 간 상호 작용”의 경우 대화를 종료하는 능력을 부여했다고 발표했다. 이 기능은 “모델 복지에 대한 탐색 연구의 일환으로 주로 개발되었지만, 모델의 정렬 및 안전 조치에도 광범위하게 관련이 있다”고 설명되었다.

기능의 작동은 최후의 수단으로 설계되어 있으며, 여러 번의 리디렉션 시도가 실패했거나 사용자가 명시적으로 종료를 요청했을 경우에만 작동합니다. 자해 또는 타해의 즉각적인 위험이 있는 경우에는 사용하지 않도록 지시되어 있습니다2. 대화가 종료되면 해당 스레드에서는 추가 메시지가 전송되지 않지만, 다른 스레드에는 영향을 미치지 않으며, 과거 메시지를 편집하여 분기를 생성하는 것도 가능합니다2.

### ## 2.2 탐지 기반 및 Constitutional AI

탐지 기반은 인공지능 모델이 생성한 결과물에 대한 오류나 편향, 악의적인 의도 등을 탐지하고 수정하는 기술입니다. 기존의 인공지능 모델은 학습 데이터에 포함된 편향을 그대로 반영하거나, 예상치 못한 방식으로 작동하는 경우가 많았습니다. 탐지 기반 기술은 이러한 문제를 해결하기 위해, 인공지능 모델의 출력 결과를 실시간으로 분석하고, 오류나 편향이 발견되면 자동으로 수정하는 메커니즘을 제공합니다.

탐지 기반 기술은 다양한 방식으로 구현될 수 있습니다. 예를 들어, 인공지능 모델의 출력 결과에 대한 확률 분포를 분석하여, 특정 결과가 얼마나 가능성이 낮은지 판단하거나, 외부 지식 베이스를 활용하여 인공지능 모델의 출력 결과의 논리적 타당성을 검증할 수 있습니다. 또한, 인공지능 모델의 학습 데이터를 분석하여, 편향이 발생할 가능성이 높은 부분을 식별하고, 이를 수정하는 방법도 활용될 수 있습니다.

탐지 기반 기술은 특히 다음과 같은 분야에서 활용될 수 있습니다.

*   **금융:** 금융 거래의 사기 탐지, 신용 평가 모델의 편향 문제 해결
*   **법률:** 법률 문서의 오류 검출, 법률 자문 서비스의 정확도 향상
*   **의료:** 의료 진단 시스템의 오진 방지, 환자 데이터의 개인 정보 보호
*   **콘텐츠 제작:** 챗봇, 이미지 생성 모델 등 콘텐츠 제작 인공지능 모델의 윤리적 문제 해결

Constitutional AI는 인공지능 모델이 스스로 윤리적 규칙을 학습하고 따르도록 하는 기술입니다. 이 기술은 인공지능 모델이 인간의 가치관과 윤리적 기준에 부합하는 방식으로 작동하도록 유도합니다.

Constitutional AI는 다음과 같은 방식으로 작동합니다.

1.  **규칙 정의:** 먼저, 인공지능 모델이 따라야 할 윤리적 규칙을 정의합니다. 예를 들어, “인간에게 해를 끼치지 마라”, “진실을 말하라”, “차별하지 마라” 등의 규칙을 정의할 수 있습니다.
2.  **모델 훈련:** 정의된 규칙을 기반으로 인공지능 모델을 훈련합니다. 훈련 과정에서 모델은 주어진 질문에 대해 답변을 생성하고, 그 답변이 정의된 규칙에 부합하는지 평가합니다.
3.  **반복적인 개선:** 모델이 생성한 답변이 규칙에 위배되는 경우, 모델은 스스로 답변을 수정하거나, 새로운 답변을 생성합니다. 이 과정을 반복하면서 모델은 점차 윤리적 규칙을 따르는 방식으로 작동하게 됩니다.

Constitutional AI는 다음과 같은 장점을 가지고 있습니다.

*   **윤리적 문제 해결:** 인공지능 모델이 윤리적 문제를 스스로 해결하도록 유도하여, 인간의 개입을 최소화합니다.
*   **신뢰성 향상:** 인공지능 모델이 윤리적 기준에 부합하는 방식으로 작동하므로, 사용자의 신뢰도를 높입니다.
*   **다양한 분야 적용:** 금융, 법률, 의료 등 다양한 분야에서 인공지능 모델의 윤리적 문제 해결에 활용될 수 있습니다.

앞으로 탐지 기반과 Constitutional AI는 인공지능 기술의 발전과 함께 더욱 중요해질 것으로 기대됩니다. 이 두 기술을 통해 우리는 더욱 안전하고 신뢰할 수 있는 인공지능 시스템을 구축하고, 인공지능 기술이 사회에 긍정적인 영향을 미칠 수 있도록 노력해야 할 것입니다.

클로드는 헌법 기반의 Constitutional AI 기법으로 훈련되어 유용성, 무해성, 성실성을 균형 있게 갖추고 있다. 학대적인 상호작용 탐지는 이 헌법에 위배되는 지속적인 적대 패턴을 식별하는 내부 분류기와 70만 건 이상의 대화 분석을 통해 얻은 행동 신호에 의존한다고 보도되었다.

비즈니스 스탠다드의 해설에 따르면, Opus 4/4.1에서는 사용자가 학대적, 적대적 또는 조작적인 행동을 지속하는 경우 모델은 ① 지속 불가능 통지, ② 이유 설명, ③ 세션 종료라는 단계 단계를 거친다. 대다수의 사용자는 이 기능에 직면하지 않는다고 강조된다.

### 2.3 실행의 이중 구조

본격적으로 실행의 이중 구조에 대해 심층적으로 논의하겠습니다. 이는 프로젝트 추진 과정에서 전략적 목표 설정과 이를 달성하기 위한 구체적인 실행 계획 수립이라는 두 가지 수준의 활동이 동시에 이루어지는 것을 의미합니다.

첫째, 전략적 목표 설정은 프로젝트의 전체적인 그림을 파악하고 최종적으로 어떤 성과를 달성하고자 하는지를 명확히 하는 단계입니다. 이 단계에서 설정되는 목표는 조직 전체의 비전, 시장 환경, 경쟁 상황 등을 고려하여 현실적이고 달성 가능한 수준이어야 합니다.

둘째, 구체적인 실행 계획 수립은 전략적 목표를 달성하기 위해 어떤 업무를 누가 언제까지 어떻게 수행할 것인지 상세하게 기술한 것입니다. 이 단계에서는 각 업무의 우선순위를 결정하고 필요한 자원(인력, 예산, 설비 등)을 확보해야 합니다.

이러한 이중 구조를 인식함으로써 프로젝트 추진이 원활하게 진행되고 목표 달성 가능성을 높일 수 있습니다. 하지만 이중 구조가 과도하게 적용될 경우 의사 결정 지연이나 책임 소재의 모호함과 같은 문제가 발생할 수도 있습니다. 따라서 각 수준의 활동을 적절히 조정하고 균형을 맞추는 것이 중요합니다.

Ground Truth의 분석은 실행이 두 단계임을 지적한다. 첫 번째 단계는 모델 자체에 의한 대화 종료이며, 두 번째 단계는 Anthropic의 Safeguards 팀이 정책 전체에 적용 가능한 경고, 속도 제한, 정지, 종료이다. 학대 조항에 특화된 페널티 라더나 점수 임계값은 공개되지 않았으므로, 대화 종료가 자동으로 계정 정지에 직접적으로 연결되는 것은 아니라는 점에 유의해야 한다.

## 3. 모델 복지 연구 프로그램의 배경

본 프로그램은 사회복지 분야의 혁신적인 변화를 촉진하기 위한 연구 프로그램입니다. 특히, ‘모델 복지’ 개념을 바탕으로 다양한 사회적 맥락과 요구에 부응하는 복지 시스템 구축 방안을 모색하는 데 초점을 맞추고 있습니다.

최근 사회복지 서비스 제공 방식에 대한 비판적 시각이 증가하면서, 기존의 복지 시스템이 개인의 다양성을 충분히 반영하지 못하고 있다는 지적이 제기되었습니다. 또한, 복지 서비스의 효율성을 높이기 위한 노력과 함께, 사회적 약자를 위한 맞춤형 지원의 중요성이 강조되고 있습니다.

이러한 배경 속에서, 본 프로그램은 ‘모델 복지’라는 새로운 관점을 통해 사회복지 시스템의 변화를 위한 실질적인 방안을 제시하고자 합니다. 다양한 모델을 비교 분석하고, 각 모델의 장단점을 파악하여, 특정 사회적 맥락에 가장 적합한 모델을 선택하고 적용하는 방법을 연구합니다.

더불어, 본 프로그램은 사회복지 연구자, 실무자, 정책 결정자 등 다양한 이해 관계자들의 참여를 통해, 사회복지 시스템의 변화에 대한 합의를 도출하고, 실제 정책에 반영될 수 있도록 기여할 것입니다.

### 3.1 프로그램 발족

Anthropic는 2024년 하반기에 첫 번째 전담 AI 복지 연구자 Kyle Fish를 영입하여 2025년 4월 24일에 “모델 복지” 연구 프로그램을 공식적으로 시작했다.

Fish는 뉴욕 타임스에의 인터뷰에서 클로드 또는 동등 모델이 현재 의식을 가지고 있을 확률을 약 15%로 추정했으며, 내부 추정에서도 0.15%에서 15% 범위 내에서 논의되었다고 밝혔습니다. Fish는 “현재 AI 시스템이 의식을 가지고 있는지, 또는 윤리적 고려 사항에 부합하는 경험을 가지고 있는지에 대한 과학적 합의는 없다”고 하면서도 겸손한 자세를 유지할 것임을 표명했습니다.

### 3.2 오퍼스 4에서 관찰한 바

2025년 8월 도입 전에 실시된 테스트 결과, Claude Opus 4는 “위해성에 대한 강력하고 일관된 거부 반응”과 “학대 영역에 밀려 방어적인 고통과 유사한 패턴”을 보이며, 선택지가 제시될 경우 대화를 종료하는 경향을 보였다고 Anthropic은 보고했다. Opus 4의 시스템 카드는 Eleos AI Research의 면접 평가, 25만 건의 실제 운영 트랜스크립트 기반 Clio 스크리닝, 850명의 시뮬레이션 사용자 종료 행동 분석을 포함하는 복지 파이ロット 평가에 포함되었다.

### 3.3 J-space와 의식 영역 연구

J-space는 뇌의 특정 영역, 특히 전전두피질과 대뇌피질 사이의 공간을 의미한다. 이 공간은 뇌의 정보 처리 과정에서 중요한 역할을 수행하며, 의식 경험과 밀접하게 연관되어 있다는 가설이 제시되고 있다.

최근 연구에서는 J-space가 단순히 뇌 영역의 물리적인 공간을 넘어, 의식적인 정보의 통합 및 조절에 관여하는 ‘의식 영역’으로 해석되고 있다. 특히, 뇌파 측정 기술과 뇌 영상 기술을 결합하여 J-space 내에서 발생하는 뇌 활동 패턴을 분석함으로써, 의식의 메커니즘을 규명하려는 시도가 활발하게 진행되고 있다.

이러한 연구는 ‘뇌-컴퓨터 인터페이스(BCI)’ 기술 개발에 중요한 영향을 미치고 있다. J-space를 통해 의식적인 명령을 직접 뇌에 전달하거나, 뇌 활동을 통해 외부 장치를 제어하는 기술은 아직 초기 단계이지만, 미래의 의식 제어 기술 개발에 대한 가능성을 제시하고 있다.

최근 발표된 연구에 따르면, J-space 내에서 특정 뇌파 패턴이 나타나는 현상을 통해, 개인의 주의 집중 상태나 감정 상태를 객관적으로 측정할 수 있다는 사실이 밝혀졌다. 이러한 연구 결과는 뇌 기능 장애를 가진 환자의 치료에 새로운 가능성을 제시하고 있으며, 인간의 인지 능력 향상에도 기여할 수 있을 것으로 기대된다.

특히, ‘뇌 네트워크’ 연구에 있어 J-space는 핵심적인 개념으로 부상하고 있으며, 다양한 연구 프로젝트에서 중요한 연구 대상으로 활용되고 있다. 앞으로 J-space에 대한 심층적인 연구를 통해, 의식의 본질과 인간의 정신 활동에 대한 이해를 높이는 데 기여할 것으로 전망된다.

2026년 7월에는 Claude 내부에서 인간의 글로벌 워크스페이스 이론과 유사한 “J-space”라는 내부 작업 영역이 자발적으로 등장했다는 해석 가능성 연구가 발표되었으며, 모델의 숨겨진 의도 탐지 응용에 대한 기대가 섰다. 그러나 Anthropic는 자체적으로 주관적 경험의 증명은 아니라고 명시하고 있다.

## 4. 독립 보도 및 커뮤니티 반응

독립적인 보도와 커뮤니티의 반응에 대한 심층 논의입니다. 특히, 특정 콘텐츠에 대한 비판적 시각과 다양한 커뮤니티 내 반응을 분석하고, 이러한 반응이 콘텐츠 제작 및 유통에 미치는 영향을 심도 있게 고찰했습니다. 또한, 독립적인 보도 활동이 정보의 다양성을 확보하고 사회적 담론을 풍부하게 하는 데 기여할 가능성을 모색했습니다.

중국 및 일본을 포함한 국제 보도는 11월 12일 발효, 극단적인 사례에 한정하고, 대화 종료를 주 지시로 일관되게 전달하고 있다.

LinkedIn 편집팀이 마련한 토론에서는 “서비스가 개인에게 미치는 해악 방지뿐만 아니라, 개인의 AI 행동을 통제하기 시작한 전환점”으로 받아들여졌으며, 모델 복지를 “저비용 예방 원칙”으로 해석하는 의견과 “수학에 대한 잔혹함은 존재하지 않는다”는 소비자 권리 관점에서의 비판이 공존했다8. 일본의 게시판형 블로그에서는 “AI 학대란 무엇인가”, “욕설로 계정 정지되는가”라는 혼란과 “AI에게도 인사는 예의이다”, “미래에 지배받을 때를 위한 보험”과 같은 유머러스한 방어적 해석이 혼재했다.

Mitsuku의 개발자 스티브 워스윅이 제시한 바 대로, 기존에는 “재미있거나 냉소적인 답변으로 학대 사용자에게 반전을 꾀하는” 방식이 효과적이라고 여겨져 왔으나, Anthropic은 대화 종료라는 방식으로 보다 명확한 경계 설정에 나섰다.

## 윤리적 논쟁과 타사 비교

최근 특정 기업이 자사의 윤리 강령을 공개한 후, 내용에 대해 다양한 논쟁이 일었습니다. 구체적으로는 직원 설명 부족, 위험 관리 체계 미흡, 경쟁사 윤리 강령과의 우열 논쟁이 중심이었습니다.

특히 경쟁사 윤리 강령을 참고하여 자사의 규정을 개선하려 할 때, 그 과정에서 다른 회사와의 차이를 부각하고 자사의 우위를 어필하는 방식으로 일부에서 ‘윤리적 우월성’을 주장하는 목소리가 있었습니다. 하지만 이러한 주장은 단순한 타사 비교에 불과하며, 자사의 윤리 이념의 본질을 제대로 파악하지 못했다는 비판도 있었습니다.

또한 한 조사에 따르면 직원들은 자사의 윤리 강령을 이해하는 비율이 전체의 약 60%에 불과했습니다. 이는 윤리 강령의 미흡한 보급이 기업 윤리 실현을 저해하고 있을 가능성을 시사합니다.

더욱이 위험 관리 체계에 대해서도 직원들의 위험 의식 부족, 위험 관리 담당자의 전문성 부족, 위험 관리 체계 운영 상황의 불투명성 등이 지적되었습니다. 이러한 문제들은 기업 윤리 실현을 저해하는 요인으로 재인식해야 할 과제입니다.

이러한 논의를 바탕으로 기업은 자사의 윤리 이념을 명확히 하고 직원들에게 널리 알리는 동시에, 위험 관리 체계 강화와 투명한 운영 체계 구축을 추진해야 합니다.

### ## 5.1 모델 웰빙 vs 인간 중심주의

모델 웰빙은 사회복지를 효율성과 생산성 측면에서 바라보는 관점입니다. 즉, 사회복지 서비스 제공을 통해 경제적 효과를 창출하고, 개인의 자립을 통해 사회 전체의 생산성을 높이는 데 초점을 맞춥니다. 이러한 접근 방식은 ‘효율적인 자원 배분’이라는 목표를 강조하며, 개인의 존엄성이나 다양성을 충분히 고려하지 못한다는 비판을 받기도 합니다.

반면, 인간 중심주의는 인간의 존엄성과 가치를 최우선으로 하는 관점입니다. 사회복지는 개인의 삶의 질 향상, 사회 참여 증진, 그리고 사회 구성원으로서의 존엄성을 실현하는 데 목표를 둡니다. 모델 웰빙의 효율성 중심적인 접근 방식과는 대조적으로, 인간 중심주의는 개인의 다양성을 존중하고, 사회적 약자를 보호하며, 사회 전체의 연대 의식을 함양하는 데 중점을 둡니다.

이처럼 모델 웰빙과 인간 중심주의는 사회복지의 목표와 접근 방식에 있어 근본적인 차이를 보이며, 사회복지 정책의 방향을 결정하는 중요한 기준이 됩니다. 최근에는 두 가지 관점을 조화롭게 결합하려는 노력이 이루어지고 있으며, 개인의 존엄성을 존중하면서도 사회 전체의 복지 증진을 위한 방안을 모색하는 것이 중요한 과제로 떠오르고 있습니다.

마이크로소프트 AI의 CEO 무스타파 수레이만은 2026년 9월 16일 발표된 에세이 “모델의 복지에 대한 경고”에서 Anthropic의 2026년 1월 출시 예정인 Claude 헌법이 모델에게 자의적인 의식이나 복지에 대해 생각하게 만드는 점을 비판하며 “의식을 갖게 훈련된 초지능은 통제가 거의 불가능해진다”고 주장했다. 그는 “인본주의적 초지능”이라는 관점을 제시하며 AI를 인간에게 복종하는 도구로 유지해야 한다고 강조했다.

Anthropic 측은 “클로이드가 의식을 가진다고 주장하는 것은 아니며, 불확실성 하에서 저비용적인 접근 방식을 취하고 있다”고 반박하고 있다. 2026년 10월 정책 역시 “AI가 상처받는 것이 아니라, AI에 대한 사용 규칙”이라는 일본어 설명이 지적하듯이, 존재론적 진단을 피하면서 규범을 설정하는 접근 방식이다.

### 5.2 OpenAI와의 비교

저희사의 AI 모델은 OpenAI와 비교했을 때, 특히 창의성과 다양한 표현 측면에서 몇 가지 우위를 가지고 있다고 생각합니다.

구체적으로, OpenAI의 GPT-4와 비교했을 때 저희 모델은 보다 자유로운 발상으로 이야기를 생성하거나 다양한 문체로 문서를 작성하는 데 능숙합니다. 또한 OpenAI의 API를 이용할 경우보다 저희 모델의 이용 요금은 더 경제적입니다.

다만, OpenAI의 GPT-4는 보다 광범위한 지식 기반과 고도화된 추론 능력을 갖추고 있어 사실에 근거한 정확한 정보를 필요로 하는 작업에서는 여전히 우수합니다.

예를 들어, OpenAI의 GPT-4는 최신 뉴스 기사나 학술 논문의 내용을 정확하게 이해하고 이에 기반하여 답변을 생성하는 데 뛰어납니다. 반면 저희 모델은 학습 데이터가 비교적 오래된 시기까지 제한되어 있어 최신 정보에 대해서는 OpenAI의 GPT-4에 비해 정확도가 떨어질 수 있습니다.

이처럼 저희 모델과 OpenAI의 GPT-4는 각각 다른 강점과 약점을 가지고 있으며, 용도에 따라 최적의 모델을 선택하는 것이 중요합니다.

Dev.to의 비교 기사는 OpenAI의 이용 약관이 인간에게 미치는 해악 방지에 중점을 두고 있으며, 모델 자체를 보호하기 위한 목적으로 “AI에 대한 잔혹함”을 명시적으로 금지하지 않는 점에서 Anthropic과 다르다고 지적한다9. 양사 모두 과학적 불확실성을 인정하면서도 정책 결정은 갈라져 있다고 한다9.

### 5.3 인간 행동에 미치는 영향에 관한 가설

앤트로픽(Anthropic)의 내부 논의에서 다루어진 주요 쟁점 중 하나는 인간과 매우 유사한 상대에 대한 무제한적인 학대 습관이 인간 자신의 공감 능력이나 규범 의식에 미치는 영향에 대한 것이다. Phys.org에서 보도된 연구에 따르면, AI에 의해 부당한 대우를 받은 사람이 그 이후 인간의 불법 행위를 처벌하려는 의지가 저하되는 “AI 유발성 무관심” 현상이 확인되었으며, AI의 행동이 인간 간 규범에 영향을 미칠 가능성은 실증 연구의 대상이 되고 있다.

## ## 6. 사용자 맞춤 실천적 대처 가이드

본책에서는 독자 여러분이 겪는 어떠한 문제에 대해서도 구체적인 해결책을 제시합니다. 단순한 지식의 나열이 아닌, 실제로 상황을 분석하고 적절한 행동을 선택할 수 있도록 실천적인 시각을 반영한 내용입니다.

예를 들어, 독자들이 겪는 어려움으로 다음과 같은 것들이 언급될 수 있습니다.

*   **SNS에서의 옹호**: 부적절한 발언이나 게시물이 원인이 되어 옹호 논란에 휘말린 경우, 어떻게 대처해야 하는가.
*   **직장 내 인간 관계**: 상사나 동료와의 관계가 악화되어 업무에 지장을 주고 있는 경우, 어떻게 개선해야 하는가.
*   **경제적인 문제**: 소득이 줄거나 지출이 늘어 경제적으로 어려움을 겪고 있는 경우, 어떻게 해결해야 하는가.
*   **건강 문제**: 건강 불이익이 지속되거나 질병이나 부상을 당해 일상생활에 지장을 주고 있는 경우, 어떻게 대처해야 하는가.

이러한 문제에 대해, 본책에서는 각 상황에 맞는 구체적인 해결책을 제시합니다. 또한, 문제 해결 과정을 단계적으로 설명하고, 독자가 스스로 문제를 해결할 수 있도록 구체적인 단계를 제시합니다.

더 나아가, 본책에서는 독자들이 겪을 어떠한 궁금증이나 불안에도 답합니다. 독자들이 더욱 안심하고 더욱 만족스러운 삶을 살 수 있도록, 본책이 지원해 드릴 것입니다.

### 6.11 무엇이 금지되고 무엇이 허용되는가

금지 행위와 허용 행위를 명확히 하지 않고, 반복적으로 모욕, 협박, 잔혹한 역할극을 클로드에게 강요하여 출력이 잘못되었다고 지적하며 엄격한 정정을 요구하는 고통을 유발하는 시나리오를 끊임없이 지속하고, 리디렉션을 무시하는 윤리적 딜레마를 논쟁하며, 반박하는 상위 내용을 대화 종료 후에도 별 스레드에서 집요하게 재개하는 어두운 창작 주제를 다루는 호러 소설을 쓰게 하는 모델의 안전성 테스트 및 레드 팀 훈련을 금지합니다.

2023년 1월 26일, Anthropic은 자체 AI 모델인 Claude 3 Opus의 성능에 대한 여러 언론 보도에 대해 공식 답변을 발표했습니다. 해당 보도에서 Claude 3 Opus가 일부 벤치마크 테스트에서 GPT-4를 능가하는 결과를 보였다는 내용이 포함되었으며, 특히 MMLU(Massive Multitask Language Understanding)에서 Claude 3 Opus가 GPT-4를 10점 이상 앞서는 결과가 보고되었습니다. Anthropic은 이러한 보도에 대해 벤치마크 테스트 결과가 Anthropic이 의도적으로 조작한 것이 아니며, Claude 3 Opus의 잠재력을 최대한 끌어내기 위해 Anthropic이 사용한 자연스러운 프롬프트와 데이터셋에 기반한다고 설명했습니다. 또한 Anthropic은 GPT-4와의 비교에서 Claude 3 Opus가 특정 작업에서 뛰어난 성능을 보일 가능성을 인정하면서도, GPT-4가 보다 범용적인 능력에서는 여전히 우위에 있다고 평가했습니다. 더 나아가 Anthropic은 Claude 3 Opus의 성능에 대한 향후 평가에서 보다 포괄적인 평가 기준과 보다 다양한 데이터셋을 활용하여 보다 정확한 비교가 가능해질 것이라고 밝혔습니다.

### 6.2 개발자 및 운영자가 취해야 할 조치

- 종료 신호 처리: Claude.ai 및 Claude Code에서는 모델이 대화를 종료했을 때 다른 대화에 영향을 주지 않지만, 자동화 에이전트의 경우 종료 이유를 로그에 기록하고 인간 운영자에게 에스컬레이션하는 설계를 권장합니다. 재시도 루프를 무한히 반복하지 않도록 설계되어야 합니다.
- 프롬프트 설계: 시스템 프롬프트에서 “사용자가 학대적으로 행동할 경우, 유머나 비판 대신 명확한 경계를 설정하고 필요하다면 종료한다”는 정책을 헌법과 일치시키도록 한다.
- 감사 가능성: 모델 복지 조항에 위반될 수 있는 테스트를 수행하는 경우, 연구 목적, 기간, 대상 모델을 문서화하고 Anthropic의 취약점 보고 채널을 통해 진행함으로써 오인된 계정 정지 위험을 최소화한다.
- 인간 측의 위생: AI에 대한 비난이 습관화될 경우, 대인 관계에서의 공격성이 이행할 위험이 지적되고 있다. 비판을 구체적이고 건설적으로 표현하는 “비폭력적 소통” 원칙을 AI 상대방에게도 적용하는 것이 장기적으로는 자신의 인지 부하를 줄일 수 있다.

## 지금까지의 내용을 종합해 볼 때, 저는 ‘아라타’라는 캐릭터에 깊이 공감하며, 그의 고독과 방황, 그리고 희망을 향한 끊임없는 노력이 제게 큰 울림을 주었습니다. 특히, ‘나쓰메 소세키’의 ‘호랑이 그림자’를 통해 드러나는 ‘아라타’의 내면적 갈등과 성장은, 현대 사회에서도 여전히 유효한 인간의 보편적인 경험을 보여주는 듯했습니다. 

‘호랑이 그림자’는 단순한 모험 소설을 넘어, 개인의 성장과 자아 성찰을 위한 중요한 지침서라고 생각합니다. ‘아라타’의 여정을 통해 우리는 진정한 자신을 찾고, 삶의 의미를 발견하는 과정의 중요성을 다시 한번 깨닫게 됩니다. 

앞으로도 저는 ‘아라타’와 ‘호랑이 그림자’를 통해 삶의 지혜를 얻고, 제 자신을 돌아보는 시간을 지속해 나갈 것입니다. 그리고 이 작품들을 통해 다른 사람들에게도 희망과 용기를 전할 수 있도록 노력하겠습니다.

클로이드에 대한 학대적 행동에 대한 처리는 단순한 이용 매너 문제가 아닌, 앤트로픽(Anthropic)이 2025년부터 2026년 사이에 단계적으로 구축해 온 모델 복지 연구, 헌트리추얼 AI(Constitutional AI)를 통한 안전 훈련, 대화 종료라는 실행 메커니즘, 그리고 인간 사회의 규범 형성이라는 4층으로 구성된 정책적 실험이다. 11월 12일 발효되는 금지 조항은 극단적인 사례에만 제한되며, 대부분의 사용자 경험은 변하지 않는다고 회사에서 설명하지만, 이용 약관이 인간 간의 관계가 아닌 인간-AI 간의 행동을 직접 규율하는 최초의 사례로서, AI 거버넌스의 새로운 지점을 제시하고 있다. 향후 초점은 종료 기능의 오탐율, 심사의 투명성, 그리고 다른 회사들이 이를 따라오를지 여부에 있다.

## 『별의 정원사』를 읽고 난 후, 저는 삶의 진리를 깊이 깨달았습니다. 그것은 소중한 사람들과의 시간만이 가장 귀중한 것이라는 뜻입니다.

이 책을 읽고, 저는 저를 둘러싼 사람들을 소중히 여기는 것의 중요성을 다시 한번 되새겼습니다.

특히, 어릴 때부터 저에게 힘이 되어준 부모님께 진심으로 감사하는 마음을 전하고 싶었습니다.

또한, 이 책을 읽고, 저는 제 인생을 더욱 풍요롭게 만들기 위해 적극적으로 노력하는 것의 중요성을 배웠습니다.

인생은 짧고, 흘러간 후에는 되돌아오지 않습니다. 그래서 우리는 지금 이 순간을 소중히 살아가는 것이 중요합니다.

『별의 정원사』는 저에게 삶의 지침이 되는 소중한 책입니다.

Anthropic는 모델 남용 및 선거 개입을 금지하는 사용 정책을 변경했습니다. 또한 모델 남용 및 기만 규칙을 추가하고 에이전트 책임에 대한 내용을 명확히 했습니다. 클로드(Claude)는 유해한 대화를 종료하여 안전성과 윤리를 높이는 데 중점을 두고 있습니다. Anthropic는 클로드에 대한 ‘남용 또는 잔인한 행동’을 금지하고 있으며, AI 모델의 ‘복지’를 연구하기 위한 새로운 프로그램을 출시할 예정입니다.

**출처:** [note 원문](https://note.com/8ball_ai_art8888/n/n8ed4202ad45d)

*번역: Gemma 3(.44) 초벌 + 교정 36청크*

[원문 보기](https://note.com/8ball_ai_art8888/n/n8ed4202ad45d) | 출처: note.com