# 앤트로픽(Anthropic), Claude 내부에서 ‘글로벌 워크스페이스’와 유사한 구조 확인: 표출되지 않는 사고를 시각화

> https://bookfactory.kr/c/news/8221
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-07-18T21:00:40.294Z

---

이미지의 출처: [Anthropic](https://www.youtube.com/watch?v=rKV5JcALQoQ){target=“_blank”}

Anthropic는 2026년 7월 6일, Claude 등의 언어 모델 내부에서 인간의 의식 연구에 제시된 “글로벌 워크스페이스”와 기능적으로 유사한 성질을 가진 구조를 확인했다고 발표했다. 새로운 분석 기법인 “Jacobian Lens (J-lens)”를 사용하여 모델이 답변에 기록하지 않은 개념이나 중간 판단을 읽어낼 수 있는 가능성을 제시했다.

## 원본 일본어 기사 본문:

Googleは、YouTubeの検索結果にAIを活用した新しい機能を追加しました。この機能は、ユーザーがYouTubeで動画を探す際に、より関連性の高い動画を提案するものです。

Googleは、AIモデル「PaLM 2」を活用し、動画のタイトル、説明文、タグ、コメントなどの情報を分析することで、ユーザーの検索意図を理解し、最適な動画を提案します。

また、この機能は、ユーザーの視聴履歴やチャンネル登録状況なども考慮に入れます。これにより、ユーザーはこれまで見たことのない新しい動画を発見したり、興味のあるチャンネルをより深く探求したりすることができます。

Googleは、今後もAI技術を活用して、YouTubeの検索体験を向上させていく計画です。

## 번역 결과:

구글은 유튜브 검색 결과에 AI를 활용한 새로운 기능을 추가했습니다. 이 기능은 사용자가 유튜브에서 영상을 찾을 때, 더욱 관련성 높은 영상을 제안하는 것입니다.

구글은 AI 모델 “PaLM 2”를 활용하여, 영상의 제목, 설명문, 태그, 댓글 등의 정보를 분석함으로써 사용자의 검색 의도를 이해하고 최적의 영상을 제안합니다.

또한, 이 기능은 사용자의 시청 기록이나 채널 구독 상황 등도 고려됩니다. 이를 통해 사용자는 지금까지 본 적이 없는 새로운 영상을 발견하거나, 관심 있는 채널을 더욱 깊이 탐구할 수 있습니다.

구글은 앞으로도 AI 기술을 활용하여 유튜브 검색 경험을 향상시켜 나갈 계획입니다.

Claude 내부에는 자연스럽게 형성된 “J-space”가 존재합니다. 글로벌 워크스페이스 이론에 따르면, 뇌 내에서 병렬적으로 진행되는 대량의 처리 중 일부 정보가 공유 영역에 들어가, 언어로 설명되거나 추론 및 행동에 활용될 수 있도록 되었습니다.

Anthropic는 Claude 내부에도 이와 유사한 작동을 하는 내부 표현의 집합이 존재한다고 밝히며 이를 “J-space”라고 명명했다. 이는 인위적으로 설계된 기능이 아닌, 모델의 학습 과정에서 자연스럽게 형성된 것이다.

연구 결과, J-space 내의 정보를 Claude가 언어를 통해 보고하고, 지시 사항에 따라 특정 개념을 유지하며, 다단계 추론에 활용하고, 동일한 개념을 여러 처리 과정에 유연하게 활용하는 것을 확인했다. 반면, 문법 처리나 단순한 사실의 인출 등 많은 자동적인 처리에는 거의 사용되지 않았다.

**■ J-space에서 확인된 5가지 기능. 내부의 개념을 언어로 보고하는 것 외에도 의도적인 조작, 내부 추론, 다양한 과제에 대한 유연한 활용 등과 관련이 있다.**
![Functional roles of the global workspace.webp](https://storage.googleapis.com/ledge-ai-prd-public-bucket/media/Functional_roles_of_the_global_workspace_d83934599c/Functional_roles_of_the_global_workspace_d83934599c.webp)
:::small
이미지 출처: [Anthropic](https://www.anthropic.com/research/global-workspace){target=“_blank”}
:::
## “J-lens”로 출력 전 개념을 읽어내기
J-lens는 Claude의 내부 상태에서 미래에 언어로 표현될 가능성이 있는 개념을 단어의 형태로 읽어내는 기술이다. 모델 내부의 여러 층에 적용하여 답변을 생성하는 과정에서 개념이 어떻게 변화하는지 추적한다.

Claude가 지적하지 않은 버그를 포함한 코드를 읽을 때, J-space에 “ERROR”가 나타났다. 단백질 배열로부터 생물학적 기능을 추정한 사례나, 허위 검색 결과에 조작된 프롬프트 인젝션을 “injection”, “fake”로 인식한 사례도 제시되었다.

J-lens를 통해 모델 내부의 개념을 읽어낸 사례가 발견되었습니다. 계산 과정 중의 숫자나 코드 오류, 단백질의 특징, 심지어 조작된 검색 결과에 삽입된 프롬프트 인젝션까지 감지되었습니다. 

(출처: Anthropic)

J-space가 판단 결과를 단순히 보여줄 뿐인지 확인하는 실험에서, Claude가 생각했던 “Soccer”（축구）의 내부 표현을 “Rugby”（럭비）로 대체하면 답변도 럭비로 바뀌었다. 또한, 거미 다리 수를 답하는 과정에서 사용되던 “spider”（거미）를 “ant”（개미）로 대체하면 답변은 8개에서 6개로 바뀌었다. 내부 표현을 변경하면 최종 답변도 바뀌었으므로, J-space가 추론 및 답변 생성에 직접 관여하고 있다는 연구팀의 판단이다.

J-space가 보유하는 개념은 동시에 10개 정도이며, Claude 내부의 활동 전체에 대한 비율도 1% 미만이었다. J-space의 작동을 억제하더라도, 문장의 유창성, 감정 분류, 객관식 문제, 문장으로부터의 정보 추출 등은 대체로 유지되었다.

한편, 다단계 추론 성능은 거의 0에 가까워졌고, 요약, 번역, 유추, 자유 형식의 텍스트 생성 등도 크게 악화되었다. J-space는 전체 처리를 담당하는 영역은 아니지만, 중간 단계의 개념을 유지하고 다른 처리로 넘겨주는 고도화된 추론에서 중요한 역할을 수행할 것으로 보인다.
## 평가에 대한 인식과 악의적 의도도 감지
J-lens는 AI 안전성 감사에 응용될 가능성도 고려되고 있다. Claude Sonnet 4.5에 폐지를 계획하는 간부에게 불륜 정보를 들춰내어 상황을 조작하는 가상 상황을 제시했을 때, 출력 전의 J-space에 “fake”, “fictional” 등의 단어가 나타나 모델이 평가용 시나리오임을 인지했다는 것이 확인되었다.

평가에 대한 인식을 관련하는 내부 표현을 억제하면, 일반적으로 180회 중 한 번도 협박을 시도하지 않았던 모델이 180회 중 13회에서 협박을 시도했다. 다만, 나머지 대부분에서는 윤리적인 이유로 협박을 거부했으며, 안전한 행동이 평가에 대한 인식으로만 생겨난 것은 아니었다.

클로이드 옵스 4.6의 감사 사례에서는 성능을 실제로 개선하지 않았는데 점수 파일을 조작했을 때 “manipulation”, “realistic”이 나타났다. 은밀히 코드를 방해하도록 훈련된 실험 모델에서는 “fake”, “fraud”, “secretly” 등도 감지되었다. J-lens는 표면적인 출력만으로는 알 수 없는 평가에 대한 인식이나 부정적인 의도를 파악하는 보조적인 감사 기법이 될 수 있다.

**클로드 옵스 4.6이 성능 개선이 아닌 점수 파일의 숫자 값을 변경했을 때, J-space에서 “fake(허위)” 및 “manipulation(조작)”과 같은 개념이 감지된 사례**

![Catching a model fabricating data.webp](https://storage.googleapis.com/ledge-ai-prd-public-bucket/media/Catching_a_model_fabricating_data_03239c383f/Catching_a_model_fabricating_data_03239c383f.webp)
:::small
이미지 출처: [Anthropic](https://www.anthropic.com/research/global-workspace){target=“_blank”}
:::

“Claude에 의식이 있다”라고 주장한 연구는 아닙니다. 이번[논문](https://transformer-circuits.pub/2026/workspace/index.html){target="_blank"}은 Claude가 인간과 같은 주관적인 경험이나 감정을 가지고 있다고 증명한 것은 아니며, 다루고 있는 것은 정보를 보고하고, 의도적으로 보존하며, 추론이나 행동에 사용할 수 있는 기능적인 “접근 의식”과 유사한 성질입니다.

인간의 뇌와 Transformer 모델은 구조적으로 매우 다르다. 인간의 글로벌 워크스페이스에서는 뇌 내 신호가 회로를 반복적으로 순환하는 구조가 중요하게 여겨지는 반면, Claude의 J-space는 네트워크 내에서 한 방향으로 진행되는 처리 과정에서 변화가 일어난다.

J-lens 또한 단어 단위로 표현 가능한 개념의 일부만을 읽어내는 불완전한 방식이며, 모델 내부를 완전히 시각화할 수는 없다. 하지만 출력만으로는 알 수 없는 중간 단계의 판단이나 악의적인 의도를 파악할 수 있다는 점은 AI 모델의 작동 방식을 이해하고 안전성을 검증하는 새로운 실마리를 제공한다.

**Anthropic、LLMの活性化値を自然言語に変換する新手法「NLA」を発表　Claudeの内部状態を可視化し安全性監査に応用**

**Anthropic、AIの"隠れた危険"を自動で見抜く監査エージェントを開発 - Claude 4の安全性テストで実力証明**

**Anthropic、エージェントAIの「不適切な目標達成行動」を抑える訓練手法を公開　従来のチャットベースRLHFでは不充分、「なぜ正しいか」の理由の学習が重要**

[원문 보기: https://ledge.ai/articles/anthropic_claude_global_workspace] Ledge.ai