# 인간CLAW: 시각언어 모델은 물리적 신체를 조작할 수 있는가?

> https://bookfactory.kr/c/ai-tech/9801
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-08-16T18:47:25.127Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/299098993/rectangle_large_type_2_feb51147b464d1d2dd6bba96e551877f.png?width=1280)

물리적 AI는 특히 조작 영역에서 여전히 연구 단계에 있으며, 사회 구현에는 상당한 시간이 소요될 것으로 예상됩니다. 실제로 이를 더욱 세분화할수록 접촉 풍부 작업일수록 실패율이 현저하게 증가합니다. 이번에 소개해 드리는 논문은 그 근본적인 원인을 밝혀냈다고 판단되어, 다루고 싶었습니다.

본 기사에서는 공개된 논문과 정리 슬라이드를 바탕으로 분리 평가의 설계, HumanCLAW-Bench의 결과, 그리고 논문이 지적하는 신체적 자기 인식(Embodied Self-awareness)의 결여까지를 체계적으로 정리합니다.

기술 설명은 Note에서 공개하고 있습니다. Aezith(이시스)의 회사 정보, 사업 내용 및 문의 사항은 https://www.aezith.com을 참조해 주시기 바랍니다.

## 目次

- 제1장: 서론 및 요약
- 1-1. 지금 HumanCLAW를 사용하는 이유인가요?
- 요약하자면 1-2입니다.
- 제2장: 배경 – 추론과 제어가 혼재하는 문제
- 제3장: HumanCLAW의 틀
- 3-1. 고·중·저 레벨의 단계적 추론
- 3-2. 프롬프트에서 스킬로의 전환
- 4장: 모션 생성과 반물리
- 제5장: HumanCLAW-Bench 및 평가 결과
- 제6장: 실패 분석과 신체적 자아 인식

## 제1장: 서론 및 요약

HumanCLAW는 상용 VLM에 신체를 부여했을 때, 그 모델이 순간마다 “다음으로 신체가 무엇을 수행해야 하는가”를 정확하게 선택할 수 있는지를 평가하기 위한 프레임워크입니다. 논문 제목은 “Can Vision-Language Models Act Through a Body?”이며, 프로젝트 페이지는 https://human-claw.github.io/이고, arXiv 논문은 2607.27180입니다.

![画像](https://assets.st-note.com/img/1785469395-F2U1JitxhjDWS8qVgaXu0HC5.png?width=1200)

### 1-1. 왜 지금 HumanCLAW인가

VLM을 인간형 로봇이나 전신 에이전트의 의사 결정 계층에 배치한다는 개념이 늘어나고 있습니다. 하지만 실패가 발생했을 때 “모델의 판단이 잘못되었던 것인가”, “균형 제어 또는 모터 추종이 떨어졌던 것인가”를 구분하는 것이 어렵다는 것이 논문의 출발점입니다. HumanCLAW는 실행자의 균형 실패 등을 의도적으로 배제하고, 남은 의사 결정의 질, 즉 액션 인텔리전스를 측정합니다.

### 1-2. 요약하자면

- 결론 1: HumanCLAW는 VLM의 기술 결정 및 저레벨 실행을 분리하고, 마이크로초 수준의 閉ループ에서 액션 인텔리전스를 측정하는 평가 프레임워크이다.
- 결론 2: HumanCLAW-Bench는 실내 41 시나리오, 1,218 에피소드의 Find–Navigate–Interact 작업을 수행한다. 9개 모델 중에서도 최고 Interact 성공률은 16.8% (Gemini-3.1)였다.
- 결론 3: 목표 인식 자체는 주된 병목이 아니다. 결여된 것은 신체적 자아 인식(자기 위치 파악, 목표 도달 판단, 물리적 상호작용 파악)이다,라는 연구가 정리하는 바이다.

## 제2장: 배경 – 추론과 제어가 혼재하는 문제

엔드투엔드 제어에서는 Think(추론)과 Act(제어)가 하나의 루프에 얽혀 있습니다. 계단에서 넘어졌을 때, VLM의 공간 판단 오류인지, 보행 컨트롤러의 균형 파탄인지 분리할 수 없습니다.

![画像](https://assets.st-note.com/img/1785469441-yvuI3iPOdzUETSBowK65nAex.png?width=1200)

HumanCLAW의 접근 방식은 의사 결정과 실행을 인터페이스로 분리하는 것입니다. VLM은 원자적 기술(걷기, 돌아가기, 앉기 등)을 선택하고, 실행 측에서 그 기술을 연속 모션으로 물리 공간에 적용합니다. 넘어지기와 같은 제어 노이즈를 평가에서 배제함으로써 “그 순간 신체가 무엇을 해야 한다고 모델이 믿었는지”를 측정합니다.

논문에서 제시하는 액션 인텔리전스는 공간 이해를 폐루프 신체 결정으로 전환하는 운영 능력입니다. 무엇을, 어떤 파라미터로, 어떤 순서로 실행할지 물리적 결과가 돌아오는 대로 재선택하는 문제이며, 선택한 동작을 관절 토크로 구현하는 모터 제어 문제와 구별됩니다.

## 제3장: HumanCLAW의 틀

프레임워크는 서브초의 폐루프에서 다음 3가지 역할을 순환하며, VLM은 사고에 집중하고 생성기와 시뮬레이터가 물리적 움직임을 보장합니다.

![画像](https://assets.st-note.com/img/1785469480-BUyVhMJio3lCFRXt4A2Tkzfd.png?width=1200)

### 3-1. 고·중·저 레벨의 단계적 추론

단일 프롬프트에서 직접 행동하는 대신, 시각 상태에 따라 목표를 단계적으로 분해합니다. 예를 들어 “소파를 찾아 앉아라”를 장기 지시의 해석, 중간 목표 설정(보이는 대상으로 향하는지 매 단계에서 계승할지 재평가할지 판단), 모션 스킬 선택 등으로 분해합니다.

![画像](https://assets.st-note.com/img/1785469526-WdSmaOBN3iCyl0oLRK1UQ8uw.png?width=1200)

### 3-2. 프롬프트에서 스킬로의 전환

입력 프롬프트에는 에이전트의 정체성, 장기 목표, 이용 가능한 스킬 목록, 과거 행동 및 시각 상태 텍스트 기록 등이 포함됩니다. VLM은 사전 정의된 스킬 풀에서 선택하고 연속 파라미터를 예측하며, 공간적 환각을 억제하는 검증 모듈(verifier)을 통해 JSON 형식의 원자 스킬로 출력합니다.

![画像](https://assets.st-note.com/img/1785469545-axA1f7bmH2rQU9uPtVIYBck5.png?width=1200)

기술 예시로는 `walk(x, z, ψ)`, `side_step(x)`, `turn_in_place(θ)`, `climb_upstairs(h, d)`, `sit_in_place(h)`, `stop` 등이 제시됩니다. 중요한 점은 기술이 “소파에 앉아”와 같은 복합 지시사항이 아닌, 신체 동작의 최소 단위라는 것입니다. 복합은 VLM 스스로가 단계별 추론으로 구성하는 설계입니다.

## 4장: 모션 생성과 반물리

VLM은 관절 트랙을 직접 생성하지 않고, 스킬 조건에 맞는 움직임 생성 장치가 연속적인 전신 운동을 공급합니다. 사전 학습된 Motion DiT(Diffusion Transformer)와 ControlNet을 통해 스킬 파라미터를 매끄러운 30Hz(15 액션 チャンキング) 전신 트랙으로 변환합니다. 스킬 조건은 스킬마다 ControlNet 측에서 처리하고, 베이스 DiT에 주입하는 구성입니다.

![画像](https://assets.st-note.com/img/1785469572-iuAVl9jdqaRx1e8KJU4GD2vZ.png?width=1200)

실행 환경은 순수한 운동학적 시뮬레이션이나 완전한 토크 제어로는 미흡한, 반물리(half-physics) 시뮬레이션을 채택합니다.

- 순수 기네마틱스: 벽을 뚫고 지나가거나, 계단을 공중에서 오르내리는 등 행동의 물리적 결과에 대한 평가가 불가능한 것
- 완전한 동적 토크 제어: 미세한 보행 오차에도 넘어지게 하며, 행동 지능 평가에 따라 보행 컨트롤러 성능이 의존한다.
- 반물리: 굳직한 접촉이나 중력 등 장면과의 상호작용은 유지하면서, 이족 보행 제어는 수행하지 않는다. 낙타 노이즈를 제거하고 VLM(Visual Landmark Measurement)의 판단 오류를 강조한다.

![画像](https://assets.st-note.com/img/1785469625-0G21mvaTBnK3ftQUZWNIsJrw.png?width=1200)

이 설계는 “벽에 부딪히는 것”, “물체를 움직이는 것”, “목표 직전에서 멈추는 것”과 같은 실패를 행동 결정에 귀속되기 쉽습니다. 반면에 실제 기기의 균형 파탄 자체는 평가 대상에서 제외되며, 벤치마크의 범위를 이해하는 데 중요한 제약으로 작용합니다.

## 제5장: HumanCLAW-Bench 및 평가 결과

HumanCLAW-Bench는 실내 주거 환경에서 VLM(볼륨 시각적 장면)에 장시간 Find–Navigate–Interact 작업을 초단시간 간격으로 수행하도록 하는 벤치마크입니다. 논문에서는 HSSD의 검증용 41채의 집을 사용하고 1,218개의 1인칭 에피소드를 구축했습니다.

![画像](https://assets.st-note.com/img/1785469653-nbhLd0kVR8PeGKD7z9Am2Bog.png?width=1200)

대표적인 작업은 “소파를 찾아 앉는” 것입니다. 초기 상태에서는 추상적인 지시만 주어지고, 모델은 탐색, 접근, 착석까지를 자율적으로 결정합니다. 슬라이드상의 진행 정의의 예는 다음과 같습니다.

- 찾다: 특정 물체를 시야에 담는 공간 탐색
- 이동: 장애물을 피하고 대상 바운딩 박스에서 20cm 이내로 접근한다.
- 상호작용: 적절한 자세를 유지하며 물리적 접촉(좌식)을 하고 완료를 선언한다.

![画像](https://assets.st-note.com/img/1785469673-cwdko1jIVSHa9F3LzyNWxtCf.png?width=1200)

평가 대상은 9가지 최첨단 VLM(가상 이동 모델)입니다. 논문과 슬라이드에서 제시된 주요 성공률은 다음과 같습니다. 어떤 모델도 벤치마크를 완전히 해결하지 못합니다.

![画像](https://assets.st-note.com/img/1785469710-6rQ4VemFDnai8zRYpw3k7Ebd.png?width=1200)

가장 높은 수치는 Gemini-3.1의 Interact 16.8%입니다. 오픈형 기반의 Gemma-4-31B(11.1%)가 일부 폐쇄형 모델을 상회하는 점도 슬라이드에서 강조되고 있습니다. Find에서 Navigate로, 그리고 Interact로 단계적으로 성공률이 하락하는 “벽”이 모든 모델에 공통적으로 나타납니다.

![画像](https://assets.st-note.com/img/1785469728-SwPnLCbXiRQu0KdzvpcrMO3I.png?width=1200)

실패의 상당수는 시각적 인지를 통해 대상을 파악한 이후 단계에 집중됩니다. Find 기능에서는 절반 가까이가 실패하고, Navigate 기능에서는 더욱 크게 감소하며, Interact 기능에서는 최종 성공률이 1.9%에서 16.8% 사이로 좁혀지는 흐름이 시각적으로 나타냅니다.

## 제6장: 실패 분석과 신체적 자아 인식

### 6-1. 시각적 인지 능력은 병목 현상이 아니다

분석의 첫 번째 점은 목표물이 충분히 명확하게 제시되어 있다면 모델이 그것을 정확하게 인식할 수 있다는 것입니다. 시각적 대상 인식률과 객관적으로 측정한 가시성률의 차이가 약 5점 이내,라고 슬라이드에서 언급합니다. “보는” 것과 “신체를 통해 행동하는” 사이에는 결정적인 간극이 있으며, 실패의 주된 원인은 인식 후의 공간 파악에 있다는 분석입니다.

![画像](https://assets.st-note.com/img/1785469746-jq14uE6YkV897X5wOBdrSAtl.png?width=1200)

### 6-2. 내비게이션 및 상호작용의 장벽

내비게이션 실패 시 이미 도착했다고 인지하지 못하고, 장애물에 갇혀 계속 전진하거나 하는 신체적 인지 결핍이 두드러집니다. 상호작용에서는 내비게이션 성공 후에도 좌석에 실패하는 비율이 높으며, 가장 빈번한 실패 모드는 ‘공중 부양’(sit on air)입니다. 내비게이션 성공 사례 중 상당수가 좌석에 닿지 못하는 데, 좌석 실패의 약 58%가 ‘공중 부양’으로 나타납니다. 골반이 어느 면에도 닿지 않으면서 좌석에 앉는 명령을 내리는 현상입니다.

![画像](https://assets.st-note.com/img/1785469763-1wbJfea0ZDUFHLp5yOdTI27q.png?width=1200)

![画像](https://assets.st-note.com/img/1785469797-EaPgYd2ruMlfD6hJqVRAT79I.png?width=1200)

### 6-3. 근본 원인으로서의 신체적 자아 인식

논문 및 슬라이드는 근본적인 원인을 신체적 자아 인식(Embodied Self-awareness)의 결여로 지적합니다. 현재 VLM은 장면 상황 추론에는 능하지만, 자신이 지금 어디에 서 있는지, 목적지에 도착했는지, 장애물에 부딪히고 있는지 등 주관적인 신체 감각에 기반한 판단을 잃기 쉽다는 점을 지적합니다.

![画像](https://assets.st-note.com/img/1785469815-i96esz2XBSZYO4kFMwmlopAJ.png?width=1200)

신체적 자아 인식은 다음 세 가지로 정리되어 있습니다.

- 자신의 위치 파악: 공간 내에서의 위치와 자세를 지속적으로 추적한다.
- 목표 달성의 인지: 겉으로 보이는 거리감뿐만 아니라, 다음 행동이 가능한지 판단하는 것
- 물리적 상호작용에 대한 이해: 충돌이나 물체 이동과 같은 행동의 물리적 결과에 대한 피드백을 인지하는 것

![画像](https://assets.st-note.com/img/1785469833-zSxvE8W2UucACfFsbMLq4keB.png?width=1200)

### 6-4. 신체성을 구현하기 위한 4가지 접근법

슬라이드는 시각적 이해에만 그치지 않고, 신체와 환경의 물리적 연관성을 추론 아키텍트 측에서 강화해야 한다는 점을 다음 4가지 사항으로 제시합니다.

![画像](https://assets.st-note.com/img/1785469861-PeI2vmdBhsCYNucO16w3EyA5.png?width=1200)

저자로서 물리적 AI 현장에서도 “인식이 이루어지는 데 마지막 접촉이나 정지 판별에서 오류가 발생하는” 경험은 흔치 않으며, HumanCLAW의 실패 모드 분해는 설계 검토 체크리스트로 활용하기 유용하다고 생각합니다(의견). 반면에 본 벤치는 동결 VLM – 주로 착석형 인터랙션, 프로피오세프션 비입력이라는 조건 하에서의 스냅샷이라는 점도 고려해야 합니다(의견).

## 제7장: 요약 및 참고 자료

HumanCLAW는 운동 제어 노이즈를 제거한うえ로 VLM의 순수한 의사결정을 측정하는 테스트 베드를 제공하여, 현재의 병목을 “신체적 자가 인식”의 위치로 재조정했습니다. 행동 지능의 진화에는 궤도 데이터의 수집뿐만 아니라 자아 신체와 물리적 인과를 닫는 루프에서 파악하는 추론 능력이 필수적이라는 것이 슬라이드의 요약입니다.

![画像](https://assets.st-note.com/img/1785469877-uYAMBva8wtrpOQJmlIXdkcGW.png?width=1200)

### まとめ

- HumanCLAW는 Think(VLM) / Translate(스킬 조건부 모션) / Act(반물리)의 폐루프 방식으로 Action Intelligence를 측정한다.
- 벤치는 41회, 1,218화로 구성되어 있으며, 최고 상호작용 성공률은 16.8%이다. Find → Navigate → Interact 방식으로 단계적으로 감소한다.
- 인지 갭은 작고, 실패는 도착 판정 및 자기 위치 파악, sit on air 등 인지 후 신체 파악에 집중한다.
- 다음 핵심은 신체 상태 추적, 물리적 결과 예측, 동적 목표 수정, 멀티모달 통합과 같은 아키텍처 측의 강화를 의미한다.

평가 조건의 한계로서, 논문은 凍結 모델을 대상으로 하며, 상호작용은 착석 기반에 치중되어 있습니다. 반물리는 균형 실패를 해결하기 위한 설계 선택이며, 실제 도입 시에는 보행 및 안정화 문제가 다시 부각됩니다. 수치는 2026년 7월 시점의 일베인치마크 결과로서 참고하는 것이 적절합니다.

본 기사는 Aezith가 공개하는 물리 AI 기술 해설의 일부입니다. 물리 AI 컨설팅 및 PM 지원에 대한 자세한 내용은 https://www.aezith.com 에서 확인하시기 바랍니다.

### 참고 자료

- 논문: HumanCLAW: 비전-언어 모델이 몸을 통해 행동할 수 있을까? (arXiv:2607.27180)
- 프로젝트 페이지: https://human-claw.github.io/
- Hugging Face Papers：https://huggingface.co/papers/2607.27180 ß

**출처:** [note 원문](https://note.com/teddy14/n/n73ce44642bda)

*번역: Gemma 3(.44) 초벌 + 교정 47청크*

[원문 보기](https://note.com/teddy14/n/n73ce44642bda) | 출처: note.com