更新日:2026/8/12 2026년 8월 11일 실행 요약 보고서에서는 로봇 기반 모델의 “실행 효율”과 “현장 적응”을 높이는 연구가 이어졌습니다. RynnValue는 일반적인 가치 판단, SLIM-0.5B는 소형·저지연 추론, HIL-HARC는 단시간의 실기 온라인 강화 학습, TempoWAM은 상태에 따른 재계획을 제시합니다. 또한, JEPA-WAM, VANE, WorldSimProbe는 잠재 세계 모델, 테스트 시 적응, 시뮬레이터 품질 보증의 과제를 심층적으로 탐구했습니다. 사업 측면에서는 Unitree Robotics의 상하이 IPO에 개인 투자자의 응모가 쏟아지고, 물리 AI 기업에 대한 자본 시장의 기대가 명확하게 드러났습니다. 제작한 기사 내용을 Gamma에 입력하여 자동으로 슬라이드를 생성했습니다. 슬라이드 내용이 보기 좋으셨으면 좋겠습니다. 무라카미 하루키는 2016년 11월 18일, 츠키지 블루마운틴 출판을 기념하는 기자회견을 열었다. 이 자리에서 그는 자신이 쓴 책들을 꼽으며, 특히 ‘나를 잊지 마’라는 제목의 소설에 대한 질문을 받았다. “‘나를 잊지 마’는 내가 쓴 책 중 가장 솔직한 책이라고 생각해요. 다른 책들보다 훨씬 더 개인적인 경험과 감정을 담고 있죠. 특히, 이 책을 통해 저는… (중략)” RynnValue: 7,000시간 이상의 동영상으로 범용 로봇 가치 모델을 사전 학습 2️⃣ SLIM-0.5B:약 0.47B 규모로 저지연·저메모리 소형 로봇 전략을 구현 3️⃣ HIL-HARC:실기 160분 온라인 RL(강화 학습)에서 평균 성공률을 40%에서 75%로 개선 4️⃣ 템포 WAM: 상태 의존적인 재계획으로 WAM 호출 및 실패율 감소 5️⃣ JEPA-WAM:잠재 세계 모델에서 VLA의 상태 예측 및 행동 생성 통합 6️⃣ VANE: 미래 관측으로 업데이트를 검증하는 안전 중심의 테스트 기반 학습 7️⃣ 월드심프로브: WAM의 물리적 정확도를 18,000건 이상으로 진단 8️⃣ 유닛리 로보틱스: 상하이 IPO에 응모 8,000배 초과, 당선율은 약 0.018% 종합적 고찰 향후 주목할 점 RynnValue: 7,000시간 이상의 동영상으로 범용 로봇 가치 모델을 사전 학습 알리바바 DAMO 아카데미와 휴판랩 연구팀이 로봇 영상의 시간 구조에서 언어 지시 완료까지 남은 시간을 추정하는 핵심 모델 “RynnValue”를 공개했습니다. 7,000시간 초과, 약 309만 건의 지시문이 포함된 클립으로 학습하여 RBM-EVAL-OOD의 Kendall의 τa 0.675를 달성했으며, 실제 기기인 Franka의 양팔 로봇을 이용한 4가지 작업에서는 최적의 비교 기법에 대해 온라인 강화 학습 성공률을 52.5%에서 72.5%, 오프라인 강화 학습을 63.8%에서 82.5%로 개선했습니다. 보상 설계 방식을 대규모 사전 학습으로 대체하고, VLA 후 학습 및 데이터 선별을 통합하는 핵심 모델로 주목받고 있습니다. 2️⃣ SLIM-0.5B:약 0.47B 규모로 저지연·저메모리 소형 로봇 전략을 구현 출처: arXiv:2608.09771 / 공식 프로젝트 다기관 연구팀이 약 4억 7,200만 개의 학습 가능한 파라미터를 가진 소형 로봇 정책 “SLIM-0.5B”를 발표했습니다. 마스크 궤도 예측을 이용한 자기 지도 학습을 통해 행동에서 미래 잠재 상태를 예측하는 순방향 학습과 상태 변화에서 행동을 복원하는 역방향 학습을 통합합니다. LIBERO에서 97.5%, LIBERO-Plus의 제로샷 평가에서 77.45%, CALVIN에서 평균 시퀀스 길이 4.556/5를 기록했습니다. 공식 프로젝트 페이지에서는 실기 5가지 작업의 평균 progress 지표 67.8, 엔드 투 엔드 정책 지연 77.3 밀리초, 정책 서버 GPU 메모리 2.01GiB를 보고합니다. 실기 값은 성공률이 아닌 진행 지표이지만, 소형 로봇 정책의 계산 자원 제약을 크게 완화하는 성과입니다. 3️⃣ HIL-HARC: 실기 160분 온라인 RL로 평균 성공률 40%에서 75%로 개선 공식 프로젝트 연구팀은 중앙집중 학습 및 분산 실행과 크리티크 분해를 결합한 실기 온라인 강화 학습 프레임워크 “HIL-HARC”를 발표했습니다. 연속적인 팔 운동과 이산적인 그립퍼 조작을 별도의 액터로 제어하며, 공유 크리티크가 튜션 보상과 그립퍼 보상을 분해하여 평가합니다. 테니스공, 바나나, 냄비 재설정이라는 3가지 실기 튜션을 총 약 160분 학습하여 평균 성공률을 40%에서 75%로 개선했으며, 학습 수렴 시점에 인간 개입률을 0%까지 낮추었습니다. 현장별 최종 적응을 수 시간 내에 회전시킬 가능성을 보여주는 한편, 안전 정지 및 인증 수준 평가 등은 향후 과제입니다. 4️⃣ 템포 WAM: 상태 의존적인 재계획으로 WAM 호출 및 실패율 감소 출처: arXiv:2608.09492 / HTML판 WAM이 생성한 행동 チャン크를 고정 길이로 실행하지 않고, 작업 진행 상황을 모니터링하여 지속하거나 재계획을 결정하는 “TempoWAM”이 제안되었습니다. 약 227만 파라미터의 경량 모니터를 기존 WAM에 추가하여 양팔 모형 실기의 3 작업을 각 30회 평가했습니다. 간단한 음료 획득에서는 성공률 90%를 유지한 채 WAM 호출을 평균 32.7회에서 23.9회로 26.9% 감소시켰으며, 어려운 핸드크림 포장에서는 성공률을 50.0%에서 63.3%로 개선했습니다. 모델을 대형화하지 않고, 상황의 난이도에 따라 추론 자원과 오차 축적을 조절하는 구현 지향적인 방법입니다. 5️⃣ JEPA-WAM:잠재 세계 모델에서 VLA의 상태 예측 및 행동 생성 통합 연구팀은 V-JEPA의 잠재 공간에서 상태 전이 예측과 연속 행동 생성이라는 두 가지 기능을 동일한 예측자에게 부여하는 “JEPA-WAM”을 발표했습니다. 현재와 미래를 공동으로 인코딩한 공간 구조를 가진 타겟을 학습하여 픽셀 수준의 미래 영상 생성을 하지 않고도 물체나 로봇의 미세한 위치 관계 변화를 정책에 반영합니다. LIBERO-Plus에서 대규모 로봇 정책 사전 학습 없이 79.2%, π0.5를 사용한 구성으로 86.3%를 달성했으며, RoboTwin 2.0과 실제 양팔 로봇 제어에서도 시각 및 공간 분포 변화에 대한 일반화 성능을 검증했습니다. 추론 시에는 상태 전이 예측 부분만 분리 가능하여 세계 모델의 장점과 저지연 제어를 동시에 추구하는 설계입니다. 6️⃣ VANE: 미래 관측으로 업데이트를 검증하는 안전 중심의 테스트 기반 학습 출처: arXiv:2608.09448 / HTML版 VLA를 도입 대상으로 한 미라벨 관측에서 적응시키는 테스트 시 학습 방법 “VANE”이 발표되었습니다. 업데이트 후보를 실운영 중인 정책으로부터 격리한 shadow copy로 생성하고, 미래 관측에서 개선 사항이 확인된 경우에만 반영함으로써 파괴적인 온라인 업데이트를 억제합니다. SimplerEnv의 WidowX에서는 성공률 71.2%를 기록했으며, 이에 해당하는 TTT 기준보다 3.2 포인트 개선되었습니다. 단일 프롬프트 설정에서는 체크포인트 1건의 평가당 backward 업데이트를 45,824회에서 612회로 98.7% 감소시켰을 뿐만 아니라 성공률을 67.5%에서 69.0%로 높였습니다. 평가는 시뮬레이션이며, Google Robot suite에서는 효과가 균일하지 않습니다. 실제 도입에는 접촉 실패나 롤백 시간 등을 포함한 추가 검증이 필요합니다. 7️⃣ 월드심프로브: WAM의 물리적 정확도를 18,000건 이상으로 진단 “이미지가 자연스러운가”가 아닌, “주어진 행동이 정확한 로봇 운동으로 이어졌으며, 그 접촉에 의해 환경이 변화했는가”를 기준으로 평가하는 벤치마크 “WorldSimProbe”가 발표되었습니다. 이 벤치마크는 지역 행동 교정, 전체 궤도 커버리지, 행동 원인별 동작 유지, 상호작용 기반 지향성, 상호작용 역학의 5가지 세트를 포함합니다. RoboTwin, ManiSkill, LIBERO의 1만 8천 건 이상의 데이터를 활용하여 6개의 오픈 소스 행동 조건부 세계 모델을 평가하고, 행동 압축, 근거 없는 물체 반응, 일관성 없는 물리적 동작을 시각화했습니다. WAM을 계획 및 합성 데이터 생성에 활용하기 전에 품질 보증 기반으로 중요한 성과입니다. 8️⃣ 유닛리 로보틱스: 상하이 IPO에 응모 8,000배 초과, 당선율은 약 0.018% 출처: 상하이증권보·우이기술 IPO 공고 / Reuters 宇樹科技(Unitree Robotics)의 상해 코성판 IPO에서 개인 투자자로부터 8,000배를 초과하는 접수 건이 몰려 최종 온라인 당선률은 약 0.018%となりました. 발행 가격은 주당 150.80 위안, 조달 규모는 약 61억 위안(약 9억 달러), IPO 시 평가액은 600억 위안 초입니다. Reuters에 따르면, 평가 배율은 2025년 이익의 219배, 매출액의 36배에 달하여 성장 기대의 큼과 밸류에이션 리스크가 동시에 나타나고 있습니다. 접수 배율 자체는 기술 진보를 의미하지 않지만, 로봇 모델, 본체, 신제품의 연구 개발 및 제조 거점을 동시에 확장할 수 있는 자본력이 중국 물리 AI 산업의 경쟁 속도를 끌어올릴 수 있습니다. 종합적 고찰 2026년 8월 11일의 주제에서 드러난 특징은 물리적 AI의 경쟁 축이 “더 큰 모델”에서 “가치 판단, 잠재 표현, 재계획, 현장 적응을 어떻게 저비용으로 구현할 것인가”로 이동하고 있다는 점을 읽을 수 있었습니다. RynnValue는 보상, SLIM과 JEPA-WAM은 제어 표현, TempoWAM은 추론 시점, HIL-HARC와 VANE는 도입 후 적응을 각각 재설계했습니다. 한편, WorldSimProbe가 지적하듯이, 자연스러운 생성 영상과 물리적으로 충실한 시뮬레이션은 동일하지 않습니다. 실제 성공률이 올라갈수록 안전 정지, 실패 복구, 평가 시도 횟수, 제3자 재현성의 부족이 다음 제약이 됩니다. Unitree IPO에 대한 극단적인 수요는 자본 유입을 가속화할 수 있습니다. 그러나 높은 기업 평가를 유지하기 위해서는 연구 성과를 지속적인 운영률, 용도별 ROI, 양산 품질로 전환할 수 있는지가 결정적입니다. 앞으로 주목할 부분은… RynnValue는 서로 다른 제조사의 로봇이나 미지의 작업에서도 가치 점수와 실제 정책 성공률 간의 상관관계가 재현되는지 여부가 핵심 쟁점입니다. SLIM과 JEPA-WAM은 실제 기기의 제어 주기, 소비 전력, 장시간 운전 시 지연 변동까지 포함하여 저전산 설계의 우수성을 입증할 수 있는지가 중요합니다. HIL-HARC와 VANE에서는 온라인 업데이트 실패를 감지하는 기준, 이전 정책으로의 복구 시간, 인간 개입 재개를 위한 조건 설계를 해야 합니다. TempoWAM의 적응적 재계획이 충돌 회피나 비정상 정지 등의 안전 감시 기능과 통합되었을 때도 계산 효율을 유지할 수 있을지가 주목됩니다. Unitree는 IPO 자금을 투입하여 로봇 모델, 본체, 신제품 연구 개발 및 제조 거점 정비와 실제 출하 대수 및 상업적 운영률을 연결할 수 있는지가 평가의 분수령이 될지 여부가 평가의 중요한 지표가 될 것입니다. 출처: note 원문 번역: Gemma 3(.44) 초벌 + 교정 27청크 원문 보기 | 출처: note.com