更新日:2026/7/28
이전 요약
2026년 7월 27일에는 접촉 제어에 도움을 주는 시각·촉각 감각 세계 모델 “ViTacWorld”、로봇 형태 묘사로 기체 의존성을 줄이는 “Robot-Factored World Models”、미지의 상대 전략을 온라인 학습하는 “SOWL-MPC”가 연구의 중심이 되었습니다. 또한, ROS 2에서 재사용 가능한 가변 인퍼런스 제어, 200Hz의 비행용 LIO(실시간 LiDAR 오도), 지자기 SLAM 데이터셋, KYOJO CUP에서의 Local 5G×Physical AI 실증이 함께 진행되어 경쟁 축이 기초 모델뿐만 아니라 저위 제어, 상태 추정, 센서 중복화, 현장 네트워크까지 확장되고 있음을 보여주었습니다.
※ 작성한 기사 내용을 Gamma에 입력하여 슬라이드 자동 생성하도록 했습니다. 슬라이드 분이 보기에 편하시다면 아래 링크를 참고해 주세요.
1️⃣ ViTacWorld: 시각, 촉각, 후각을 활용한 몰입형 세계 모델로, 닿기만 하면 성공률이 80%를 기록
출처: arXiv:2607.22530 / 시나이 톄후 대학 등 연구팀이 행동을 조건으로 영상과 촉각을 동시에 예측하는 접촉 조작용 세계 모델 “ViTacWorld”를 발표했습니다. 공개된 시각-촉각 데이터와 5,000건이 넘는 작업 일치 시뮬레이션 경로를 포함한 총 21,000건이 넘는 경로로 사전 학습했으며, 4가지 작업의 실기 평가에서는 촉각을 포함한 평균 성공률이 실제 데이터만으로는 42.5%에서 생성 롤아웃 1회에 67.5%, 2회에 80.0%로 향상되었습니다. 생성 롤아웃 1회 후의 전략에서는 예측 평균은 57.5%, 실기 평균은 67.5%이며, U-Block 삽입에서는 10가지 조건 중 9가지 조건이 일치했으며, 데이터 생성과 투입 전 평가를 통합하는 프레임워크입니다.
2️⃣ 로봇-팩터드 월드 모델: URDF 묘사로 세계 모델의 기체 의존성을 분리
출처: arXiv:2607.22535 / 서울대학교 등 연구팀은 세계 모델의 입력을 기종별 제어 벡터가 아닌, 로봇의 URDF에서 추출한 명목 궤적과 깊이 정보로 대체하는 “Robot-Factored World Models”를 발표했습니다. DROID 아브레이션 결과, Raw action mesh의 PSNR 21.57, SSIM 0.860, LPIPS 0.175에서 명목 메쉬 + 엔드 효과자/시네 깊이 정보로 23.08, 0.874, 0.161로 개선되었습니다. 미검토된 xArm 6+Inspire F1이나 이중 팔 Franka에 대한 제로샷 예시도 제시했지만, 논문의 정량적 평가는 영상 예측에 중점을 두고 있으며, 실제 기기 폐루프 제어는 검증되지 않았습니다.
3️⃣ SOWL-MPC:미지의 상호작용을 온라인 학습하는 안전 예측 제어
보로냐 대학교 연구팀이 공유 공간에서 상대 로봇의 전략이 미지라도 안전한 회피 및 추월을 계획하는 “SOWL-MPC”를 제안했습니다. 스파스 변분 가우스 과정을 온라인으로 업데이트하고, 예측 불확실성을 비선형 MPC에 통합했습니다. 50회 간의 몬테카를로 시뮬레이션에서 예측 지평을 10에서 40으로 늘렸을 때 성공률이 86%에서 100%로 상승했으며, 상대 궤적의 정적 ADE는 고정 속도 예측의 약 0.4m에 대해 약 0.05m였습니다. 9x4m의 실내 환경에서도 JetRacer 2대, Vicon 100Hz, 명령 20Hz로 실증하고, 미지의 에이전트와의 공존 제어에 구현 가능성을 보여주었습니다.
4️⃣ 플러그, 플레이, 그리고 준수: ROS 2 가변 임피던스 제어를 장치 간 횡단화
출처: arXiv:2607.22483 / 프로젝트 페이지 연구팀은 ROS 2 Humble에서 온라인 변위 임피던스 제어를 기종 간 횡단 방식으로 재사용하는 “Plug, Play, and Comply”를 공개했습니다. Franka FR3 실기에서는 FCI를 통해 1kHz로 토크를 교환하고, FR3 모델을 사용한 독립형 측정에서는 제어기 업데이트가 평균 3.82µs, 모델 업데이트 등을 포함한 라ッパー 적용 시 4.49µs로, 1ms 주기를 훨씬 밑돌았습니다. 퀵 커넥터 삽입은 1~6도의 전체 빗각에서 성공했으며, TCP 고정 프레임 비교법은 3도 초과에서 실패했습니다. 동일한 플러그인을 FR3 실기 및 KUKA LBR iiwa14, Flexiv Rizon 4s, UR5e를 포함한 시뮬레이션에 적용할 수 있는 점이 실무적입니다.
5️⃣ 비행 준비용 LIO: 드론용 상태 추정률을 200Hz로 구현
출처: arXiv:2607.22145 / 마드리드 공과대학 연구팀이 GitHub에 구현한 결과, 벤치마크 정확도에 중점을 둔 LiDAR 기반 융합 정밀도(LIO)를 드론의 폐루프 비행에 맞게 개조한 “Flight-Ready LIO”를 발표했습니다. Livox Mid-360, Pixhawk 4 Mini, Jetson Orin NX를 탑재한 기체에서 추정 출력을 약 10Hz에서 안정적으로 200Hz로 높여 평균 전송 간격 5.00ms, p99 6.95ms를 달성했습니다. 58초 비행에서는 ATE RMSE를 11.7cm에서 5.2cm, 1초 RPE를 4.9cm에서 2.4cm로 개선했습니다. 더불어 인공적으로 만든 1.5초 LiDAR 데이터 결측 상황에서도 전송을 지속하여 약 0.49m의 드리프트 후, 복귀 1 업데이트로 재수렴했습니다.
6️⃣ Mag4D-SLAM:지자기 센서를 활용한 야외 데이터셋
DGIST 연구팀은 arXiv:2607.21986 논문을 통해 지자기 데이터를 LiDAR, 카메라, IMU, GNSS와 동기화한 외부 SLAM 데이터셋 “Mag4D-SLAM”을 공개했습니다. 이 데이터셋은 총 길이 18km를 초과하는 14개의 시퀀스를 포함하며, 낮과 밤, 그리고 전/후방 재주행을 모두 포함합니다. IROS 2026에서 채택이 확정되었으며, 온라인 2차원 원 피팅을 이용한 방향 추정은 1.4km 이상의 경로에서도 오차를 누적시키지 않고 RMSE 약 6~8도를 유지했습니다. 낮과 밤을 넘나드는 장소 인식은 Recall@10이 20.9%로, 무작위 기준 0.08%의 250배를 넘는 성능을 보였으며, GNSS 신호 불통이나 저조도 환경에서 지자기 센서를 보조 센서로 활용하는 기반이 될 수 있습니다.
7️⃣ 쿄조 컵:로컬 5G×물리적 AI로 실시간 영상 선별
출처: 富士通 등 공동 보도자료 富士通, IIJ, NRI, Ghelia, M-TEC 등 7사는三菱電機와 공동으로, KYOJO CUP를 무대(舞台)로 Local 5G와 Physical AI를 사용하는 실시간 영상 전송 실증을 개시했다고 발표했습니다. 22대의 차량에서 차량 내부 영상과 텔레메트리를 획득하여 富士スピード웨이의 3D 공간 데이터를 통합하고, AI가 “가장 보고 싶은 장면”을 즉시 선정합니다. 현지 CPU와 전력 회사 기지의 원격 GPU를 APN으로 연결하는 구성으로, 별도의 스튜디오 없이 저지연 전송을 목표로 합니다. 로봇 제어는 아니지만, 물리 공간의 인식(認識)을 의사 결정에 연결하는 사회 구현(사회実装)의 예시로 주목받고 있습니다.
종합적 고찰
2026년 7월 27일 주제에서 드러난 특징은, 물리적 AI가 대규모 모델 단체로는 작동하지 않고, 접촉 데이터, 기체 표현, 저위 제어, 상태 추정, 통신 기반을 통합 설계하는 단계로 진전했다는 점이었습니다. ViTacWorld는 생성 롤아웃으로 촉각 데이터를 보완하고, Robot-Factored World Models는 URDF 묘사로 기체 의존성을 외부로 내보냈습니다. SOWL-MPC와 Plug, Play, and Comply는 미지의 상대나 접촉 오차에 대해 불확실성과 유연성을 제어 계층에 통합합니다. 반면, Flight-Ready LIO와 Mag4D-SLAM은 실제 기체의 성공 여부가 업데이트 주기, 결손 내성, 환경 비의존 참조 신호에도 영향을 받음을 보여줍니다. KYOJO CUP의 실증은 원격 GPU와 현지 네트워크를 포함한 시스템 전체가 물리적 AI의 가치를 결정한다는 것을 보여주었습니다. 앞으로는 장시간 운전, 이종 기기 이송, 안전 여유, 통신 장애 시의 손실 특성을 공통 지표로 제시할 수 있는지 여부가 중요합니다.
향후 주목할 점
- ViTacWorld의 실제 평가에서는 각 작업마다 10회 시도가 이루어졌기 때문에, 다양한 촉각 센서, 미확인된 물체, 더 많은 시도에서도 80%의 성공률을 재현할 수 있는지 여부가 가장 큰 검증 포인트였습니다.
- 로봇-팩터링된 월드 모델은 미검찰 기체에 적용 효과를 정량적으로 보여주었으며, 다음 단계는 실제 기체 폐루프 제어, 카메라-URDF 교정 비용, 접촉 실패 데이터 포함한 평가가 중요합니다.
- SOWL-MPC의 상위 예측과 Plug, Play, and Comply의 저위 유연 제어를 연결한다면, 미지의 상대와 물리적 접촉 모두에 대응하는 실용적인 스택에 더욱 가까워질 수 있습니다. 다수 대 환경이나 통신 지연 하에서의 안전 여유가 핵심 쟁점입니다.
- 플라이트-레디 LIO는 인공적인 센서 결함으로부터, Mag4D-SLAM은 동일 캠퍼스 내의 낮과 밤 재주행으로부터 얻은 결과입니다. 야외 비행, 장시간 결함, 악천후, 강한 금속 간섭 환경까지 평가를 확장할 수 있을지가 주목됩니다.
- 키조 컵 실증에서는 영상 획득부터 AI 선별, 배포에 이르는 엔드 투 엔드 지연, 장면 선별 정확도, 네트워크 장애 시 지속성을 수치로 제시할 수 있는지가 다른 장소나 공장으로의 확산을 좌우합니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 18청크
원문 보기 | 출처: note.com