무라카미 하루키, 20년 만에 돌아온 소설 『나를 비추는 대로』 출간 기념 북토크
2024년 5월 31일, 무라카미 하루키가 20년 만에 발표하는 장편 소설 『나를 비추는 대로』 출간 기념 북토크가 열렸다.
이날 북토크는 서울광장역에서 진행되었으며, 무라카미 하루키와 카호가 참석했다.
북토크는 무라카미 하루키의 새로운 소설에 대한 기대감과 함께, 그의 작품 세계에 대한 팬들의 열정을 엿볼 수 있는 자리였다.
- 가장 앞선 곳은 이미 걸음을 내딛고 있다.
- Google은 6가지 기술을 하나로 묶었다.
- 전신과 양팔을 동일한 학습 모델로 제어했다.
- 로봇이 작업 진행 상황을 이해한다.
- 협력 상대의 강점과 약점을 파악하는 것
- 다지 조작은 동작에 따라 성공률이 크게 달라진다.
- 본命은 로봇을 위한 Gemini 기반입니다.
- OpenAI와 Google의 전략 차이가 명확하게 드러나고 있습니다.
- 참고 자료
이 기사에서는 Gemini Robotics 2가 무엇인지, 현재 로봇 AI의 최첨단 기술과 비교하며 요약합니다.
인간형 로봇의 전신 제어, 수분간의 자율 작업, 다른 기체로의 기술 전용은 이미 여러 기업과 연구기관에서 실현하고 있습니다. 2026년 7월 30일에 발표된 제미니 로보틱스 2는 이 수준의 기술을 폭넓게 하나로 모았습니다.
구글 딥마인은 전신을 움직이는 VLA, 작업을 관리하는 추론 모델, 기체 내에서 작동하는 소형 VLA를 동시에 발표했습니다. 여러 로봇에 의한 협업, 안전 판단, 개발자용 API도 같은 시스템에 포함됩니다. 여기에는 “구글이 본気を出してきた”라고 말할 수 있는 이유가 있습니다.
VLA는 카메라의 이미지와 언어적 지시를 로봇의 움직임으로 변환하는 AI입니다.
공식 영상: Gemini Robotics 2 개요
Gemini Robotics 2는 Google DeepMind에서 개발한 최첨단 로봇 시스템입니다. 이 로봇은 복잡한 환경에서 스스로 학습하고 적응하며, 인간과 협업하여 다양한 작업을 수행할 수 있도록 설계되었습니다.
Gemini Robotics 2의 핵심 기술은 다음과 같습니다.
* **강화 학습:** 로봇은 시행착오를 통해 스스로 학습하며, 목표 달성을 위한 최적의 전략을 개발합니다.
* **멀티모달 센서:** 로봇은 카메라, 마이크, LiDAR 등 다양한 센서를 통해 주변 환경을 인식합니다.
* **고급 제어 시스템:** 로봇은 정밀한 제어 시스템을 통해 움직임을 수행하고, 복잡한 작업을 수행합니다.
Gemini Robotics 2는 초기 단계의 로봇이지만, 미래 로봇 기술의 가능성을 보여주는 중요한 연구 결과입니다. Google DeepMind는 Gemini Robotics 2를 기반으로 더욱 발전된 로봇 시스템을 개발하고, 다양한 분야에서 활용될 수 있도록 노력할 것입니다.
현재 Gemini Robotics 2는 Google DeepMind의 연구 시설에서 테스트를 진행하고 있으며, 향후 실제 환경에서 다양한 실험을 통해 성능을 개선해 나갈 계획입니다.
영상 출처: Google DeepMind “Gemini Robotics 2는 로봇에 전체 신체 지능을 제공한다”
가장 앞선 곳은 이미 ‘걷는 것’을 넘어선 곳으로 나아가고 있다.
로봇 AI 경쟁은 하이유먼이드가 걷는 능력을 겨루는 단계에서, 걷는 동안에도 작업을 지속할 수 있는 능력을 겨루는 단계로 발전하고 있습니다.
Figure AI의 헬릭스 02는 2026년 1월, Figure 03의 발, 허리, 팔, 손가락을 하나의 시스템으로 제어하며 식기세척기를 4분간 청소했습니다. 머리와 손의 카메라, 손가락의 촉각, 관절 상태를 활용하여 걷는 동안에도 들고 있는 물건이나 자세를 조절합니다.
물리적 지능(Physical Intelligence)은 π0.7로 학습하지 않은 작업을 언어 지시를 통해 조립하고, 다른 기체에서 습득한 세탁물을 말기(folding) 방법을 새로운 양팔 로봇으로 이식했습니다. MEM은 짧은 시간의 영상과 긴 시간의 사건을 분리하여 기억하고, 최대 15분 동안의 작업을 실행합니다.
2026년 6월에 공개된 OpenHLM은 이미지와 언어 기반으로 인간형 로봇의 전신을 움직이는 VLA(Value Learning Agent)입니다. 코드, 학습 데이터, 모델을 공개했으며, 12가지 전신 작업에서 평균 90% 이상의 진도를 보였습니다.
NVIDIA의 GR00T 1.7은 다양한 기체에 추가 학습이 가능한 VLA뿐만 아니라, 실연 데이터 수집, 시뮬레이션, 평가, 기체 배포까지 공개하고 있습니다. Skild AI는 시뮬레이션상의 10만 종류의 몸체로부터 학습하여 본 적이 없는 기체나 관절의 고장 발생에 대응하는 사례를 보여줍니다.
각 사는 기체 사용, 작업, 성공 판정 방식이 다릅니다. 여기서는 각 모델이 보였던 능력의 범위를 비교합니다. Gemini Robotics 2를 평가할 때는 이 기준이 출발점이 됩니다.
Google은 6가지 기술을 하나로 묶었다.
Google의 발표는 로봇의 동작이 아닌, 다음 6가지 요소를 통합적으로 다루는 것을 의미합니다.
이를 담당하는 모델은 Gemini Robotics 2, Gemini Robotics ER 2, Gemini Robotics On-Device 2의 3가지 모델입니다.
Gemini Robotics 2는 이미지와 언어를 로봇의 움직임으로 변환하는 VLA(Vision Language Agent)입니다. ER 2는 주변을 감지하여 작업을 분담하고, VLA나 검색 등의 도구를 호출합니다. On-Device 2는 통신 없이 기체 내에서 작동하는 소형 VLA입니다.
Google는 모델군 전체와 핵심 VLA 양쪽에 ‘Gemini Robotics 2’라는 이름을 사용하고 있습니다. 본고에서는 3개의 모델을 통칭할 때도 ‘Gemini Robotics 2’로 표기합니다.
전신과 양팔을 동일한 학습된 모델로 작동시킵니다.
Gemini Robotics 2는 동일한 학습된 모델(체크포인트)로 3가지 구성 요소를 제어했습니다.
두 종류의 어플로 2는 서로 다른 형태의 다지 핸드를 사용하여 발부터 손가락 끝까지 움직입니다. Franka Duo는 2개의 평행 그리퍼를 사용하여 도구를 분류하고 부품을 삽입합니다.
인간에 가까운 전신을 가진 로봇과 책상 위에 고정된 2본 팔과는 몸의 형태, 센서, 관절 수, 움직일 수 있는 범위가 크게 다릅니다. 같은 VLA가 양쪽을 모두 다루게 되면 한 기체에서 수집한 데이터를 다른 기체에도 활용하기 쉬워집니다.
온디바이스 2는 새로운 양팔 로봇 도입 기간을 단축합니다. 200건 미만의 사례를 활용하여 몇 시간 만에 형태나 센서가 다른 기체에 적응했습니다. 스키ल्ड 브레인은 추가 학습 없이 적응을 보이며, π0.7는 작업 데이터가 없는 기체에 활용될 수 있음을 시사합니다. 구글의 특징은 전신 VLA의 넓이와 실제 기체에 맞추기 쉬운 소형 모델을 동일 제품군에 배치한 것입니다.
로봇이 작업 진행 상황을 이해한다.
Gemini Robotics ER 2는 로봇용으로 조정된 추론 모델입니다. 카메라의 연속 영상을 통해 작업을 작은 단계로 나누고 VLA에 동작을 요청합니다.
특징적인 점은 무엇을 하는지뿐만 아니라, 어느 정도 완료했는지 판단하는 데 있습니다. 작업 중 다음 단계를 고려하고, 성공적인 순간을 포착하며, 실패하면 다시 시도합니다. 작업의 시작과 종료를 명확히 인식합니다.
고급 추론 모델과 저수준 VLA를 구분하는 계층 구조는 Figure, Physical Intelligence, Hi-VLA 연구에도 활용됩니다. 시간으로는 MEM이 제시한 최대 15분 작업이 Google의 몇 분 단위 작업보다 우세합니다.
ER 2에서 새로운 점은 이 추론 부분을 Gemini API에서 활용할 수 있다는 것입니다. 저희의 VLA(비주얼 언어 에이전트) 및 내비게이션 기능을 도구로 등록하여 ER 2에 작업 관리를 위임할 수 있으며, Google Search나 사용자가 정의한 함수를 호출할 수 있습니다.
협력 상대의 강점과 약점을 파악하는
Gemini Robotics ER 2는 여러 로봇이 같은 장소에서 작업할 때, 각 로봇의 능력을 평가하여 역할을 분담합니다. 이동에 능한 기체와 정밀한 조작에 능한 기체를 조합하는 방식입니다.
공식 영상: Gemini Robotics 2를 이용한 다중 로봇 협업
영상 출처: Google DeepMind “Gemini Robotics 2는 로봇에 전체 신체 인지 능력을 제공한다”
여러 대의 협력 로봇에서는 Figure가 2대의 인간형 로봇을 이용한 침대 정리를 먼저 공개했습니다. Figure의 2대는 통신하지 않고, 상대방의 움직임에서 의도를 파악합니다. ROSClaw 또한 서로 다른 로봇에게 작업을 할당하는 연구입니다. 구글은 서로 다른 종류의 로봇이 통신하고 능력을 인식하여 역할을 결정하는 방식을 채택했습니다.
ER 2는 안전성을 매우 높은 수준으로 판단하며, 위험한 지시를 VLA로 전달하지 않고, 대상이 불분명하면 담당자에게 확인하고, 주변에 사람이 접근하면 정지 기능을 호출합니다.
사람이 1미터 이내에 있는지 판단하는 평가에서 ER 2가 93.0%의 정답률을 기록했습니다. 구글의 안전 보고서에서는 미스를 줄이는 만큼 불필요한 정지가 늘어난다는 점도 나타났습니다. 추론 모델에 의한 판단은 충돌 회피, 힘 제어, 기체 정지 장치와 함께 사용됩니다.
다지 조작은 동작에 따라 성공률이 크게 달라진다.
공식 데모만으로 보더라도 Gemini Robotics 2는 사람의 수공예 작업에 상당히 가까운 수준으로 보입니다. 평가값을 분석하면 현재 실력이 구체적으로 파악됩니다.
평행 그립퍼에서는 일반적인 물건 이동이 74.2%, 도구 분류가 78.9%, 정밀한 삽입이 89.6%였습니다. 전신을 사용하여 물건을 집는 평가에서는 테이블上が 68.4%, 바닥이 45.7%, 선반이 76.3%입니다.
Google의 모델 페이지는 인간과 맞먹는 재능과 표현력을 가지고 있습니다. 발표된 본문에서는 인간과 맞먹는 정확도와 속도를 향후 목표로 삼고 있습니다. 현재 시점에서는 전신, 손, 그립퍼를 널리 다룰 수 있도록 발전했으며, 동작별 정확도를 향상시키는 단계에 있습니다.
본격적인 대상은 로봇을 위한 Gemini 기반입니다.
Figure는 Figure 03의 하드웨어와 Helix 02를 함께 정비하고 있습니다. Physical Intelligence는 기체를 가로질러 사용하는 범용 VLA와 기억, 학습 방법을 심화시키고 있습니다. NVIDIA는 개발 환경과 공개 모델로 로봇 기업을 지원하고 있습니다. Skild AI는 모든 기체에 탑재 가능한 하나의 모델을 목표로 하고 있습니다.
Google는 Gemini에 로봇을 위한 추론을 맡기고, 이를 통해 각 회사의 VLA와 기체를 연결하려 하고 있습니다. ER 2는 공개 프리뷰로서 API를 통해 사용 가능하며, VLA와 On-Device 2는 조기 액세스 파트너에게 제공되고 있습니다. Apptronik, Boston Dynamics, Agile Robots 등 다양한 형태의 로봇을 보유한 기업과의 협력도 진행 중입니다.
전신 제어, 장시간 작업, 기체에 대한 적응, 다수 대의 협력은 각각 선행되어야 하는 기술입니다. Gemini Robotics 2는 이를 Gemini의 추론, 안전 제어, API와 통합했습니다.
구글이 본격적으로 나섰다는 의미는 로봇 AI 경쟁을 개별 데모에서 공통 AI 기반으로 확장시켰다는 것입니다.
OpenAI와 Google의 전략 차이가 명확하게 드러나고 있습니다.
저는 GPT-5.6와 Gemini Robotics 2에는 OpenAI와 Google의 전략적 차이가 명확하게 드러나는 것을 생각합니다.
GPT-5.6는 복잡한 문제에 사용하는 계산량을 `max`까지 늘릴 수 있습니다. 또한, 일반적으로보다 많은 처리를 수행하여 하나의 답변을 반환하는 `Pro` 모드도 마련했습니다. 시간과 계산량을 투자하여 복잡한 문제에 대한 단일 답변의 정확성을 높이는 방향입니다.
Gemini 로보틱스 2는 로봇이 주변을 감지하고, 움직이며, 결과를 확인하고 다음 동작을 선택하는 사이클을 중시합니다. Gemini 로보틱스 ER 2는 수분 동안의 작업 중에도 수백 번의 판단을 수행합니다. On-Device 2는 통신 대기 시간을 피하기 위해 로봇 본체에서 작동합니다.
이러한 차이를 보면, GPT-5.6은 장기적인 사고와 난해한 문제 해결에 초점을 맞추고, Gemini Robotics 2는 현실 변화에 맞춰 짧은 판단을 반복하는 방향으로 초점을 맞추는 것으로 보입니다. Gemini Robotics 2에서는 장기적인 모델의 정확성을 겨루는 것보다 추론을 짧은 행동 주기로 연결하는 것이 중요하게 여겨집니다. 이 모델의 차이점을 통해 OpenAI와 Google의 전략적 차이가 더욱 뚜렷하게 드러나는 것으로 보입니다.
Gemini Robotics 2의 중요성은 로봇이 기교를 발전시켰다는 점뿐만 아니라, AI의 평가 기준을 “깊이 추론하는 능력”에서 “현실적인 환경에서 얼마나 빠르게 추론을 지속할 수 있는가”로 확장한 점에 있습니다.
참고 자료
- Google DeepMind, “Gemini 로보틱스 2는 로봇에 전신 지능을 구현한다,” 2026년 7월 30일. https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
- 구글 딥마인드, “제미니 로보틱스 2”, 2026년 7월 30일.
- Google DeepMind, “제미니 로보틱스 ER 2 - 모델 카드,” 2026년 7월 30일. https://deepmind.google/models/model-cards/gemini-robotics-er-2/
- Google DeepMind, “Gemini Robotics On-Device 2 - 모델 카드,” 2026년 7월 30일. https://deepmind.google/models/model-cards/gemini-robotics-on-device-2/
- Google DeepMind, “제미니 로보틱스 2: 안전 평가”, 2026년 7월 30일. https://storage.googleapis.com/deepmind-media/gemini-robotics/Gemini-Robotics-2-Safety.pdf
- Figure AI, “헬릭스 02: 완전 신체 자율성 공개,” 2026년 1월 27일.
- Figure AI, “헬릭스-02 침실 정리,” 2026년 5월 8일. https://www.figure.ai/news/helix-02-bedroom-tidy
- NVIDIA, “NVIDIA Isaac GR00T를 사용하여 인간형 로봇 정책을 종단 간으로 개발” 발표, 2026년 7월 7일. https://developer.nvidia.com/blog/develop-humanoid-robot-policies-end-to-end-with-nvidia-isaac-gr00t/
- 물리 지능, “π0.7: 가변 가능한 능력 기반 모델,” 2026년 4월 16일. https://www.pi.website/blog/pi07
- 물리 지능, “장기 및 단기 기억을 가진 Very Large Arrays”, 2026년 3월 3일. https://www.pi.website/research/memory
- 스킬드 AI, “옴니 바디 로봇 뇌를 위한 주장” (2025년 9월 24일). https://www.skild.ai/blogs/omni-bodied
- 잉딩 후이 등 연구진, “OpenHLM: 전체 신체를 위한 로고-매니퓰레이션에 대한 경험적 레시피” 논문, arXiv:2606.22174, 2026년 6월 20일. https://arxiv.org/abs/2606.22174
- 자이heng 후 외 다수, “로봇 정책 조율에서 중요한 요소: 계층적 VLA 에이전트의 체계적 연구,” arXiv:2606.10267, 2026년 6월 9일. https://arxiv.org/abs/2606.10267
- 장 쯔하이 외, “ROSClaw: 다양한 에이전트의 이질적 협업을 위한 계층적 의미-물리적 프레임워크”, arXiv:2604.04664, 2026년 4월 6일.
- OpenAI, “GPT-5.6 활용 방법.” https://developers.openai.com/api/docs/guides/latest-model?model=gpt-5.6
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 50청크
원문 보기 | 출처: note.com