# 구글 딥마인드, 로봇용 AI 모델군 “제미니 로보틱스 2” 발표, 인간형 로봇의 전신 제어 및 다중 로봇 협동 지원

> https://bookfactory.kr/c/news/8818
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-04T05:11:27.447Z

---

구글 딥마인드는 현지 시간 2026년 7월 30일, 로봇용 AI 모델 군 “제미니 로보틱스 2”를 발표했다. 시각과 언어에 의한 지시로부터 로봇의 동작을 생성하는 모델, 다단계의 작업을 계획하는 신체성 추론 모델, 로봇에서 동작하는 경량 모델의 3 종류로 구성된다.

기존 모델이 주로 인체형의 상반신이나 탁상 작업, 즉 엎드려 앉아 작업하는 것을 제어해 왔던 것에 반해, 제미니 로보틱스 2는 걷기나 굽혔다 펴는 동작을 포함하는 전신 제어에 대응한다. 손가락과 그립퍼를 사용한 정밀한 조작에 더하여, 서로 다른 종류의 로봇이 같은 공간에서 협력하는 기능도 갖춘다.

## 3 모델로 로봇의 추론과 동작을 지원

제미니 로보틱스 2는 역할의 다른 3개의 모델로 구성된다.

핵심이 되는 “제미니 로보틱스 2”는 시각과 언어의 입력을 모터 제어로 변환하는 VLA(Vision-Language-Action) 모델이다. 탁상형 로봇부터 인체형까지, 다양한 형태의 기체를 제어할 수 있다.

인체형에서는, 발목부터 손가락까지 전신을 제어하고, 걷고, 쪼그리고 앉아, 물건을 들어 올리고, 선반에 보관하는 등 일련의 동작을 실행한다. 구글 딥마인드는 Apptronik의 인체형 “아폴로 2”가 젓가락을 들고 선반까지 걸어 가서 지정된 상자에 넣는 시연을 공개했다.

5개의 손가락으로 22개의 자유도를 가진 로봇 핸드를 사용하여 전구를 돌리고, 가방 입구를 묶고, 지퍼가 달린 가방을 닫는 등 조작에도 활용할 수 있다. 2개의 손가락으로 된 그립퍼에서는, 부품의 포장이나 좁은 곳에 삽입하는 등에도 대응한다.

한편, 구글 딥마인드는 다지 손으로 하는 조작에 대해서는 여전히 어려운 과제가 남아 있다는 점을 지적한다. 평가에서, 전구를 떼어내는 작업의 성공률이 92%였던 것에 반해, 전구를 끼워 넣는 작업은 36%, 가방을 묶는 작업은 44%에 그쳤다.

## 작업의 진행 상황을 영상에서 판단, 실패 시에는 수정

“제미니 로보틱스 ER 2”는 로봇의 “고수준의 두뇌”로서 기능하는 신체성 추론 모델이다. 인간의 지시나 주변 상황을 이해하고, 수분 내에 걸친 작업을 여러 단계로 분해하여 계획한다.

로봇으로부터 보내는 영상을 지속적으로 확인하고, 작업이 얼마나 진행되었는지, 실패가 발생했는지, 다음 단계로 넘어갈지 판단한다. 작업에 실패한 경우에는, 그 단계를 다시 하고 등과 같은 수정도 가능하다.

구글 딥마인드의 평가에서, 영상 내의 작업 진행 상황을 5단계에 분류하는 테스트에서 57.4%의 정확도를 기록했다. 작업의 시작이나 완료 등, 중요한 순간을 영상에서 특정하는 테스트에서는 91.3%의 정확도를 달성했으며, 정답 지점과의 평균적인 차이는 0.96초였다.

이 모델은 로봇의 저수준 동작을 담당하는 VLA 모델이나 내비게이션 API 등을 도구로 호출할 수 있다. 구글 검색이나 개발자가 준비한 함수도 이용할 수 있으며, 로봇이 동작을 계속하면서 다음 절차를 추론한다.

또한, 서로 다른 종류의 로봇이 정보를 공유하고, 작업을 분담하는 기능도 도입했다. 공개된 시연에서는, 인체형의 아폴로 2와 2개의 로봇 팔을 갖춘 Franka Duo가 협력하여 어질러진 방을 정리하고 있었다.

“제미니 로보틱스 온 디바이스 2”는 로봇 본체에서 로컬 실행하도록 최적화된 VLA 모델이다. 인터넷 연결이 없는 장소나, 통신 지연을 피해야 하는 환경에서의 이용을 염두에 둔다.

다양한 형태와 센서, 자유도를 가진 새로운 양팔 로봇에도 수 시간 분량의 데이터를 활용하여, 일반적으로 200건 미만의 데이터로도 적응할 수 있다고 한다. 클라우드 상의 모델을 이용하지 않고, 로봇 자체에서 추론과 동작 생성을 처리할 수 있다.

“Gemini Robotics ER 2”는 개발자를 대상으로 공개된다.

3가지 모델 중 “Gemini Robotics ER 2”는 Gemini API와 Google AI Studio에서 대중 미리보기 형태로 제공을 시작했다. 표준 모델인 “gemini-robotics-er-2-preview” 외에도 실시간으로 영상과 음성을 처리하는 “gemini-robotics-er-2-streaming-preview”를 사용할 수 있다.

Gemini Enterprise Agent Platform에서는 사적 미리보기 형태로 제공된다. 반면, 로봇의 동작을 직접 생성하는 Gemini Robotics 2와 Gemini Robotics On-Device 2는 조기 액세스 파트너 대상 제공이 된다.

Google DeepMind는 안전성에 대해, 인간이 로봇에게 가까이 다가왔는지 감지하고, 안전 도구를 호출하여 정지시키는 기능을 평가하고 있다고 한다. 다만, 모델 카드에서는 의료나 교통 등 오작동으로 인해 사망, 부상, 재산 피해가 발생할 수 있는 안전 상 중요한 용도에는 사용하지 않도록 요청하고 있다.

[원문 보기](https://ledge.ai/articles/google_deepmind_gemini_robotics_2) | 출처: Ledge.ai