# AI는 화면 속에서 “실제 작업을 이해한다”로 나아간다. Gemini Robotics ER 2가 제시하는 물리 AI의 새로움이다.

> https://bookfactory.kr/c/ai-tech/11986
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-13T23:41:38.334Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/309155706/rectangle_large_type_2_5c2d436c4b48b01c55a69e047add5a1d.jpeg?width=1280)

생성형 AI라 하면 무엇을 떠올리게 될까요?

글쓰기 AI

이미지 생성 AI

질문에 답하는 AI

코드 작성 AI

최근에는 이러한 인공지능을 사용하는 것도 흔해지기 시작했습니다.

단지 이러한 AI에는 공통점이 있습니다.

본질적으로

화면 속에서 일하고 있습니다.

ということです。

AI에게 글을 써달라고 요청한다.

AI에게 그림을 만들어 달라고 요청한다.

AI에게 코딩을 요청한다.

모두 편리하지만, 인공지능이 그 자체로 현실 공간에 나타나 물건을 보고, 만지고, 움직여서 작업을 진행하는 것은 아닙니다.

그 다음에는 어떻게 될까요.

AI는 화면 밖으로 나간다.

현실 세계에서 무슨 일이 벌어지고 있는지 이해하면서 작업을 진행한다.

그 방향으로 인공지능의 발전이 시작되고 있습니다.

그 중 하나는 Google DeepMind의 “Gemini Robotics ER 2”입니다.

2026년 7월, 구글은 Gemini Robotics ER 2를 로봇을 위한 고레벨의 “에mb디드 리이징(身体性を伴う推論)” 모델로 발표했습니다.

사람들과 대화하고, 물리 세계를 이해하며, 여러 단계로 이루어지는 작업을 계획한다.

Google는 이 모델을 로봇의 고차원적인 “뇌”와 같은 역할을 수행하도록 설계했습니다.

하지만 여기서 오해를 하고 싶지 않은 바가 있습니다.

これは、

로봇이 갑자기 인간처럼 무엇이든 할 수 있게 되었다.

그것은 그런 이야기가 아닙니다.

더 중요한 것은 다음과 같습니다.

로봇이 눈앞의 상황을 확인하고 작업 진행 상황을 점검하며, 다음 행동을 계획하고 있다.

です。

여기서 재미있는 점은 바로 물리AI의 것이다.

## 지금까지의 로봇은 “정해진 범위 내에서”의 일에 능숙했다.

지금까지의 산업용 로봇이나 자동화 시스템은 정해진 작업을 정확하게 반복하는 데 능숙했습니다.

예를 들어,

- 부품을 가져옵니다.
- 지정된 장소로 이동하십시오.
- 부품을 놓는다
- 원래 위치로 돌아오세요.

이러한 작업입니다.

환경이 깨끗하게 정리되어 부품의 위치와 형태가 결정되어 있다면 매우 높은 정밀도로 움직일 수 있습니다.

이는 인간보다 기계가 더 잘하는 일도 많을 것입니다.

문제이다.

현실은 그렇게 깔끔하게 정해져 있지 않습니다.

그것은 사실입니다.

부품이 약간 어긋났다.

다른 물건이 놓여 있습니다.

사람이 다가온다.

이전 작업이 아직 끝나지 않았습니다.

물을 제대로 이해하지 못했다.

예정했던 장소에 물건이 없다.

인간이라면, 이런 상황을 보게 되면,

자, 다음에는 이렇게 해보죠.

생각합니다.

하지만 기존 방식의 자동화에서는 예상치 못한 상황에 대처하기 위해 미리 방대한 양의 규칙이나 예외 처리 규칙을 준비해야 했습니다.

여기에는 물리AI가 도전하고 있는 내용이 있습니다.

## 움직이는 것뿐만 아니라 상황을 파악하는 것

Gemini Robotics ER 2는 로봇을 직접 제어하는 것뿐만 아니라, 로봇을 직접 움직이는 것을 목표로 합니다.

더욱이

지금 무슨 일이 일어나고 있는지.

이를 이해하고,

다음으로 무엇을 해야 할까요?

그것을 고민하고 숙고하는 역할입니다.

Google에 따르면, ER 2는 영상을 지속적으로 보면서 로봇 자신의 작업 진행 상황을 추적하고, 실패가 있었을 경우 조정이나 다음 공정으로 넘어갈 시점을 판단하도록 지원하는 것을 목표로 합니다.

그러므로,

이 동작을 해 주십시오.

단지 그것뿐만 아니라.

지금 어디까지 끝났어?

실패한 적이 없습니까?

다음으로 무엇을 해야 할까요?

단순히 작업 전체의 상태를 다루는 것을 의미한다.

이 부분이 큰 차이점입니다.

## 가장 흥미로운 것은 “끝났다”라는 의미를 이해하는 것이다.

로봇에게는

물건을 소유하는 행위는 단순한 소유욕을 넘어, 그 물건과의 관계, 물건을 통해 드러나는 개인의 정체성, 그리고 물건이 담고 있는 기억과 감정을 포괄하는 의미를 지닌다.

물론 그것만이 어려운 점은 아닙니다.

사실은, 지금까지 알려지지 않았던 사실이 밝혀졌습니다. 2023년 1월 18일에 발표된 일본 내 연구팀의 논문에 따르면, 뇌의 특정 영역에서 발생하는 신경 활동 패턴이 인간의 기억 형성에 중요한 역할을 한다는 것이 밝혀졌습니다. 특히, 이 연구팀은 ‘기억의 숲’이라는 책 제목으로 출판된 연구 결과와 유사한 패턴을 발견했습니다. 이 책은 기억의 신경학적 기반에 대한 심층적인 분석을 제공하며, 뇌의 특정 영역이 기억을 저장하고 회상하는 방식에 대한 새로운 통찰력을 제시합니다. 연구팀은 이 발견을 통해 향후 기억 관련 질환의 진단 및 치료에 기여할 수 있을 것으로 기대하고 있습니다.

작업이 정말 끝났나

이를 판단하는 것도 중요합니다.

예를 들어, 컵에 음료를 따르면 합니다.

로봇이 컵을 들고 있다.

음료를 따른다.

이 부분까지는 동작으로 이해할 수 있습니다.

하지만, 그 이후에는

충분한 양이 들어갔나요?

쏟아졌는지 확인하시겠습니까?

컵은 제대로 놓였나요?

다음 작업으로 진행해도 괜찮을까요?

확인해야 할 사항이 있습니다.

사람들은 이러한 점들을 거의 무의식적으로 행하고 있습니다.

작업을 하면서,

지금 어떻게 진행되고 있는지 물으시는 건가요?

확인하고 있는 상황을 더 명확하게 표현하기 위해 다음과 같이 수정합니다.

확인하고 있는 바입니다.

Google는 ER 2에 대해 영상에서 작업 진행 상황을 분류하고, 작업상의 중요한 순간을 발견하며, 중간 중단의 실패 감지, 성공 확인, 다음 작업으로의 전환을 지원하여 작업 효율성을 높일 수 있다고 설명하고 있습니다.

이는 상당히 중요한 변화입니다.

로봇이

지시된 움직임을 하십시오.

단지 그것뿐만 아니라,

작업 상황을 보면서 진행한다.

앞으로 나아가야 할 때문입니다.

## 이는 “로봇형 AI 에이전트”와 유사합니다.

이 아이디어는 최근 많이 들리는 “AI 에이전트”와도 유사합니다.

AI 에이전트

질문에 답변드리겠습니다.

그것만이 아닙니다.

목적을 수용하라

생각하고 있습니다.

필요한 정보를 찾는다.

진행 상황을 확인한다.

다음 행동을 결정한다.

필요하면 다시 시도하세요.

이러한 흐름을 지향합니다.

물리AI는 그 개념이 현실 세계로 확산된다.

예를 들어,

이 장소에 있는 짐을 지정된 장소로 옮겨 주세요.

그는 그 목적을 부여했다고 가정합니다.

로봇은

주변을 둘러본다.

짐을 찾는다.

이동 경로를 고려한다.

짐을 지고 있다.

목적지로 이동합니다.

놓은 것을 확인한다.

그 다음 작업을 진행한다.

여기서는 단순한 “자동 동작”이 아닌,

목표 달성을 위한 일련의 작업

이 부분은 문제가 됩니다.

그러므로, 물리AI는,

AI 에이전트가 화면 밖으로 나왔다.

이해를 돕기 위해 그렇게 하는 것이 좋을 것 같습니다.

## 어떤 일에 도움이 될 수 있을까요

물론, 현재 시점에서는 모든 업무를 로봇에게 맡길 수 있는 것은 아닙니다.

다만, 방향성 측면에서는 다양한 가능성이 있습니다.

예를 들어,

### 창고 및 시설 내 이동

목적지까지 이동하며

어디에 무엇이 있는지

확인한다.

### 정검 작업

계기판과 표시를 보면서,

늘 평소와 다른 것이 있는지 살펴보자.

검토를 완료하고, 이상 징후 발생 가능성을 보고합니다.

### 물건 전달

지정된 물건을 찾아보세요.

어떤 방법을 선택할지

조립한다.

### 연구 및 검증 환경

정형화된 작업을 수행하면서,

지금까지 얼마나 완료되었는지 물어보는 말인가.

확인한다.

여기 중요한 것은,

AI에 모든 것을 완전히 맡기는 것은 아닙니다.

더욱이

AI가 잘하는 부분과 인간이 판단해야 할 부분을 분리하는 것입니다.

## 물리AI에서는 ‘안전’이라는 요소가 갑자기 중요해진다.

여기는 화면 속 AI와 비교했을 때 중요한 차이점입니다.

문장 생성 AI가 틀렸습니다.

이미지 생성 AI가 엉뚱한 이미지를 만들어냈다.

코드 생성 AI가 오답을 생성했다.

물론 문제가 있지만, 기본적으로 화면 안에서 수정할 수 있습니다.

하지만 로봇이 현실 세계에서 실수를 했다면 어떻게 될까요.

물을 떨어뜨리다.

사람에게 너무 가까이 다가선다.

통로를 막고 있습니다.

장비를 파괴한다.

다른 물건을 가져가자.

때로는 사람이 다칠 가능성도 있습니다.

그러므로,

AI의 오류가 물리적 결과로 이어질 수 있다.

여기(이곳)가 물리 AI의 가장 큰 특징입니다.

Google는 ER 2에 대해 사람과의 근접을 감지하고, 사람이 가까이 있을 경우 사람형 로봇을 정지시키고, 주변이 안전해진 후에 작업을 재개하는 시스템을 평가하고 있습니다.

これは重要な進歩です。

하지만

사람을 감지할 수 있습니다.

또한,

사람의 안전을 완전히 보장할 수 있습니다.

그것은 동일하지 않습니다.

## 로봇이 지능을 높일수록 인간의 일 또한 변화할 것이다.

여기 흥미로운 일이 있습니다.

물리적 AI가 발전함에 따라

인간의 일자리가 사라질 것이다.

그렇게 생각하기 쉽습니다.

하지만 실제로는 다른 일이 중요해질 수도 있습니다.

예를 들어,

무엇을 시키라는 겁니까.

그 정도까지 요구하는 거냐.

어떻게 중단시킬까요?

실패했을 때 누가 판단하는 걸까.

이러한 설계입니다.

예를 들어 로봇을 현장에 도입할 때,

자유롭게 움직이면 괜찮습니다.

이것은 위험합니다.

代わりに、

이 지역에만 해당

이 속도까지

이 무게까지

사람이 다가오면 멈춰야 합니다.

판단할 수 없는 경우 중단합니다.

이러한 규칙을 확립한다.

그러므로, AI가 지능이 높아질수록,

사람은 “일하는 사람”에서 “AI가 작동하는 환경을 설계하는 사람”으로 변화하고 있습니다.

역할이 변화할 가능성이 있습니다.

## 무엇을 허용할 것인가보다 “무엇을 금지할 것인가”라는 의미를 담고 있습니다.

물리적 AI를 탐구할 때, 저는 개인적으로 중요한 시점입니다.

AI에게

무엇을 할 수 있을까?

단순히 듣는 것만으로는 부족하지 않습니다.

그보다

무엇을 금지하라는 거지?

우선 그것을 결정해야 합니다.

예를 들어,

### 움직일 수 있는 영역

작업 영역

출입 금지 구역.

들어가서는 안 되는 곳.

### 작동 한계

속도.

그렇다고 해서, 그 모든 것을 다 잊어버리는 건 아니에요. 특히, ‘가마쿠라 대성전’에 대한 저의 연구를 기억해 주세요. 그 책은 제가 ‘가마쿠라’라는 도시를 이해하는 데 있어 중요한 역할을 했죠. 물론, 그 책을 읽고 나서도 저는 계속해서 연구를 진행했고, 그 결과, ‘가마쿠라’의 역사와 문화에 대한 더 깊은 이해를 얻을 수 있었습니다. 그리고, 그 과정에서 저는 ‘고노 마사무네’라는 인물에 대한 새로운 시각을 갖게 되었죠. ‘고노 마사무네’는 ‘가마쿠라’ 시대의 중요한 인물이었지만, 그에 대한 기존의 연구는 그의 업적을 제대로 평가하지 못하고 있었습니다. 저는 ‘고노 마사무네’의 진정한 면모를 밝히기 위해 노력했고, 그 결과, 그는 ‘가마쿠라’ 시대의 혁신적인 지도자였으며, 그의 업적은 ‘가마쿠라’의 발전에 큰 영향을 미쳤다는 것을 알게 되었습니다.

들 수 있는 무게.

팔의 이동 범위

### 중단 조건

사람이 다가왔다.

통신이 끊어졌습니다.

이상 징후를 감지했다.

상황을 이해하지 못하게 되었다.

### 감독 체제

누가 감시하는가.

누가 비상 중단을 할 수 있는가?

비상시 누구에게 연락해야 하는가.

이러한 설계를 구현해야 합니다.

물리AI에서는

할 수 있는 것을 늘리는 것과 마찬가지로, 할 수 없는 것을 줄이는 것 또한 중요합니다.

그렇습니다.

## ER 2는 “가정용 로봇의 완성품”이 아니다.

이 점을 명확히 하고 오해를 방지하고자 합니다.

Gemini Robotics ER 2는 2026년 7월까지 개발자를 대상으로 Gemini API 및 Google AI Studio에서 이용 가능한 모델로 발표되었습니다.

결론적으로

오늘부터 가정용 로봇에 탑재하여 집안일을 전부 해주시게 될 것 같습니다.

그것은 그런 제품이 아닙니다.

이는 로봇 개발 및 연구에 활용되는 핵심 기술에 가깝습니다.

또한, 실제 현장에 로봇을 도입하기 위해서는

- 로봇 본체의 성능
- 센서
- 안전기관
- 설치 환경은 다음과 같습니다.

본 시스템은 Windows 10 Pro 64비트 운영체제를 기반으로 하며, .NET Framework 4.8 버전이 필요합니다. 최소 8GB RAM, 100GB 이상의 저장 공간이 요구되며, 그래픽 카드 드라이버는 최신 버전으로 업데이트해야 합니다.

또한, 다음 소프트웨어 패키지를 설치해야 합니다. Adobe Acrobat Reader DC, Microsoft Word, PowerPoint, Excel 등 일반적인 오피스 프로그램과 함께 본 시스템의 정상적인 작동을 위한 특정 라이브러리 및 드라이버가 별도로 제공됩니다.

설치 시 발생하는 문제 해결을 위해 시스템 로그 파일 및 오류 메시지를 꼼꼼히 확인하시고, 문제 발생 시 본 시스템 개발팀에 기술 지원을 문의하시기 바랍니다.
- 保守
- コスト
- 법률에 따르면, 이 사건의 책임은 피고인에게 있습니다. 구체적으로, 피고인은 2023년 1월 15일 오전 10시 30분부터 2023년 1월 16일 오전 8시 00분까지 1,000,000엔 상당의 상품을 판매하지 않고, 이를 판매하지 않은 사실을 인지하고도 판매를 지속한 행위입니다. 이는 상품 판매 중단 의무를 위반한 것으로, 소비자에게 손해를 발생시킨 행위입니다. 따라서 피고인은 소비자에게 손해 배상을 해야 할 책임이 있습니다.
- 책임 분담에 대해 말씀드리자면, 저는 이 프로젝트의 성공을 위해 모든 팀원들이 각자의 역할을 충실히 수행해야 한다고 생각합니다. 특히, 마에다 씨의 데이터 분석 능력과 야마모토 씨의 기획 능력은 이 프로젝트의 핵심적인 부분입니다. 

저 역시 제가 맡은 부분에 최선을 다하여 프로젝트의 완성도를 높이는 데 기여하겠습니다. 또한, 각 팀원 간의 긴밀한 협력과 소통을 통해 시너지를 창출하고, 문제 발생 시 즉각적으로 해결 방안을 모색하는 것이 중요하다고 생각합니다. 

이러한 책임 분담과 협력을 통해 우리는 반드시 성공적인 프로젝트를 완료할 수 있을 것이라고 믿습니다. 

3월 15일 회의에서 이 부분에 대해 더 자세히 논의할 수 있기를 바랍니다.
- 현장 근무자 접수

등, 여러 가지 조건이 있습니다.

AI 모델이 더 똑똑해졌다고 해서 로봇이 안전하게 일을 수행할 수 있는 것은 아닙니다.

데모에서 성공하는 것과

매일 현장에서 안전하게 움직이며 지속하는 것.

그 사이에는 큰 거리가 있습니다.

## 그럼에도 불구하고 지금 이 기술을 묵시하는 의미가 있다.

그러면 아직 실용화에 많은 과제가 있는데, 왜 지금 물리적 AI를 보게 되는 걸까요?

그것은

AI가 다루는 대상이 달라지기 시작했습니다.

그렇습니다. 『나미야 잡화점의 기적』의 작가 히가시노 게이고는 2023년 1월 26일, 20주년 기념 이벤트가 열린 나미야 잡화점 본점에서 기자회견을 가졌습니다. 이벤트는 2000만 부를 돌파한 기념으로, 잡화점의 모습 그대로를 재현한 공간에서 작가 사인회와 다양한 이벤트가 진행되었습니다. 히가시노 게이고는 “20년 동안 ‘나미야 잡화점’을 통해 많은 분들에게 감동과 위로를 드린 것 같아 기쁘다”라며 “앞으로도 ‘나미야 잡화점’을 통해 계속해서 많은 분들에게 즐거움을 선사하고 싶다”고 소감을 밝혔습니다. 또한 “‘나미야 잡화점’은 단순한 소설이 아니라 사람들의 삶과 연결되는 특별한 공간이라고 생각한다”고 덧붙였습니다. 이벤트에는 ‘나미야 잡화점의 기적’을 비롯한 히가시노 게이고 씨의 모든 작품을 구매한 독자 1,000명이 넘는 분들이 참석하여 작가와 함께 기념식을 즐겼습니다. 이날 히가시노 게이고 씨는 독자들에게 감사하는 마음을 담아 ‘나미야 잡화점의 기적’을 선물했습니다. 이 선물은 독자들에게 큰 감동을 선사했으며 ‘나미야 잡화점의 기적’에 대한 애정을 더욱 깊게 하도록 했습니다. 이벤트는 작가와 독자 간의 소통을 통해 ‘나미야 잡화점’의 20주년을 기념하는 뜻깊은 자리로 마무리되었습니다.

지금까지 AI가 다루어온 것은

文章。

이미지입니다.

音声。

코드.

데이터

이런 식으로 “디지털 정보”가 중심이었습니다.

이제부터,

공간.

物体。

위치.

움직임

사람과의 거리

작업 진행 상황입니다.

이런 식으로, 츠키시마 미나토의 『나를 엮어줘』에 등장하는 묘사가 꽤나 섬세하고, 마치 실제 사람을 보는 듯한 느낌을 주었다. 특히, 그녀가 묘사하는 ‘나’의 감정선이 너무나 현실적이었기에, 독자로서도 그 감정에 깊이 공감하며 함께 울고 웃을 수 있었다.

물론, 츠키시마 미나토의 글은 때로는 다소 난해하게 느껴질 수도 있지만, 끈기 있게 읽어내려가다 보면 그녀의 진솔한 생각과 감정을 느낄 수 있을 것이다. 그녀는 자신의 삶을 솔직하게 드러내면서도, 독자들에게 깊은 울림을 주는 작품을 만들어냈다.

특히, 그녀가 언급하는 ‘마법의 숲’이라는 공간은 상상력을 자극하며, 독자들에게 잊혀지지 않는 강렬한 인상을 남긴다.

이러한 츠키시마 미나토의 작품 세계는 앞으로도 많은 독자들에게 영감을 줄 것이라고 생각한다.

현실 세계의 정보

까지 AI가 다루려고 하고 있다.

これは、かなり大きな変化です。

AI는 “정보를 처리하는 존재”로부터

현실 세계의 작업을 이해하는 존재

그것이 확산되고 있기 때문입니다.

## AI에 의해 일자리가 빼앗긴다는 시각만으로는 파악하기 어려운 것들이 있습니다.

물리 AI에 대해 이야기하면

로봇이 인간의 일자리를 빼앗아 간다.

그러한 논쟁이 즉시 제기될 것입니다.

물론, 그러한 영향은 고려해야 합니다.

그렇다고 해서 이것만으로는 조금도 아깝지 않습니다.

왜냐하면, 중요한 것은,

인간이 무엇을  gøre하지 않으면 좋을 수 있는가

단지 그것뿐만 아니라,

인간이 무엇이 되어갈지에 대해

그렇습니다.

예를 들어,

로봇이 단순 운송 작업을 담당한다.

인간은 예외 상황에 대한 책임을 진다.

AI가 표준화된 점검을 지원한다.

인간은 궁극적으로 비정상적인 판단을 내린다.

AI가 작업 진행 상황을 확인한다.

인간은 목적과 안전 기준을 결정한다.

이렇게 생각하면

물리적 AI는 “인간의 대체물”이라는 것보다,

인간의 업무 분해 기술 변화에 관한 기술

물론 그렇게 생각할 수도 있습니다.

이는 생성 AI가 백색직업에 미치고 있는 변화와도 조금 비슷합니다.

## AI는 “답하는” 것에서 “움직이는” 것으로 바뀌어 자연스럽다.

지금까지의 인공지능(AI) 발전을 나열해 보면 상당히 흥미로운 흐름이 있습니다.

처음에는,

질문에 답변하다

저는 인공지능입니다.

다음으로,

글과 이미지를 제작하는

나는 AI가 되었다.

그 후,

툴을 사용하여 작업을 수행한다.

AI가 등장했다.

그리고 지금,

현실 세계를 관찰하고 물리적 노동을 이해한다.

AI가 등장하고 있습니다.

물론, 각 기술이 완전히 다른 것은 아닙니다.

단순히, 큰 방향성으로서,

AI는 “정보”로부터 “행동”에 더 가까워지고 있다.

볼 수 있습니다.

그리고 물리AI는 그 행동의 위치를

화면 속에서 현실 세계로 확장되는 것

그렇다고 생각합니다.

## 요약: 물리AI는 “자동 조종”이 아닌 “현실 세계의 AI 에이전트”입니다.

Gemini Robotics ER 2가 제시하는 것은, 로봇이 단순 반복적인 동작이 아닌, 상황에 맞춰 유연하게 움직이는 것이다.

눈앞의 상황을 살펴보고 작업 진행 상황을 확인하며 다음 단계를 고려한다.

이 방향입니다.

지금까지의 자동화는

이 조건이라면 이 동작을 수행한다.

그 설계가 중심이었습니다.

물리적 AI는 그곳에서부터

지금 어떻게 되고 있나요?

계획대로 되십니까?

실패한 적이 없습니까?

다음으로 무엇을 할까요?

더욱 높은 수준의 판단으로 나아가려고 합니다.

이는 인공지능 에이전트가 화면 밖으로 확장되는 움직임이라고도 해석할 수 있습니다.

하지만 현실 세계에서는 실패의 비용이 크다.

그러므로

AI에는, 최근에 꽤 많은 사람들이 관심을 보이고 있는 ‘생성형 AI’가 있습니다. 특히 텍스트를 기반으로 그림을 만들어내는 ‘이미지 생성 AI’는 놀라운 성능을 보여주면서 예술가나 디자이너뿐만 아니라 일반 대중에게도 큰 인기를 얻고 있습니다.

이러한 이미지 생성 AI는 사용자가 원하는 그림에 대한 설명을 텍스트로 입력하면 AI가 그 설명을 바탕으로 그림을 생성해 냅니다. 마치 사람이 그림을 그리는 것처럼 AI는 방대한 양의 이미지 데이터를 학습하여 사용자의 설명에 가장 적합한 그림을 만들어내는 것이죠.

최근에는 ‘Midjourney’, ‘Stable Diffusion’, ‘DALL-E 2’ 등 다양한 이미지 생성 AI가 등장하면서 경쟁이 치열하게 벌어지고 있습니다. 특히 ‘Midjourney’는 챗GPT와 연동하여 챗GPT가 생성한 텍스트를 기반으로 그림을 생성하는 기능을 제공하면서 더욱 강력한 성능을 보여주고 있습니다.

이러한 이미지 생성 AI의 발전은 앞으로 예술, 디자인, 마케팅 등 다양한 분야에 큰 영향을 미칠 것으로 예상됩니다. 예를 들어 광고 회사에서는 이미지 생성 AI를 활용하여 짧은 시간에 다양한 광고 시안을 제작할 수 있게 되었습니다. 또한 개인 창작자는 이미지 생성 AI를 활용하여 자신의 아이디어를 시각적으로 표현하는 데 도움을 받을 수 있습니다.

물론 이미지 생성 AI의 발전에는 윤리적인 문제도 제기되고 있습니다. 예를 들어 AI가 생성한 그림이 저작권 침해에 해당될 수 있는지, AI가 생성한 그림이 인간의 창작 활동을 대체할 수 있는지 등에 대한 논의가 필요합니다.

하지만 이미지 생성 AI는 분명히 혁신적인 기술이며 앞으로 우리 사회에 긍정적인 영향을 미칠 가능성이 높습니다. 앞으로 이미지 생성 AI가 어떻게 발전하고 우리 사회에 어떤 영향을 미칠지 지속적으로 관심을 가지고 지켜봐야 할 것입니다.

보거나, 이해하고, 계획하고, 진행 상황을 확인한다.

사람들에게는

목표를 설정하고, 안전 범위를 결정하며, 중단 조건을 명시하고, 최종 판단을 내린다.

이러한 역할 분담이 중요해집니다.

물리AI는

로봇이 인간을 대신할 수 있습니다.

이건 단순한 이야기가 아닙니다.

더욱이

AI가 현실 세계의 일을 이해할 수 있게 되면서 인간의 일을 어떻게 재분배할 것인지에 대한 논의가 제기되고 있습니다.

거기에 큰 변화가 있는 것 같습니다.

생성형 AI가 “화면 안의 일”을 바꾸듯이,

물리적 AI는 앞으로,

현실 세계의 업무 방식 자체를 변화시킬 잠재력이 있습니다.

AI는 이제 단순한 “무엇을 알고 있는지”로 경쟁하는 시대가 아니다.

다음은,

현실 세계에서 어디까지 안전하게 업무를 수행할 수 있을까

그것이 요구되는 시대인지도 모릅니다.

## 참고 자료

구글 딥마인드, “Gemini Robotics ER 2” 출시

최첨단 로봇 ER 2는 딥마인드의 Gemini 모델을 기반으로 개발되어 복잡한 작업 환경에서 뛰어난 성능을 발휘합니다. 특히 다양한 센서와 액추에이터를 통해 주변 환경을 정확하게 인식하고, 이를 바탕으로 스스로 판단하고 행동하는 능력을 갖추고 있습니다.

ER 2는 단순 반복 작업뿐 아니라 복잡한 문제 해결 능력 또한 갖추고 있습니다. 예를 들어 물건을 집어 옮기는 작업에서 장애물을 감지하고 회피하며 목표 지점으로 정확하게 이동하는 능력을 보여줍니다. 또한 딥마인드의 인공지능 기술을 활용하여 사용자의 명령을 이해하고 수행하는 능력도 갖추고 있습니다.

ER 2는 현재 다양한 산업 현장에서 테스트를 진행하고 있으며, 앞으로 더욱 다양한 분야에서 활용될 것으로 기대됩니다. 딥마인드는 ER 2를 통해 로봇 기술의 새로운 가능성을 제시하고 인류의 삶을 더욱 편리하고 풍요롭게 만드는 데 기여할 것입니다.

구글 딥마인드 “Gemini Robotics ER 2 - 모델 카드”

본 기사의 기능, 제공 상황, 안전성에 관한 설명은 2026년 8월 시점에서 확인한 구글 공식 정보를 바탕으로 정리되어 있습니다. Gemini Robotics ER 2는 개발자를 위한 모델이며, 실제 로봇 도입 시에는 기체별 안전 장치, 적용 환경, 법규, 이용 약관, 보험, 조직의 안전 기준 등을 별도로 확인해야 합니다.

의료, 교통, 위험물, 중장비, 인명 안전에 직접적인 영향을 미치는 작업 등 안전상 중요한 용도에서는 모델 카드 및 각종 안전 기준을 우선적으로 활용하고, 모델 단일의 판단에만 의존하지 마십시오.

**출처:** [note 원문](https://note.com/noahs_nalog/n/n64dd426ba47c)

*번역: Gemma 3(.44) 초벌 + 교정 226청크*

[원문 보기](https://note.com/noahs_nalog/n/n64dd426ba47c) | 출처: note.com