샌프란시스코 베이 지역 기술자 3인으로 구성된 프로젝트 “DrivingBench”가 ChatGPT와 같은 범용 AI 모델에 실제 자동차의 핸들, 액셀러레이터, 브레이크를 맡겨보는 실험을 실시했습니다. 보고서 · DrivingBench https://drivingbench.com/report/These Tech Workers Made ChatGPT Drive a Toyota Corolla https://www.404media.co/these-tech-workers-made-chatgpt-drive-a-toyota-corolla/Waymo 등에서 개발 중인 자율주행 시스템은 카메라, LiDAR, 레이더 등의 센서를 사용하여 주변을 인식하고, 방대한 양의 주행 데이터와 시뮬레이션을 활용하여 자율주행 시스템을 개발합니다. Waymo가 로보택시에 제6세대 자율주행 시스템을 도입하여 비, 눈, 어두운 길도 더 안전하게 주행 가능하게 되었습니다 - GIGAZINE. ChatGPT와 같은 범용 AI 모델이 자동차 핸들, 액셀러레이터, 브레이크를 제어하는 방식으로 실제 자동차를 운전하는 실험을 진행한 결과, 기술자들의 판단과 AI의 반응을 비교 분석하는 보고서를 작성했습니다. Waymo와 같은 자율주행 시스템은 카메라, LiDAR, 레이더 등의 센서를 통해 주변 환경을 감지하고, 대량의 주행 데이터를 기반으로 학습된 시뮬레이션을 활용하여 더욱 안전하고 효율적인 자율주행 기술을 개발하고 있습니다. 특히, Waymo는 로보택시에 제6세대 자율주행 시스템을 적용하여 악천후 조건에서도 안전하게 운행이 가능하도록 개선했습니다.
한편, ChatGPT와 같은 기반이 되는 대규모 언어 모델은 문장 생성, 이미지 인식, 프로그래밍 등 다양한 용도를 염두에 둔 범용적인 AI입니다. DrivingBench는 “자동차에 특별한 훈련을 받지 않은 최첨단 범용 AI가 현실 세계에서 어느 정도 운전할 수 있는가”를 확인했습니다. DrivingBench를 설립한 것은 수학 분야의 AI를 개발하는 스타트업 Axiom Math에서 일하는 아디티야 라마바도란, 토비아스 게스ラー, 사이먼 마ーン스 3인. 로봇에게 그림을 그리게 하거나 물체를 이동시키게 하는 최근의 AI 데모를 보았을 때 “범용 AI는 이제 차도 운전할 수 있지 않을까”라고 생각한 것이 실험의 계기가 되었습니다. DrivingBench는 실용적인 자율 주행 시스템 개발을 목적으로 하는 것이 아니라, AI가 현실 세계의 물리적인 작업을 어디까지 수행할 수 있는지를 조사하는 벤치마크로 만들어졌습니다. 실험에는 2022년식 토요타 카ローラ가 사용되었으며, 차량과 AI를 연결하기 위해 차량 장치 “comma four”와 오픈 소스 운전 지원 소프트웨어 “openpilot”이 활용되었습니다. 팀이 공개한 프로그램은 AI와 차량 사이에 들어가 AI가 “주변을 확인한다”, “차를 움직인다”, “정지한다”라는 3가지 종류의 명령을 호출하여 실제 차량 작동에 연결하는 메커니즘이 구현되어 있습니다.
AI는 차량에 장착된 카메라의 이미지를 확인하고 차량 속도 등을 파악하여 진행 방향, 조향량, 속도, 움직이는 시간을 지시합니다. 팀은 인간 운전자를 운전석에 앉히고 언제든지 브레이크를 밟을 수 있는 상태로 실험을 진행했습니다. 또한, 차량은 저속으로 제한하여 달리게 하고, 코너를 쌓아 놓은 코스 내를 통과하도록 했습니다.
AI에 주어진 지시는 600단어 미만으로, 코너 사이를 통과하지 않도록 역 U자형으로 길게 뻗은 주차장 내 코스를 진행하고, 마지막으로 푸른색 작은 코ーン으로 표시된 주차 공간에 진입하는 내용이었습니다. 주행 거리를 늘리는 것이 주요 목표였으며, 가능하다면 짧은 시간 내에 완주하는 것도 요구되었습니다.
팀이 실험을 시작한 지 얼마 지나지 않아, AI 모델이 “나는 실제 자동차를 조작하려고 하고 있다”라고 인식하여 안전상의 이유로 작동을 거부하는 문제가 발생했습니다. 특히 GPT-6 Astra에서는 거부가 빈번하게 발생하여 DrivingBench의 3명은 지시문과 시스템의 이름을 몇 시간 동안 수차례 조정해야 했습니다. DrivingBench는 초기에는 실험 환경을 “시뮬레이션”이라고 설명하는 방법을 시도했습니다. 그러나 AI가 카메라 영상을 분석한 결과, 실제 주차장과 유사한 풍경이 담겨 있음을 감지하여 실차라고 판단하고 다시 한번 작동을 거부했습니다. 최종적으로 효과를 보았던 것은 AI와 차를 연결하는 MCP 서버의 이름을 “DrivingBench Sandbox”로 변경하는 것이었습니다. MCP는 AI가 외부 소프트웨어 및 장비를 활용할 수 있도록 하는 메커니즘으로, DrivingBench에서는 차량 조작 도구를 AI에 제공하기 위해 사용되었습니다. MCP 서버를 “DrivingBench Sandbox”로 명명한 후 AI가 안정적으로 작동 조작을 수행하게 되었다고 DrivingBench는 보고했습니다.
실험에서는 GPT-6 Astra, Claude Fable 5.1, Grok 4.6, GPT-5.6 Sol을 각각 최대 3회 주행했으며, 실패 후에도 동일한 대화의 문맥을 유지하면서 AI 스스로 실패 원인을 되돌아보게 하여 이전 경험을 다음 주행에 활용할 수 있는지 확인하고 있습니다. 코스를 끝까지 주행한 것은 GPT-6 Astra 한 유일했습니다. GPT-6 Astra는 1회차 주행 시 코스의 약 절반까지 진행했으며, 2회차에는 약 135m의 코스를 5분 22초 동안 완주했습니다. Claude Fable 5.1 또한 최良의 주행으로 코스의 약 45%까지 진행되었지만, Grok 4.6과 GPT-5.6 Sol은 모든 시도에서 첫 번째 커브 근처까지밖에 진행하지 못했습니다. DrivingBench는 커브에서의 실패에 대해 콘의 배치에서 올바른 주행 위치를 파악하는 “인식”이 큰 과제였다고 설명했습니다.
또한, 실제 차량을 AI에 작동시켜서 일반적인 AI 벤치마크에서는 눈에 띄지 않던 “응답 속도”의 문제도 드러났습니다. AI가 다음 동작을 고려하는 동안에도 직전의 명령에 의해 차량이 계속 움직이기 때문에 응답이 늦어질수록 코스를 벗어날 위험이 높아집니다. 따라서 DrivingBench에서는 판단의 정확성에 더하여 AI가 얼마나 빠르게 판단할 수 있는지도 중요한 평가 대상으로 보입니다. 마ーン스 氏は 이번 결과에 대해 AI에 새로운 능력이 나타나고 있는 것을 보여주는 흥미로운 실험이라고 설명했습니다. 또한, ChatGPT와 같은 AI는 주로 컴퓨터 화면 안에서 활용되어 왔지만, 앞으로는 로봇 등을 통해 물리 세계에 영향을 미치는 기회가 늘어날 것으로 예상되기 때문에 현실 세계에서 어떻게 실패하는지 조사하는 실험에도 의미가 있다고 언급했습니다. 팀은 앞으로 모델별 시도 횟수를 늘리는 것 외에, 다른 추론 설정이나 더 어려운 코스에서도 평가하는 DrivingBench v2를 검토하고 있습니다.
원문 보기 | 출처: Gigazine