# 음성 AI는 왜 즉시 답변할 수 있을까? OpenAI가 “GPT-Live”의 작동 원리를 설명

> https://bookfactory.kr/c/news/8829
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-04T07:19:53.632Z

---

OpenAI가 인간과의 대화에 빠르게 반응하는 음성 AI “GPT-Live”를 지원하는 실시간 시스템을 약 6개월 만에 구축한 방법을 공개했습니다. 이용자와 AI가 동시에 대화할 수 있는 메커니즘, 복잡한 처리를 다른 AI에 맡겨 대화를 지속하는 설계, 통신 시작까지의 대기 시간을 단축하는 기술이 상세히 설명되어 있습니다.

음성 AI와 대화 중에 답변이 시작되거나, 대화를 마치고 나서 긴 침묵이 이어지는 현상은 대화를 부자연스럽게 만듭니다. 기존의 음성 AI는 이용자의 발언 종료를 감지한 후 답변을 생성했기 때문에, 판정이 빠르면 대화를 끊고, 느리면 답변이 늦어지는 문제가 있었습니다.

GPT-Live에서는 발언 종료를 감지하는 전용 모델을 음성 처리 경로에서 분리하고, AI 스스로가 음성을 듣는 동안 대화하는 “전이중 통신” 방식을 채택했습니다. 전화처럼 양쪽이 동시에 음성을 송수신할 수 있으며, GPT-Live는 말하기, 듣기, 대기, 끼어들기 등과 같은 판단을 1초에 수십 번 반복한다고 합니다.

검색이나 복잡한 추론이 필요한 경우에는 GPT-Live가 대화를 이어가면서 고성능의 별 모델로 처리를 위임합니다. 별 모델의 처리 결과를 기다리는 동안에도 음성 통신은 전용의 고속 경로로 지속되므로, 검색이나 도구 실행이 늦어져도 대화가 끊어지지 않습니다.

장시간의 대화에서는 대체 모델 인스턴스를 백그라운드에서 준비하고, 대화의 맥락을 읽어준 후 전환하여 실행 환경 전환이나 맥락 압축으로 인한 대기 시간을 사용자에게 느끼지 않도록 설계되었습니다.

음성의 전송에는 저지연 통신 기술 “WebRTC”가 사용되었습니다. 일반적인 WebRTC는 연결 시작 시 여러 번의 통신이 필요했지만, OpenAI는 WebRTC Abridged Roundtrip Protocol(WARP)을 개발하여 음성 및 데이터 통신 시작에 필요한 네트워크 상의 왕복 횟수를 6회에서 1회로 줄였습니다.

GPT-Live의 메커니즘은 ChatGPT Voice에도 사용되었으며, OpenAI는 앞으로 GPT-Live API를 제공하여 음성 대화를 더 많은 기기 및 앱으로 확장할 계획이라고 밝혔습니다.

[원문 보기](https://gigazine.net/news/20260804-openai-gpt-live/) | 출처: Gigazine