# OpenAI가 음성 대화 AI 'GPT-Live-1'의 API를 출시

> https://bookfactory.kr/c/news/11057
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-11T04:01:22.594Z

---

OpenAI가 음성 에이전트의 말하기 방식이나 동작을 더욱 세밀하게 제어할 수 있는 음성 모델 'GPT-Live-1'의 API를 발표했습니다. 개발자가 용도에 맞게 음성 경험을 제어할 수 있습니다.Build more natural voice experiences with GPT‑Live‑1 in the API | OpenAIhttps://openai.com/index/introducing-gpt-live-1-in-the-api/

GPT-Live-1 is now available in the API.Bring ChatGPT’s natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose.pic.twitter.com/gIl1gwsBDV

'GPT-Live'는 2026년 7월에 등장한 신세대 음성 모델로, 말하기→듣기→말하기라는 기존의 주고받기 방식에서 벗어나 말을 들으면서 동시에 말할 수 있는 '풀 듀플렉스 방식'을 채택하고 있습니다. 또한 자연스러운 대화를 담당하는 부분과 검색 및 추론 등의 무거운 작업을 담당하는 부분을 분리한 점도 특징으로, 웹 검색이나 깊은 추론 등 복잡한 작업이 필요한 경우 GPT-Live는 백그라운드에서 최신 프론티어 모델에 처리를 위임하여 작업 중에도 대화의 흐름을 유지할 수 있습니다. ChatGPT의 음성 모드에서 더욱 자연스러운 대화를 가능하게 하는 'GPT-Live' 등장, 말을 들으면서 맞장구나 끼어들기에 대응 - GIGAZINE

새롭게 'GPT-Live-1'의 API가 2026년 9월 10일에 발표되었습니다. API에서 GPT-Live-1의 주요 강점으로 OpenAI가 꼽은 특징은 다음과 같습니다.
・끼어들기 처리: 입력된 음성과 출력하는 음성을 함께 추론하는 단일 모델을 통해 끼어들기 처리를 개선하고, 기존의 음성 인식(STT)→대규모 언어 모델(LLM)→음성 합성(TTS)이라는 연결형 아키텍처에서의 지연이나 각 모델 간의 전달이 불안정해지는 문제를 해소.
・추론 및 툴 호출 위임: GPT-Live-1은 추론이나 툴 호출을 GPT-6 Astra와 같은 백엔드 텍스트 모델이나 서드파티 모델에 위임할 수 있습니다.
・톤, 페이스, 대화 스타일: 개발자는 시스템 프롬프트를 통해 AI 에이전트의 말하기 톤, 말하는 속도, 대화 스타일을 자유롭게 설정할 수 있습니다.
・무음 및 주변 소음 처리: 대화를 중단하거나 처리 절차를 소리 내어 설명하지 않고 주변 소음이나 무음 상태를 더욱 적절하게 처리합니다.
・장시간 세션에서의 신뢰성: 장시간의 주고받기에서도 문맥 유지와 대화의 질을 향상시킵니다.
・전화 응대: 레스토랑 예약부터 고객 지원까지, 전화 응대용 풀 듀플렉스 방식 에이전트의 도입을 가능하게 합니다.
GPT-Live-1을 통한 음성 대화의 예시는 아래 포스트에서 확인 가능.

Shape your voice agent’s personality with instructions for tone, pacing, and expressiveness.GPT-Live-1 can mirror the tone and emotion in a speaker’s voice and adapt to their pace.You can also set its language and response length.pic.twitter.com/kRIoQjn10y

아래 포스트에서는 카페 등 소음이 많은 환경에서의 작동을 확인할 수 있습니다.

GPT-Live-1 finally makes conversations fluid.It distinguishes speech from background noise, so café chatter doesn’t have to stop the conversation ☕You can even add a detail you just thought of or change direction mid-conversation without waiting for the model to finish its…pic.twitter.com/xjkqQh04Zn

또한, 새로운 음성 옵션도 여러 개 공개되었습니다. 제품이나 사용자에게 맞는 자연스러운 음성이 필요한 경우, 개발자는 GPT-Live-1에서 제한된 실시간 음성 세트로부터 억양·방언·언어를 아우르는 더 넓은 선택지로 확장할 수 있습니다. 향후 수개월 동안 음성 옵션과 지원 언어를 확대해 나갈 예정이라고 합니다.

GPT-Live-1은 이미 ChatGPT의 새로운 음성 모드를 지원하는 모델로 배포되어 있으며, 기존 음성 모델인 'GPT-Realtime-2.1'과 비교해 Full Duplex Bench 성능을 30% 향상시키고 턴테이킹 지연 시간과 대화형 동작에서 큰 개선을 보였다고 OpenAI는 주장합니다. 또한 GPT-6 Astra와 조합하여 중간 정도의 추론 부하로 사용했을 때, 엔드투엔드 작업에서 최첨단 음성 에이전트의 지능을 측정하는 'Tau3'에서도 1위를 차지했다고 합니다.

다음은 사용자가 대화 턴을 종료한 후 에이전트가 응답을 시작할 때까지의 시간을 측정한 그래프입니다.

GPT-Live-1 개발에는 주택 및 의료 기관의 커뮤니케이션 효율화와 업무 효율 향상을 지원하는 AI 솔루션을 제공하는 'EliseAI'가 참여하고 있습니다. EliseAI의 악샤이 라마스워미 씨는 "지난 몇 달 동안 OpenAI와 협력하여 GPT-Live-1의 초기 디자인 파트너로 함께 일해 왔습니다. 2024년에 첫 S2S 모델이 등장했을 때의 흥분을 지금도 기억하지만, 프로덕션 환경에 적용하기까지는 오랜 시간이 걸렸습니다. 이제야 마침내 그 단계에 도달한 기분입니다"라고 전했습니다.

이 소식을 비밀로 지키는 것이 정말 힘들었습니다! 지난 몇 달 동안 @elise_ai는 GPT-Live-1의 초기 디자인 파트너로서 @OpenAIDevs와 협력해 왔습니다. 첫 S2S 모델이 나왔던 2024년의 흥분을 여전히 기억하지만, 여기까지 오는 데 오랜 시간이 걸렸습니다…pic.twitter.com/9f3RfW7yp9

GPT-Live-1은 2026년 9월 10일부터 API로 이용 가능. 프론트엔드의 음성 레이어는 1분당 0.05달러(약 7.7엔)이며, 이를 제품에 맞는 백엔드 모델 및 에이전트 하네스와 조합함으로써 필요한 작업량에 맞춰 확장 가능한 음성 경험을 구축할 수 있습니다. Getting started with GPT-Live | OpenAI APIhttps://developers.openai.com/api/docs/guides/live

[원문 보기](https://gigazine.net/news/20260911-gpt-live-1/) | 출처: Gigazine