OpenAI는 2026년 7월 28일(현지 시간), OpenAI API용 문자열 인식 AI 모델 “GPT Transcribe”와 “GPT Live Transcribe”의 일반 제공을 시작했다.
GPT Transcribe는 녹음된 오디오 파일 등을 고정밀도로 문자열 인식하는 모델이며, GPT Live Transcribe는 마이크나 통화 등에서 발생하는 실시간 오디오를 낮은 지연 시간으로 순차적으로 문자열 인식하는 모델이다.
두 모델 모두 녹음 내용의 맥락, 오디오에 포함될 가능성이 있는 키워드, 예상되는 여러 언어를 지정할 수 있다. OpenAI는 억양이나 언어 차이, 짧은 구절, 숫자, 전문 용어, 큰 배경 소음이 포함된 실제 환경 오디오에서도 기존 모델보다 정확하게 문자열 인식할 수 있다고 설명하고 있다.
@YouTube
## 녹음된 오디오와 실시간 오디오로 모델을 사용 구분
GPT Transcribe는 완료된 오디오 파일이나, 오디오 파일을 처리하면서 결과를 출력하는 스트리밍 문자열 인식에 대응한다. 실시간 API에서는 사용자가 구분을 최종적으로 확정한 오디오 단위의 문자열 인식에도 활용할 수 있다.
오디오 파일 처리에는 기존과 동일한 “v1/audio/transcriptions” 엔드포인트를 사용한다. 처리 대상 오디오 파일은 미리 완성되어 있어야 하며, 파일을 처리하면서 문자열을 받는 기능과 마이크에서 발생하는 음성을 실시간으로 처리하는 기능은 구분된다.
반면, GPT Live Transcribe는 마이크, 통화, 스트리밍 등 지속적으로 도착하는 실시간 오디오를 위한 모델이다. WebSocket 또는 WebRTC를 통해 이용 가능하며, 문자열 인식 결과를 낮은 지연 시간으로 순차적으로 출력한다.
개발자는 지연 설정을 조정하여 중간 결과를 더 빠르게 표시할지, 최종 문자열 인식 정확도를 우선시할지 선택할 수 있다.
## 맥락, 전문 용어, 다국어를 힌트로 지정
OpenAI의 문자열 인식 가이드에 따르면, 두 모델 모두 “prompt”, “keywords”, “languages” 세 종류의 정보를 제공할 수 있다.
“prompt”에서는 회의, 의료 상담, 고객 지원과 같은 녹음된 내용의 주제나 상황을 자유 형식으로 설명할 수 있다. “keywords”에서는 제품명, 약품명, 인명, 약어 등 실제로 오디오에 등장할 가능성이 있는 어구를 지정할 수 있다.
“languages”에는 여러 언어를 예상할 수 있으므로, 여러 언어가 혼재된 오디오나 대화 중에 언어가 전환되는 코드 스위칭에도 대응하기 쉬워진다.
OpenAI Developers의 공식 게시글에 따르면, 9개 언어의 실제 환경 오디오를 사용한 OpenAI의 벤치마크에서 GPT Live Transcribe의 문자열 인식 오류율은 9.60%였으며, 기존의 실시간 문자 인식 모델 “GPT-Realtime-Whisper”는 11.65%였다.
GPT Transcribe의 오류율은 8.98%였으며, 기존의 “whisper-1”의 15.21%를 밑돌았다. 이 모두는 OpenAI에 의한 평가이며, 오류율이 낮을수록 성능이 높다.
또한, 자유 형식의 맥락 정보를 제공한 경우, 맥락을 고려한 음성 인식 벤치마크의 의미적 정확성은 GPT Live Transcribe에서 38.5%에서 44.6%, GPT Transcribe에서 41.6%에서 45.2%로 상승했다.
OpenAI는 이양 가이드에서 녹음된 오디오에는 GPT Transcribe, 지속적인 실시간 문자열 인식에는 GPT Live Transcribe를 사용하도록 안내하고 있다.
기존 시스템에서는 “gpt-4o-transcribe”, “gpt-4o-mini-transcribe”, “gpt-realtime-whisper” 등을 계속해서 이용할 수 있지만, 새로이 문자 인식 기능을 도입할 경우에는 이번에 소개하는 2 모델이 권장된다.
다만, GPT Transcribe와 GPT Live Transcribe는 기존 모델이 제공하는 모든 기능을 그대로 대체하는 것은 아니다.
SRT, VTT 형식의 자막이나 단어 단위의 타임스탬프, 녹음 음성의 영어 번역이 필요한 경우에는 “whisper-1”을 계속해서 사용한다. 화자별로 발언을 분리하는 화자 식별이 필요한 경우에는 “gpt-4o-transcribe-diarize”를 이용한다.
API 요금은 GPT Transcribe가 음성 1분당 0.0045달러, GPT Live Transcribe가 1분당 0.017달러로 책정되어 있다.
원문 보기 | 출처: Ledge.ai