NVIDIA는 음성 인식 AI 모델 “NVIDIA Nemotron 3 Diarization”을 공개했습니다. 최대 8명의 화자를 식별하는 동시에 실시간 텍스트 변환이 가능합니다. **Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization** https://huggingface.co/blog/nvidia/nemotron-diarizationNVIDIA Nemotron 3 Diarization의 동작 예시는 다음과 동영상에서 확인하실 수 있습니다. 화자의 전환을 정확하게 인식하면서도 정확하게 텍스트 변환을 수행하고 있습니다. Argmax Pro SDK 3 - YouTube
NVIDIA Nemotron 3 Diarization은 “화자를 식별하는 처리”와 “텍스트 변환을 하는 처리”를 따로 실행합니다. 화자 식별은 “사전에 각 인물의 음색을 등록하는” 시스템이 아닌, “등장하는 화자를 순차적으로 ‘화자 1’ ‘화자 2’와 인식해 나가는” 시스템을 채택하고 있습니다.
학습 데이터는 공개 데이터셋이나 데이비드 AI로부터 라이선스를 제공받은 데이터셋을 이용한 것으로 알려졌습니다. 화자 식별 성능을 겨루는 Voice Arena의 다이어리제이션 벤치에서는 메타의 Muse Voice Transcribe 등을 상회하여 참여 모델 중에서 최상의 성적을 달성했습니다.
테스트에 포함되는 음성 데이터의 예가 다음과 같습니다. 4명의 화자에 의한 대화 음성으로, 중복되는 부분이 많아 인간도 구별하기 어려운 음성인데, NVIDIA Nemotron 3 Diarization은 상당히 정확하게 화자를 식별했습니다.
Nemotron 3 Diarization은 @voicearena_ai의 초기 Diarization-Bench 결과에서 12 시스템 중 1위를 기록했습니다. 14.72%의 오류율은 2위보다 약 24% 낮았습니다. 다음은 벤치마크에서 4인치 화자 비교입니다. 전체 결과: https://t.co/q3iXtsmHczpic.twitter.com/066OrH0Lji
NVIDIA Nemotron 3 Diarization 데모는 다음 링크에서 확인하실 수 있습니다. Live Speaker Diarization - a Hugging Face Space by nvidia https://huggingface.co/spaces/nvidia/nemotron-diarization
NVIDIA Nemotron 3 Diarization은 오픈 모델로서 공개되어 있으며, 다음 링크에서 배포됩니다. 라이선스는 OpenMDW-1.1입니다. nvidia/Nemotron-3-Diarization · Hugging Face https://huggingface.co/nvidia/Nemotron-3-Diarization
원문 보기 | 출처: Gigazine