AI 기업 Tavus가 실시간 영상과 음성을 통해 인간과 대화하는 AI 모델 “Griffin”을 발표했습니다. 연구 프리뷰 버전 “Griffin-Lite”를 사용한 실험에서는 1분간의 라이브 비디오 통화에 참여한 54명 중 26명, 약 48%가 대화 상대방의 AI를 실제 인간이라고 판단했습니다.
Griffin: The First Human Interaction Model | Tavus https://www.tavus.io/griffin
다음 영상을 통해 실제로 Griffin이 인간과 비디오 통화하는 모습을 확인할 수 있습니다. 48% of People Thought This AI Was a Real Human | Introducing Griffin - YouTube
Griffin이 비디오 통화용으로 응답하는 영상은 X(구 Twitter)에서도 공개되었습니다.
머신이 우리에게서 우리가 있는 곳으로 만나고 진정으로 우리를 이해할 때, 기분 좋은 친구나 동료와 대화하는 것처럼 기계를 사용하는 것이 가능해지는 미래를 열 수 있습니다. 길을 잃었을 때 알아차리는 모든 학생을 위한 튜터, 경청하는 노인 돌봄 동반자, 완벽한 비서가 됩니다. https://t.co/XaVLldOQGe
다음 영화에서는 카메라에 담긴 인형에 반응하여 대화하는 모습을 확인할 수 있습니다.
이야기 중간에, 화성은 공작을 들고 있으며, 그리핀은 완벽하게 줄거리 속에 녹여 넣습니다. 그것은 말할 때 무엇을 보는지 알기 때문에, 무엇을 보느냐에 따라 그것이 말하는 것이 달라집니다. 무언가를 보여주면 대화의 일부가 됩니다. https://t.co/4mVWQvjOB8
Griffin은 Tavus가 “Human Interaction Model(HIM)”이라고 부르는 새로운 유형의 AI 모델입니다. 사용자 발언에 답변하는 것뿐만 아니라, 영상과 음성을 실시간으로 인식하고, 표정, 시선, 음성 톤, 침묵의 길이를 포함하여 언제, 어떻게 반응할지 판단합니다. 동시에 AI 자신의 음성 및 표정, 시선, 몸짓도 실시간으로 생성합니다. 일반적인 음성 AI는 사용자가 말하기를 마치고 나서, 음성 인식, 언어 모델에 의한 답변 생성, 음성 합성 순서로 진행합니다. 반면 Griffin은 1초 미만의 간격으로 대화 상태를 판단하기 지속합니다. 따라서 상대방이 말하는 도중에 고개를 끄덕이거나, 짧은 박수를 치거나, 필요에 따라 끼어들거나 할 수 있습니다. 또한 AI가 말하는 도중에 사용자가 끼어드는 경우에도 그것을 인식하고 대응할 수 있습니다.
Griffin은 크게 두 가지 시스템으로 구성되어 있습니다. “Continuous Conversational Modeling” 엔진은 영상과 음성을 지속적으로 인식하고, 무엇을, 언제, 어떻게 표현할지 결정합니다. “Audio-Visual Generation” 엔진은 그 판단에 따라 음성과 영상을 생성합니다. 인식, 판단, 생성 과정을 병행하여 수행함으로써, 인간 간의 대화와 유사한 양방향의 교환을 가능하게 합니다.
영상은 1장의 참조 이미지를 기반으로 생성합니다. 생성하는 것은 얼굴뿐만 아니라 팔, 손가락, 신체 움직임, 의자, 그림자, 배경을 포함한 전체 화면입니다. 720p의 영상을 320밀리초 단위로 생성할 수 있으며, NVIDIA H100을 사용한 측정에서는 수신한 음성이 영상에 반영되는 데 걸리는 지연은 평균 0.43초였습니다. Tavus에 따르면, 비교한 스트리밍형 영상 생성 기법 중 다음으로 빠른 기법의 약 절반에 해당하는 지연이었음을 나타냅니다.
대화 능력은 NVIDIA의 영상 및 음성을 통한 양방향 대화 벤치마크 “VideoFDB”에서도 평가됩니다. AI 자신의 음성과 영상이 대화에 적합한지를 확인하는 “Generation” 평가에서는 5점 만점으로 Griffin-Lite가 3.83, 인간 참조 데이터가 3.92, 다음 단계인 “Gemini 2.5+Anam”이 2.80이었습니다.
반면, 상대방의 영상과 음성으로부터 상황을 이해하고 있는지를 확인하는 “Perception” 평가에서는 Griffin-Lite가 3.73, 인간이 4.20, 다음 단계인 “MiniCPM-o 4.5”가 3.44였습니다. Tavus는 이 평가를 NVIDIA가 2026년 9월에 독립적으로 실시한 것으로 설명하고 있습니다.
Tavus는 또한 Griffin-Lite와 인간이 실제로 대화하는 실험을 진행했습니다. 독립적인 연구 플랫폼을 통해 수집된 참가자들에게 “다른 참가자와 1분간 비디오 통화를 한다”고 설명하고 “올해 기대하는 것”을 주제로 이야기하도록 했습니다. 실제 대화 상대는 Griffin-Lite에서 작동하는 AI로, 얼굴, 목소리, 답변은 모두 실시간으로 생성되었습니다. 통화 후, 참가자들은 대화 상대의 답변 내용, 자연스러움, 신뢰성, 대화 흐름 등을 평가했습니다. 그 후, 마지막으로 처음 “상대가 실제 인간이 아닌 가능성을 생각했는가”라고 질문했습니다.
그 결과, 54명 중 26명이 상대방을 실제 인간이라고 판단했으며, 약 48%가 그랬습니다. 인간이라고 답한 참가자가 그 판단에 얼마나 확신을 가졌는지를 나타내는 확신도는 평균 79%였습니다. 반면, Tavus의 기존 시스템 “Phoenix-4.5+Sparrow-2+Raven-1”을 동일한 절차로 시도한 실험에서는 참가자 41명 중 상대방을 인간이라고 판단한 비율은 2.4%였다고 합니다. 7단계 평가에서는 Griffin-Lite의 “자연스러움”이 평균 5.4, “신뢰할 수 있나”가 5.6, “다시 이야기하고 싶나”가 5.8였습니다. “상대가 자신의 이야기를 제대로 들어주는 것을 느꼈는가”는 5.5였지만, “대화가 자연스럽게 이어졌는가”는 4.9로 조사한 5개 항목 중 가장 낮은 평가를 받았습니다.
Tavus는 이 결과를 바탕으로, Griffin-Lite가 실시간 “비디오 튜링 테스트”를 돌파했다고 평가하고 있습니다. 반면, 자연스럽고 인간다운 대화 능력이 상대방에게 AI를 인간이라고 믿게 하기 위한 용도로도 사용될 수 있음을 인정하면서, 안전상의 문제를 인지하고 있습니다. 이에 따라, Griffin-Lite는 현재 시점에서는 일반 고객에게 제공하지 않고, 신뢰할 수 있는 일부 테스터에게 연구 프리뷰로서 제한적으로 공개하고 있습니다. Tavus는 AI임을 안전하게 명시하는 메커니즘 등을 검토한 후, Griffin을 보다 광범위하게 제공할 계획입니다.
원문 보기 | 출처: Gigazine