중국의 AI 개발 기업인 MiniMax가 영상 생성 AI “MiniMax H3”를 발표했습니다. MiniMax H3는 최대 15초 분량의 음성 포함 영상을 생성할 수 있으며, 텍스트, 영상, 이미지, 음성의 입력을 지원합니다. 또한, 곧 모델 자체가 무료로 공개될 예정입니다. MiniMax H3는 텍스트, 영상, 이미지, 음성의 입력에 대응하며, “이미지를 입력하여 등장인물을 지정하는”, “노래声 입력하여 립싱크 영상을 만드는” 등의 조작이 가능합니다. 여러 미디어를 동시에 입력하여 하나의 영상을 생성할 수도 있습니다. 영상의 해상도는 768p 또는 2K이며, 최대 15초의 영상을 생성할 수 있습니다.
MiniMax 공식 페이지에 게시된 MiniMax H3의 생성 예시는 다음과 같습니다.
영상 생성 AI “MiniMax H3”의 생성 예시 그 1 – 유튜브
게임 화면처럼 보이는 영상도 있습니다. 영상 생성 AI “MiniMax H3”의 생성 예시 그 두 번째
제3자 기관인 인공 분석(Artificial Analysis)의 테스트 결과가 이미 공개되었습니다. “AI 모델의 이름을 가린 채 동일한 프롬프트에서 영상을 생성하여 성능을 비교하는” 방식으로 “텍스트에서 음성 포함 영상을 생성하는” 작업의 품질을 순위화한 결과가 아래와 같습니다. MiniMax H3는 Gemini Omni Flash에 이어 2위를 기록했으며, 고품질로 알려진 Seedance 2.0을 능가했습니다.
이미지에서 음성까지 포함하는 동영상 생성이라는 작업에서 Seedance 2.0이 1위를, Gemini Omni Flash가 2위를, MiniMax H3가 3위를 차지했습니다.
MiniMax H3는 현재 API를 통해 이용 가능하며, 곧 모델이 오픈 웨이트로 공개될 예정입니다. API 문서 확인은 다음 링크에서 가능합니다: Create Video Generation Task - MiniMax API Docs https://platform.minimax.io/docs/api-reference/video-generation-v2-create 또한, ComfyUI와 같은 제3자 서비스에서도 MiniMax H3의 API를 활용하여 영상 생성이 가능합니다.
MiniMax H3가 ComfyUI를 통해 파트너 노드 형태로 출시되었습니다. → 멀티모달 I/O: T2V, First/Last Frame, Omni Reference → 모든 클립에 네이티브 스테레오 오디오 지원 → 최대 2K, 5-15초, 24 FPS → 캐릭터, 장면, 대화, 음성을 현장에서 편집 API 접근이 오늘부터 활성화되었습니다. 네이티브… pic.twitter.com/lRrgrIEvFN
원문 보기 | 출처: Gigazine