# 돈 들이지 않는 영상 생성 AI – MiniMax H3에 로컬 세력이 뛰어든 이유

> https://bookfactory.kr/c/news/9779
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-08-16T14:51:20.099Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/304106048/rectangle_large_type_2_742fe33c1b7c08e7c55cd9b0c737a332.png?width=1280)

## 결론: 클라우드 과금 제로로 무한정 다시 시도할 수 있다는 점에 있다.

중국 MiniMax는 2026년 8월 3일, 오므니모달 멀티모달 영상 생성 모델 “MiniMax H3”의 모델 가중치를 Hugging Face에서 공개했다. 텍스트, 이미지, 영상, 음성을 단일 모델로 처리하고, 영상과 스테레오 음성을 동시에 생성할 수 있는 것이 특징이다.

클라우드 기반 영상 생성 AI(Sora나 Seedance 등)는 1본마다 과금이 발생하며, 시행착오 비용이 누적됩니다. 반면에 H3는 자체적으로 공개되었기 때문에, ComfyUI 등을 사용하여 개인 GPU에 다운로드하여, 얼마든지 자유롭게 무료로 생성 시도를 할 수 있습니다. 이 “무료로 검증 가능 무제한”이라는 점이, 로컬 LLM/로컬 생성 AI를 접해본 사용자층에게 강하게 와닿은 이유라고 생각됩니다.

## MiniMax H3는 어떤 모델입니까?

- 공개일: 2026년 8월 3일 (Hugging Face MiniMaxAI/MiniMax-H3)
- 파라미터 수: 330억 개의 고밀도 단일 스트림 Transformer
- 라이선스: MiniMax 커뮤니티 라이선스(조건 충족 시 상업적 이용도 가능)
- 텍스트, 이미지(최대 9장, 참조 자료 총 12건까지), 동영상, 음성을 단일 맥락에서 이해한다.
- 최대 15초, 24fps, 32kHz 스테레오 음성 포함 영상

설계상의 주요 특징은 3단계 파이프라인을 통해 생성된다는 점입니다.

- H3-컨텍스트-IR：텍스트, 이미지, 비디오, 오디오 등의 참조 자료를 구조화된 맥락으로 정리
- H3-Base：그 문맥에서 768p 해상도의 영상과 스테레오 음성을 동시에 생성
- H3-재생(2K): 원래 문맥과 H3-기반의 출력을 활용하여 2K로 재생성

즉, 로컬에서 네이티브하게 생성 가능한 해상도는 768p까지이며, 2K 출력은 “2차 재생성 경로”를 통해 처음 얻어지는 사양입니다. 단순한 업스케일러가 아닌 원본 맥락을 재활용한 고해상도화 방식이므로, “H3는 네이티브 2K”라고 단순화하여 소개하는 글도 종종 보이기 때문에 이 점을 정확히 파악해야 합니다.

## 로컬 환경에서 실행하는 데 필요한 것은 무엇입니까?

Hugging Face에서는 ComfyUI용으로 재패키징된 미러(Comfy-Org/MiniMax-H3)도 같은 날 공개되었으며, ComfyUI가 네이티브 지원을 즉시 제공했습니다.

- 최소 동작 구성: 약 42.5GB(풀 정밀도 123.6GB에서 약 66% 감소한 양자화 버전)
- VRAM: 컴퍼니 UI 측에서는 12GB 클래스 이상의 그래픽 카드와 오프로드 실행도 가능하다.
- 업무별 체크포인트: 텍스트 및 이미지 구동 방식의 fl2va와 참조 자료 구동 방식의 ref2va가 각각 최소 구성으로 약 21GB이며, 이 둘을 모두 갖추면 총 약 63GB의 저장 공간이 필요합니다.

VRAM 12GB 정도에서도 유사한 사례가 보고되는 것으로 보이나, 원활하게 구동하기 위해서는 고성능 GPU가 현실적이라고 할 수 있습니다.

## 실측 벤치마크를 통해 확인하는 “실용의 기준선”

공식 발표나 소개 기사뿐만 아니라, 실제로 RTX 5090(32GB)로 검증한 기술 블로그(Zenn, 2026년 8월 7일 공개)의 실측값을 참조하면, 더욱 높은 해상도의 실제 모습이 드러납니다.

- 기준 조건 (864×480, 124프레임=약 5.17초): 워밍업 실행 시 약 76초, 최대 VRAM 약 31.4GB
- 해상도와 픽셀을 높이면 시간이 단순하게 비례하지 않습니다. 720×720 해상도에서 약 5.17초가 약 137초로 늘어나는 반면, 동일 해상도에서 픽셀을 약 2.1배 늘리면 약 395초(약 2.9배)가 됩니다. 고해상도와 픽셀이 길수록 ‘비싼’ 경향이 있습니다.
- 고속화 기법 SageAttention: 품질 검수를 유지하면서 약 31.5%의 시간 단축을 확인(GPU 아키텍처 및 라이브러리 조합에 따라 효과가 달라질 수 있음).
- 터보 LoRA(4단계 속도 향상): 공신성적 기준 약 5배 속도이지만, 검증된 조건에서는 영상 및 음성 모두 붕괴가 확인되어 채택되지 않았습니다. 8단계까지 되돌리면 일반적으로 실용적인 영역에 해당합니다.

이 블로그에서는 H3, WAN2.2, LTX2.3의 3가지 모델에 동일한 조건에서 생성된 비교도 진행되었으며, H3는 “짧은 보행, 카메라 회전, 간단한 체술” 프리뷰 생성(본番 전에 미리 확인하는 영상)에 강한 반면, 여러 캐릭터의 대화, 격렬한 액션, 시작점-종료점 고정 생성(First/Last Frame)은 약한 성능을 보였습니다. 만능이라는 것보다는 특정 분야에 강점을 가진 모델이라는 인상입니다.

## 그가 왜 지역 세력에 깊이 관여했을까

- 결제 없이 시도 횟수를 늘릴 수 있습니다. 클라우드는 “제공된 속도가 그대로 경험”이며, 로컬은 직접 설정을 조절하여 속도와 품질을 최적화할 수 있습니다.
- 검증 결과가 즉시 노하우화된다: SageAttention의 고속화나 Turbo LoRA의 실용 범위 등 개인의 검증 결과가 블로그나 X에서 즉시 공유되어 커뮤니티 전체의 지적 자산으로 축적되어 간다.
- ComfyUI의 즉시 대응: 모델 공개와 동시에 워크플로우가 정비되어 환경 구축의 장벽이 낮아졌다.

한편, Hugging Face 상의 커뮤니티 반응을 살펴보면 “공개는 환영하지만, 현지에서 편하게 사용하려면 아직 무겁다”는 의견도 많이 보이며, 가벼운 버전으로의 요청이나 라이선스 지역 제한에 대한 질문도 많습니다. “굉장히 훌륭하게 공개되었지만 발전 중인 단계”라는 온도감이 실태와 가깝습니다.

## 저작권 관련 사항을 유의해 주시기 바랍니다.

MiniMax 커뮤니티 라이선스에는 생성물(Outputs)을 “적용 지역” 외부에서 이용, 복제, 수정, 배포, 표시하는 것을 금지하는 조항이 있습니다. 이 지역 제한에 대해서는 2026년 8월 6일에 MiniMaxAI 공식 멤버가 Hugging Face 상의 토론에서 대상 지역 내 이용자가 세계적인 시청자에게 영상을 공개하는 경우 추가 신청이 불필요하다는 답변을 제시한 것으로 보고되었습니다. 그러나 라이선스 본문 자체는 수정되지 않았으며, 조항과의 해석의 긴장은 여전히 남아있는 상태입니다. 일본에서 발신하는 경우에도, 이 점을 염두에 두는 것이 좋겠습니다.

## まとめ

- MiniMax H3는 330억 파라미터의 오미니모달 비디오 생성 모델로, 2026년 8월 3일에 가중치가 공개되었습니다.
- 네이티브 생성은 768p까지이며, 2K는 2단계 재생으로 얻어지며 (“네이티브 2K”라는 표현은 부정확함)
- 최소 구성이라도 수십 GB 규모의 저장 공간과 고성능 VRAM이 필요하며, ‘누구나 쉽게’라고까지 말하기는 어려운 현실이다.
- 클라우드 결제 없이도 무한히 시도할 수 있는 자유도가 현지 사용자에게 가장 큰 매력이었던 이유였다.
- SageAttention과 같은 가속화 기법 및 모델별 강점과 약점은 커뮤니티의 실측 검증을 통해 빠르게 파악되고 있다.

공식 발표된 숫자뿐만 아니라, 실제로 움직인 사람들의 검증 로그를 좇는 것이 실용적이라는 틀은, 로컬 영상 생성 AI의 새로운 “정보의 흐름”이 되기 시작하는 듯합니다.

본 기사는 PC Watch 등과 같은 보도 자료 및 공개된 기술 검토 기사를 바탕으로, 사실 확인을 거쳐 독자적으로 정리한 것입니다.

#미니맥에이치3 #영상생성AI #로컬LLM #생성AI #AI뉴스 #컴퓨이 #오픈소스AI #AI영상 #이미지생성AI #AI활용

**출처:** [note 원문](https://note.com/tolove/n/n99e60d5d1823)

*번역: Gemma 3(.44) 초벌 + 교정 33청크*

[원문 보기](https://note.com/tolove/n/n99e60d5d1823) | 출처: note.com