# 핫이슈 MiniMax H3를 지금 바로 사용하는 7가지 방법 [그래픽 카드 불필요, Colab 불필요]

> https://bookfactory.kr/c/news/8967
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-08-08T04:01:52.094Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/300879625/rectangle_large_type_2_9bb1dfc1b4b280b15bfff7dc38adbd57.png?width=1280)

2026년 8월 3일, 영상 생성 AI의 세계가 완전히 뒤바뀌었습니다.

중국의 MiniMax社가 영상 생성 모델 “MiniMax H3”를 “오픈 웨이트” 형태로 Hugging Face에서 무료로 공개했습니다.

오픈 웨이트란 무엇입니까?

익숙하지한 단어일 수 있으니, 먼저 설명을 드리겠습니다.

AI 모델의 본체는 “웨이트(weights)”라는 이름으로 불리는 거대한 데이터 파일입니다. 학습이 완료된 AI의 지능이라고 생각하시면 됩니다. 오픈 웨이트는 이 모델 본체 파일을 누구나 다운로드할 수 있도록 공개하는 것을 의미합니다.

ChatGPT와 같은 서비스는 AI를 “서버를 통해 사용하게 해주는” 것일 뿐, 실제 AI 본체를 얻을 수 있는 것은 아닙니다. 오픈웨이트는 AI 본체를 얻을 수 있기 때문에, 자신의 PC나 클라우드에서 직접 실행할 수 있습니다. 즉,

API 이용료를 내지 않아도 됩니다.

생성 횟수에 제한이 없습니다.

• 서비스 측의 규제나 필터에 얽매이지 않음

이것이 “오픈 웨이트”의 파괴력입니다.

이것이 얼마나 큰 사건인지 말씀드려야 합니다.

• 최대 2K 해상도, 최대 15초의 동영상을 생성할 수 있습니다.

• 영상과 스테레오 음성을 동시에 생성한다 (대사, 효과음, 배경음악이 처음부터 포함되어 있는)

• 이미지에서 음성 동영상을 제작하는 작업의 벤치마크에서 세계 3위 (1위 Seedance 2.0, 2위 Gemini Omni Flash)

자신의 PC나 클라우드에서 실행할 수 있습니다. API 이용료는 0원입니다.

발표 직후, MiniMax의 모회사 주가가 홍콩 시장에서 10% 이상 급등했다는 소식이 있었습니다. 시장이 움직일 정도의 발표였습니다.

단지, X를 보면서 흥미로운 부분과 동시에 혼란스러운 목소리도 정말 많다. GPU 사양이 충분한지 모르겠다. 클라우드에서 돌리는 방법에 대한 아이디어가 떠오르지 않고, 도입을 시도했으나 오류로 인해 진행할 수 없다.

알겠습니다. 오픈 웨이트 모델은 “무료로 사용할 수 있다”와 “쉽게 사용할 수 있다”가 완전히 다른 개념이라는 점을 이해합니다.

이 글에서는 MiniMax H3를 사용하는 방법을 “모든 패턴”으로 정리했습니다. 로컬 PC, Google Colab, GPU 클라우드, 공식 API, 제3자 API, 노코드 웹 서비스 등을 포함합니다. 사용자의 환경과 예산에 맞춰 반드시 하나를 선택할 수 있는 구성으로 합니다.

이 긴 기사지만, 목차에서 자신에게 맞는 부분만 읽어줘도 괜찮습니다.

### 제1장 MiniMax H3는 무엇인가

먼저 기본 정보를 정리합니다.

MiniMax H3는 2026년 7월 31일에 발표되어 8월 3일(중국 시간)에 오픈 웨이트 모델로 Hugging Face에서 공개된 영상 생성 모델입니다. Hailuo 3.0 또는 Hailuo 03이라고도 불립니다.

사양을 정리하면

• 출력은 5~15초, 24fps, 최대 2K 해상도

32kHz 스테레오 음성을 영상과 동일한 추론 경로로 동시에 생성

텍스트, 이미지, 동영상, 음성을 혼합하여 입력할 수 있는 오므니모랄 디자인

• 참조 자료는 이미지, 영상, 음성 등 총 최대 12개까지 전달 가능합니다.

텍스트에서 영상(T2V), 영상의 앞뒤 프레임 지정(FL2VA), 참조 자료에서 생성(Ref2VA, R2V), 기존 영상의 일부만 대체하는 인플레이스 편집, 참조 영상에서 카메라 워크와 편집 리듬을 추출하여 별 소재에 적용하는 모션 전송까지, 하나의 모델에서 모두 수행한다.

특히 혁신적인 점은 “음성 동시 생성”입니다.

기존의 비디오 생성 AI는 영상을 제작한 후 음성을 별도의 공정으로 추가하는 것이 일반적이었습니다. H3는 영상을 제작하는 과정에서 음성과 음성을 함께 생성하여, 입 모양과 대사, 움직임과 효과음의 타이밍이 처음부터 일치합니다. 포스트프로덕션에서 음성 조절 작업을 완전히 제거하는 것입니다.

여기 문을 열 때의 소리와 BGM이 지정된 타이밍에 재생된다. 직접 경험해 보면 감동적이다.

### 제2장 오픈웨이트라면 무엇이 달라지는가

앞서 설명한 바와 같이, 오픈 웨이트는 모델 본체가 확보됩니다. 이것이 실제 운영에서 어떤 영향을 미치는지 보면…

자신의 GPU로 돌리면 생성 비용은 전기 요금뿐입니다.

생성 횟수 제한 없음

서비스 측의 혼잡이나 규정 변경에 휘둘리지 않도록

자동화 파이프라인에 통합했음에도 요금이 부과되지 않습니다.

특히 4번째로, API 비용이 발생하지 않는다는 것은 양산이나 자동화를 하는 사람들에게는 생존 문제 수준에서 매우 중요하다. 1개당 수십 엔화에서 수백 엔의 API 과금은 100개, 1000개와 같이 생산하는 세계에서는 수만 엔에서 수십만 엔까지의 차이가 발생한다.

하지만 주의해야 할 점도 있습니다. 여기 언급되지 않은 내용이 많기 때문에, 의도적으로 자세히 설명하겠습니다.

### 제3장 라이선스 주의사항 (이 부분 중요)

H3는 MiniMax H3 커뮤니티 라이선스라는 독자적인 라이선스로 공개되었습니다. 주요 내용은 다음과 같습니다.

상업적 이용은 가능하며, 라이선스 표기를 해야 합니다.

2년 간 판매 부가가치가 2,000만 달러(약 31억 엔)를 초과하는 기업은 MiniMax의 사전 서면 허가를 받아야 합니다.

3. 유럽 연합, 영국, 한국, 미국은 라이선스 적용 지역 외입니다. 이 지역에서의 이용은 별도로 MiniMax에 문의가 필요합니다.

생성을 다른 AI 모델의 학습에 사용하는 것을 금지합니다.

5개의 인공지능 생성물을 명시하지 않고 공개하는 행위는 금지됩니다.

재미있는 점은 3번입니다. 로스앤젤레스 개발자는 다운로드할 수 없지만, 도쿄 개발자는 할 수 있습니다. 일본은 제외 지역에 속하지 않으므로, 저희는 보통 사용할 수 있습니다. 이러한 지정학적 상황이 AI 모델의 라이선스에 반영되는 시대가 되었습니다.

또한 “검열 없음”이라는 점에 대해 말씀드리자면, 확실히 로컬에서 실행할 경우에는 API 서비스와 같은 콘텐츠 필터가 적용되지 않습니다. 하지만 위에 언급했듯이 라이선스상의 금지 사항은 존재하며, 생성물의 공개에는 당연히 각 플랫폼의 규약과 법률이 적용됩니다. 자유와 무법은 다른 것이 아니므로, 그 부분은 어른다운 운영으로 해결해야 합니다.

### 4장: 사용 방법 전체 지도

이제 본론으로 들어가겠습니다. H3를 사용하는 방법을 크게 7가지로 나눌 수 있습니다.

방법 1: 로컬 PC에서 실행 (컴피 UI)

방법 2: Google Colab에서 실행

방법 3, RunPod와 같은 GPU 클라우드를 빌려 실행한다.

방법 4: MiniMax 공식 API 활용

방법 5 외부 API를 통해 사용 (fal, RunComfy 등)

방법 6 ComfyUI API 노드, Comfy 클라우드에서 사용합니다.

방법 7 노코드 웹 서비스를 활용합니다(해오 앱 등).

요약하자면 1~3은 ‘자가 워크로드 운영으로 = 생성 비용 거의 없음’의 세계이고, 4~7은 ‘호스팅 기반으로 사용하며 = 간편하지만 과금 방식’의 세계입니다.

차례대로 살펴보겠습니다.

제5장 방법 1: 로컬 PC에서 실행

가장 로맨틱하고 가장 높은 난이도를 요구하는 방법입니다. 다만 H3은 출시 직후부터 ‘예상보다 낮은 사양으로도 잘 돌아간다’는 보고가 있었고, 이것이 이번 행사의 중심이 되고 있습니다.

필요한 환경의 기준

ComfyUI 0.30.0 이상 (이것이 가장 중요합니다. 오래된 버전으로는 H3 노드가 인식되지 않습니다)

VRAM 12GB 이상 (쾌적하게 사용하려면 16GB 이상, 검증 보고가 많은 것은 24GB급)

메인 메모리(RAM) 64GB 이상을 권장합니다. VRAM에 모두 올라오지 않는 데이터를 RAM으로 전송하여 사용하는 방식입니다.

・디스크 여유 용량 약 40GB (R2V를 사용한다면 약 60GB)

NVIDIA GPU를 사용합니다. CUDA는 최신 스택(cu130 시리즈)을 기준으로 하며, 오래된 경우 성능이 현저히 저하되었다는 보고가 있습니다.

왜 12GB로 작동하는 걸까요

본가 리포지토리의 풀 정밀도(BF16) 모델은 총 288GB에 달하며, 이는 멀티 GPU 서버를 전제로 하는 크기입니다. 개인용 PC에서 다루기에는 적합하지 않습니다.

그러고 나서 ComfyUI 공식(Comfy-Org)에서 양자화 버전을 준비했습니다. 모델의 약 40%를 차지하는 변조층을 루크업 테이블로 대체하고, int8 양자화와 커스텀 커널을 결합하여 최소 구성의 메모리 사용량을 123.6GB에서 42.5GB까지 66% 감소시켰습니다. 동적 VRAM 오프로드를 병용하여 RTX 3060 클래스 GPU에서도 작동하도록 성능을 극대화했습니다.

지역에서 실행하려면 이 Comfy-Org 버전이 유일합니다. 원본 diffusers 형식은 스스로 워크플로우를 구성하는 고급 사용자에게 적합하다고 생각하시면 됩니다.

실제 작동 보고서

RTX 4070(VRAM 12GB)으로 5초 영상이 6분 30초, 10초 영상이 약 16분 정도라는 보고가 있습니다.

RTX 4090(VRAM 24GB)에서는 설정을 최대한 활용하면 5초 영상이 약 70초 정도로, 15초 풀 길이 음성 포함 영상이 약 10분 정도로 보고되었다.

• 다만 VRAM 12GB 환경은 상당히 턱걸이이고, RAM 64GB 이상을 거의 전제로 한 구성

어떤 제약이 있는지 명확히 밝혀지지 않았습니다. 제약 조건이 무엇인지 알려주시면 정확하고 자연스러운 번역을 제공해 드릴 수 있습니다.

로컬에서 생성 가능한 해상도는 기본적으로 768p(짧은 변 768px)까지입니다.

• 2K 출력을 담당하는 업스케일 부분(H3-Regenerate-2K)은 가중치가 공개되지 않았으며, 공식 호스트형 API만을 통해 제공됩니다.

즉, “지역은 768p로 재생하고, 핵심 장면만 2K로 변환은 클라우드를 활용한다”는 하이브리드 운영 방식이 현실적인 해결책입니다.

### 도입 절차 개요

ComfyUI를 0.30.0 이상으로 업데이트합니다 (데스크톱 앱의 업데이트에서는 코어가 오래 남을 수 있으므로, git clone으로 최신 코어를 가져오는 것이 확실합니다).

2. ComfyUI 템플릿 라이브러리에서 T2V, I2V, R2V 공식 워크플로우를 엽니다.

3. 워크플로우 내 지침에 따라 拡散 모델, 텍스트 인코더, 비디오 VAE, 음성 VAE 각 파일을 다운로드하여 지정된 폴더에 배치합니다.

먼저, 작은 해상도와 짧은 컷(960x544, 5초 정도)으로 1개 생성하여 동작 확인합니다.

5. 5를 실행하면 해상도와 픽셀을 높여간다.

ハマりどころとしては、ComfyUIのバージョン、CUDAのバージョン、音声VAEの選択漏れ（音が出ない）あたりが定番です。最初は高速化系のカスタムノードを入れず、公式ワークフローそのままで動かすのが鉄則。

적합한 사람

・RTX 3060 12GB 이상을 이미 보유한 분들

많은 양을 생성하고 운영 비용을 0에 가깝게 하려는 사람

• 환경 구축의 어려움을 즐기는 사람

이 현지 도입에 대해서는 제가 직접 처음부터 설정하고, 막히게 된 부분까지 포함한 완전 절차를 별도의 기사로 공개할 예정입니다. 이 기사의 절차 개요만으로는 분명히 어디에서든 막히게 될 것이므로 실제로 도입하는 사람은 이 기사가 공개될 때까지 기다리는 것이 안전합니다.

### 제6장 방법 2 Google Colab으로 실행

그래픽 카드는 없지만 월 1,000엔 정도면 지불 가능하다는 사람들에게 어필하는 작품이다.

Google Colab의 L4 GPU(VRAM 24GB)로 H3 로컬 모델을 실행했다는 보고가 있었고, 15초 분량의 영상(약 720p) 1개당 약 0.23 유로, 즉 약 40엔 정도라는 비용 계산이 공유되고 있습니다.

이것이 얼마나 비싼지 보면, 같은 15초 분량을 공식 API(768p)로 제작하면 1.20달러, 약 180엔입니다. Colab의 4~5배에 해당하며, 다른 회사의 동급 모델 API와 비교하면 8배 이상 차이가 나는 경우도 있습니다.

Colab의 장점

Colab은 Google에서 제공하는 무료 클라우드 기반의 Jupyter Notebook 환경입니다. Python 코드를 실행할 수 있으며, Google Drive와 연동하여 데이터를 쉽게 불러오고 저장할 수 있습니다.

Colab의 주요 장점은 다음과 같습니다.

*   무료 사용
*   간편한 사용법
*   Google Drive 연동
*   GPU/TPU 지원
*   협업 기능
*   다양한 라이브러리 지원

Colab은 데이터 분석, 머신러닝, 교육 등 다양한 분야에서 활용될 수 있는 강력한 도구입니다. 특히, Python을 처음 접하는 사람들에게 Colab은 좋은 시작점이 될 수 있습니다.

초기 투자 없이, 브라우저만으로 완결됩니다.

프로 계약(월 이용료) 또는 컴퓨팅 유닛 소량 구매 이용 가능

부서졌다면 다시 만들어도 됩니다. 환경 오염에 대한 걱정은 없습니다.

단점

노트북 설정에 필요한 지식이 있다 (여기서는 쉽게 포기하는 사람들이 많다).

세션이 종료되면 모델이 재다운로드될 가능성이 높으며, (40GB 상당이므로 상당한 부담입니다. Drive 캐시 활용 등 개선이 필요합니다.)

장시간 연속 가동이나 자동화에는 적합하지 않습니다.

노트북에 익숙하지 않은 사람들에게는 아직 벽이 있습니다. 하지만 가격 대비 성능만 놓고 보면 현재 시점에서 가장 최고의 선택지입니다.

### 제7장 방법 3 GPU 클라우드 대여 (RunPod 등)

그래픽 카드를 구매하는 대신, 시간 대출을 통해 빌리는 방법입니다. RunPod, Vast.ai 등이 일반적입니다.

X에서 계산해본 결과, 흥미로운 사실이 있었습니다. RunPod에서 RTX 5090을 1시간에 약 160엔 정도면 빌릴 수 있는데, 15초 영상 생성에 10분이 걸린다고 가정했을 때 1시간에 6개 정도 생성 가능합니다. 1개당 약 27엔입니다. 공식 API보다 저렴한 계산이네요. 게다가 방이 너무 덥게 되지 않는 것도 (특히 여름에는 매우 중요하죠).

RunPod 공식도 H3에 대한 설명 기사를 게시하고 있으며, 공식 ComfyUI 템플릿으로 포드를 설정하고 Hugging Face CLI로 모델을 다운로드하여 실행하도록 안내하고 있습니다. 모든 양자화 패턴을 테스트하려면 600GB 크기의 볼륨 디스크를 확보해 두는 것이 안전합니다.

여름바다의 섬세한 감정 묘사와 무라카미 하루키 특유의 문체가 돋보이는 작품입니다. 독특한 설정과 인물들의 관계, 삶의 의미를 되짚어보게 하는 여운이 깊습니다. 

무라카미 하루키 특유의 섬세한 묘사와 여름의 분위기가 잘 어우러져 독자들에게 깊은 인상을 남깁니다. 특히, 주인공의 내면 심리를 섬세하게 그려낸 점이 인상적입니다. 

이 작품은 단순한 소설을 넘어, 삶의 의미와 가치에 대해 생각하게 만드는 철학적인 질문을 던집니다. 독자들은 이 작품을 통해 자신만의 답을 찾고, 삶의 새로운 영감을 얻을 수 있을 것입니다.

RTX 4090, 5090, A100 등 개인으로는 사실상 구매하기 어려운 고성능 GPU를 수백 엔/시 단위로 이용할 수 있습니다.

사용 시간만큼만 과금하며, 사용하지 않는 달은 요금이 없습니다.

환경은 템플릿으로 재현할 수 있으므로, 파괴해도 다시 만들 수 있습니다.

단점

팟의 실행, 모델 배치, ComfyUI 업데이트 등 매번 준비된 대로 진행한다.

저장 공간을 유지하려면 보관료가 발생합니다.

자리세를 켜놓고 잠들어 버리면 돈이 다 털리겠죠.

여기 제가 직접 공략하고 있는 틈새가 있습니다. GPU 클라우드는 가격 대비 성능이 가장 좋지만, 준비 과정의 번거로움 때문에 9할이 이탈합니다. 그래서 그 준비 과정을 전부 패키지로 제공하면 됩니다. 이 이야기는 최종 장에서 자세히 설명하겠습니다.

### 8장 방법 4 MiniMax 공식 API 사용

단순히 가중치를 변경하지 않고 MiniMax가 호스팅하는 모델을 API로 호출하는 방법입니다.

• 발표 초기부터 API 제공이 이루어졌으며, 문서도 공개되었습니다.

요금의 대략적인 기준은 768p 15초 영상 시점에 약 1.20달러 정도라는 정보가 공유되고 있습니다.

그리고 가장 큰 강점은 2K 출력(H3-Regenerate-2K)을 사용할 수 있는 곳이 현재 여기(그리고 공식 제휴 서비스)뿐이라는 점입니다.

지역이나 Colab은 768p까지 지원됩니다. 최종 납품물로 2K가 필요한 경우 공식 API(또는 이를 실행할 수 있는 서비스)를 통해서만 진행해야 합니다.

적합한 사람

• 환경 구축을 일절 하고 싶지 않은 개발자

・2K 해상도가 필수인 사람

• 생성본 수가 적고, 과금량에 부담이 없는 사람

### 제9장 방법 5 제3자 API 활용

공식 외에도 H3를 호스트하고 API를 제공하는 사업자가 이미 여러 곳 있습니다.

그녀는 마치 텅 빈 캔처럼 느껴졌다. 겉으로는 완벽해 보이지만, 속은 텅 비어 있는 것 같았다. 마치 무라카미 하루키의 소설 속 주인공처럼, 그녀 역시 삶의 의미를 찾지 못하고 방황하는 듯했다.

그녀의 눈빛은 깊이를 알 수 없는 밤하늘처럼 어두웠다. 마치 ‘카호’가 겪었던 것처럼, 그녀 역시 잃어버린 꿈과 희망을 찾아 헤매고 있었다. 그녀의 삶은 마치 텅 빈 캔처럼, 겉으로는 아름다워 보이지만 속은 텅 비어 있는 것 같았다.

나는 그녀에게 다가가 말을 걸었다. “괜찮아?” 그녀는 잠시 망설이다가 대답했다. “네, 괜찮아요.” 하지만 그녀의 목소리는 여전히 떨리고 있었다. 마치 텅 빈 캔처럼, 그녀는 여전히 불안하고 혼란스러웠다.

해외의 생성 AI 인프라 선두 기업입니다. 텍스트에서 영상, 이미지에서 영상(프레임 지정, 프레임 페어 지정), 참조 자료에서 생성, 영상 편집까지 H3의 각 기능이 서버리스 API로 제공됩니다. 2K 출력, 7종의 앵글비가 지원되며, 1회 생성 시 이미지 9점, 영상 3본, 음성 3본까지 참조로 전달할 수 있습니다. 개발자가 제품에 통합한다면 이곳이 유력한 후보입니다.

어느 날, 나는 낡은 셔츠를 입고, 낡은 턴테이블을 들고, 낡은 앨범을 훑어보았다. 앨범 표지에는 낯선 여인의 얼굴이 담겨 있었다. 그녀의 이름은 ‘夏帆(카호)’였다. 앨범 제목은 ‘夜空(야소)’였다.

나는 턴테이블을 돌려 음악을 재생했다. 앨범에는 ‘村上春樹(무라카미 하루키)’가 작곡한 곡들이 담겨 있었다. 그는 앨범에 대한 짧은 글을 썼다. “이 앨범은 나의 어린 시절을 담고 있다.”라고 적어놓았다.

나는 앨범을 들고 밖으로 나갔다. 늦은 오후의 햇살이 쏟아져 내렸다. 나는 벤치에 앉아 앨범을 들여다보았다.

그때, 한 남자가 다가왔다. 그는 앨범을 훑어보더니, “이 앨범은 ‘夏帆(카호)’가 만든 것 아니에요?”라고 물었다.

나는 고개를 끄덕였다. “맞아요. ‘夏帆(카호)’가 만들었어요.”라고 말했다.

남자는 “‘夏帆(카호)’는 정말 대단한 뮤지션이에요.”라고 말했다.

나는 “‘夏帆(카호)’는 아직 젊은 뮤지션이에요. 앞으로 더 많은 음악을 만들어낼 거라고 생각해요.”라고 말했다.

우리는 잠시 동안 이야기를 나누었다.

그 후, 나는 앨범을 다시 들고 집으로 돌아갔다.

나는 앨범을 덮고 생각에 잠겼다. ‘夏帆(카호)’의 음악은 마치 어린 시절의 기억처럼, 나를 잊을 수 없는 감정으로 가득 채웠다.

클라우드 ComfyUI 서비스에서 H3 API도 제공하며, 통일된 파라미터 형식과 샘플 코드가 준비되어 비동기 작업으로 요청을 전송하고 request_id로 결과를 가져오는 방식입니다.

이러한 공통점은 “공식 출력률에 수수료가 부과되는” 것과 관련됩니다. 간편함을 대가로 1본당 단가는 자체 호스트보다 높아집니다.

### 제10장 방법 6 ComfyUI API 노드, Comfy 클라우드

ComfyUI 사용자에게는 기쁜 소식이 있습니다. H3는 정식 출시 첫 날부터 ComfyUI를 지원했습니다. 또한 2가지 방법으로 사용할 수 있습니다.

첫째는 지금까지 설명해 온 지역 기반의 개방형 버전입니다.

세 번째는 파트너 노드(API 노드)입니다. ComfyUI 워크플로우에 H3 노드를 배치하면 생성 처리 자체는 MiniMax 서버 측에서 실행되며, 모델 다운로드나 로컬 GPU는 필요 없습니다. 생성 시간(초)에 따라 Comfy API 계정에 과금됩니다. 템플릿 라이브러리에는 텍스트에서 비디오 생성, 프레임 앞뒤 추출, 참조에서 생성하는 3종의 샘플 워크플로우가 포함되어 있습니다.

컴피 클라우드(브라우저에서 실행되는 컴피유이)도 마찬가지로 활용할 수 있어 “컴피유이의 워크플로우 자산은 그대로 유지하고 실행만 클라우드에서”라는 선택이 가능합니다.

ComfyUI 생태계의 강점은 지역 기반 768p 생성과 API 노드의 2K 생성을 동일한 워크플로우 문화 안에서 자유롭게 상호 활용할 수 있게 해주는 데 있습니다.

### 제11장 방법 7 노코드 웹 서비스를 활용하기

“코드(Code)나 컴피 UI도 작동하지 않으니, 버튼을 누르면 영상이 나오기를 원하는 사람들을 위한 콘텐츠입니다.”

해일오(MiniMax 공식 앱)

H3는 Hailuo 3.0이기도 하여 공식 Hailuo 앱이나 웹 서비스를 통해 사용하는 것이 가장 간편한 노코드 루트입니다.

모피크 등, H3을 통합한 제3자 웹 서비스

무료 플랜을 제공하는 경우도 있으며, 추가 비용 없이 바로 시작해 볼 수 있습니다. 상업적 이용이나 생성량 증대를 원한다면 유료 플랜을 선택하는 것이 일반적입니다.

ComfyUI 공식 브라우저 실행(전장 참조) 역시 실질적으로 여기와 거의 동일한 간편함입니다.

단점은 생성량 대비 비용이 가장 많이 소요되는 것과, 서비스 측의 필터나 규약 범위 내에서만 생성할 수 있다는 점입니다. “첫 작품을 제작하여 감동을 주는” 것을 위한 진입로는 최적입니다.

### 제12장 비용 비교 요약

15초 영상 1개당 비용을 현재까지 발표된 보고서 기준으로 정리합니다(환율 및 조건에 따라 달라질 수 있으므로 참고용으로 활용해 주십시오).

로컬 PC (자체 GPU)

一本당 전기료만 (수원)

초기 투자 비용은 그래픽 카드 비용을 포함하며 (RTX 3060 12GB의 경우 중고 4~5만 엔대부터)

해상도 768p까지

그녀는 텅 빈 방에 앉아 있었다. 창밖에는 빗소리가 들려왔다. 빗소리는 마치 그녀의 마음처럼 텅 비어 있었다. 그녀는 며칠 동안 아무것도 먹지 못했다. 그녀의 몸은 쇠약해져 있었다. 그녀는 마치 죽어가는 꽃처럼 앙상한 모습이었다.

그녀는 텅 빈 방에 앉아 빗소리를 들었다. 빗소리는 그녀의 슬픔을 더욱 깊게 만들었다. 그녀는 텅 빈 방에 앉아 슬픔에 잠겨 있었다. 그녀는 마치 잃어버린 아이처럼 외로웠다.

그녀는 텅 빈 방에 앉아 빗소리를 들었다. 빗소리는 그녀의 절망을 더욱 심하게 만들었다. 그녀는 텅 빈 방에 앉아 절망에 빠져 있었다. 그녀는 마치 파멸을 향해 걸어가는 사람처럼 불안했다.

그녀는 텅 빈 방에 앉아 빗소리를 들었다. 빗소리는 그녀의 고독을 더욱 짙게 만들었다. 그녀는 텅 빈 방에 앉아 고독에 잠겨 있었다. 그녀는 마치 세상에서 단절된 사람처럼 외로웠다.

1본당 약 40엔 수준 (약 0.23유로 정도의 보고)

초기 투자 없음

해상도 720p 수준

GPU 클라우드(RunPod RTX 5090)

1본당 약 27엔 (시간 160엔, 1시간 6본에 한 셈)

초기 투자 없음

해상도 768p까지 (GPU에 따라 속도가 향상됨)

공식 API

1권당 약 180엔 (768페이지 분량의 1.20달러 보고서)

초기 투자 없음

해상도 2K 지원

세 번째 제3자 API(팔 등)

1묶음당 공식 환율에 수수료가 부과되는 것이 일반적인 방식입니다.

초기 투자 없음

해상도 2K 지원

노코드 웹 서비스

一本당 플랜은 계획에 따라 무료 枠 포함

초기 투자 없음

해상도 서비스에 따름

숫자를 보면 한눈에 드러나죠. 대량 생산이라면 자체적으로 운영하는(로컬, Colab, GPU 클라우드) 3가지 선택지, 단발이나 2K 필수라면 API 기반, 시도해 보거나 샘플 테스트라면 웹 서비스로의 구별이 됩니다.

### 제13장 결국 무엇을 고르길 좋을까요

타입별 결론입니다.

자, 한 번 만들어 보는 사람

방법 7(해류 등의 웹 서비스). 5분 후에는 동영상이 생성됩니다.

RTX 3060 이상의 게이밍 PC를 보유한 분들

방법 1 (로컬 ComfyUI). RAM이 32GB라면 64GB로 업그레이드를 고려해 보세요. 전기료만으로도 무제한의 세계로 오신 것을 환영합니다.

PC는 약하지만 월 수천 엔은 지출할 수 있는 사람

방법 2(Colab) 또는 방법 3(GPU 클라우드). 현재 기준으로 이 두 가지 방법이 가장 비용 효율적이다.

앱과 서비스에 통합하고 싶은 개발자

방법 4(공식 API) 또는 방법 5(fal 등). 2K가 필요하다면 더욱더 그렇다.

ComfyUI를 이미 사용하고 있는 분들께,

저희는 ComfyUI의 새로운 기능, 특히 ‘스케치북’ 기능에 대한 여러분의 피드백을 받고 있습니다. 스케치북 기능은 여러분의 워크플로우를 더욱 효율적으로 만들어 줄 수 있는 강력한 도구입니다.

스케치북 기능에 대한 자세한 내용은 ComfyUI 공식 웹사이트 또는 관련 커뮤니티에서 확인하실 수 있습니다. 여러분의 소중한 의견을 기다립니다.

방법 1과 방법 6을 병用한다. 평소에는 768p 로컬, 결정된 커트만 API 노드를 통해 2K로 한다.

### 제14장, 여전히 남아있는 “최후의 벽”과 제가 만들어낸 것들

이 정도까지 읽고, 이렇게 생각하는 사람들이 많을 거라고 생각했을 겁니다.

선택지는 파악했다. 하지만 ComfyUI 업데이트, 모델 4 파일 다운로드 및 배치, CUDA 버전 맞춤 설정, 클라우드 포드 설정이 그것이 불가능하다고.

네, 맞습니다. H3는 “12GB 그래픽 카드에서도 작동하는” 정도까지는 왔습니다. 하지만 “누구나 작동시킬 수 있는” 정도까지는 오지 않았습니다. 오픈 웨이트의 혜택이 환경 구축이 가능한 일부 사용자들에게만 전달되고 있는 현황입니다.

그러므로 저는 이 환경 구축을 완전히 생략할 수 있는 시스템을 직접 만들어 보기로 했습니다.

목표하는 형태는 이렇습니다.

버튼을 누르면 클라우드 상에 GPU 환경이 생성되어 H3 생성 환경이 전부 설정된 상태로 바로 실행된다.

ComfyUI의 지식 없이도, 프롬프트를 입력하면 음성 동영상이 생성됩니다.

사용이 끝난 것은 그냥 버리면 됩니다. GPU 시간 대출 비용만 발생하며, API 과금은 없습니다.

즉, 대량 생산이나 자동화와 결합하더라도 비용이 선형적으로 증가하지 않는다.

사양의 벽과 환경 구축의 벽은 시스템의 측면에서 사라져 버린다. 나는 평소에 웹 서비스를 혼자서 개발하고 소비하는 것을 즐기기에, 이것은 내 영역이다. 개발 과정 또한 이 노트에서 공개될 예정이다. 관심 있는 사람은 팔로우 부탁한다.

### まとめ

MiniMax H3는 2K 해상도, 15초 길이의 음성 동시 생성 비디오 모델로, 2026년 8월 3일에 오픈 웨이트로 공개되었다.

일본은 라이선스 적용 지역 내이며, 상업적 이용도 가능합니다(표기 의무 등의 조건 하에).

양자화 버전을 사용하면 12GB VRAM GPU에서도 작동이 보고되었으며, 개인 PC 수준까지 발전했습니다.

사용하는 방법은 로컬, Colab, GPU 클라우드, 공식 API, 제3자 API, ComfyUI의 API 노드, 웹 서비스의 7가지 패턴

대량 생산 시에는 자체 호스트를 사용하고, 2K 정도의 용량이 필요하다면 API 기반을, 체험용으로는 웹 서비스를 이용하세요.

• 환경 구축을 완전히 생략할 수 있는 시스템을 직접 만들어보겠다는 결정을 내렸다. 개발 과정 또한 노트에 공개할 예정이다.

다음 회차는 로컬 ComfyUI에 대한 도입 절차를 실습 보고서 형태로 자세히 설명하는 영상입니다.↓ 검증 결과는 과연 어떨까요? ? ? 【검증】8GB VRAM의 일반적인 PC에서 화제의 MiniMax H3는 실행될까? RTX 3050의 한계에 도전한 결과

영상 생성의 민주화, 드디어 시작입니다. 이 흐름을 놓치지 마세요.

다음 기사를 놓치고 싶지 않은 분은 팔로우를 부탁드립니다.

**출처:** [note 원문](https://note.com/yuki_gpts/n/nccc4293a7e1c)

*번역: Gemma 3(.44) 초벌 + 교정 148청크*

[원문 보기](https://note.com/yuki_gpts/n/nccc4293a7e1c) | 출처: note.com