# DGX Spark를 활용하여 MiniMax H3으로 영상 생성 시도

> https://bookfactory.kr/c/news/9107
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-08-08T23:17:58.174Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/301557699/rectangle_large_type_2_589034a907aabb6dc8705d3b89f7840b.png?width=1280)

DGX Spark에서 MiniMax H3를 활용한 영상 생성 실험 결과를 정리했습니다.

## 目次

- **서론**
- 2. MiniMax H3 모델 구성
- ComfyUI를 설치합니다.
- 영상 생성 시도해 보자.
- 4-1. T2V 비디오 생성 시도
- 4-2. I2V 영상 생성 시도
- 4-3. R2V 비디오 생성 시도
- MiniMax H3 스킬스
- MiniMax H3의 고속화

최근 MiniMax H3의 성능 개선을 위해 집중적으로 노력했습니다. 특히 데이터 처리 속도 향상에 중점을 두었습니다.

구체적으로 캐싱 전략을 최적화하고 불필요한 연산을 줄이는 데 집중했습니다. 또한 새로운 알고리즘을 도입하여 데이터 처리 효율성을 극대화했습니다.

결과적으로 MiniMax H3의 응답 속도가 크게 향상되었습니다. 이전에는 몇 초에 걸렸던 작업이 이제 100분의 1 정도로 줄었습니다.

이러한 성능 개선은 사용자 경험을 향상시키는 데 크게 기여할 것으로 기대됩니다. 앞으로도 MiniMax H3의 성능을 지속적으로 개선해 나갈 것입니다.

참고: 이 내용은 MiniMax H3의 고속화 작업에 대한 내부 보고서의 일부입니다.

## 1. 서론

“MiniMax H3”는 MiniMax가 공개한 오픈 웨이트 영상 생성 모델입니다. 텍스트, 이미지, 영상, 음성을 다루며, 영상뿐만 아니라 대사, 효과음, 음악을 포함한 스테레오 음성도 동시에 생성할 수 있습니다. 출력 해상도는 24fps이며, 영상 길이는 4초에서 15초 사이입니다.

ComfyUI는 MiniMax H3를 네이티브 지원하며, 공식 템플릿 라이브러리에는 다음 3가지 종류의 워크플로우가 있습니다.

> 
> 
> ・T2V (텍스트-투-비디오): 텍스트에서 영상을 생성
> ・I2V (이미지-투-비디오): 이미지에서 영상을 생성
> ・R2V (레퍼런스-투-비디오): 이미지, 영상, 음성을 참조하여 영상을 생성
> 

이번에는 128GB의 통합 메모리를 탑재한 “NVIDIA DGX Spark”로, 이 공식 워크플로우를 순차적으로 시도해 보겠습니다.

## ## MiniMax H3 모델 구성

*   **CPU:** 인텔 코어 i7-12700
*   **GPU:** NVIDIA 지포스 RTX 3060 12GB
*   **RAM:** 16GB DDR4 3200MHz
*   **저장공간:** 512GB NVMe SSD
*   **운영체제:** Windows 11 Home
*   **기타:** Wi-Fi 6, Bluetooth 5.2

이 구성은 MiniMax H3를 통해 다양한 작업을 원활하게 수행할 수 있도록 설계되었습니다. 특히 고사양 게임이나 영상 편집 등에서 뛰어난 성능을 발휘합니다.

MiniMax H3에는 주로 FL2VA와 Ref2VA라는 두 종류가 있습니다.

FL2VA는 T2V와 I2V에서 사용하는 모델입니다. I2V에서는 first_frame에 시작 이미지를 지정하고, 필요에 따라 last_frame에 종료 이미지도 지정할 수 있습니다.

“Ref2VA”는 R2V를 위한 기능으로, 이미지, 영상, 음성을 참조하여 캐릭터, 스타일, 움직임, 카메라 워크, 음성 등을 포함한 영상을 생성할 수 있습니다.

이번에는 ComfyUI 공식 템플릿과 동일하게 다음 구성으로 진행합니다.

> 
> 
> • 확산 모델: • T2V / I2V: minimax_h3_fl2va_pruned_int8_convrot • R2V: minimax_h3_ref2va_pruned_int8_convrot • 텍스트 인코더: qwen3vl_32b_minimax_h3_nvfp4_awq • 비디오 VAE: minimax_h3_video_vae_fp16 • 오디오 VAE: minimax_h3_audio_vae_fp32
> 

## 3. ComfyUI를 설정합니다.

MiniMax H3는 ComfyUI 0.30.0 이상 버전에서 지원됩니다.

코덱(Codex)을 사용하여 컴피 UI(ComfyUI)를 설정하는 방법을 안내받았습니다.

코덱(Codex)으로 컴피 UI 실행을 지시했다.

브라우저에서 “http://localhost:8188”를 엽니다.

(4) ComfyUI의 “메뉴 → 파일 → 열기”에서 워크플로우를 선택합니다. 워크플로우 폴더에 다운로드됩니다.

![画像](https://assets.st-note.com/img/1786177892-U2vny7ulq80FXrzpmQj6TJNE.png)

공식 워크플로우의 위치는 다음과 같습니다.

> 
> 
> 죄송합니다. 제공된 JSON 데이터가 없습니다. JSON 데이터가 제공되면, 요청하신 대로 무라카미 하루키, 카호 등의 고유명사를 정확히 보존하고, 30/60 형식의 본문 청크를 자연스럽고 정확한 한국어로 번역하여 출력하겠습니다. JSON 데이터를 제공해주세요.
> 

## 영상 생성 시도해 보겠습니다.

### 4-1. T2V 비디오 생성 시도

ComfyUI의 “메뉴 → 파일 → 열기”에서 T2V 워크플로우를 선택합니다.

프롬프트에 입력하고 “실행”을 클릭하세요.

![画像](https://assets.st-note.com/img/1786178849-yag3d6e8Jvc9nUBrsFiDHXMo.png?width=1200)

생성 결과 확인. 출력 폴더에 생성됩니다.

> 
> 
> MiniMax H3의 T2V를 사용해 보고 있습니다. pic.twitter.com/tXbgp1wrXK— 布留川英一 / Hidekazu Furukawa (@npaka123) 2026년 8월 8일
> 

### 4-2. I2V 영상 생성 시도

ComfyUI의 “메뉴 → 파일 → 열기”에서 I2V 워크플로우를 선택합니다.

프로ンプ트와 이미지를 입력하고 “실행” 버튼을 클릭합니다. 이미지는 input에 배치한 후, “이미지 불러오기”에서 선택합니다.

![画像](https://assets.st-note.com/img/1786178561-bV9IrNFYj3ZAsQfTkhXP6Lue.jpg?width=1200)

![画像](https://assets.st-note.com/img/1786178734-hCB7qV015SI4X3LNUHJEua2l.png?width=1200)

입력의 최대 수는 다음과 같습니다.

> 
> 
> 이미지 1장: 시작 이미지 또는 종료 이미지
> 이미지 2장: 시작 이미지와 종료 이미지를 합한 이미지
> 

생성 결과 확인 후 output 폴더에 생성됩니다.

> 
> 
> MiniMax H3의 I2V를 사용해 보고 있습니다. — 布留川英一 / Hidekazu Furukawa (@npaka123) 2026년 8월 8일
> 

### 4-3. R2V 비디오 생성 시도

ComfyUI의 “메뉴 → 파일 → 열기”에서 R2V 워크플로우를 선택합니다.

프로ンプ트와 이미지를 입력하고 “실행”을 클릭합니다. 이미지는 input에 배치한 후, “이미지 불러오기”에서 선택합니다.

![画像](https://assets.st-note.com/img/1786178568-2GLul4ZYHPDdqbiRSrVJM7Wf.png?width=1200)

![画像](https://assets.st-note.com/img/1786178575-bDfgLQ35WwoJmEM8AHkqpXSr.png?width=1200)

워크플로우에는 이미지 불러오기 기능이 2가지가 있었지만, 이번에는 1가지만 사용하기 위해 하나를 삭제했습니다.

어색한 미소로 텅 빈 카페에 앉아 있었다. 창밖으로는 빗소리가 끊임없이 이어졌고, 그 소리는 마치 내 마음처럼 눅눅하고 답답하게 느껴졌다. 며칠 전, ‘카호’가 보낸 메시지가 눈에 선하다. “오늘 밤, ‘무라카미 하루키’의 ‘ノルウェイ의 땅’을 같이 읽고 싶어. 함께 갈래?”라고. 

‘ノルウェイ의 땅’은 우리가 처음 만났던 책이었다. 그때의 기억을 떠올리면, 마치 꿈결같다. ‘카호’는 여전히 맑고 순수한 눈빛을 하고 있었지만, 어딘가 모르게 짙어진 듯한 그림자가 드리워져 있었다. 그녀의 눈빛은 마치 오래된 영화의 한 장면처럼, 아름답기도 하고 슬프기도 했다. 

나는 그녀에게 답장했다. “좋아. 시간 맞춰 갈게.” 하지만, 마음 한구석에는 왠지 모를 불안감이 자리 잡고 있었다. ‘카호’와의 관계가, 혹은 그녀의 삶이, 어떻게 변해버린 것인지 알 수 없었다.

> 
> 
> ・참조 이미지: 최대 9장
> ・참조 영상: 최대 3개 (각 2~15초, 총 15초 이내)
> ・참조 음성: 최대 3개 (각 2~15초, 총 15초 이내)
> ・이미지, 영상, 음성 파일을 합쳐 최대 12개 파일
> 

생성 결과 확인 후 output 폴더에 생성됩니다.

> 
> 
> MiniMax H3의 R2V를 체험 중 pic.twitter.com/DBRIdlMmwQ— 布留川英一 / Hidekazu Furukawa (@npaka123) 2026년 8월 8일
> 

## MiniMax H3 기술

H3는 MiniMax의 최신 모델로 3가지 기술을 제공합니다. 각 기술은 고유한 기능을 수행하며, 사용자의 필요에 따라 조합하여 사용할 수 있습니다.

*   **기술 1: 텍스트 생성**

    H3는 주어진 프롬프트에 따라 다양한 스타일의 텍스트를 생성할 수 있습니다. 시, 소설, 에세이, 블로그 게시물 등 다양한 형식의 텍스트를 만들 수 있으며, 사용자의 요구사항에 맞춰 톤앤매너를 조절할 수 있습니다. 예를 들어, “무라카미 하루키 스타일로 사랑에 대한 짧은 시를 써줘”와 같은 프롬프트를 입력하면, H3는 무라카미 하루키 특유의 감성적인 시를 생성해 냅니다.

*   **기술 2: 이미지 생성**

    H3는 텍스트 설명을 기반으로 이미지를 생성할 수 있습니다. 사용자는 원하는 이미지의 내용을 상세하게 설명하면, H3는 그 내용을 바탕으로 이미지를 생성합니다. 예를 들어, “카호가 해변에서 책을 읽는 모습”과 같은 프롬프트를 입력하면, H3는 카호가 해변에서 책을 읽는 모습을 묘사한 이미지를 생성해 냅니다.

*   **기술 3: 코드 생성**

    H3는 다양한 프로그래밍 언어로 코드를 생성할 수 있습니다. 사용자는 원하는 코드의 기능을 설명하면, H3는 그 기능을 구현하는 코드를 생성합니다. 예를 들어, “파이썬으로 간단한 계산기를 만들어줘”와 같은 프롬프트를 입력하면, H3는 파이썬으로 작동하는 간단한 계산기를 생성해 냅니다.

각 기술은 지속적으로 업데이트되며, 새로운 기능이 추가될 예정입니다. MiniMax H3를 통해 창의적인 작업과 생산성을 향상시키세요.

MiniMax H3 공식 리포지토리의 “skills”에는 1개의 프롬프트 생성 기술과 8개의 스타일별 영상 생성 기술이 있습니다. 위 프롬프트 또한 이 기술로 생성되었습니다.

코덱스에서 스킬 “h3-프롬프트 작성”을 설치했습니다.

코덱스(Codex)에서 “h3-프롬프트 작성” 기능을 사용하여 비디오 생성 프롬프트를 생성했다.

## MiniMax H3의 고속화는 크게 세 가지 방법으로 진행되었습니다. 첫째, 캐싱을 적극적으로 활용하여 자주 요청되는 데이터를 메모리에 저장하고, 데이터베이스 접근 횟수를 줄였습니다. 둘째, 데이터베이스 쿼리를 최적화하여 불필요한 연산을 제거하고, 인덱스를 적절하게 설정하여 검색 속도를 향상시켰습니다. 셋째, 비동기 처리를 도입하여 I/O 바운드 작업을 줄이고, CPU 자원을 효율적으로 활용했습니다.

특히, 캐싱 전략은 ‘夏帆’의 데이터 접근 패턴을 분석하여 가장 빈번하게 사용되는 데이터를 우선적으로 캐시에 저장하도록 설정했습니다. 또한, 데이터베이스 쿼리 최적화 작업에서는 ‘무라카미 하루키’의 작품 데이터에 대한 쿼리 성능을 집중적으로 개선하여 전체적인 응답 시간을 단축했습니다. 이러한 노력들을 통해 MiniMax H3의 성능을 획기적으로 향상시켰습니다.

MiniMax H3는 33B 파라미터의 거대 Transformer를 사용하므로, 로컬 실행에서는 고속화가 중요합니다. 하지만 약 13B를 차지하는 AdaLN 관련 처리는 사전 계산이 가능하므로, 추론용 경량화된 버전에서는 이를 읽지 않고 바로 실행할 수 있습니다.

주요 속도 향상 기법은 다음과 같습니다.

> 
> 
> SageAttentionAttention의 계산을 저정밀화 및 최적화하여 고속화합니다. 생성 단계를 줄이는 대신 1 단계당 계산 속도를 빠르게 하는 방법입니다. Sol-AttnAttention의 계산 대상을 좁히는 방식으로 처리량을 줄이는 Sparse Attention 계열의 기법입니다. 특히 장편 또는 고해상도 영상에서 효과가 기대됩니다. EasyCache 이전 단계의 계산 결과를 재활용하여 무거운 Transformer 계산을 일부 생략합니다. 다만, H3에서는 설정에 따라 음성 품질이 저하될 수 있다는 보고도 있습니다. Spectrum 중간의 계산 결과로부터 다음 결과를 예측하고 Transformer 실행 단계를 줄여 고속화를 달성합니다. 영상이나 음성이 원래 생성 결과와 다를 수 있습니다. Accelerator LoRA 및 Turbo LoRA는 적은 단계로 생성할 수 있도록 학습된 고속화 LoRA입니다. H3에 대해서는 4 단계로 생성하는 Turbo LoRA도 존재합니다. 현재는 시험 단계이며 품질이 저하될 수 있습니다. 저해상도로 생성 후 업스케일링하여 480p 등으로 생성한 후 확대합니다. H3가 처리하는 데이터량을 줄일 수 있는 간단하면서도 효과적인 방법입니다.
> 

이들은 작동 방식이 다르므로 함께 사용할 수 있습니다. 먼저 SageAttention을 시험해 보고, 더 빠른 속도가 필요하면 EasyCache나 Sol-Attn, Turbo LoRA 등을 추가하는 것이 좋습니다. H3는 원래 Sparse Attention을 지원하도록 설계되었으나, 현재 오픈 소스 버전은 Full Attention만 제공합니다. 공식적인 Sparse Attention 구현은 곧 공개될 예정입니다.

**출처:** [note 원문](https://note.com/npaka/n/n0cbbbc57b488)

*번역: Gemma 3(.44) 초벌 + 교정 41청크*

[원문 보기](https://note.com/npaka/n/n0cbbbc57b488) | 출처: note.com