# MiniMax H3 도입 방법 ~I2V (이미지 투 비디오)

> https://bookfactory.kr/c/news/8969
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-08-08T04:08:39.396Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/300862533/rectangle_large_type_2_697328d2e4b9ca6af3e57c5f7901a13f.png?width=1280)

## MiniMax H3이란

MiniMax H3는 MiniMax가 2026년 8월 3일에 공개한 오픈 웨이트 모델로, 라이선스 범위 내에서 무료로 이용 가능한 멀티 모달 생성 AI 모델입니다. 구체적으로 텍스트, 이미지, 비디오, 음성을 입력하여 비디오를 생성할 수 있으며, 용도에 따라 여러 모델로 나뉘어 각 작업에 적합한 모델을 사용합니다.

## T2V(Text to Video)는 텍스트를 기반으로 비디오를 생성하는 기술입니다. 이 기술은 텍스트 설명을 입력하면, 그 텍스트를 시각적으로 표현하는 비디오를 자동으로 만들어냅니다.

T2V는 인공지능(AI) 기술을 활용하여 텍스트의 의미를 이해하고, 이를 바탕으로 이미지, 애니메이션, 3D 모델 등 다양한 시각적 요소를 조합하여 비디오를 제작합니다.

T2V는 광고, 마케팅, 교육, 엔터테인먼트 등 다양한 분야에서 활용될 수 있으며, 특히 콘텐츠 제작에 어려움을 겪는 개인이나 소규모 기업에게 유용한 도구가 될 수 있습니다.

최근에는 T2V 기술의 발전으로 인해 더욱 정교하고 현실적인 비디오를 생성할 수 있게 되었으며, 앞으로 더욱 다양한 분야에서 활용될 것으로 기대됩니다.

이미지 생성 경험이 있는 분이라면 익숙한 방법일 겁니다. 텍스트 프롬프트를 작성하고, 이를 바탕으로 MiniMax H3 모델에 학습된 개념을 활용하여 영상 생성을 진행합니다. 이미 Anima나 Krea2 등으로 정지 이미지를 생성할 수 있는 분이라면, 이 글에서 소개하는 I2V를 활용하는 것이 좋습니다. T2V보다 훨씬 많은 사람들이 I2V를 사용하고 싶어할 테니, 이 글에서는 T2V를 다루지 않습니다.

## I2V(Image to Video)는 이미지와 비디오를 연결하는 기술입니다. 특히, 무라카미 하루키의 소설 『夏帆』에 등장하는 장면들을 이미지로 재구성하여 짧은 비디오로 제작하는 프로젝트에서 활용되었습니다. 이 프로젝트는 단순히 책의 이미지를 영상으로 옮기는 것을 넘어, 각 장면의 분위기와 감성을 섬세하게 표현하기 위해 I2V 기술을 적극적으로 활용했습니다. I2V는 이미지의 디테일과 움직임을 분석하여 자연스러운 비디오를 생성하며, 이를 통해 독자들은 『夏帆』의 세계를 더욱 생생하게 경험할 수 있었습니다. 프로젝트 진행 중, I2V 기술의 성능 개선을 위해 다양한 이미지 데이터셋을 활용하고, 알고리즘을 지속적으로 튜닝하는 작업이 이루어졌습니다.

기존 이미지를 기반으로 프롬프트에 이미지의 개요를 기재하고, 원하는 컷 프롬프트를 여러 개 작성하여 영상 생성을 진행합니다. Wan2.2를 사용해 보신 분들은 음성이 생성되지 않는 것을 알고 계실 수 있습니다. 또한 LTX2.2에서는 음성을 생성할 수 있지만, MiniMax H3에서도 일본어 음성 합성이 가능합니다.

## Ref2V(참고 영상)

가장 복잡한 모델 중 하나인 MiniMax H3는 흔히 ‘오므니스레퍼런스 모델’이라고 불립니다. 이 모델은 이미지, 영상, 음성을 참조 자료로 제공하면, 이들을 조합하여 새로운 영상을 생성할 수 있습니다. 구체적으로는 캐릭터 디자인을 이미지로 정의하고, 움직임을 영상으로 참조하여 추출하며, 0샷 음성 합성 기능을 동시에 정의하여 통합된 하나의 영상으로 출력할 수 있습니다. 복잡하지만 매우 강력한 모델로, 공개되지 않은 Sora2에 준하는 영상을 생성하는 것도 가능합니다. 이번에는 소개에만 집중하겠지만, Ref2V의 동작 검증은 완료되었으므로 다음 기사에 자세히 다루고 싶습니다.

## 이 글의 흐름

MiniMax H3를 사용하려면 일반적으로 ComfyUI를 활용합니다. 이전 게시물을 읽고 실천하고 계시는 분들은 기존 ComfyUI를 최신 버전으로 업데이트하고 MiniMax H3 모델을 도입하면 영상 생성이 가능합니다. 이전 게시물을 읽고 Anima 설치 방법의 뒤에 MiniMax H3를 설치하는 것도 가능하지만, ComfyUI가 처음이신 분들을 위해 ComfyUI 설정 방법부터 안내해 드리겠습니다.

- 운영 환경
- Python과 Git for Windows 설치 방법

**1. Python 설치**

*   Python 공식 웹사이트에서 최신 버전의 Windows용 Python을 다운로드합니다.
*   다운로드한 설치 파일을 실행하고, 설치 시 "Add Python to PATH" 옵션을 반드시 선택합니다.
*   설치 과정에서 "Install launcher for all users (recommended)" 옵션을 선택하는 것을 권장합니다.
*   설치가 완료되면 명령 프롬프트에서 `python --version` 명령어를 입력하여 설치된 Python 버전을 확인합니다.

**2. Git for Windows 설치**

*   Git for Windows 공식 웹사이트에서 최신 버전을 다운로드합니다.
*   다운로드한 설치 파일을 실행하고, 설치 과정에서 "Use Git from Git Bash" 옵션을 선택하는 것을 권장합니다.
*   설치 과정에서 필요한 구성 요소를 선택합니다. (예: Git Bash, Git GUI, SSH, WinMerge 등)
*   설치가 완료되면 명령 프롬프트에서 `git --version` 명령어를 입력하여 설치된 Git 버전을 확인합니다.

**3. 설치 확인**

*   명령 프롬프트를 실행하고, `python --version` 및 `git --version` 명령어를 입력하여 각각 Python 및 Git이 정상적으로 설치되었는지 확인합니다.
- ComfyUI 도입

ComfyUI는 로우다이의 최신 버전으로, 노드 기반 인터페이스를 통해 더욱 직관적이고 강력한 생성형 AI 워크플로우를 구축할 수 있도록 설계되었습니다. 기존의 Flow의 단점을 보완하고, 더욱 복잡하고 정교한 이미지 생성 작업을 가능하게 합니다.

ComfyUI는 다음과 같은 주요 특징을 가지고 있습니다.

*   노드 기반 인터페이스: 다양한 노드를 연결하여 원하는 이미지를 생성하는 워크플로우를 직접 구성할 수 있습니다.
*   다양한 노드 지원: 이미지 생성, 텍스트-이미지 변환, 스타일 변환 등 다양한 기능을 제공하는 노드를 사용할 수 있습니다.
*   확장성: 커뮤니티에서 개발된 다양한 노드를 추가하여 기능을 확장할 수 있습니다.
*   성능 향상: 최적화된 워크플로우를 통해 이미지 생성 속도를 향상시킬 수 있습니다.

ComfyUI는 특히 복잡한 스타일 변환이나 여러 단계를 거치는 이미지 생성 작업에 유용합니다. 또한, 사용자 정의 워크플로우를 구축하여 자신만의 독창적인 이미지를 만들 수 있습니다.

ComfyUI를 시작하기 전에, 로우다이의 공식 문서를 참고하여 설치 및 사용법을 익히는 것이 좋습니다. 또한, ComfyUI 커뮤니티에 참여하여 다른 사용자들과 정보를 공유하고 도움을 받을 수 있습니다.
- 이전 게시물을 읽은 분들을 위한 ComfyUI 업데이트 방법
- MiniMax H3 도입 안내
- I2V(아이투비) 기술을 이용한 영상 생성

주로 명령어를 통해 설정 작업을 진행하므로, 모르는 부분은 ChatGPT에 해당 명령어를 입력하고 어떤 동작을 하는지 확인하면서 실행해 주세요. 만약 이 방법을 사용하여 ComfyUI를 설정했다면, 앞으로의 업데이트도 명령어를 통해 진행해야 합니다. 오류 등 문제 발생 시 해당 지식이 도움이 될 것입니다.

## 운영 환경

- Windows 11에서 작동하며 (Linux 환경에서도 거의 동일하지만 GPU 드라이버 및 CUDA 설정이 필요합니다).
- CPU는 Windows 11에서 지원하는 사양이라면 특별히 높은 사양이 필요하지 않습니다.
- 지포스 RTX 2000 시리즈 이상(VRAM 8GB 이상), 8GB VRAM에서도 ComfyUI의 시작 옵션으로 작동 가능합니다.
- GPU 드라이버는 최신 버전으로 업데이트하는 것이 좋습니다. CUDA 13.0용 PyTorch를 사용합니다.
- 메인 메모리가 64GB가 있다면 이상적이지만 16GB로도 작동합니다. 이 경우 `--disable-pinned-memory` 옵션이 필요합니다.
- SSD 용량은 최소 100GB 이상 여유를 두는 것이 좋습니다. MiniMax H3 모델은 거대하며, I2V/Ref2V 두 모델만으로도 약 60GB를 차지합니다.
- ComfyUI는 웹 브라우저를 통해 로컬에 연결하여 사용합니다. Chrome/Edge/Brave 등이 권장됩니다.

## 파이썬과 Git for Windows 설치 방법

**1. 파이썬 설치**

1.  파이썬 공식 웹사이트([https://www.python.org/downloads/windows/](https://www.python.org/downloads/windows/))에서 최신 버전의 Windows용 파이썬을 다운로드합니다.
2.  다운로드한 설치 파일을 실행합니다.
3.  “Python을 PATH에 추가” 옵션을 반드시 선택합니다. 이 옵션을 선택하면 명령 프롬프트에서 `python` 명령어를 사용할 수 있습니다.
4.  “설치 Now”를 클릭하여 기본 설정으로 파이썬을 설치합니다. 또는 “사용자 지정 설치”를 클릭하여 설치 경로를 변경하거나, 특정 컴포넌트만 선택하여 설치할 수 있습니다.

**2. Git for Windows 설치**

1.  Git for Windows 공식 웹사이트([https://gitforwindows.org/](https://gitforwindows.org/))에서 Git for Windows를 다운로드합니다.
2.  다운로드한 설치 파일을 실행합니다.
3.  “Windows에서 Git 사용” 옵션을 선택합니다.
4.  “설치” 버튼을 클릭하여 Git for Windows를 설치합니다.
5.  설치 과정에서 “Git 설치 과정 애니메이션 실행” 옵션을 선택하면 Git 설치 과정에서 애니메이션이 표시됩니다.
6.  설치가 완료되면, 명령 프롬프트에서 `git --version` 명령어를 입력하여 Git이 제대로 설치되었는지 확인합니다.

**3. 설치 확인**

*   명령 프롬프트(cmd)를 실행합니다.
*   `python --version` 명령어를 입력하여 파이썬 버전이 출력되는지 확인합니다.
*   `git --version` 명령어를 입력하여 Git 버전이 출력되는지 확인합니다.

이제 파이썬과 Git for Windows가 정상적으로 설치된 것입니다. 이 두 도구를 사용하여 다양한 개발 작업을 수행할 수 있습니다.

파이썬은 버전 3.13.15를 사용합니다. 이는 Comfy.Org의 공식 문서에서 권장하는 버전이며, 사전 빌드 바이너리(파이썬 패키지)를 도입할 때 바이너리 레벨에서 3.13 계열로 호환성을 유지할 가능성이 있기 때문입니다. 패치 레벨에서 업데이트가 있었다면 Windows용 빌드가 제공된다면 업데이트하는 것이 좋습니다. 보안 패치가 있는 경우에는 위험을 줄일 수 있습니다. 하지만 실행 중인 환경에서 교체하려면 venv를 다시 구축해야 합니다. 특히 ComfyUI에 `--listen` 옵션을 사용하지 않고 인터넷을 통해 이용할 계획이 없다면 무리하게 업데이트하지 않는 것이 타당한 생각일 수 있습니다.

- 파이썬 다운로드 URL: https://www.python.org/ftp/python/3.13.15/python-3.13.15-amd64.exe

Git for Windows를 최신 버전으로 설치하고, 설치 시 업데이트가 있는 경우 업데이트 알림을 표시하는 옵션을 선택하세요. Git은 직접 인터넷을 통해 소스 코드를 다운로드하는 툴이므로 보안 패치를 반드시 적용해야 합니다.

- Git for Windows 다운로드 URL: https://github.com/git-for-windows/git/releases/download/v2.55.0.windows.3/Git-2.55.0.3-64-bit.exe

다운로드 가능하다면 어떤 것을 먼저 설치해도 괜찮습니다. 다만 Python과 Git을 시스템 PATH 변수에 설정해 주시기 바랍니다. 그렇지 않으면 매번 터미널에서 `set PATH=C:\~\\Python\\bin;%PATH%`와 같이 실행해야 합니다. Git for Windows는 기본적으로 PATH 환경 변수에 추가되므로 그대로 진행하시면 됩니다. 편집기 선택은 VSCode를 설치해 둔 경우 VSCode를 선택해 주세요. 설치하지 않은 경우에는 Notepad를 지정해도 괜찮습니다. 본 기사의 범위에서는 편집기를 거의 사용하지 않으므로 Notepad로도 문제가 없습니다.

![画像](https://assets.st-note.com/img/1785977883-s1d9XuMTIawK75ZUqnQcmiHe.png?width=1200)

![画像](https://assets.st-note.com/img/1785977914-syiqRe4KxvtZJNuhlQ0IMc72.png?width=1200)

![画像](https://assets.st-note.com/img/1785977942-ZMYOXFs2HDyVkhSlLc4v0xdQ.png?width=1200)

![画像](https://assets.st-note.com/img/1785977964-GE6z7PBF9sxjfUdrYC8ORAQw.png?width=1200)

## ComfyUI 설치 안내

ComfyUI는 강력한 노드 기반 인터페이스를 제공하는 AI 이미지 생성 플랫폼입니다. 이 튜토리얼에서는 ComfyUI를 설치하고 기본적인 사용법을 익히는 방법을 안내합니다.

1.  ComfyUI 다운로드

ComfyUI는 공식 웹사이트에서 다운로드할 수 있습니다. [https://github.com/comfyanomaly/comfyui](https://github.com/comfyanomaly/comfyui) 에서 최신 버전을 다운로드하여 압축을 풉니다.

2.  ComfyUI 실행

다운로드한 압축 파일을 실행하여 ComfyUI 실행 파일을 찾습니다. 실행 파일을 더블 클릭하여 ComfyUI를 실행합니다.

3.  초기 설정

ComfyUI를 처음 실행하면 몇 가지 초기 설정을 진행해야 합니다.

*   GPU 설정: ComfyUI는 GPU를 사용하여 이미지 생성을 가속화합니다. GPU가 제대로 설치되어 있고 ComfyUI에서 인식되는지 확인합니다.
*   모델 설정: ComfyUI는 다양한 AI 모델을 지원합니다. 원하는 모델을 선택하거나 다운로드합니다.
*   메모리 설정: ComfyUI는 이미지 생성에 필요한 메모리를 설정합니다. GPU 메모리가 부족하면 이미지 생성 속도가 느려질 수 있습니다.

4.  첫 번째 이미지 생성

ComfyUI 인터페이스를 살펴보고 노드를 연결하여 이미지를 생성해 봅니다. 간단한 프롬프트를 입력하고 노드를 연결하여 이미지를 생성해 보세요.

5.  추가 정보

ComfyUI에 대한 자세한 내용은 공식 웹사이트의 문서를 참조하세요. [https://github.com/comfyanomaly/comfyui](https://github.com/comfyanomaly/comfyui)

이번에는 마뉴얼 설치 ComfyUI v0.30.2를 도입합니다. 앞 글에서 설정이 완료된 ComfyUI가 있는 경우 업데이트 방법은 다음 섹션에서 설명합니다.

## **ComfyUI 설치 방법**

1.  **Windows:**
    *   ComfyUI Windows 버전을 다운로드하여 설치 마법사의 지시를 따릅니다. 설치 과정에서 CUDA 툴킷 등 필요한 드라이버가 설치되었는지 확인합니다.
2.  **macOS:**
    *   ComfyUI macOS 버전을 다운로드하여 설치 마법사의 지시를 따릅니다. macOS에서 ComfyUI를 실행하려면 Rosetta 2를 활성화해야 할 수 있습니다.
3.  **Linux:**
    *   ComfyUI Linux 버전을 다운로드하여 설치 마법사의 지시를 따릅니다. Python, PyTorch 등 Linux 환경에 맞는 패키지가 설치되었는지 확인합니다.
4.  **설치 후 확인 사항:**
    *   ComfyUI가 정상적으로 실행되는지 확인하고, 버전 정보를 확인합니다(메뉴 > 설정 > 정보). 최신 업데이트를 확인하고 설치합니다(메뉴 > 설정 > 업데이트).
5.  **문제 발생 시:**
    *   ComfyUI 공식 웹사이트의 FAQ를 참고하거나 커뮤니티 포럼에 질문합니다(https://discourse.comfyui.com/).
6.  **참고:** ComfyUI는 GPU를 사용하여 실행되므로, GPU가 제대로 설치되어 있고 드라이버가 최신 버전인지 확인하는 것이 중요합니다.

이 작업에서는 Windows 명령줄을 사용합니다. Windows 키 + R을 눌러 cmd를 입력하고 터미널을 엽니다.

다음 명령어를 아래와 같이 한 줄씩 복사하여 붙여넣고 실행해 주세요. 각 줄을 붙여넣은 후엔 엔터/리턴 키를 눌러 실행합니다. 전체 내용을 복사하여 붙여넣어도 작동은 하지만, 문제가 발생했을 때 파악하기 어려우므로 한 줄씩 실행하는 것이 좋습니다. 터미널에서 오른쪽 클릭하면 명령어를 붙여넣을 수 있습니다.

PyTorch를 먼저 설치하는 이유는 requirements.txt에서 설치하면 CPU 버전만 설치될 수 있기 때문입니다.

여기 문제는 기본 ComfyUI가 실행될 때마다 Python 가상 환경을 활성화하고 `python`으로 스크립트를 실행해야 한다는 점입니다. 그래서 쉽게 실행할 수 있도록 배치 파일을 만들어 봅시다.

Windows 키 + R을 누르고 `notepad`를 입력하여 메모장을 실행하고, 다음 중 본인 환경에 맞는 내용을 붙여넣어 주세요.

- VRAM 16GB 환경에서 메인 메모리도 64GB를 갖는 경우
- VRAM 12GB 환경에 적합합니다.
- VRAM 8GB 환경이나 메인 메모리가 부족한 환경에 해당합니다. 만약 VRAM 8GB 환경에서 실행하고 싶거나, 메인 메모리가 64GB 미만인 경우 `--enable-manager` 뒤에 `--disable-pinned-memory`를 추가해주세요. 이 옵션은 VRAM에 올라가지 않은 모델의 일부를 메인 메모리에 배치하지 않고, 필요에 따라 SSD에서 읽어오는 옵션입니다. RTX 5060(VRAM 8GB) + 16GB 메인 메모리 환경에서도 실용적인 시간 내에 작동하며, 0.4Mp(해상도 864x480)로 5초 분량의 영상을 생성할 경우 약 7~8분 내에 생성할 수 있습니다.

이 텍스트를 `C:\Software\ComfyUI\run.bat`에 저장하십시오. 확장자가 `.txt`가 되었다면, 탐색기에서 `C:\Software\ComfyUI`로 이동하여 `run.bat.txt`를 `run.bat`로 이름 변경하십시오. 매번 탐색기를 따라가는 것이 번거롭다면, 데스크탑에 바로 가기를 만들어 두는 것도 좋습니다.

## 이전 게시물을 읽은 분들을 위한 ComfyUI 업데이트 방법

이 단계를 따르면 오류가 발생하는 경우, ChatGPT에 터미널 텍스트를 선택하여 붙여넣고 원인을 찾아보세요. 이 기사에서는 Python 3.13.15를 사용하고 있지만, 이미 3.12.10을 사용하고 있는 경우에는 venv의 재구성이 필요하다는 점에 유의해 주세요. 번거롭다면 `C:\Software\ComfyUI`를 `ComfyUI-v0.27.0` 등으로 변경하고, 상단의 섹션부터 시작해도 괜찮습니다.

`git commit -a -m "requirements.txt 변경됨."` 해당 부분은 `requirements.txt` 파일 내 torch 관련 항목을 주석 처리했을 때 필요하며, ComfyUI Git 저장소를 변경하지 않은 경우에는 필요하지 않습니다.

## MiniMax H3 도입에 대한 정보입니다.

ComfyUI에서 MiniMax H3 템플릿을 열면 필요한 모델 다운로드가 실행되지만, 안정적인 환경에서 수동으로 다운로드하여 배치하는 것이 더욱 확실합니다. ComfyUI 상에서 다운로드 시 실패하면 중단 없이 재개되지 않을 수 있습니다.

MiniMax 공식은 Hugging Face에서 다운로드할 수 있도록 제공되었으며, 웹 브라우저에서 각각 개별적으로 다운로드하여 지정된 경로로 이동하십시오.

- MiniMax H3 I2V 모델 (https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors)

설치 장소

MiniMaxH3 폴더는 없으므로 탐색기를 사용하여 직접 만들어 주십시오.

- MiniMax H3 텍스트 인코더 모델: https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

설치 장소

MiniMaxH3 폴더는 없으므로 탐색기를 사용하여 직접 만들어 주십시오.

- MiniMax H3 비디오 VAE/오디오 VAE 모델: https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_video_vae_fp16.safetensors, https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_audio_vae_fp32.safetensors

장소 배정

MiniMaxH3 폴더는 없으므로 탐색기를 사용하여 직접 만들어 주십시오.

## I2V 기술을 이용한 영상 생성에 대해 알아보겠습니다.

I2V는 텍스트 설명을 기반으로 고품질의 영상을 생성하는 기술입니다. 즉, 사용자가 원하는 장면을 텍스트로 입력하면, I2V가 이를 바탕으로 영상을 만들어 줍니다.

최근 실험 결과, I2V는 텍스트 설명을 매우 정확하게 반영하는 영상을 생성할 수 있다는 것을 보여주었습니다. 특히, 복잡한 장면이나 다양한 스타일의 영상을 생성하는 능력은 기존 영상 생성 기술보다 훨씬 뛰어납니다.

무라카미 하루키의 소설 ‘나의 유턴’을 I2V에 입력하여 영상을 생성해 보았을 때, 소설의 분위기와 주요 장면을 잘 담아낸 영상이 만들어졌습니다. 또한, 카호가 등장하는 장면을 묘사하는 데에도 I2V는 매우 효과적인 결과를 보여주었습니다.

I2V 기술은 앞으로 영화, 광고, 게임 등 다양한 분야에서 활용될 가능성이 높습니다.

이곳까지 오셨다면 ComfyUI를 실행하세요. 앞서 만든 C:\Software\ComfyUI\run.bat 파일을 더블클릭하여 실행합니다.

콘솔에 로컬 URL이 표시되어 있으면 성공입니다. URL 부분을 Ctrl+클릭하면 웹 브라우저에서 ComfyUI가 실행됩니다.

## 템플릿 열기

워크플로우를 수동으로 구축하는 것은 어렵기 때문에, MiniMax H3 템플릿을 활용하는 것이 좋습니다. ComfyUI 툴바에서 템플릿을 클릭하고 검색 상자에 ‘MiniMax’를 입력하면 MiniMax H3 이미지에서 영상으로 템플릿이 나타납니다.

![画像](https://assets.st-note.com/img/1785978002-7nlG5V6AaUOo1uvHzjsXYfKh.png)

![画像](https://assets.st-note.com/img/1785978020-J4IGnQmC2ObNKUgvRMohA50u.png?width=1200)

![画像](https://assets.st-note.com/img/1785978051-av0kBNeP3z5bLmuEQM7flFW4.png?width=1200)

여기에서 모델은 템플릿이 예상하는 경로와 다릅니다. 따라서 각각 다음과 같이 수정합니다.

- 카호는 멍하니 창밖을 바라봤다. 빗방울이 얇게 흩뿌려진 거리 풍경은 마치 낡은 영화의 한 장면 같았다. 그녀는 며칠 전, 무라카미 하루키의 『나를 잊어선 안 되는 사람』을 읽다가 문득 이런 생각을 했다. 삶은 결국 텅 빈 공간으로 향하는 여정이라는 말이다. 

그녀는 책을 덮고, 다시 빗소리에 귀를 기울였다. 빗소리는 마치 그녀의 마음처럼 복잡하고 혼란스러웠다. 그녀는 자신이 왜 이렇게 불안한지, 무엇을 해야 할지, 그리고 무엇을 원하는지 알 수 없었다. 

그때, 그녀의 휴대폰이 울렸다. 화면에는 ‘MiniMaxH3/minimax_h3_fl2va_pruned_int8_convrot.safetensors’라는 이름의 파일이 표시되어 있었다. 그녀는 그 이름이 무엇인지 전혀 알지 못했지만, 왠지 모르게 그 파일이 자신에게 중요한 것 같다는 느낌을 받았다.
- 카호는 그런 생각을 하면서 옥탑방 창밖을 바라봤다. 옥탑방은 낡고 좁았지만, 그녀에게는 세상에서 가장 멋진 공간이었다. 옥탑방에서 바라보는 도시는 마치 그림처럼 아름다웠고, 그녀는 이곳에서 자신만의 이야기를 만들어갈 수 있다고 믿었다.

그녀는 최근에 읽은 무라카미 하루키의 소설 『1Q84』에 깊은 인상을 받았다. 소설 속 주인공들이 겪는 기묘한 모험과 사랑 이야기는 그녀에게 큰 영감을 주었다. 특히, 소설 속 주인공 ‘시로’의 묘사가 그녀의 마음을 사로잡았다. 시로는 엉뚱하고 기계적인 면모를 동시에 가지고 있었지만, 그 안에서 인간적인 따뜻함과 깊이를 느낄 수 있었다. 카호는 시로처럼 자신만의 방식으로 세상을 바라보고, 자신만의 이야기를 써내려갈 수 있기를 희망했다.
- `vae_name` → `MiniMaxH3/minimax_h3_video_vae_fp16.safetensors`
- 카호는 텅 빈 방에 앉아 있었다. 창밖으로는 잿빛 하늘이 엿보였고, 빗소리가 희미하게 들려왔다. 그녀는 며칠 동안 멈춰 있던 시간을 다시 시작해야 했다. 

그녀는 낡은 노트북을 열고, 며칠 전부터 계속해서 멈추지 않았던 웹사이트의 링크를 클릭했다. 링크는 그녀를 ‘MiniMaxH3/minimax_h3_audio_vae_fp32.safetensors’라는 파일로 이끌었다. 그녀는 이 파일이 무엇인지, 왜 자신에게 보내졌는지 알지 못했지만, 묘하게 끌리는 느낌을 받았다. 마치 오래된 친구를 다시 만난 듯한, 혹은 잃어버린 기억을 되찾는 듯한 기분이었다. 

파일을 다운로드하고 압축을 풀자, 낯선 이름의 오디오 VAE 모델이 나타났다. 그녀는 이 모델이 무엇을 하는 것인지, 어떻게 활용해야 하는지 전혀 알지 못했다. 하지만 그녀는 이 모델을 통해 무언가를 만들어내고 싶었다. 

그녀는 며칠 동안 이 오디오 VAE 모델을 실험하며 다양한 시도를 해보았다. 그녀는 모델에 텍스트를 입력하고, 모델이 생성하는 오디오를 듣고, 모델이 생성하는 오디오를 기반으로 새로운 음악을 만들려고 노력했다. 그녀는 이 과정을 통해 자신을 돌아보고, 자신의 내면을 탐구하며, 자신만의 이야기를 만들어가고 있었다.

![画像](https://assets.st-note.com/img/1785978064-FWiPpoA7MUltvqZbKhCseDgz.png?width=1200)

## I2V에 사용되는 이미지 설정

다음으로 I2V에 사용할 이미지를 설정합니다. ComfyUI 워크플로우상의 ‘이미지 읽기’ 노드에 탐색기에서 사용할 이미지를 드래그 앤 드롭합니다. 그러면 다음과 같은 화면이 나타납니다. 이미지 자체는 Anima나 ChatGPT로 생성한 것이든 상관없습니다. 사용 예시 이미지는 아래에 첨부했으니 다운로드하여 설정해도 됩니다.

![画像](https://assets.st-note.com/img/1785978088-ClX7RqhIzSmt1bxTfeLj28rE.png?width=1200)

![画像](https://assets.st-note.com/img/1785978537-PWE3THdJGcrbmlgDp6L9ICaA.jpg?width=1200)

## 프롬프트 설정

템플릿에서 일부 텍스트를 수정하여 이 이미지를 조작할 수 있도록 합시다.

## 이미지 비율 설정

가로 긴 소스 이미지이므로 3:4 (포트레이트 스탠다드)를 선택합니다.

![画像](https://assets.st-note.com/img/1785978584-HL4Pcs8JoeWBtpV9d1nz0bj2.png)

## 무라카미 하루키는 최근 자신의 소셜 미디어에 영상 생성에 대한 생각을 공유했습니다. 그는 특히 ‘카호’가 출연한 영화 ‘나 홀로 집에 2’를 보면서 영상 편집의 중요성을 깨달았다고 밝혔습니다.

“영상 편집은 마치 이야기를 다듬는 것과 같다”고 말하며, 영상 편집 기술을 통해 자신의 작품에 더욱 깊이와 감성을 더할 수 있을 것이라고 기대하고 있습니다. 그는 앞으로 자신의 소설을 기반으로 한 영상 콘텐츠 제작에도 관심을 보이며, 다양한 시도를 통해 새로운 가능성을 탐색할 계획입니다. 특히, 영상 편집 프로그램에 대한 학습을 통해 자신의 비전을 실현하는 데 집중할 것이라고 덧붙였습니다.

ComfyUI 상단에 있는 “실행”이라는 하늘색 버튼을 누릅니다. 이렇게 하면 비디오 생성 작업이 시작됩니다. 생성 작업이 완료되면 ComfyUI 상단에서 미리 볼 수 있습니다. “비디오 저장” 노드의 왼쪽 하단에 있는 재생 버튼을 누르세요.

![画像](https://assets.st-note.com/img/1785978597-SOxovwgkeUhtmndWz5bAJZPY.png)

생성된 비디오는 C:\Software\ComfyUI\outputs\Video\ 폴더에 출력됩니다. 다음은 생성 결과 예시입니다.

## 후기사

이 부분까지는 기본적인 I2V 기반 영상 생성은 완료되었습니다. 템플릿 프롬프트를 살펴보면,

- 영상 스타일을 지시하고, 이미지에 등장하는 피사체의 특징을 묘사하며, `<Picture 1>`에서 캐릭터를 인식한다.
- 장면: 캐릭터의 외모와 배경 상황을 묘사
- 샷 n:에서 샷당 캐릭터의 동작을 묘사
- 오디오: 캐릭터에게 말해 줄 일본어 텍스트 지정

이런 식으로 되어 있습니다.

더 자세한 프롬프트 묘사에 대해 알고 싶다면 MiniMax H3의 공식 문서를 읽어보세요.

- ## 비디오 프롬프트 작성 가이드

**개요**

이 가이드는 MiniMax-H3 모델을 사용하여 비디오 프롬프트를 생성하는 방법을 안내합니다. MiniMax-H3는 텍스트 프롬프트에서 비디오 프롬프트를 생성하는 데 특화된 모델입니다. 이 가이드는 모델의 기본 사용법과 효과적인 프롬프트 작성에 대한 팁을 제공합니다.

**1. MiniMax-H3 모델 소개**

MiniMax-H3는 Hugging Face에서 제공하는 모델로, 텍스트 프롬프트의 의미를 이해하고 이를 기반으로 비디오 프롬프트를 생성합니다. 이 모델은 다양한 비디오 스타일과 내용에 대한 프롬프트를 생성할 수 있도록 훈련되었습니다.

**2. 프롬프트 작성 방법**

MiniMax-H3를 사용하여 비디오 프롬프트를 생성하려면 다음과 같은 사항을 고려해야 합니다.

*   **명확하고 구체적인 프롬프트:** 모델은 명확하고 구체적인 프롬프트를 더 잘 이해합니다. 원하는 비디오의 내용, 스타일, 분위기를 명확하게 설명하십시오.
*   **키워드 사용:** 비디오의 핵심 키워드를 프롬프트에 포함시키십시오. 예를 들어, “해변”, “서핑”, “일몰”과 같은 키워드를 사용하면 모델이 해당 내용을 기반으로 비디오를 생성합니다.
*   **스타일 지정:** 원하는 비디오 스타일을 명시적으로 지정하십시오. 예를 들어, “애니메이션 스타일”, “실사 영화 스타일”, “유화 그림 스타일”과 같이 스타일을 지정할 수 있습니다.
*   **분위기 설정:** 비디오의 분위기를 설정하는 데 도움이 되는 단어를 사용하십시오. 예를 들어, “밝고 긍정적인”, “어둡고 신비로운”, “따뜻하고 편안한”과 같은 분위기를 설정할 수 있습니다.
*   **예시 프롬프트:**
    *   “해변에서 서핑하는 젊은 남자의 실사 영화 스타일 비디오”
    *   “숲 속에서 걷는 소녀의 애니메이션 스타일 비디오”
    *   “밤하늘 아래에서 별을 바라보는 커플의 유화 그림 스타일 비디오”

**3. 모델 사용 방법**

MiniMax-H3 모델을 사용하려면 Hugging Face의 MiniMax-H3 저장소를 클론하고 모델을 로드해야 합니다. 모델에 프롬프트를 입력하면 모델은 해당 프롬프트에 대한 비디오 프롬프트를 생성합니다.

**4. 추가 정보**

*   **모델 문서:** MiniMax-H3 모델에 대한 자세한 내용은 Hugging Face 저장소의 문서를 참조하십시오. ([https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO\_PROMPT\_WRITING\_GUIDE\_base\_en.md](https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md))
*   **커뮤니티:** MiniMax-H3 커뮤니티에 참여하여 다른 사용자와 경험을 공유하고 질문을 할 수 있습니다.

**5. 주의 사항**

*   MiniMax-H3 모델은 아직 개발 중인 모델이므로 생성된 비디오 프롬프트의 품질이 항상 완벽하지 않을 수 있습니다.
*   모델의 출력 결과를 주의 깊게 검토하고 필요에 따라 프롬프트를 수정하십시오.

MiniMax H3 도입, 수고하셨습니다.

**출처:** [note 원문](https://note.com/w_studio_tech/n/nc59729cfcc8e)

*번역: Gemma 3(.44) 초벌 + 교정 53청크*

[원문 보기](https://note.com/w_studio_tech/n/nc59729cfcc8e) | 출처: note.com