# 공의 폴더에서 코덱스에 MiniMax H3 전용 ComfyUI 구축을 요청했습니다.

> https://bookfactory.kr/c/news/8970
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-08-08T04:13:02.017Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/301010355/rectangle_large_type_2_a399684cf276960bbd78805b413be4ba.png?width=1280)

이 기사는 2026년 8월 6일 시점의 환경을 기준으로 합니다. MiniMax H3와 ComfyUI는 업데이트가 빠르므로, 도입 시에는 최신 정보도 함께 확인해 주세요.

저는 평소에 거의 매일 로컬에서 이미지와 영상을 생성하고 있습니다. 주로 사용하고 있는 ComfyUI 환경도 이미 존재하며, 모델이나 LoRA, 커스텀 노드를 용도에 맞게 조합해 놓았습니다.

이번에 MiniMax H3 공식 모델을 테스트하기 위해 기존 환경에 모두 추가할 수도 있었지만, 평소 환경과 섞이는 것을 피하고 싶었다. 새로운 모델과 VAE, 실험적인 고속화 노드를 추가한 결과, 평소 워크플로우에 영향을 주는 일이 생길까 봐 우려했다.

또 다른 이유는 MiniMax H3 주변의 움직임이 너무나 빠른 것이었다. 공개 직후부터 양자화 모델, 경량 텍스트 인코더, 새로운 VAE, 고속화 LoRA, Spectrum 등 고속화 기술, 저 VRAM용 워크플로우가 연이어 등장했다. ComfyUI 본체 측의 대응도 수일 단위로 진행되고 있어, 정보를 수집하고 이해하며, 자신 혼자서 환경에 반영하고 지속하는 것은 쉽지 않다.

그러므로 이번에는 기존 환경과 공유하지 않는 MiniMax H3 전용 폴더를 만들고, 구축과 검증을 Codex에게 맡기는 방식으로 진행하기로 했다.

제가 먼저 준비한 것은 거의 비어 있는 폴더 하나뿐이었습니다.

죄송합니다. 제공된 정보만으로는 해당 note.com 게시글의 본문 청크 7/102를 번역할 수 없습니다. “E:\000_MiniMaxH3_ComfyUI”라는 파일 이름만으로는 게시글의 내용이나 내용을 알 수 없습니다.

이 폴더를 Codex에 전달하고, ComfyUI 본체, Python 환경, GPU용 라이브러리, 필요한 커스텀 노드, 실행용 배치 파일, 확인용 스크립트까지 구축해 달라고 요청했다. 모델, 텍스트 인코더, VAE, LoRA 파일만 따로 준비된 폴더에 복사하고 있다.

MiniMax H3를 시작하는 진입 장벽도 빠르게 낮아지고 있다.

MiniMax H3의 움직임이 빠른 것은 새로운 기능이 늘어남뿐만이 아니었다. 필요한 하드웨어와 이용 방법 또한 공개된 지 수일 사이에 상황이 변화해 왔다.

X나 커뮤니티 게시물을 주시하면 RTX 3060 12GB로 MiniMax H3를 실행했다는 사례까지 발견된다. 물론 RTX 5080과 같은 GPU와 비교하면 시간이 걸리고, 시스템 RAM, 가상 메모리, SSD, 양자화 모델, 출력 해상도 등 다양한 설정을 조정해야 한다. 하지만 “최상위 GPU가 없으면 부팅조차 불가능했다”는 단계에서, 상당히 접근 가능한 GPU로 시도해 볼 수 있는 단계로 나아가고 있다.

또한, 자신의 PC에 충분한 GPU가 없는 사람들을 위해 Google Colab 상으로 MiniMax H3를 배포하는 공개 사례도 공유되기 시작했다. 로컬 PC가 없는 사람이나, 처음 한 번만 테스트해보고 싶어하는 사람들에게도 진입점이 열리고 있다.

하지만 Colab은 할당되는 GPU나 시스템 RAM, 이용 시간에 제한이 있으며 무료 枠이므로 모든 구성이 안정적으로 작동한다고 보장할 수 없다. 모델 용량도 크기 때문에 실제로 사용할 경우에는 저장 위치, 다운로드 시간, 세션 끊김에 대한 대비가 필요하다. 그럼에도 불구하고 로컬 PC인지 고액의 클라우드 서비스인지의 이중 선택이 아닌, 시도해 볼 수 있는 선택지가 늘어나는 것은 큰 장점이다.

이번 PC 환경은…

GPU：NVIDIA GeForce RTX 5080 16GB

시스템 RAM：64GB

OS: 윈도우

파이썬：3.11.15

PyTorch：2.13.0 + CUDA 13.0

ComfyUI: 공식 마스터 커밋 2eb6097

RTX 5080은 16GB VRAM이므로, 거대한 MiniMax H3를 그대로 항상 VRAM에 두는 것은 어렵다. 따라서 런칭 설정은 --lowvram을 사용하고 OS 쪽에 1GB를 예약하는 구성으로 했다. 모델의 일부를 시스템 RAM에 보관하면서 실행하기 때문에 첫 번째 로딩에는 시간이 걸리지만, 전용 환경으로는 안정적으로 처리할 수 있다.

코덱스가 설치한 것

먼저, 기존 ComfyUI와 분리된 Python 가상 환경 .venv가 생성되었고, 그 안에 RTX 5080용 PyTorch와 CUDA 관련 환경이 설치되었다.

주요 구성은 다음과 같습니다.

項目 導入内容 Python 3.11.15 PyTorch 2.13.0+cu130 Triton for Windows 3.7.1.post27 SageAttention 2.2.0 comfy-kitchen 0.2.26 翻訳ライブラリ deep-translator 1.11.4

트리톤과 세이지 어텐션은 설치 후에도 RTX 5080에서 실제로 CUDA 커널이 동작하는지 확인하는 과정을 거쳤다. 세이지 어텐션은 고속화 옵션을 사용할 수 있도록 설정되어 있지만, 최종 워크플로우에 모든 고속화를 무조건적으로 적용한 것은 아니다. 고속화 노드는 조합에 따라 화질과 안정성이 달라지므로, 하나씩 확인 가능한 형태로 구성되어 있다.

導入した主なカスタムノードは以下のとおり。

ComfyUI-KJNodes：다양한 유틸리티와 SageAttention 관련 노드들

ComfyUI-SolAttn_triton：솔 어텐션 실험용

ComfyUI-Spectrum-MiniMax-H3：MiniMax H3용 Spectrum 최적화 패키지

AlekPet 커스텀 노드: 일본어 입력을 영어로 변환하는 번역 노드

AlekPet 패키지에는 다수의 노드가 포함되어 있지만, 이번에는 특수한 환경을 복잡하게 만들지 않기 위해 필요한 DeepTranslatorTextNode만 읽어들이는 경량 구성으로 조정한 것.

시작용 start_minimax_h3.bat와 Python, PyTorch, CUDA, GPU, 모델 배치를 검사하는 verify_environment.bat도 제작되어 있다. 이후에는 런처치를 더블클릭하는 것만으로 이 전용 ComfyUI를 실행할 수 있다.

제가 올린 모델 파일

모델류는 별도 환경과 공유하지 않고, 전용 폴더에 복사했다. 배치 및 파일 구성 확인 시에는 Comfy-Org의 MiniMax H3 모델 배포 페이지를 참고하면 된다.

FL2VA용 확산 모델

REF2VA 확산 모델

Qwen3-VL-32B 기반 MiniMax H3용 텍스트 인코더

죄송합니다. 제공된 텍스트는 이미지 파일의 이름이므로, 번역할 내용이 없습니다. 파일 이름은 안전한 모델 파일(.safetensors)의 파일명이며, 텍스트 내용이 포함되어 있지 않습니다.

minimax_h3_audio_vae_fp32.safetensors 파일은 음성 파일의 메타데이터 정보입니다. 이 파일은 음성 모델과 관련된 파일이며, 무라카미 하루키, 카호 등의 인물이나 작품에 대한 내용은 포함되어 있지 않습니다. 따라서 번역할 내용이 없습니다.

MiniMax H3 Turbo LoRA

그 외에도 용도별 LoRA가 있습니다.

영상 VAE와 음성 VAE는 별도 파일이므로 둘 다 필요하다. MiniMax H3는 영상뿐만 아니라 음성도 생성하기 때문에 음성 VAE를 잊지 않도록 주의해야 한다.

API 형태의 워크플로우에서 누락된 노드를 복원

주로 사용할 예정인 워크플로우는 ComfyUI에서 API 형식의 JSON으로 내보낸 것을 전달했다. 파일 이름에 다운로드 시 (2)가 붙어 있었지만, Codex는 원 파일을 변경하지 않고 다음 이름으로 정리하여 복사해 줬다.

알겠습니다. 1차 번역문을 제시해주세요.

API 형식으로도 실행 내용과 의존 노드를 확인할 수 있습니다. 하지만 일반 워크플로우 형식과 달리 화면상의 노드 위치나 그룹과 같은 레이아웃 정보는 보존되지 않습니다. 외관을 포함하여 재사용하고 싶다면, 일반 형식도 함께 저장해 두는 것이 좋습니다.

이 API JSON에서는 사용자 정의 노드가 발견되지 않아 2개의 노드 이름과 입력 이름이 UNKNOWN으로 나타났다.

어느 날, 나는 카호에게서 전화가 왔다. 그녀는 마치 며칠 전 만난 것처럼, 마치 내가 그녀를 잊은 것처럼, “무라카미 하루키의 『1Q84』를 읽고 있는데, 너무 무서워서 잠을 못 자.”라고 말했다. 나는 그녀의 말을 듣고 웃음을 터뜨렸다. 그녀는 항상 무라카미 하루키의 작품에 대해 과장된 반응을 보였다. 마치 그녀가 그 책의 내용을 완전히 이해하고 있는 것처럼, 혹은 그 책이 그녀의 삶과 완전히 일치하는 것처럼 말이다.

“무서우면 책을 덮고 자. 너무 심하게 반응하지 마.”라고 나는 말했다. “그리고, 혹시 ‘1Q84’의 옥타곤에 대해 생각해 본 적 있니?”

카호는 잠시 침묵했다. “옥타곤? 그게 뭔데?”

“그건 무라카미 하루키가 만든 세계관이야. 1Q84의 등장인물들이 살고 있는 세상이지. 꽤 복잡하고, 현실과 환상의 경계가 모호한 곳이야.” 나는 설명했다. “그것이 너를 그렇게 무서워하게 만들었을 수도 있어.”

“정말 복잡하구나. 나는 복잡한 것을 싫어해.” 카호는 말했다. “하지만… 그 책이 너무 매혹적이야. 마치 내가 그 세계에 존재하는 것처럼 느껴져.”

스펙트럼애플라이 미니맥스 H3

코덱스는 남아있던 입력 값과 연결 관계를 바탕으로 원래 노드를 식별하고, 커스텀 노드를 도입한 후 JSON 내의 class_type과 공식적인 입력 명칭을 복원했다. 최종적으로 20개 노드를 ComfyUI의 object_info와 비교하여 미 도입 노드가 없는지 확인한다.

“4step”이라고 적힌 터보 LoRA를 8단계로 사용

이번에 사용한 고속화 LoRA는 파일 이름에 “4step”이라고 되어 있다. 하지만 이미 다른 이용자들의 검증 결과, 4~7단계에서는 영상이 깨지고, 8단계 이상으로 사용해야 한다는 정보가 있었다.

따라서, 이 환경에서는 파일명이나 메타데이터의 “4단계”를 그대로 채택하지 않고, 공식적인 검증 조건을 8단계로 고정했다. 이는 기존의 검증 결과를 운영 규칙으로 채택한 것이다.

첫 번째 워크플로우는 10단계였지만, 최종적으로 지정된 대로 8단계로 변경했다.

여기서는 상당히 중요하며, LoRA 이름에 4step이 포함되어 있더라도 현재 조합으로는 4단계가 실용적이지는 않습니다. 모델, LoRA, ComfyUI 구현 업데이트 상황을 종합적으로 고려하여 판단해야 합니다.

프롬프트도 MiniMax H3에 최적화됨

원래 프롬프트는 얕은 바다에 누워있는 여성의 정적이고 평화로운 모습과 풍경을 자세히 설명한 것이었다. 다만, 영상 생성에서는 외모뿐만 아니라 시간의 흐름에 따른 움직임, 카메라, 물리적인 변화, 소리까지 명시하는 것이 더 효과적이다.

그러면서 코덱스는 MiniMax H3를 위해 다음 3개 섹션으로 재구성했다.

어느 날, 나는 카호에게서 전화가 왔다. 그녀는 마치 며칠 전, 마치 어제, 마치 지난주, 마치 지난달, 마치 지난해도 이렇게 말하는 것 같았다. “무라카미 하루키의 『1Q84』를 읽고 있는데, 너무 재밌어. 너는 요즘 뭘 하고 있어?”

나는 대답했다. “나는… 그냥 그래. 아무것도 특별히 하고 있지 않아.”

카호는 웃음을 터뜨렸다. “너는 항상 그래. 넌 늘 특별한 일을 하고 있는 것처럼 보이지 않아. 마치 영화 속 주인공 같잖아.”

나는 웃음을 참았다. 카호는 항상 그런 농담을 했다. 그녀는 나를 묘사할 때마다 과장된 표현을 사용했다. “너는 정말 특별한 사람이야. 너는 마치… 마치 꿈속에 존재하는 사람 같아.”

나는 잠시 침묵했다. 카호의 말에 나는 약간 당황했다. 그녀는 내가 특별하다고 생각하는 것을 인정해 주지 않았다. 나는 항상 스스로를 특별한 사람이라고 생각하지 않았다. 나는 그냥 평범한 사람일 뿐이었다.

“무라카미 하루키는 정말 재밌는 작가야. 그의 작품은 마치… 마치 현실과 환상의 경계에 놓인 것처럼 느껴져. 나는 그의 작품을 읽을 때마다 새로운 것을 배우는 것 같아.” 카호는 계속해서 말했다. “너도 한번 읽어봐. 분명히 즐길 수 있을 거야.”

나는 고개를 끄덕였다. “그래, 한번 읽어볼게.”

카호는 마지막으로 말했다. “잘 지내. 다음에 또 전화할게.”

“그래, 잘 지내.” 나는 대답했다.

전화를 끊고 나는 다시 혼자 남겨졌다. 나는 카호의 말에 다시 한번 생각에 잠겼다. 그녀는 내가 특별하다고 생각하는 것을 인정해 주지 않았다. 하지만 그녀의 말은 진실일지도 모른다. 나는 항상 스스로를 특별한 사람이라고 생각하지 않았다. 하지만 카호는 나를 특별한 사람이라고 생각했다. 그리고 그것은 나에게 큰 기쁨을 주었다.

전반적인 음향 풍경

낡은 롤러 블레이드가 멈춰 서 있는 모습이 눈에 들어왔다. 낡은 롤러 블레이드는 텅 빈 공간에 놓여 있었고, ‘카호’가 읽었던 ‘나쓰메 소신의 유포’의 한 구절을 떠올리게 했다. “가끔은, 텅 빈 공간에 멈춰 서 있는 롤러 블레이드가 더 의미 있는 것일지도 모른다.” ‘무라카미 하루키’는 ‘카호’에게 이렇게 말했다. “그 롤러 블레이드를 좀 더 자세히 살펴봐. 그 롤러 블레이드는 ‘카호’의 삶을 반영하고 있을지도 몰라.” ‘카호’는 롤러 블레이드를 바라보며 자신이 잊고 지냈던 어린 시절의 기억들을 떠올렸다. 롤러 블레이드는 그녀의 잃어버린 꿈처럼 텅 빈 공간에 놓여 있었다. ‘무라카미 하루키’는 덧붙였다. “삶은 때로는 멈춰 서는 것에서 시작되는지도 모른다.”

머리카락이 물결처럼 퍼져나가는 모습, 가슴의 작은 호흡, 손이 물면을 움직여 파문이 퍼지는 것, 빛의 무늬가 움직이는 것, 카메라가 천천히 줌을 조절하는 것 등을 5초 동안 지속되는 연속 동작으로 추가했다. 환경음은 잔잔한 파도 소리, 물소리, 바람, 멀리서 날아가는 해조류에 따라 분류하여 기재했으며, 불필요한 배경음악은 N/A로 표시했다.

일본어로 입력하려면 Deep Translator 노드에서 영어로 변환한 후 텍스트 인코더로 전달할 수 있습니다. 이 번역 처리에는 인터넷 연결이 필요합니다.

첫 번째 영상은 모든 프레임이 검은색이었습니다.

환경이 완료되어 1.0MP와 0.7MP로 5초 분량의 영상을 생성한 후, 처리 자체는 정상적으로 완료되었으나, 생성된 MP4를 재생하면 영상이 완전히 검게 나타났다.

여기서 코덱스에 의한 원인 조사가 시작되었다.

먼저, MP4의 손상이나 플레이어 측의 문제인지 확인했다. 영상은 H.264로 정상적으로 저장되어 있으며, 124프레임, 24fps, 약 5.17초로 읽어낼 수 있다. 그러나 모든 프레임의 RGB 최소값, 최대값, 평균값이 모두 0이었다. 즉, 저장 후에 검게 변한 것이 아니라, VAE에서 나온 영상 자체가 완전한 검정색이었다는 의미다.

다음으로, 아래 조건들을 순서대로 제거하면서 짧은 진단용 영상을 제작했다.

스펙트럼을 비활성화합니다.

터보 LoRA를 제거하십시오.

다른 FL2VA 모델로 전환

VAE에 사용자 정의 샘플러의 별도 출력을 연결합니다.

어떤 조건이든 검은 화면은 변하지 않았습니다.

더 나아가, 현지에서 진단용 노드를 구축하여 샘플러 전후의 잠재 데이터를 직접 측정했다. 초기 잠재는 0이었지만, 샘플러 후에는 0이 아니며 NaN이나 Inf도 없는 정상적인 수치 분포가 나타났다. 즉, 모델과 샘플러는 정상적으로 작동하고 있었으며, 그 다음의 영상 VAE 디코딩에서 문제가 발생하는 것으로 좁혀졌다.

VAE를 FP32로 고정하면 완전한 검은색에서는 변화했지만, 지금은 격자 형태의 컬러 노이즈가 나타났습니다. 이는 여전히 정상적인 영상이 아닙니다.

안정 버전 ComfyUI가 신 VAE 형식에 미지원되었기 때문입니다.

여기서 “이 VAE는 최신 ComfyUI가 아니면 사용할 수 없는 것일지도 모른다”라고 생각하고 ComfyUI 본체의 최신 버전과의 차이점을 확인했다.

초기에 사용하던 것은 안정 버전 v0.30.0의 커밋 b1693ec이었다. 반면, 공식 master에는 MiniMax H3 관련 새로운 수정 사항이 추가되어 있었다.

MiniMax H3의 int8_convrot VAE 호환 #15334

VAE 파라미터 장치 변환 수정 #15268

특히 #15334는 이번에 사용 중인 minimax_h3_video_vae_int8_convrot.safetensors를 명시적으로 대상으로 한 수정이었다. 공식 설명에서도 int8_convrot 양자화 VAE에 대한 대응을 추가한 것으로 되어 있다.

그러고 나서 ComfyUI를 공식 master 커밋 2eb6097로 업데이트하고, 프론트엔드 및 워크플로우 템플릿 등의 의존성을 함께 업데이트했다.

업데이트 후, 먼저 256×384·5프레임·8단계의 짧은 영상으로 확인한 결과, 얕은 물 속에 누워있는 인물, 머리카락, 물결, 흰색 의상이 정확하게 묘사되었다. 검은 화면과 격자 노이즈도 사라졌다. 이후 5초·124프레임으로도 정상적인 영상을 생성할 수 있었다.

가장 중요한 교훈은 “모델 파일을 올바른 폴더에 배치하는 것만으로는 작동하지 않을 수 있다”는 것이었다. 새로운 양자화 형식의 모델이나 VAE에서는 대응 코드가 릴리스 태그보다 나중에 추가되는 경우가 있으며, 오류를 내지 않고 검은 화면이나 노이즈를 반환하는 경우에는 모델이나 프롬프트뿐만 아니라 ComfyUI 본체의 대응 시기도 확인해 보는 것이 좋다.

최종적으로 완성된 전용 환경

최종 구성에서는 다음 상태까지 확인되었습니다.

기존 ComfyUI와 공유되지 않는 MiniMax H3 전용 환경

RTX 5080 16GB용 저 VRAM 설정

MiniMax H3의 비디오 VAE 및 음성 VAE를 식별

터보 LoRA를 8단계로 사용

스펙트럼 노드를 포함한 API 워크플로우 복구

일본어 입력용 번역 노드를 도입

MiniMax H3용 프롬프트 템플릿 저장

SageAttention, Triton, Sol-Attn 도입 및 작동 확인

실행 배치와 환경 검증 배치를 생성했습니다.

검은 화면의 원인을 잠재 데이터까지 조사하고, ComfyUI 업데이트로 해결했습니다.

참고로, 동일 프롬프트, 동일 시드, 8단계, 5초 지정으로 측정한 결과는 다음과 같습니다.

설정 해상도, 총 처리 시간, 샘플링 시간
1.0MP (832×1248) 300.692초, 234.991초
0.7MP (704×1056) 214.583초, 153.714초

0.7MP에서는 총 처리 시간이 약 28.6% 단축되었다. 다만, 이 글에서 가장 남기고 싶었던 것은 속도 차이 자체였다. 빈 폴더에서 전용 환경을 만들고, 부족한 노드를 복원하며, 검은 화면을 데이터로 분리하고, 새로운 VAE에 대응한 ComfyUI까지 업데이트하여 마침내 정상적인 영상에 도달한 일련의 과정이었다.

이번에는 제가 준비한 것이 폴더와 모델 파일뿐이고, 환경 구축, 의존성 도입, 워크플로우 복구, 검증, 원인 조사 등은 Codex에 맡겼다. 로컬 AI 환경은 라이브러리와 양자화 형식이 복잡하지만, 실제 파일, GPU, 서버 API, 비디오 프레임, 잠재 텐서어까지 순서대로 검토하면서 “어렴풋이 작동하지 않는” 상태에서 구체적인 원인을 찾아낼 수 있다.

같은 MiniMax H3 환경을 만드는 사람들에게는 모델 이름뿐만 아니라 VAE 형식, ComfyUI 커밋, 단계 수, 커스텀 노드의 역할을 함께 기록해 두는 것을 추천한다.

**출처:** [note 원문](https://note.com/takato725/n/neacab22005d6)

*번역: Gemma 3(.44) 초벌 + 교정 52청크*

[원문 보기](https://note.com/takato725/n/neacab22005d6) | 출처: note.com