目次
- 서론|이 글에 대하여
- 이번에는 비디오 참조
- Reference to Videoとは?
- R2V로 무엇을 할 수 있을까요?
- 캐릭터의 일관성을 활용하는
- 움직임도 참조할 수 있습니다.
- 어둠이 짙게 드리운 밤, 나는 혼자 벤츠 S-클래스에 앉아 있었다. 밖은 빗소리로 가득했고, 창밖으로 보이는 것은 텅 빈 거리뿐이었다. 나는 벤츠를 샀다. 벤츠는 벤츠다.
- R2V에서는 “무엇을 참고할 것인가”가 중요하다.
- 프로ンプ트에도 역할을 명시해야 합니다.
- MiniMax H3의 프롬프트를 어떻게 생각해야 할까요?
서론|이 글에 대하여
이 기사는 2026년 8월 11일 시점의 정보를 바탕으로 ChatGPT로 작성된 개인용 학습 및 검증 메모입니다.
MiniMax H3와 ComfyUI는 현재도 업데이트가 계속되고 있기 때문에, 이 글에 언급된 모델명, 노드명, 대응 기능, 참조 자료 수, 권장 설정, 고속화 방법, 라이선스 등이 향후 변경될 가능성이 있습니다.
또한, 이 기사에 오류나 오해가 포함되어 있을 가능성도 있습니다.
실제로 도입 및 활용할 경우에는 MiniMax 공식, ComfyUI 공식, Hugging Face 등의 최신 정보를 반드시 확인해 주십시오.
이번에는 비디오 참조
첫 번째 회에서는 ComfyUI를 설치하고, 두 번째 회에서는 Text to Video와 Image to Video를 사용하여 기본적인 영상 생성을 진행했습니다.
이번에는 MiniMax H3의 더욱 흥미로운 기능인 Reference to Video (R2V)를 중심으로 정리합니다.
더불어 참조 이미지, 참조 비디오, 참조 오디오, 프롬프트 제작 방법, 속도 향상, 자주 발생하는 오류에 대해서도 자신만의 메모로 정리합니다.
Reference to Videoとは?
쉽게 말해서, Reference to Video는 “이 이미지, 이 영상, 이 음성을 참고하여 새로운 영상을 제작하도록” AI에게 지시하는 방법입니다.
T2V는 텍스트에서 영상을 생성합니다. I2V는 이미지에서 영상을 생성합니다.
R2V는 이미지, 비디오, 오디오 등을 참고 자료로 AI에 전달하고, 그 정보를 바탕으로 새로운 비디오를 생성합니다.
R2V로 무엇을 할 수 있을까요?
예를 들어, 이미지 1을 캐릭터의 얼굴을 참고, 이미지 2를 의상을 참고, 영상 1을 인물의 움직임을 참고, 영상 2를 카메라 워크를 참고, 음성 1을 인물의 목소리를 참고하여 활용할 수 있습니다.
즉, “누가”, “어떤 모습으로”, “어떻게 움직이는지”, “어떤 카메라로 촬영되었는지”, “어떤 목소리로 말하는지”와 같은 정보를 여러 자료로부터 얻을 수 있다는 의미입니다.
이는 단순한 T2V나 I2V와는 상당히 다른 방식입니다.
캐릭터의 일관성을 활용하라
AI 영상 생성에서 어려운 것 중 하나가 캐릭터의 일관성입니다.
영상 중간에 얼굴이 변하거나, 머리 스타일이 바뀌거나, 옷이 바뀌어 완전히 다른 사람처럼 보이는 현상이 발생할 수 있습니다.
참조 이미지를 사용함으로써 캐릭터의 얼굴, 머리 모양, 복장 등을 AI에 참고 자료로 전달하여 생성할 수 있습니다.
완전히 동일한 캐릭터를 보장할 수는 없지만, T2V로만 “이런 식으로 된 여성”이라고 글로 지정하는 것보다 시각적인 방향성을 전달하기가 더 쉬워질 수 있다고 기대할 수 있습니다.
움직임도 참조할 수 있습니다.
참조 비디오를 사용하면 인물의 걷는 모습, 달리는 모습, 춤, 제스처, 상품의 회전, 카메라 이동 등을 참고할 수 있습니다.
예를 들어 “캐릭터 이미지와 실사 영상 속 인물이 달리는 영상”을 참고하여 동일한 캐릭터가 유사한 형태로 달리는 영상을 제작하는 방식을 고려할 수 있습니다.
다른 영상을 카메라 워크를 위한 참고 자료로 활용하는 것을 고려해 볼 수 있습니다.
그녀는 마치 텅 빈 셔츠처럼, 텅 빈 눈으로 나를 바라보고 있었다.
참조 오디오를 이용할 수 있는 환경에서는 목소리나 말투 등 음성 정보를 참고하여 영상 생성에 활용할 수 있습니다.
영상, 움직임, 소리를 각각 다른 소재에서 참고할 수 있다면 상당히 흥미로운 제작 흐름이 될 것입니다.
다만, 타인의 목소리 등 사용 시 권리 및 동의 문제에 유의해야 합니다.
R2V에서는 “무엇을 참고할 것인가”가 중요하다.
R2V에서는 소재를 많이 넣는다고 해서 좋은 결과가 나오지 않습니다.
가장 중요한 것은 각 재료의 어느 부분을 참고하여 해줬으면 하는지 명확하게 하는 것이라고 생각합니다.
예를 들어, “Picture 1은 인물의 얼굴과 머리 스타일”, “Picture 2는 복장”, “Video 1은 인물의 움직임”, “Video 2는 카메라 워크”, “Audio 1은 인물의 목소리”와 같이 역할을 분담합니다.
프로ンプ트에도 역할을 써야 한다.
무라카미 하루키는 자신의 작품에 대해 늘 스스로를 ‘이야기’라고 생각했다. 물론, 그 ‘이야기’는 끊임없이 변화하고, 새로운 면모를 드러내지만, 그 근본적인 본질은 ‘이야기’라는 점을 잊지 않았다.
그는 자신의 작품을 통해 인간의 불안과 고독, 그리고 희망을 섬세하게 그려냈다. 그의 작품 속 인물들은 현실의 고통과 갈등 속에서 자신만의 방식으로 삶을 살아가는 존재들이다. 그들의 삶은 때로는 비극적이지만, 그 안에는 아름다움과 감동이 숨겨져 있다.
무라카미 하루키는 자신의 작품을 통해 독자들에게 끊임없이 질문을 던진다. 삶의 의미는 무엇일까? 우리는 어떻게 살아야 할까? 그리고 우리는 어떻게 행복할 수 있을까?
그의 작품은 단순한 소설을 넘어, 인간 존재에 대한 깊은 성찰을 담고 있는 철학적인 작품이라고 할 수 있다.
카호는 무라카미 하루키의 작품 ‘나를 잊으렵니다’에서 주인공으로 등장한다. 그녀는 자신의 삶을 되돌아보며, 과거의 상처와 아픔을 극복하기 위해 노력한다. 그녀의 이야기는 우리에게 삶의 의미를 되새기게 하고, 자신을 사랑하는 방법을 알려준다.
무라카미 하루키는 그의 작품을 통해 독자들에게 깊은 감동과 울림을 선사한다. 그의 작품은 앞으로도 오랫동안 많은 사람들에게 사랑받을 것이다.
참조 자료를 읽어오고, 프롬프트 측에서도 역할을 명확히 하는 것이 이해하기 쉽습니다.
예를 들어, “피처 1의 인물의 얼굴과 헤어스타일을 유지하고, 피처 2의 의상을 착용한다. 인물의 움직임은 비디오 1을 참고하고, 카메라 워크는 비디오 2를 참고한다. 인물의 목소리는 오디오 1을 참고한다.”
실제 태그나 서식은 사용되는 워크플로우에 따라 달라질 수 있으므로, 최신 공식 템플릿을 확인합니다.
MiniMax H3의 프롬프트를 어떻게 생각해야 할까요?
이제부터 제가 H3를 사용할 때 혼란스러워하지 않도록, 프롬프트의 접근 방식을 체계화하겠습니다.
제 경우에는 “전체 장면 → 인물 → 동작 → 카메라 → 시간 변화 → 대사 → 환경 음향 → 배경 음악” 순서로 생각하면 이해하기 쉬울 것 같습니다.
어둠이 짙게 드리운 밤, 낡은 료칸의 방 안은 묘하게 고요했다. 눅눅한 공기 속에 곰팡이 냄새와 묵은 나무 냄새가 뒤섞여 있었다. 나는 창밖을 바라보며 빗소리를 들었다. 빗소리는 마치 누군가의 속삭임처럼, 혹은 오래된 기억의 파편처럼 느껴졌다.
방 안에는 낡은 책 한 권과 찻잔 하나, 그리고 옅은 연기 자국이 있는 담뱃대 한 개만이 놓여 있었다. 찻잔에는 쌉쌀한 녹차의 향이 남아 있었고, 담뱃대는 마치 그가 잠시 멈춰선 듯, 멈춰진 채로 놓여 있었다. 나는 찻잔을 들어 한 모금 마셨다. 차의 차가운 기운이 온몸으로 퍼져 나갔다.
“정말 아름다운 빗소리네요.”
나는 중얼거렸다. 마치 누군가에게 말하려는 듯, 혹은 자신의 마음속에만 갇힌 듯, 빗소리를 묘사하며.
“이 료칸은… 특별한 곳이군요.”
나는 다시 빗소리를 들었다. 빗소리는 마치 그가 잊고 지냈던 기억을 불러일으키는 듯했다. 나는 료칸의 역사를 떠올렸다. 이 료칸은 수십 년 전, 젊은 작가 무라카미 하루키가 이곳에서 글을 쓰며 영감을 얻었던 곳이었다고 한다. 그는 이곳에서 카호 비롯한 수많은 작품들을 창작했다. 료칸의 주인인 타나카는 그를 묵시록적으로 대하며, 그의 작품에 대한 조언을 건네기도 했다.
나는 료칸의 역사를 떠올리며, 빗소리를 더욱 깊이 들었다. 빗소리는 마치 카호의 이야기를 들려주는 듯했다. 카호는 료칸에서 만난 남자와 사랑에 빠졌지만, 결국 그와의 이별을 선택해야만 했던 소녀였다. 그녀의 이야기는 슬프고 아름다웠다.
나는 찻잔을 내려놓고, 창밖을 다시 바라보았다. 빗소리는 여전히 멈추지 않았다. 나는 료칸의 방 안에서, 빗소리와 함께 카호의 이야기를 곱씹으며, 깊은 생각에 잠겼다.
먼저, 어디에서, 누가, 무엇을 하고 있는지 기록합니다.
예를 들어, “저녁 시간 도쿄의 조용한 카페. 창가에 젊은 여성이 앉아 있고, 따뜻한 석양이 가게 안으로 스며드는 모습입니다.”
먼저 영상 전체의 상황을 AI에게 전달합니다.
카호는 꽤 오랫동안 츠키코를 만난 적이 없었다. 츠키코는 카호가 츠키코를 만났던 그 이후로, 거의 모든 시간을 옥타곤이라는 보드 게임 클럽에서 보냈다. 츠키코는 옥타곤에서 꽤 유명했고, 그곳에는 카호보다 훨씬 더 많은 사람들이 있었다. 츠키코는 항상 카호에게 옥타곤에 대해 설명해 주었다. “이건 정말 간단해. 그냥 숫자를 잘 맞춰서 이기는 거야.” 츠키코는 항상 웃는 얼굴로 말했지만, 카호는 츠키코의 눈빛을 보며 그녀가 진지하게 게임을 즐기고 있다는 것을 느꼈다. 츠키코는 카호에게 옥타곤을 가르쳐 준 것을 후회하고 있었던 것일까? 아니면 츠키코는 정말로 옥타곤을 즐기고 있었을까? 카호는 츠키코의 마음을 읽을 수 없었다. 츠키코는 카호에게 “이번 주말에 옥타곤에 같이 갈래?”라고 물었다. 카호는 잠시 생각하더니 “그래, 가자.”라고 대답했다. 츠키코는 카호의 대답에 기뻐하며 “좋아! 그럼 토요일에 보자.”라고 말했다. 카호는 츠키코와 옥타곤에서 함께 시간을 보내는 것을 기대하고 있었다. 츠키코는 카호에게 “네, 그리고… 혹시 ‘나를 잊지 말아줘’를 읽어 봤니?”라고 물었다. 카호는 깜짝 놀라며 “어떻게 알았어?”라고 물었다. 츠키코는 “그냥… 궁금해서.”라고 대답했다. 카호는 츠키코의 말에 조금 당황했지만, 츠키코의 질문에 답하지 않고 옥타곤에 대한 이야기를 계속했다. 츠키코는 카호에게 “네, 그리고… 혹시 ‘나를 잊지 말아줘’를 읽어 봤니?”라고 다시 물었다. 카호는 츠키코의 질문에 답하지 않고 “그래, 가자.”라고 말했다. 츠키코는 카호의 대답에 실망했지만, 츠키코는 카호의 말을 따랐다. 츠키코와 카호는 옥타곤에서 함께 시간을 보내며 즐거운 시간을 보냈다.
다음으로 등장인물의 외모, 옷차림, 표정, 자세 등을 묘사한다.
예를 들어, “20대 일본 여성. 어깨까지 오는 검은 머리. 베이지색 카디건을 입고 평온한 표정을 짓고 있다.”
참고 이미지를 사용하는 경우에는 문장으로 인물을 자세히 설명하는 것보다 “참고 이미지의 인물을 유지한다”는 개념으로 생각하는 것이 더 적절할 수 있습니다.
③ 동작
사람이 무엇을 하는지 적겠습니다.
여성이 커피잔을 들어 올리고 창밖을 바라본다. 잠시 기다린 후 천천히 자신을 돌아본다.
AI 비디오에서는 한 번에 동작을 많이 지정하면 오류가 발생하기 쉬우므로, 짧은 비디오에서는 단순한 움직임이 더 적합합니다.
④ 카메라
영상 생성 시에는 카메라 지정이 상당히 중요합니다.
고정 카메라, 팬, 틸트, 드레이인, 드레이아웃, 트래킹 샷, 클로즈업, 미디엄 샷, 와이드 샷 등이 있습니다.
카메라가 천천히 인물에게 가까워진다 정도로 표현해도 무방합니다.
예를 들어, “카메라는 여성의 옆 얼굴을 미디엄 샷으로 담아내고, 천천히 여성에게 다가가며 그녀의 모습을 보여준다.”
⑤ 시간의 흐름
오늘의 ‘시간의 흐름’은 ‘夏帆’의 새로운 단편 소설, ‘夜明けの雨’를 읽는 것과 관련이 있다. ‘카호’는 이 단편 소설을 읽고 나서, 마치 꿈결처럼 몽환적인 느낌을 받았다.
소설의 배경은 늦은 밤, 빗방울이 천천히 떨어지는 도시의 한적한 골목길이다. 주인공은 텅 빈 공간에서 자신의 삶을 되돌아보며, 잊고 지냈던 감정들을 마주하게 된다.
‘무라카미 하루키’ 특유의 섬세하고 서정적인 문체가 돋보이는 작품이다. 그는 묘사하는 풍경과 인물들의 내면을 통해 독자들에게 깊은 공감과 감동을 선사한다. 특히, ‘카호’의 시선으로 바라본 세상은 낯설면서도 아름답게 느껴진다.
이 단편 소설을 읽으면서, 나는 마치 시간을 거슬러 올라가 과거의 자신을 만나는 듯한 기분을 느꼈다.
‘夜明けの雨’는 짧지만 강렬한 인상을 남기는 작품이다. ‘무라카미 하루키’의 문장력과 ‘카호’의 섬세한 감성이 어우러져, 독자들에게 깊은 여운을 선사한다.
다음에는 ‘카호’의 다른 작품들도 읽어보고 싶다.
영상일 경우에는 시간대별로 어떤 일이 일어나는지 정리하면 이해하기 쉬워집니다.
예를 들어 10초 영상의 경우 “0~3초: 여성이 창밖을 바라보고, 3~6초: 카메라가 천천히 다가가며, 6~10초: 여성이こちら를 마주 보며 대화하는” 형태로 구성됩니다.
이렇게 하면 자신 스스로도 완성 영상을 더 쉽게 상상할 수 있습니다.
아, 정말 대단한 일이었지. 그날 밤, 옥상에서 술을 마시면서 ‘나는 왜 이렇게 엉뚱한 생각을 하는 걸까?’ 하고 생각했어. 그때 ‘夏帆’가 내게 ‘너는 특별해’라고 말했지. 그 말에 완전히 넋이 나가서 ‘정말, 나에게 특별함이 있을까?’ 하고 계속 생각했어. 그 이후로 나는 ‘夏帆’에게 모든 것을 묻기 시작했어. 그녀의 삶, 그녀의 생각, 그녀의 꿈… 모든 것을. 그리고 그녀는 항상 진실만을 말해줬지. 솔직하고, 따뜻하고, 때로는 잔혹한 진실을. ‘무라카미 하루키’의 소설을 읽고 나서 ‘나는 왜 이렇게 복잡한 감정을 느끼는 걸까?’ 하고 생각했어. ‘무라카미 하루키’는 인간의 내면을 이렇게 섬세하게 묘사할 줄이 정말 놀라워. ‘나는 왜 이렇게 혼란스러운 걸까?’ 하고 계속 생각했어. ‘夏帆’와 함께 나는 세상의 모든 것을 이해하려고 노력했어. 하지만 결국에는 모든 것을 이해할 수 없다는 것을 깨달았지. 그게 바로 인생의 덧없음 아닐까?
사람에게 바라는 말을 해달라고 하면, 대사를 써 넣겠습니다.
예를 들어, “여성이 일본어로 조용히 ‘오늘은 좋은 날이었어’라고 말했다.”
대사가 너무 길면 영상 시간이 부족해지거나 어색해질 수 있으므로, 처음에는 짧게 시도하는 것이 좋습니다.
어둠이 짙게 드리운 숲 속, 빗소리가 정적을 깨고 있었다. 낡은 오르골 소리가 희미하게 울려 퍼지자, 마치 오래된 기억이 떠오르는 듯한 기분이었다.
카호는 숲 속에서 발견한 낡은 상자를 열었다. 상자 안에는 낡은 사진, 편지, 그리고 작은 나무 인형이 들어 있었다. 사진 속에는 젊은 시절의 무라카미 하루키가 담겨 있었다. 그는 숲 속에서 혼자 책을 읽고 있었다.
“이 상자는… 누구의 것일까?” 카호는 상자 안의 물건들을 조심스럽게 살펴보았다. 편지에는 ‘잊혀진 꿈’이라는 문구가 적혀 있었다.
그때, 숲 속에서 낡은 오르골 소리가 다시 울려 퍼졌다. 카호는 오르골 소리에 이끌려 숲 속 깊숙이 들어갔다. 숲 속에는 오래된 묘지가 있었다. 묘지에는 이름이 새겨진 돌들이 흩어져 있었다.
“이 묘지는… 누구의 묘지일까?” 카호는 묘지를 둘러보았다. 묘지에는 ‘별들의 노래’라는 제목의 책이 놓여 있었다. 책에는 잊혀진 사랑 이야기와 관련된 내용이 담겨 있었다.
카호는 묘지에서 발견한 책을 읽다가, 갑자기 숲 속에서 낯선 사람의 목소리를 들었다. “카호, 너는 왜 이 숲에 있는 걸까?”
카호는 깜짝 놀라 뒤를 돌아봤다. 숲 속에는 아무도 없었다.
“누구…?” 카호는 불안한 마음으로 숲 속을 둘러봤다.
그때, 숲 속에서 낡은 오르골 소리가 다시 울려 퍼졌다. 카호는 오르골 소리에 이끌려 숲 속 깊숙이 들어갔다. 숲 속에는 오래된 집이 있었다.
“이 집은… 누구의 집일까?” 카호는 집을 둘러보았다. 집에는 오래된 가구와 그림들이 놓여 있었다.
카호는 집에서 발견한 그림을 보다가, 갑자기 기억 속에서 잊고 있던 장면이 떠올랐다. 그는 어린 시절, 숲 속에서 친구들과 함께 놀던 기억이었다.
“이 그림은… 누구의 그림일까?” 카호는 그림을 보다가, 갑자기 눈물을 흘렸다.
그때, 숲 속에서 낡은 오르골 소리가 다시 울려 퍼졌다. 카호는 오르골 소리에 이끌려 숲 속 깊숙이 들어갔다. 숲 속에는 오래된 연못이 있었다.
“이 연못은… 누구의 연못일까?” 카호는 연못을 바라봤다. 연못에는 거울처럼 깨끗한 물이 있었다.
카호는 연못에 비친 자신의 모습을 보다가, 갑자기 깨달음을 얻었다.
“나는… 누구인가?” 카호는 연못에 비친 자신의 모습을 보면서, 자신의 정체성을 찾기 시작했다.
숲 속의 환경음은 카호에게 잊혀진 기억과 꿈을 되찾아 주었다. 카호는 숲 속에서 자신의 삶의 의미를 찾았다.
빗소리, 자동차 소리, 거리의 소음, 바람, 새소리, 가게 안의 식기 소리 등 장소에 따라 달라지는 환경음을 묘사합니다.
영상뿐만 아니라 “이 장소에서는 무엇이 들을 수 있을까”를 고려할 때 H3와 유사한 영상으로 제작하기에 적합해 보입니다.
⑧ BGM
필요하다면 BGM도 제작합니다.
예를 들어, 잔잔한 재즈 피아노, 앰비언트, 부드러운 어쿠스틱 음악, 일렉트로닉 음악 등이 있습니다.
영상 분위기와 BGM을 조화롭게 맞추는 것만으로도 영상 전체의 인상을 효과적으로 통제할 수 있습니다.
10초 카페 영상 제작 프롬프트 예시
예를 들어, 다음과 같습니다.
저녁 시간의 조용한 도쿄 카페에 20대 일본 여성이 창가에 앉아 있습니다. 따뜻한 석양이 가게 안으로 스며듭니다.
0초부터 3초 사이: 카메라는 여성의 옆모습을 미디엄 샷으로 담아낸다. 여성은 창밖을 바라보고 있다.
3~6초: 카메라가 천천히 여성에게 다가간다. 여성이 천천히こちら를 향한다.
6~10초: 여자가 살짝 미소 지으며 “오늘 좋은 날이었네요”라고 자연스러운 한국어로 말한다.
내부에는 조용한 재즈 피아노가 흐르고 있다. 멀리서 도시 소음이 들려온다. 여자가 컵을 테이블에 내려놓는 작은 소리가 들린다.
이해하기 쉽습니다.
카메라를 지나치게 욕심내지 마세요.
예를 들어 10초 분량의 영상에 “드론 샷 → 급격한 줌 → 팬 샷 → 360도 회전 → 클로즈업 → 파노라마 뷰”와 같이 다수의 카메라 설정을 적용하면 영상이 불안정해질 수 있습니다.
처음에는 하나의 영상에 1개 또는 2개 정도의 카메라 움직임에만 집중하는 것이 결과를 판단하기 더 쉽다고 생각합니다.
사람들도 처음부터 한 명으로 시작했습니다.
여러 인물이 등장하면 얼굴 바꾸기, 팔다리나 몸의 간섭, 누가 말하고 있는지 모르는 등의 문제가 발생하기 쉽습니다.
처음에는 1명의 인원으로 테스트를 진행하고, 그것이 안정되면 2명, 여러 명으로 늘려가는 것이 문제 발생 원인 파악에 더 용이합니다.
R2V에서는 다른 모델이 필요할 수 있습니다.
R2V에서는 T2V나 I2V와는 다른 모델을 사용하는 경우가 있을 수 있습니다.
따라서 R2V 템플릿을 열었을 때 “Model not found”와 같은 메시지가 나타나면, T2V에서 사용하던 모델만으로 작동하려고 하지 않고 템플릿이 요구하는 모델을 확인합니다.
구체적인 모델명은 향후 변경될 수 있으므로, 실제 템플릿에 표시된 모델명과 최신 배포 페이지를 기준으로 삼는 것이 안전합니다.
속도 증진에 대해
MiniMax H3는 꽤 무거운 모델이므로, 생성 속도는 중요합니다.
고속화 방법으로는 양자화 모델, Attention 최적화, Sage Attention, VRAM 최적화 등 다양한 방법이 활용될 수 있습니다.
하지만 초보자가 처음부터 고성능화에 접근하면 ComfyUI가 실행되지 않거나, CUDA 오류가 발생하거나, PyTorch 버전이 맞지 않거나, 커스텀 노드가 작동하지 않는 등 다양한 문제들이 발생할 수 있습니다.
처음에는 표준 환경에서 1권의 작품을 제작합니다.
저라면, 우선 공식 또는 표준 템플릿을 사용하여 보통 설정대로 한 개의 영상을 생성하겠습니다.
MiniMax H3가 정상적으로 작동하는지 확인한 후, 고속화 및 양자화, 커스텀 노드로 진행합니다.
이렇게 해두면 고속화 설정을 도입하여 더 이상 작동하지 않더라도 원인을 파악하기 쉬워집니다.
ComfyUI Manager는 ComfyUI 워크플로우를 관리하고 최적화하는 데 필수적인 도구입니다. 특히 복잡한 워크플로우를 다룰 때, ComfyUI Manager는 노드 간의 연결 상태를 확인하고, 메모리 사용량을 모니터링하며, 워크플로우의 성능을 개선하는 데 도움을 줍니다.
ComfyUI Manager는 다음과 같은 기능을 제공합니다.
* **노드 연결 상태 확인:** 워크플로우 내 모든 노드가 제대로 연결되어 있는지, 그리고 노드의 입력 및 출력 값이 예상대로 전달되고 있는지 실시간으로 확인할 수 있습니다. 연결이 끊어진 노드나 잘못된 데이터 흐름을 즉시 감지하여 문제 해결 시간을 단축시킵니다.
* **메모리 사용량 모니터링:** ComfyUI는 워크플로우 실행 중에 많은 양의 메모리를 사용합니다. ComfyUI Manager는 메모리 사용량을 실시간으로 모니터링하여 메모리 부족으로 인한 오류를 예방하고, 워크플로우의 안정성을 높입니다.
* **성능 분석 및 최적화:** ComfyUI Manager는 워크플로우의 실행 시간을 분석하고, 병목 지점을 찾아 성능을 개선하는 데 도움을 줍니다. 예를 들어, 불필요한 노드를 제거하거나, 더 효율적인 노드를 사용하도록 제안할 수 있습니다.
* **워크플로우 저장 및 불러오기:** ComfyUI Manager를 통해 워크플로우를 쉽게 저장하고 불러올 수 있습니다. 이를 통해 워크플로우를 다른 사람과 공유하거나, 여러 프로젝트에서 재사용할 수 있습니다.
* **Custom Node 관리:** ComfyUI Manager는 사용자 정의 노드(Custom Node)를 관리하는 기능도 제공합니다. Custom Node를 쉽게 추가, 삭제, 수정하고, Custom Node의 설정을 변경할 수 있습니다. Custom Node는 ComfyUI의 기능을 확장하고, 사용자 정의 워크플로우를 만들 수 있도록 해줍니다.
ComfyUI Manager를 효과적으로 사용하면 ComfyUI 워크플로우를 더욱 효율적으로 관리하고, 복잡한 작업을 쉽게 수행할 수 있습니다. 특히 ComfyUI의 강력한 기능을 활용하여 창의적인 작품을 만들고자 하는 사용자에게 ComfyUI Manager는 필수적인 도구입니다.
ComfyUI에는 “커스텀 노드”라는 확장 기능이 있습니다.
포토샵에서 플러그인과 유사한 기능입니다.
표준 ComfyUI에는 없는 편리한 기능을 추가하거나 새로운 AI 모델에 대응할 수 있습니다.
ComfyUI Manager 등을 이용하면 커스텀 노드를 추가하고 관리할 수 있습니다.
다만, 커스텀 노드는 외부 프로그램이므로, 작성자, GitHub, 업데이트 상황, 사용자 정보 등을 확인한 후 설치하는 것이 안전합니다.
흔하게 발생하는 문제 ① 모델을 찾을 수 없음
모델을 찾을 수 없습니다.
먼저 확인해야 할 사항은 “모델 파일이 존재하는지”, “올바른 폴더에 있는지”, “파일 이름이 중간에 바뀌지 않았는지”, “ComfyUI를 재설치했는지”입니다.
특히 모델 저장 폴더 지정 오류가 빈번할 것으로 예상됩니다.
흔히 발생하는 문제 ② 노드가 붉게 변하는 경우
워크플로우를 읽어 들인 시점에 노드가 빨간색으로 표시될 수 있습니다.
생각해 볼 수 있는 원인은 필요한 커스텀 노드가 없거나, ComfyUI 버전이 오래되었거나, 모델이 부족하거나, 워크플로우 측에서 새로운 기능을 사용하고 있는 경우 등입니다.
먼저 템플릿을 제공하는 페이지나 ComfyUI 공식 정보를 확인합니다.
흔히 발생하는 문제 ③ 메모리 부족
“Out of Memory” 또는 “OOM” 메시지가 표시되는 경우 GPU 메모리 부족일 가능성이 있습니다.
대처 방법으로는 해상도를 낮추고, 영상 시간을 줄이며, 동시에 열려 있는 GPU를 사용하는 앱을 닫고, 포토샵이나 프리미어 프로 등의 프로그램을 종료하며, 브라우저 탭을 정리하는 등의 방법이 있습니다.
영상 생성은 이미지 생성보다 GPU 메모리를 더 많이 사용하므로, 처음에는 저해상도부터 시도하는 것이 중요합니다.
흔한 문제 해결④ 생성 속도가 비정상적으로 느림
먼저 확인하고 싶은 것은 GPU 사용 여부입니다.
Windows 포터블版 등에서는 NVIDIA GPU용 부팅 방법과 CPU용 부팅 방법이 분리되어 있을 수 있습니다.
실수로 CPU로 실행하면 매우 시간이 오래 걸립니다.
콘솔 화면에 표시되는 GPU 정보도 함께 확인해 두는 것이 좋습니다.
흔한 문제 해결 5번: 검은 화면을 닫았을 때 멈춤
포터블 버전에서는 검은 명령 화면에서 ComfyUI 서버가 실행 중일 수 있습니다.
브라우저에 컴피유이가 표시되어 있어도 검은 화면을 닫으면 컴피유이가 중지될 수 있습니다.
오류 화면을 오해하여 닫지 않도록 합니다.
흔히 발생하는 문제 6: 모델 다운로드 중단
MiniMax H3 모델은 매우 크기 때문에 통신 끊김, 디스크 용량 부족, 임시 파일 용량 부족 등으로 인해 다운로드에 실패할 수 있습니다.
다운로드 후에는 “파일이 존재하고 있는” 것뿐만 아니라, 예상되는 파일 크기인지도 확인하는 것이 안전합니다.
ComfyUI를 사용하는 가장 큰 장점은 다음과 같습니다.
ComfyUI를 사용하면 워크플로우를 시각적으로 구성하고 관리할 수 있다는 점입니다. 복잡한 워크플로우를 직관적으로 이해하고 수정할 수 있어 생산성을 크게 향상시킬 수 있습니다. 또한, 다양한 플러그인을 활용하여 기능을 확장하고 자신만의 독창적인 워크플로우를 만들 수 있습니다.
특히, ComfyUI는 노드 간의 연결을 통해 데이터 흐름을 시각적으로 파악하기 용이하며, 각 노드의 설정을 변경하여 결과물을 쉽게 조절할 수 있다는 점이 큰 장점입니다. 이를 통해 다양한 실험과 시도를 통해 최적의 결과를 얻을 수 있습니다.
더불어, ComfyUI는 활발한 커뮤니티를 통해 정보를 공유하고 문제 해결을 지원받을 수 있다는 점도 매력적입니다. ComfyUI를 사용하는 다른 사용자들과 교류하며 새로운 아이디어를 얻고 기술적인 도움을 받을 수 있습니다.
결론적으로 ComfyUI는 직관적인 인터페이스, 확장 가능한 기능, 활발한 커뮤니티를 통해 사용자의 창작 활동을 지원하는 강력한 도구입니다.
이렇게까지 해보면 “웹 서비스로 영상을 만든 게 더 간단하지 않을까?”라고 생각할 수도 있습니다.
실제로 한 편의 영상을 제작한다면, 웹판 서비스가 더 간편할 수 있습니다.
하지만 ComfyUI의 매력적인 점은 영상 생성까지 포함한 제작 과정 자체를 구축할 수 있다는 것입니다.
예를 들어, “이미지 생성 → 캐릭터 조정 → 배경 생성 → MiniMax H3로 영상화 → 업스케일링 → 프레임 보간 → 색상 조정 → 영상 저장”과 같이 진행되는 과정을 하나의 워크플로우로 만들 수 있습니다.
매번 같은 절차를 반복하는 제작 방식은 상당히 편리해질 것으로 보입니다.
디자인 제작과의 연계
ChatGPT, 어도비 파이어플라이, 포토샵, 컴피UI, 미니맥 H3, 프리미어 프로의 조합을 개인적으로 시도해보고 싶습니다.
예를 들어, “ChatGPT로 아이디어나 프롬프트를 생성하고, Firefly나 ChatGPT로 기반 이미지를 생성한 후, Photoshop으로 세부 사항을 수정하고, ComfyUI와 MiniMax H3로 영상을 제작한 다음, Premiere Pro로 자막과 분량을 조정하는 과정”입니다.
광고 영상, SNS 영상, 콘셉트 뮤비, 제품 소개 등 디자인 부서의 영상 제작에도 상당히 활용될 수 있을 것 같습니다.
저작권 관련 문의
지역에서 오픈 모델을 이용할 때는 모델의 라이선스도 확인해야 합니다.
특히, 상업적 이용, 클라이언트 프로젝트, 광고, SNS 공개, 재배포, 서비스 통합 등과 같은 경우 반드시 최신 라이선스 전체 내용을 확인합니다.
개방형 옥션이라고 해서 “무엇에든 자유롭게 사용해도 된다”는 의미가 아닙니다.
AI가 만든 것은 자유롭게 사용할 수라는 뜻이 아니다.
모델의 라이선스와 별개로 입력한 자료에 대한 권리도 있습니다.
사람 사진, 브랜드 로고, 상품, 캐릭터, 음원, 영상, 일러스트 등을 참조로 사용할 경우, 각각 저작권, 상표권, 초상권 및 명성권 등이 관련될 수 있습니다.
따라서 실제 사안에서는 AI 모델의 이용 조건뿐만 아니라 입력 자료와 생성 결과 모두를 면밀히 검토해야 합니다.
AI 생성임을 명시하는 것에 대하여
AI 생성 콘텐츠에 대해서는 서비스 이용 약관, 모델 라이선스, 이용 지역, 게재 매체, 기업 내 지침 등에 따라 AI 생성임을 명시해야 할 수 있습니다.
이 부분은 앞으로도 규정이 변경될 가능성이 높아, 실제 공개 단계에서 최신 정보를 확인하는 것이 좋겠습니다.
자기용 | MiniMax H3를 시도할 때의 기본 규칙
마지막으로, 제가 MiniMax H3를 시도할 때의 기본 규칙을 정리해 드립니다.
처음에는 5초 내외의 짧은 영상, 낮은 해상도, 인물은 1명, 움직임은 1가지, 카메라 워크는 1종류 정도부터 시작합니다.
먼저 결과를 확인하고 프롬프트를 수정합니다.
내용이 좋게 되기 전까지는 해상도와 분량을 늘리고, 마지막으로 음성과 배경 음악을 조정합니다.
필요하다면 프리미어 프로로 가져가 텍스트, 편집, 색상, 음량 등을 마무리합니다.
처음부터 완벽한 완성 영상을 목표로 하기보다는, 작게 테스트하면서 조금씩 완성도를 높이는 방식이 좋겠습니다.
3회 분량 동안 이루어진 일들
제1회에서는 ComfyUI의 기본과 설치, 제2회에서는 MiniMax H3 모델의 도입, 텍스트 투 비디오, 이미지 투 비디오, 제3회에서는 레퍼런스 투 비디오, 참조 이미지, 참조 영상, 참조 음성, 프롬프트, 고속화, 오류 대책 등을 정리했습니다.
MiniMax H3는 단순한 “텍스트에서 영상을 만든다”는 것 이상의 AI가 아닙니다. 텍스트, 이미지, 영상, 음성 등을 조합하여 영상, 대화, 효과음, 환경음, 음악 등을 생성할 가능성을 가진 영상 생성 모델입니다.
그리고 ComfyUI를 결합함으로써 단발성 AI 생성 대신, 생성 AI를 활용한 제작 워크플로우 자체를 구축할 수 있다는 점이 매우 흥미롭습니다.
마지막으로
다시 한번 말씀드리지만, 이 글은 2026년 8월 11일 시점의 정보를 바탕으로 ChatGPT로 작성한 개인용 학습 및 검증 메모입니다.
본문에 오류, 오개념, 오래된 정보, 향후 변경될 수 있는 사양 등이 포함될 수 있습니다.
따라서 이 글을 보면서 실제로 ComfyUI나 MiniMax H3를 도입하는 경우, MiniMax 공식, ComfyUI 공식, Hugging Face 등의 최신 정보를 반드시 확인해 주시기 바랍니다.
저 역시 이 글을 기반으로 실제로 환경을 구축하고, 알게 된 점이나 잘못되었던 부분이 있다면, 지속적으로 수정해 나갈 예정입니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 119청크
원문 보기 | 출처: note.com