최근에는 로컬 환경에서도 사용 가능한 영상 생성 AI인 ‘MiniMax H3’에 대해 관심을 가지고 있었다. 普段からComfyUIを使って動画生成をしているので、 RTX 5060 Ti 16GB로도 MiniMax H3는 실용적으로 실행될 수 있을까? 계기에 신경 쓰여 실제로 시도해 보기로 했습니다. 처음에는 ComfyUI에 제공된 표준 템플릿부터 시작합니다. 그것으로부터 고속화를 위해 LightX2V LoRA와 H3 Turbo를 도입하고, PyTorch의 CUDA 환경을 재검토하면서, 0.5MP 0.6MP 0.8MP 1.0MP 10~15초 4단계 / 6단계 점차 조건을 높여갔습니다. 결국에는 RTX 5060 Ti 16GB로 1.0MP 해상도, 15초 촬영, 4step 영상 생성까지 완료됨. 하지만 그렇게까지 진행하면 생성 시간이 상당히 길어집니다. 이번에는 실제로 테스트해 본 생성 시간, VRAM, 화질, 얼굴 안정성 등을 종합적으로 검토해 보았습니다. 이번 검증 환경 이번에 사용한 PC 환경은 다음과 같습니다. OS: 윈도우 GPU:NVIDIA GeForce RTX 5060 Ti 16GB RAM: 약 80GB 컴포즈 UI 안정성 행렬 MiniMax H3 동적 VRAM 활용량 중간부터 가속화를 위해 Kijai LightX2V LoRA H3 터보 샘플러 또한 사용하고 있습니다. 또한, 검증 시작 시점에 PyTorch가 사용되었습니다. PyTorch 2.11.0 + cu128 그녀는 마치 텅 빈 셔츠처럼, 텅 빈 듯한 느낌을 풍겼다. 나머지 부분에서는 이것을. PyTorch 2.11.0 + cu130 변경 중입니다. 이 변경 전후에도 상당히 흥미로운 차이가 나타났습니다. 먼저 ComfyUI 표준 템플릿에서 H3를 시도해 보겠다. 처음부터 라이트엑스투비(LightX2V)를 사용한 것은 아닙니다. 먼저 ComfyUI에 준비되어 있는 MiniMax H3의 표준 템플릿을 사용하여 RTX 5060 Ti 16GB로 H3를 실행할 수 있을까요? 확인했습니다. 결과적으로, 이동합니다. 16GB VRAM으로도 MiniMax H3를 이용한 영상 생성 자체는 가능했습니다. 하지만 문제는 생성 시간입니다. 실제로 시도했을 때 결과는 다음과 같이 나타났습니다. 0.4MP 또는 0.6MP로도 생성할 수 있습니다. 하지만 해상도나 영상 시간을 늘려갈수록 급격히 무거워졌습니다. 특히 0.8MP·10초에서는 이대로 기다리는 것이 현실적이지 않다고 판단하여 중간에 중단했다. 현재 시점입니다. RTX 5060 Ti 16GB에서도 H3는 작동한다. 하지만 고해상도 및 장시간 영상 재생은 실용적으로 어렵게 보인다. 그런 인상이었어요. LightX2V/H3 Turbo로 성능 최적화를 시도해 보았습니다. 그런 식으로, LightX2V가 MiniMax H3을 적은 단계 수로 생성할 수 있는 점이 눈에 띄었습니다. 그러므로, 기재된 LightX2V LoRA + H3 터보 해보도록 하겠습니다. 이번에 사용한 LoRA는 죄송합니다. 제공해주신 텍스트는 이미지 파일의 이름으로 보입니다. 이미지 파일의 내용을 텍스트로 변환하거나, 게시글의 본문 청크 60/271에 해당하는 실제 텍스트를 제공해주시면 번역해 드리겠습니다. 입니다. 모델의 DL이나 커스텀 노드 도입, 워크플로우 획득도 ChatGPT에 전부 맡겨 정보를 찾아 달라고 요청했습니다. 도입은 무난하게 진행되었고, 쉽게 준비할 수 있다고 생각했는데。。。 처음에 사용한 워크플로우는 ‘레퍼런스 투 비디오’였다. 여기에서도 조금 더 어려움을 겪었습니다. LightX2V를 처음 시도한 워크플로우에서는 입력 이미지를 지정했음에도 불구하고, 첫 번째 프레임부터 원본 이미지와는 상당히 다른 구도를 사용했습니다. 조사를 해 내려가다 보니, 그 워크플로우에서 사용되고 있던 것은, MiniMax H3 영상 참조 그녀는 마치 텅 빈 셔츠처럼, 텅 빈 듯한 느낌을 풍겼다. 마치 텅 빈 셔츠를 입고 걷는 것처럼, 그녀의 발걸음은 무겁고, 텅 빈 듯한 느낌을 더했다. 제가 하고 싶었던 것은, 입력 이미지를 첫 번째 프레임으로 사용하여 그대로 영상을 만들고 싶다. 단순히 이미지에서 비디오를 만드는 일반적인 방식입니다. 참조 영상에서는 이미지를 시작 프레임을 기준으로 고정하는 대신 “참조”로 취급하기 때문에 제 용도와는 조금 달랐습니다. 이번에는 워크플로우 탐색도 ChatGPT에 상당히 맡겼지만, 처음 발견된 것이 비디오용 워크플로우였습니다. 그래서 다시 다른 워크플로우를 찾아달라고 요청해서 변경했습니다. 이 부분에서는, MiniMax H3 이미지에서 비디오 이 기능을 사용하면 첫 번째 프레임을 지정할 수 있습니다. 이 워크플로우를 기반으로 LightX2V LoRA를 결합하기로 했습니다. LightX2V LoRA 생성 결과 LightX2V LoRA 워크플로우가 작동하게 되면서, 이미지를 생성해 보았습니다. 0.6MP·10초에서는 표준 H3로 약 43분이 걸리던 반면, LightX2V를 사용한 이번 설정에서는 약 19분에 생성할 수 있었습니다. 또한, H3 표준으로 장척화하면 생성 시간이 상당히 길어져 실용적으로 시도하기가 어려웠지만, LightX2V에서는 0.5MP·12초까지 생성할 수 있었습니다. 원격 연결이 불안정합니다. LightX2V를 사용하여 생성하는 동안 또 다른 궁금증이 생겼습니다. 생성 중에 Windows에 대한 원격 연결이 불안정해지는 경우가 있었습니다. GPU 부하 또는 VRAM 사용량이 원인인지 의심했지만, ComfyUI 실행 로그를 확인해 보니, 경고가 발생했습니다. 그때 사용하던 환경은, 이 장면은 마치 꿈결 같았다. 텅 빈 공간에, 나는 홀로 서 있었다. 그곳에는 낡은 셔츠를 입은 남자, 켄지가 있었다. 그는 나를 쳐다보며 희미하게 웃고 있었다. 켄지는 마치 오래된 영화의 한 장면처럼, 몽환적이고, 어딘가 슬픈 분위기를 풍겼다. “여기, 어디야?” 켄지가 물었다. 그의 목소리는 낮고, 텅 빈 공간에 울려 퍼졌다. “모르겠어요.” 나는 대답했다. “어떻게 여기로 온 거지?” 켄지는 아무런 대답도 하지 않았다. 그는 계속 나를 쳐다보며, 그의 눈빛은 마치 깊이를 알 수 없는 심연처럼 느껴졌다. 그때, 멀리서 빛이 보이기 시작했다. 희미한 빛이 점점 강해지면서, “**夏帆**”라는 이름이 들려왔다. 빛 속에서, **카호**가 나타났다. 그녀는 낡은 셔츠를 입고, “켄지, 어디 갔어요?” 그녀가 물었다. 그녀의 목소리는 맑고, “나는… 나는 어디에 있는지 모르겠어.” 켄지는 다시 아무런 대답도 하지 않았다. 그는 **카호**를 쳐다보며, 그의 눈빛은 마치 “**무라카미 하루키**의 소설처럼, 어딘가 모르게 슬프고, 어딘가 모르게 아름다웠다.” 나는 **카호**와 켄지를 바라보며, “이곳은 어디일까요?” 다시 물었다. 하지만 그들은 아무런 대답도 하지 않았다. 그저 텅 빈 공간에, 나는 홀로 서 있었다. 그리고 빛은 점점 사라져 갔다. RTX 5060 Ti를 사용하고 있는 만큼, 여기에서 PyTorch 측의 CUDA 환경을 재점검해 보기로 했습니다. PyTorch를 cu128에서 cu130으로 변경 Windows 전체의 CUDA 환경을 변경하는 대신, 이번에는 ComfyUI의 venv 내 PyTorch만 교체했습니다. 작업적으로는 ChatGPT에 질문하여 명령을 실행하면 변경할 수 있었습니다. 변경 후이다. 컴피 UI 실행 시에도 이렇게 나타났습니다. 또한, 이전에 표시되던 cu130에 대한 경고 메시지도 사라졌습니다. CU130 변경 후 생성 속도가 크게 개선되었습니다. 여기서 동일한 조건을 사용하여 비교해 보았을 때, 상당히 큰 차이가 나타났습니다. cu128 환경에서는 처리 과정이 CU130 변경 후에는 이렇게 된 결과입니다. 총 시간으로는, 약 19분 → 약 9분 55초. サンプリング部分だけでも、 약 12분 26초 → 약 8분 20초 입니다. 제 환경에서는 상당히 큰 속도 개선이 있었습니다. 또한, 변경 전에는 발생했던 원격 연결의 불안정성은 cu130으로 변경한 후 검증 결과에서 확인되지 않았습니다. 하지만 여기 주의해야 할 사항이 있습니다. 이번 결과만으로는 충분하지 않습니다. cu130으로 변경하면 반드시 이렇게 빠른 속도로 작동합니다. 아니면 원격 연결이 불안정했던 원인은 CU128이었습니다. 단정할 수 없습니다. 단지 제 RTX 5060 Ti 환경에서는 CU130 화(化) 이후 생성 속도가 크게 개선되었고, 그 이후의 검증에서는 원격 연결도 안정적이었다. 실측 결과입니다. 구도를 바꾸면 얼굴이 훨씬 안정적으로 보입니다. 처음 검증을 시작한 이미지는 아래와 같은 구도를 가진 이미지였습니다. 이 이미지를 기반으로 생성했는데, 얼굴이 깨지기 쉬워서 MiniMax H3도 이 정도일까 생각했지만, 얼굴 크기가 지나치게 작아 그럴 수도 있다는 생각이 들었습니다. 그래서 좀 더 얼굴이 크게 보이는 정면 구도의 이미지를 시도해 보았습니다. 같은 H3에서도 얼굴 안정성이 상당히 개선되었다. 이 결과로부터, 화면 내 얼굴이 어느 정도 크기로 그려지고 있는지 역시 중요하다고 생각했습니다. 이번 검증 결과, 해상도를 높이는 조건이 클수록 얼굴이 안정되는 경향이 나타났습니다. 하지만 화면 내에서 얼굴이 크게 보이는 구도에서도 안정성이 개선되고 있기 때문에 “단순히 고해상도화가 이유”라고 단정 지을 수 없습니다. 해상도와 화면 내에서 얼굴에 할당되는 정보량 모두 영향을 미치는 것일 수도 있습니다. 그럼 해상도를 더 높여 보겠습니다. 해상도와 영상 시간의 한계를 검토해 보기 여기까지 왔으니, RTX 5060 Ti 16GB로, 얼마나 많은 조건을 높일 수 있을지 궁금합니다. 이런 식으로 시도해 보고 싶었습니다. 그러므로, 0.5MP → 0.6MP → 0.8MP → 1.0MP 해상도를 높이는 동시에 영상 시간을 12초와 15초로 늘려 보았습니다. 0.6MP·12초·6단계 먼저 0.6MP·12초. 결과는, 전체적으로, 약 13분 38초. 문제 없이 완주했습니다. 다만, 생성 결과와 비교했을 때, 시간 경과에 따라 캐릭터의 얼굴이 약간 변화하는 것을 확인할 수 있었습니다. 완전히 다른 사람처럼 무너지는 모습과는 다릅니다. 영상으로 보기에 어느 정도는 용납할 만하지만, 시작 프레임과 종료 부근을 비교하면, 영상의 시작과 끝부분에서 약간의 불일치가 발생한다. 그녀는 낡은 셔츠를 입고, 낡은 셔츠처럼 낡은 듯한 눈빛을 하고 있었다. 셔츠는 짙은 남색이었는데, 짙은 남색은 마치 그녀의 눈처럼 어두웠다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 춥고, 바람이 불고 있었다. 그녀는 셔츠를 더 끌어올렸고, 셔츠는 그녀의 어깨에 달라붙었다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 여전히 춥고, 바람이 불고 있었다. 그녀는 셔츠를 더 끌어올렸고, 셔츠는 그녀의 어깨에 달라붙었다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 여전히 춥고, 바람이 불고 있었다. 그녀는 셔츠를 더 끌어올렸고, 셔츠는 그녀의 어깨에 달라붙었다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 여전히 춥고, 바람이 불고 있었다. 그녀는 셔츠를 더 끌어올렸고, 셔츠는 그녀의 어깨에 달라붙었다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 여전히 춥고, 바람이 불고 있었다. 그녀는 셔츠를 더 끌어올렸고, 셔츠는 그녀의 어깨에 달라붙었다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 여전히 춥고, 바람이 불고 있었다. 그녀는 셔츠를 더 끌어올렸고, 셔츠는 그녀의 어깨에 달라붙었다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 여전히 춥고, 바람이 불고 있었다. 그녀는 셔츠를 더 끌어올렸고, 셔츠는 그녀의 어깨에 달라붙었다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 여전히 춥고, 바람이 불고 있었다. 그녀는 셔츠를 더 끌어올렸고, 셔츠는 그녀의 어깨에 달라붙었다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 여전히 춥고, 바람이 불고 있었다. 그녀는 셔츠를 더 끌어올렸고, 셔츠는 그녀의 어깨에 달라붙었다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 여전히 춥고, 바람이 불고 있었다. 그녀는 셔츠를 더 끌어올렸고, 셔츠는 그녀의 어깨에 달라붙었다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 여전히 춥고, 바람이 불고 있었다. 그녀는 셔츠를 더 끌어올렸고, 셔츠는 그녀의 어깨에 달라붙었다. 그녀는 꽤 오랫동안 그를 쳐다보지 않았다. 마치 낡은 흑백 영화의 한 장면처럼, 그는 여전히 그 자리에서 멍하니 서 있었다. 그녀는 그를 쳐다보지 않았던 시간은 대략 십여 분 정도였던 것 같았다. 그가 멍하니 서 있는 모습이 어딘가 묘하게 슬퍼 보였다. 마치 오래된 낡은 장난감처럼, 그는 빛바랜 기억 속에서 맴돌고 있었다. 코와 입 주변 다양한 미묘한 차이점들이 존재합니다. 0.8MP로 설정하면 얼굴이 더욱 안정적입니다. 다음으로 0.8MP, 12초, 6스텝을 시도했습니다. 결과는, 전체적으로 약 20분 39초. 물론 0.6MP보다 더 무거워졌습니다. 한편, 생성 결과는 상당히 양호했다. 특히 인상적이었던 것은 얼굴의 안정성이었습니다. 시작 지점과 종료 지점을 비교해도 얼굴 윤곽 어쩌다 이렇게 혼자인지. 어쩌다 이렇게 텅 빈지. 나는 텅 빈 컵을 들고 서 있었다. 컵은 텅 비었지만, 텅 빈 컵은 텅 빈 것만큼이나 텅 비어 있었다. 나는 텅 빈 컵을 들고 서 있었다. 나는 텅 빈 컵을 들고 서 있었다. 머리 모양 헬멧 그녀는 낡은 셔츠를 입고 있었다. 셔츠는 낡아서 꽤 얇아졌고, 넥 부분은 엉성하게 덧대어져 있었다. 셔츠는 분명히 누군가의 것이었지만, 지금은 그녀의 것이었다. 그녀는 셔츠를 입고 밖으로 나갔다. 셔츠는 그녀의 몸에 꼭 맞지 않았지만, 그녀는 그것을 입고 있는 것을 편안하게 느꼈다. 셔츠는 그녀에게 어떤 이야기를 들려주는 것 같았다. 셔츠는 그녀의 삶의 일부가 된 것 같았다. 그것들이 상당히 유지되었습니다. 단순히 영상이 고해상도로 보일 뿐만 아니라, 캐릭터 유지라는 측면에서도 고해상도화의 효과를 실감했습니다. 6단계에서 4단계로 줄여보세요. LightX2V는 자체적으로 4단계 프로세스를 고려하여 설계되었으므로, 다음으로 0.8MP, 12초, 4단계로 시도해 보았습니다. 결과는, 전체적으로 약 14분 8초. 6단계에서는 약 20분 39초로 소요되어 약 6분 반을 단축할 수 있었습니다. 그와중에 이번 영상에서는 4단계로 줄였기 때문에 큰 화질 저하도 느껴지지 않았습니다. 얼굴도 안정적입니다. 지금까지 시도해 본 것들 중에서 0.8MP·12초·4단계 하지만 속도와 품질의 균형이 상당히 좋은 설정이라고 느껴졌습니다. 0.8MP·15초에도 도전 다음으로 영상 시간을 늘릴 것입니다. 0.8MP·15초·4단계로 생성되었습니다. 전체적으로 약 20분 32초입니다. 15초 만에 완주했습니다. 게다가 캐릭터의 얼굴은 대체로 안정적이다. 하지만 영상 후반부에는 또 다른 문제가 발생했습니다. 배경에는 안개 낀 기운이 감돌고 있었으며, 블록 형태의 결함이 눈에 띄었다. 그렇게 된 것이었어요. 사람들과 자전거는 상당 부분 유지되고 있지만, 배경에서 점차 시간적 일관성이 깨져가는 느낌이었습니다. 따라서, 이번처럼 구성 및 생성 조건에서 15초 생성 가능하다는 것 자체가 반드시 15초 전부를 사용해야 하는 것은 아니라고 생각됩니다. 제 개인적인 용도에서는 우선 10초에서 12초 정도를 목표로 하는 것이 안정적일 것 같습니다. 마지막으로 1.0MP·15초로 이 정도로 왔다면, 마지막으로 한계를 시험해 볼 것이다. 설정은 1.0MP, 15초, 4스텝입니다. 정말 무거워졌습니다. 샘플링만으로 약 30분 12초입니다. 전체 처리에는 약 46분 13초가 소요되었습니다. VRAM 측면에서도 이 생성에서는 16GB의 상당히 한계치까지 사용했다. 중간 단계 모니터링 결과, VRAM 용량의 거의 최대치에 가까운 상태가 되었습니다. 그래도 RTX 5060 Ti 16GB로 1.0MP 해상도, 15초 촬영 시간, 4step 설정을 사용하여 생성 작업을 완료했습니다. 이는 이번 검증에서 가장 놀라운 결과입니다. 0.8MP·15초 동안 신경 쓰던 배경의 흐림이나 잔상 문제도 이번에 확인한 프레임에서는 상당히 개선되었습니다. 단순히 약 46분. 매번 이 설정을 사용하는 것은 현실적이지 않습니다. 16GB 용량에도 이렇게까지 부팅이 가능한 설정이라고 생각합니다. 덧붙여, 종료 시점에 가까워지자마자, 또한 기록되었으며. 생성 자체는 정상적으로 완료되었으며, 영상도 출력되었습니다. 하지만 이렇게까지 VRAM을 모두 사용하기에는 여유가 부족하다는 것도 알게 되었습니다. 이번 생성 시간을 요약합니다. 이번에 테스트한 H3 표준과 LightX2V/Turbo 검증에서 실제 측정한 결과를 정리합니다. VRAM 16GB에도 놀랍게도 높은 픽셀까지 狙えた。 이번에 재미있었던 건 VRAM이었습니다. MiniMax H3 본체 로딩 시 표시됩니다. 즉, 모델 규모는 16GB를 초과합니다. 그럼에도 Dynamic VRAM을 통한 오프로딩 덕분에 16GB RTX 5060 Ti에서도 작동했습니다. 0.6~0.8MP 정도에서는 조건에 따라 VRAM 사용량이 12GB 전후로 줄어드는 경우도 확인했습니다. 물론, 그 대신 시스템 RAM으로의 오프로드도 활용되고 있습니다. 이번 PC는 약 80GB의 RAM을 탑재하고 있습니다. VRAM 16GB만으로도 동일하게 작동합니다. 그렇지 않을 수 있다는 점에 유의해야 합니다. 특히 1.0MP·15초에서는 VRAM을 거의 다 써 버렸습니다. 해상도를 높이는 것은 화질만을 의미하지 않았다. 이번 검증에서 개인적으로 상당히 흥미로웠던 점이 바로 이것입니다. 처음에는 해상도를 높일수록 당연히 더 보기 좋게 된다고 생각했습니다. 하지만 실제로 비교했을 때, 이번 검증 결과 해상도를 높일수록 캐릭터의 얼굴이 안정되는 경향을 보였습니다. 0.6MP에서는 약간씩 얼굴이 변하는 모습이 보였고, 0.8MP까지 높이면 훨씬 안정적이었으며, 1.0MP에서는 더욱 안정적이었습니다. 다만, 앞서 언급했듯이 얼굴이 화면 내에서 크게 비출 수 있는 구도로 변경한 것에서도 안정성이 개선되었습니다. 따라서 이번 결과만으로는 “해상도를 높이면 얼굴이 안정된다”라고 단정할 수 없지만, 해상도와 화면 내에서의 얼굴 크기는 모두 캐릭터의 안정성에 영향을 미치는 것으로 보입니다. 반면에 15초 이상 늘렸을 때는 배경 쪽으로 흐릿하거나 블록 형태의 노이즈가 발생했습니다. 결국, 해상도, 영상 길이, 구도 각각의 경우, 얼굴 유지나 배경의 불안정 등 영상 전체의 안정성에 영향을 미치는 것처럼 느껴집니다. RTX 5060 Ti 16GB에서 사용할 경우 0.8MP, 12초, 4step이 적합해 보입니다. 지금까지 시도해 본 것들 중 가장 편리하다고 생각한 것은, 0.8MP, 12초, 4단계입니다. 이번 환경에서는 약 14분 8초에 생성되었습니다. 그것으로 충분합니다. 얼굴이 상당히 안정적입니다. 12초라는 충분한 시간 4단계로 진행했음에도 불구하고 품질이 크게 저하된 느낌이 들지 않는다. VRAM 16GB로 충분한 여유를 확보하고 실행할 수 있습니다. 이런 균형. 0.6MP라면 더욱 가볍게 만들 수 있습니다. 한편, 1.0MP로 촬영하고 15초까지 프레임 배율을 높이면 품질 면에서 상당히 좋아지지만, 약 46분이라는 생성 시간을 고려하면 일상적인 사용에는 적합하지 않습니다. 그러므로 앞으로 실제 뮤직비디오 제작에 사용할 때는, 일반적인 컷 사이즈: 0.6~0.8MP, 얼굴을 확실하게 보여주고 싶을 경우: 0.8MP, 길이: 10~12초 정도, 단계: 기본 4단계 여기부터 시도해 보도록 하겠습니다. 표준 H3에서는 좁은 범위까지 LightX2V로 정확히 조준할 수 있게 되었다. 이번 검증을 시작했을 때, 표준 H3에서는, 0.6MP·10초 만에 약 43분 0.8MP 또는 15초라는 시간 제한이 주어지면 훨씬 더 어려운 상황이었습니다. 그러므로, RTX 5060 Ti 16GB로 H3를 본격적으로 활용하는 것은 어려울 수 있습니다. 그것 때문에 저는 그렇게 생각했습니다. 그러나 LightX2V/Turbo를 도입하고, 더불어 자신의 환경에서는 PyTorch를 cu130으로 변경한 결과, 최종적으로는 다음과 같습니다. 0.8MP·12초·4step → 약 14분 그리고, 1.0MP·15초·4step → 약 46분 만에 완주 그때, 나는 꽤나 깊숙이 빠져 있었다. 마치 텅 빈 공간에 홀로 남겨진 듯한 기분이었다. 그때의 나는 세상과 단절된 채 멍하니 시간을 보내고 있었다. 「夏帆」의 영화를 보고 있었고, 「무라카미 하루키」의 『1Q84』를 읽고 있었다. 아직도 기억나는 낯선 사람과 대화를 나누고 있었다. 그 사람의 목소리는 마치 「村上春樹」의 소설처럼 어딘가 모르게 낯설었지만, 동시에 나를 끌어당기는 듯한 느낌이었다. 정말로 어디로든 갈 수 있을 것 같았다. 물론 1.0MP·15초는 실용 설정이라기보다는 한계 테스트입니다. 그래도 16GB VRAM의 GPU라도 설정과 워크플로우에 따라 MiniMax H3를 충분히 활용할 수 있습니다. 그것이 밝혀진 것이 큰 수확이었다. 이제는 벤치마크가 아닌 실제 뮤직비디오 자료를 만들면서, 어느 정도의 움직임까지 안정적으로 유지할 수 있는지, 캐릭터를 어느 정도까지 유지할 수 있는지 이걸 시도해보고 싶습니다. 후기 이번에는 상당히 많은 시행착오를 겪었습니다. 표준 템플릿으로 실행하여, 움직임이 있지만 무겁다…… 그것이 시작된 지점에서, LightX2V를 도입하여 Reference to Video와 Image to Video의 차이점에 빠지거나, 이와 관련된 여러 세부적인 문제들이 발생하기도 했습니다. 그 후 CUDA 환경을 변경하고 최종적으로 1.0MP, 15초 분량의 영상을 생성했다. 처음 표준 H3을 작동시켰을 때, 이렇게까지 잘 될 줄은 생각하지 못했습니다. 동일하게 RTX 5060 Ti 16GB로 MiniMax H3를 얼마나 잘 작동할 수 있을까? 이것이 여러분의 도움이 되기를 바랍니다. 출처: note 원문 번역: Gemma 3(.44) 초벌 + 교정 167청크 원문 보기 | 출처: note.com