안녕하세요, 카모토입니다!
릴리즈된 이후 빠르게 생태계가 구축되고 있는 로컬 영상 생성 AI, ‘MiniMax H3’. 프롬프트의 추종성이 뛰어나 VRAM 12GB의 제 환경에서도 5초 영상이 6분 안에 생성될 수 있게 되어, 상당히 영상 생성의 진입 장벽이 낮아졌습니다.
이번에는 MiniMax H3를 ComfyUI에서 실행할 수 있게 되어, 다음으로는 익숙한 캐릭터 LoRA 학습을 시도해 보았습니다!
제 PC는 RTX 4070 12GB입니다. MiniMax H3 자체가 상당히 크기 때문에, 처음에는 12GB VRAM으로 LoRA 학습까지 가능한지 반신반의했지만, 양자화 모델과 CPU 오프로드를 사용함으로써, 시간이 걸리지만 AI 툴킷으로 1000스텝까지 학습할 수 있었습니다!
한편으로, 처음 제작한 LoRA는 효과는 있었지만 원 캐릭터와는 다소 차이가 있었습니다. 학습 이미지와 캡션을 재검토하고, 얼굴에 특화된 데이터셋으로 재학습한 결과, 재현성이 상당히 개선되었습니다. 이를 소개합니다.
이 글에서는 AI-툴킷 업데이트, 필요한 모델, 학습 설정, ComfyUI에서의 추론, 데이터셋 개선 등을 정리합니다!
2026년 8월 7일 현재, 제가 주로 사용하는 무시비 튜너/SD 스크립트는 MiniMax H3의 LoRA 학습에 대응 중인 상태이므로, 이번에는 ai-toolokit으로 시도하고 있습니다.
目次
- 사용 환경
- AI 툴킷을 MiniMax H3 대응 버전으로 업데이트했습니다.
- 필요한 MiniMax H3 모델
- 확산 모델
- 텍스트 인코더
- 비디오 VAE
- 오디오 VAE
- 3. ComfyUI 모델을 ai-toolkit에서 참조
- 4. 학습 이미지를 준비한다.
- 이미지 데이터셋에서 중요한 설정
데이터셋 크기는 모델의 성능에 큰 영향을 미칩니다. 일반적으로 데이터셋이 클수록 모델은 더 많은 패턴을 학습하고 일반화 성능이 향상됩니다. 하지만 데이터셋 크기가 너무 크면 학습 시간이 길어지고 과적합(overfitting)의 위험이 커질 수 있습니다. 따라서 데이터셋 크기를 적절하게 설정하는 것이 중요합니다.
이미지 해상도는 모델의 성능에도 영향을 미칩니다. 해상도가 높을수록 더 많은 정보를 얻을 수 있지만, 학습 시간이 길어지고 메모리 사용량이 증가할 수 있습니다. 따라서 이미지 해상도를 적절하게 설정하는 것이 중요합니다. 일반적으로 256x256 또는 512x512 해상도가 많이 사용됩니다.
라벨링 방식은 모델의 성능에 큰 영향을 미칩니다. 정확하고 일관성 있는 라벨링은 모델이 올바른 패턴을 학습하는 데 도움이 됩니다. 라벨링 방식에는 수동 라벨링, 자동 라벨링, 그리고 혼합 라벨링 등이 있습니다.
학습률은 모델이 학습하는 속도를 결정합니다. 학습률이 너무 높으면 모델이 최적의 해답을 찾지 못하고 발산할 수 있습니다. 반대로 학습률이 너무 낮으면 모델이 학습하는 데 너무 오래 걸릴 수 있습니다. 따라서 학습률을 적절하게 설정하는 것이 중요합니다. 일반적으로 0.1, 0.01, 0.001 등의 값을 사용합니다.
이 외에도 배치 크기, 에폭 수, 옵티마이저 등의 설정도 모델의 성능에 영향을 미칠 수 있습니다. 이러한 설정들을 적절하게 조정하여 모델의 성능을 최적화해야 합니다. 특히, 무라카미 하루키의 『나를 잊어선 안되는 이유』와 같은 작품을 분석하는 모델을 훈련할 때, 데이터셋의 특성을 고려하여 적절한 설정을 찾는 것이 중요합니다. 카호의 등장작과 같이 다양한 스타일의 작품을 포함하는 데이터셋을 사용할 경우, 모델이 특정 스타일에 편향되지 않도록 주의해야 합니다. 또한, 데이터셋의 품질을 유지하기 위해 지속적으로 데이터를 검토하고 수정하는 것이 중요합니다.
사용 환경
- OS:Windows 11
- CPU: 코어 i3 12100F
- GPU:NVIDIA GeForce RTX 4070 (VRAM 12GB)
- 메모리: DDR4 48GB
- ComfyUI: Windows 포터블 버전
- LoRA 학습: ostris/ai-toolkit
LoRA(Low-Rank Adaptation) 학습은 대규모 언어 모델(LLM)을 특정 작업에 맞게 효율적으로 미세 조정하는 방법입니다. ostris/ai-toolkit는 LoRA 학습을 위한 강력한 도구 모음입니다.
이 툴킷은 다음과 같은 기능을 제공합니다.
* 다양한 LLM 지원: Llama 2, Mistral, Gemma 등 다양한 LLM 모델을 지원합니다.
* 간편한 설정: LoRA 학습을 위한 설정 과정을 단순화하여 초보자도 쉽게 사용할 수 있습니다.
* 효율적인 학습: GPU 자원을 효율적으로 사용하여 학습 시간을 단축합니다.
* 다양한 옵션: 학습률, 배치 크기 등 다양한 학습 옵션을 설정하여 최적의 성능을 얻을 수 있습니다.
ostris/ai-toolkit를 사용하면 LoRA 학습을 통해 LLM을 원하는 대로 커스터마이징할 수 있습니다.
더 자세한 내용은 ostris/ai-toolkit 저장소([https://github.com/ostris/ai-toolkit](https://github.com/ostris/ai-toolkit))를 참조하십시오.
- 학습 이미지: 31~32매
- 학습 해상도는 512×512입니다.
- LoRA 랭크:16
- 학습 단계: 1000
ComfyUI는 다음과 같이 설치될 것으로 예상됩니다.
AI 툴킷은 다음과 같이 배치되어 있습니다.
AI 툴킷을 MiniMax H3 대응 버전으로 업데이트했습니다.
먼저, AI 툴킷을 가져옵니다.
이미 AI 툴킷을 설치한 경우, Git 저장소를 최신 상태로 업데이트합니다.
의존 관계에 변경 사항이 있는 경우, ai-toolkit의 가상 환경에서 업데이트하십시오. 글로벌에 적용하면 위험합니다. AI에 지시할 때도 주의를 기울이십시오.
환경에 따라 AI 툴킷의 설치 방법이 다를 수 있습니다. 기존의 가상 환경을 사용하고 있다면 새로운 환경을 만들지 않고 동일한 환경을 업데이트하는 것이 좋습니다. 이 부분 또한 AI 에이전트에게 문의하여 확인하는 것이 가장 확실합니다!
MiniMax H3 대응 이후 AI 툴킷에서는 설정 파일의 모델 아키텍처에 다음을 지정할 수 있습니다.
필요한 MiniMax H3 모델
이번 학습에서는 ComfyUI에서 이미 사용하던 MiniMax H3 모델을 그대로 재활용했습니다.
필요한 파일은 다음과 같습니다.
확산 모델
설치 경로: C:\comfyui\ComfyUI_windows_portable\ComfyUI\models\diffusion_models
텍스트 인코더
설치 경로: C:\comfyui\ComfyUI_windows_portable\ComfyUI\models\text_encoders
영상 VAE
설치 경로: C:\comfyui\ComfyUI_windows_portable\ComfyUI\models\vae
오디오 VAE
설치 경로: C:\comfyui\ComfyUI_windows_portable\ComfyUI\models\vae
모델 일식은 40GB 이상이므로, AI 툴킷 측에 복사하면 용량을 두 번 소비하게 됩니다. AI 툴킷에서 컴피 UI 모델 폴더를 직접 참조하도록 하는 것이 좋습니다. 아니, 요즘 AI는 필요한 모델과 크기도 많아서 SSD가 부족합니다…
3. ai-toolkit에서 ComfyUI 모델을 참조합니다.
그 다음, Windows의 배치 파일에서 MODELS_PATH를 설정합니다.
이 설정에 따라 AI 툴킷은 다음과 같은 항목들을 자동으로 검색합니다.
실행 시 로그에서도 컴피 UI 측 모델이 로딩되었습니다.
MiniMax H3의 작은 config.json 파일 등은 Hugging Face에서 가져올 수 있지만, 수십 GB의 모델 본체를 다시 다운로드할 필요는 없습니다.
학습 이미지를 준비한다.
처음에는 과거에 다른 모델용으로 제작했던 캐릭터 이미지 32장이었습니다. 참고로 이 예시는 실패 사례이므로, 일단 소개하는 것 외에는 아무런 영향도 없습니다. 나중에 성공 사례를 소개하겠습니다.
설치 위치: C:\Users(사용자 이름)\python\ai-toolkit\images\
캡션에는 각 이미지와 동일한 이름의 .txt 파일을 첨부했습니다. 캡션 파일의 예시는 다음과 같습니다. 이는 AI에 이미지를 분석하고 생성하도록 지시했습니다.
AI 툴킷에서는 512x512로 리사이즈하여 학습시키고 있습니다.
이미지 데이터셋에서 중요한 설정
이미지 데이터셋을 구축하고 활용할 때, 성능에 큰 영향을 미치는 주요 설정들을 살펴보겠습니다.
**1. 이미지 크기**
이미지 크기는 모델 학습 속도와 정확도에 직접적인 영향을 미칩니다. 일반적으로 크기가 클수록 더 많은 정보가 담겨 정확도가 향상될 수 있지만, 동시에 학습 시간과 메모리 사용량도 증가합니다. 따라서 데이터셋의 특성과 모델의 복잡도를 고려하여 적절한 크기를 선택해야 합니다.
* **너무 작은 크기:** 모델이 충분한 정보를 학습하지 못하여 과소적합될 수 있습니다.
* **너무 큰 크기:** 학습 시간이 길어지고 메모리 부족 문제가 발생할 수 있습니다.
일반적으로 224x224 또는 256x256 픽셀 크기가 많이 사용되지만, 데이터셋의 해상도와 목적에 따라 더 작은 크기나 더 큰 크기를 선택할 수 있습니다.
**2. 배치 크기**
배치 크기는 한 번의 학습 단계에서 모델에 입력되는 이미지의 개수를 의미합니다. 배치 크기가 클수록 학습이 안정화될 수 있지만, 메모리 사용량이 증가하고 학습 속도가 느려질 수 있습니다. 반대로 배치 크기가 작으면 학습이 불안정해지고 학습 속도가 느려질 수 있습니다.
* **너무 작은 배치 크기:** 학습이 불안정해지고 수렴 속도가 느릴 수 있습니다.
* **너무 큰 배치 크기:** 메모리 부족 문제가 발생하고 학습 속도가 느려질 수 있습니다.
일반적으로 GPU 메모리 용량과 데이터셋 크기를 고려하여 적절한 배치 크기를 선택해야 합니다.
**3. 데이터 증강**
데이터 증강은 기존 이미지를 변환하여 새로운 데이터를 생성하는 기술입니다. 회전, 확대/축소, 자르기, 색상 변경 등의 다양한 방법을 사용하여 데이터셋의 크기를 늘리고 모델의 일반화 성능을 향상시킬 수 있습니다.
* **회전:** 이미지를 특정 각도로 회전시킵니다.
* **확대/축소:** 이미지를 확대하거나 축소합니다.
* **자르기:** 이미지를 무작위로 자릅니다.
* **색상 변경:** 이미지의 색상 강도를 무작위로 변경합니다.
데이터 증강은 모델이 다양한 환경에서 작동하도록 훈련하는 데 도움이 됩니다.
**4. 정규화**
이미지 데이터의 정규화는 각 픽셀 값의 범위를 조정하는 기술입니다. 일반적으로 픽셀 값을 0과 1 사이로 정규화하거나, 평균을 0으로, 표준 편차를 1로 정규화합니다. 정규화는 학습 속도를 향상시키고 모델의 수렴을 돕습니다.
* **Min-Max 정규화:** 픽셀 값을 0과 1 사이로 정규화합니다.
* **Z-Score 정규화:** 픽셀 값의 평균을 0으로, 표준 편차를 1로 정규화합니다.
이번에 AI 툴킷에서 MiniMax H3 LoRA 학습을 사용하여 정지 이미지를 활용할 경우, 다음 설정이 중요했습니다.
auto_frame_count을 활성화하면 정지 이미지 데이터셋이 비디오로 처리되어 이미지 검색이 불가능합니다. 실행 시 “데이터셋에 비디오가 없습니다”와 같은 메시지가 나타납니다.
정지 이미지 데이터셋이 인식되면, AI 툴킷의 정상적인 로그는 다음과 같습니다.
영상으로 처리되고 있는 경우 다음과 같습니다.
MiniMax H3 정지화 LoRA에서는 auto_frame_count를 비활성화해야 합니다. 영상으로 학습하는 것은 VRAM 12GB로는 거의 불가능합니다.
사용된 학습 설정
AI 툴킷에서 MiniMax H3 LoRA 학습을 진행할 때 RTX 4070 12GB에 사용한 주요 설정은 다음과 같습니다.
## [minimax_h3_lora_rtx4070_12gb_test.yaml]
이 파일은 RTX 4070 12GB GPU를 사용하여 Minimax H3 LoRA 모델을 테스트하는 설정 파일입니다.
**설정:**
* **모델:** Minimax H3 LoRA
* **GPU:** RTX 4070 12GB
* **메모리:** 12GB
* **배치 크기:** 1
* **이미지 크기:** 512x512
* **스텝 크기:** 256
* **학습률:** 1e-4
* **에포크 수:** 10
* **저장 빈도:** 1000 스텝마다
* **체크포인트 저장 빈도:** 1000 스텝마다
* **로그 저장 위치:** ./logs/minimax_h3_rtx4070_12gb_test
7. 학습 시작: RTX 4070 12GB로 실제로 작동하는가?
이제 설정이 완료되었으니,あとは 학습시키기만 하면 됩니다. 학습에는 다음과 같은 배치 파일을 만들었습니다. 이 파일을 ai-toolkit 폴더 내에 두고, 더블클릭하여 실행하면 됩니다. 경로와 파일명은 필요에 따라 수정해 주세요.
참고로, 제 RTX 4070 VRAM 12GB 환경에서는 상당히 꽉 막히지만 LoRA 학습이 가능했습니다!
모델 로딩 시에는 다음과 같은 상황이다.
- 전용 VRAM: 약 11.7GB / 12GB
- 공유 GPU 메모리: 약 10~15GB
- 시스템 RAM: 약 32~37GB
- GPU 사용률: 거의 100%
실제로는 GPU VRAM만으로 완전히 해결되는 것이 아니라, CPU RAM으로 상당히 오프로드됩니다. 그래서 시간이 꽤 걸립니다. 제 경우에는 데이터셋 정지화 32장, 1000단계로 6~7시간 정도 소요되었습니다.
처음 제작된 LoRA 결과
RTX 4070으로 ai-toolkit MiniMax H3의 LoRA 학습에 6~7시간이 걸렸는데, 처음 생성된 LoRA는 전혀 비슷하지 않았습니다.
같은 시드 프롬프트로 이미지가 달라지므로 LoRA 자체의 가중치는 적용된 것처럼 보였지만, 거의 LoRA 없이 변화가 거의 없습니다.
그러므로 데이터셋을 다시 검토해 보기로 했습니다.
9. 얼굴 특화 데이터셋으로 변경한다
첫 번째 데이터 세트에는 다음과 같은 내용이 포함되어 있었습니다.
- 얼굴 확대
- 상반신
- 전신
- 다수의 의상
- 背景
- 가도구
- 잠시 멈춰라.
원본 이미지는 1024x1024인데, AI 툴킷에서 MiniMax H3 LoRA 학습 시 512x512 크기로 전체 이미지를 학습시키기 때문에 얼굴 부분이 작아집니다.
즉, 캐릭터의 얼굴을 익히도록 하고 싶었지만, LoRA가 동시에 다음과 같은 것들을 학습하려고 했을 가능성이 있습니다.
그러한 결과로 2차 학습에서는 얼굴 확대 이미지에만 한정해 보았습니다. 이미지의 특징은 다음과 같습니다.
- 얼굴이 화면의 대부분을 차지하고 있다.
- 백색 배경
- 黒髪
- 매끈한 묶음 머리
- 회색·검정색 눈동자
- 얼굴 특징과 그림체 면에서 비교적 통일감이 있다.
- 전면 및 좌우 대각선 각도를 포함
캡션도 크게 간소화했습니다.
캐릭터의 고유한 정보를 가능한 한 charsayaka에 집약시키려는 의도였기에, 머리 스타일, 머리 색깔, 눈 색깔, 상반신, 전신 등은 캡션에 기록하지 않았습니다. 캡션 제작이 번거로웠던 것은 아니었습니다.
이 설정을 사용하여 다시 학습을 실행합니다. ai-toolkit YAML 파일은 출력 파일 이름을 변경하지 않으면 재학습을 수행하지 않으며, 이미 출력 파일이 존재하므로 이를 건너뛰라는 메시지를 표시합니다. 따라서 주의해야 합니다.
10. 얼굴 맞춤형 결과
다시 학습을 통해 추가로 6~7시간을 투자한 결과가 아래와 같습니다. 상당히 개선되었습니다!
LoRA가 없었다면 MiniMax H3의 베이스 모델 기종의 애니메이션 얼굴이 나왔을 것이지만, LoRA가 있었다면 더욱 자연스러운 애니메이션 얼굴이 나타났다.
- 검은 머리
- 머리를 묶는 방법 중 하나로, 머리카락을 뭉쳐 묶는 것을 의미합니다.
- 회색빛 검은 눈
- 세련된 윤곽
- 차분한 얼굴
- 원래 그림과 유사한 앞머리
그러게 되었습니다. 약간은 원작 그림보다 덜 닮았지만, 합격점을 받을 만하네요!
## ComfyUI에서 LoRA 사용하기
ComfyUI에서 LoRA를 사용하는 방법은 크게 세 단계로 나눌 수 있습니다. 첫째, LoRA 파일을 ComfyUI에 불러오는 것입니다. LoRA 파일은 일반적으로 `.safetensors` 또는 `.ckpt` 확장자를 가지며, ComfyUI의 LoRA 탭에서 불러올 수 있습니다. 불러오기 전에 LoRA 파일이 올바른 형식인지, ComfyUI와 호환되는지 확인하는 것이 중요합니다.
둘째, LoRA를 사용하여 이미지를 생성하는 것입니다. LoRA를 불러온 후에는 이미지 생성 탭에서 LoRA를 활성화하고, 원하는 스타일이나 컨셉을 적용할 수 있습니다. LoRA의 강도를 조절하여 이미지에 LoRA의 영향을 얼마나 적용할지 설정할 수 있습니다. 강도가 높을수록 LoRA의 영향력이 커지지만, 과도하게 높이면 이미지 품질이 저하될 수 있으므로 주의해야 합니다.
마지막으로, 생성된 이미지를 확인하고 필요에 따라 설정을 조정하는 것입니다. LoRA의 강도, 이미지 크기, 샘플링 스텝 등 다양한 설정을 조절하여 원하는 결과물을 얻을 수 있습니다. 또한, LoRA 파일을 여러 개 불러와서 조합하여 더욱 복잡하고 다양한 스타일을 만들 수도 있습니다. ComfyUI에서 LoRA를 사용하는 것은 창의적인 이미지 생성의 가능성을 넓혀주는 강력한 도구입니다. 다양한 LoRA 파일을 실험해보고 자신만의 스타일을 찾아보세요.
**참고:** LoRA를 사용하기 전에 ComfyUI의 최신 버전을 사용하고 있는지 확인하는 것이 좋습니다. 또한, LoRA 파일을 다운로드할 때 신뢰할 수 있는 출처에서 다운로드하여 악성코드 감염 위험을 방지하는 것이 중요합니다.
마지막으로, 학습된 LoRA를 ComfyUI에서 사용해 보려고 합니다. 먼저, MiniMax H3용 LoRA를 다음 폴더로 복사합니다.
그녀는 꽤 오랫동안 그를 기다렸다. 그가 나타나기 전까지, 그녀는 마치 텅 빈 공간처럼 느껴졌다. 텅 빈 공간처럼 느껴졌지만, 그녀는 그를 기다리는 동안에도 끊임없이 생각했다. 그가 왜 이렇게 늦어지는지, 무슨 일이 있는지. 그는 결국 나타났다. 그의 얼굴은 꽤 붉었고, 옷은 조금 젖어 있었다. 그녀는 그에게 다가갔다. 그녀는 그에게 말을 걸고 싶었지만, 입술은 바싹 말라 말을 잇지 못했다. 그는 그녀에게 말을 걸었다. “미안, 늦었다.”
ComfyUI에서 지정하는 LoRA 이름은 상대 경로로 됩니다.
MiniMax H3 모델을 불러온 후, LoraLoaderModelOnly를 적용합니다. 이미지는 이런 느낌입니다.
이번 LoRA는 텍스트 인코더를 학습하지 않으므로 모델 측에만 적용합니다.
LoRA 강도는 LoRA 모델의 성능에 큰 영향을 미치는 요소입니다. LoRA 강도를 높이면 모델이 더 복잡한 패턴을 학습할 수 있지만, 과적합의 위험도 증가합니다. 반대로 LoRA 강도를 낮추면 과적합을 방지할 수 있지만, 모델의 성능이 저하될 수 있습니다.
따라서 LoRA 강도는 데이터셋의 크기, 모델의 복잡도, 그리고 원하는 성능 수준을 고려하여 신중하게 결정해야 합니다. 일반적으로 작은 데이터셋이나 간단한 모델에는 LoRA 강도를 높게 설정하고, 큰 데이터셋이나 복잡한 모델에는 LoRA 강도를 낮게 설정하는 것이 좋습니다.
LoRA 강도를 조절할 때는 다양한 값을 시도해보고, 검증 데이터셋을 사용하여 모델의 성능을 평가하는 것이 중요합니다. 또한, LoRA 강도와 함께 다른 하이퍼파라미터(예: 학습률, 배치 크기)도 최적화하여 모델의 성능을 극대화할 수 있습니다.
그 외에는 MiniMax H3 LoRA를 사용하여 다양한 영상을 생성합니다. T2V에서는 트리거 워드와 캐릭터 특징을 입력합니다.
영상 설정
124프레임이므로, 약 5.17초의 영상이 됩니다. 나머지는 자유롭게 영상을 제작하면 됩니다!
LoRA 강도 차이
참고로, LoRA 강도를 비교해 보았습니다. 가중치 차이로 인해 영상을 몇 프레임만 생성하여 비교했습니다.
500단계 정도부터 시작하여 800단계 이후부터 사용하는 것이 좋고, 개인적으로는 1000단계로 사용하고 있습니다.
まとめ
이번에는 MiniMax H3의 캐릭터 LoRA를 ai-toolkit를 사용하여 제작하는 방법을 소개했습니다. 시간이 걸리지만, VRAM 12GB의 RTX 4070에서도 학습이 가능했습니다!
이번 조건에서
- 512×512
- 그녀는 마치 텅 빈 셔츠처럼, 겉으로는 아무것도 없는 듯 보였다. 하지만 그녀의 눈빛은 깊이를 알 수 없는 웅덩이처럼, 어딘가에 갇힌 듯 보였다. 나는 그녀의 눈빛을 들여다볼수록, 그녀가 얼마나 많은 것을 잃어버렸는지, 그리고 그 상실감은 그녀를 어떻게 변화시켰는지 깨달았다. 그녀는 마치 오래된 사진처럼, 빛바랜 기억과 함께 잊혀진 시간을 품고 있었다.
나는 그녀에게 물었다. “무라카미 하루키의 『늑대』를 읽어본 적 있니?” 그녀는 잠시 망설이다가 대답했다. “읽어봤는데, 너무 슬펐어.” 나는 그녀의 대답에 고개를 끄덕였다. “그것이 『늑대』의 매력이기도 하지.” 그녀는 미소를 지었다. “그래, 그게 맞는 것 같아.”
그녀는 마치 어린아이처럼 순수하고, 동시에 세상의 모든 것을 알고 있는 듯한 느낌을 주었다. 나는 그녀와 함께 해변을 걷다가, 그녀가 바다를 바라보며 말했다. “바다는 항상 나를 위로해 줘. 마치 카호처럼.” 나는 그녀의 말에 놀라움을 금치 못했다. “카호? 그 영화를 봤지?” 그녀는 고개를 끄덕였다. “그 영화는 정말 아름다웠어. 특히, 마지막 장면에서…” 그녀는 말을 멈추고 잠시 생각에 잠겼다. “그 장면은 마치 내 삶의 한 페이지를 보여주는 듯했어.”
- rank 16
- 1000step
- ConvRot INT8 모델
- Qwen3-VL NVFP4 텍스트 인코더
- VRAM 부족
- 잠재 캐시
- 텍스트 임베딩 캐시
그래서 1000단계에 약 6~7시간이 소요됩니다. 그래도 로컬에서 MiniMax H3 LoRA가 스테이밍 이미지로 학습 가능하다는 점이 확인된 것을 좋게 생각했습니다. 아마 VRAM 12GB의 RTX 3060에서도 MiniMax H3 LoRA 학습이 가능할 것으로 보입니다. 다만 시간이 더 걸릴 것 같습니다.
MiniMax H3의 LoRA 학습으로 정지 이미지로 학습하는 방법을 모르는 분들께 이 글이 도움이 되었으면 합니다!
마지막까지 읽어주셔서 감사합니다.
만약 이번 글이 “좋았다”고 느껴지셨다면, 좋아요를 눌러주시면 총 14시간의 LoRA 학습 비용을 충당하는 만큼의 의미가 있습니다!
앞으로도 지역 이미지 생성, 음성 생성, LLM, 가끔 휴식을 위한 이미지 생성 등 실제로 작동해 본 내용을 모아 정리해 나가겠습니다. 팔로우 부탁드립니다!
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 83청크
원문 보기 | 출처: note.com