지난 2주 동안 영상 생성 모델이 3개 들어왔습니다. 게다가 3개 모두 ComfyUI를 제작 흐름의 입구로 활용할 수 있습니다. 다만, 클라우드나 API를 통해 진행하는 경우와 공개 가중치를 사용하여 로컬에서 실행하는 경우에는 구성과 조건이 다릅니다. Seedance 2.5, MiniMax H3, 그리고 어제 LTX-2.5입니다. 저는 H3를 ComfyUI로 실행하고 도입 및 프롬프트 설계 문서를 작성했지만, 솔직히 끝마칠 때가 오기도 전에 다음이 다가온 듯했습니다. 다만, 세 가지를 나란히 해보니 분명한 차이점이 있었습니다. 능력치가 중첩되는 부분은 있지만, 각 단계마다 강점이 뚜렷합니다. 하나의 줄자만으로 비교하면 그 차이가 명확하게 드러나지 않습니다. 2026년 8월 12일 현재 정보입니다. 특히 LTX-2.5는 공개된 지 약 24시간이 지나 있어, 저장소 및 배포 파일의 상황이 변경될 수 있습니다. 실제로 사용하기 전에 공식 최신 정보를 확인해 주십시오. 세 가지를 나란히 해보자. 반복되는 기능들은 있지만, 선택할 때의 축이 다릅니다. 시데이스 2.5는 다재료 참조와 부분 수정, MiniMax H3는 최대 12개의 파일에 대한 멀티모달 참조와 음성 동시 생성, LTX-2.5는 속도와 단계별 제어가 두드러집니다. 어떤 것이 가장 좋을지 찾고 있는데, 이 차이가 보이지 않네요. LTX-2.5에서 두드러진 두 점 속도 공개된 수치는 NVIDIA GB200을 2대 사용하여 이미지에서 720p 영상을 10초 동안 생성하는 데 6.8초 소요되는 수치입니다. 이는 일반적인 환경과는 다릅니다. GB200은 개인에게 흔히 있는 기계가 아니므로, 이 숫자를 그대로 자신의 환경에 적용할 수 없습니다. 다만, 방향성 측면에서는 의미가 있습니다. H3로 8초의 클립을 생성하면, 환경에 따라서는 몇 분이 걸릴 수도 있습니다. 같은 “영상 생성”이라도 속도의 桁이 다른 설계 철학이 나타나 있다는 의미입니다. 워크플로우 유형 이 방식이 실무에서는 더 효과적입니다. LTX-2.5는 ComfyUI에 Day-1에서 통합되었으며, LTX-2.5를 위한 공식 ComfyUI 워크플로우도 공개되었습니다. T2V/I2V의 기본 형태에 더불어, 모션 트랙, 인페인팅, 아웃페인팅, 유니언 컨트롤 등 IC-LoRA를 사용한 제어 시스템이 마련되어 있습니다. 모션 트랙(움직임 경로 지정) 부분 수정(재도감) 아웃페인트(화면 외부를 확장) 유니온 컨트롤 (심도, 포즈, 에지 등 복합 제어) H3는 “입력을 늘려 방향을 설정하는” 설계인 반면, LTX-2.5는 “각 단계별로 분리하여 제어하는” 설계로 보입니다. 이전 H3 기사에서는 참조 파일을 12개까지 전달할 수 있으며, 그 역할 분담이 중요하다는 내용이 있었습니다. LTX-2.5는 반대로, 제어 방식에 따라 워크플로우가 분리되어 있습니다. 어느 쪽이 더 우수하다는 이야기가 아니라, 꼼꼼하게 포장하고 싶다면 LTX-2.5, 한 번에 전달하고 싶다면 H3로 구분해서 사용하게 될 것 같습니다. 導入について(現状の注意点) 솔직히 말씀드리면, 공개 직후라 정보가 혼란스럽습니다. 제가 확인한 범위 안에서는 다음과 같은 상황입니다. 워크플로우는 공식 리포지토리의 example_workflows/2.5/에 위치합니다. 공개 당일에는 반영이 늦어지던 시간대가 있었으며, 보이지 않는 타이밍도 있었습니다. 대체로 ComfyUI 템플릿 라이브러리에서 LTX-2.5 템플릿을 찾아 API를 통해 제공되는 것과 로컬용 두 가지 종류를 사용할 수 있습니다. 텍스트 인코더 — LTX-2/2.3에서는 Gemma 3가 사용되었지만, 2.5에서는 Gemma 4 기반으로 변경되었습니다. 파일명도 변경되므로, 2.3의 절차를 그대로 사용하면 멈추게 됩니다. VRAM — 숫자가 흩어져 있어 신중하게 작성합니다. 12GB를 “잘 작동한다”고 소개하는 것은 피하는 것이 좋을 것 같습니다. 조건이 갖춰져야 작동하는 이야기이고, 쾌적하게 사용할 수 있는 환경은 아닙니다. 이 부분은 공개된 지가 얼마 되지 않아 숫자를 맹신하지 말고, 자신의 환경에서 작게 테스트하는 것이 확실합니다. 저작권 조건 보시면 안 될 부분이지만, 확인해 두는 가치가 있습니다. LTX-2.5의 현행 라이선스에서는 연간 매출액이 1,000만 달러 이상인 사업체는 상업 이용에 유료 라이선스가 필요합니다. 매출액은 관련 회사 등 포함된 단위로 판단되므로, 해당 조직은 이용 전에 원문을 확인해야 합니다. 연간 매출액이 기준 미만이라도 용도 제한이나 배포 조건이 사라지는 것은 아닙니다. 개인이나 소규모 조직을 포함하여 “오픈 웨이트”가 무조건적으로 상업적 이용이 가능한 것은 아니라는 점을 유념해야 합니다. 이 라이선스 조항의 확인은 H3 때도 작성했습니다. 오픈 웨이트 모델이 늘어남에 따라 모델마다 조건을 확인하는 작업이 늘고 있습니다. 이곳은 반년 전에는 없었던 번거로움입니다. 어떻게 세 가지를 활용할까요? 현재까지 제가 정리한 내용입니다. 씨던스 2.5가 다가오고 있다. 참고 자료가 풍부합니다(이미지 30장, 영상 10개, 음성 10개까지 처리 가능). 생성 후 일부를 수정하고 싶다. 환경 구축을 하고 싶지 않습니다. MiniMax H3가 움직입니다. 다양한 자료 참조와 음성 동시 생성을 현재 익숙한 H3 환경에서 통합하고자 한다. 마테를 외부로 유출하고 싶지 않다 역할 분담을 통해 지침으로 삼고 싶습니다. LTX-2.5는 뻗는다. 각 단계별로 제어 방식을 분리하고 싶다 (인페인트, 모션, 뎁스 등). 워크플로우를 설계하고 반복적으로 실행하고 싶습니다. 속도를 우선시하고 싶습니다. 또한, 모델이 바뀌어도 남아있을 가능성을 고려하는 단계가 있습니다. 생성물이 시스템 오류를 반환하지 않더라도, 얼굴이 중간에 바뀌거나 컷 간의 일관성이 깨지는 경우가 있습니다. 이러한 ずれ는 출력을 병렬로 처리할 때 처음 발견됩니다. 모델이 빨라져도 최종적인 검토 단계는 없어지지 않았습니다. 적어도 H3를 사용한 범위에서는 그렇게 느껴졌습니다. 쫓아가야 할 것인가 솔직히 말씀드리면 전부를 따라가는 것은 불가능하다고 생각합니다. 2주 만에 3번 방문하셨습니다. 각각마다 도입 절차와 워크플로우, 그리고 프롬프트의 습관이 있습니다. 전부 다 시도해 보려면 작품을 만드는 시간이 없어져요. 그래서 저는 한 가지를 정해서 깊게 사용하는 것을 선택했습니다. 현재는 H3를 중심으로 하고 있습니다. 이유는 음성 동시 생성 기능이 제 용도에 잘 맞기 때문이고, 성능 비교 결과가 아닙니다. LTX-2.5는 공개된 제어 시스템 워크플로우를 제 환경에서 실행할 수 있게 되면 시도해 볼 계획입니다. 인페인트와 아웃페인트가 공정으로 분리된 것은 수정의 왕복이 많은 설계에는 효과적일 것 같아서 그렇습니다. 새로운 모델이 나올 때마다 갈아타는 것보다, 제 공정의 어떤 부분이 막혀 있는지 먼저 파악하고, 그것을 해결하는 모델을 선택하는 것이 빠를 것입니다. 세 개를 나란히 놓고 보니, 그렇게 생각했습니다. 정보가 진행되는 시기이므로, 이 기사 내용 포함하여 실행 전에는 공식 최신 정보를 확인해 주시기 바랍니다. 특히 LTX-2.5는 공개 직후이므로 파일 구성 및 권장 환경이 변경될 수 있습니다. #생성AI #AI영상 #ComfyUI #LTX영상 #MiniMaxH3 #씨댄스 출처: note 원문 번역: Gemma 3(.44) 초벌 + 교정 37청크 원문 보기 | 출처: note.com