이 글은 AI 이미지·영상 생성 서비스 “모니픽스”를 운영하는 monipix가 작성했습니다. AI 영상 제작 시 “로컬 생성”과 “클라우드 생성”을 혼동하지 않도록 정리하는 것입니다.
생성 AI 영상에 빠지면, 상당한 확률로 다음에 검색할 용어가 있습니다.
결국, 어떤 GPU를 사야 가장 빠른가?
RTX 5090으로는 5초 영상이 몇 분 안에 몇 분이고, RTX 3090으로는 20분 이상 소요됩니다. 이러한 “GPU 성능 비교”를 보면 오히려 고성능 카드가 갖고 싶어지네요.
단지 여기서 한 번 멈춰서서 잠시 쉬는 것이 좋겠습니다.
그 표에는 어떤 모델을, 어떤 설정으로, 어떤 PC에서 실행한 숫자들이 담겨 있는 걸까요?
이번에 “MiniMax H3의 GPU 벤치마크” 자료를 확인했습니다. 하지만 조사해 보니, GPU 이름과 VRAM 용량에 여러 가지 불일치가 있었고, MiniMax H3의 공식 로컬 벤치마크로 인정될 근거도 확인할 수 없었습니다.
결론적으로 MiniMax H3를 사용하고 싶다면 RTX 5090을 구매할 필요가 없습니다.
H3를 브라우저에서 사용하는 경우, 생성 처리는 클라우드 측에서 이루어지므로 현저한 GPU 성능이 생성 시간에 영향을 미치지 않습니다.
이 글에서는 제시된 소요 시간을 낭비하지 않고 “참조 데이터”로서 분석하며, 어디까지 믿어야 하는지, 그리고 로컬 비디오 생성의 GPU 표는 어떻게 만들어야 하는지를 정리합니다.
먼저, 30초 만에 결론입니다.
이 세 가지 사항을 알게 되면, 중간 숫자도 헷갈리지 않고 읽을 수 있습니다. 여기서부터 하나씩 확인해 나갈 것입니다.
먼저 확인합니다: “로컬 모델”과 “MiniMax H3”는 별개의 내용입니다.
AI 비디오에는 크게 두 가지 활용 방식이 있습니다.
지역 영상 생성
모델의 가중치를 PC로 다운로드하여 자신의 GPU에서 추론합니다.
- GPU 및 VRAM 용량이 생성 가능 여부와 소요 시간에 직접적으로 영향을 미칩니다.
- 드라이버, CUDA, 양자화, 오프로드 설정에 따라 달라진다.
- 초기 비용과 설치 시간이 소요됩니다.
- 상응하는 오픈 웨이트 모델이라면 세밀하게 환경을 조절할 수 있습니다.
MiniMax H3를 클라우드에서 생성
브라우저나 API를 통해 생성 요청을 하고, 처리 과정은 서비스 측의 계산 환경에서 진행됩니다.
- 손안에서 맥북이나 내장 GPU PC로도 가능
- 직접 모델이나 CUDA 환경을 설치할 필요가 없습니다.
- 내 RTX 5090과 RTX 3060에서 H3 자체의 생성 품질은 동일합니다.
- 이용료가 발생하지만, 고가의 GPU를 구매할 필요는 없습니다.
MiniMax의 공식 API 문서는 영상 생성을 “작업 생성 → 상태 확인 → 파일 획득”이라는 비동기 클라우드 처리로 안내하고 있습니다. 2026년 8월 11일 현재, H3를 로컬 GPU에서 실행하기 위한 공식 배포 가중치와 재현 가능한 GPU별 벤치마크를 확인하지 못했습니다.
여기, 매우 중요한 부분입니다.
지역 영상 모델의 벤치마크는 H3 벤치마크와 다릅니다.
만약 목적이 “GPU 검증”이 아닌 “H3로 영상을 제작하는 것”이라면, PC를 조립하기 전에 브라우저에서 한 번 출력물을 미리 확인해 보는 것이 판단하기 더 쉽습니다.
모니픽에서 MiniMax H3를 브라우저에서 직접 사용해 보세요.
제시된 5초 영상의 재생 시간을 그대로 나열해 봅니다.
다음은 이번에 ‘480p/768p 5초 영상 생성 시간’으로 제시된 수치입니다.
주의: 출처, 모델명, 커밋, 생성 단계 수, 양자화, OS, 드라이버 등의 정보가 불명확하므로 검증되지 않은 참고 자료입니다. MiniMax H3의 실제 측정 결과가 아닙니다.
- 제시된 GPU 명칭 RTX 4090 24GB, 480p 5초, 3.5~4분, 768p 5초, 6~8분 공식 사양과 비교한 주의사항 24GB라면 표준 RTX 4090이 아닌 RTX 4090 D v2의 가능성입니다.
- 제시된 GPU 명칭 RTX 5090 26GB, 480p 5초, 3.5~4분, 768p 5초, 10~14분 공식 사양과 비교한 주의사항입니다. 26GB 구성의 공식 GeForce RTX 5090은 확인되지 않으며, 표준판은 32GB입니다.
- 제시된 GPU 명칭: RTX 3070 Ti 16GB, 480p 5초, 4~5분 768p 5초, 14~21분 공식 사양과 비교한 주의사항, 공식 사양과 일치
- 제시된 GPU 명 RTX 5070 Ti 12GB, 480p 5초, 5.5분 768p 5초 21~32분 공식 사양과 비교한 주의사항 12GB는 RTX 5070의 공식 사양이며, RTX 5070 Ti는 16GB입니다.
- 제시된 GPU 명 RTX 4080 16GB, 480p 5초, 5~5.5분, 768p 5초, 18~25분 공식 사양과 비교한 주의사항. 공식 사양과 일치
- 제시된 GPU 명 RTX 4070 Ti SUPER 16GB 480p 5초 5.5~7분 768p 5초 21~32분 공식 사양과 비교한 주의사항 공식 사양과 일치
- 제시된 GPU 명 RTX 3090 24GB, 480p 5초, 6~8분, 768p 5초, 20~29분. 공식 사양과 비교 시 유의사항. 공식 사양과 일치
상위 콘텐츠일수록 더 빠르고, 768p 해상도로 전환 시 대기 시간이 늘어난다는 큰 경향이 나타납니다.
하지만 “천등표”라고 부르기에는 아직 조건이 충분하지 않습니다.
이 표를 그대로 믿을 수 없는 3가지 이유
GPU 이름과 VRAM 용량이 혼동되어 있습니다.
NVIDIA의 공식 사양에 따르면 표준 GeForce RTX 5090은 32GB GDDR7입니다. 24GB 버전으로 확인되는 것은 중국용 RTX 5090 D v2입니다.
또한, RTX 5070 Ti는 16GB, RTX 5070은 12GB입니다. “5070 Ti 12GB”라는 표현은 다른 제품의 성능과 혼동될 수 있습니다.
일본에서 부품을 찾는 독자들에게는 이것이 다소 치명적입니다. 모델 번호가 1자리라도 다르면 가격, 대역폭, VRAM 모두 달라지기 때문입니다.
VRAM이 많을수록 빠르다는 설명과 숫자가 모순된다.
제공된 데이터에서는 768p 해상도의 5090 24GB 모델이 6~8분, 5090 26GB 모델이 10~14분으로 나타납니다.
만약 같은 GPU 세대, 동일 조건에서 “VRAM 용량과 시간이 반비례한다”는 결과라면, 용량이 많은 쪽이 더 느린 결과는 설명할 수 없습니다.
そもそもVRAMは、単純な“速度メーター”ではありません。
일본어로 대략적으로 말하자면, VRAM은 “빠르다/느리다”보다 먼저 “모델이 탑재되는지 여부”를 결정하는 용량입니다.
속도에는 CUDA 코어, 메모리 대역폭, 텐서 연산, 정밀도, 어텐션 구현, CPU/RAM으로의 오프로딩 등이 영향을 미칩니다. VRAM이 충분히 남아있는 것만으로는 반드시 빨라지는 것은 아닙니다.
768p는 2~4배 확대도 모든 행에 적용되지 않는다.
같은 화면 비율이라면, 480에서 768로 한 辺을 늘리면 해상도는 약 2.56배 증가합니다. 비디오 확산 모델에서는 중간 텐서도 증가하여 소요 시간이 크게 늘어나는 것은 자연스러운 현상입니다.
그러나 제시된 값에서 배율을 계산하면 최소 1.5배에서 최대 5.8배입니다.
- 5090 24GB:약 1.5 ~ 2.3배
- 5070 Ti 16GB: 약 2.8 ~ 5.3배
- 5070 Ti 12GB表記:약 3.8 ~ 5.8배
- RTX 4070 Ti 슈퍼: 약 3.0 ~ 5.8배
대략 2~4배 정도라는 결과를 요약하려면 오차가 지나치게 큽니다. 적어도 중앙값, 시행 횟수, 워밍업 여부 등이 필요합니다.
정말 유용한 GPU 레이팅 테이블에 필요한 12가지 항목
로컬 비디오 생성 비교표를 작성한다면, GPU 명과 분수만으로는 충분하지 않습니다.
다음 조건을 고정하면 처음부터 “비교”가 성립됩니다.
- 모델명과 체크포인트
- 저장소 커밋 ID
- 텍스트를 비디오 또는 이미지로 변환하는 방법에 대해 알아보겠습니다.
이 기능은 매우 간단합니다. 텍스트를 입력하거나 이미지를 업로드하면, 이를 바탕으로 짧은 비디오를 생성해 줍니다.
다양한 스타일과 효과를 선택할 수 있으며, 원하는 대로 비디오 길이를 조절할 수도 있습니다.
이 기능은 마케팅, 광고, 교육 등 다양한 분야에서 활용될 수 있습니다.
더 자세한 내용은 아래 링크를 참고해 주세요.
- 해상도, 프레임 수, FPS, 영상 길이
- 프롬프트와 시드
- 추론 단계 수와 샘플러
- BF16 / FP16 / FP8 등의 정확도
- 양자화 방식
- 주의 구현체 구현
- CPU/RAM 오프로딩 여부
- 운영체제, GPU 드라이버, CUDA, PyTorch 버전
- 워밍업 후 3회 이상 중앙값 및 최대 VRAM
예를 들어, 공개용 표가 다음과 같은 형태라면 재검토하기 쉽습니다.
- GPU RTX 5090, VRAM 32GB
모델 / 커밋 모델명 / abc123
해상도 / 프레임 768p / xx 프레임
단계 / 정밀도 30 / BF16
중위값 xx분 xx초
최대 VRAM xxGB
OOM 없음
- GPU RTX 4080, VRAM 16GB, 모델/커밋 모델명: abc123, 해상도: 768p / xx 프레임, 스텝/정밀도: 30 / BF16 미디언 xx분 xx초, 최고 VRAM xxGB, OOM No
- GPU RTX 3090, VRAM 24GB 모델 / 커밋 모델명: model-name, abc123 / 해상도: 768p, xx 프레임 / 스텝: 정밀도 30, BF16 평균 xx분 xx초 / 최대 VRAM: xxGB, OOM No
3090은 느리지만 24GB나 있어서 끝까지 올라갈 수 있고, 4080은 새로운 모델이지만 16GB로 오프로드가 추가되었다.
숫자 순위보다 먼저 “같은 조건으로 비교하고 있는지” 확인한다. 일본에서 GPU를 구매한다면, 이 순서가 더 실패하기 어렵다.
로컬 생성과 클라우드 생성, 어느 쪽이 더 적합한가?
이는 우열이 아닌, 하고 싶은 것의 차이입니다.
길을 잃었다면 사양표보다 먼저 “무엇을 만들고 싶은지”를 결정합니다.
지역 기반 생성은 사람들에게 향한다.
- 반응하는 오픈 웨이트 모델을 반복적으로 실행하고 싶습니다.
- 환경 구축과 최적화를 그 자체로 즐길 수 있습니다.
- 모델, LoRA, 노드, 샘플러까지 면밀하게 관리하고 싶다.
- 이미 충분한 GPU와 전원 및 냉각 환경을 가지고 있습니다.
- 외부로 자료를 전송하지 않는 구조가 필요합니다.
클라우드 H3가 향하는 사람
- 먼저 아이디어가 영상으로 구현되는지 시도해 보고 싶다.
- GPU 구매보다 프롬프트와 연출에 시간을 쓰고 싶다.
- 맥이나 노트북에서 생성하고 싶다.
- CUDA와 그에 따른 의존성 문제를 피하고 싶다면
- 네이티브 2K와 음성 지원 H3 출력이 목표입니다.
또한 “로컬 환경이라면 무료”라는 표현에도 주의가 필요합니다. 모델 이용료가 없더라도 GPU 본체, 전원, 냉각, 저장 공간, 전기 요금, 설정 시간 등이 모두 발생할 수 있습니다.
한편, 클라우드는 생성마다 비용이 발생합니다. 어느 쪽이 더 저렴한지는 한 달에 제작하는 작품 수와 환경 구축을 업무가 아닌 취미로 즐길 수 있는 정도에 따라 달라집니다.
요약: GPU 구매와 H3 사용 이야기는 분리하여 고려하는 것이 좋습니다.
이번 주요 사항은 5가지입니다.
- MiniMax H3의 클라우드 생성에 손안의 고성능 GPU는 필수적이지 않습니다.
- 제시된 분수는 모델과 측정 조건이 불명확하므로 H3 실측이라고 부를 수 없습니다.
- 표준 RTX 5090은 32GB 용량을 제공하며, 24GB는 RTX 5090 D v2, 26GB 구성은 확인되지 않습니다.
- RTX 5070 Ti는 16GB 용량을 제공하며, RTX 5070은 12GB 용량을 제공합니다.
- VRAM은 단순한 속도 문제가 아니라, 우선 모델이 탑재될 수 있는지에 따라 영향을 받습니다.
GPU 검증이 목적이라면 조건부 로컬 모델 벤치마크를 구축한다.
H3로 영상을 제작하는 것이 목적이라면, GPU를 구매하기 전에 먼저 5초 분량의 영상을 생성하여 원하는 움직임과 음성이 나오는지 확인하는 것이 좋습니다.
이 두 가지를 분리하는 것만으로도 수십만 엔짜리 쇼핑과, 하나의 영상을 같은 고뇌에 빠지지 않아도 됩니다.
GPU를 준비하지 않고, Monipix를 사용하여 MiniMax H3의 5초 영상을 만들어 보았다.
자주 묻는 질문
MiniMax H3는 제 자신의 GPU에 설치할 수 있나요?
2026년 8월 11일 현재, H3을 로컬 추론에 활용하기 위한 공식 배포된 가중치와 절차를 확인할 수 없었습니다. Monipix에서는 클라우드 기반으로 H3을 이용하므로 모델 다운로드나 CUDA 환경이 필요하지 않습니다. 향후 공식 배포가 시작될 경우 모델의 라이선스와 필요한 VRAM을 다시 확인해주시기 바랍니다.
VRAM이 많은 GPU일수록 영상 생성 속도가 더 빨라집니까?
물론 속도가 빨라지는 것은 아닙니다. VRAM은 모델과 중간 데이터를 GPU에 올릴 수 있는지 여부를 결정하며, 부족할 경우 CPU 오프로드나 OOM(Out of Memory)을 피하는 데 중요합니다. 올린 후의 속도는 연산 성능, 메모리 대역폭, 정확도, Attention 구현, 추론 단계 등 여러 조건에 따라 결정됩니다.
해상도를 480p에서 768p로 높일 때 왜 시간이 더 걸릴까요?
같은 화면 비율이라면 해상도가 약 2.56배로 늘어나고, 각 프레임에서 처리하는 잠재 표현이나 중간 데이터도 증가하는 이유입니다. 하지만 소요 시간은 모델 구현이나 VRAM 부족으로 인한 오프로딩에 따라 크게 달라지므로, “반드시 2~4배”와 고정하지 않고 동일 환경에서 여러 번 측정하여 결과를 확인해 주십시오.
로컬 비디오 생성은 정말 무료한가요?
소프트웨어나 모델을 무료로 사용할 수 있다고 해도 완전히 무료한 것은 아닙니다. GPU, 전원, 냉각, 저장 공간, 전기 요금, 환경 구축 및 유지 보수에 시간과 비용이 소요됩니다. 소수의 동영상을 테스트하는 단계라면 클라우드를, 지속적으로 대량 생성하고 세밀하게 제어하고 싶다면 로컬 환경을 사용하는 것이 현실적입니다.
RTX 5090을 구매하면 MiniMax H3가 더 빠르지 않을까요?
Monipix 등 클라우드를 통해 H3를 사용하는 한에서는 제 RTX 5090이 H3의 생성 처리를 빠르게 하지 않습니다. GPU 구매는 로컬 대응 모델을 자신의 PC에서 실행하려는 목적이 있는 경우에만 고려해 보세요. H3가 목적이라면 우선 브라우저 생성으로 품질과 대기 시간을 확인하는 것이 더 확실합니다.
참조된 공식 정보
- MiniMax API:영상 생성
MiniMax API는 영상 생성에 특화된 API로, 텍스트 프롬프트 기반으로 고품질의 영상을 제작할 수 있도록 설계되었습니다. 사용자는 간단한 텍스트 설명을 입력하면, MiniMax API가 이를 기반으로 다양한 스타일과 내용의 영상을 생성합니다.
현재 MiniMax API는 다음과 같은 기능을 제공합니다.
* 다양한 스타일 지원: 사진, 애니메이션, 3D 렌더링 등 다양한 영상 스타일을 지원합니다.
* 고품질 영상 생성: 최신 AI 기술을 활용하여 고해상도, 고품질의 영상을 생성합니다.
* 사용자 맞춤 설정: 영상의 내용, 스타일, 길이 등을 사용자 정의할 수 있습니다.
* 빠른 생성 속도: 대용량 영상도 빠르게 생성할 수 있습니다.
MiniMax API는 광고, 마케팅, 콘텐츠 제작 등 다양한 분야에서 활용될 수 있습니다. 예를 들어, 짧은 광고 영상을 제작하거나, 소셜 미디어 콘텐츠를 제작하는 데 사용할 수 있습니다. 또한, 게임 개발, 영화 제작 등 창작 활동에도 활용될 수 있습니다.
MiniMax API에 대한 자세한 내용은 MiniMax 공식 웹사이트([https://minimax.ai/](https://minimax.ai/))에서 확인할 수 있습니다.
- MiniMax 공식 GitHub
- NVIDIA GeForce RTX 5090 공식 사양
- NVIDIA GeForce RTX 5090 D v2 공식 사양
- NVIDIA GeForce RTX 5070 시리즈 공식 사양
- NVIDIA GeForce RTX 40 시리즈 공식 사양
- NVIDIA Ampere GA102 공식 백서
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 89청크
원문 보기 | 출처: note.com