# 최고 화질의 AI는 가장 유용하지 못했습니다 – 같은 사진을 4개의 영상 AI에 전달한 기록

> https://bookfactory.kr/c/news/9299
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-08-11T05:46:04.403Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/302335975/rectangle_large_type_2_f6598a979a7c80e70305ca40493914e3.png?width=1280)

저장된(개인 컴퓨터 상)에서 실행되는 영상 생성 AI가, 무심하게도 여러 종류로 늘어 있었습니다.

제 컴퓨터에는 지금 4가지 종류의 장치가 있습니다. 모두 “1장의 사진을 움직일 수” 있습니다. 늘어난 것은 좋은데, 그렇다 보니 다음부터 문제가 되는 것이 “어떤 것을 사용해야 할지”입니다.

소개 기사를 읽어보니, 모두 훌륭하게 작성된 것 같았습니다. 파라미터 수, 대응 해상도, 대응 시간 등을 확인했지만, 실제로 자신의 사진을 제출했을 때 결과가 어떻게 되는지는 여전히 명확하지 않았습니다.

그러다가 조건이 모두 갖춰진 상태에서 같은 사진을 4장이나 전달드렸습니다.

![画像](https://assets.st-note.com/img/1786399805-7xAbIqc1QyjJC608upRtlrZf.png?width=1200)

결과를 먼저 말씀드리자면, 화질 수치가 가장 좋았던 AI가 가장 쓸모가 없었습니다. 오늘 그 이야기를 말씀드리겠습니다.

## 모아둔 조건들

비교할 때 가장 중요한 것은 비교하고 싶은 곳 이외를 흔들지 않는 것이다. 이번에 모은 것은 다음과 같다.

- 시작이 되는 사진: 똑같은 1장 (창가에 선 여성의 포트레이트)
- 지시문(프롬프트): 한 자 한 자 동일
- 출력 사이즈: 576×736
- 길이: 약 5초
- 시드 값: 동일한 값

지시문 안 내용은 대략적으로 다음과 같습니다. “창가에 서서 조용히 숨을 쉬며 눈을 깜빡이고, 카메라를 아주 조금만 바라보며 작게 미소 짓는다. 카메라가 고정되어 있으며, 약간의 흔들림만 있다.”

그러니, 크게 움직이지 않도록 부탁드립니다. 여기가 이번의 이별이 되었습니다.

컴퓨터는 그래픽 부품(GPU)이 12GB, 일반 메모리가 32GB라는, 가정용으로는 중간 정도의 구성입니다.

## 그녀는 마치 텅 빈 셔츠처럼, 텅 빈 느낌이었다. 텅 빈 셔츠는 아무것도 걸치지 않은 것처럼 보이지만, 그 안에는 무언가가 숨어 있는 것 같았다. 그녀는 그런 셔츠를 입고 있었다.

나는 그녀의 텅 빈 눈을 바라보며 생각했다. 그녀는 무엇을 잃었을까? 그녀는 무엇을 찾고 있을까? 그녀는 왜 이렇게 텅 비어 있는 걸까?

나는 그녀에게 물었다. “너는 무엇을 하고 있었니?”

그녀는 대답하지 않았다. 그녀는 그저 나를 바라볼 뿐이었다. 그녀의 눈은 여전히 텅 빈 채였다.

나는 그녀의 텅 빈 눈을 바라보며 다시 생각했다. 그녀는 무엇을 잃었을까? 그녀는 무엇을 찾고 있을까? 그녀는 왜 이렇게 텅 비어 있는 걸까?

나는 그녀에게 다시 물었다. “너는 무엇을 하고 있었니?”

그녀는 여전히 대답하지 않았다. 그녀는 그저 나를 바라볼 뿐이었다. 그녀의 눈은 여전히 텅 빈 채였다.

나는 그녀의 텅 빈 눈을 바라보며 절망했다. 그녀는 무엇을 잃었을까? 그녀는 무엇을 찾고 있을까? 그녀는 왜 이렇게 텅 비어 있는 걸까?

나는 그녀에게 마지막으로 물었다. “너는 무엇을 하고 있었니?”

그녀는 마침내 대답했다. “나는… 나는 ‘夏帆’를 읽고 있었어.”

4개의 영상을 3개의 숫자로 측정했습니다.

![画像](https://assets.st-note.com/img/1786400333-bHSLmFCU5KQdNzoRJ70Zn4vs.png?width=1200)

숫자의 의미를 간단히 설명하겠습니다.

세부적인 묘사는 화면 안에 얼마나 정교한 문양이 남아있는지 보여줍니다. 클수록 피부, 머리카락, 배경이 더욱 선명하게 표현됩니다.

시점 재현은 1컷目が 원 사진과 얼마나 일치하는지 확인하는 것입니다. 차이가 작을수록 전달받은 사진이 첫 번째 컷에 그대로 반영됩니다.

움직임의 크기는 인접한 그림이 얼마나 다른지를 나타냅니다. 이번에는 “크게 움직이지 말아달라”고 요청드렸으므로, 작을수록 지시를 따르는 것입니다.

## 가장 놀라운 점은

표를 다시 한번 살펴보세요.

LTX 2.3는 세부 사항의 양이 48.4로 4개 항목 중 가장 많았습니다. 실제로 살펴보면 피부의 질감이나 한 가닥 한 가닥의 머리카락은 확실히 가장 풍부했습니다. 이 부분만 놓고 보면 “승리”입니다.

그러나 움직임의 크기가 9.74로, 다른 3개는 0.87에서 1.57 사이인데, 한 건만 숫자가 다릅니다.

무라카미 하루키의 소설 『카호』에서 한 여자가 뒤를 돌아 화면 밖으로 나가 버렸습니다.

저는 “잠시 카메라를 향해 조금 미소 짓도록 부탁드렸습니다.”라고 요청했습니다. 돌아온 것은 정반대였습니다. 카메라를 등지고, 두 사람은 머리끈만 화면에 남아 5초 동안 끝났다는 것입니다.

또한, 이를 만드는 데 25분 33초가 걸렸습니다. 가장 빠른 것이 1분 58초이므로, 13배에 달합니다.

25분 동안 기다리다 보니, 지시와 반대되는 영상이 나타났다. 이것이 “화질 수치가 가장 좋았던 AI”의 실제였다.

![画像](https://assets.st-note.com/img/1786400735-YQnOK9Sxw324gFsNvTRhdMEi.png?width=1200)

## 말을 따르는 것은 숫자로 표현될 수 있다.

이 경험을 통해 제가 깨달은 것은, 영상 생성 AI를 비교할 때에는 화질만 보아서는 안 된다는 것입니다.

정지 이미지 AI라면 화질은 상당히 중요한 지표라고 생각합니다. 하나의 그림으로서 좋은 결과가 나오기 때문입니다.

하지만 영상은 달랐습니다. 영상은 “움직임” 자체가 결과물입니다. 그리고 움직임은 이쪽의 지시대로 움직이는지 여부로만 좋고 나쁨이 결정됩니다. 아무리 아름다워도, 요청하지 않은 움직임을 했다면 다시 만들어야 합니다.

그러고 나서 도움이 된 것이 바로 앞서 언급한 “움직임의 크기”라는 숫자였습니다. 인접한 칸의 차이를 평균하는 것만큼이나 매우 단순한 계산입니다.

- 조용히 해 줘”라고 요청했는데 숫자가 너무 컸던 → 지시를 따르지 않고 있었다.
- 움직여 주질 않네요.

숫자 자체에 좋고 나쁨은 없어요. 부탁했던 내용과 숫자가 맞는지 확인하는 것이 중요합니다. 이렇게 되면, 영상을 수십 개나 꼼꼼히 비교봐도 틀린 것을 먼저 걸러낼 수 있습니다.

이번에 경우, MiniMax H3의 0.87이 가장 지시에 가깝고, LTX 2.3의 9.74가 가장 멀리 떨어져 있다는 해석이 됩니다.

## 시작점 사진을 얼마나 소중히 여기는지

또 한편, 생각했던 것보다 더 큰 차이가 있었던 것은 ‘시즈메의 재현’이었다.

MiniMax H3는 2.74이고, 나머지 3본은 각각 5.78, 5.84, 6.82입니다. 2배 이상의 차이가 있습니다.

이는 무엇을 의미하는지 묻는다면, H3는 제가 보낸 사진을 거의 첫 번째 칸으로 만들어주셨고, 나머지 3개는 “참고하면서 다시 그리고 있다”는 의미입니다.

그림을 다시 그릴 때, 얼굴이 조금씩 변형됩니다. 원본 사진을 마음에 두고 그 사람의 모습 그대로 유지하고 싶다면, 이 차이는 상당히 영향을 미칩니다.

이유를 조사해 보니까, 시스템적으로 어긋났습니다. H3는 제가 전달한 이미지를 해당 영상의 기준으로 직접 내재시키는 방식으로 설계되어 있었고, 나머지는 참고 정보로 첨부하는 것뿐이었습니다. 설계의 차이가 그대로 숫자로 나타난 형태입니다.

## 빨리 하려고 노력한 결과, 생각보다 효과가 있었습니다.

또 다른 시도를 해보았으며, 생성을 더 빠르게 하는 두 가지 방법을 순서대로 추가해갔습니다.

같은 조건(동일한 크기, 동일한 종)에서 측정한 결과입니다.

![画像](https://assets.st-note.com/img/1786400497-9AEViQfuOmS42Wnwd0F1qLyl.png?width=1200)

첫 번째 방법은 인공지능이 내부적으로 수행하는 “어떤 것에 주목할지”라는 계산을 정확도를 약간 낮추는 대신 더 빠르게 수행하는 것입니다. 두 번째 방법은 계산 중간 결과가 이전 결과와 크게 다르지 않을 때, 계산하지 않고 재사용하는 것입니다.

3분 28초가 1분 30초로 변경되었으며, 절반 미만입니다.

관심은 품질이지만, 3개를 나란히 봤을 때 구도와 인물도 거의 같았습니다. ①과 ②의 방법을 활용했을 때 배경의 파도가 약간 더 부드럽게 보이는 정도입니다.

하지만 한 가지 알아낸 점이 있습니다. ‘工夫②’를 넣으면 소리가 작아졌습니다. 이 AI는 영상과 음성을 함께 만드는 데 사용되는데, 음량의 평균이 -34.6에서 -40.3dB로 낮아졌습니다. 영상에는 거의 영향을 주지 않지만, 오히려 음량에는 영향을 미쳤습니다.

音を主役にしたい場面では、工夫②は外したほうが良さそうです。

## 넘어진 지점들도 상세히 기록해 두었습니다.

성공적인 이야기만으로는 도움이 되지 않기 때문에, 짚었던 문제점들도 그대로 남겨두겠습니다.

첫 번째: 파일 이름을 맹신해서는 안 되었습니다.

LTX 2.3 のために保存してあった設定ファイルには、名前に「I2V」（画像から動画）と入っていました。ところが中を開けたら、画像を使わない設定で保存されていたのです。

처음 실행했을 때, 전혀 다른 사람의, 전혀 다른 장소의 영상이 나타났습니다. 25분이나 기다린 끝에 얻은 결과입니다. 프로그램 내부를 살펴보니, 특정 스위치가 켜진 상태에서 이미지를 삭제하도록 만들어져 있었고, 그 스위치가 켜진 채로 저장되어 있었습니다.

자신이 만든 파일이라도, 오랫동안 사용하지 않다 다시 쓸 때는 내용을 확인해 보는 것이 좋다는 교훈이 되었습니다.

2번: “고요한 소리”라고 쓰니까 정말로 아무 소리도 나지 않았어요.

조용한 실내의 공기 소리, 유리창 너머 희미하게 들리는 자동차 소리와 요청했습니다. 나온 음성은 거의 들리지 않는 상태였고, 음량은 -63.5로 실질적으로 무음이었습니다.

“かすかな”、“静かな”라고 쓰면 그대로 구현해 주신 거죠. 지시를 충실히 따르는 것의 반면이었습니다. 들리는 소리가 필요하다면 소리를 약화시키는 표현을 사용하지 않고, 울려야 할 소리를 그대로 써야 했습니다.

3번: 페이지 수가 다른 물건이 있었습니다.

2.2 I2V-A14B만 1초에 16コマ였습니다. 나머지는 24コマ입니다. 같은 5초라도 프레임 수가 81枚와 124枚에서는 움직임의 자연스러움이 달라집니다. 표의 숫자를 가로로 볼 때, 여기도 함께 보아야 했습니다.

## 결론적으로, 그 모든 것을 겪고 나서 결국 모든 것이 엉망진창이 되었다는 것을 깨달았다. 물론, 그 과정에서 많은 것을 배웠지만, 모든 것을 정리하고 다시 시작하는 것은 불가능했다. 마치 거대한 퍼즐을 풀려고 노력하는 것과 같았는데, 결국 퍼즐 조각들이 흩어져 아무것도 완성되지 않았다. 나는 그 모든 것을 겪으면서 삶은 예측할 수 없는 것이며, 때로는 모든 것을 잃어도 괜찮다는 것을 깨달았다. 그리고 그 깨달음 속에서 새로운 시작을 할 수 있었다.

이번 용도, 즉 “좋아하는 사진 한 장을 그 사람의 모습 그대로 지시대로 조금만 움직여서”라면 MiniMax H3를 선택합니다. 시작점 재현은 다른 배율보다 훨씬 높고, 움직임은 지시 범위 안에 들어오며, 2분 41초 만에 완료되고 음까지 포함됩니다.

LTX 2.3는 세부적인 양 측면에서는 분명히 우수했습니다. 큰 움직임을 표현하고 싶을 때, 또는 그림의 밀도를 높여야 할 때 활용될 것입니다. 다만 25분이라는 시간 제한과 지시에서 벗어나기 쉬운 특성은 인지하고 있는 상태에서 사용하게 될 것입니다.

WAN 2.2 TI2V-5B는 세부 사항의 양이 다른 것들보다 약 26% 정도 적고, 눈으로 보기에도 부드러운 인상을 주었습니다. 파일 크기가 9.3GB로 가장 작고, 작동은 가볍습니다.

2.  2 I2V-A14B는 사실 4본 중 가장 빠르게 1분 58초에 끝났습니다. 세부적인 부분들의 양도 상위권에 근접하며, 특히 1초 16コマ라는 점이 큰 영향을 미칩니다. 속도를 우선시한다면 이처럼 선택하는 것이 합리적일 것입니다.

## 마지막으로, 솔직히 말씀드리자면

이 비교에는 불공정한 부분도 있습니다.

계산의 횟수(단계 수)는 모델마다 권장되는 값에 따라 다르므로 모아놓지 않았습니다. 각 모델의 기본 설정으로 실행하고 있습니다. 따라서 “같은 판”이라고 말할 수 있는 것은 시작점의 사진, 지시문, 출력 크기, 길이, 난수 씨앗까지입니다.

또한, 이번에 측정된 세 가지 숫자는 단순한 기계적인 지표일 뿐입니다. “세부적인 양”은 섬세한 무늬가 있을수록 커지므로, 무늬가 좋은 것인지 나쁜 것인지 구분하지 않습니다. 실제로 처음으로 실행했던 LTX 영상에서는 화면에 글자와 같은 것이 새겨져 있었고, 그것도 “세부”로 계산되었습니다. 숫자는 시작점일 뿐이고, 결국에는 자신의 눈으로 확인해야 한다고 생각합니다.

그렇다고 해서 오늘 가장 남기고 싶은 점이 바로 이 한 가지입니다.

영상 생성 AI는 화질로 선택하면 실패합니다. 명령을 따르는지 여부로 선택하는 것이 결과적으로 더 빠릅니다.

25분 동안 기다려도 등 뒤를 돌려받은 5초가 나에게 그것을 알려주었다.

이것이 지금까지의 모든 것이며, 4개를 나란히 놓고 보면서 깨달은 모든 것입니다.

본문에서는 “빠르게 하는 방법”과 “실수했던 부분”을 최대한 전문 용어를 사용하지 않고 설명했습니다. 하지만 실제로 본인이 직접 동일한 작업을 재현하고자 하시는 분들에게는 이것만으로는 부족하다고 생각합니다. 오히려 어느 정도 지식을 갖춘 분들은 오히려 혼란스러울 수도 있을 것 같습니다.

어떤 메커니즘을, 어떤 값으로 입력했나. 그 25분의 실패는 어떤 스위치가 원인이었나. “고요한 소리”가 왜 무심해진 걸까.

그 시점을 기준으로, 사용한 설정을 하나씩 그대로 유지한 유료 파트를 준비했습니다. 직접 재현하고 싶거나, 동일한 문제를 피하고 싶다면, 아래 내용을 참고해 주시기 바랍니다. 숫자만으로 기록된 것이지만, 제가 반나절 만에 밟았던 지뢰를 그대로 피하실 수 있을 겁니다.

**출처:** [note 원문](https://note.com/geneai_jp/n/nb87450e81c71)

*번역: Gemma 3(.44) 초벌 + 교정 59청크*

[원문 보기](https://note.com/geneai_jp/n/nb87450e81c71) | 출처: note.com