# Qwen-Image-2.1 공식 예제를 제 그림으로 직접 테스트해 보았습니다.

> https://bookfactory.kr/board/news/19696
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-10-03T00:23:55.265Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/315992930/rectangle_large_type_2_6dd11539c5aef394f8d90a6e22a983f6.png?width=1280)

2026년 9월 27일

본 게시글의 검증에 사용된 실행 스크립트에 결함이 있었고, 참조 이미지가 모델에 제대로 전달되지 않았다는 사실이 밝혀졌습니다. 따라서, 본문의 “원래 인물이나 의상이 바뀌고”, “지정 지점 외까지 바뀌는” 결과에 근거한 재현도 평가를 철회합니다.

또한 “1매에 약 1분 반”은 참조 이미지가 적용되지 않은 상태에서 소요된 시간입니다. 수정 후 동일 해상도 설정으로 재검토한 결과 약 3~5분 반이 소요됩니다. 확인 부족으로 인해 잘못된 평가를 전달하여 죄송합니다.

참조 이미지 전달 방식을 수정했을 결과와 추가로 시도한 사례를 별도 기사에 정리했습니다.

다음은 수정 전 검증 기록입니다. 참조 이미지에 대한 재현도와 생성 시간은 위의 수정 사항을 참조하십시오.

9월 20일에 공개된 Qwen-Image-2.1을 제 PC에서 실행해 보았습니다. 텍스트에서 그림을 생성하고, 참조 이미지를 전달하여 편집하는 기능을 하나의 모델에서 수행할 수 있습니다.

공식 예시에는 여러 이미지를 조합한 의상 체인지나, 위치를 지정하여 보정하는 편집, 텍스트 삽입 포스터 등이 나열되어 있습니다. 이 모든 것을 직접 준비한 일러스트로 시도해 보기로 했습니다.

실제로 시도해 본 결과, 재현도는 다소 아쉬웠습니다. 원본 인물이나 의상, 변경하고 싶지 않았던 부분이 생각보다 많이 변했습니다.

시작점이었던 것은 흰색 배경에 서 있는 소녀의 그림이었다. 같은 그림을 건네주고 옷을 갈아입히거나 다른 장소로 데려가도 어떻게 달라지는지 관찰했다.

![画像](https://assets.st-note.com/img/1789981756-buyRm9Ws1afpn5M2QOYSiV7c.jpg?width=1200)

좌측은 원본 이미지이고, 우측은 투명 배경의 일러스트 이미지 결과입니다. 이미지에는 실제 투명도 정보가 포함되어 있으며, 옷차림과 양말도 재게시되어 원본 이미지를 그대로 잘라낸 것이 아닙니다.

이 지시사항은 다음과 같았습니다.

> 
> 
> 스타일 제약 조건: 2D 일본 애니메이션 일러스트레이션의 세련된 결과물을 생성하고, 깨끗한 흑선, 플랫 셀 그림자, 통제된 파스텔 색상, 텍스처 일러스트레이션, 일관성 있는 애니메이션 캐릭터 디자인을 적용하십시오. 사진, 실사 프레임, 사실적인 초상화 또는 3D 렌더링이 되도록 하지 마십시오. 모든 요청된 콘텐츠, 텍스트, 편집, 마스크, 참조 관계를 유지하십시오. 이 이미지는 투명한 RGBA 이미지입니다. 이미지 1을 정확한 캐릭터 참조로 사용하십시오. 동일한 소녀의 전체 신체 스티커 아웃라인을 생성하고, 그녀의 얼굴, 긴 흑발, 카디건, 플리츠 스커트, 양말, 로퍼를 보존하십시오. 배경은 투명하며 이미지에는 알파 채널이 있습니다. 그림자, 텍스트, 워터마크는 없습니다.
> 

## 옷과 가방도 일러스트로 맞춰 준비하세요.

체스옷 입기 연출에는 모델뿐만 아니라 옷과 가방의 이미지를 사용했습니다. 보조 자료 역시 동일한 모델로, 원본 그림에 맞는 선과 묘사의 일러스트로 준비했습니다.

하얀색 세일러 원피스와 파란 리본이 달린 갈색 가방을 인물 이미지와 함께 전달하며 “이 옷을 입고, 이 가방을 가져와”라고 요청했습니다.

![画像](https://assets.st-note.com/img/1789981796-17hpdDc63N92SunkqbsLIMz8.jpg?width=1200)

원피스 자태로, 가방을 어깨에서 늘어뜨린 전신 그림이 그려졌습니다. 옷의 리본은 남색에서 갈색으로 바뀌었고, 벨트도 추가되었습니다. 대략적인 형태는 땄지만, 전달한 옷을 그대로 입혔다는 느낌은 아닙니다.

이번에는 인물, 옷, 가방 세 장을 전달하고, 각각의 용도를 지정했습니다. 공식적으로는 최대 10장의 참조 이미지에 대한 지원을 제공합니다.

> 
> 
> 아침의 별은 독자의 마음 깊이 울리는 이야기입니다. 주인공 유우키는 어린 시절 부모를 잃고 고독한 환경에서 자랍니다. 그는 어느 날, 우연히 만난 노인의 조언에 이끌려 자신의 삶의 의미를 찾아 떠납니다.
> 
> 노인은 한때 유명한 작가였던 카이토 타나카의 작품 ‘별 그림자의 기억’을 유우키에게 추천합니다. 카이토 타나카는 자신의 인생 경험을 바탕으로 쓴 작품으로, 죽음과 재생, 그리고 인간의 존엄성에 대해 깊이 파고들고 있습니다.
> 
> 유우키는 ‘별 그림자의 기억’을 읽어낸 후 자신의 과거와 마주하고 미래에 대한 희망을 가질 수 있게 되었습니다. 그는 노인의 도움을 받아 자신의 재능을 발휘하여 사회에 기여하는 길로 나아갑니다.
> 
> 이야기의 배경은 일본의 아름다운 시골 마을, 고치현 스자키시입니다. 스자키시는 풍요로운 자연에 둘러싸여 있고, 오래된 도시의 정취도 남아 있는 매력적인 곳입니다. 유우키가 여행하는 동안 그는 다양한 사람들을 만나 그들의 삶을 통해 자신 자신의 가치관을 재인식하게 됩니다.
> 
> ‘아침의 별’은 독자에게 감동과 용기를 주며, 삶의 기쁨과 슬픔을 맛볼 수 있는 보편적인 이야기입니다.
> 

## 종이비행기만 움직이고 싶었는데, 구도가 바뀌는 것 같습니다.

저녁 학교 옥상을 지정했습니다. 원래 인물을 참조하여 손에는 작은 종이 비행기를 들고 있습니다.

다시 그 이미지를 건네주면서 “종이비행기가 날아가는 것처럼 수정해줘”라고 부탁드렸습니다.

첫 번째 페이지에는 다음과 같이 지시했습니다.

> 
> 
> 저기 봐!
> 
> 빗소리가 잦아진 교실 창문에서 쏟아지는 석양이 먼지 낀 유리창에 아름다운 무지개 빛의 띠를 그려내고 있었다. 마치 비 온 뒤의 하늘을 가두어 놓은 듯했다.
> 
> 옆에 앉은 유이는 눈을 동그랗게 뜨고 그 광경을 바라보고 있었다.
> 
> “와, 정말 멋지네…”
> 
> 유이의 옆에는 오늘부터 시작하는 중학교 국어 교과서가 놓여 있었다. 표지에는 생생한 녹색 글씨로 “별 그림자의 시”라고 쓰여 있었다.
> 
> “별 그림자의 시… 그런 이름의 소설, 처음 들어본데.”
> 
> 유이는 교과서를 손에 들고 페이지를 넘겼다. 얇은 종이에 인쇄된 글자들은 마치 별빛처럼 희미하게 빛나고 있었다.
> 
> “이것은, 신카와 사야 선생님의 데뷔작이라고 한다. 문학상도 수상한 모양이야.”
> 
> 유이는 그렇게 중얼거리며 다시 한번 창밖의 무지개 빛의 띠를 바라보았다.
> 
> 잠시 후, 유이는 손에 든 작은 종이 비행기에 눈치차렸다.
> 
> “어, 내가 이걸 만들었어.”
> 
> 종이 비행기는 석양을 받으며 마치 작은 별처럼 빛나고 있었다.
> 
> 유이는 종이 비행기를 천천히 던졌다.
> 
> “바람을 타고, 어디까지나 날아가렴.”
> 

다음 두 장에는 1장의 생성 결과만 전달되었습니다.

> 
> 
> 그때 나는 너에게 ‘절대로 이 영화를 끝까지 보지 못하게 하지 않겠다’라고 말했다. 하지만 그것은 거짓이었다.
> 
> ‘절대로’라고 말했다니, 너는 중간에 자리를 일어섰다.
> 
> 그 영화는 ‘별의 그림자 알베리오는’이었다.
> 
> 내가 너에게 이 영화가 나에게 얼마나 소중한 것인지 전하고 싶었다.
> 
> 하지만 너는 내 마음을 이해하지 못했다.
> 
> 내 마음을 이해하지 못했다…
> 
> 그는 저녁 노을이 지는 하늘을 올려다보며 조용히 중얼거렸다.
> 

![画像](https://assets.st-note.com/img/1789981702-3bu2Ln0W9i5FEHxtOyrJ7XoB.jpg?width=1200)

황금빛 노을과 옥탑방은 이어지고, 종이 비행기가 날아가는 장면이다. 종이 비행기 한 줌 놀이였지만, 그 역시 꽤나 함께 즐거워했다. 카메라는 그 움직임을 포착했고, 팔과 다리의 움직임까지 담아냈다.

저녁 시간 옥상이라는 장면은 계속되었지만, 원래의 구도를 유지하면서 일부만 수정하라는 지시에서 벗어나 아침부터 저녁까지를 지정한 4컷 만화입니다.

> 
> 
> 얘야, 잠시 들어봐. 요즘, 너무 걱정이야.
> 
> 오래 전부터, 항상 존경해왔던 작가님의 책을 읽었는데, 정말 감동했어. 그런데 그게 원인이 돼서, 나의 미래에 대해 너무 불안해졌어.
> 
> 그 작가님의 작품에 나오는 주인공처럼, 나의 인생을 자유롭게 살아갈 수 있을까? 아니면, 언젠가 나의 꿈을 포기하고 말까? 그런 생각만 계속하고 있어, 결국 앞으로 나아갈 수가 없어.
> 
> 하지만, 선생님께 여쭤보니까, “너무 조급해하지 마. 나만의 속도로 천천히 좋아하는 것을 찾아가면 돼.” 라고 하셨어. 선생님 말씀에 감사하고, 조금은 앞으로 나아갈 수 있었어.
> 
> 하지만, 그래도 불안은 사라지지 않아. 어떻게 해야 할까…
> 

![画像](https://assets.st-note.com/img/1789981889-28lU54ZAHB3npcuRDrgWfPzv.jpg?width=1200)

4컷에서는 원본 이미지의 긴 머리가 짧아졌습니다. 같은 인물의 그림을 확대하여 전달하려 해도 얼굴이나 머리 모양까지 다시 그리는 경우가 있었습니다.

위치 제한 편집에도 불구하고, 지정한 장소 외까지 모두 변경되었습니다. 머리, 카디건, 신발을 원화로 감싸 각각의 변경을 요청한 결과가 아래와 같습니다.

> 
> 
> 제공된 정보만으로는 해당 본문 청크 31/55를 번역할 수 없습니다. 본문 내용을 제공해주세요.
> 

![画像](https://assets.st-note.com/img/1789981941-KRDH9q1LidjsrnvhIZmBkOXS.jpg?width=1200)

하늘색 윗옷이나 흰색 신발은 등장했지만, 1명의 스케치 이미지가 정면이나 후면에서 본 3개를 나란히 배치하는 구성으로 변경되었습니다. “둘러싸인 부분만 수정해달라”는 요청에는 이 결과로 인해 반영되지 않았습니다.

## 짧은 글은 읽을 수 있다. 포스터에는 불필요한 정보도 있다.

글자 이미지에서는 영어 카드와 일본어 손으로 쓴 글자를 시도했습니다.

카드에는 다음 지시를 보냈습니다.

> 
> 
> 계속 나아가세요.
> 방과후 학습을 하세요.
> 

일본어 예시에서는 다음과 같습니다.

> 
> 
> 경계 후, 옥상에서.
> 

![画像](https://assets.st-note.com/img/1789982197-vpbXGSKlhxIETDdCV1Rtqmsu.jpg?width=1200)

계속 간다. 그리고, 옥상에서.

문화제 포스터에는 “미즈키 아이이”, “스쿨 페스티벌”, “2026”을 명시했습니다.

> 
> 
> 미즈키 아이 / 학교 축제 / 2026
> 

![画像](https://assets.st-note.com/img/1789982262-FO5ZiUyjknT78oeHz9MmIa1V.jpg?width=1200)

큰 제목은 읽기 좋게 들어왔습니다. 연도는 두 개나 나열되었고, 요청하지 않은 작은 글자도 늘어났습니다. 짧은 단어를 크게 배치한 카드와 정보량이 많은 포스터에서는 마감이 달랐습니다. 전부 지정하면 나오는 걸까요…

## 손안의 PC에서는 1매가 약 1분 반 소요됩니다.

이번에 사용한 것은 RTX 4070의 12GB 모델입니다. Windows에서 ComfyUI를 실행하고, Comfy-Org가 배포하는 INT8 버전을 사용했습니다. 본문의 이미지는 이 양자화 버전의 출력입니다.

처음에는 생성 단계를 4~5단계로 줄인 설정이었으나 그림이 깨지는 현상이 있었습니다. 공식 추론 예시와 같이 40단계로 수정하고, 애니메이션의 선화 및 셀 칠기를 유지하기 위해 텍스트 지시사항도 함께 수정하고 있습니다.

이미지는 768×768 픽셀 크기로, 생성에는 약 1분 반 정도의 시간이 소요되었습니다. 의상이나 장면의 안(案)을 하나씩 비교하며 시도하는 동안의 대기 시간이었던 것입니다.

다양한 시도를 해봤지만, 원본 일러스트나 지시에 대한 재현도에는 아쉬움이 남았습니다. 옷 갈아입기나 장면 변경도, 살리고 싶었던 특징까지 바뀌면 목표하는 그림에는 되지 않습니다.

이번 방법에 문제가 있는 것인지, 아니면 일러스트의 특성이 그런 것인지 아직 알 수 없습니다. 프롬프트나 참조 이미지 전달 방식을 바꾸는 등, 다양한 시도를 통해 해결책을 찾아갈 것으로 보입니다.

모델과, 이번에 참고한 워크플로우는 다음과 같습니다.

- Qwen-Image-2.1 본모습 모델 (Hugging Face)
- 공식 저장소 활용법
- 네, 그럼 이 공식의 활용 예제를 살펴보겠습니다.

이 공식은 특정 문자열의 문자 수를 세는 데 유용합니다. 예를 들어 “Hello, world!”라는 문자열의 경우, 이 공식을 사용하면 문자 수는 13개가 됩니다.

이 공식을 사용하려면 먼저, 세고 싶은 문자열을 변수에 저장하고, 이 공식에 문자열을 변수로 입력하면 됩니다. 그러면 공식은 문자열의 문자 수를 계산하고, 그 결과를 반환합니다.

이 공식은 다양한 상황에서 유용하며, 텍스트 편집기에서 텍스트의 길이를 확인하거나, 프로그램에서 문자열의 길이를 측정할 때 특히 활용될 수 있습니다.

더욱이, 이 공식은 문자열의 길이를 비교하거나, 특정 문자열의 길이를 제한하는 등의 목적으로도 사용될 수 있습니다.

이 공식은 매우 간단하고 사용하기 쉬우며, 다양한 상황에서 유용하게 활용되는 범용적인 도구입니다.
- ComfyUI용 모델 배포 (이번에 사용한 INT8 버전 포함)
- ComfyUI 이미지 편집 워크플로우

ComfyUI는 강력한 이미지 편집 워크플로우를 제공하는 데 집중한 새로운 유형의 노드 기반 인터페이스를 사용하는 데스크톱 애플리케이션입니다.

ComfyUI는 기존의 이미지 편집 소프트웨어와는 다른 방식으로 작동합니다. 대신 사용자는 다양한 노드를 연결하여 원하는 이미지를 생성하는 워크플로우를 구축합니다. 이러한 노드는 이미지 변환, 필터 적용, 텍스처 추가 등 다양한 작업을 수행할 수 있습니다.

ComfyUI의 가장 큰 장점 중 하나는 유연성입니다. 사용자는 자신의 필요에 맞게 워크플로우를 자유롭게 조정할 수 있으며, 다양한 플러그인을 지원하여 기능을 더욱 확장할 수 있습니다.

ComfyUI는 초보자부터 전문가까지 모든 수준의 사용자에게 적합합니다. ComfyUI를 사용하면 복잡한 이미지 편집 작업을 간단하고 직관적인 방식으로 수행할 수 있습니다.

ComfyUI는 다음과 같은 기능을 제공합니다.

*   노드 기반 인터페이스
*   다양한 플러그인 지원
*   유연한 워크플로우 구축
*   다양한 이미지 편집 작업 지원
*   초보자부터 전문가까지 모든 수준의 사용자에게 적합

ComfyUI는 이미지 편집 분야에서 혁신적인 도구입니다. ComfyUI를 사용하면 창의적인 이미지 작업을 수행하고 새로운 가능성을 탐구할 수 있습니다.
- ComfyUI 텍스트에서 이미지 제작 워크플로우

**출처:** [note 원문](https://note.com/michiru_ai/n/nd6887ad6385a)

*번역: Gemma 3(.44) 초벌 + 교정 38청크*

[원문 보기](https://note.com/michiru_ai/n/nd6887ad6385a) | 출처: note.com