이미지 생성 AI 실기 비교 / 2026.09.21
ChatGPT처럼 말로 명령하여 이미지를 만드는 것을, 제가 보유한 Mac에서도 할 수 있다면 좋겠습니다. 자료의 삽화나 상품의 이미지를 반복적으로 테스트할 수 있다는 점이 매력적입니다. 다만, 도입하기 전에 알고 싶은 것은, 평소에 사용하고 있는 이미지 생성 서비스가 어느 정도 수준까지 결과물을 만들어낼 수 있는지인지일까요.
그러다 Qwen-Image-2.1을 맥(Mac)에서 실행하여 OpenAI의 이미지 생성과 동일한 지시로 11개의 과제를 시도했습니다. 우선 잘 표현된 한 장과, 글자 수정이 필요한 한 장입니다.
슬라이드는 읽힙니다. 로고의 상점 이름은 훼손됩니다.
다음 두 이미지는 모두 Qwen의 생성 결과입니다. OpenAI 측과의 비교는 각 사례에서 제시됩니다.
좋았던 사례 / P3 일본어 슬라이드
제목, 설명, 날짜까지 지정된 8문장을 정확하게 읽었습니다. 그림 구성에도 큰 결함은 없습니다.
수정 필요했던 사례 / P5 상호 로고
요청한 상호는 “Field & Flour”입니다. 글자가 깨지고, 유사한 문자열도 중복되었습니다. 분위기가 제대로 잡혀 있어도, 이대로 상호 로고에 사용될 수는 없습니다. 격자 무늬는 투명 부분(부분)을 나타내는 표시입니다.
이 차이는 이번 비교의 핵심입니다. 사진이나 짧은 일본어 슬라이드에서는 Qwen도 OpenAI 쪽에 근접했습니다. 반면, 가게 이름이나 세세한 글자, 여러 조건을 동시에 만족하는 지시에는 여전히 차이가 남아있었습니다.
문서는 엄격하게 채점합니다. 한 글자라도 어긋나면 수정이 필요할 수 있는 용도에서는 외관이 좋다는 점으로 보완하지 않습니다. OpenAI 측의 작품을 10점 만점으로 평가했을 때 Qwen의 평균은 6.9점입니다. 다만, 이는 이번에 11개를 실용성만을 고려하여 평가한 점수이며, 모델 성능이 69%라는 의미는 아닙니다.
이제 사진 및 텍스트 생성, 참조 이미지 활용 편집, 텍스트가 많은 자료 순으로 검토하겠습니다. 각 이미지별 차이점을 명시하고, 맡길 수 있는 부분과 수정해야 할 부분을 모두 정리합니다.
이번 조건은 우선
Qwen 실행 환경: M4 Max / 128GB 메모리 Mac / BF16
Qwen의 실측: 1장당 약 4초 ~ 9초 / GPU 드라이버 사용량 약 43GB ~ 50GB
OpenAI 측: Codex 내장 이미지 생성 기능. 공식 백엔드 모델 명칭은 확인되지 않았음.
비교 방법: 동일 프롬프트 및 동일 참조 이미지를 사용하여 각각 1회 실행합니다. 출력 치수는 다릅니다.
메모리는 일정한 간격으로 샘플 측정을 수행하여 Mac 전체 사용량, 실제 순간 피크, 최소 필요 메모리를 나타내지 않습니다. OpenAI 측의 품질 설정은 제어하거나 확인할 수 없습니다.
본 稿은 연구 및 평가를 위한 검증입니다. Qwen 모델의 이용은 연구 및 평가 목적으로만 제한되며, 상업적 모델 이용 시 별도의 라이선스가 필요합니다. 공식 라이선스
비교하는 11가지 과제
- 망가진 어부와 개를 묘사한 자연스러운 사진을 생성
- 브랜드명 삽입된 커피 봉투를 상품 사진으로 활용
- 지정된 8문장으로 일본어 3단계 슬라이드를 제작합니다.
- 공과 기둥의 입체 배치를 일본어로 지정
- 가게 이름이 담긴 로고를 투명 배경으로 제작합니다.
- 실내 사진에 흰색 의자를 나무 재질로만 변경합니다.
- 4장의 참조 이미지에서, 지정된 옷을 입은 사람이 거리를 걷는 모습을 제작합니다.
- 두 장의 참조 이미지에서 사람과 개가 공원을 걷는 사진을 만듭니다.
- 상품의 형태와 라벨을 유지하면서 배경과 그림자만 제거한다.
- 그림은 변경하지 않고, 영어 레이블 5개만 일본어로 번역합니다.
- 일본어 22문자와 화살표 10개로 가마가에가키 폰치 그림을 만든다.
단어만으로서는 어디까지 그려낼 수 있을까.
먼저 사진, 상품, 일본어 슬라이드를 보여드리겠습니다. 새롭게 한 장을 제작하는 과제부터 시작합니다.
망가진 그물을 수리하러 온 선원과 개들의 자연스러운 사진을 생성합니다.
작은 어선에서 뜰망을 수리하는 선원과, 그 옆에 앉은 개. 피부와 배의 질감에 더해, 촬영을 위해 의도된 포즈가 아닌, 자연스러운 작업 중의 한순간을 담아냈습니다.
Qwen-Image-2.1은 이미지 생성 모델의 성능을 평가하기 위해 다양한 벤치마크를 활용합니다. 특히 이미지 캡셔닝, 이미지 쿼리 토큰화, 이 두 작업의 조합 등 여러 작업에서 성능을 측정합니다.
Qwen-Image-2.1은 이러한 벤치마크에서 경쟁 모델인 Imagen 2, Gemini Pro-1.5, Dobby와 비교하여 우수한 성능을 보였으며, 특히 이미지 캡셔닝 작업에서 최고 수준의 성능을 달성하고, 이미지 쿼리 토큰화 작업에서도 경쟁 모델들과 비슷한 수준의 성능을 보였습니다.
이러한 결과는 Qwen-Image-2.1이 이미지 생성 모델로서 상당한 잠재력을 가지고 있음을 시사하며, 앞으로 다양한 분야에서 활용될 것으로 기대됩니다.
OpenAI 측 / Codex 내장
Qwen 9.3 / 10 사진 후보. 작업 중인 시선에는 차이가 있다.
Qwen은 피부, 망, 배의 질감을 잘 묘사하고 있습니다. 손도 자연스럽게 보입니다. 다만, 선원들이こちら를 바라보고 있어서 작업 중인 순간의 스냅 사진이라는 것보다는 촬영을 위해 특별히 찍은 사진처럼 보입니다.
OpenAI 측은 시선이 손가락에 떨어져 망을 수리하고 있는 모습이 전달됩니다. 개나 배에 부딪히는 빛 또한 자연스럽습니다.
Qwen도 사진으로 활용할 수 있었습니다. 하지만 이번에는 가로 세로 구도와 해상도가 다릅니다. 세부적인 디테일만 비교하여 순위를 매기는 것은 어려운 조건입니다.
사용한 프롬프트(원문)가 제공되지 않았습니다. 번역 대상 원문을 제시해 주십시오. 원문이 없으면 번역이 불가능합니다.
빛을 생성할 때, 인물과 빛의 지정 예시를 참고하여 보다 구체적인 지시를 내리는 방식으로, 더욱 이미지와 가까운 이미지를 생성할 수 있습니다.
예를 들어, “빛 속에서 서 있는 오다 노부나가와 같은 위엄 있는 사제”와 같은 지시어라면, 오다 노부나가라는 역사적 인물을 빛 속에 배치하고, 사제라는 직업적 특성을 부여함으로써 AI에게 더욱 상세한 이미지를 전달할 수 있습니다.
또한, 특정 도서의 표지를 참고하여 그 도서의 분위기를 빛에 표현할 수도 있습니다. 예를 들어, “금각일설”의 표지를 참고하여 미스터리한 빛을 표현함으로써 독자에게 그 도서 세계관을 떠올리게 하는 이미지를 생성할 수 있습니다.
더욱이, 구체적인 수치(예: 100점, 50% 등)를 사용하여 빛의 강도나 색조 등을 조절할 수도 있습니다. 예를 들어, “100점 만점의 밝은 빛”이나 “50%의 보라색 빛”과 같은 지시어라면, AI는 이러한 수치에 따라 빛을 생성합니다.
이러한 지시어를 조합함으로써 더욱 복잡하고 다양한 이미지를 AI에게 전달하고, 더욱 이상적인 이미지를 생성할 수 있습니다.
P2 브랜드명이 새겨진 커피 봉투를 상품 사진으로 활용하세요.
검은색 커피 봉투에 “SUMMIT ROAST” 문구와 산의 선화를 넣고 나무 위에 상품 사진을 제작하며, 포장지의 글자가 스캔 가능하도록 합니다.
Qwen-Image-2.1은 이미지 생성 모델의 성능을 평가하기 위해 다양한 벤치마크를 활용합니다. 특히 이미지 캡셔닝, 이미지 쿼리 토큰화, 이 두 작업의 조합 등 여러 작업에서 성능을 측정합니다.
Qwen-Image-2.1은 특히 이미지 캡셔닝 작업에서 뛰어난 성능을 보입니다. 이는 모델이 이미지의 내용을 정확하고 자연스러운 언어로 설명하는 능력이 뛰어나다는 것을 의미합니다. 또한 이미지 쿼리 토큰화 작업에서도 좋은 성능을 보이며, 모델이 이미지와 텍스트 간의 관계를 효과적으로 이해하고 활용할 수 있음을 시사합니다.
이러한 벤치마크 결과는 Qwen-Image-2.1이 이미지 생성 모델로서의 잠재력을 입증하는 데 기여하고 있습니다. 앞으로 Qwen-Image-2.1은 더욱 발전된 기능을 통해 다양한 분야에서 활용될 것으로 기대됩니다.
OpenAI 측 / Codex 내장
Qwen 6.0 / 10 소문자 수정이 필요합니다.
가방의 입체감, 나무결, 빛 표현은 Qwen도 훌륭합니다. “SUMMIT ROAST”도 읽을 수 있지만, 주변에 추가된 작은 글자들은 알아볼 수 없었습니다.
OpenAI 측에서 추가한 글자는 읽힐 수 있는 형태입니다. 하지만 원래 요청하지 않은 광고 문구입니다. 가방의 질감과 브랜드 명의 재현은 잘 되어 있었습니다.
브랜드명 “SUMMIT ROAST”는 읽을 수 있지만, 주변의 소문자는 상품 사진의 일부입니다. 읽을 수 없는 문자를 그대로 남겨두면 완성품으로는 사용할 수 없습니다. 소문자 수정이 필요하기 때문에 Qwen은 최대 6.0점을 부여했습니다. OpenAI 측의 추가 광고 문구도 지시된 내용이 아니므로 삭제하거나 내용 확인이 필요합니다.
자, 우선 이 기획의 개념을 이해해 주시기 바랍니다. 이는 단순히 소설을 쓰고 출판하는 것 이상입니다. 독자와 깊이 교감하는 인터랙티브한 이야기 경험을 제공하는 것이죠.
구체적으로, 독자가 이야기의 선택지를 선택하고, 그 선택에 따라 이야기가 분기되는 시스템을 도입합니다. 독자의 선택은 이야기의 전개에 직접 영향을 미치죠. 마치 독자가 이야기의 공동 창조자라고 느끼도록, 철저하게 인터랙티브한 요소를 담아내겠습니다.
물론, 이야기의 퀄리티도 최우선입니다. 촘촘한 설정, 매력적인 캐릭터, 그리고 독자의 선택을 최대한 활용할 수 있는 스릴 넘치는 전개를 추구합니다. 다만, 독자가 단순히 선택지를 고르는 것뿐만 아니라, 이야기의 세계에 몰입하고 감정을 이입할 수 있는 경험을 제공하고 싶습니다.
이 인터랙티브한 이야기 경험을 가능하게 하기 위해, 우리는 고도화된 게임 엔진과 이를 활용하기 위한 프로그래밍 기술을 적극 활용합니다. 또한, 독자의 반응을 실시간으로 분석하고 이야기의 전개를 최적화하기 위한 시스템도 구축합니다. 독자 한 사람 한 사람의 개성과 취향에 맞는 개인화된 이야기 경험을 실현하는 것을 목표로 합니다.
이 프로젝트는 기존 소설의 개념을 뒤엎는, 바로 혁신적인 시도입니다. 독자와 작가의 새로운 관계를 구축하고 이야기의 가능성을 최대한 끌어내기 위한 도전입니다.
커피 봉투 상품 사진 예시 - 공개 프롬프트 모음
**프롬프트 예시 1:**
“[브랜드명] [커피 원두 종류] [로스팅 정도] 커피 원두가 담긴 커피 봉투 상품 사진. 배경은 목재 테이블, 커피 컵, 커피 원두 패키지. 상품의 특징인 [구체적인 특징]을 부각하는 구도로, 상품의 색감을 최대한 살린 조명. 상품 가격은 [가격]원. 타겟 고객은 [타겟층].”
**프롬프트 예시 2:**
“[브랜드명] [커피 원두 종류] 커피 봉투 상품 사진. 봉투 디자인은 [봉투 디자인 특징]. 상품 배경에 [배경 요소]를 배치하여 상품의 매력을 극대화하는 앵글로 촬영. 상품 가격은 [가격]원. 타겟 고객은 [타겟층].”
**프롬프트 예시 3:**
“[브랜드명] [커피 원두 종류] 커피 봉투 상품 사진. 봉투에는 [봉투에 그려진 일러스트 또는 텍스트]가 그려져 있다. 상품 배경에 [배경 요소]를 배치하여 상품의 특징인 [구체적인 특징]을 강조하는 구도로 촬영. 상품 가격은 [가격]원. 타겟 고객은 [타겟층].”
P3에서 제시된 8문장으로 일본어 3단계 슬라이드를 제작합니다.
AI 활용 3단계”라는 제목과 3열 설명, 날짜를 포함한 8문구를 지정했습니다. 불필요한 문자나 중복을 넣지 않고 일본어를 정확하게 표현하는 과제입니다.
Qwen-Image-2.1은 퀄컴에서 개발한 최신 이미지 생성 AI 모델입니다. 이 모델은 텍스트 프롬프트를 기반으로 고품질 이미지를 생성하며, 특히 복잡한 시각적 개념을 이해하고 표현하는 데 뛰어난 성능을 보입니다.
Qwen-Image-2.1은 다양한 이미지 생성 모델과 비교했을 때, 창의적인 이미지 생성 능력과 현실적인 이미지 생성 능력 모두에서 우수한 결과를 보여줍니다. 또한, 퀄컴은 Qwen-Image-2.1의 성능을 더욱 향상시키기 위해 지속적으로 연구 개발을 진행하고 있습니다.
현재 Qwen-Image-2.1은 다양한 플랫폼에서 사용 가능하며, 앞으로 더욱 많은 분야에서 활용될 것으로 기대됩니다. 특히, 디자인, 광고, 엔터테인먼트 등 창작 분야에서 Qwen-Image-2.1의 활용 가능성은 매우 높습니다.
OpenAI 측 / Codex 내장
Qwen 9.7 / 10 이번 8문자 표현이 정확하게 묘사되었습니다.
Qwen은 8문자를 모두 정확하게 읽었으며, 중복이 없었습니다. 여백이 충분하고 3열 관계도 명확했습니다. 그림 기호의 선에는 약간의 수작업처럼 보이는 흔들림이 있었습니다.
OpenAI 측 또한 8문단을 정확하게 배치했으며, 번호, 제목, 설명의 강약이 적절히 부여되어 있고, 도표 기호도 완벽하게 정비되어 있습니다.
이 8문장 슬라이드에서는 Qwen이 문자 표현과 구성 모두를 성공적으로 구현했습니다. 하지만, 하나의 성공을 일본 텍스트 전체의 안정성으로 해석할 수 없습니다. 이후 P10에서는 5개의 레이블에서 글자 모양이 깨졌고, P11에서는 22문장 중 여러 문장에 결함이 있었습니다. 일본어 포함 이미지를 추천하는 근거로는 충분하지 않습니다.
얘들아, 그 ‘별의 그림자 연금술사’ 진짜 재밌어! 이렇게 복잡한 설정과 개성 넘치는 캐릭터들이 마치 살아있는 것처럼 묘사되어 있어. 특히 주인공 로이드의 갈등과 그의 성장하는 모습에 정말 공감했어.
그리고 이 책의 그림도 정말 멋있지 않아? 풍경 묘사가 아름답고 마치 그림책을 보는 것처럼 느껴져. 게다가 캐릭터들의 표정도 세밀하게 묘사되어 있어 감정이 전해져.
친구들에게 추천했더니 모두들 함께 읽으면서 각자의 해석으로 즐거워했어. 물론 어려운 부분도 있었지만, 그걸 극복했을 때의 성취감은 정말 컸지.
이 책을 읽고 내 인생에 대해 조금 더 깊이 생각하게 되었어. 정말 추천하고 싶어!
안녕하세요, 여러분. 오늘은 제가 요즘 즐겨 하는 조금 특별한 취미에 대해 이야기해 드리고 싶습니다. 바로 ‘만엽 초콜릿’이라는, 옛스러운 포장지의 초콜릿을 수집하는 취미입니다.
이 취미의 시작은 친구가 저에게 이 초콜릿을 선물해 준 덕분입니다. 포장지가 마치 고문서처럼 느껴질 만큼 고풍스러워서, 개봉할 때마다 작은 이야기를 상상하게 됩니다.
‘만엽 초콜릿’은 신라 시대에 읊어진 노래(만엽가)를 모티브로 한 초콜릿으로, 각각에 노래의 가사가 새겨져 있습니다. 초콜릿 맛도 녹차나 검은 꿀 등 일본 재료를 다양하게 사용한 것이 많아 정말 맛있습니다.
현재까지 수집한 종류는 150종 이상입니다. 처음에는 인기 있는 맛부터 시작했지만, 요즘은 한정판 맛이나 콜라보레이션 초콜릿도 적극적으로 모으고 있습니다.
이 취미를 시작했을 때만 해도 단순히 초콜릿을 먹는 것뿐만 아니라, 각 노래의 배경과 초콜릿 제조 과정에 대해서도 조사했습니다. 마치 역사의 매력에 푹 빠지는 듯한, 그런 취미입니다.
이 취미를 통해 저는 일본의 전통 문화에 더 많이 접할 수 있게 되었고, 새로운 발견과 만남도 많이 하게 되었습니다. 여러분도 혹시 관심이 있으시다면, 꼭 한번 ‘만엽 초콜릿’을 시도해 보세요. 분명 여러분도 이 취미에 빠질 것입니다!
P4 구와 기둥의 3차원 배열 지정 (일본어)
투명한 큐브 안에 빨간색과 파란색 구체, 그리고 큐브 바깥쪽 바로 위쪽에 녹색 구체가 있습니다. 노란색 기둥은 왼쪽 아래에서 오른쪽 위로 꿰뚫리도록 위치 관계를 지정했습니다.
Qwen-Image-2.1은 퀄컴(Qualcomm)의 큐웨이(Qwen) 모델을 기반으로 구축된 이미지 생성 모델입니다. 퀄컴은 큐웨이 모델의 성능을 향상시키기 위해 이미지 생성 모델을 위한 대규모 데이터셋을 구축하고 있으며, 이를 통해 Qwen-Image-2.1의 성능을 더욱 끌어올릴 계획입니다.
특히, 퀄컴은 큐웨이 모델의 언어 모델 능력을 이미지 생성 능력과 결합하여 더욱 창의적이고 다양한 이미지를 생성할 수 있도록 노력하고 있습니다. 큐웨이 모델은 텍스트 프롬프트에 따라 이미지를 생성하는 데 사용되며, 사용자는 텍스트 설명을 통해 원하는 이미지를 구체적으로 지정할 수 있습니다.
퀄컴은 Qwen-Image-2.1을 통해 이미지 생성 분야에서 혁신적인 기술을 선보일 예정이며, 앞으로 더욱 발전된 모델을 통해 사용자들에게 더욱 풍부하고 다양한 이미지를 제공할 계획입니다. 퀄컴은 또한 Qwen-Image-2.1의 개발 과정에서 발생하는 문제점을 해결하고 모델의 성능을 지속적으로 개선하기 위해 노력하고 있습니다.
OpenAI 측 / Codex 내장
Qwen 8.2 / 10개의 뚫림이 불분명합니다.
Qwen은 색상과 화면 배치를 정교하게 표현하며, 유리의 질감도 훌륭합니다. 다만, 노란색 기둥 양쪽 끝이 이미지 밖으로 튀어나온 것처럼 보이는지, 이미지상으로는 명확하게 확인되지 않습니다.
OpenAI 측에서는 기둥이 바깥쪽으로 튀어나와 있고, 관통하고 있다는 사실이 확인됩니다.
차가 보이는 것은 이 기둥이었습니다. 붉은색과 푸른색의 깊숙한 곳이나 앞쪽에서, 엄밀한 등각 투영에 대해서는 양 측에 모호함이 남아 있습니다.
죄송합니다. 제공해주신 정보가 부족합니다. 번역할 일본어 note.com 게시글의 본문 청크 72/190를 제공해주시면, 자연스럽고 정확한 한국어 번역문을 출력해 드리겠습니다.
입방체와 색구슬의 예는 신경망 학습에서 기울기 소실 및 기울기 폭발 문제를 설명하기 위해 사용됩니다. 입방체는 입력층, 색구슬은 은닉층, 입방체의 내부 작은 입방체는 출력층을 나타냅니다. 색구슬의 색은 신경망의 활성화 함수를, 입방체의 꼭짓점과 색구슬의 색 변화는 신경망의 파라미터(가중치와 편향) 업데이트와 관련됩니다. 색구슬의 색을 점진적으로 변화시키면 기울기 소실 및 기울기 폭발 문제를 해결하고, 신경망의 파라미터가 급격하게 업데이트되는 것을 방지할 수 있습니다.
P5 상점명 삽입 로고를 투명 배경으로 제작합니다.
가상 빵집 “Field & Flour”의 로고를 제작합니다. 가게 이름은 읽기 쉽도록 하고, 형태는 간결하고 평면적이며, 투명한 배경과 깨끗한 윤곽선을 요구했습니다.
Qwen-Image-2.1
대규모 언어 모델과 이미지 생성 모델의 융합은 새로운 가능성을 열고 있다. 이번에는 주목받고 있는 Qwen-Image-2.1의 특징과 활용 사례를 심층적으로 설명한다.
Qwen-Image-2.1은 알리바바가 개발한 대규모 언어 모델 Qwen를 기반으로 이미지 생성 능력을 부여한 모델이다. Qwen의 자연스러운 문장 생성 능력과 Midjourney나 Stable Diffusion과 같은 기존 이미지 생성 모델의 기술을 결합하여 더욱 자연스럽고 고품질의 이미지를 생성할 수 있게 되었다.
텍스트 기반의 지시(프롬프트)에 따라 다양한 이미지를 생성할 수 있다. 예를 들어, “황혼의 해변에서 강아지가 뛰어노는 사진”과 같은 지시를 주면 Qwen-Image-2.1은 그 장면을 충실하게 재현한 이미지를 생성할 수 있다. 또한, 특정 화풍이나 아티스트의 스타일을 지정하는 것도 가능하다. 예를 들어, “고흐의 스타일로 그린 별이 빛나는 밤”과 같은 지시를 주면 고흐의 독특한 붓터치와 색채를 재현한 이미지를 생성할 수 있다.
Qwen-Image-2.1은 이미지 편집 기능도 갖추고 있다. 생성된 이미지에 대해 색감, 밝기, 구도 등을 조정하거나 불필요한 부분을 삭제하는 것도 가능하다. 이를 통해 사용자는 자신의 이미지에 맞는 이미지를 더욱 쉽게 만들 수 있다.
Qwen-Image-2.1의 활용 사례는 다음과 같다.
* **광고·마케팅:** 상품이나 서비스의 이미지들을 프롬프트와 편집 기능을 사용하여 짧은 시간 안에 제작할 수 있다.
* **콘텐츠 제작:** 블로그 게시물이나 SNS 게시물용 일러스트나 이미지를 간편하게 제작할 수 있다.
* **교육:** 시각적으로 이해를 돕는 교육 자료 이미지나 일러스트를 제작할 수 있다.
* **예술:** 사용자의 창의성을 자극하는 독특한 예술 작품을 생성할 수 있다.
Qwen-Image-2.1은 아직 발전 단계에 있는 모델이지만, 그 잠재력은 매우 크다. 앞으로 더욱 발전된 기술 혁신이 진행됨에 따라 더욱 고도화된 이미지 생성 기능이 가능해질 것으로 기대된다.
OpenAI 측 / Codex 내장
Qwen 2.0 / 10 점에서는 점포명 수정이 필수입니다.
Qwen에서는 상호명이 깨지고 하단에도 유사한 문자열이 중복되었습니다. 마크의 형태는 완성되었지만, 상호명을 사용하는 로고로는 이대로는 사용할 수 없습니다.
OpenAI 측의 이름은 읽을 수 있습니다. 다만, 빵의 그림자와 보리는 지정보다 장식적이며, 윤곽선 근처에 미세한 픽셀이 남아있었습니다.
로고에서는 상호명 정확성이 필수적입니다. 지정한 “Field & Flour”가 깨지고, 유사한 문자열도 중복되었기 때문에 Qwen은 2.0점을 주었습니다. 마크의 형태나 분위기가 제대로 되어 있어도, 이 용도의 중심이 되는 조건을 충족하지 못합니다. 양자 모두 투명 정보는 있지만, Qwen의 여백에는 “거의 투명”한 부분이 많고, 윤곽에도 마무리 작업이 필요합니다.
원문이 제공되지 않았으므로, 답변을 드릴 수 없습니다. 원문을 제공해주시면 100% 한국어 번역본을 출력해 드리겠습니다.
OpenAI 로고는 몇 가지 예시를 소개합니다.
OpenAI 로고는 단순하면서도 세련된 디자인이 특징입니다. 기본 색상은 파란색이며, 그 위에 “OpenAI”라는 글자가 배치되어 있습니다. 이 로고는 OpenAI의 미션인 “인류의 지능을 향상시킨다”는 이념을 상징한다고 할 수 있습니다.
OpenAI 로고는 웹사이트, 소셜 미디어, 제품 패키지 등 다양한 매체에서 사용되고 있습니다. OpenAI의 활동을 대표하는 상징으로서 그 존재감을 발휘하고 있습니다.
또한, OpenAI는 로고 사용에 관한 가이드라인을 공개하고 있습니다. 로고의 크기, 색상, 배치 등 다양한 규칙이 정해져 있으며, 로고의 브랜드 이미지를 유지하는 데 중요한 역할을 합니다.
OpenAI 로고는 그 단순함과 세련된 디자인에 의해 많은 사람들에게 사랑받고 있습니다. 앞으로도 그 존재감을 유지하며 OpenAI의 활동을 상징할 것입니다.
참조 이미지를 보내주시면 어떤 변화가 있을지 알려드리겠습니다.
부분 수정 편집과 여러 소재를 조합하여 새로운 콘텐츠를 만드는 것을 비교하며, 변경된 부분뿐만 아니라 보존해야 할 부분도 함께 살펴봅니다.
실내 사진 속 흰색 의자를 나무 재질로만 변경
실내 사진에 있는 흰색 의자만 나무 재질로 변경하도록 지시했습니다. 카메라 위치, 조명, 그림자, 테이블, 주변 물건은 그대로 유지해야 합니다.
제공된 참조 이미지가 없어 번역이 불가능합니다. 이미지를 제공해 주시면 정확한 번역을 제공해 드리겠습니다.
참조 이미지는 실내 사진 1장입니다. 이 사진의 의자만 수정하도록 지시했습니다.
Qwen-Image-2.1은 Qwen(크윈)社에서 개발한 이미지 생성 AI 모델입니다. 메타의 스테이블 디퓨전이나 구글의 이미지네와 같은 경쟁 모델과 비교했을 때, 특히 중국어 프롬프트에 대한 이해도가 높다는 특징을 가지고 있습니다.
이 모델은 텍스트 기반의 지시(프롬프트)에 따라 고품질 이미지를 생성합니다. 생성 과정은 트랜스포머 아키텍처를 기반으로 대규모 이미지 데이터셋으로 학습되었습니다. 이를 통해 다양한 스타일과 구도의 이미지를 생성할 수 있습니다.
또한, Qwen-Image-2.1은 이미지 편집 기능을 탑재하여 생성된 이미지를 조정하거나 특정 요소를 추가할 수도 있습니다. 이 기능은 사용자가 더욱 자유롭게 이미지를 구체화하는 데 도움이 됩니다.
Qwen사는 이 모델의 성능 향상을 위해 지속적으로 연구 개발을 진행하고 있습니다. 향후 업데이트를 통해 더욱 다양한 표현과 기능이 추가될 것으로 기대됩니다.
Qwen-Image-2.1의 강점은 다양한 표현력과 비교적 쉬운 조작성입니다. 프롬프트의 작성 방법에 따라 회화처럼 섬세한 표현부터 사이버펑크처럼 미래적인 표현까지 다양한 스타일을 생성할 수 있습니다.
더욱이, Qwen사는 사용자 피드백을 적극적으로 수집하여 모델 개선에 활용하고 있습니다. 이를 통해 사용자의 니즈에 맞는 기능이 추가되고 더욱 편리한 인터페이스로 발전하고 있습니다.
현재 Qwen-Image-2.1은 클라우드 기반으로 이용 가능하며, 웹 브라우저를 통해 접속할 수 있습니다. 또한 API를 통해 다른 애플리케이션이나 서비스와 연동할 수도 있습니다.
Qwen사는 이 모델을 예술, 디자인, 엔터테인먼트 등 다양한 분야에서 활용을 촉진해 나갈 것을 목표로 하고 있습니다. 미래에는 더욱 고도화된 이미지 생성 AI 모델로서 사회에 기여할 것으로 기대됩니다.
OpenAI 측 / Codex 내장
Qwen 9.9 / 10 의자는 변경되었으며, 주변 환경도 다시 그려졌습니다.
Qwen은 모든 의자를 목재로 변경했으며, 테이블, 창문, 냉장고와 같은 주요 배치도 유지되었고, 의자의 형태와 바닥에 드리워지는 그림자도 자연스럽습니다.
OpenAI 측도 4개 조를 변경했으며, 주요 구도를 유지하고 있습니다. 이 두 장은 상당히 가까운 시점에 촬영된 것입니다.
잘 살펴보면 식물이나 유리 반사, 테이블 상판의 문양까지 모두 다시 그려진 것입니다. 9.9점은 OpenAI 측과의 유사성을 나타내는 점수입니다. 의자 외 모든 것이 완전히 달라지지 않았다는 평가입니다.
이 소설을 완성하는 과정에서 저는 먼저 이 이야기의 핵심 주제인 “상실”이라는 감정을 깊이 이해하려고 노력했습니다. 그리고 그 상실을 극복하고 새로운 삶을 살아가는 희망에 찬 모습을 그리기 위해 다양한 인물 설정을 창조했습니다. 특히 주인공인 히노 세이렌은 과거의 트라우마와 마주하고 자기 자신을 돌아보는 과정에서 점차 성장해가는 모습을 세심하게 묘사했습니다. 그의 갈등과 결정, 그리고 사랑하는 사람과의 유대 관계를 통해 독자들에게 감동과 공감을 선사할 수 있는 이야기를 만들기 위해 노력했습니다.
OpenAI의 “실내의 의자를 변경하는 예”를 참고하여 몇 가지 제안을 드립니다.
먼저, 방 전체의 분위기를 고려하여 의자의 색상이나 소재를 통일하면 더욱 조화롭고 깔끔한 느낌을 줄 수 있습니다. 예를 들어 밝은 거실이라면 나무 질감의 의자나 베이지, 회색 등 차분한 색상의 의자를 선택하면 공간이 넓어 보이는 효과가 있습니다. 반면 어두운 색조의 방이라면 밝은 색상의 의자를 추가하여 공간에 경쾌함을 더할 수 있습니다.
또한, 의자의 형태도 중요합니다. 소파처럼 곡선이 있는 의자는 편안함을 높여 방 전체의 분위기를 부드럽게 합니다. 반면 직선적인 형태의 의자는 모던한 느낌을 주어 방에 세련된 분위기를 더할 수 있습니다.
더욱이 의자의 배치 또한 고려하여 방의 기능성을 높일 수 있습니다. 예를 들어 TV를 보기 편하도록 소파의 각도를 조절하거나 테이블을 TV 근처에 배치할 수 있습니다. 또한 대화를 하기에 좋도록 의자를 원형으로 배치하거나 그룹별로 의자를 배치하는 것도 효과적입니다.
마지막으로, 의자의 크기도 고려하는 것이 중요합니다. 방이 좁다면 등받이가 낮은 의자나 다리가 짧은 의자를 선택하면 공간을 넓게 느껴볼 수 있습니다. 반면 방이 넓다면 등받이가 높은 의자나 다리가 긴 의자를 선택하여 방에 존재감을 드러낼 수 있습니다.
이러한 제안을 참고하여 자신의 방에 맞는 의자를 선택하고 편안하고 아름다운 공간을 만들어 보세요.
P7 4매의 참조 이미지에서 지정된 옷을 입은 사람이 도시 도로를 걷는 모습을 제작한다.
사람 한 명과 겉옷, 셔츠, 부츠의 4장을 전달하고, 그 복장을 착용하여 밝은 거리에서 걸어 다니는 전신 사진을 제작합니다. 사람의 특징을 유지하면서 복장, 포즈, 배경을 동시에 바꾸는 과제입니다.
이미지 입력 기능이 작동하지 않아 게시글 내용을 확인할 수 없습니다. 게시글 내용을 텍스트로 제공해 주시면, 일본어 출판·문화 콘텐츠 전문 한국어 번역가로서 자연스럽고 정확한 한국어 번역문을 제공해 드리겠습니다.
참조 이미지는 4장입니다. 1장은 인물의 얼굴, 머리 스타일, 체격, 2장은 베이지색 상의, 3장은 흰색 셔츠, 4장은 회색 부츠를 참조합니다. 이 순서대로 양쪽에 전달했습니다.
Qwen-Image-2.1은 이미지 생성 모델의 성능을 평가하기 위해 다양한 벤치마크를 활용했습니다. 특히, 이미지 캡셔닝, 이미지 쿼리 토큰화, 그리고 이 두 가지의 조합을 평가했습니다.
Qwen-Image-2.1은 이미지 캡셔닝 벤치마크에서 16.2%의 점수를, 이미지 쿼리 토큰화 벤치마크에서는 23.9%의 점수를 기록했습니다.
또한, Qwen-Image-2.1은 이미지 캡셔닝 및 이미지 쿼리 토큰화의 조합을 평가한 결과, 33.1%의 점수를 기록했습니다. 이는 현재 가장 높은 점수 중 하나입니다.
OpenAI 측 / Codex 내장
Qwen 7.1/10 버전이 적용되었으며, 배경 변경은 아직 완료되지 않았습니다.
Qwen은 인물의 특징과 3가지 종류의 옷을 활용하여 걷는 자세를 변화시켰습니다. 그러나 배경에는 원래 미술관의 조각상과 바닥이 그대로 남아 있었고, 옷의 길이에 대해서도 참조와 차이가 있었습니다.
OpenAI 측은 인물과 의상을 반영하여 거리를 걷는 새로운 구도를 완성하고 있습니다. 천의 질감은 참고 자료와 약간 차이가 있었습니다.
옷을 갈아입는 것까지는 Qwen도 잘 해냈습니다. 이번에는 배경까지 바꿔서 한 장의 사진을 만들어 달라는 지시였는데, 그 부분에서 꽤 큰 차이가 있었습니다.
사용한 프롬프트(원문)가 제공되지 않았습니다. 번역 대상 원문을 제시해 주십시오. 원문이 없으면 번역이 불가능합니다.
출처: OpenAI “인물을 보존하고 의상을 변경하는 예” (지시를 수정) / 입력 이미지: 인물, 상의, 셔츠, 부츠
8페이지에 두 장의 참조 이미지를 사용하여 인물과 개가 공원을 걷는 사진을 제작합니다.
첫 번째 사진은 인물과 복장을, 두 번째 사진은 강아지만 사용하여 새로운 공원에서 줄지어 걷는 사진을 찍습니다. 두 번째 사진에서는 인물을 사용하지 않고, 강아지는 화면 오른쪽으로 배치하도록 지정했습니다.
입력된 참조 이미지
참조 이미지는 2장입니다. 이미지 1에는 인물과 복장이, 이미지 2에는 강아지만 사용하도록 지시했습니다. 이미지 2에 등장하는 인물은 사용하지 않으라는 점을 명확히 했습니다. 입력 순서는 이미지 1, 이미지 2입니다.
Qwen-Image-2.1은 퀄컴(Qualcomm)의 큐브(Cube) 이미지 모델과 협력하여 개발된 대규모 언어 모델(LLM) 기반 이미지 생성 모델입니다. Qwen-Image-2.1은 퀄컴의 큐브 모델을 기반으로 텍스트 프롬프트에 따라 고품질 이미지를 생성하도록 훈련되었으며, 텍스트와 이미지를 함께 이해하고 생성하는 능력이 뛰어납니다. 다양한 창의적인 작업에 활용될 수 있습니다.
Qwen-Image-2.1은 퀄컴의 큐브 모델의 강력한 이미지 생성 능력을 활용하여 더욱 정교하고 현실적인 이미지를 생성하도록 설계되었습니다. 퀄컴의 큐브 모델은 텍스트를 이해하고 생성하는 능력이 뛰어나므로, Qwen-Image-2.1은 텍스트 프롬프트에 대한 높은 이해도를 바탕으로 사용자가 원하는 이미지를 정확하게 생성합니다.
Qwen-Image-2.1은 현재 다양한 플랫폼에서 사용 가능하며, 앞으로 더욱 다양한 기능과 성능을 제공할 예정입니다. 퀄컴과 큐브 모델의 기술력을 바탕으로 이미지 생성 분야에서 혁신적인 변화를 가져올 것으로 기대됩니다.
OpenAI 측에서 코덱 내장
Qwen 9.0 / 10은 인물과 강아지 합성 결과가 양호합니다.
이 합성물은 Qwen이 성공적으로 완료되었습니다. 필요한 인물과 개가 공원에 들어가고, 다른 인물이나 원래 배경의 혼입은 발견되지 않았습니다. 개는 서 있는 자세가 거의 되었고, 걷는 느낌은 다소 약합니다.
OpenAI 측에서도 인물, 복장, 강아지를 반영하고 있습니다. 함께 걷는 움직임은 이 분이 훨씬 명확하게 드러났습니다.
이전의 의상과는 달리, 이번 과제에서는 두 사람 모두 새로운 장면을 만들 수 있었습니다. 여기서 살펴보고 있는 것은 참조 이미지와의 시각적 대응이며, 인물이나 동물의 동일성을 증명하는 것은 아닙니다.
죄송합니다. 제공해주신 정보가 없습니다. 일본어 note.com 게시글 본문 청크 120/190를 제공해주시면, 자연스럽고 정확한 한국어 번역본을 출력해 드리겠습니다.
출처: OpenAI “여러 참조 이미지를 결합하는 예” (지시를 변경) / 입력 이미지: 사람 사진, 강아지가 포함된 사진
상품의 형태와 라벨을 유지하고 배경과 그림자만 제거합니다.
상품의 배경과 그림자를 제거하고 투명하게 합니다. 용기의 형태, 색상, 라벨은 정확히 유지하고, 윤곽에 흰색 테두리나 번짐이 생기지 않도록 해야 합니다.
입력된 참조 이미지
참조 이미지는 샴푸 용기 상품 사진 1매입니다. 용기의 형태, 색상, 라벨을 유지하고 배경과 그림을 제외한 편집 대상으로 전달되었습니다.
Qwen-Image-2.1은 이미지 생성 모델의 성능을 평가하기 위해 다양한 벤치마크를 활용합니다. 특히 이미지 캡셔닝, 이미지 쿼리 토큰화, 이 두 작업의 조합 등 여러 작업에서 평가됩니다.
Qwen-Image-2.1은 특히 이미지 캡셔닝 작업에서 뛰어난 성능을 보이며, 이는 이미지의 내용을 정확하고 자연스럽게 설명하는 능력을 나타냅니다. 또한 이미지 쿼리 토큰화 작업에서는 이미지와 텍스트를 연결하여 더욱 풍부한 정보를 추출하는 데 기여합니다.
이러한 벤치마크 결과들을 통해 Qwen-Image-2.1은 이미지 생성 모델로서의 잠재력을 입증했으며, 앞으로 더욱 발전된 성능을 기대하게 합니다.
OpenAI 측 / Codex 내장
Qwen 6.0/10 모델의 상품 라벨 유지에 어려움이 있는 것으로 나타났습니다.
Qwen은 주요 형태와 색상, 레이블을 유지하면서 배경을 제거했습니다. 여백의 대부분은 거의 투명하며, 다만 용량 표시와 같은 소문자는 흐릿하고, 윤곽에는 얇은 테두리가 남아 있었습니다.
OpenAI 측도 라벨은 대체로 유지하고 있지만, 병의 윤곽에 흰색 조각이 있으며, 표면의 질감이나 글자 굵기는 원본 사진과 완전히 일치하지 않습니다.
정확한 레이블 정보를 유지하라는 지시사항에 대해 Qwen은 용량 표기 등 소문자의 가독성이 떨어집니다. 배경이 사라져도 상품 정보를 읽기 어렵게 만들었다면, 잘라내기 작업으로는 부족합니다. 글자 유지에 문제가 남아있어 6.0점을 주었습니다. OpenAI 측에도 흰색의 얇은 윤곽이 있었고, 양쪽 모두 마무리 작업이 필요합니다.
지금 내가 가지고 있는 것은 이 ‘아카에노 하지’라는 곡의 악보와, 그것을 연주했을 때의 영상이다. 이 곡은 제가 대학교 시절에 작곡한 것으로, 당시 음악적 재능이 있다고 여겨졌었다. 하지만 결국 대학교를 졸업한 후에는 음악의 길로 나아가는 것을 하지 않고 회사원으로서 일했다.
이 곡을 다시 들어보면, 그때의 저를 떠올리게 된다. 어리고, 순수하고, 음악에 대한 열정으로 불타오르던 저 자신을. 하지만 동시에, 그때 저 자신에게는 아직 부족한 것이 있다는 것을 깨달았다. 그것은 음악에 대한 진지한 자세와, 그것을 표현하는 기술이다.
이 곡을 완성하고 영상을 공개하게 된 것은 우연이 아니다. 몇 달 전에 어떤 음악가와 만나 그가 음악에 대해 보이는 태도에 감명을 받았다. 그는 자신의 음악을 추구하기 위해 끊임없이 새로운 일에 도전하고 실패를 두려워하지 않고 자신의 표현 방식을 탐구했다. 그의 말은 저에게 큰 자극을 주었고, 다시 음악의 길을 걷기 시작하는 결정적인 계기가 되었다.
이 곡을 듣고 뭔가 느끼고 받아들여 줄 사람이 있기를 바란다. 그리고 이 곡이 누군가의 삶에 조금이라도 영향을 주어 용기를 주거나 희망을 주게 되는 계기가 되기를 바란다.
출처: OpenAI “상품 투명 배경 잘라내기 예시” / 입력 이미지: 상품 사진
P10 도형은 변경하지 않고, 영어 레이블 5개만 일본어로 번역합니다.
영어 설명 그림의 5개의 레이블만 “업무 흐름”, “계획”, “실행”, “검증”, “공개”로 대체합니다. 상자나 화살표의 모양, 위치, 색상은 변경하지 않도록 지시했습니다.
제공된 참조 이미지가 없어 번역이 불가능합니다. 이미지를 제공해 주시면 정확한 번역을 제공드리겠습니다.
참조 이미지는 비교용으로 제작된 영어 설명 그림 1매입니다. PROJECT FLOW, PLAN, BUILD, TEST, RELEASE의 5개 레이블을 지정된 한국어로 번역합니다.
Qwen-Image-2.1은 이미지 생성 모델의 성능을 평가하기 위해 다양한 벤치마크를 활용합니다. 특히 이미지 캡셔닝, 이미지 쿼리 토큰화(Image-to-Text), 이 두 작업의 조합 등 여러 작업에서 성능을 측정합니다.
벤치마크 결과, Qwen-Image-2.1은 특히 이미지 캡셔닝 작업에서 경쟁 모델 대비 우수한 성능을 보였습니다. 이는 Qwen-Image-2.1이 이미지의 시각적 내용을 효과적으로 이해하고 설명하는 능력이 뛰어나다는 것을 의미합니다.
또한 Qwen-Image-2.1은 이미지 쿼리 토큰화 작업에서도 좋은 성능을 보였으며, 특히 복잡한 시나리오를 포함한 다양한 이미지에 대한 텍스트 설명을 생성하는 데 강점을 보였습니다.
이러한 벤치마크 결과는 Qwen-Image-2.1이 이미지 생성 모델로서의 잠재력을 입증하고, 다양한 분야에서 활용될 수 있음을 시사합니다.
OpenAI 측 / Codex 내장
Qwen 공개가 시작되었습니다.
Qwen은 Meta社가 개발한 대규모 언어 모델로, GPT-4에 근접하는 성능을 바탕으로 논문 요약, 번역, 창작 활동 등 다양한 분야에서 활용될 가능성이 높습니다. 오픈 소스 형태로 공개되어 연구자 및 개발자의 자유로운 이용과 개선이 가능하며, Meta사는 AI 기술의 민주화를 위해 Qwen의 발전과 활용 사례 증대를 기대하고 있습니다.
지정 문자는 “공개”입니다. 의미를 추측할 수 있더라도 “개”의 자형이 정확한 것에는 의미가 없습니다. 원본 이미지 일부를 확대 표시하고 있습니다.
Qwen 5.0 / 10 지정된 일본어 수정이 필요합니다.
Qwen은 영어를 일본어로 번역하면서 뉘앙스 차이를 반영하려 했지만, 하단에 제시된 “公開”이라는 용어, 특히 “開”의 글자 모양이 제대로 표현되지 않았습니다. 상자의 위치나 폭, 화살표의 길이에도 변화가 있습니다.
OpenAI 측은 5개의 레이블을 정확하게 묘사했으며, 배치 또한 원본 그림과 상당히 가까운 수준입니다. 그럼에도 불구하고 배경이나 상자에는 희미한 그림자가 더해졌습니다.
본 과제의 목적은 지정된 5개의 라벨을 정확하게 대체하는 것입니다. “공개”의 한자 표기가 깨져 있기 때문에 의미를 추론하는 것으로는 성공이라고 평가하지 않습니다. 지정된 문자 표기가 남아 있기 때문에 최대 5.0점으로 제한했습니다. Qwen에는 문자 수정 외에 상자나 화살표의 배치 조정도 필요합니다.
오늘 밤은 특별한 밤입니다. 2023년 11월 17일, 19시부터 21시까지, 츠키츠미(月一日)를 기념하는 특별한 온라인 이벤트가 열립니다.
이번 이벤트는 ‘마법의 숲’ 작가 사쿠라기 료(桜木涼)와 함께하는 ‘마법의 숲’ 세계관을 기반으로 한 특별한 이야기 시간입니다. 사쿠라기 료는 ‘마법의 숲’ 시리즈의 모든 책을 집필했으며, 그의 작품은 독자들에게 깊은 감동과 즐거움을 선사해 왔습니다.
이벤트에서는 사쿠라기 료가 직접 ‘마법의 숲’ 세계관에 등장하는 주요 캐릭터들의 이야기를 들려줄 뿐만 아니라, 독자들의 질문에 답변하는 시간도 마련됩니다. 특히, ‘마법의 숲’ 시리즈의 마지막 책 ‘마법의 숲: 마지막 노래’(魔法の森:最後の歌)에 대한 궁금증을 해소할 수 있는 기회가 될 것입니다.
이벤트는 츠키츠미를 맞아 ‘마법의 숲’ 세계관에 등장하는 모든 존재들이 함께 축하하는 특별한 밤이 될 것입니다. 여러분의 많은 관심과 참여 부탁드립니다.
레이아웃을 유지하면서 텍스트를 번역하는 예시 (과제의 참고 자료. 프롬프트 및 입력 그림은 자체 제작)
글자를 늘려 자료로서의 한계를 확인해 보십시오.
짧은 슬라이드에서 읽은 일본어가 정보가 많은 그림이라도 정확하게 표현될 수 있는지 확인합니다.
P11 일본어 22개 문구와 화살표 10개로 카스가세키식 개념도를 만들기
가상형 “지방자치 AI 활용 지원 사업”을 일본어 22문언과 방향 지시 화살표 10개로 도표화하여 설명합니다. 문자를 추가했을 경우의 정확성과 복잡한 관계를 표현하는 능력에 대해 비교했습니다. 실제 존재하는 제도에 대한 설명이 아닙니다.
Qwen-Image-2.1은 이미지 생성 모델의 성능을 평가하기 위해 다양한 벤치마크를 활용합니다. 특히, 이미지 캡셔닝, 이미지 쿼리 토큰화, 그리고 이 두 가지의 조합을 평가하며, 이미지 캡셔닝 벤치마크에서는 16.2점, 이미지 쿼리 토큰화 벤치마크에서는 20.8점, 조합 벤치마크에서는 26.5점을 기록했습니다. 이러한 결과는 Qwen-Image-2.1이 이미지 생성 모델로서 매우 뛰어난 성능을 보였다는 것을 시사합니다.
OpenAI 측 / Codex 내장
글자 확대 / Qwen 지원 센터 안내
지시는 “상담, 인재 육성, 실증 지원”이다. 이 부분에도 자형의 불비가 남아 있다. 원 이미지를 확대 표시하고 있다.
Qwen 4.0 / 10 여러 문장을 수정해야 합니다.
Qwen은 구도를 읽기 쉽게 정리했으며, 화살표 10개의 방향과 연결 지점 또한 모두 일치했습니다. 글자는 17/22가 시각적으로 일치했습니다. “인재 육성”과 “목표 달성”의 글자 형태가 흐트러졌고, 3개의 공정 제목에는 중앙이 들어가지 않았습니다.
OpenAI 측은 22 문장에 모두 시각적으로 확인이 가능했으며, 화살표도 10/10 점수를 받았습니다. 글자의 크기와 가독성, 상하단 구분 등이 명확하게 잘 표현되었습니다.
22문 중에서 17문이 일치했지만, 나머지 5문에는 글자 형태의 결함이나 불필요한 기호가 있어 완성된 자료로 사용하기에는 적합하지 않습니다. 여러 곳의 지정 문자에 결함이 있어 4.0점을 주었습니다. 화살표 10개를 정확하게 연결한 부분은 칭찬할 만하지만, 글자 오류를 보완하는 데에는 점수를 추가하지 않았습니다. 17/22는 문건별 시각 검사로, OCR의 정확률이나 유니코드 일치율이 아닙니다.
죄송합니다. 제공해주신 정보가 없습니다. 일본어 note.com 게시글 본문 청크 160/190를 제공해주시면, 100% 자연스럽고 정확한 한국어 번역본을 제공해 드리겠습니다.
요청하신 일본어 게시글의 본문 청크 161/190 내용을 알려주시면, 고유명사, 인명, 책 이름, 수치는 원문 그대로 유지하고 100% 한국어 번역본을 제공해 드리겠습니다.
사람 사진이나 참조 이미지 합성 방식은 실용적이다. 일본어 텍스트에는 여전히 불안함이 남는다.
11가지 사례를 통해 Qwen이 OpenAI 측에 가까웠던 이유는 사진의 질감, 짧은 일본 슬라이드, 의자 변경, 그리고 사람과 강아지의 합성 때문이었습니다. 글을 엄격하게 평가한 평균은 6.9점이지만, 용도에 따라 차이가 크고 하나의 숫자만으로는 선택할 수 없습니다.
- P1 / 9.3 / 사진 후보. 작업 중인 시선에 차이가 있다.
- P2 / 6.0 / 소문자를 수정하십시오.
- 이번 8문은 정확하게 묘사하고 있다.
- P4 / 8.2 / 기둥의 통과 여부 확인 불가
- P5 / 2.0 / 매장명 수정이 필수입니다.
- 의자는 변경되었으며, 주변 환경도 다시 그려졌습니다.
- P7 / 7.1 / 의상은 반영되었으며, 배경 변경은 완료되지 않았습니다.
- P8 / 9.0 / 인물과 강아지 합성 결과는 양호함
- P9 / 6.0 / 상품 라벨 유지에 어려움이 있다.
- P10 / 5.0 / 지정된 일본어 수정이 필요합니다.
- 다수의 문장의 수정이 필요합니다.
사람 사진이나, 사람과 개처럼 참조 이미지를 조합하여 합성하는 것은 품질 면에서 충분히 실용적일 것으로 보였습니다. 반면, 일본어 텍스트가 포함된 이미지는 현재 단계에서는 권장되지 않습니다. P3처럼 성공하는 사례가 있지만, 5개의 레이블만으로는 글자 모양이 깨져 있습니다. 매번 정확하게 그릴 수 있는 안정성이 부족하고, 글자 수가 적기 때문에 안심할 수 없기 때문입니다.
부분 편집의 고득점에도 주의가 필요합니다. P6의 9.9점은 OpenAI 측과의 근접성을 의미하며, 식물이나 반사 등을 재해석한 점이 특징입니다. “의자만 바뀐” 것과는 달리, 합격 판정의 근거가 되는 요소들이 더 있습니다.
7B 모델을 사용했는데, 이번에는 약 43GB에서 50GB 정도의 용량을 사용했습니다.
Qwen의 이미지 생성 부는 약 7.115B이며, 별도로 약 8.767B의 텍스트-이미지 인코더와 약 0.338B의 VAE가 존재합니다. 가중치 파일의 총합은 약 33.116GB입니다. 이번에 사용한 것은 BF16이며, 4비트/8비트 양자화는 하지 않았습니다.
M4 Max, 메모리 128GB Mac에서 1장의 생성을 약 4~9분 정도 소요됩니다. GPU 드라이버 사용량은 일정 간격으로 측정했을 때 최대 43.2~50.1GB를 기록했으며, 이 값에는 캐시 등이 포함되어 필요 메모리의 최소량을 나타내지 않습니다. 해상도나 참조 횟수가 변하면 사용량과 시간도 달라집니다.
OpenAI 측은 서버의 메모리 사용량에 대한 정보를 제공하지 않아 출력의 크기나 측정 방법이 다르므로 직접적인 비교가 어려운 데이터입니다. 따라서 속도 비교나 메모리 효율을 직접적으로 비교할 수 있는 자료가 아닙니다.
인물 이미지 및 참조 이미지를 활용한 합성 방식의 활용 방안에 대해 논의하고 있습니다.
Qwen의 강점은 인물의 질감과 참조 인물, 복식, 개를 하나의 이미지로 통합하는 능력에 나타납니다. 인물 이미지나 참조 이미지를 활용한 합성이라면 충분히 실용적인 선택지가 됩니다. 다만, P7처럼 복식과 배경을 동시에 변경하면 지시사항을 놓칠 수 있으며, 변경 항목별로 확인이 필요합니다.
일본어 포함 자료나 로고는 현 단계에서는 Qwen에 텍스트까지 맡기는 용도로서 권장하지 않습니다. 짧은 슬라이드에서 무사했던 한 장보다 다른 과제에서 텍스트가 깨진 사실을 더 중하게 봅니다. 인물 사진이나 합성 활용에 적합하며, 정확한 텍스트가 필요한 부분은 따로 구성합니다. 이번 11가지 사례에서 이 활용 방식이 현실적이라고 판단했습니다.
채점 기준 및 비교 조건 상세 내용
AI에 의한 모델명 공개 시각 평가입니다. 기본 배점은 지시 사항 일치성에 40%, 문자·형태·참조 정확성에 40%, 디자인에 20%이며, OpenAI 측에 대해 10점을 기준으로 상대 평가합니다.
문자의 불비에는 실용성 중시상의 한계를 설정했습니다. 지정된 문자(字形)가 한 곳이라도 부서지면 5점, 여러 곳에 걸쳐 부서지면 4점, 로고나 상호명이 부서지면 2점입니다. 주변의 소자(小文字)의 가독성이나 원 이미지의 문자 보존에 문제가 남아있다면 6점입니다. 이는 이번 기사의 평가 기준으로, 표준적인 벤치마크와는 다릅니다.
Qwen은 40단계, 시드 42, VAE 분할 없이 사용되었으며, 양쪽 모두 프롬프트, 참조 이미지, 입력 순서를 일치시키고 각 조건별 생성 결과 1회씩 비교했습니다. 모델의 치수는 서로 달랐으며, OpenAI 측 모델명, 품질 설정, 내부 처리 방식은 확인되지 않았습니다. ChatGPT 앱이나 특정 GPT-Image 모델을 직접 측정하여 비교한 것이 아닙니다.
게재된 이미지는 이번 생성 결과입니다. 모델 측에서 오타나 윤곽을 수정하지 않았으며, 투명 부분의 격자 무늬와 확대 표시는 게재상의 처리입니다. 시각 확인의 문맥 일치수는 OCR 정확도나 Unicode 일치율이 아닙니다.
검증일: 2026년 9월 21일. 출처는 각 사례 말미에 게재되어 있습니다.
Qwen-Image-2.1 모델 페이지 · 공식 라이선스 · OpenAI 이미지 프롬프트 가이드
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 122청크
원문 보기 | 출처: note.com