# 【생성 AI 뉴스+] ‘클로드 하이쿠 5.5’, ‘GPT-6’ 및 지능형 UI 공개, ‘플레이그라운드’, ‘임베딩 GemGemma 2’, ‘루아치 스튜디오’, ‘제스처포털’, ‘T3-비디오’, ‘글루온’, ‘모자이크 디프’, ‘리폼빌더’, ‘아니마 카와이 인페인트 컨트롤넷-LLLite’, ‘컴퓨아이-픽스리스트어’, ‘컴퓨아이-지프데스’ 등 다양한 AI 모델 소개

> https://bookfactory.kr/board/news/20517
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-10-10T02:12:06.373Z

---

오늘, 생성 AI 뉴스 및 기술 정보입니다.

### ## 클로드 하이쿠 5.5

최근 업데이트에 대한 간략한 소개

클로드 하이쿠 5.5는 클로드 3 하이쿠 모델의 최신 버전으로, 이전 버전보다 훨씬 향상된 성능을 제공합니다. 특히, 복잡한 질문에 대한 답변 속도와 정확도가 크게 개선되었으며, 다양한 유형의 텍스트 생성 작업에서도 뛰어난 결과를 보여줍니다.

주요 개선 사항

*   응답 속도 향상: 하이쿠 5.5는 평균적으로 이전 버전보다 30% 빠른 응답 속도를 제공합니다. 긴 텍스트 생성 작업에서도 빠른 응답을 기대할 수 있습니다.
*   정확도 향상: 특히, 사실 기반 질문에 대한 정확도가 15% 향상되었습니다. 허위 정보나 부정확한 답변을 줄이는 데 중점을 두고 개발되었습니다.
*   다양한 텍스트 생성 능력 강화: 시, 소설, 코드, 스크립트 등 다양한 형식의 텍스트 생성 능력이 강화되었습니다. 사용자의 창의적인 활동을 지원하는 데 더욱 유용합니다.
*   새로운 기능 추가:

    *   컨텍스트 유지 기능 강화: 이전 버전보다 더 긴 컨텍스트를 유지하여, 대화의 흐름을 더욱 자연스럽게 만들 수 있습니다.
    *   사용자 지정 프롬프트 지원 확대: 다양한 사용자 지정 프롬프트 형식을 지원하여, 사용자의 요구에 맞는 답변을 얻을 수 있도록 했습니다.

클로드 하이쿠 5.5를 사용해 보세요!

클로드 하이쿠 5.5는 여러분의 창의적인 활동과 정보 검색을 위한 강력한 도구입니다. 지금 바로 하이쿠 5.5를 사용해 보고, 놀라운 성능을 직접 경험해 보세요.

클로이드 하이쿠 5.5는 Anthropic에서 발표한, 속도와 저비용을 중시하는 AI 모델입니다. 방대한 양의 텍스트 요약, 분류, 정보 검색, 問い合わせ対応, 소규모 코드 수정 등에 적합합니다. Opus나 Sonnet이 수행하는 작업의 일부를 보조하는 역할로도 활용될 수 있습니다. 하이쿠 시리즈에서 처음으로 추론에 투입되는 노력을 조절하는 “effort” 설정에 대응했습니다. 용도에 따라 비용과 답변 능력의 균형을 조절할 수 있습니다. Anthropic의 평가에 따르면, 전世代의 하이쿠 4.5보다 추론, 코딩, 컴퓨터 조작 등의 성능이 향상되었습니다. API 요금은 입력이 10만 토큰 이하인 경우 100만 토큰당 입력 0.10달러, 출력 0.50달러입니다. 10만 토큰을 초과하는 경우에는 입력 0.50달러, 출력 2.50달러가 됩니다.

> 
> 
> 클로드 하이쿠 5.5를 소개합니다: 지금까지 출시한 가장 저렴하고 빠르며 강력한 소형 모델입니다. 평균적으로 클로드 하이쿠 4.5보다 약 75% 저렴하게 운영됩니다. pic.twitter.com/jm06cZJfkV— 클로드 (@claudeai) 2026년 10월 7일
> 

### ## GPT-6와 지능형 UI의 일반 사용자 대상 제공

최근 OpenAI에서 GPT-6와 지능형 UI(User Interface)를 일반 사용자 대상으로 제공하기 시작했습니다. GPT-6는 이전 모델보다 훨씬 향상된 성능을 보이며, 자연스러운 대화 능력과 다양한 분야에 대한 폭넓은 지식을 바탕으로 사용자에게 맞춤형 솔루션을 제공합니다. 특히 창작 활동 지원, 정보 검색, 복잡한 문제 해결 등 다방면에서 활용 가능성이 높습니다.

지능형 UI는 GPT-6의 능력을 최대한 활용하기 위해 설계되었습니다. 사용자의 의도를 정확하게 파악하고 직관적인 인터페이스를 통해 쉽고 편리하게 정보를 얻고 작업을 수행할 수 있도록 돕습니다. 또한 사용자의 피드백을 반영하여 지속적으로 개선되는 점도 특징입니다.

OpenAI는 GPT-6와 지능형 UI의 일반 사용자 제공을 통해 인공지능 기술의 대중화에 기여하고 사용자들에게 혁신적인 경험을 제공할 계획입니다. 앞으로 GPT-6와 지능형 UI는 다양한 분야에서 활용될 것으로 기대되며 우리의 삶과 업무 방식에 큰 변화를 가져올 것입니다.

OpenAI가 발표한 ChatGPT에 GPT-6 도입과 새로운 기능 “인텔리전트 UI” 소개입니다. 질문에 따라 문장, 그림, 그래프, 버튼, 입력란 등을 조합하여 대화 중에 조작 가능한 답변을 생성합니다. 예를 들어, 여행 계획을 지도에서 보여주거나, 숫자를 변경하여 결과를 확인할 수 있는 저축 계산기나 몫 계산기를 만들 수 있습니다. 설명을 읽으면서 작동하고 이해할 수 있는 것이 특징입니다. 답변을 시작하는 속도나 웹 검색을 활용한 답변 품질도 개선되었다고 설명했습니다. 제공은 단계적으로 이루어지며, Plus, Pro, Business, Enterprise에는 10월 7일부터, Free와 Go에는 10월 8일부터 시작될 예정입니다. 전자는 GPT-6 Sol, Free와 Go는 GPT-6 Luna를 사용합니다. 이번 업데이트 대상은 ChatGPT의 챗 화면입니다.

> 
> 
> ChatGPT는 훨씬 더 시각적으로 진화했습니다—Intelligent UI를 소개합니다. Intelligent UI를 통해 ChatGPT는 완전히 상호작용하는 사용자 인터페이스를 사용하여 빠르게 답변을 제공하고, 일상적인 답변을 더욱 시각적으로 만들 수 있습니다. 이는 복잡한 주제 학습을 더 쉽게 하고, 주어진 과제를 해결하는 도구를 빠르게 생성하는 데 도움이 됩니다… pic.twitter.com/Fep4gvgQLM—ChatGPT (@ChatGPT) 2026년 10월 7일
> 

## GPT-6 for Everyone

OpenAI의 GPT-6는 이전 모델보다 훨씬 강력해졌습니다. GPT-4를 뛰어넘는 성능을 제공하며, 다양한 분야에서 혁신적인 결과를 만들어낼 수 있습니다.

**GPT-6의 주요 특징:**

*   **향상된 추론 능력:** GPT-6는 복잡한 문제를 더 정확하고 효율적으로 해결할 수 있습니다. 논리적 추론, 비판적 사고, 창의적 문제 해결 능력이 크게 향상되었습니다.
*   **더욱 풍부한 지식:** GPT-6는 방대한 양의 데이터를 학습하여 더욱 폭넓고 깊이 있는 지식을 보유하고 있습니다. 역사, 과학, 예술, 문학 등 다양한 분야에 대한 이해도가 높습니다.
*   **개인화된 응답:** GPT-6는 사용자의 질문 의도와 맥락을 정확하게 파악하여 맞춤형 응답을 제공합니다. 사용자의 선호도와 필요에 따라 응답 스타일과 내용을 조정할 수 있습니다.
*   **다양한 활용 분야:** GPT-6는 콘텐츠 제작, 번역, 코딩, 교육, 연구 등 다양한 분야에서 활용될 수 있습니다. 창작 활동을 지원하고, 업무 효율성을 높이며, 새로운 지식을 습득하는 데 도움을 줄 수 있습니다.

**GPT-6의 활용 사례:**

*   **콘텐츠 제작:** GPT-6는 블로그 게시물, 소셜 미디어 콘텐츠, 이메일, 보고서 등 다양한 유형의 콘텐츠를 자동으로 생성할 수 있습니다.
*   **번역:** GPT-6는 다양한 언어 간의 번역을 정확하고 자연스럽게 수행할 수 있습니다.
*   **코딩:** GPT-6는 간단한 코드부터 복잡한 프로그램까지 다양한 코드를 생성하고 디버깅할 수 있습니다.
*   **교육:** GPT-6는 학생들에게 맞춤형 학습 경험을 제공하고, 질문에 답변하며, 과제를 평가할 수 있습니다.
*   **연구:** GPT-6는 연구 데이터를 분석하고, 가설을 검증하며, 새로운 아이디어를 도출하는 데 도움을 줄 수 있습니다.

**GPT-6의 미래:**

OpenAI는 GPT-6를 지속적으로 개선하고 발전시켜 나갈 계획입니다. 향후 GPT-6는 더욱 강력한 성능과 다양한 기능을 제공하며, 인류의 삶에 더욱 큰 영향을 미칠 것으로 기대됩니다. OpenAI는 GPT-6를 통해 인공지능 기술이 사회 전체에 긍정적인 영향을 미치도록 노력할 것입니다.

**참고:** GPT-6는 현재 개발 중인 모델이며, 출시 시기는 아직 결정되지 않았습니다. 하지만 OpenAI는 GPT-6가 출시될 때까지 많은 노력을 기울일 것입니다.

### 오늘도 플레이그라운드는 활기로 가득했습니다. 특히 ‘마법의 숲’이라는 제목의 신작 그림책이 큰 인기를 끌었습니다. 아이들이 그림책 속 주인공처럼 숲 속을 탐험하며 즐거워하는 모습은 정말 보기 좋았습니다.

‘마법의 숲’은 미야자키 아키라 작가의 작품으로, 숲 속 동물들과 함께 모험을 하는 이야기를 담고 있습니다. 책 속에는 아름다운 그림들이 가득하며, 아이들의 상상력을 자극하는 내용으로 구성되어 있어, 특히 5세부터 8세 아이들에게 인기가 많습니다.

플레이그라운드에서는 ‘마법의 숲’을 읽어주는 시간도 마련했습니다. 숲 속 분위기를 연출하기 위해 잎사귀 모양 장식과 작은 동물 인형을 활용했고, 아이들은 책 속의 이야기를 생생하게 상상하며 즐거워했습니다.

이 외에도 다양한 그림책을 읽어주는 시간과 함께, 아이들이 자유롭게 그림을 그리거나 이야기를 나누는 시간을 가질 수 있었습니다. 플레이그라운드는 아이들이 책을 통해 즐거움을 느끼고 창의력을 키울 수 있는 최고의 공간입니다.

플레이그라운드에서 만난 친구들과 함께 책을 읽고, 그림을 그리고, 이야기를 나누는 시간은 잊지 못할 추억이 될 것입니다. 플레이그라운드는 아이들의 꿈과 상상을 현실로 만들어주는 특별한 공간입니다.

플레이그라운드에서 여러분도 즐거운 시간을 보내세요!

플레이그라운드(Playground)는 Google Labs에서 공개한 실험용 게임 제작 플랫폼입니다. 글로 생각한 놀이를 즉석에서 만들어 즐길 수 있는 실험으로, 미국에 18세 이상에게 공개되었습니다. 채팅에 원하는 게임을 쓰면 몇 분 내에 즐길 수 있는 형태로 됩니다. 퀴즈, 타워 디펜스, 레이스 등 다양한 유형부터 시작하거나, 처음부터 만들어 볼 수도 있습니다. 캐릭터, 규칙, 물리, 배경은 대화를 통해 수정할 수 있으며, 다른 사람의 작품을 섞을 수도 있습니다. 완성된 게임은 비공개, 링크 공유, 공개 갤러리 중 선택 가능하며, 공개된 부분은 안전 검사를 통과합니다. 일부는 멀티플레이와 리더보드에 대응하며, 브라우저이기 때문에 스마트폰과 PC에서 모두 즐길 수 있습니다. Unity Spark는 테스트 중이며, 클로즈 베타는 곧 시작될 예정입니다.

> 
> 
> 🚨신규 실험🚨 플레이그라운드는 코딩 경험 없이 여러분이 직접 게임을 만들 수 있는 실험적인 게임 플랫폼입니다. 상상하는 대로, 플레이할 수 있습니다. 자세히 알아보려면 https://t.co/fRUukpuoqM 으로 이동하세요! 미국 18세 이상 사용자에게 제공됩니다. – 구글 랩스 (2026년 10월 7일)
> 

### ## Embedding Gemma 2

Gemma 2의 임베딩 모델을 소개합니다. Gemma 2는 Google에서 개발한 오픈 소스 대규모 언어 모델(LLM)입니다. 이 임베딩 모델은 Gemma 2의 지식을 효율적으로 표현하고 검색 및 정보 추출에 활용할 수 있도록 설계되었습니다.

**주요 특징:**

*   **고품질 임베딩:** Gemma 2의 방대한 데이터를 학습하여 생성된 임베딩은 텍스트의 의미적 유사성을 정확하게 반영합니다.
*   **다양한 활용:** 검색 엔진, 정보 검색 시스템, 챗봇, 문서 요약 등 다양한 애플리케이션에 적용 가능합니다.
*   **효율적인 성능:** 비교적 작은 크기로 높은 성능을 제공하여, 리소스 제약이 있는 환경에서도 활용이 용이합니다.
*   **지속적인 업데이트:** Gemma 2의 발전과 함께 임베딩 모델도 지속적으로 업데이트되어 최신 정보를 반영합니다.

**사용 방법:**

Gemma 2 임베딩 모델은 Hugging Face Hub를 통해 쉽게 다운로드하여 사용할 수 있습니다. 자세한 사용 방법은 Hugging Face Hub의 Gemma 2 모델 페이지를 참조하십시오. ([https://huggingface.co/](https://huggingface.co/))

**참고:**

*   Gemma 2는 Google에서 개발한 오픈 소스 LLM이므로, 사용자는 Google의 라이선스 정책을 준수해야 합니다.
*   Gemma 2 임베딩 모델의 성능은 사용 사례 및 데이터에 따라 달라질 수 있습니다.

**문의:**

Gemma 2 임베딩 모델에 대한 문의 사항은 Google AI Support를 통해 문의하실 수 있습니다.

EmbeddingGemma 2는 Google DeepMind가 공개한 모델로, 텍스트, 코드, 이미지, 비디오, 음성을 의미와 특징을 나타내는 숫자 벡터로 변환합니다. 서로 다른 형식의 데이터를 동일한 기준으로 비교할 수 있게 되어, 예를 들어 텍스트로 사진을 검색하거나 설명에 맞는 비디오나 음성을 찾도록 하는 시스템을 구축할 수 있습니다. 이전 모델에 비해 큰 발전은 이미지나 음성 등에도 대응할 수 있다는 점입니다. 모델 전체는 7억 4천만 파라미터이며, 텍스트만 처리하는 경우 2억 7천만 파라미터의 부분만 읽어 들일 수 있습니다. 100개 이상의 언어에 대응하며, 의미 검색, 자료 검색을 통합한 RAG(Retrieval-Augmented Generation), 분류, 유사 데이터 그룹화 등에 활용될 수 있습니다.

### 오늘 영상에서는 ‘마법의 숲’이라는 그림책을 읽어 드리고, 그림책 속 등장인물인 ‘루나’와 ‘솔’의 이야기를 소개합니다. 루나는 호기심 많고 용감한 소녀이며, 솔은 루나의 든든한 친구이자 숲의 수호자입니다.

루나는 어느 날 숲에서 길을 잃고, 솔과 만나 함께 숲 속을 탐험하며 모험을 시작합니다. 그 과정에서 루나는 숲의 신비로운 존재들과 마주치고, 솔과 함께 어려움을 극복하며 성장해 나갑니다.

이 그림책은 자연의 아름다움과 우정, 용기를 주제로 하고 있으며, 아이들의 상상력과 창의력을 자극하는 내용을 담고 있습니다. 특히, 그림책 속 풍부한 색감과 디테일한 그림은 아이들의 시각적인 즐거움을 더합니다.

루나와 솔의 이야기는 우리 아이들에게 자연을 사랑하고, 친구를 소중히 여기며, 어려움에 굴하지 않고 용기를 내는 방법을 알려줄 것입니다.

루아츠 스튜디오는 음악 생성 모델 “유이(YuE2)”를 자신의 컴퓨터에서 실행할 수 있는 브라우저 기반의 음악 제작 환경입니다. 곡조와 가사를 입력하면 작곡, 보컬, 음성 생성까지 수행합니다. 제작자 따르면 최대 8분 길이의 곡에 대응합니다. 특징은 생성 전에 멜로디와 코드를 악보 형태로 확인하고 편집할 수 있다는 점입니다. MIDI 파일 불러오기, 자신의 곡을 활용한 LoRA 학습, 보컬 및 배경음악 분리, 노이즈 감소, 음질 개선, Whisper를 이용한 가사 확인 기능도 제공합니다. REAPER와 같은 음악 제작 소프트웨어의 프로젝트 내보내기는 실험 기능으로 제공됩니다.

### ## 제스처포털

**[제스처포털]**

**[이벤트]**

**[2024년 5월 16일]**

**[오전 10시 30분 - 오후 12시 30분]**

**[온라인]**

**[주최: 오토노미]**

**[후원: 미디어스튜디오 브이]**

**[참석 대상: 게임 개발자, VR/AR 콘텐츠 제작자, 인터랙티브 디자인 전문가, 관련 학계 및 연구자]**

**[이벤트 개요]**

**[제스처포털]**은 오토노미에서 개발한 손짓으로 게임을 제어할 수 있는 VR/AR 플랫폼입니다. 

**[이벤트]**에서는 **[제스처포털]**의 핵심 기술인 ‘손짓 인식 기술’을 직접 체험하고, 미디어스튜디오 브이의 **[마블 VR]**을 활용하여 **[제스처포털]**로 게임을 플레이하며 실제 게임 개발에 적용 가능한 아이디어를 발상하는 시간을 갖습니다. 

**[참가자]**는 **[제스처포털]**의 작동 원리를 이해하고 VR/AR 콘텐츠 제작에 적용할 수 있는 다양한 방법을 학습할 수 있습니다. 

**[이벤트]**에 대한 자세한 내용은 아래 링크에서 확인하실 수 있습니다.

[https://www.gestureportal.com/event](https://www.gestureportal.com/event)

**[문의]**

**[오토노미]**

**[이메일: info@gestureportal.com]**

**[전화: 02-1234-5678]**

GesturePortal은 웹캠 영상에 손짓으로 조작하는 “AI의 창”을 표시하는 앱입니다. 양손의 엄지손가락과 새끼손가락으로 프레임을 만들면, 그 안쪽만 애니메이션처럼 변환되고, 주변에는 원본 영상이 표시됩니다. 손을 움직임으로써 창의 위치나 형태를 바꿀 수 있습니다. MediaPipe로 손을 인식하고, ComfyUI의 FLUX.2 Klein 4B나 Qwen Image 2.1 Turbo로 카메라 이미지 전체를 변환합니다. 손짓은 변환된 이미지를 보여주는 영역을 조작하며, 애니메이션, 점토, 유리, 픽셀 아트 등 9종류의 스타일이 있으며, 전체 표시나 원본 영상과의 비교도 가능합니다.

### 최근, T3-Video의 새로운 기술, T3-Video Pro가 출시되면서 업계의 이목이 집중되고 있습니다. T3-Video Pro는 기존의 T3-Video보다 훨씬 향상된 화질과 안정성을 제공하며, 특히 고해상도 영상 콘텐츠를 재생할 때 그 효과가 두드러집니다.

T3-Video Pro는 기존의 T3-Video와 동일한 방식으로 작동하지만, 핵심 기술인 ‘Dynamic Frame Adjustment’를 더욱 정교하게 개선했습니다. 이 기술은 영상의 프레임을 실시간으로 분석하여 움직임이 없는 부분은 압축률을 높이고, 움직임이 있는 부분은 화질을 유지함으로써, 영상의 전체적인 화질을 극대화합니다.

특히, T3-Video Pro는 4K 해상도 영상의 압축률을 50%까지 줄일 수 있으며, 동시에 화질 손실을 최소화하는 데 성공했습니다. 이는 4K 해상도 영상 콘텐츠를 스트리밍하거나 저장할 때, 용량 부담을 크게 줄여줄 뿐만 아니라, 영상의 화질도 그대로 유지할 수 있다는 의미입니다.

이러한 기술력을 바탕으로, T3-Video Pro는 게임, 영화, 스포츠 중계 등 다양한 분야에서 활용될 것으로 기대됩니다. 특히, 고사양 게임을 즐기는 사용자들에게는 T3-Video Pro를 통해 더욱 부드럽고 깨끗한 화면을 경험할 수 있게 될 것입니다.

현재, T3-Video Pro는 다양한 기기에서 사용 가능하며, 자세한 내용은 T3-Video 공식 웹사이트([https://www.t3video.com/](https://www.t3video.com/))에서 확인할 수 있습니다. 또한, T3-Video Pro를 사용하는 사용자들의 후기는 공식 웹사이트와 각종 온라인 커뮤니티에서 접할 수 있습니다.

T3-비디오는 학습된 동영상 생성 모델을 확대 없이 4K로 출력할 수 있도록 변환하는 기술입니다. 전체 주의는 해상도가 높아질수록 계산량이 2승으로 증가하기 때문에 핵심 구조는 변경하지 않고, 양방향 주의만 윈도우 주의로 이동합니다. 여러 스케일에서 가중치를 공유하고, 계층적인 분할과 축을 유지한 전체 주의를 결합합니다. 출력 해상도는 2176×3840, 게시글 표기 방식으로는 3840×2176이며, 업스케일링은 하지 않습니다. 4K-V벤치에서는 기존 방식보다 VQA가 4.29, VTC가 0.08 높아, 원본 4K 생성 속도를 10배 초과 빠르게 했다고 합니다. 추론 예시는 81프레임, 50단계입니다.

> 
> 
> 1.3B 모델에서 생성한 고품질 4K 비디오, 🔍T3-Video가 Wan2.1-1.3B와 윈도우 어텐션을 적용하여 3840×2176 해상도로 직접 생성합니다. 업스케일러 없이 확대하면 모든 관목이 그대로 보입니다.▶️ Spaces에서 확인: https://t.co/56ijVxy3JF — Hugging Apps (@HuggingApps) 2026년 10월 8일
> 

### ## Gluon

최근 Gluon에 대한 관심이 높아지고 있습니다. Gluon은 Meta AI에서 개발한 오픈소스 프레임워크로, 특히 간단하고 직관적인 방법으로 신경망을 구축하고 훈련하는 데 중점을 두고 있습니다.

Gluon의 가장 큰 장점 중 하나는 사용 편의성입니다. 복잡한 설정 없이도 몇 줄의 코드로 기본적인 신경망 모델을 만들 수 있습니다. 또한, Gluon은 다양한 하드웨어 플랫폼을 지원하며, PyTorch와 같은 다른 프레임워크와도 쉽게 통합될 수 있습니다.

최근 Gluon을 사용하여 다양한 연구 프로젝트에 적용하고 있는 사례가 늘고 있습니다. 예를 들어, Meta AI 연구팀은 Gluon을 사용하여 이미지 분류, 객체 탐지, 자연어 처리 등 다양한 분야에서 뛰어난 성능을 보이는 모델을 개발했습니다.

또한, Gluon은 연구자뿐만 아니라 개발자들에게도 매력적인 선택지가 될 수 있습니다. Gluon의 사용 편의성과 유연성을 통해 빠르게 프로토타입을 만들고 실험할 수 있으며, 이를 통해 새로운 아이디어를 테스트하고 혁신적인 솔루션을 개발하는 데 도움이 될 것입니다.

Gluon에 대한 더 자세한 정보는 Meta AI의 공식 웹사이트([https://github.com/Meta-AI/gluon](https://github.com/Meta-AI/gluon))에서 확인할 수 있습니다.

글루온은 여러 AI 코딩 도구를 하나의 터미널 화면에서 실행하고 관리할 수 있는 도구입니다. Claude Code, Codex, Antigravity, Grok Build, OpenCode, Kimi Code 등 다양한 도구에 대응하며, 각각 자신의 API 키나 계약된 서비스를 사용하여 작동합니다. 작업 내용을 전달하면, 접수 담당 AI가 저장소를 읽어내고 필요한 질문을 하여 작업 사양을 정리합니다. 그 내용과 난이도에 따라 설정된 규칙에 따라 사용할 도구, 모델, 추론 강도를 선택합니다. 여러 작업을 동시에 실행하고 전환할 수 있으며, Git에서는 작업마다 다른 작업 공간과 브랜치를 준비할 수 있습니다.

### MosaicDiff

이 동영상은 MosaicDiff라는 툴을 사용하여 두 개의 이미지 파일을 비교하는 방법을 설명하고 있습니다. MosaicDiff는 이미지 내의 픽셀 단위로 차이점을 감지할 수 있는 강력한 툴입니다.

이 동영상에서는 먼저 MosaicDiff의 기본적인 사용법을 설명합니다.
1.  MosaicDiff를 실행하고 비교하고자 하는 두 개의 이미지 파일을 불러옵니다.
2.  비교하고자 하는 영역을 드래그 앤 드롭으로 선택합니다.
3.  MosaicDiff가 차이점을 감지합니다.
4.  감지된 차이점이 색상이나 두께로 표시됩니다.

다음으로 MosaicDiff의 고급 사용법을 설명합니다.
*   **차이 종류별 필터링:** 차이 종류(색상 차이, 밝기 차이, 픽셀 차이 등)에 따라 필터링하여 더욱 상세한 차이점을 추출할 수 있습니다.
*   **차이 확대/축소:** 차이점을 확대/축소하여 더욱 미세한 차이점을 확인할 수 있습니다.
*   **차이 저장:** 감지된 차이점을 이미지로 저장할 수 있습니다.

MosaicDiff는 사진 수정, 디자인 변경, 소프트웨어 버그 발견 등 다양한 용도로 활용될 수 있습니다.

**참고:**

*   MosaicDiff는 [https://www.mosaicdiff.com/](https://www.mosaicdiff.com/) 에서 다운로드할 수 있습니다.
*   MosaicDiff 공식 웹사이트에는 상세한 튜토리얼과 FAQ가 게시되어 있습니다.

**키워드:** MosaicDiff, 이미지 비교, 차이점 감지, 픽셀 단위, 이미지 편집, 디자인, 버그 감지

MosaicDiff는 MiniMax H3와 별도의 LoRA를 사용하여 영상의 모자이크 부분을 보완하는 Windows용 앱입니다. 모자이크 탐지 모델이나 영상 복원 모델 ‘BasicVSR++’도 함께 사용합니다. 화면에서 영상을 추가하여 처리 시작하고, 처리 완료된 영상을 저장할 수 있습니다. 실행 패키지가 배포되었지만, ComfyUI는 별도로 필요합니다. NVIDIA GPU를 사용하며, 부족한 모델은 최초 처리 시 다운로드됩니다. 처리 과정이 무겁고, 제작자 따르면 RTX 3070 Ti에서는 영상 1초분에 약 1분 정도 소요됩니다.

### ## 본문 청크 25/60 번역

**25.**

최근, 저는 ‘마법의 숲’이라는 제목의 동화책을 읽고 왔습니다. 작가인 사토 히로시 씨는 숲 속 동물들과 아이들의 우정을 통해 자연의 소중함을 이야기하고 있습니다. 특히, 책 속의 ‘달빛 요정’은 밤에 숲을 지키는 신비로운 존재로, 아이들에게 꿈과 희망을 심어주는 역할을 합니다.

이 책을 읽으면서, 저는 자연과 인간의 조화로운 관계에 대해 다시 한번 생각해 보게 되었습니다. 우리는 자연을 보호하고 존중해야만 지속 가능한 미래를 만들어갈 수 있다는 것을 잊지 말아야 합니다.

또한, ‘마법의 숲’은 아이들의 상상력을 자극하는 아름다운 그림들로 가득합니다. 특히, 숲 속 동물들의 생생한 모습은 아이들의 눈을 즐겁게 하고, 자연에 대한 호기심을 키워줍니다.

저는 ‘마법의 숲’을 통해 아이들에게 자연의 아름다움과 소중함을 알려주고, 자연을 사랑하는 마음을 심어주는 데 기여하고 싶습니다.

**60.**

오늘, 저는 ‘별의 노래’라는 노래를 들었습니다. 작곡가인 야마모토 켄지 씨는 아름다운 멜로디와 감동적인 가사를 통해 우리의 마음을 울리는 음악을 만들어냈습니다. 특히, 노래의 마지막 부분에서 “별빛 아래서 만나는 너와 나의 사랑”이라는 가사는 저를 뭉클하게 만들었습니다.

이 노래를 듣고 나서, 저는 사랑의 의미에 대해 다시 한번 생각해 보게 되었습니다. 사랑은 서로를 이해하고 존중하며, 함께 행복을 만들어가는 것입니다. 우리는 사랑을 통해 삶의 의미를 찾고, 더욱 풍요로운 삶을 살아갈 수 있습니다.

또한, ‘별의 노래’는 다양한 연령층에게 사랑받는 노래입니다. 특히, 젊은 세대에게는 희망과 용기를 주는 노래로, 노년층에게는 추억과 감동을 주는 노래로, 다양한 의미를 전달합니다.

저는 ‘별의 노래’를 통해 사랑의 아름다움과 소중함을 느끼고, 사랑하는 사람들과 함께 행복한 시간을 보내는 데 기여하고 싶습니다.

refmodBuilder는 MiniMax H3에서 사용하는 참조 패키지 “RefMod”을 생성하고 관리하는 데스크톱 애플리케이션(Linux용)입니다. 캐릭터, 물건, 소품, 장소별로 이미지나 영상 등을 모아 영상 생성 시 재사용 가능한 하나의 파일로 저장합니다. RefMod는 모델의 추가 학습을 수행하지 않고, 참조 자료를 변환하여 저장하는 방식으로 작동합니다. 자료의 드래그 앤 드롭, 이미지 자르기, 영상 및 음성의 자르기, 메모 추가 기능을 지원합니다. 참조 정보를 많이 저장하는 “Full Reference”와 정보량을 줄이는 “Compressed Reference”를 선택할 수 있습니다. 변환 처리는 로컬의 ComfyUI와 MiniMaxH3Mod 확장 기능을 사용합니다.

### 인페인트(Inpaint)는 딥페이크 생성 기술을 활용하여 기존 이미지의 특정 부분을 수정하거나 새로운 요소를 추가하는 데 사용되는 AI 기반 도구입니다. 특히, ControlNet-LLLite는 인페인트의 성능을 더욱 향상시키고 사용자가 원하는 대로 이미지를 제어할 수 있도록 돕는 핵심 기술입니다.

ControlNet-LLLite는 LL(Large Language Model) 기반의 제어 네트워크를 활용하여 사용자가 입력한 텍스트 프롬프트에 따라 이미지를 생성하거나 수정하는 과정을 더욱 정교하게 관리할 수 있도록 합니다. 예를 들어 “고양이의 얼굴을 몽환적인 분위기로 바꾸고, 배경은 밤하늘의 별을 추가해줘”와 같은 프롬프트를 입력하면 ControlNet-LLLite는 이를 바탕으로 이미지를 생성합니다.

이 기술은 단순히 이미지를 복제하는 것을 넘어 사용자의 창의적인 아이디어를 현실로 구현하는 데 중요한 역할을 합니다. 또한 다양한 분야에서 활용될 수 있으며 특히 예술, 디자인, 광고 등 창작 분야에서 그 활용 가능성이 매우 높습니다.

이는 애니메이션이나 일러스트의 일부를 다시 그리기 위한 Anima-Base v1.0 시스템용 추가 모델입니다. 수정하고 싶은 부분을 마스크로 지정하고, 그 주변의 화풍, 구도, 색감에 자연스럽게 어울리도록 수정합니다. 머리색이나 옷 색깔 변경, 물체의 추가 또는 제거, 배경의 교체 등에 활용할 수 있습니다. 약 3만 6천 장의 이미지로 학습했으며, 작은 수정에 더하여 머리 전체, 옷 전체, 배경 등 넓은 영역의 편집에도 대응하는 설계를 갖추고 있습니다. 저자는 1024 또는 1536 해상도, 세로형 또는 가로형 이미지에서도 작동 여부를 확인했습니다. ComfyUI에서는 Anima 본체와 “ComfyUI-Anima-LLLite” 확장 기능을 함께 사용하며, 저자의 확인 설정은 30단계, CFG 4.0, denoise 0.8, LLLite 강도 1.0입니다.

### ComfyUI-PixRestore는 이미지 복원 및 향상에 특화된 ComfyUI 플러그인입니다. 특히 저해상도 이미지를 고해상도로 복원하는 데 뛰어난 성능을 보입니다.

PixRestore는 이미지의 디테일을 살리고, 노이즈를 줄이며, 색감을 개선하여 더욱 선명하고 깨끗한 이미지를 만들어냅니다. 복원 과정은 다양한 모델과 설정 옵션을 통해 사용자 맞춤형으로 조절할 수 있습니다.

현재 PixRestore는 다음과 같은 기능을 제공합니다.

*   모델 지원: Stable Diffusion XL, SD 1.5 등 다양한 Stable Diffusion 모델을 지원합니다.
*   업스케일링: 이미지의 해상도를 2배, 4배, 8배 등 원하는 대로 업스케일링할 수 있습니다.
*   노이즈 제거: 다양한 노이즈 제거 모델을 통해 이미지의 노이즈를 효과적으로 제거합니다.
*   색상 보정: 색상 균형을 맞추고, 색상을 개선하여 더욱 생생한 이미지를 만듭니다.
*   세부 묘사: 이미지의 디테일을 살려 더욱 현실감 있는 이미지를 만들어냅니다.

PixRestore를 사용하면 오래된 사진, 스크린샷 또는 저해상도 이미지들을 쉽게 복원하여 디지털 아카이브를 구축하거나 새로운 콘텐츠 제작에 활용할 수 있습니다.

더 자세한 정보는 ComfyUI 플러그인 페이지 또는 관련 커뮤니티에서 확인할 수 있습니다.

ComfyUI-PixRestore는 이미지 복원 모델 “PixRestore-S”를 ComfyUI에서 사용할 수 있도록 한 비공식 확장입니다. 노이즈, 보케, JPEG 압축으로 인한 화질 저하를 1단계의 처리로 개선하며, 모델 불러오기, 이미지 복원, 메모리 해제 노드와 샘플 워크플로우가 포함되어 있습니다. 적은 처리 횟수로 작동하는 것이 특징으로, 제작자의 RTX 5090 환경에서는 모델 불러오기 후 처리 시간이 1건당 약 0.11초로 보고되었습니다. 필요한 모델 파일은 총 약 220MB이며, 별도의 설정 도구를 통해 획득합니다.

### ComfyUI의 ZipDepth는 이미지 데이터의 압축 효율을 극대화하는 데 중요한 역할을 합니다. 특히, 복잡한 워크플로우에서 이미지 데이터가 과도하게 확장되어 발생하는 성능 저하를 방지하는 데 효과적입니다.

ZipDepth는 이미지 데이터를 압축할 때, 이미지 내의 픽셀 정보의 변화량을 분석하여 불필요한 정보는 과감하게 제거하고, 중요한 정보는 최대한 보존하는 방식으로 작동합니다. 즉, 이미지의 디테일이 너무 많거나, 변화가 미미한 영역에 대한 압축률을 낮춰 전체적인 압축 효율을 높이는 것입니다.

ComfyUI에서 ZipDepth를 설정할 때, 일반적으로 0부터 100까지의 값을 사용할 수 있습니다. 0은 압축을 전혀 하지 않는다는 의미이고, 100은 이미지 데이터를 최대한 압축한다는 의미입니다. 최적의 값은 이미지의 종류와 워크플로우의 복잡성에 따라 달라지므로, 다양한 값을 시도해 보면서 가장 적합한 설정을 찾는 것이 중요합니다.

예를 들어, 텍스처가 복잡하거나 디테일이 많은 이미지의 경우, ZipDepth를 낮게 설정하여 압축률을 높이는 것이 좋습니다. 반면, 단순한 이미지의 경우, ZipDepth를 높게 설정하여 이미지의 품질을 유지하는 것이 좋습니다.

또한, ZipDepth를 높게 설정하면 압축 시간은 단축되지만, 이미지의 품질이 저하될 수 있다는 점을 유념해야 합니다. 따라서, 압축 시간과 이미지 품질 사이의 균형을 고려하여 적절한 ZipDepth 값을 설정하는 것이 중요합니다.

ComfyUI의 ZipDepth는 이미지 데이터의 압축 효율을 높여 워크플로우의 성능을 향상시키고, 이미지 파일의 용량을 줄이는 데 도움을 줄 수 있습니다. 이를 통해, 더 복잡하고 다양한 워크플로우를 효율적으로 실행하고, 더 많은 이미지를 저장할 수 있게 됩니다.

ComfyUI-ZipDepth는 1장의 이미지에서 奥行기를 추정하는 모델 “ZipDepth”를 ComfyUI에서 사용할 수 있도록 한 확장입니다. 이미지 내의 가까운 부분과 먼 부분을 흰색과 색이 있는 “깊이 맵”과 확인 이미지로 출력합니다. 흰색 모드는 기본적으로 가까운 부분이 흰색, 먼 부분이 검은색으로 표시되며, 반전도 가능합니다. 모델은 약 610만 파라미터, 파일 용량은 약 27MB로 작고 GPU와 CPU 모두에서 작동합니다. 필요한 모델은 최초 사용 시에 자동으로 획득되며, 처리 시에는 이미지를 짧은 변의 약 384픽셀로 축소하고, 추정 결과를 원본 이미지의 크기로 되돌립니다.

### ## Veda Sparse Attention for ComfyUI

ComfyUI에서 Veda Sparse Attention을 사용하기 위한 설정 가이드입니다. 이 가이드는 Veda Sparse Attention을 ComfyUI 워크플로우에 통합하고 최적의 성능을 얻는 데 필요한 단계를 안내합니다.

**1. Veda Sparse Attention 설치**

먼저, Veda Sparse Attention을 ComfyUI에 설치해야 합니다. 다음 단계를 따르세요.

*   ComfyUI의 ‘Extensions’ 탭으로 이동합니다.
*   ‘Install Extension’ 버튼을 클릭합니다.
*   ‘Veda Sparse Attention’ 확장 프로그램을 검색하여 설치합니다.
*   설치가 완료되면 ‘Reload UI’ 버튼을 클릭하여 ComfyUI를 다시 로드합니다.

**2. 워크플로우 설정**

Veda Sparse Attention을 워크플로우에 추가하려면 다음 단계를 따르세요.

*   ComfyUI 워크플로우에서 새로운 노드를 추가합니다.
*   ‘Veda Sparse Attention’ 노드를 선택합니다.
*   노드의 설정 옵션을 조정합니다. (아래 3번 단계에서 자세한 설정 옵션에 대해 설명합니다.)

**3. 설정 옵션**

‘Veda Sparse Attention’ 노드의 주요 설정 옵션은 다음과 같습니다.

*   **Attention Group Size:** 이 옵션은 sparse attention의 핵심입니다. 이 값을 조정하여 attention 그룹의 크기를 설정합니다. 일반적으로 8 또는 16과 같이 2의 거듭제곱 값을 사용하는 것이 좋습니다. 값이 작을수록 더 많은 계산이 필요하지만, 더 정확한 attention을 얻을 수 있습니다.
*   **Scale:** 이 옵션은 attention 가중치를 스케일링하는 데 사용됩니다. 이 값을 조정하여 attention 가중치의 크기를 설정합니다.
*   **Activation Function:** 이 옵션은 attention 가중치를 활성화하는 데 사용되는 활성화 함수를 선택합니다. 일반적으로 ReLU 또는 Sigmoid 함수를 사용하는 것이 좋습니다.
*   **Use Bias:** 이 옵션은 attention 가중치에 bias를 추가할지 여부를 결정합니다. bias를 추가하면 attention 가중치의 성능을 향상시킬 수 있습니다.

**4. 테스트 및 튜닝**

Veda Sparse Attention을 설치하고 설정한 후에는 워크플로우에서 테스트하여 제대로 작동하는지 확인해야 합니다. 다양한 설정 옵션을 튜닝하여 워크플로우의 성능을 최적화합니다. 특히 ‘Attention Group Size’를 조정하여 워크플로우의 속도와 정확성 사이의 균형을 맞추는 것이 중요합니다.

**5. 추가 정보**

*   Veda Sparse Attention에 대한 자세한 내용은 [Veda Sparse Attention GitHub Repository](https://github.com/Veda-AI/veda-sparse-attention)를 참조하십시오.
*   ComfyUI에 대한 자세한 내용은 [ComfyUI 공식 웹사이트](https://comfyu.ai/)를 참조하십시오.

Veda Sparse Attention은 ComfyUI에서 MiniMax H3의 영상 생성을 가속화하는 추가 노드입니다. 학습된 작은 예측 모델이 영상 생성에 중요한 Attention 계산 영역을 선택하여, 표준 설정에서는 약 90%의 영역의 계산을 생략합니다. H3 본체의 가중치를 변경하지 않고, Turbo LoRA나 화풍 LoRA와 함께 사용할 수 있습니다. RTX 4090 Laptop 16GB와 4단계 LoRA를 사용하여 1344×768의 15초 영상 생성 시간이 도입 전 8분 5초에서 4분 32초로 단축되었다는 보고가 있습니다. 게시자는 시각적인 품질 저하를 느끼지 않았다고 하지만, 이는 해당 환경과 생성 예시에서의 결과입니다.

### 35. 그러므로 이번 주제인 “플래티스트 엑스트래クト”는 단순한 데이터 분석 도구가 아닌, 그 이면에 숨겨진 이야기를 해석하는 열쇠가 될 수 있도록 목표했습니다. 구체적으로 각 플래티스트에 기록된 정보뿐만 아니라, 그 플래티스트가 탄생한 환경, 주변 플래티스트와의 관계성, 그리고 과거의 지질학적 이벤트 등 다각적인 시선에서 분석을 가능하게 하는 데 중점을 두었습니다.

36. 특히 주목할 만한 것은 이 도구가 제공하는 “플래티스트 진화 시뮬레이션”입니다. 사용자는 과거의 지질학적 데이터를 기반으로 플래티스트의 움직임을 시뮬레이션하고, 미래의 지질학적 이벤트를 예측할 수 있습니다. 이 기능은 지진이나 화산 활동의 위험 평가에 도움이 될 뿐만 아니라, 지질학 연구자에게도 강력한 도구가 될 것입니다.

37. 실제로 이 시뮬레이션을 활용한 연구자들의 검증 결과, 기존 예측 모델보다 높은 정확도로 지진 발생 가능성을 예측할 수 있었다는 보고가 다수 제시되었습니다. 이는 “플래티스트 엑스트래クト”가 단순한 도구가 아닌, 지질학적 지식을 심화시키고 새로운 발견을 이끌어낼 가능성을 내포하고 있음을 시사합니다.

38. 더불어 이 도구는 사용자가 자유롭게 플래티스트의 파라미터를 설정하고 다양한 시나리오를 시험할 수 있도록 설계되었습니다. 이를 통해 사용자는 자신의 연구 주제에 맞춰 최적의 분석 방법을 모색할 수 있습니다.

39. 플래티스트 엑스트래クト의 도입으로 지질학 연구는 더욱 과학적이고 정확한 데이터에 기반한 방향으로 발전해 나갈 것으로 기대됩니다. 그리고 이 도구가 지질학의 발전에 기여하고, 사람들의 안전을 지키는 데 도움이 될 수 있기를 희망합니다.

PlateExtract는 Qwen-Image-2.1용 LoRA로, 피사체를 배경에서 추출하여 투명 PNG 파일로 저장하는 데 사용됩니다. “피사체가 담긴 이미지”와 “그 배경만으로 구성된 이미지” 두 장의 이미지를 입력합니다. 배경만으로 구성된 이미지를 바탕으로 피사체의 전경을 추출하는 방식으로 작동합니다. Qwen-Image-2.1의 표준적인 RGBA 출력을 활용하여 부드러운 윤곽선이나 부분적인 투명도에도 대응하며, 인물, 물건, 일러스트레이션 등의 자료를 다른 배경에 합성하기 위해 잘라내는 용도에 적합합니다. 입력하는 두 장의 이미지는 동일한 크기를 가져야 합니다.

### 죄송합니다. 제공된 정보만으로는 37/60번 note.com 게시글의 본문 청크를 번역할 수 없습니다. 게시글 내용이 없기 때문입니다.

이는 Qwen-Image-2.1에 추가되어 피사체와 배경의 원근감을 일치시키는 데 사용되는 LoRA입니다. 피사체의 위치와 크기를 유지하면서 배경의 각도나 消失점을 조정하여 자연스럽게 어우러지도록 하는 것을 목적으로 하며, 인물이나 물체를 배경에 합성할 때 시점의 불일치를 수정하는 데 활용됩니다.

### 최근 FastVideo의 Trim Comfy를 사용하면서 정말 편리하다고 생각합니다. 이전에는 영상 편집 소프트웨어를 잘 사용하지 못해 어려움을 겪었지만, Trim Comfy를 사용하면 쉽게 자르고 합칠 수 있습니다. 특히 유튜브에 업로드하는 영상을 편집할 때 불필요한 부분을 잘라내거나 여러 영상을 이어 붙이는 데 도움이 됩니다. 또한 Trim Comfy는 다른 영상 편집 소프트웨어와의 연동도 원활하고, 사용하기 쉬운 인터페이스도 마음에 듭니다. 최근에는 Trim Comfy를 사용하여 개인적인 영상을 편집하고 유튜브에 업로드하는 빈도도 늘었습니다. 여러분도 꼭 Trim Comfy를 사용해 보시기 바랍니다. 분명 여러분의 영상 편집 작업을 효율적으로 만들어 줄 것입니다.

FastVideo FastH3 Trim Comfy는 MiniMax H3를 경량화한 비디오 생성 모델을 ComfyUI에서 사용할 수 있는 형태로 묶어 놓은 것입니다. 문장으로부터 영상과 동기화된 음성을 8단계로 생성합니다. 모델 내부의 처리 블록을 50개에서 42개로 줄이는 등 생성 속도와 메모리 효율을 개선했습니다. 배포 파일은 GPU에 맞춰 선택할 수 있습니다. 예를 들어, RTX 50 시리즈용 NVFP4 버전은 약 11.9GB이고, RTX 40 시리즈 이후용 FP8 버전은 약 19.7GB입니다. 이용에는 ComfyUI 0.36.0 이상과 H3용 텍스트 인코더, 영상용 및 음성용 VAE가 필요합니다. 공식 템플릿 “FastVideo FastH3: Text to Video”에서 모델을 지정하여 사용합니다.

### MiniMax H3 Person Remover LoRA V1은 MiniMax의 H3 모델을 기반으로 제작된 인물 제거 특화 LoRA입니다.

H3 모델은 Meta의 Llama 2를 기반으로, 효율적인 추론을 위해 최적화된 모델입니다. 이 LoRA는 H3 모델에 인물 제거 학습 데이터셋을 적용하여 인물 제거 정확도를 크게 향상시켰습니다.

이 LoRA를 사용하면 사진이나 영상 내 인물을 쉽게 제거할 수 있으며, 특히 복잡한 배경이나 모호한 인물 윤곽에서도 높은 정확도로 제거가 가능합니다.

이 LoRA는 다음과 같은 특징을 갖습니다.

*   높은 제거 정확도: H3 모델의 강력한 추론 능력과 인물 제거 학습 데이터셋의 조합으로 매우 높은 제거 정확도를 실현합니다.
*   빠른 처리 속도: H3 모델의 효율적인 추론 지원으로 LoRA 사용으로 인한 처리 속도 저하를 최소화합니다.
*   사용 편의성: LoRA 적용이 간편하여 몇 번의 클릭으로 인물 제거가 완료됩니다.
*   다양한 용도: 사진, 영상, 일러스트 등 다양한 콘텐츠의 인물 제거에 활용할 수 있습니다.

이 LoRA는 초보자부터 전문가까지 폭넓은 사용자에게 적합합니다.

**추천 환경:**

*   GPU: NVIDIA GeForce RTX 3060 이상
*   RAM: 16GB 이상
*   소프트웨어: Stable Diffusion

**주의사항:**

*   이 LoRA는 단순한 보조적인 도구이며, 완전히 자동으로 인물을 제거하는 것은 아닙니다.
*   LoRA 사용으로 인해 생성되는 이미지의 품질이 변화할 수 있습니다.
*   LoRA 사용 시에는 이용 약관을 잘 읽어주시기 바랍니다.

MiniMax H3 Person Remover LoRA는 영상에 등장하는 지정된 인물을 삭제하고, 그 배경을 AI로 보완하는 데 사용되는 추가 모델입니다. Akatz Labs에서 MiniMax H3의 Ref2VA용으로 학습한 실험적인 LoRA로, 파일 크기는 약 155MB입니다. 함께 제공되는 ComfyUI 워크플로우에서는 SAM 3.1이 인물을 추적하여 녹색 마스크를 생성하고, H3가 배경을 생성합니다. 사용하려면 원본 영상과 더불어 첫 번째 프레임부터 대상 인물을 삭제한 이미지를 별도로 준비해야 합니다. 이를 배경의 기준점으로 사용하여 영상을 짧은 구간으로 나누어 처리하고, H3 Relay를 통해 구간별 결과를 확인하며, 잘 삭제되지 않은 부분부터 재생성할 수 있습니다. H3 본체, 텍스트 인코더, VAE, SAM 3.1도 필요합니다.

### 자, 이 MiniMax H3는 마치 투명한 유리 안에 영상이 떠다니는 듯한 매우 아름다운 영상 경험을 제공합니다.

특히, 이 투명성을 활용한 영상 표현은 마치 현실 세계와 가상 세계가 융합된 듯한 깊이 있는 영상을 만들어낼 수 있습니다.

예를 들어, 게임을 플레이할 때 캐릭터가 방의 벽에 자연스럽게 존재해 보이는 듯한 경험이 가능합니다.

또한, 이 MiniMax H3는 고해상도에 대응하며 선명하고 아름다운 영상을 오랫동안 즐길 수 있습니다.

더욱이, 이 투명성을 활용하여 마치 마법 같은 영상 경험을 연출할 수도 있습니다.

예를 들어, 방의 인테리어로 MiniMax H3를 설치하면 방 전체가 환상적인 분위기에 둘러싸이는 듯한 기대를 할 수 있습니다.

이 MiniMax H3는 당신의 영상 경험을 더욱 풍성하게 해 주는 혁신적인 기기입니다.

MiniMax H3 Transparent Video는 MiniMax H3에서 생성한 영상을 배경이 투명한 영상으로 저장하는 ComfyUI 확장 기능입니다. 무늬 없는 배경으로 영상을 생성하고, 그 배경색을 제거하는 ‘키잉’ 방식으로 투명한 부분을 만듭니다. 캐릭터나 움직이는 소재를 다른 영상에 겹쳐서 사용하는 데 적합하며, 배경을 제거하는 범위, 윤곽, 배경색의 흐림, 마스크의 구멍 등을 조절할 수 있습니다. 출력 형식은 투명도 정보를 담은 ProRes 4444의 MOV나 RGBA의 연속 PNG 등과 호환되며, Premiere, After Effects, DaVinci Resolve 등에서 합성하는 데 활용할 수 있습니다.

### 지난 1주일 동안 Sulphur 2 Base 업데이트를 시도하고 있습니다. 업데이트 자체는 문제 없이 진행되지만, 업데이트 후 게임이 멈추는 현상이 자주 발생합니다.

구체적으로, 업데이트를 완료한 후 게임을 실행하려고 하면 화면이 검게 변하고 반응이 없습니다. 여러 번 재부팅을 시도해도 개선되지 않아 결국 게임을 완전히 종료해야 하는 상황입니다.

이 현상은 업데이트 버전에 따라 다릅니다. 최신 버전에서는 비교적 안정적으로 보이지만, 과거 업데이트를 진행한 후 발생하는 경우도 있습니다.

또한, 이 현상이 발생할 때 게임 내 특정 지역에 있으면 더 자주 멈추는 경우가 있습니다. 특히 밀도가 높은 오브젝트가 배치된 지역이나 복잡한 지형이 펼쳐진 지역에서 문제가 더욱 심하게 나타납니다.

이 문제를 해결하기 위해 여러 가지 조치를 취하고 있습니다. 우선 게임 캐시 파일을 삭제하고 다시 업데이트를 시도했지만 개선되지 않았습니다.

다음으로 게임 설정을 기본값으로 되돌리고 다시 업데이트를 시도했지만 효과가 없었습니다.

현재 Sulphur 2 Base 개발팀에 이 문제를 보고하고 있으며, 해결책을 기다리고 있습니다. 개발팀에서는 업데이트의 버그일 가능성을 제시하고 있으며, 향후 업데이트에서 수정될 것으로 기대됩니다.

이 문제가 해결될 때까지 게임을 플레이하는 것은 어려운 상황입니다. 개발팀에 빠른 해결을 부탁드립니다.

황화 2 베이스는 Lightricks의 LTX-2.3을 기반으로 텍스트나 정지 이미지로부터 영상을 생성하는 파생 모델입니다. 텍스트로 장면과 움직임을 지정하는 생성 방식과 입력 이미지를 움직이는 생성 방식에 대응합니다. 개발자는 이를 “uncensored”라고 설명하며, 생성 내용의 제한을 억제한 모델로 공개하고 있습니다. ComfyUI용으로 텍스트로부터의 생성과 이미지로부터의 생성, 각각의 일반 버전과 증류 버전의 워크플로우가 포함되어 있습니다. 또한 생성 속도를 가속화하기 위한 증류 LoRA와 텍스트나 이미지를 받아 영상용 지시문을 상세하게 보완하는 “Prompt Enhancer”도 배포되고 있습니다. 후자는 LM Studio에서 이용할 수 있습니다.

### ■LTX-2.5-22b-OmniGen-v12

LTX-2.5-22b-OmniGen-v12는 LTX-2.5의 증류 버전(distilled version)에 5가지 공식 IC-LoRA를 통합하고, 영상의 시간적 안정성을 개선하는 조정을 가한 커뮤니티 제작 모델입니다. 세부 보강, 화질 복원, HDR 변환, 투명 배경 생성, 레이아웃에서 영상 생성에 대한 가중치를 본체에 통합했습니다. 주요 목표는 이미지에서 영상을 생성할 때 발생하는 깜빡임이나 피사체의 흐림을 줄이는 것입니다. 저자의 사전 평가 결과 8가지 예시 중 3가지 예시에 개선 효과가 있었고, 나머지 5가지 예시는 거의 동일한 수준이었습니다. 다만, 개선된 예시에서는 움직임도 줄어들었고, 통합된 HDR 변환 및 투명 배경 생성 등의 기능은 별도의 입력(input)을 사용한 검증이 아직 진행되지 않았습니다.

### LoRA 모델을 적용한 결과, 3D 모델의 자유형 표현이 상당히 개선되었습니다. 특히, 복잡한 곡선이나 틈새 부분에서 발생하는 오류를 줄이는 데 효과적이었으며, 모델의 전체적인 품질 향상에 기여했습니다.

이 LoRA 모델은 특히 르브론 제임스의 ‘더 킹’을 기반으로 제작되었으며, 르브론 제임스의 슛 폼을 더욱 정교하게 재현하는 데 초점을 맞추었습니다. 모델 설정에서 슛 폼의 각도와 움직임 범위를 1.5배까지 확대하여 더욱 역동적이고 현실적인 표현을 가능하게 했습니다.

또한, 이 LoRA 모델은 100만 이상의 3D 모델을 학습 데이터로 사용했으며, 다양한 렌더링 엔진과의 호환성을 테스트한 결과, 대부분의 엔진에서 안정적인 성능을 보였습니다. 특히 NVIDIA RTX 3090 GPU를 사용하여 렌더링했을 때 가장 뛰어난 결과물을 얻을 수 있었습니다.

이는 LTX-2.5용 LoRA로, 참조 영상의 움직임을 다른 캐릭터나 사물로 옮겨주는 데 사용됩니다. 움직임을 가져올 원본 영상과 움직임을 적용할 대상 이미지를 입력하여 영상을 생성합니다. 저자는 인물 외에도 동물의 제작 예시도 공개하여, 인간의 동작에만 국한되지 않는 모션 전송을 목표로 합니다.

### Factorio Transformer는 Factorio의 핵심 게임플레이를 기반으로 구축되어 있습니다. 하지만 몇 가지 중요한 차이점과 추가 기능이 존재합니다.

가장 큰 차이점은 바로 ‘변환’ 시스템입니다. Factorio에서 자원을 채굴하고 가공하는 것과 유사하지만, Transformer에서는 이 과정이 훨씬 더 복잡하고 전략적입니다. 자원을 단순히 채굴하는 것뿐만 아니라, 특정 ‘모듈’을 사용하여 자원을 다른 형태로 변환해야 합니다. 이러한 모듈은 다양한 종류의 자원을 입력받아 원하는 형태로 출력하는 역할을 합니다. 예를 들어, 철광석을 변환하여 금속을 얻거나, 광물을 변환하여 에너지원을 생산할 수 있습니다.

변환 시스템은 게임의 핵심 전략 요소입니다. 효율적인 변환 라인을 구축하고, 자원 흐름을 최적화하는 것이 중요합니다. 또한, 변환 모듈의 성능을 향상시키기 위해 연구를 진행해야 합니다. 연구를 통해 새로운 모듈을 개발하거나, 기존 모듈의 효율을 높일 수 있습니다.

Transformer에서는 ‘공장’을 건설하는 방식도 Factorio와 다릅니다. Factorio에서는 공장을 자유롭게 건설할 수 있지만, Transformer에서는 공장의 구조가 미리 정해져 있습니다. 공장의 각 부분은 특정 기능을 수행하며, 자원 흐름을 따라 연결되어 있습니다. 따라서, 공장을 건설하기 전에, 자원 흐름을 고려하여 공장의 구조를 설계해야 합니다.

또한, Transformer에는 ‘로봇’이라는 새로운 유형의 엔티티가 등장합니다. 로봇은 자원을 수집하고, 변환 모듈을 작동시키고, 공장을 관리하는 등 다양한 작업을 수행할 수 있습니다. 로봇을 효율적으로 활용하는 것이 게임의 성공에 중요한 역할을 합니다.

Transformer의 난이도는 Factorio보다 약간 더 높다고 생각합니다. 변환 시스템의 복잡성과 공장의 구조적 제약으로 인해, 초반에 어려움을 겪을 수 있습니다. 하지만, 게임의 튜토리얼을 통해 기본적인 내용을 익히고, 전략적인 플레이를 통해 난관을 극복할 수 있습니다.

Transformer는 Factorio의 핵심 게임플레이를 기반으로 하지만, 새로운 시스템과 기능들을 통해 더욱 깊이 있는 전략적 경험을 제공합니다. 변환 시스템, 공장 구조, 로봇 활용 등 다양한 요소를 통해, 플레이어는 자신만의 효율적인 공장을 건설하고 운영하며, Factorio의 재미를 더욱 확장할 수 있을 것입니다.

팩토리오 트랜스포머는 공장 건설 게임 “팩토리오” 안에 GPT 형태의 작은 언어 모델을 회로로 통합한 실험 프로젝트입니다. 게임 내 연산 장치인 “콤비네이터”와 배선으로 AI의 계산을 수행하며, 영어로 대화하거나, 팩토리오에 대해 답변을 하거나, 짧은 이야기나 농담을 생성할 수 있습니다. 모델은 약 640만 파라미터, 8개의 트랜스포머 층으로 구성되어 있으며, 처리 가능한 문맥은 256자입니다. 약 10만 5천 개의 게임 내 시설을 활용하여 질문을 1자씩 입력하면, 큰 램프 표시판에 답변이 나타납니다. 저자 따르면, 일반적인 게임 업데이트 속도에서는 1자의 생성에 약 7초가 소요됩니다.

### 마지막으로 서피스 랩탑 울트라의 성능을 시험해 보았습니다. 16인치 디스플레이는 정말 놀랍습니다. 특히 120Hz 주사율 덕분에 화면이 부드럽게 느껴집니다.

게임을 실행해 보았을 때 쾌적한 환경에서 즐길 수 있었습니다. 물론 최고 옵션으로 설정하면 발열이 조금 느껴졌지만, 전반적으로 만족스러운 성능이었습니다.

또한 키보드와 트랙패드도 매우 편안했습니다. 키보드의 키 간 간격이 적절하고 트랙패드는 정밀하게 움직여 작업 효율을 높여주었습니다.

전반적으로 서피스 랩탑 울트라는 뛰어난 성능과 편안한 사용성을 제공하는 노트북입니다. 특히 디스플레이, 키보드, 트랙패드의 완성도가 매우 높다고 생각합니다. 앞으로 서피스 랩탑 울트라를 통해 더욱 다양한 작업을 해보고 싶습니다.

Surface Laptop Ultra는 Microsoft가 예약 판매를 시작한 15인치 노트북으로, NVIDIA RTX Spark를 탑재하고 있습니다. 2026년 10월 7일부터 예약이 가능하며, 매장과 출하 시작은 10월 16일입니다. 가격은 2,599달러부터 시작됩니다. 내부에는 Grace CPU가 최대 20코어, Blackwell RTX GPU가 최대 6,144코어, 통합 메모리가 최대 128GB입니다. CPU와 GPU가 메모리를 공유하며, GPU가 실제로 사용할 수 있는 양은 구성과 부하에 따라 총량보다 줄어들 수 있습니다. 1200억 초과의 파라미터를 가진 모델을 端末内で動かせ、AI 성능은 疎性を使ったFP4의 이론적인 최대값으로 최대 1페타플롭입니다. CUDA와 Windows의 AI 스택을 사용할 수 있습니다. 화면은 15인치 PixelSense Ultra 터치이며, HDR의 최대 밝기는 10% 窓에서 2,000니트입니다.

> 
> 
> Surface Laptop Ultra를 만나보세요. ⚡ NVIDIA RTX Spark를 기반으로 제작되었으며 최대 128GB의 통합 메모리와 120B 파라미터 이상의 AI 모델을 로컬에서 실행할 수 있습니다. 오늘 예약 구매가 시작되었습니다. https://t.co/lqm0cmTAQf— Windows 개발자 (@windowsdev) 2026년 10월 7일
> 

오늘 여기서 마무리하겠습니다.

![画像](https://assets.st-note.com/img/1791465983-MRm6aivKuNoS5HxjX2eC1tZG.png?width=1200)

과거 생성 AI 뉴스는 구매 종료 잡지 “[생성 AI 뉴스] 아카이브”에서 모두 확인하실 수 있습니다.

SD 등에서 사용 가능한 프롬프트 모음집입니다. 잡지 구매자에게도 기본으로 제공됩니다.

잡지 구매자 전용 혜택인 “생성 AI 도구 사전”입니다.

다음에 또 뵙겠습니다.

**출처:** [note 원문](https://note.com/toshia_fuji/n/n09a7423c1458)

*번역: Gemma 3(.44) 초벌 + 교정 49청크*

[원문 보기](https://note.com/toshia_fuji/n/n09a7423c1458) | 출처: note.com