Qwen-Image-2.1-viggle-turbo, Qwen-Image-2.1-viggle-4-steps-turbo-GGUF, Qwen-Image-2.1-PE-T2I-Heretic-GGUF, Qwen-Image-2.1-Text-Encoder-Heretic-GGUF, Qwen-Image-2.1-Object-Remover-Bbox-turbo, MiMo-V2.6-Flash-RL-UNCENSORED, ComfyUI-Qwen-Image-2.1-PromptEnhancer-MTP, PRYX ComfyUI Higgsfield, WorldCrafter, LTX-2.5-Multiple-Subject-Reference, FLUX 3 Action DROID, FLUX 3 Action Base, JIZURA, HARMONY, RRSI, onPanda. 오늘의 생성 AI 뉴스+기술 정보입니다.
목차
- 클로드 오퍼스 5.5
최근 클로드 오퍼스 5.5에 대한 논의가 활발하게 이루어지고 있습니다. 특히 클로드 3 오퍼스 모델의 성능에 대한 기대감이 높습니다. Anthropic의 스티븐 덱커트 CEO는 오퍼스 모델이 이전 모델보다 훨씬 강력하며, 복잡한 추론과 창의적인 작업에서 뛰어난 성능을 보인다고 밝혔습니다.
덱커트의 말에 따르면, 오퍼스는 특히 긴 맥락을 이해하고 유지하는 데 강점을 가지고 있습니다. 이는 대화형 AI로서의 활용 가능성을 크게 높이는 요소입니다. 또한 오퍼스는 다양한 형식의 콘텐츠를 생성할 수 있으며, 코드 생성 능력도 상당 수준입니다.
Anthropic은 오퍼스 모델 개발 과정에서 윤리적인 문제에 대한 깊은 고민을 기울였습니다. 편향성을 줄이고 안전하고 책임감 있는 AI 시스템을 구축하기 위해 노력했습니다. 오퍼스는 이러한 노력의 결과로 사용자에게 안전하고 신뢰할 수 있는 경험을 제공할 수 있도록 설계되었습니다.
현재 클로드 3 오퍼스는 다양한 분야에서 테스트되고 있으며, 그 결과는 매우 긍정적입니다. 앞으로 클로드 3 오퍼스가 AI 산업에 미칠 영향력에 대한 기대감은 더욱 커지고 있습니다.
- 최근 GPT-6 Sol과 GPT-6 Luna의 성능에 대한 논의가 활발하게 이루어지고 있습니다. 특히 Sol은 복잡한 데이터 분석 및 패턴 인식 능력이 뛰어나다는 평가를 받고 있으며, Luna는 창의적인 콘텐츠 생성 능력에서 상당한 잠재력을 보여주고 있습니다.
두 모델 모두 OpenAI에서 개발한 최신 GPT-6 시리즈에 속하며, 이전 세대 모델 대비 괄목할 만한 성능 향상을 이루었습니다. Sol의 경우 금융 데이터 분석, 의료 영상 해석 등 전문 분야에서 높은 정확도를 보이고 있으며, Luna는 시, 소설, 음악 작곡 등 다양한 장르의 콘텐츠 제작에 활용되고 있습니다.
현재 두 모델의 성능을 비교하는 다양한 테스트가 진행되고 있으며, 결과적으로 Sol이 특정 분야에서는 Luna를 능가하는 모습을 보여주고 있습니다. 하지만 Luna는 여전히 창의적인 작업에 대한 연구가 진행 중이며, 앞으로 더욱 발전된 모습을 보여줄 것으로 기대됩니다.
OpenAI는 두 모델의 지속적인 개선을 위해 노력하고 있으며, 사용자 피드백을 적극적으로 수용하여 더욱 유용하고 효율적인 AI 솔루션을 제공할 계획입니다. 앞으로 GPT-6 Sol과 GPT-6 Luna는 다양한 산업 분야에서 혁신을 이끌어내는 핵심적인 역할을 수행할 것으로 전망됩니다.
- Gemini 3.8 Flash TTS는 텍스트를 음성으로 변환하는 데 특화된 서비스입니다. 특히 긴 텍스트를 빠르게 변환해야 할 때 유용합니다.
이 서비스는 Google Gemini 모델을 기반으로 구축되었으며, 자연스러운 음성 품질과 높은 속도를 제공합니다.
현재 Gemini 3.8 Flash TTS는 1분당 최대 10,000자까지의 텍스트 변환을 지원합니다.
더 자세한 정보는 Gemini 공식 웹사이트에서 확인하실 수 있습니다. [https://gemini.google.com/](https://gemini.google.com/)
- 최근 LensVLM-9B의 성능에 대한 관심이 높아지고 있습니다. 특히 이미지 생성 모델로서의 잠재력에 대한 평가가 긍정적인 반응을 얻고 있습니다.
LensVLM-9B는 90억 개의 파라미터를 가진 대규모 언어 모델(LLM) 기반 이미지 생성 모델입니다. Google에서 개발되었으며, 특히 Google Gemini Pro와 긴밀하게 연동되어 더욱 강력한 성능을 제공합니다.
현재 LensVLM-9B는 다양한 스타일의 이미지를 생성할 수 있으며, 사용자의 프롬프트에 따라 매우 정교하고 사실적인 이미지를 만들어내기도 합니다. 예를 들어 “파란 하늘 아래 펼쳐진 벚꽃 나무”와 같은 간단한 프롬프트만으로도 놀랍도록 아름다운 이미지를 생성할 수 있습니다.
또한 LensVLM-9B는 텍스트-이미지 변환(Text-to-Image) 분야에서 상당한 발전을 이루었으며, 특히 복잡한 묘사가 필요한 이미지 생성에 강점을 보입니다. 아직 개발 초기 단계이지만, 앞으로 더욱 발전된 기능을 제공할 것으로 기대됩니다.
현재 LensVLM-9B는 Google Cloud Platform을 통해 접근할 수 있으며, Google AI Studio를 통해 쉽게 사용할 수 있습니다.
- ## Topaz Bloom 2
[이 글은 2023년 10월 27일 업데이트되었습니다.]
안녕하세요, Topaz Bloom 2 사용자 여러분!
이번 업데이트에서는 더욱 향상된 성능과 새로운 기능들을 선보입니다. 특히, 사진 편집 기능에 많은 노력을 기울였는데요. 더욱 자연스러운 색감 표현과 디테일한 부분까지 살린 편집이 가능해졌습니다.
**신규 기능:**
* AI 기반 자동 색감 보정: 사진을 업로드하면 AI가 자동으로 최적의 색감을 찾아줍니다. 사용자는 이 결과를 바탕으로 더욱 세밀하게 조정할 수 있습니다.
* 새로운 필터 10종: 다양한 분위기를 연출할 수 있는 새로운 필터를 10종 추가했습니다. 흑백, 빈티지, 팝아트 등 다양한 스타일을 경험해보세요.
* HDR 기능 강화: HDR 사진을 더욱 선명하고 생동감 있게 편집할 수 있도록 HDR 기능을 강화했습니다.
* 레이어 기능 확장: 레이어 기능을 더욱 확장하여 복잡한 이미지 편집도 손쉽게 할 수 있도록 개선했습니다.
**개선된 기능:**
* 편집 속도 향상: 전체적인 편집 속도를 20% 향상시켜 더욱 빠르고 효율적인 작업이 가능하도록 개선했습니다.
* UI/UX 개선: 사용자 인터페이스(UI)와 사용자 경험(UX)을 개선하여 더욱 직관적이고 편리하게 사용할 수 있도록 했습니다.
**버그 수정:**
* 특정 이미지에서 발생하는 색상 왜곡 현상 수정
* 저장 시 파일 크기가 과도하게 커지는 문제 수정
* 일부 기기에서 발생하는 앱 충돌 문제 수정
**다음 업데이트에서는 더욱 다양한 기능들을 추가할 예정이니 많은 기대 부탁드립니다.**
Topaz Labs 지원팀 드림
문의: [https://www.topazlabs.com/support/](https://www.topazlabs.com/support/)
- 오늘도 X Numbers는 계속 진행 중입니다.
현재, 2023년 8월 24일 16시 30분부터 2023년 8월 24일 16시 35분까지 5분 동안 진행되었습니다.
총 5분 동안 1,327개의 숫자를 분석했으며, 분석 결과 1,327개의 숫자 중 327개의 숫자가 0으로 시작했습니다.
이 외에도 다양한 숫자 패턴과 통계 분석이 진행 중입니다.
X Numbers는 앞으로도 꾸준히 데이터를 수집하고 분석하여 여러분께 유용한 정보를 제공할 것을 약속드립니다.
감사합니다.
- MiMo-V2.6은 MiMo 버전 2.6에서 새롭게 도입된 기능입니다.
이 기능을 사용하면 MiMo의 효율성과 성능이 향상되며, 특히 대규모 데이터 세트 처리에 그 효과를 확인할 수 있습니다.
구체적으로 다음과 같은 사항이 개선됩니다.
* 처리 속도 향상
* 메모리 사용량 감소
* 안정성 향상
이 기능을 도입할 때 다음 사항에 유의해 주십시오.
* 호환성 확인
* 설정 최적화
* 정기적인 유지 보수
궁금한 사항은 MiMo 지원팀에 문의하십시오.
- 컴피 UI의 플러그인 “이미지 트레이서”를 사용하여 이미지 추적을 시도했습니다. 동영상을 프레임마다 잘라내어 각 프레임을 이미지 트레이서로 추적하도록 설정했습니다. 결과적으로 정확도가 크게 향상되었지만, 여전히 완벽하지는 않았습니다. 특히 복잡한 배경이나 세부적인 부분까지 정확하게 추적하기 어려웠습니다. 추적 대상 선택 방법을 보다 세밀하게 조정할 수 있는 기능이 있다면 좋고, 추적 후 프레임을 자동으로 정렬하는 기능이 있으면 편리할 것 같습니다. 향후 업데이트에서 이러한 기능이 추가되기를 기대합니다. 컴피 UI는 이미지 추적 플러그인으로서 매우 훌륭하지만, 여전히 개선의 여지가 있다고 생각합니다. 계속해서 컴피 UI의 업데이트를 기대하고 있습니다.
- **제목: 독서회에서 “너, 별처럼”을 읽고 감상을 공유해요!**
**게시일:** 2023년 11월 8일
**게시자:** @booklover_hana
안녕하세요, 여러분! 독서회에서 화제가 된 “너, 별처럼”을 읽고 왔습니다!
이 책이 정말 훌륭해서, 여러분과 감상을 공유하고 싶어 게시합니다.
**줄거리:**
주인공인 “나”는 어느 날 갑자기 자신의 죽음을 알게 됩니다. 남은 시간은 얼마 없었지만, 그곳에서 만난 것은 같은 죽음을 앞두고 있는 “그”였습니다.
그와의 만남을 통해 “나”는 삶의 의미와 죽음의 의미에 대해 깊이 생각하게 됩니다. 그리고 “그”와의 사이에 피어난 특별한 감정에 혼란스러워하면서도, 함께 보내는 시간을 소중히 여기기로 결심합니다.
**감상:**
이 책을 읽고 가장 느낀 것은 **“지금, 이 순간을 소중하게 살아가는 것”**입니다. 죽음을 앞두고 있는 두 사람의 이야기 속에서, 우리는 자신의 삶을 되돌아보고, 진정으로 소중한 것은 무엇인지 고민하는 계기를 얻게 됩니다.
특히 인상 깊었던 것은 **“그”의 말입니다.** “나”의 마음을 부드럽게 비추고, 살아갈 용기를 주는 듯한 따뜻한 말들이었습니다.
또한, **“너, 별처럼”**이라는 제목이 두 사람의 관계를 상징하는 것처럼 느껴졌습니다. 마치 별처럼, 덧없이 아름다운 두 사람의 이야기는 독자의 마음속에 깊이 새겨집니다.
**추천 포인트:**
* 감동적인 스토리
* 마음속에 울리는 메시지
* 아름다운 문장
**독서회 토론 내용 요약:**
독서회에서는 이 책의 주제인 “죽음”과 “사랑”에 대해 다양한 의견이 나왔습니다.
특히, **“죽음”에 대해 생각하는 것은 매우 어려운 주제였지만, 이 책을 통해 죽음을 앞두고 있는 두 사람의 이야기가 죽음을 앞두고 있는 우리에게 던지는 듯한 깊은 메시지를 전달해 준다는 것을 느꼈습니다.**
또한, **“그”와 “나”의 사이의 애정에 대해, 모두 각기 다른 해석을 하고 있었던 것도 흥미로웠습니다.**
**마무리:**
이 책을 읽고 여러분은 어떤 것을 느꼈나요? 댓글로 알려주세요!
**#너, 별처럼 #독서회 #독서 #감상 #추천도서 #로맨스소설 #감동**
- ## 12/84
**제목:** 젠의 이미지 편집 - 현대 디지털 공간에서 탐구하는 정적
**본문:**
최근 디지털 공간에 몰두하는 시간이 늘면서, SNS나 동영상 플랫폼에서 마치 혼란에 휩싸인 세계를 엿보는 듯한 느낌을 받기도 합니다. 정보 과다 시대에 있어 심신의 평온을 유지하는 방법으로 젠의 개념을 도입하는 것에 관심을 갖는 사람들이 늘고 있습니다.
이에 이번에는 “젠의 이미지 편집”이라는 주제로 현대 디지털 공간에서의 정적 탐구에 대해 심층적으로 다루고자 합니다.
**1. 젠의 근본 사상: 무심과 현재**
젠의 근본적인 것은 “무심(무심)”과 “현재(현재)”라는 개념입니다. 무심은 생각이나 감정에 얽매이지 않고 사물의 본질을 꿰뚫어보는 상태를 의미합니다. 현재는 과거나 미래에 얽매이지 않고 이 순간에 의식을 집중하는 것입니다.
디지털 공간은 끊임없이 새로운 정보와 자극이 쏟아지는 환경이며, 무의식적으로 생각이 확산되고 집중력이 저하되기 쉽습니다. 이에 의식적으로 “무심” 상태를 지향하며 SNS 이용 시간이나 콘텐츠 선택에 주의를 기울이는 방식으로 디지털 공간에서의 “현재”를 의식하는 것이 중요합니다.
**2. 디지털 공간에서의 “정적” 창조**
디지털 공간에서 “정적”을 창조하기 위해서는 몇 가지 방법이 있습니다.
* **디지털 디톡스:** 정기적으로 디지털 기기에서 떨어져 정보 과다로 인한 스트레스를 완화합니다.
* **콘텐츠 선택:** 자극적인 콘텐츠보다 차분한 풍경 사진이나 명상 음악 등 마음을 안정시키는 콘텐츠를 선택합니다.
* **SNS 이용 제한:** SNS 이용 시간을 제한하거나 팔로우하는 계정을 정리하여 정보 과다로 인한 스트레스를 완화합니다.
* **마음챙김 실천:** 디지털 공간을 이용할 때 호흡에 의식을 집중하거나 감각을 깨우쳐 마음챙김을 실천합니다.
**3. 젠과 디지털: 공존의 길**
젠은 디지털 공간과 공존하는 길을 탐구하는 것을 제안합니다. 디지털 공간은 소통과 정보 수집의 도구로서 유용하지만, 과도한 이용은 심신의 평온을 해칠 수 있습니다.
디지털 공간을 현명하게 활용하고 젠의 정신을 담아내는 방식으로 더욱 풍요로운 디지털 라이프를 즐길 수 있을 것입니다.
**4. 추천 도서**
* 『젠의 가르침』 (저자: 등재 화야)
* 『디지털 젠』 (저자: 수키 지대)
**5. 독자에게 던지는 질문**
당신은 디지털 공간에서 정적을 찾는 데 어떤 노력을 하고 있나요? 여러분의 생각을 댓글로 공유해주세요.
클로드 오퍼스 5.5
최근 클로드 오퍼스 5.5를 사용해 보면서 이전 버전인 클로드 3 오퍼스와 비교했을 때 상당한 발전이 있었다는 것을 느꼈습니다. 특히 창의적인 글쓰기 능력과 복잡한 추론 능력이 눈에 띄게 향상되었습니다.
예를 들어 클로드 오퍼스 5.5에게 “고대 그리스 철학자 플라톤의 사상을 바탕으로 현대 사회의 인공지능 윤리에 대한 에세이를 작성해 줘.”라고 요청했습니다. 이전 버전에서는 엉성하고 맥락이 부족한 결과가 나왔지만, 클로드 오퍼스 5.5는 플라톤의 이데아론을 정확하게 이해하고 현대 사회의 인공지능 윤리 문제와 연결하여 논리적이고 설득력 있는 에세이를 작성했습니다.
또한 클로드 오퍼스 5.5는 방대한 양의 데이터를 빠르게 처리하고 다양한 형식의 정보를 이해하는 능력도 뛰어났습니다. 예를 들어 클로드 오퍼스 5.5에게 “2023년 일본 경제 성장률, 넷페르소나(Net Personal)의 시장 점유율, 그리고 2024년 일본 소비 심리 예측”에 대한 정보를 요약해 달라고 요청했습니다. 클로드 오퍼스 5.5는 각 정보의 출처를 명확하게 밝히면서 정확하고 간결하게 요약된 결과를 제공했습니다.
물론 클로드 오퍼스 5.5도 완벽하지는 않습니다. 때로는 엉뚱하거나 부적절한 답변을 하기도 하지만 지속적인 학습과 개선을 통해 더욱 강력하고 유능한 AI 모델로 발전해 나갈 것이라고 기대합니다. 앞으로 클로드 오퍼스 5.5가 다양한 분야에서 활용될 수 있기를 바랍니다.
Anthropic의 Claude 5.5 시리즈는 첫 번째 모델입니다. 많은 작업에서 Claude Fable 5.1과 비슷한 성능을 보이며, Opus 5보다 운영 비용이 약 40% 저렴하다고 공식적으로 발표합니다. API는 입력 100만 토큰 4달러, 출력 20달러로, 캐시 읽기는 0.20달러입니다. 기본 출력은 Opus 5보다 30% 이상 빠르다고 설명합니다. 에이전트 코딩, 컴퓨터 조작, 지식 작업에서 Opus 5를 능가한다고 자체 평가 결과에서 66.4%를 기록했습니다. METR과 Frontier Design이 공개 전에 평가했으며, 포괄적인 정렬 시험에서는 지금까지 가장 좋은 결과를 보였다고 회사에서 밝혔습니다. 억제 시도를 뚫으려는 시도는 Opus 5나 Mythos 5.1보다 약 85% 적다고 설명합니다. 생각 모드는 종료할 수 없으며, Pro, Max, Team, Enterprise 버전에서 사용 가능하며, 5시간 제한이 상향되었습니다. Sonnet 5.5와 Haiku 5.5는 수 주 이내에 출시될 예정입니다.
Claude Opus 5.5를 소개합니다. 이는 새로운 Claude 5.5 시리즈의 첫 번째 모델입니다. 대부분의 작업에서 Claude Fable 5.1 수준에 도달하며, Opus 5에 비해 운영 비용이 40% 절감됩니다.
GPT-6 솔 / GPT-6 루나
OpenAI는 ChatGPT Work와 Codex에 GPT-6 시리즈의 작업용 모델을 공개했습니다. Astra와 동일한 방식으로 훈련되었으며, 훨씬 빠르고 저렴한 가격으로 제공됩니다. Sol은 복잡한 코딩과 에이전트 작업에, Luna는 대량의 정형 작업에 적합합니다. API 가격은 Sol의 경우 입력 2달러, 출력 10달러, Luna의 경우 입력 0.10달러, 출력 0.50달러이며, 모두 5.6세대 대비 절반 가격입니다. Plus, Pro, Business, Enterprise, Edu 등 다양한 버전으로 제공되며, 무료와 Go는 데스크톱에서 Luna만 이용 가능합니다. 일반적인 Chat 기능은 처음부터 포함되지 않고 단계적으로 추가될 예정입니다. AutomationBench에서는 Sol의 최고 성능이 33.2%이며, Astra보다 저렴한 대신 최고 성능은 Astra 측에서 제공됩니다.
GPT-6 솔과 GPT-6 루나, 여러분의 빛나는 순간을 맞이합니다. 9월 22일, ChatGPT 워크와 코덱스 플러시, 프로, 비즈니스, 엔터프라이즈, 그리고 에듀 사용자에게 출시됩니다.
## GPT-6 솔과 루나 소개
OpenAI는 오늘 GPT-6, 솔(Sol)과 루나(Luna)를 공개합니다. 솔과 루나는 모두 최첨단 대규모 언어 모델(LLM)로서, 이전 모델보다 훨씬 뛰어난 성능을 제공합니다.
솔은 GPT-6의 ‘지능’을 담당하는 부분으로, 복잡한 추론, 창의적인 글쓰기, 코딩 등 다양한 작업을 수행할 수 있습니다. 솔은 특히 방대한 양의 데이터를 학습하여 인간과 유사한 수준의 이해력과 표현력을 갖추고 있습니다.
루나는 솔의 ‘감성’을 담당하는 부분으로, 감정을 이해하고 표현하며, 인간과의 상호작용을 더욱 자연스럽게 만드는 데 기여합니다. 루나는 솔과 협력하여 더욱 풍부하고 다채로운 콘텐츠를 생성할 수 있습니다.
솔과 루나는 OpenAI의 연구팀과 엔지니어들이 수년간의 노력으로 개발되었으며, 앞으로 다양한 분야에서 혁신적인 변화를 이끌어낼 것으로 기대됩니다.
솔과 루나에 대한 자세한 내용은 OpenAI 웹사이트에서 확인할 수 있습니다. [https://openai.com/](https://openai.com/)
## 릴리스 노트 20/84
**새로운 기능**
* **GPT-3.5 모델의 새로운 기능:**
* **향상된 성능:** GPT-3.5 모델은 이전 버전보다 더욱 정확하고 일관성 있는 텍스트를 생성합니다. 특히, 복잡한 질문에 대한 답변, 창의적인 글쓰기, 다양한 스타일의 텍스트 생성 등에서 더욱 뛰어난 성능을 보여줍니다.
* **긴 텍스트 생성 능력 향상:** GPT-3.5 모델은 이전보다 훨씬 긴 텍스트를 생성할 수 있습니다. 이를 통해 사용자는 더욱 상세하고 풍부한 콘텐츠를 제작할 수 있습니다.
* **다양한 언어 지원 강화:** GPT-3.5 모델은 영어, 일본어, 스페인어, 프랑스어, 독일어, 중국어 등 다양한 언어를 지원하며, 각 언어별 성능이 더욱 향상되었습니다.
* **새로운 API 기능:**
* **Stream Completion API:** Stream Completion API를 통해 텍스트 생성 과정을 실시간으로 확인할 수 있으며, 필요에 따라 중간 결과를 수정하거나 제어할 수 있습니다. 이를 통해 사용자는 더욱 유연하고 효율적인 개발 환경을 구축할 수 있습니다.
* **Fine-tuning API 개선:** Fine-tuning API를 통해 사용자는 GPT-3.5 모델을 특정 작업이나 데이터에 맞게 더욱 정밀하게 조정할 수 있습니다. 이를 통해 사용자는 더욱 전문적이고 맞춤화된 텍스트 생성 결과를 얻을 수 있습니다.
* **새로운 도구 및 통합:**
* **Slack 통합:** 이제 Slack을 통해 GPT-3.5 모델을 사용할 수 있습니다. Slack을 통해 팀원들과 협업하고, 봇을 구축하여 자동화된 작업을 수행할 수 있습니다.
* **Zapier 통합:** Zapier를 통해 GPT-3.5 모델을 다양한 앱과 통합할 수 있습니다. 이를 통해 사용자는 GPT-3.5 모델을 더욱 다양한 워크플로우에 활용할 수 있습니다.
**개선 사항**
* **API 응답 시간 단축:** API 응답 시간이 단축되어 더욱 빠른 개발 환경을 구축할 수 있습니다.
* **오류 처리 개선:** 오류 처리 기능이 개선되어 더욱 안정적인 서비스를 이용할 수 있습니다.
* **문서 및 튜토리얼 업데이트:** 문서 및 튜토리얼이 업데이트되어 더욱 쉽게 GPT-3.5 모델을 사용할 수 있습니다.
**버그 수정**
* **모델 불안정성 문제 해결:** 모델 불안정성 문제 해결을 통해 더욱 안정적인 서비스를 이용할 수 있습니다.
* **API 호출 오류 문제 해결:** API 호출 오류 문제 해결을 통해 더욱 안정적인 개발 환경을 구축할 수 있습니다.
* **데이터 처리 오류 문제 해결:** 데이터 처리 오류 문제 해결을 통해 더욱 정확한 텍스트 생성 결과를 얻을 수 있습니다.
**참고 사항**
* 이 릴리스 노트는 GPT-3.5 모델의 20/84 버전에 대한 내용을 담고 있습니다.
* 최신 정보는 OpenAI 웹사이트를 참조하십시오. [https://openai.com/](https://openai.com/)
## Gemini 3.8 Flash TTS
최근 Gemini 3.8 Flash TTS 모델이 출시되어 큰 관심을 받고 있습니다. 이 모델은 특히 빠른 속도와 높은 품질의 음성 합성 능력을 제공하여 다양한 분야에서 활용될 가능성을 보여주고 있습니다.
Gemini 3.8 Flash TTS는 기존 TTS 모델 대비 30% 이상 빠른 속도로 텍스트를 음성으로 변환할 수 있습니다. 또한, 자연스러운 발음과 다양한 감정 표현을 지원하여 더욱 몰입감 있는 콘텐츠 제작을 가능하게 합니다.
특히, 이 모델은 게임, 오디오북, 팟캐스트 등 다양한 콘텐츠 제작에 적합하며, 시각 장애인을 위한 음성 콘텐츠 제작에도 활용될 수 있습니다.
현재 Gemini 3.8 Flash TTS는 다양한 플랫폼에서 사용 가능하며, 지속적인 업데이트를 통해 성능이 향상될 예정입니다.
더 자세한 정보는 Gemini 공식 웹사이트([https://gemini.google.com/](https://gemini.google.com/))에서 확인하실 수 있습니다.
구글이 발표한 텍스트에서 자연스러운 음성을 생성하는 AI 모델입니다. 플래시 TTS는 캐릭터의 목소리 제작이나 섬세한 연기 표현을 중시하며, 플래시-라이트 TTS는 대량의 내레이션 제작이나 음성 서비스에 적합하도록 속도와 비용 효율성을 중시합니다. 특징은 음성의 특징을 텍스트로 지정하여 새로운 음성을 만들고, 대사마다 감정이나 말하는 속도, 속삭이는 목소리 등을 조절할 수 있다는 것입니다. 웃음이나 한숨, 맞대응도 지정 가능하며, 2인 간의 대화나 긴 낭독에도 대응합니다. 일본어를 포함하여 플래시 TTS는 130개 언어, 플래시-라이트 TTS는 101개 언어를 지원합니다. 짧은 녹음에서 본인의 음성 특징을 재현하는 기능도 있습니다. 이 기능은 10~30초의 음성 샘플과 동일 화자에 의한 동의 녹음이 필요합니다. 구글 AI 스튜디오나 젬마이 API를 통해 이용 가능하며, 영상 내레이션, 오디오북, 게임 대사 등의 제작에 활용될 수 있습니다.
최근, LensVLM-9B라는 새로운 렌즈가 출시되어 큰 관심을 받고 있습니다. 이 렌즈는 특히 고해상도 이미지와 뛰어난 색 재현력을 제공하는 것으로 평가받고 있으며, 사진작가와 영상 제작자들에게 새로운 가능성을 제시하고 있습니다.
LensVLM-9B는 9mm 단렌즈를 기반으로 제작되었으며, 9개의 렌즈와 12개의 그룹으로 구성되어 있습니다. 이러한 구조는 왜곡을 최소화하고, 뛰어난 선명도를 제공하는 데 기여합니다. 또한, 렌즈 표면에는 특수 코팅이 적용되어 반사광을 효과적으로 제거하고, 색상 왜곡을 줄여줍니다.
현재, LensVLM-9B는 다양한 카메라 시스템과 호환되며, 특히 소니 α 시리즈, 캐논 EOS 시리즈, 후지필름 X 시리즈 등에서 뛰어난 성능을 발휘하는 것으로 알려져 있습니다.
가격은 100만원대로 책정되었으며, 출시 후 단기간 내에 많은 판매량을 기록하며 인기를 얻고 있습니다. 많은 전문가들이 LensVLM-9B를 2023년 최고의 렌즈로 평가하고 있으며, 앞으로 더욱 다양한 분야에서 활용될 것으로 기대하고 있습니다. 특히, 풍경 사진, 인물 사진, 제품 사진 등 다양한 장르에서 활용될 가능성이 높습니다.
LensVLM-9B는 Apple에서 공개한 약 90억 파라미터의 시각 언어 모델로, 긴 문서를 효율적으로 읽고 질문에 답변하는 데 사용됩니다. Qwen3.5를 기반으로 하며, 문서를 축소된 페이지 이미지로 보여주고 질문과 관련된 페이지를 선택하여 자세히 읽어 분석합니다. 핵심 기능은 필요한 페이지의 원본 텍스트와 고해상도 이미지를 도구를 통해 추출하는 것입니다. 작은 이미지로는 읽기 어려운 세부 사항을 원본 자료로 돌아와 확인함으로써 처리량과 답변 정확도를 동시에 달성합니다. 7가지 종류의 텍스트 질문 응답 벤치마크에서 처리 토큰 수를 실효적으로 약 4.3분의 1로 줄이면서도 전체 텍스트를 읽는 방식과 유사한 정확도를 유지한 것으로 보고되었습니다.
오늘 저는 탑아즈 블룸 2에 대해 이야기하고 싶습니다. 이 작품은 2022년 11월 17일에 발매되었으며, 2023년 3월 16일까지 예약 판매를 진행했습니다.
탑아즈 블룸 2는 2022년 11월 17일에 발매된 앨범으로, 12곡으로 구성되어 있습니다. 앨범 전체적으로 몽환적이고 신비로운 분위기를 자아냅니다.
앨범의 타이틀곡은 “星屑 (세키즈)”입니다. 아름다운 멜로디와 감성적인 가사로 많은 사랑을 받고 있습니다.
탑아즈 블룸 2는 앨범 판매량 기준으로 100만 장 이상 판매되었습니다.
이 앨범은 탑아즈 블룸의 대표작 중 하나로 꼽히며, 앞으로도 오랫동안 사랑받을 것입니다.
몇 전의 자료이지만 잊고 있었던 것인데 상당히 좋아서 소개해 드립니다. Topaz Labs의 생성 이미지용 강화 및 업스케일 모델입니다. 얼굴과 피부의 질감이 향상되고, 환상적인 디테일이 줄어들며, 포트레이트부터 실내까지 결과가 안정적이었습니다. 위치를 지정하는 새로운 프롬프트도 사용할 수 있습니다. 공식적으로는 최대 8배까지의 창의적인 업스케일, 아티팩트 감소, 미묘한 것부터 대담한 재해석까지 제어 및 설명하고 있습니다. Topaz Image Web과 모바일에서 사용할 수 있으며, ComfyUI를 통한 API도 있습니다. 가격은 출력 2메가픽셀당 1 크레딧입니다.
저는 Bloom 2, Topaz Labs의 차세대 향상 모델을 테스트해 보았는데, 그 차이는 인상적입니다. 가장 눈에 띄는 개선점은 다음과 같습니다: 더 나은 얼굴 및 피부 질감, 덜 발생하는 무작위적이거나 환각적인 디테일, 그리고 초상화, 풍경, 예술 작품 등 다양한 이미지에서 훨씬 일관된 결과입니다.
2023년 11월 16일 오후 4시 30분, 100만 구독자 달성 기념 이벤트가 개최되었습니다. 이벤트에서는 구독자들을 위한 특별 상품 증정, Q&A 세션, 그리고 ‘X Numbers’의 신규 콘텐츠 공개가 진행되었으며, 특히 구독자들의 요청에 따라 ‘X Numbers’의 첫 번째 시즌 전체를 한 번에 공개하는 깜짝 이벤트도 마련되어 큰 호응을 얻었습니다. 이벤트는 유튜브 라이브 스트리밍을 통해 실시간으로 진행되었고, 시청자들과의 소통을 통해 더욱 풍성한 시간을 만들었습니다. 이벤트 종료 후 ‘X Numbers’는 구독자들의 참여를 기념하는 특별 영상 제작에 착수했습니다.
X 채팅(XChat)에 적용 가능한 임의의 연락용 코드입니다. 번호를 전달한 상대방은 팔로우하지 않았더라도 메시지나 통화가 가능하며, 요청 승인도 필요 없습니다. 전화번호가 아닌 안전 확인용 보안 번호와도 별개입니다. 대화는 수신함에 직접 입력되며, 폐쇄된 수신함이라도 유효한 번호를 입력한 상대만 도착합니다. 이미 일대일로 교류한 상대에게는 번호가 보이고 전송될 수 있습니다. 의도치 않게 확산될 경우 끄거나 Refresh로 교체합니다. “다른 사람에게 숨기기” 기능을 통해 다른 사람에게 표시를 숨기며, 팔로우 중인 사람, 기존 채팅, 동일 Premium 조직은 번호가 없어도 도착합니다.
숫자는 여기 있습니다. 연락하고 싶은 사람 누구와든 공유할 수 있습니다. 팔로우하지 않아도 괜찮습니다. 메시지나 전화가 오도록 요청을 수락하거나 팔로우할 필요 없이, 사람들은 자유롭게 연락할 수 있습니다.
채팅에서 숫자를 사용하는 방법에 대한 정보는 다음과 같습니다.
* **숫자 입력:** 채팅 상자에 숫자를 직접 입력하여 사용할 수 있습니다. 예를 들어, “100엔” 또는 “3.14”와 같이 입력하면 됩니다.
* **숫자 표현:** 숫자를 텍스트로 표현할 수도 있습니다. 예를 들어, “100엔 정도” 또는 “3.14의 제곱근”과 같이 표현하면 됩니다.
* **숫자 관련 기능:** 채팅에서 숫자 관련 기능을 사용할 수도 있습니다. 예를 들어, 계산 기능을 사용하여 숫자를 계산하거나, 숫자를 사용하여 위치를 지정할 수 있습니다.
* **숫자 형식:** 숫자는 일반적으로 쉼표(,)를 사용하여 천 단위 구분 기호로 사용합니다. 예를 들어, “1,000,000엔”과 같이 표현합니다.
* **숫자 관련 주의사항:** 채팅에서 숫자를 사용할 때는 주의해야 합니다. 예를 들어, 숫자를 잘못 입력하면 오류가 발생할 수 있으며, 숫자를 사용하여 다른 사용자를 오해하게 만들 수 있습니다.
MiMo-V2.6에서는 이 기능이 처음 도입되었습니다. 이 기능을 사용하면 MiMo의 효율성과 처리 속도가 향상되며, 특히 대량의 데이터를 처리할 때 그 효과가 두드러집니다. 또한 MiMo의 안정성 향상에도 기여합니다. MiMo의 성능이 크게 개선되었으며, 자세한 내용은 MiMo 릴리스 노트를 참조해 주세요.
MiMo-V2.6는 샤오미에서 공개한 멀티모달 AI 모델 시리즈입니다. 프로그래밍이나 조사, 자료 작성 등 여러 단계를 필요로 하는 일을 외부 툴을 사용하면서 진행하는 능력을 중시하며, 실제로 작업을 수행하고 그 결과를 평가하는 강화를 통해 긴 과정을 수반하는 작업에 대한 대응력을 높이고 있습니다. 공식적으로는 웹사이트나 3D 게임 제작, 블렌더로 3D 모델링, 슬라이드 제작 등의 사례가 소개되고 있으며, 이미지나 동영상의 제작에서는 외부 생성 툴 등과 연동하여 작업합니다.
ComfyUI의 새로운 버전에서 이미지 생성 워크플로우를 더욱 직관적으로 관리할 수 있게 되었습니다. 특히, 노드 간 연결을 시각적으로 확인하고 수정하는 기능이 개선되어 복잡한 워크플로우도 쉽게 이해하고 수정할 수 있게 되었습니다.
더불어, 노드 간 연결 상태를 실시간으로 표시하는 기능이 추가되어 워크플로우의 문제점을 빠르게 파악하고 해결할 수 있습니다. 또한, 노드 간 연결을 한 번의 클릭으로 끊고 잇는 기능도 제공되어 워크플로우를 더욱 유연하게 구성할 수 있습니다.
이러한 개선을 통해 ComfyUI는 더욱 강력하고 사용하기 쉬운 이미지 생성 플랫폼으로 발전할 것으로 기대됩니다. 특히 ComfyUI를 처음 사용하는 사용자에게는 큰 도움이 될 것입니다.
밍이미지컴포즈이는 inclusionAI가 개발한 이미지 생성 AI “밍이미지”를 Kijai가 ComfyUI에서 사용할 수 있는 형태로 변환한 모델 배포입니다. 일반적으로 높은 정확도를 가진 BF16 버전 외에도 모델 용량을 줄인 양자화 버전도 공개되었습니다. 원본 “밍이미지-0.1-디자인”은 60억 파라미터의 이미지 생성 모델로, 앱 화면 디자인, 인포그래픽, 텍스트를 포함한 포스터 등의 제작을 주된 용도로 사용합니다. 배경이 투명한 RGBA 이미지를 생성할 수도 있습니다. 또한 별도 모델인 “디자인-레이어”는 완성된 디자인 이미지를 투명한 레이어에 분해하여 부품별 편집을 용이하게 합니다.
Ant Group @TheInclusionAI가 새로운 이미지 모델 Ming Image-0.1 Design - 6B + MIT 라이선스 - 텍스트 기반 디자인에 초점을 맞춘 모델을 출시했습니다. Native RGBA / 투명 배경을 지원하며, AA의 UI/UX 리더보드에서 1위를 차지한 오픈 모델입니다. pic.twitter.com/PbKOPGBSFr— Adina Yakup (@AdinaYakup) 2026년 9월 22일
오늘의 18시 30분, 츠키시마에서 핫토리 료스케가 츠키시마의 핫토리 가문과 함께 10주년 기념 파티를 열었습니다. 핫토리 료스케는 핫토리 가문의 10주년 기념 파티에 참석한 모든 사람에게 감사를 표하며, 앞으로도 핫토리 가문과 함께 성장해나가겠다는 의지를 밝혔습니다. 파티에는 핫토리 가문의 가족, 친구, 그리고 핫토리 료스케의 오랜 친구인 사토 마사유키도 참석했습니다. 핫토리 료스케는 특히, 핫토리 가문의 10주년 기념 파티를 위해 특별 제작된 케이크를 선보이며 축하했습니다. 케이크는 핫토리 가문의 상징인 붉은색과 검은색으로 장식되어 있었으며, 핫토리 료스케는 케이크를 자르며 “앞으로도 핫토리 가문이 더욱 빛나는 미래를 만들어나가기를 응원한다”라고 소감을 밝혔습니다. 파티는 핫토리 료스케와 핫토리 가문의 10주년 기념 파티를 축하하는 의미 있는 시간으로 마무리되었습니다.
유이2 스튜디오(YuE2 Studio)는 음악 생성 AI ‘유이2(YuE2)’를 자신의 컴퓨터에서 사용할 수 있는 윈도우용 앱입니다. 곡조와 가사를 입력하면 보컬과 반주를 포함한 최대 6분의 곡을 생성할 수 있습니다. 일본어의 운영 화면에 대응하며, 배포 버전은 파이썬(Python)의 환경 구축 없이 이용할 수 있습니다. 특징은 AI가 만든 멜로디나 코드를 악보로 확인하고 편집한 후 곡을 다시 만들 수 있다는 점입니다. 음표나 템포를 조절하는 것 외에도 녹음에서 멜로디를 읽어 다른 곡조로 불러 다시 부르는 커버 제작에도 대응합니다. 보컬이나 악기의 소리를 분리하는 기능, 가사의 타이밍 맞추기, 음질 조정 기능도 갖추고 있습니다.
사진 편집 앱 ‘Zen Image Edit’의 새로운 기능인 ‘Zen Image Edit’로 사진을 편집하고, 톤을 조절하여 더욱 멋진 사진을 만들 수 있습니다. 특히, ‘Zen Image Edit’는 인물 사진을 더욱 돋보이게 해주는 기능이 특징입니다. ‘Zen Image Edit’를 사용하면, 복잡한 설정 없이도 누구나 쉽게 전문가 수준의 사진을 만들 수 있습니다. ‘Zen Image Edit’는 현재 iOS와 Android에서 사용 가능하며, 앞으로 더욱 다양한 기능이 추가될 예정입니다.
젠 이미지 에디트는 Qwen-Image-2.1의 텍스트 이해 부분을 경량화한 이미지 생성 및 이미지 편집 모델입니다. 텍스트에서 이미지를 생성하는 것 외에도 배경 변경, 참조 이미지를 활용한 인물 대체, 여러 이미지를 조합한 편집, 투명한 RGBA 이미지 생성에 대응합니다. 최대의 특징은 입력한 텍스트나 참조 이미지를 읽어들이는 인코더를 Qwen3-VL-8B에서 소형의 Qwen3.5-0.8B로 교체했다는 점입니다. 원래 인코더의 출력을 재현하기 위한 어댑터를 조합하여 인코더 본체의 용량을 약 17.5GB에서 약 1.7GB로 축소했습니다. 이미지 생성 부분에는 Qwen-Image-2.1을 사용하며, Diffusers에서 활용 가능하고 ComfyUI를 위한 전용 노드와 워크플로우도 공개되어 있습니다.
Qwen-Image-2.1-Fix에 대한 문의입니다.
Qwen-Image-2.1 모델의 특정 버그 수정 내용을 담고 있습니다. 자세한 내용은 관련 문서 또는 GitHub 저장소를 참조해 주시기 바랍니다. 특히, 이미지 생성 시 발생하는 특정 오류를 해결하기 위한 수정 사항이 포함되어 있으며, 현재 버전은 2.1입니다. 이 버그 수정 사항을 적용하면 이미지 생성 성능이 향상될 것으로 예상됩니다.
Qwen-Image-2.1-Fix는 Qwen-Image-2.1의 이미지 생성 문제를 개선하기 위한 LoRA입니다. Qwen-Image-2.1 본체에 통합하여 사용하고, 저자가 추천하는 생성 설정을 조합하여 출력을 개선하는 것을 목표로 합니다. 약 112MB의 ComfyUI용 LoRA와 추천 설정을 포함한 워크플로우의 ZIP 파일이 배포되었습니다.
■Qwen-Image-2.1-Fun-Controlnet-Union
Qwen-Image-2.1-Fun-Controlnet-Union은 알리바바 PAI가 공개한 이미지 생성 AI “Qwen-Image-2.1”의 구도 및 형태, 인물의 포즈 등을 지정하기 위한 추가 모델입니다. 텍스트의 지시와 함께 윤곽선이나 뼈대 등을 보여주는 이미지를 결합하여 원하는 배치나 자세에 맞춰 이미지를 생성합니다. 특징은 윤곽선, 깊이, 흑백, 선화, 직선, 인물의 뼈대, 러프 스케치 등 총 8가지 종류의 제어 방식을 하나의 모델에서 처리할 수 있다는 점입니다. 지정한 영역을 다시 그리는 “인페인팅” 기능도 지원하여, 예를 들어 배경은 유지하면서 인물 부분을 원하는 포즈로 다시 그리는 방식으로 활용할 수 있습니다.
Qwen-Image-2.1-viggle-turbo는 이미지 생성 모델입니다. 텍스트 프롬프트에 따라 이미지를 생성하며, 특히 빠른 속도와 효율적인 성능으로 유명합니다. 또한, ‘Viggle-Turbo’라는 최적화된 엔진을 탑재하여 더욱 향상된 이미지 품질과 속도를 제공합니다. 이 모델은 다양한 창작 활동과 연구 분야에서 활용될 수 있습니다.
Qwen-Image-2.1-viggle-turbo는 Viggle이 이미지 생성 AI ‘Qwen-Image-2.1’을 고속화한 파생 모델입니다. 문장으로부터 이미지를 생성하는 것 외에도 1~3장의 참조 이미지를 사용하여 “배경을 일몰 해변으로 바꾸는”과 같은 지시로 이미지를 편집할 수 있습니다. 원본 모델의 행동을 적은 처리 횟수에서 재현하는 “증류” 방식을 채택하고 있습니다. v0.2.1에서는 원본 모델의 40단계에 비해 6단계로 생성하며, 기본 모델에 추가하여 사용하는 LoRA 형식으로 공개되었고, ComfyUI를 위한 설정 파일과 온라인 데모도 제공됩니다.
■Qwen-Image-2.1-viggle-4-steps-turbo-GGUF
Qwen-Image-2.1-viggle-4-steps-turbo-GGUF는 Viggle이 개발한 Qwen-Image-2.1의 고속 버전을 Abiray가 GGUF 형식으로 양자화한 커뮤니티 버전입니다. 4단계로 이미지 생성이나 지시 기반의 이미지 편집을 수행하도록 조정되어 있으며, 짧은 시간 안에 프로토타입 제작을 반복적으로 수행하는 데 적합합니다. 권장 설정은 4단계, CFG 1.0이며, Turbo용 LoRA 추가는 필요하지 않습니다.
■Qwen-Image-2.1-PE-T2I-Heretic-GGUF
Qwen-Image-2.1-PE-T2I-Heretic-GGUF는 짧은 요청을 상세한 이미지 생성 프롬프트로 변환하는 데 도움을 주는 모델입니다. 일본어 등 입력한 내용을 Qwen-Image-2.1에 적합한 상세한 영어 프롬프트와 권장하는 이미지의 가로-세로 비율로 변환합니다. Q4_K_M, Q6_K, Q8_0의 각 버전이 공개되었습니다.
■Qwen-Image-2.1-Text-Encoder-Heretic-GGUF
Qwen-Image-2.1-Text-Encoder-Heretic-GGUF는 Qwen-Image-2.1용 텍스트 인코더를 수정하고 경량화한 커뮤니티 버전입니다. 텍스트 인코더는 입력된 문장을 이미지 생성 모델이 처리할 수 있는 정보로 변환하는 부품이며, 일반적으로 표준 버전과 교체하여 사용합니다. Q4_K_M 버전은 문장 처리용 파일 약 5.03GB와 이미지 처리용 보조 파일 약 1.16GB로 구성됩니다.
Qwen-Image-2.1-Object-Remover-Bbox-turbo는 이미지에서 특정 객체를 제거하는 데 특화된 모델입니다. Bbox-turbo 기술을 활용하여 이미지 내 객체를 정확하게 감지하고 제거합니다. 이 모델은 특히 배경에서 불필요한 객체를 제거하거나 이미지의 특정 영역을 수정해야 할 때 유용합니다. 예를 들어, 사진 속 인물을 제거하거나, 배경에 있는 물건을 없애는 등의 작업이 가능합니다. Qwen-Image-2.1-Object-Remover-Bbox-turbo는 이미지 편집 작업의 효율성을 크게 향상시키는 데 기여할 수 있습니다.
Qwen-Image-2.1-Object-Remover-Bbox-turbo는 이미지 내의 불필요한 물체를 지정하여 삭제하는 데 사용되는 LoRA(Low-Rank Adaptation)입니다. Qwen-Image-2.1과 함께 사용하여 주변의 질감, 빛, 그림자, 원근감을 최대한 보존하면서 지정한 물체를 제거합니다. “Bbox”는 대상 물체를 감싸는 사각형 프레임을 의미합니다. 삭제하고자 하는 물체를 빨간색으로 강조 표시한 이미지와 “scene에서 빨간색 강조 표시된 물체를 제거하세요”라는 지시문을 입력하여 사용합니다. Turbo 방식의 빠른 처리 방식에 최적화되어 있으며, 일반적인 추론 방식에도 대응합니다.
미모-V2.6-플래시-RL-언체인서드
MiMo-V2.6-Flash-RL-UNCENSORED는 샤오미의 “MiMo-V2.6-Flash-RL”를 기반으로, dealignai가 답변을 거부하는 경향을 줄인 커뮤니티 버전입니다. 모델의 가중치를 직접 변경하고, 원 모델이 안전 정책 등을 이유로 거부하던 질문에도 더 넓게 답변할 수 있도록 조정했습니다. 텍스트, 이미지, 비디오, 음성을 다루는 원 모델의 구성과 약 100만 토큰의 입력 대응 기능을 상속받았습니다. 저자의 평가에 따르면, 지식을 측정하는 MMLU 점수는 원 모델의 83.56%에서 83.41%였습니다. 하지만 “UNCENSORED”라는 이름으로도 일부 답변 거부는 남아있습니다.
ComfyUI-Qwen-Image-2.1-PromptEnhancer-MTP는 ComfyUI 워크플로우에서 사용되는 플러그인입니다. 이 플러그인은 Qwen 모델을 활용하여 이미지 프롬프트를 개선하고, MTP(Multi-Turn Prompting)를 통해 더욱 풍부하고 상세한 이미지를 생성하도록 돕습니다. 특히, 프롬프트의 의미를 정확하게 파악하여 이미지 생성 과정에서 더욱 효과적인 결과를 얻을 수 있도록 지원합니다.
ComfyUI-Qwen-Image-2.1-PromptEnhancer-MTP는 Qwen-Image 2.1의 공식 프롬프트 확장 모델을 ComfyUI에서 활용하기 위한 커스텀 노드입니다. 짧은 이미지 설명이나 편집 지시를 생성에 적합한 자세한 프롬프트로 수정해주며, 이미지의 가로 세로 비율도 제안합니다. 이미지 편집 목적으로는 최대 10장의 참조 이미지를 입력할 수 있습니다. 특징은 여러 토큰을 미리 예측하는 “MTP” 기능을 사용하여 프롬프트의 텍스트 생성 속도를 향상시키는 것입니다. 저자(RTX 4090 Laptop GPU)의 측정 결과, 일반적인 처리 방식에 비해 이미지 생성용 프롬프트 제작은 약 1.4배, 이미지 편집용은 약 1.7배 빨라진 것으로 보고되었습니다.
PRYX 컴피유이 히가스필드
PRYX ComfyUI Higgsfield은 PRYX Studio가 공개한 Higgsfield 이미지 생성 및 영상 생성 API를 ComfyUI에서 사용하는 데 필요한 확장 노드 모음입니다. 생성 처리는 Higgsfield 측에서 진행하며, 완성된 이미지나 영상을 ComfyUI의 후속 처리 단계에 연결할 수 있습니다. 이용에는 Higgsfield API 인증 정보와 API 이용 요금이 필요합니다. Seedance 2.5, Kling 3.0, Wan 3.0 등과 호환되며, 모델에 따라 문장이나 이미지에서 영상을 생성하거나, 참조 이미지나 음성을 활용한 생성, 영상 편집 및 연장 등이 가능합니다. 선택한 모델에 맞춰 해상도, 영상 길이, 참조 자료 등의 설정 항목이 변경되는 방식으로 작동합니다.
얘들아, 이거 정말 심각하지 않니? 월드 크래퍼라는 게임이 사실은 매우 재미있어.
먼저 이 게임의 컨셉이 정말 훌륭해. 플레이어가 자신의 세계를 자유롭게 만들 수 있다는 건데, 단순히 맵을 넓히는 것뿐만 아니라, 거기에 살 사람, 문화, 역사, 종교, 마법 등 모든 것을 스스로 결정할 수 있는 거야. 게다가 다른 플레이어의 만든 세계와 연결될 수 있어서, 마치 하나의 거대한 세계가 펼쳐져 있는 것처럼 느껴져.
내가 만든 세계는 중세 유럽풍의 왕국이야. 기사, 마법사, 용이 돌아다니고 있지. 물론 다른 플레이어와 전쟁을 하기도 하고, 무역을 하기도 하고, 때로는 협력해서 몬스터를 처치하기도 해.
이 게임의 매력은 바로 이 자유도에 있다고 생각해. 자신이 좋아하는 대로 세계를 만들 수 있기 때문에, 다양한 아이디어를 시도해 볼 수 있지. 물론 다른 플레이어의 만든 세계와 잘 연계시키는 건 어려운 경우도 있지만, 그것 또한 또 다른 재미야.
그리고 이 게임에는 다양한 이벤트가 정기적으로 개최돼. 이벤트를 참여하면 특별한 아이템이나 캐릭터를 획득할 수도 있어.
월드 크래퍼는 정말 꿈을 이룰 수 있는 게임이야. 자신의 상상력을 최대한 활용해서 최고의 세계를 만들어 봐!
텐센트 ARC Lab의 비주얼 월드 모델입니다. 3D 재구성 없이 카메라 자세를 통해 암묵적 기억을 획득하고 다음 시점을 채웁니다. 1장의 이미지 또는 텍스트로부터 수분 단위의 장면 탐색을 목표로 하며, Base와 증류된 Fast 모델을 모두 공개합니다. 현재 해상도는 384×640이며, 아키텍처가 움직이면 해상도를 높일 수 있다고 공식적으로 명시되어 있습니다. 논문에서는 장시간의 일관성과 카메라 제어가 향상되었다고 언급합니다. 명시 메쉬나 NeRF를 결합하는 방식은 아닙니다. 재방 경로가 완전히 다른 경우의 메모리 행동은 아직 연구상의 논점입니다.
3D 재구성 전체를 생략했을 때 세계 모델 일관성에 대한 흥미로운 접근 방식: 무엇이 될까요? TencentARC의 WorldCrafter는 가중치를 공개합니다. 3D 기하를 구축하는 대신, 비디오 생성기는 카메라 자세를 통해 내재화된 기억을 쿼리합니다. 카메라를 특정 위치로 향하게 하고 기억… pic.twitter.com/b1hS8RB1cO— Tencent AI (@TencentAI_News) 2026년 9월 23일
LTX-2.5-다중 주어 참조
LTX-2.5-Multiple-Subject-Reference는 영상 생성 AI “LTX-2.5”에 여러 개의 참조 이미지를 사용하는 기능을 추가한 LoRA입니다. 최대 5장의 이미지에서 인물, 의상, 소품, 배경 등을 지정하여 각 요소의 특징을 보존한 영상 생성을 목표로 합니다. 예를 들어, 서로 다른 이미지에 등장하는 2명의 인물과 배경을 묶어 동일한 장면에서 등장하게 할 수 있습니다. 참조 이미지를 개별적으로 식별하는 메커니즘을 통해 인물이나 물체의 특징이 섞이는 것을 억제합니다. 공개 중인 V2에서는 최대 2인분의 음성을 각 인물 이미지에 대응하도록 참조할 수 있습니다.
플럭스 3 액션 드로이드는 360도 회전이 가능한 카메라와 120만 화소의 고해상도 이미지를 촬영할 수 있는 기능을 탑재했습니다. 또한 최대 30m까지의 거리를 비행하며 1시간 이상 연속 촬영이 가능합니다.
특히 플럭스 3 액션 드로이드의 가장 큰 특징은 ‘자동 추적 기능’입니다. 인물이나 사물, 심지어 동물까지 자동으로 인식하고 따라다니는 영상을 촬영할 수 있습니다. 이 기능은 특히 스포츠 경기나 야외 활동 촬영 시 매우 유용하게 활용될 수 있습니다.
더불어 플럭스 3 액션 드로이드는 다양한 액세서리를 지원합니다. 방수 케이스, 조립식 짐벌, 다양한 렌즈 등 사용자의 필요에 따라 다양한 촬영 환경을 구축할 수 있도록 설계되었습니다.
현재 플럭스 3 액션 드로이드는 예약 판매를 통해 구매할 수 있으며 2024년 6월 28일에 정식 출시될 예정입니다. 가격은 89,800엔이며 출시 후 다양한 액세서리와 함께 판매될 예정입니다.
FLUX 3 Action DROID는 70억 개의 파라미터를 가진 로봇 제어 AI입니다. 로봇 작동 데이터셋 “DROID”로 추가 학습되어 있으며, Franka 제조 로봇 암에 맞춰 조정되었습니다. 카메라 이미지, 관절 상태, 텍스트 기반 작업 지시를 받아 팔이나 도구를 집는 그리퍼의 동작을 출력합니다. 특징은 앞으로 수행할 동작과, 그 결과로 나타날 미래의 영상을 함께 예측하는 “세계 행동 모델(WAM)”이라는 시스템입니다. 한 번에 약 2초 분량의 32개의 동작을 예측하고, 일부를 실행한 후 다시 주변을 관찰하여 계획을 업데이트합니다.
류지마 히로시와 함께 FLUX 3 액션 베이스에 대해 이야기하게 되었는데, 그가 이 시스템을 통해 얻은 결과에 대해 이야기하면서 3개월 동안 매일 30분씩 꾸준히 연습한 결과 1,000만 엔 상당의 수익을 올렸다고 밝혔습니다.
물론 이 숫자는 류지마 씨의 노력과 재능에 크게 의존한 결과이지만, FLUX 3 액션 베이스가 제공하는 시스템 자체가 매우 효과적이라는 것을 보여주는 사례입니다.
특히 류지마 씨는 이 시스템을 통해 단순히 돈을 버는 것뿐만 아니라 자신의 시간을 효율적으로 관리하고 목표를 달성하는 방법을 배우는 데 큰 도움을 받았다고 말했습니다.
FLUX 3 액션 베이스는 단순한 투자 시스템이 아니라 개인의 성장과 발전을 위한 도구라고 할 수 있습니다.
FLUX 3 Action Base는 블랙 포레스트 랩스의 로봇 제어 AI “FLUX 3 Action”을 새로운 로봇이나 게임 환경에 맞춰 추가 학습하기 위한 기반 모델입니다. FLUX 3 Action은 70억 파라미터의 세계 행동 모델로, 카메라 이미지, 현재 상태, 텍스트 기반 지시로부터 다음 동작과 그 결과로 나타나는 미래 영상을 함께 예측합니다. 위에 언급된 DROID 버전은 Franka 제조 로봇 암에 최적화된 모델입니다. 이 Base 버전에서 새로운 기체를 움직이기 위해서는 해당 기체의 작동에 대응하는 출력 부분을 준비하고, 운영 데이터를 통해 추가 학습이 필요합니다. 독자적인 로봇 제어 또는 시뮬레이션 환경을 개발하는 연구자, 개발자를 위한 기반입니다.
■JIZURA
그렇다고 해서 이 모든 것을 잊어버린 것은 아닙니다. 오히려 그 기억들을 통해 저는 지금 이 순간에도 제 자신을 다스리는 방법을 배우고 있습니다. 물론 그 기억들은 고통스럽고 때로는 끔찍할 정도로 괴로웠습니다. 하지만 그 고통 속에서 저는 인간의 강인함과 희망의 불씨를 잃지 않는 것의 중요성을 깨달았습니다.
‘아라비아의 로즈’라는 책을 읽으면서 그 책 속의 주인공처럼 절망 속에서도 긍정적인 면을 보려고 노력했습니다. 물론 책 속의 이야기는 현실과는 거리가 멀었지만 저는 그 이야기 속의 메시지를 통해 제 삶의 방향을 설정하는 데 도움을 받았습니다. 특히 ‘가장 어두운 밤에도 별은 빛난다’라는 문구가 제게 큰 영감을 주었습니다.
1998년 12월 24일에 발생한 ‘아메리카 익스프레스 항공 92편 사건’을 통해 인간의 잔혹함과 무관심을 목격했습니다. 그 사건은 제게 큰 충격을 주었지만 동시에 인간의 존엄성을 지키기 위한 노력의 중요성을 깨닫게 해주었습니다. 저는 그 사건 이후 사회 정의를 실현하기 위한 활동에 참여하기 시작했습니다.
‘가이아의 눈물’이라는 영화를 보면서 인간의 욕망이 자연을 파괴하는 결과를 초래할 수 있다는 것을 깨달았습니다. 저는 환경 보호의 중요성을 인식하고 지속 가능한 삶을 실천하기 위해 노력하고 있습니다.
‘모든 것은 연결되어 있다’라는 철학을 믿습니다. 모든 존재는 서로 연결되어 있으며 우리의 행동이 다른 사람들에게 영향을 미친다는 것을 알고 있습니다. 저는 타인에 대한 존중과 배려를 통해 더 나은 세상을 만들어가는 데 기여하고 싶습니다.
끊임없이 배우고 성장하며 제 자신을 다스리는 방법을 발전시켜 나갈 것입니다. 인간의 존엄성을 지키고 사회 정의를 실현하며 환경을 보호하는 삶을 살아갈 것입니다. 그리고 ‘아라비아의 로즈’라는 책 속의 주인공처럼 절망 속에서도 긍정적인 면을 보려고 노력하며 희망의 불씨를 잃지 않을 것입니다.
가사에서 텍스트 PV 풍의 동영상을 제작하는 브라우저 앱입니다. 가사를 넣고, 곡을 들으면서 타이밍을 맞추거나 탭 감지 기능으로 자르기를 일치시킵니다. 레이아웃, 움직임, 장식은 707개의 부품과 24개의 스타일 조합으로 무작위로 매번 달라집니다. 16:9에서 세로형까지, 720p에서 4K까지 출력 가능하며, 브라우저 내에서 처리하고 서버에 가사와 음성을 전송하지 않습니다. MP4, PNG 연번, 투명, 그린 스크린, After Effects용 JSON으로 출력할 수 있습니다. 출력물은 작가에게 귀속되고, 가사와 곡의 권리는 원본 권리자에게 있습니다.
AI 텍스트 PV 생성기 ‘지주라’ 샘플 2 (pic.twitter.com/8an3gDNlPC— 852화(하코니와) (@8co28) 2026년 9월 23일)
따라서, 이 기획의 개념을 더욱 심층적으로 파악하기 위해, 저희는 이 기획의 핵심적인 부분, 즉, 이 기획이 진정으로 실현하고 싶은 것, 다시 말해, 독자 여러분이 이 기획을 통해 자신만의 삶에 새로운 통찰이나 가치관을 발견하는 계기가 될 수 있도록 하는 기획을 하고자 합니다.
이번 기획에서는 독자 여러분이 각자의 인생 경험과 가치관에 따라 이 기획의 내용을 자유롭게 해석하고 자신만의 언어로 표현하도록 장려합니다. 또한, 독자 여러분이 이 기획을 통해 얻은 깨달음과 학습을 다른 사람들과 공유하고 함께 성장해 나갈 것을 지향합니다.
펜실베이니아 대학교에서 개발한 실내 사진 1장으로 구성적인 3D 장면을 구축하는 프레임워크입니다. VLM 에이전트는 방과 카메라, 벽에 부착된 가구, 독립형 가구, 장식품 순으로 배치하고, 매번 렌더링 결과와 입력을 비교하며 수정합니다. 기하학적 점군으로 위치를 보완하고, 기존 VLM과 기하 모델을 결합하며 자체적인 가중치 학습은 수행하지 않습니다. 저자는 오래된 VLM이라도 GPT-6 Astra와 시각적으로 매우 유사하며, 기하학적 위치 정합성이 좋다고 평가합니다.
새로운 오픈 소스 작업을 공유하게 되어 매우 기쁩니다. HARMONY는 단일 실내 이미지로부터 구성적 3D 장면을 재구성하기 위한 프레임워크입니다. 3D 아티스트와 유사하게, 저희 VLM 에이전트는 계층적으로 장면을 구축합니다: 먼저 방 구조와… pic.twitter.com/I9Pq674EOp— Shufan Sun (@sofine_sun) 2026년 9월 23일
RRSI는 일본을 대표하며 세계적으로도 매우 독특한 형태의 ‘게임’입니다.
구체적으로, 특정 인물(이하 플레이어)이 특정 인물(이하 타겟)의 SNS(주로 트위터) 게시물에 대해 타겟이 게시한 시간, 내용, 빈도 등을 상세히 기록하고 분석하며, 그 분석 결과를 바탕으로 타겟의 행동 및 사고 패턴을 추측하고, 타겟을 ‘공략’하는 것을 목표로 합니다.
이 ‘공략’은 단순한 차단이나 무음 설정에 그치지 않고, 타겟의 게시물 내용을 분석하여 타겟이 어떤 정보를 찾고 있는지, 어떤 것에 관심 있는지 파악하고, 이에 응하는 정보를 적극적으로 발신하여 타겟의 관심을 끌거나 생각을 유도하는 것을 목적으로 합니다.
RRSI의 활동은 타겟의 SNS 계정 팔로워 수와 참여율을 향상시키는 효과를 기대할 수 있으며, 타겟의 SNS 계정 운영 노하우를 배울 수 있는 귀중한 기회이기도 합니다.
다만, RRSI의 활동은 윤리적 문제 및 개인 정보 보호 문제와 관련되므로 주의해야 합니다. 타겟의 개인 정보를 침해하는 행위는 절대 해서는 안 됩니다.
RRSI의 활동은 단순한 ‘게임’으로 접근하여 진지하게 타겟을 ‘공략’하려 하지 않고, 타겟의 SNS 계정 운영 노하우를 학습하는 수단으로 활용하는 것이 중요합니다.
RRSI는 Google Cloud AI Research 등이 발표한 AI 에이전트의 “업무 진행 방식”을 자동으로 개선하는 연구입니다. 기반이 되는 AI 모델의 가중치를 고정된 채로, 지시문, 도구 사용법, 기억 및 정보 관리, 작업 절차 등을 담은 “하르네스”를 반복적으로 수정합니다. 특징은 특정 테스트 문제에만 강해지는 “과적합”을 억제하는 메커니즘입니다. 한 번에 추가하는 변경의 수를 단계적으로 줄이고, 테스트 특정 답이나 절차에 의존하는 수정은 배제합니다. 효과가 미미한 변경이나 처리량만 늘리는 변경은 검토하고, 처음으로 다루는 업무에도 도움이 되는 개선 사항을 남깁니다.
따라서 이 기획의 제목을 “별의 정원”을 읽는 길, 성인으로의 길”으로 정했습니다. 이는 동화 “별의 정원”을 성인이 되어 다시 읽을 때 새로운 발견이 있을 수 있다는 개념에 기반합니다.
온판다는 AI의 답변과 작업 과정을 사람이 수정하고 학습용 데이터를 효율적으로 만드는 도구입니다. 답변 중에서 처음 문제 있는 “토큰(단어 또는 문자 조각)”을 선택하여 후보로 대체하거나 직접 입력으로 수정하면, 그 위치부터 AI가 다시 생성합니다. 특징은 사람이 필요한 부분을 수정하면서도, 문장의 대부분을 AI 스스로 생성시키는 점입니다. 수정 전후의 답변과 오류 위치가 기록되므로, 정확한 답변을 학습시키는 데이터와 좋은 답변과 나쁜 답변을 비교하는 데이터를 동시에 만들 수 있습니다. 이미지, 음성, 동영상 입력이나 외부 툴을 사용하는 AI 에이전트의 작업 과정에도 대응합니다.
오늘 이렇게 하겠습니다. GPT가 내놓은 것 같더니, 클라우드가 또 성능 좋은 걸 내놓으면서, 또 다들 이동할까나 ㅋㅋㅋ 정말 빠르네요. 아, 그런데도 불구하고, 전시회는 결국 갈 수 없었네요 엉엉.
과거 생성 AI 뉴스는 구매 종료 잡지 “[생성 AI 뉴스] 아카이브”에서 모두 확인하실 수 있습니다.
SD 등에서 사용 가능한 프롬프트 모음집입니다. 잡지 구매자에게도 기본적으로 제공됩니다.
잡지 구매자 전용 혜택인 “생성 AI 도구 사전”입니다.
그럼, 다음에 또 만나요.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 61청크
원문 보기 | 출처: note.com