안녕하세요. 이 노트에서는 LLM, AI 그림, AI 영상, AI 음성, AI 음악 등, 관심을 갖게 된 생성 AI를 실제로 사용해보는 기록을 써나갈 예정입니다. 먼저 자기소개 겸하여, 지금까지 어떤 생성 AI에 접촉해봤는지 정리해볼게요. 생성 AI와의 만남은 NovelAI로부터 시작이었다. 2022년 10월부터 생성 AI를 본격적으로 다뤄보게 된 건 저였습니다. 계기는 NovelAI였죠. 당시 AI가 그림을 생성할 수 있다는 사실 자체가 신선했고, 실제로 만지면서 그 가능성에 점점 빠져들었습니다. 큰 전환점은 2023년 2월이었죠. OrangeMixs에서 생성된 그림을 보고 충격을 받았고, “나도 AI 이미지 생성을 해보고 싶다”라고 생각하여 그에 필요한 PC를 구매했습니다. Stable Diffusion 1.5부터 시작하여 Anything, SDXL, Animagine, Pony, Illustrious 등 그 때 그때 등장하는 새로운 모델을 쫓아왔습니다. 배포되는 모델을 사용하는 것뿐만 아니라, 모델의 병합을 포함하여 궁금한 점은 다양하게 시도했습니다. 현재는 Anima 계열 모델을 중심으로 사용하고 있습니다. 현재 사용 중인 PC 현재 주요 PC 사양은 다음과 같습니다. Windows 11 Home 64비트 운영체제는 꽤 오래된 버전입니다. 2023년 기준으로 Windows 11의 최신 버전인 Windows 11 22H2가 출시되었고, 23H2 버전도 이미 업데이트되었습니다. 64비트 운영체제는 현대적인 애플리케이션을 실행하는 데 적합하지만, 최신 기능이나 보안 업데이트를 받기 위해서는 업그레이드를 고려하는 것이 좋습니다. 혹시 Windows 11로 업그레이드하는 데 어려움이 있으시다면, Microsoft에서 제공하는 업그레이드 가이드를 참고하시거나, 전문가의 도움을 받는 것을 추천합니다. CPU: 인텔 코어 i7-13700F (16코어/24스레드) GPU:NVIDIA GeForce RTX 3060 VRAM:12GB 메모리: 32GB 저장 용량: 약 6TB (2TB + 4TB) AI 이미지, 영상, 음성 등의 로컬 생성은 기본적으로 이 PC에서 시도하고 있습니다. ChatGPT와 Claude, 그리고 Codex에 대해 LLM은 2023년 3월부터 ChatGPT를 사용하기 시작했습니다. 같은 해 5월쯤부터는 Claude를 사용하기 시작했으며, 조사나 글쓰기뿐만 아니라 프로그램 제작, 장시간 작업을 진행하기 위한 조언을 구하는 대상으로서 활용해왔습니다. 2026년에는 약 2개월 동안 Rinna-3.6B를 활용한 AI VTuber 제작에 도전하기도 했습니다. 유튜브의 댓글에 반응해서 말하는 모습은 구현할 수 있었지만, AI에게 자발적인 대화를 이끌어내는 부분에서는 늘 제가 만족할 만한 결과물을 만들지 못해 결국에는 포기하게 되었습니다. 이 제작 기간 동안에는 ChatGPT나 Claude의 이용 제한에 여러 번 걸려 끊임없이 시도와 오류를 반복했습니다. 원하는 대로 움직이지 않을 때마다 지시를 바꿔, 작업을 세분화하고, 긴 과정을 AI에게 맡기기 위한 프롬프트를 재구성한다. 이러한 반복을 통해 AI에게 지시하는 방법과 복잡한 작업을 끝까지 진행하도록 돕는 프롬프트 설계는 상당히 숙련된 것일 거라고 생각한다. 현재는 Codex를 메인으로 사용하고 있습니다. 이전에는 제가 한 건씩 수작업으로 처리하던 일을 AI에 모아서 모두 맡길 수 있게 되었습니다. 그 일에 대해, 지금도 여전히 큰 감동을 받고 있습니다. 거의 매일 사용하고 있는데, 이제는 완전히 손을 놓을 수 없는 도구로 자리 잡았습니다. AI 비디오로, 드디어 드러난 것들 AI 영상에 대해서는 Runway나 Sora를 조금 사용해 보았을 뿐만 아니라, 로컬 환경에서 Wan2.2나 WanAnimate와도 상당한 어려움을 겪었습니다. 단, 기술적으로는 재미있었지만, 내가 바라는 표현에 다소 미치지 못하여 한동안 정체되었습니다. 그 가운데 2026년 8월에 MiniMax H3가 등장했습니다. 실제로 닿아보면서, 드디어 “제가 AI 영상으로 하고 싶었던 것”에 상당히 가까워진 느낌이 듭니다. 현재, 가장 몰두해서 시험하고 있는 생성 AI 중 하나입니다. AI 음성 및 AI 음악도 계속 시도 중입니다. 음성 및 음악 생성에서는 지금까지 다음과 같은 기술들을 활용해 왔습니다. ACE-Step 1.5는 2008년에 발표된 뇌파 분석 소프트웨어입니다. 뇌파를 실시간으로 분석하여 뇌파 패턴을 시각적으로 보여주는 데 사용되며, 수면 연구, 신경 심리학 연구, 정신 질환 진단 등 다양한 분야에서 활용됩니다. ACE-Step 1.5는 사용하기 쉬운 인터페이스와 다양한 분석 기능을 제공하여 연구자들에게 널리 사용되고 있으며, 지속적인 업데이트를 통해 성능이 향상되고 새로운 기능들이 추가되고 있습니다. 무라카미 하루키의 작품, 특히 『하늘의 문』 시리즈와 같은 작품에서 묘사된 뇌파 분석의 가능성을 상상하며 개발된 소프트웨어라고 할 수 있습니다. RVC Style-Bert-VITS2 Qwen3-TTS 어떻게든 도와드리겠습니다. 원본 텍스트를 제공해주세요. 특히 Style-Bert-VITS2는 설정 및 학습 등을 포함하여 다양한 시도를 해왔습니다. 현재는 Irodori-TTS를 중심으로 어떤 음성을 만들 수 있는지 실험적으로 탐색하고 있습니다. 성공뿐만 아니라 실패 또한 간직하고 싶다. 저는 AI 기술을 전문적으로 설명하는 것보다, 전문가로서 AI 기술을 해설하는 것이 더 적절합니다. 정말 이것을 해낼 수 있을까? 실제로 사용했을 때 어떤 결과가 나올까? 실패한다면 어디서일까? 이런 의문을 스스로 시험해보고 확인하는 것을 좋아합니다. 생성 AI를 사용해 보면서 소개 영상이나 성공 사례만으로는 간단해 보이지만 실제로는 잘 되지 않는 경우가 많습니다. 환경 구축에서 어려움을 겪는 경우도 있고, 예상했던 대로 출력이 나오지 않는 경우도 있습니다. 여러 날을 시도한 끝에 결국 포기하는 경우도 있습니다. 그럼에도 불구하고, 실패한 과정에는 실제로 만져봤기 때문에 알 수 있는 것들이 있습니다. 이 노트에서는 LLM, AI 그림, AI 영상, AI 음성, AI 음악 등, 관심을 갖게 된 생성 AI를 실제로 사용해 본 기록을 남겨갈 것입니다. 잘 풀렸던 일뿐만 아니라 풀리지 않았던 일이나 어디에서 어려움을 겪었는지까지 꼼꼼하게 기록할 계획입니다. 같은 생성 AI에 관심을 가지고 있거나, “실제로 어디까지 가능한 건지?”라고 생각하는 사람들에게 조금이라도 도움이 되는 기록이 되기를 바랍니다. 앞으로도 잘 부탁드립니다. 출처: note 원문 번역: Gemma 3(.44) 초벌 + 교정 25청크 원문 보기 | 출처: note.com