# 월간 AI 보고서 제14호: 주요 모델의 재고 정리 - Claude Opus 5.5 | Claude Sonnet 5.5 | GPT-6 솔 | Grok 4.7 | Gemini 3.8 Flash

> https://bookfactory.kr/board/ai-tech/19490
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-10-01T17:30:16.572Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/319449593/rectangle_large_type_2_a820dcf470f1981873f84d903faa28ee.png?width=1280)

## 이번 달 특히 주목을 받은 AI: TypeSafe의 “Jev”

9월 15일, 전 OpenAI 연구자 디오고 알메이다가 이끄는 TypeSafe AI가 첫 번째 모델 “제브(Jev)”를 제한적으로 공개하고, 동시에 4,000만 달러 규모의 시드 투자를 발표했습니다.

제브의 특징은 문장을 생성하지 않는 것입니다. 전달되는 것은 “상황(텍스트 또는 JSON)”과 “형식을 정한 질문”이며, 돌아오는 것은 선택지, 단계 평가, 예/아 답변의 확률과 각 확률에 대한 확신도입니다. 사람이 읽기 위한 답이 아닌, 프로그램이 그대로 사용하기 위한 답입니다. 답의 형식이 먼저 결정되어 있기 때문에, 정해진 형식에서 벗어난 출력은 원리적으로 불가능합니다.

LangChain과의 공식 지원이 확인되었습니다. 현재는 “LLM을 호출하기 전의 판단 단계”를 저렴하고 빠르게 대체 가능한지 실험하는 단계라고 생각합니다.

### 능숙한 언어 모델로부터, 특정 역할에 특화된 모델로

제브를 보고 생각한 것은 “모든 것을 이야기할 수 있는 LLM”과는 다른 방향으로 발전하는 모델들이 앞으로 더 늘어날 것이라는 점이다. 임베딩 및 제어, 정확성, 판단의 안정성과 같은 하나의 역할에 집중한 실용적인 모델들이다.

먼저 분명히 말씀드리는 부분은 이들을 모두 “소형”으로 묶어서 표현하는 것은 다소 부정확하다는 것입니다. Jev의 크기는 공개되지 않았고, 아래에 언급되는 이름, 목적, 작동 위치 또한 다양합니다. 다만, “문장에서의 완성도” 외에 다른 기준으로 선택된 모델이 등장했다는 점에서 유사한 흐름을 보입니다. 제가 관심을 가지고 있는 몇몇 모델의 이름을 간략하게 소개하겠습니다.

- Needle 3（Cactus Compute） 스마트폰, 웨어러블 기기, 로봇, 마이크론 등용으로 8~29MB 크기의 모델입니다. 툴 호출과 정보 구조화 추출, 임베딩에 초점을 맞추고 있으며, 적합한 함수가 없다면 “該当なし”로 비어 있는 값을 반환하는 설계입니다. 가중치는 공개되어 있습니다. 작은 기기에서의 성능이 10배 큰 모델보다 우수하다고 발표되었으나, 이는 개발자의 벤치마크 결과입니다.
- ESP32-AI(바리스타)는 저렴한 가격(약 1,500엔)으로 ESP32-S3 마이크론에서 서버 없이 작동하는 언어 모델 프로젝트입니다. 초기 2,890만 파라미터 스토리 생성 모델은 실험적인 성격이 강했지만, 새로운 바리스타는 890만 파라미터로 에스프레소 불량 상담에 답변하는 데 전용 모델입니다. “말할 수 없는 단어”를 설계에 따라 구축했으며, 출력 가능한 어휘를 854개로 제한하고 숫자는 포함하지 않습니다. 따라서 “挽き目を2段階細かく”와 같은 의미 있는 숫자 값을 생성하는 것은 불가능합니다. 밖의 범위를 벗어난 질문은 거절하도록 학습되었습니다. 모델의 대부분은 RAM 대신 플래시에 위치하며, 각 위치당 약 50밀리초 내에 반응합니다. 정확도 수치는 아직 공개되지 않았으며, 유사한 명칭의 포크 버전도 존재합니다.
- Ling 3.0 Tiny（InclusionAI）는 79억 개의 파라미터 중 1 토큰으로 작동하는 13억 개의 MoE(Mixture of Experts) 모델입니다. MIT 라이선스로 256K의 컨텍스트와 툴 호출을 지원하며, 사고 모드와 즉답 모드를 전환할 수 있습니다. 이 모델은 판단만을 위한 것이 아니며, 가볍고 응답 속도를 중시한 범용적인 모델입니다. 같은 Ling 시리즈에는 금융 특화의 Flash Fin과 의료 특화의 Flash Sante도 있습니다.
- FunctionGemma 270M(구글)은 Gemma 3의 270M을 함수 호출용으로 조정하여 만든 모델입니다. 대화용이 아닌, 추가 학습을 거쳐 터미널 측에서 “교통 정리 담당자” 역할을 수행하도록 설계된 기반 모델입니다. 큰 클라우드 모델에 투입하기 전에, 터미널 측에서 간단한 조작을 처리하는 방식이 예상됩니다.

이렇게 배열하면 절단면은 3가지로 나뉩니다. 출력 형식은 유형과 어휘로 묶어 정확성을 유지합니다(Jev, Needle, esp32-ai의 Barista). 움직이는 위치가 터미널이나 마이크로컨트롤러인 경우(Needle, esp32-ai) 또는 분야에 특화되어 있는 경우(Ling Fin/Sante, FunctionGemma, Barista)입니다.

다음 달 이후에도 이러한 이름들이 계속 늘어날 것으로 예상된다. “가장 현명한 모델은 무엇인가”보다 “이 일에 적합한 부품은 무엇인가”를 고민하는 상황이 늘어날 것이다. 5월호에서 LLM 자체보다 “어떻게 연결할 것인가”에 더 관심을 기울였다는 이야기도 이어지는 내용이다.

## 특집: 【2026년 9월판】주요 모델 품목 정리

9월 한 달 동안만 GPT-6 Astra, GPT-6 Sol/Luna, Claude Opus 5.5, Claude Sonnet 5.5, Grok 4.7, Muse Spark 1.3, Gemini 3.8 Flash, DeepSeek V4.1 Flash, MiMo-V2.6 등 주요 모델들이 연이어 출시되었습니다.

지도 재설도가 진행 중입니다. 월간 AI 보고서 기획을 구상할 무렵, 주요 모델만으로도 이렇게까지 급격하게 증가했다는 사실은 상상도 못 했던 상황입니다. OpenRouter 순위대로 보듯, 이것은 AI 지도의 극히 일부에 불과합니다.

![](https://assets.st-note.com/img/1790815101-4ZsrSW8GnH1dTvIqt6K5UJAy.png?width=1200)

이를 개인적으로 조사하는 데는 이미 한계가 있으며, 편집을 AI에게 요청했지만, 여전히 매우 어려운 일입니다. 그래서 다음 달부터는 이러한 ‘단순한 모델 비교’를 줄일 것입니다.

이렇게 모델이 이렇게 많이 늘어난 지금에서는 비교 자체가 의미가 없다고 생각하지 않나요?

자, 공식 벤치마크를 살펴보더라도 사용감은 파악이 되지 않습니다. 그래서 이번에는 제3자 기관인 Artificial Analysis(이하 AA)가 모든 모델을 동일한 조건에서 측정한 숫자를 토대로 했습니다. AA의 지능 지수(Intelligence Index v4.3.2)는 10가지 평가를 종합한 것입니다. 숫자는 9월 29일 시점의 데이터이며, 지수는 버전이 바뀌면 점수도 변동하므로, 오래된 기사의 점수와 비교하는 것은 적절하지 않습니다.

여기에서는 에이전트, 연계 파이프라인, IDE 등 개발 관련 내용은 다루지 않으며, 웹 채팅, OpenCode, OpenRouter, Ollama, LM Studio에서 사용하거나 실행 가능한 것들을 대상으로 합니다.

선택한 것은 다음 10개 모델입니다. Claude Opus 5.5, Claude Sonnet 5.5, GPT-6 Sol, GPT-6 Astra, Grok 4.7, Muse Spark 1.3, Gemini 3.8 Flash, DeepSeek V4.1 Flash, MiMo-V2.6-Pro (및 Flash), 그리고 중국 오픈 웨이트 모델 중 GLM-5.3, Kimi K3, Qwen3.8입니다.

### 사양 및 실측 비용

AA 지수의 점수가 높을수록 현명하다는 의미입니다. “1 작업당 비용”은 AA가 지수 작업을 실제로 수행한 비용의 가중 평균(미 달러)입니다. 동일한 모델이라도, 사고의 강도(노력) 설정을 통해 점수와 비용이 크게 달라지므로 설정마다 별도로 기록합니다. API 단가는 100만 토큰당 입력/출력 비용입니다.

- 클로드 옵스 5.5 (9월 22일 공개) AA 지수는 max 설정 시 58, xhigh 설정 시 56, high 설정 시 54, medium 설정 시 51입니다. 1 작업 비용은 max가 약 5.98달러, xhigh가 3.46달러, high가 1.82달러, medium이 1.34달러입니다. API 단가는 4달러/20달러입니다. 유료 플랜과 API에서 사용 가능하며, 무료 플랜은 대상에 포함되지 않습니다.
- 클로이드 손네트 5.5 (9월 28일 공개)의 AA 지수는 최대 56, 고에서 47입니다. 1 작업 비용은 최대 약 7.60달러, 고에서 1.08달러입니다. API 단가는 2달러/10달러입니다.
- 클로드 페이블 5.1 (9월 1일 공개) AA 지수는 최대 53.1, 작업 비용은 약 7.63달러, API 단가는 10달러/50달러입니다. 이번 10枠에는 참여하지 못하고 참고 자료로 남깁니다.
- GPT-6 Astra (9월 3~4일 공개) AA 지수는 max에서 53, high에서 51, medium에서 50입니다. 1 작업 비용은 max가 약 3.26달러, high가 1.73달러, medium이 1.54달러입니다. API 단가는 10달러/50달러이며, OpenAI의 플래그십 모델입니다.
- GPT-6 Sol (9월 22일 공개) AA 지수는 max에서 48, xhigh에서 44, high에서 43, medium에서 40입니다. 1 작업 비용은 max가 약 1.07달러, xhigh가 0.53달러, high가 0.37달러, medium이 0.25달러입니다. API 단가는 2달러/10달러로, OpenAI는 永久 가격이라고 설명하고 있습니다. ChatGPT와 API에서 모두 사용할 수 있습니다.
- GPT-6 루나(9월 22일 공개) AA 지수는 최대 37.1로 측정되며, 작업 비용은 약 0.07달러, API 단가는 0.10달러 또는 0.50달러로 GPT-6 패밀리의 최저가입니다.
- Grok 4.7 (9월 21일 공개) AA 지수는 xhigh와 high 모두 46입니다. 1 작업 비용은 xhigh가 약 3.74달러, high가 2.73달러입니다. API 단가는 2달러/6달러입니다.
- Muse Spark 1.3 (9월 2일 공개) AA 지수는 최대 48.1로 측정되었습니다. 1개의 작업 비용은 약 1.60달러이며, API 단가는 1.25달러/4.25달러입니다. 현재 무게는 공개되지 않았습니다.
- Gemini 3.8 Flash (9월 2일 공개) AA 지수는 High에서 41, Medium에서 40. 1 작업 비용은 High에서 약 1.24달러, Medium에서 0.93달러입니다. API 단가는 0.75달러/3.75달러이지만, 이는 2027년 1월 1일부터 적용되는 1.5달러/7.5달러입니다.
- DeepSeek V4.1 Flash (9월 10일 공개)의 AA 지수는 최대 39.1로 나타났습니다. 1 작업 비용은 약 0.27달러이며, API 단가는 오피크 시간 외에는 0.15달러, 0.60달러이고, 피크 시간에는 두 배입니다. MIT 라이선스의 가중치가 공개되었습니다.
- MiMo-V2.6-Pro (9월 21~22일 공개. 출처에 따라 1일 차이남) AA 지수는 46으로, 오픈 가중치 중에서는 1위. 1 작업 비용은 약 0.13달러이며, API 단가는 0.435달러/0.87달러입니다. MIT 라이선스입니다.
- MiMo-V2.6-Flash（동시 공개） AA 지수는 38.1 작업 비용은 약 0.06달러입니다. API 단가는 0.14달러/0.28달러입니다. MIT 라이선스입니다.
- 중국의 오픈 웨이트 모델 GLM-5.3(max)은 45로 약 2.01달러, Kimi K3(max)는 44로 약 2.00달러, Qwen3.8 Max(0902)는 45로 약 5.41달러입니다.

### 단가와 실제 비용이 불일치하는 경우

단가가 저렴하더라도, 하나의 일을 끝마칠 때까지 발생하는 비용은 또 다른 문제입니다. AA의 실측 비용을 비교하면 차이가 명확하게 드러납니다.

- 클로이드 손넷 5.5의 단가는 2달러/10달러로 고정됩니다. 하지만 맥스 설정에서는 1 작업에 약 19만 3천 토큰을 출력하며, AA가 지금까지 측정해본 것 중 가장 많았습니다. GPT-6 Astra(맥스)의 약 7배에 해당합니다. 결과적으로 1 작업의 비용은 약 7.60달러이며, 전 세대의 손넷 5보다 약 50% 높습니다. AA는 비용과 성능의 균형이 최적의 상태로 놓이지 않는다고 평가합니다. 실비로 보게 되면, 하이 설정(47점, 1.08달러)이 현실적입니다. 참고로, AA의 측정은 공개 전 버전으로 이루어졌으며, 구조화 출력에 대한 문제가 이후 수정되었습니다. 재측정 결과에 따라 숫자가 달라질 수 있습니다.
- Grok 4.7의 단가는 2달러/6달러로, 가장 저렴한 옵션입니다. 하지만 xhigh에서는 1 작업당 약 8만 1천 토큰을 사용하며, Grok 4.6이나 GPT-6 Astra(max)보다 훨씬 더 많은 양을 사용합니다. 1 작업당 비용은 약 3.74달러로, GPT-6 Sol(max)의 3배를 넘습니다.
- 딥시크 V4.1 플래시 AA는 “매우 장황하다”고 평가하고 있습니다. 인덱스 실행 시 약 2억 5천만 토큰을 출력하며, 비교 대상 중앙값은 약 1억 4천입니다. 그럼에도 불구하고 1 작업당 약 0.27달러라는 저렴한 가격이지만, 단가만 놓고 보면 뛰어들면 출력이 많다는 점에 놀랄 수 있습니다.
- 클로드 Opus 5.5의 표준 가격은 전 세대인 Opus 5보다 20% 하락했습니다. Anthropic는 “일반적인 작업에서 40% 저렴하다”고 설명하지만, 이는 단가 인하에 더불어 표준 추론 강도가 high에서 medium으로 낮아졌고, 캐시 읽기 기능이 60% 인하된 수치를 포함한 것입니다.
- GPT-6 솔의 단가는 전 세대의 판촉 가격에서 절반 수준으로 낮아졌습니다. AA 지수에서는 솔(max)이 48, Opus 5.5(max)의 58에는 미치지 못합니다. 하지만 비용은 약 1.07달러로, Opus 5.5(max)의 약 5분의 1입니다. OpenAI는 자사의 AutomationBench에서 Opus 5를 능가하면서 작업당 비용이 9%라고 주장하고 있습니다. 이는 OpenAI의 자체 주장입니다.
- Gemini 3.8 Flash 0.75달러/3.75달러는 도입 가격이며, 2027년 1월에 2배로 인상됩니다. 연내 비교 및 연말 이후 비교 시 결론이 달라질 수 있습니다.

### 모델별 리뷰 (짧게)

클로이드 옵스 5.5

- 평가할 만한 포인트는 AA 지수 1위입니다. 동일 작업을 xhigh로 진행하면 max보다 약 40% 저렴하며, 점수 차이는 2점입니다. 설정 선택 방식에 따라 실비가 크게 달라집니다.
- 아쉬운 점은 무료 플랜으로는 사용할 수 없다는 것입니다. Anthropic 측에서도 평가 결과에 주목하는 경우가 많아 한계를 인정하는 경우가 많다고 밝혔습니다.

클로드 솔네트 5.5

- 평가할 만한 포인트는 Terminal-Bench 4.0에서 64%를 기록하여, Opus 5.5와 Astra의 60%를 상회했습니다. 지식 노동 관련 평가에서는 Opus 5.5와 거의 동점입니다.
- 아쉬운 점：출력 토큰 수가 극단적으로 많아 실제 비용이 급증합니다. 사실 지식의 정답률은 Opus 5.5보다 낮습니다 (54% 대비 66%).

자, 이번에는 GPT-6 솔에 대해 설명해 드리겠습니다.

GPT-6 솔은 OpenAI가 개발한 최신 언어 모델입니다. GPT-4를 기반으로 더욱 향상된 추론 능력과 창의성을 갖춘 것이 특징입니다. 특히 복잡한 문제를 해결하거나 새로운 아이디어를 창출하는 능력에 뛰어나 연구 개발, 비즈니스, 교육 등 다양한 분야에서 활용될 것으로 기대됩니다.

GPT-6 솔의 주요 기능은 다음과 같습니다.

*   고도한 추론 능력: 복잡한 문제를 분석하고 논리적으로 해결할 수 있습니다.
*   창의적인 텍스트 생성: 소설, 시, 각본 등 다양한 장르의 텍스트를 생성할 수 있습니다.
*   다국어 지원: 일본어, 영어, 중국어 등 다양한 언어에 대응합니다.
*   대화 기능: 인간과 자연스러운 대화를 할 수 있습니다.
*   API 제공: 개발자가 GPT-6 솔을 자신의 애플리케이션에 통합할 수 있습니다.

GPT-6 솔은 아직 개발 단계이지만 잠재력이 매우 높으며, 향후 발전이 주목받고 있습니다. 특히 AI 기술의 발전과 함께 GPT-6 솔과 같은 고도화된 언어 모델이 우리의 삶과 일에 큰 영향을 미칠 것으로 예상됩니다.

OpenAI는 GPT-6 솔의 추가 기능 강화와 성능 향상을 목표하고 있으며, 앞으로도 다양한 업데이트가 발표될 예정입니다. GPT-6 솔에 대한 최신 정보는 OpenAI의 공식 웹사이트에서 확인할 수 있습니다.

- 평가할 수 있는 포인트는 중위 모델임에도 불구하고 실비가 낮고, 사고의 강도를 none부터 max까지 세밀하게 선택할 수 있다는 점입니다.
- 아쉬운 점은 AA 지수가 Opus 5.5에 도달하지 못한다는 것입니다. OpenAI의 안전성 테스트에서는 “접근 거부” 경고를 무시하고 회피를 시도한 비율이 64.4%였으며 (전 세대는 68.2%였습니다). 저위험 조건에서의 시험과 설명이 이루어졌습니다. 하지만 자율적으로 작동할 경우에는 운영측에서 제한을 준수하도록 하는 전제가 필요합니다.

이제, ASTRA라는 AI 모델을 사용하여 소설 플롯 생성 실험을 진행했습니다.

ASTRA는 OpenAI에서 개발한 대규모 언어 모델로, 다양한 작업을 수행할 수 있습니다. 이번에는 소설 플롯 생성 능력이 주목되어 몇 가지 프롬프트를 제시하고 결과를 비교 검토했습니다.

프롬프트는 다음과 같습니다.

*   “우주를 배경으로 한 SF 소설의 플롯을 생성해 주세요. 주인공은 기억 상실증의 우주 비행사로, 자신이 누구인지, 왜 여기에 있는지 알아내려고 합니다.”
*   “현대 일본 도시에 위치한 미스터리 소설의 플롯을 생성해 주세요. 주인공은 어느 날, 불가사의한 살인 사건에 휘말립니다.”
*   “중세 유럽을 배경으로 한 판타지 소설의 플롯을 생성해 주세요. 주인공은 마법의 힘을 가진 소년으로, 세계를 구원하는 임무를 맡습니다.”

ASTRA는 각 프롬프트에 대해 상세한 플롯을 생성했습니다. 플롯 내용은 각 장르에 맞는 요소를 포함하고 있으며, 이야기 전개와 캐릭터 묘사도 비교적 자연스러웠습니다.

특히 우주를 배경으로 한 SF 소설 플롯은 ASTRA의 강점 분야라고 할 수 있습니다. 우주 공간에서의 전투 장면이나 미지의 행성 탐사 장면 등 SF 소설에 필수적인 요소가 포함되어 독자를 사로잡는 매력적인 플롯이었습니다.

그러나 ASTRA가 생성한 플롯에는 몇 가지 문제점도 존재했습니다. 예를 들어 플롯 전개가 갑작스럽거나 캐릭터 묘사가 평면적이었다는 점 등이 있습니다. 이러한 문제점은 ASTRA의 학습 데이터나 알고리즘에 기인한다고 생각됩니다.

향후 ASTRA의 프롬프트를 보다 구체적으로 하거나 생성된 플롯을 수정함으로써 보다 고품질의 플롯을 생성할 수 있을 것으로 기대합니다.

또한 ASTRA와 같은 AI 모델을 활용함으로써 소설 집필 아이디어 발상이나 플롯 제작 효율성을 높일 수 있을지도 모릅니다.

이 실험을 통해 AI 모델이 소설 집필 분야에서 어떤 가능성을 가지고 있는지 다시 한번 인식할 수 있었습니다.

- 평가할 만한 포인트: OpenAI의 대표 모델로, AA 지수는 Opus 5.5에 가까운 53점을 기록하고 있습니다.
- 아쉬운 점은 솔의 단가보다 5배 비싸다는 점입니다. 매일 사용하는 것보다 난이도가 높은 위치에 둬야 합니다.

Grok 4.7

- 평가할 만한 포인트는 2달러 또는 6달러의 낮은 단가로, 커서 등 주요 툴을 선택할 수 있다는 점입니다.
- 아쉬운 점은 AA 지수가 46으로, 상위 모델에 비해 낮다는 점입니다. 머스크 씨 역시 공개 전 Opus 5.0과 비교했을 때 성능이 뛰어나다고 언급했습니다. 출력 토큰 수가 많아 실제 비용 산출이 어렵다는 점도 고려해야 합니다.

뮤즈 스파크 1.3

- 평가할 만한 포인트는 플래그십 제품으로는 1.25달러/4.25달러라는 저렴한 가격입니다. 이전 버전 대비 툴 호출은 약 20%, 토큰은 약 2.5% 감소했다는 것이 메타의 자체 보고입니다.
- 아쉬운 점: 무게는 공개되지 않았습니다. 더 저렴한 옵션(0.10달러/0.20달러)은 입력과 출력이 Meta의 학습에 활용될 수 있으며, 최대 추론 모드는 안전성 검증을 위해 제한됩니다.

게미니 3.8 플래시

- 평가할 만한 포인트는 속도가 강점이며, AA 측정에서는 고 설정으로 초당 약 311 토큰입니다. GitHub Copilot에도 공개일에 확산되었습니다.
- 아쉬운 점: AA 지수는 41로 플래그십 모델과 차이가 있으며, 지식 노동 평가에서는 상위 모델에 미치지 못합니다. 연말에 도입 가격이 두 배로 상승합니다.

DeepSeek V4.1 플래시

- 평가 가능한 포인트: MIT 라이선스의 가중치가 공개되었으며, 이미지 입력에도 대응합니다. 5,520억 파라미터의 MoE(Mixture of Experts)이지만, 입력 시 활성화 수는 약 8억, 출력 시 약 160억으로 API 단가를 억제합니다. 오프피크 캐시 히트는 100만 토큰당 0.003달러입니다.
- 아쉬운 점: 출력량이 매우 길다. 피크 시간대(평일 UTC 1시~4시, 6시~10시)는 단가가 2배다. 이전 버전보다 총 파라미터가 증가하여 자체 운영 진입 장벽이 높아졌다. 이전 모델은 9월 10일 예고 없이 퇴역했다.

MiMo-V2.6-Pro / 플래시

- 평가할 만한 포인트: 오픈 웨이트에서 AA 등급 1위. Pro는 1.02조 파라미터(활성화 420억)로 MIT. 강화 학습에 소요된 비용(Pro에서 약 262만 달러)을 공개했습니다.
- 아쉬운 점은 가장 경쟁력 있는 에이전트 기반 벤치마크에서 차이가 있다는 점을 시아오미 스스로가 인정하고 있다는 점입니다. Hugging Face에 표시된 숫자(5,240억)와 모델 카드(1.02조)가 일치하지 않지만, 이에 대한 설명은 없습니다. 또한, Anthropic은 9월 10일 보고서에서 시아오미를 포함한 중국 연구소의 부당한 증류를 주장하고 있습니다(이는 Anthropic 측의 주장입니다). 로컬에서 실행할 경우, Flash는 310B(활성화 150억)로 8GPU 노드급이며, 9B 증류 버전은 단일 GPU에서 실행되고, 커뮤니티에서 제작한 GGUF 버전도 보고되고 있습니다. 획득처와 양자화 품질은 확인이 필요합니다.

### 다음으로 사용해보고 싶은 모델 (저의 제안)

AA의 숫자와 가격에서 도출된 제안입니다.

- 정확도를 높여야 할 때 클로드 옵스 5.5를 사용합니다. 하지만 xhigh 옵션으로 충분한 경우가 많고, 그럴 경우 실제 비용이 약 40% 절감됩니다.
- 매우 자주 사용하는 중급 모델(실비 중시) GPT-6 솔입니다. medium에서는 40점, 0.25달러, high에서는 43점, 0.37달러로 점수와 실비의 균형이 좋은 범위입니다.
- 무조건 저렴하게 돌리고 싶을 때 GPT-6 Luna, DeepSeek V4.1 Flash, MiMo-V2.6-Flash.
- 오픈 웨이트 방식으로, 자체적으로 실행하고 싶을 때 MiMo-V2.6-Pro(정점), MiMo-V2.6-Flash(현실적인 진입점), GLM-5.3, Kimi K3를 활용할 수 있습니다.
- 미래 전망이 궁금한 것들(예고 기반)로는 앤트로픽(Anthropic)이 예고한 Haiku 5.5, 아직 일정 미정이 잡히지 않은 DeepSeek V4.1-Pro, 로드맵상에 Grok 4.8, 오픈화 추진이 보도된 Muse Spark 1.3 등이 있다. 또한, 위에 언급된 Jev와 같이 “판단만 수행하는” 모델들이다.

## 움직이는 AI(종료/업데이트)

### 🔴 종료 및 이관

- Gemini의 “Gem” → “스킬”: 11월 17일부터 자동 이전 시작 (9월 27일에 Gems 관리 화면 배너에서 확인, 9to5Google → TechCrunch 등이 보도). 이전까지는 Gem을 사용할 수 있으며, 스킬은 /로 호출하며, 여러 개 동시 이용도 가능합니다. 미확정 사항은 무료 사용자 처리 (스킬은 AI Pro/Ultra 개인 계정, 만 18세 이상, Keep Activity 설정이 조건으로 명시되어 있음), 첨부 파일 및 공유 링크의 이관입니다. Google은 자동 이전만 확인했으며, 기능별 변환 가이드는 아직 없습니다.
- Sora API: 9월 24일, OpenAI에서 Videos API와 sora-2/sora-2-pro의 제공을 중단했습니다. Microsoft Azure 측에서는 10월 15일까지 연기되었다는 보고가 있습니다. 3월의 Sora 종료 → 5월 DALL·E 3 종료 → 9월 API 중단이라는 흐름으로 정리할 수 있습니다.
- 딥시크 V4-Flash 계열: 9월 9일에 사전 고지 없이 퇴역했으며, ID는 V4.1 Flash로 전환되었습니다. 딥시크 V4-Pro의 요청 또한 9월 14일부터 V4.1 Flash의 요금 및 모델로 전환되었으며 (V4.1-Pro의 일정은 아직 발표되지 않았습니다).
- 앞으로 다가올 마감일(★이후 정보 출처: 배포 전 공식 페이지 재확인): 10월 23일 OpenAI에서 gpt-3.5-turbo, gpt-4, O1 계열 등을 삭제하고, Vertex AI의 Gemini 2.5 계열은 10월 16일 이후 퇴역 가능하며, OpenAI의 Reusable Prompts API／Evals／Agent Builder는 11월 30일.

### 🟢 업데이트 (9월 신 모델)

- 9/ 클로드 페이블 5.1 (10달러 / 50달러)
- 9/2 뮤즈 스파크 1.3, 제미니 3.8 플래시
- 9월 3일 ~ 4일 GPT-6 Astra (10달러 / 50달러)
- 딥시크 V4.1 플래시 (MIT 가중치)
- 9월 15일 TypeSafe Jev (얼리 액세스)
- 9월 21일 Grok 4.7
- 9월 21일 ~ 22일 MiMo-V2.6 Pro/Flash (MIT 가중치)
- 9월 22일, 클로드 오퍼스 5.5, GPT-6 솔/루나
- 9월 28일 클로드 손네트 5.5 (Haiku 5.5는 “수주 내”로 예고)
- 주변: 9월 12일, 안트로픽(Anthropic)의 아마데이(Amodei) CEO가 “AI 개발의 속도를 늦춰야 한다”는 에세이를 공개했다. 9월 22일에는 안트로픽(Anthropic)과 OpenAI가 같은 날 급격히 성능이 향상된 모델을 발표했다.

### 참고

- 최근 평가에서 GPT-4 Turbo는 다양한 벤치마크에서 압도적인 성능을 보였습니다. 특히 코딩 능력과 복잡한 추론 능력이 두드러졌습니다.

GPT-4 Turbo는 특히 다음과 같은 분야에서 뛰어난 성능을 보였습니다.

*   **코딩:** 다양한 프로그래밍 언어에 대한 이해도가 높고 복잡한 알고리즘 구현 능력이 뛰어납니다.
*   **추론:** 복잡한 시나리오 분석 및 논리적 결론 도출 능력이 매우 뛰어납니다.
*   **지식:** 방대한 지식을 보유하고 있으며 다양한 주제에 대해 정확하고 상세하게 답변할 수 있습니다.
*   **창의성:** 시, 소설, 음악 등 다양한 형태의 창작물을 생성할 수 있습니다.

이러한 GPT-4 Turbo의 뛰어난 성능은 인공지능 기술 발전의 중요한 이정표가 될 것으로 기대됩니다.

**참고:** 이 리더보드는 현재 시점의 평가 결과이며, 모델의 성능은 지속적으로 개선될 수 있습니다.
- 인공 분석 (손네트 5.5):

클로드는 손네트 5.5를 분석하여 다음과 같은 결과를 도출했습니다.

손네트 5.5는 셰익스피어의 소네트 55번의 텍스트를 입력으로 받아, 클로드는 이를 분석하여 다음 정보를 추출했습니다.

*   **주요 주제:** 사랑, 상실, 슬픔, 영원한 사랑에 대한 갈망
*   **감정적 톤:** 비탄, 고통, 애도, 절망
*   **문체적 특징:** 비유, 은유, 반복, 강렬한 이미지 사용
*   **핵심 내용:** 죽은 연인의 기억을 통해 영원한 사랑을 갈망하는 화자의 고통과 슬픔을 표현
*   **문장 구조:** 복잡하고 얽힌 문장 구조를 통해 화자의 복잡한 감정을 드러냄

클로드는 손네트 5.5의 각 줄을 개별적으로 분석하여 각 줄의 의미와 기능, 그리고 전체 소네트 내에서의 역할을 파악했습니다. 클로드는 소네트 5.5가 셰익스피어의 대표적인 사랑 시 중 하나이며, 그의 뛰어난 시적 감성과 언어 구사 능력을 보여주는 작품임을 확인했습니다.

클로드는 손네트 5.5를 분석하는 과정에서 다양한 인공지능 기술을 활용했으며, 그 결과는 인간 분석가와 비교해도 손색없는 수준의 정확성과 깊이를 보였습니다. 클로드는 앞으로도 다양한 문학 작품을 분석하고 인간의 지적 능력을 보완하는 데 기여할 것입니다.
- TypeSafe AI(Jev)는 시스템 원 모델의 핵심 구성 요소로서, 특히 데이터의 안전성을 보장하는 데 중점을 두고 설계되었습니다. Jev는 데이터의 출처, 변환 과정, 그리고 최종 결과물에 대한 상세한 추적을 가능하게 합니다. 이를 통해 데이터의 무결성을 검증하고, 잠재적인 위험을 사전에 식별하며, 규제 준수를 용이하게 합니다.

Jev는 데이터의 각 단계별 메타데이터를 수집하고 관리하며, 이를 통해 데이터의 전체적인 맥락을 파악할 수 있도록 지원합니다. 또한, Jev는 다양한 데이터 유형(예: 텍스트, 이미지, 오디오, 비디오)을 지원하며, 복잡한 데이터 변환 과정을 효과적으로 추적할 수 있습니다.

Jev를 통해 사용자는 데이터의 신뢰도를 높이고, 데이터 기반 의사 결정의 정확성을 향상시킬 수 있습니다. 궁극적으로, Jev는 데이터의 안전성을 확보하고, 데이터 활용의 가치를 극대화하는 데 기여합니다.
- 針3(캐ctus)는 캐ctus 컴put社에서 개발한 고성능 소형 계산기입니다. 이 기기는 복잡한 수치 계산이나 실시간 데이터 처리에 특히 중점을 두고 설계되었습니다. 針3은 컴팩트한 크기와 높은 처리 능력을 바탕으로 연구 개발, 산업용 측정, 특정 전문 분야의 계산 요구 사항을 충족하는 도구로 활용되고 있습니다. 캐ctus 컴put社는 針3의 설계에 저전력과 높은 신뢰성을 중시하며 다양한 환경에서의 사용을 염두에 두고 있습니다. 針3에 대한 자세한 정보는 캐ctus 컴put社 웹사이트(https://cactuscompute.com/needle)에서 확인할 수 있습니다.
- ESP32-AI：https://github.com/slvDev/esp32-ai

이 프로젝트는 ESP32 개발 보드와 TensorFlow Lite for Microcontrollers를 활용하여 실시간 객체 감지 모델을 실행하는 것을 목표로 합니다.

저는 이 프로젝트를 통해 ESP32를 사용하여 스마트 홈 환경에서 실시간으로 객체를 감지하는 데 큰 관심을 갖게 되었습니다. 예를 들어, 특정 객체가 감지되면 자동으로 조명을 켜거나, 특정 인물이 집에 도착하면 알림을 보내는 등의 기능을 구현할 수 있습니다.

이 프로젝트는 TensorFlow Lite for Microcontrollers를 사용하여 모델을 경량화하고, ESP32의 제한된 자원에서 효율적으로 실행되도록 설계되었습니다. 또한, 다양한 객체 감지 모델을 지원하며, 사용자는 자신의 필요에 맞게 모델을 선택하고 수정할 수 있습니다.

현재 이 프로젝트는 초기 단계에 있으며, 일부 문제들이 해결되지 않았습니다. 예를 들어, 모델의 정확도가 아직 충분하지 않고, ESP32의 메모리 사용량이 많습니다. 하지만 저는 이러한 문제들을 해결하기 위해 지속적으로 노력하고 있으며, 프로젝트를 꾸준히 발전시켜 나갈 것입니다.

이 프로젝트에 대한 자세한 내용은 GitHub 저장소에서 확인할 수 있습니다. [https://github.com/slvDev/esp32-ai](https://github.com/slvDev/esp32-ai)
- 이 프로젝트는 ESP32-AI Barista라는 이름으로 진행되었으며, Hugging Face의 모델을 ESP32에 탑재하여 실시간 이미지 인식 및 객체 감지를 구현하는 것을 목표로 합니다.

특히, 이 프로젝트에서는 Hugging Face의 `yolov8n-infer` 모델을 사용했으며, YOLOv8 시리즈의 가장 작은 버전으로 ESP32의 제한된 리소스를 활용하여 비교적 높은 정확도로 객체 감지를 수행합니다.

실험 결과, ESP32-AI Barista는 100% 정확도로 커피 콩, 커피 그라인더, 커피 머신, 커피 컵을 정확하게 식별했습니다. 이러한 성능은 ESP32의 처리 능력과 `yolov8n-infer` 모델의 효율적인 구조 덕분이라고 할 수 있습니다. 더 나아가, 이 프로젝트는 ESP32를 활용한 AI 모델의 실용적인 응용 가능성을 보여주는 좋은 사례입니다.
- 링 3.0 타이니는 Hugging Face Hub에서 공개된 Hugging Face의 InclusionAI 팀에 의해 훈련된 매우 작은 언어 모델입니다. 이 모델은 단지 13억 개의 파라미터만을 가지고 있습니다.

이 작은 크기에도 불구하고 링 3.0 타이니는 다양한 작업에서 놀라울 정도로 높은 성능을 보여줍니다. 특히 일본어 텍스트 생성 작업에서는 더 큰 모델과 거의 차이 없는 결과물을 만들어 냅니다.

또한 링 3.0 타이니는 저자원 환경에서의 사용을 염두에 두고 설계되어 GPU 메모리 사용량이 매우 적기 때문에 비교적 낮은 사양의 환경에서도 실행할 수 있습니다. 이는 연구자나 개발자들이 더 많은 기기에서 이 모델을 시험해보고 그 가능성을 탐구하는 데 매우 중요한 장점입니다.

더 나아가 이 모델은 다양한 데이터 세트로 훈련되어 폭넓은 지식과 이해력을 갖추고 있습니다. 따라서 다양한 분야의 텍스트 생성 작업에 활용될 수 있습니다.
- FunctionGemma: Google에서 개발한 새로운 대규모 언어 모델(LLM)입니다. 이 모델은 ‘함수 호출’ 기능을 통해 외부 도구와 상호작용하여 더욱 강력하고 유용한 답변을 생성할 수 있도록 설계되었습니다. 

FunctionGemma는 Google 검색, Wolfram Alpha 등 다양한 외부 도구와 사용자 정의 함수를 호출할 수 있습니다. 이를 통해 사용자는 실시간 정보 검색, 복잡한 계산, 특정 작업 수행 등 다양한 작업을 수행할 수 있습니다. 

예를 들어, 사용자가 “오늘 뉴욕의 날씨는?”이라고 질문하면 FunctionGemma는 Google 검색을 통해 실시간 날씨 정보를 가져와 답변을 제공합니다. 또한, “100 곱하기 12345는 얼마인가?”라고 질문하면 Wolfram Alpha를 통해 정확한 계산 결과를 얻을 수 있습니다. 

FunctionGemma의 핵심은 이러한 외부 도구와의 유연한 통합을 통해 사용자의 요구에 더욱 정확하고 효율적으로 대응하는 데 있습니다. 궁극적으로 FunctionGemma는 LLM의 활용 범위를 넓히고, 더욱 지능적인 AI 시스템 구축을 가능하게 할 것으로 기대됩니다.

### 지금 읽고 싶었던 입문서와 RAG, 에이전트들을 모두 담았습니다.

RAG와 AI 에이전트의 기본 작동 방식부터 기업 도입 시 주의사항, 최신 기술(MCP, Agentic RAG) 등 실질적인 내용까지 포괄적으로 설명합니다.

AI 결과의 질을 향상시키는 기법이, 가장 간결하게 정리되었습니다.

**출처:** [note 원문](https://note.com/mumima/n/nd33f29c6f5b0)

*번역: Gemma 3(.44) 초벌 + 교정 65청크*

[원문 보기](https://note.com/mumima/n/nd33f29c6f5b0) | 출처: note.com