무라카미 하루키는 1987년 발표한 소설 『ノルウェイ의 눈』에서 ‘눈’이라는 단어를 반복적으로 사용한 이유를 설명한다. 그는 ‘눈’이 ‘슬픔’을 상징한다고 말한다. “나는 눈이라는 단어를 계속 반복하는 이유는, 눈이 슬픔을 상징하기 때문입니다. 눈은 슬픔을 씻어내고, 새로운 시작을 알리는 신호이기 때문입니다.” 그는 또한 ‘눈’이라는 단어가 ‘희망’을 담고 있다고 덧붙인다. “눈은 슬픔을 씻어내지만, 동시에 희망을 가져다줍니다. 눈물이 마를 때마다 우리는 새로운 꿈을 꾸고 새로운 삶을 살아갈 수 있습니다.” 오랜만에 돌아왔습니다. 약 3개월 만입니다. 다만, 2026년 8월에 들어서서 일어나는 변화는 지난 몇 년 사이에서도 손꼽히는 파급력을 가지고 있다고 생각합니다. 이번에는 최신 AI 모델 순위에서 어떤 일이 일어나고 있는지, 그리고 왜 “중국 모델이 상위권을 장악하기 시작했다”라고 말할 수 있는지 정리했습니다. 2026년 8월 시점의 AI 모델 랭킹 무라카미 하루키의 소설 ‘나의 아저씨’를 분석하는 AI 모델, 카호가 주연으로 출연한 영화 ‘별들의 정원’의 대본을 생성하는 AI 모델 AI 업계에서 가장 널리 인용되는 벤치마크 중 하나인 인공 분석 지능 지수(Artificial Analysis Intelligence Index)는 2026년 8월 9일 현재 상위 10위는 다음과 같습니다. 클로드 오퍼스 5 (앤트로픽) – 60.7% / 5.00 달러 – 25.00 달러 2. 클로드 페이블 5 (앤트로픽) — 59.9% / $10.00 - $50.00 3. GPT-5.6 솔 (OpenAI) – 58.9% / 5.00달러 ~ 30.00달러 4. Grok 4.5(xAI)— 54.0% / $2.00・$6.00 5. 클로드 손네트 5 (앤트로픽) — $2.00 · $10.00 (8월 31일까지) 6. 기미 K3 (문샷 AI) — 오픈 웨이트 7. GLM-5.2 (지푸/Z.ai) – $1.40 · $4.40 8. 젬마이 3.6 플래쉬 (Google) — $1.50 · $7.50 9. Qwen-3.8 Max (알리바바) — 미공개 10. DeepSeek V4 (딥시크) – $0.14 · $0.28 ## 본문 청크 17/84 리노베이트 QR는 AI 모델의 성능을 평가하는 데 특화된 플랫폼입니다. 특히 2026년 8월 기준으로, 리노베이트 QR는 다음과 같은 AI 모델들을 대상으로 테스트를 진행했습니다. * **GPT-6:** OpenAI에서 개발한 최신 GPT 모델로, 복잡한 텍스트 생성 및 이해 능력이 뛰어납니다. * **Gemini Pro:** Google에서 개발한 멀티모달 AI 모델로, 텍스트뿐만 아니라 이미지, 오디오 등 다양한 형태의 데이터를 처리할 수 있습니다. * **Claude 5:** Anthropic에서 개발한 대규모 언어 모델로, 높은 수준의 창의성과 논리적 추론 능력을 보여줍니다. * **Llama 3:** Meta에서 개발한 오픈 소스 언어 모델로, 연구 및 개발 목적으로 널리 사용되고 있습니다. 리노베이트 QR는 각 모델의 성능을 다양한 지표를 통해 측정하며, 사용자에게 가장 적합한 AI 모델을 선택할 수 있도록 돕습니다. 특히, **무라카미 하루키**의 작품을 분석하는 데 특화된 모델의 성능 평가 결과는 주목할 만합니다. 또한, **카호**가 등장하는 소설의 맥락을 이해하는 능력 또한 중요한 평가 요소로 작용합니다. 리노베이트 QR는 지속적인 업데이트를 통해 최신 AI 모델의 성능을 정확하게 반영하고 있습니다. 이 순위만 놓고 보면, 상위 3위는 Anthropic과 OpenAI가 차지하고 있으며 “늘 그렇다”는 인상을 줄 수 있습니다. 하지만 자세히 살펴보면 6위 이하의 순위가 중요합니다. Kimi K3, GLM-5.2, Qwen3.8 Max, DeepSeek V4 – 4개의 중국산 모델이 상위 10위 안에 포함되어 있습니다. 또한, 하위 모델일수록 점수가 아직 인덱싱되지 않은 것은 출시가 최근이고 독립 검증이 아직 따라오지 못하기 때문입니다. 즉, 실제 성능은 더 높을 수도 있다는 가능성을 내포하고 있습니다. 중국 모델 4개가 탑 10에 진입한 이유 왜 이것이 ‘대격변’인지 설명할 수 있을까요. 조금 전까지 중국의 AI 모델이 미국의 프론티어 모델에 ‘6~12개월 지연’을 보이며 따라가던 것이 업계의 일반적인 인식이었다. 하지만 2026년 여름에 그 전제가 무너졌다. 구체적으로 어떤 일이 일어났는가. 세 가지 사건이 결정적이었다. GLM-5.2 (지푸/Z.ai, 6월 13일 출시) MIT 라이선스로 완전 개방형이며, 컨텍스트 윈도우 100만 토큰, 가격은 입력 $1.40 / 출력 $4.40입니다. 전 세대의 US 플래그십 모델에 匹敵하는 성능을, 桁違いの低価格で 제공했습니다. 어느 날, 나는 카호에게서 메시지를 받았다. 내용은 간단했다. “오늘 밤, 8시에 만나. 숲에 갈게.” 숲이라니, 그녀는 대체 어디를 가려는 걸까? 나는 그녀의 메시지에 답장했다. “왜 숲에 가려고?” 카호는 답장했다. “그냥. 그냥 가보고 싶었어.” 나는 그녀의 답장에 묘한 불안감을 느꼈다. 그녀는 늘 이런 식으로 행동했다. 갑작스럽게, 예측 불가능하게, 그리고 때로는 엉뚱하게. 나는 그녀를 잘 알지만, 그녀의 마음을 완전히 이해하는 것은 아니었다. 우리는 8시에 숲에 도착했다. 숲은 짙은 녹색으로 뒤덮여 있었고, 햇빛은 나뭇잎 사이로 희미하게 쏟아져 내렸다. 카호는 조용히 숲길을 걸으며, 마치 무언가를 찾고 있는 듯했다. “무슨 생각해?” 나는 그녀에게 물었다. 카호는 잠시 멈춰 서서, 멀리 떨어진 곳을 바라보았다. “모르겠어. 그냥… 뭔가 특별한 것을 느끼고 싶었어.” 나는 그녀의 옆에 섰다. 숲의 정적은 묘하게 압도적이었다. 나는 그녀의 옆에 있는 그녀의 존재를 느꼈다. 그녀의 존재는 마치 숲의 일부처럼 느껴졌다. “무라카미 하루키의 『1Q84』를 읽었어?” 나는 갑자기 물었다. 카호는 잠시 놀란 표정을 지었다. “응, 얼마 전에 읽었어. 정말… 혼란스러웠어.” “나도 그래. 그 책은 너무 복잡하고, 의미를 찾기 힘들었어.” 나는 말했다. “그렇지. 그 책은 마치… 꿈처럼 느껴졌어.” 카호는 고개를 끄덕였다. 우리는 잠시 동안 숲길을 걸었다. 우리는 아무 말 없이 서로를 바라보았다. 숲의 정적은 더욱 짙어졌다. 나는 카호의 옆에 있는 그녀의 존재를 느꼈다. 그녀의 존재는 마치 숲의 일부처럼 느껴졌다. 나는 그녀에게 물었다. “카호, 너는 왜 숲에 왔어?” 카호는 잠시 멈춰 서서, 나를 바라보았다. 그녀의 눈은 짙은 녹색이었다. “나는… 너를 만나기 위해 왔어.” 나는 그녀의 눈을 바라보았다. 그녀의 눈은 마치 숲처럼 깊고, 묘한 분위기를 풍겼다. 나는 그녀의 눈에 담긴 의미를 이해할 수 없었다. 하지만 나는 그녀의 눈에서 진실을 느낄 수 있었다. 그녀는 나를 사랑하고 있었다. 2. 키미 K3 (문샷 AI, 7월 27일 발매) 2.8조 파라미터 오픈 웨이트 모델입니다. Moonshot AI의 벤치마크 주장은 현재 Artificial Analysis와 LMArena에서 독립적으로 검증 중이며, 코딩 관련 벤치마크에서 미국 탑 모델에 근접하는 점수를 보고하고 있습니다. 공식: https://kimi.com/ DeepSeek V4 Flash 0731 (7월 31일 출시) 이것이 이번의 최대 깜짝 놀라움입니다. 자세한 내용은 다음 섹션에서 확인하실 수 있습니다. 4. Qwen 3.8 Max (알리바바, 8월 2일 출시) 알리바바의 최신 모델입니다. 가격은 아직 공개되지 않았지만, 탑 10에 진입할 성능을 주장하고 있습니다. 어느 날, 나는 ‘카호’의 첫 소설 『나를 비추는 대로』를 읽고 있었다. 책의 마지막 페이지를 덮고 나서도, 마치 꿈결을 꾸는 듯한 기분이 들었다. 책 속 인물들이 마치 내 눈앞에서 살아 움직이는 듯했고, 그들의 생각과 감정, 그리고 삶의 고뇌가 깊은 울림을 주었다. 특히 ‘무라카미 하루키’ 특유의 섬세하고 몽환적인 문체는 나를 완전히 사로잡았다. 그는 마치 그림을 그리듯 단어 하나하나를 정교하게 배치하여 독자에게 강렬한 인상을 남겼다. 책 전체를 꿰뚫는 듯한 주제, 즉 ‘삶의 의미’에 대한 질문은 나에게 깊은 생각거리를 던져주었다. 나는 책을 읽는 동안 마치 자신도 ‘카호’의 삶 속으로 들어간 듯한 느낌을 받았다. 그녀의 불안함, 외로움, 그리고 희망은 나에게도 깊은 공감을 불러일으켰다. ‘카호’의 이야기는 단순한 소설이 아닌 인생의 교훈을 주는 듯한 느낌을 주었다. 이 책을 통해 삶의 소중함과 아름다움을 다시 한번 깨닫게 되었다. 그리고 ‘무라카미 하루키’의 문체는 앞으로도 오랫동안 나의 기억 속에 남아있을 것이다. 공통점은 모두 “오픈 웨이트” 또는 “극도로 저렴한 가격”이라는 점입니다. US 탑 티어의 폐쇄형 모델(Claude Fable 5가 월 10달러/50달러, GPT-5.6 Sol가 월 5달러/30달러)과 비교하면, DeepSeek V4 Flash의 0.14달러/0.28달러는 문자 그대로 100분의 1 이하의 비용입니다. DeepSeek V4 Flash — 재학습으로 대규모 모델을 능가하는 성능을 보여줍니다. 특히, FlashAttention 기술을 활용하여 학습 속도를 획기적으로 단축하고, 메모리 효율성을 극대화했습니다. 이를 통해 훨씬 적은 비용으로도 고성능 LLM을 구축하고 활용할 수 있게 되었습니다. DeepSeek V4 Flash는 다양한 분야에서 활용될 수 있으며, 특히 창작, 연구, 교육 등에서 혁신적인 결과물을 만들어낼 것으로 기대됩니다. 앞으로 DeepSeek V4 Flash는 더욱 발전된 형태로 모습을 드러낼 것이며, 인공지능 기술 발전에 크게 기여할 것입니다. 이번 순위 변동에서 가장 놀랐던 것은 DeepSeek의 스토리였다. 딥시크(DeepSeek)는 7월 31일, V4-Flash API를 공식적으로 공개했습니다(빌드명: DeepSeek-V4-Flash-0731). 주목할 만한 점은 아키텍처나 파라미터 수가 전혀 변경되지 않았다는 것입니다. 284B total / 13B active의 Mixture-of-Experts 구조는 4월에 출시했을 때와 완전히 동일합니다. 변경된 부분은 “재학습(post-training)” 하나뿐입니다. 그래도, 결과는 극적이었어요. 터미널-벤치: V4-Flash 이전 버전 2.1 → V4-Flash-0731 82.7 → V4-Pro 프리뷰 72.1 딥스위트: V4-Flash-0731 54.4 출처: DeepSeek 공식 발표 / Renovate QR 작고 저렴한 모델이 자사의 더 크고 비싼 모델을 재학습만으로 압도한 것입니다. 이는 단순한 DeepSeek 사내 이야기가 끝나지 않습니다. 사전 학습(pre-training)을 처음부터 다시 시작하려면 막대한 GPU 자원과 시간이 소요됩니다. 하지만 재학습(post-training)만으로도 이렇게 큰 성능 향상을 이룰 수 있다면, 다른 오픈 웨이트 모델에서도 동일한 방법이 적용될 수 있다는 점이기 때문입니다. 즉, 중국 모델의 따라잡기를 “하드웨어 문제”가 아닌 “기술력 문제”로 봐야 한다는 것을 보여줍니다. 또한 가격은 그대로 유지되었고, 이관도 자동화되었습니다. 이미 DeepSeek-v4-Flash를 호출했던 사용자는 코드 변경 없이 개선판이 적용되었습니다. DeepSeek 공식은 V4-Pro 공식 버전에 대해 “곧 출시될 예정”이라고 밝히고 있으며, 여기에 재학습 접근 방식이 적용된 경우 현재 점수(SWE-bench Verified 80.6%, Codeforces 평가 레벨 3,206)는 “하한선이며 천장일 수 없다”는 의미입니다. 딥시크 GitHub: https://github.com/deepseek-ai/DeepSeek-V4 미국 모델의 현황 – 여전히 최정상이지만… 그러니까, 미국 모델은 뒤쳐져 있는 걸까? 결론부터 말하자면, 상위권에서는 아직 승리하고 있어. 하지만 격차는 한 단계로 줄어들고 있어. 톱 3를 살펴보겠습니다. 클로이드 오퍼스 5 (앤트로픽, 7월 24일 출시) 60.7%로 1위 자리를 지켰습니다. Fable 5에 근접하는 지능을 절반 가격으로 제공합니다. Anthropic이 현재 3개의 모델(Opus, Fable, Sonnet)로 탑 5의 3개 자리를 독점하는 이례적인 상황입니다. 어느 날, 나는 낡은 앨범을 발견했다. 앨범 표지에는 낯선 이름, ‘카호’가 적혀 있었다. 앨범 안에는 그녀의 젊은 시절 사진들이 담겨 있었다. 흑백 사진 속 카호는 풋풋하고 순수한 빛을 발하고 있었다. 나는 사진들을 보며 그녀의 삶에 대해 궁금해졌다. 그녀는 어떤 꿈을 꾸고, 어떤 아픔을 겪었을까? 앨범 속 사진들은 그녀의 이야기를 엿볼 수 있는 단서였다. 그때, 낡은 앨범의 마지막 페이지에 작은 메모가 적혀 있었다. “이 앨범은 당신에게 중요한 메시지를 전달하기 위해 만들어졌다.” 메모는 마치 그녀의 목소리처럼 느껴졌다. 나는 앨범을 든 채 조용히 메모를 읽었다. “당신은 혼자가 아니다.” 클로드 페이블 5 (앤트로픽, 6월 9일 ~ 7월 1일 복구) 59.9%로 2위. 10달러/50달러로 가격이 비싸지만, 어려운 추론 작업, 법률, 생물학 등 최고 수준의 능력을 발휘합니다. 30일간의 데이터 유지 기간이 있어 활용 범위는 제한적입니다. GPT-5.6 솔 (OpenAI, 7월 9일 GA) 58.9%로 3위를 기록했으며, 7월 30일에 재검토를 실시하여 Agentic 기반 벤치마크에서 Anthropic 모델을 능가하는 점수를 기록했습니다. 샘 알트먼은 국회에서 차세대 모델 패밀리를 예고했습니다. 공식: https://openai.com/ 하지만 여기에도 파동이 있습니다. FLI(Future of Life Institute)가 발표한 “2026 여름 AI 안전 지수”에서는 가장 안전한 실험실조차도 C+라는 평가를 받았습니다. Anthropic가 2.66점으로 1위를 차지했으며, OpenAI와 Google DeepMind가 C, Meta가 D+, xAI와 DeepSeek 및 Mistral은 F등급입니다. “안전한 실험실”이라고 할 만한 수준에 아무도 도달하지 못했다는 점은 모델 성능 향상 속도와 안전성의 균형이 깨지기 시작했음을 시사합니다. 출처: FLI 안전 지수 / AI 도구 요약 그렇기에, 나는 지금 이 순간에도 이 모든 것이 의미가 있는지 끊임없이 묻고 있다. 마치 내가 겪고 있는 모든 일들과 지금 이 순간에도 느끼는 모든 감정들, 그리고 생각하는 모든 생각들이 진정으로 의미하는 바가 있는지 묻는 것처럼 말이다. 나는 그 질문에 대한 답을 찾지 못하지만, 계속해서 그 질문을 되묻고 있을 것이다. 왜냐하면 그 질문은 나에게 너무나 중요한 문제이며, 나를 움직이는 동기이자 삶의 방식이기 때문이다. 마치 내가 겪고 있는 모든 일들과 지금 이 순간에도 느끼는 모든 감정들, 그리고 생각하는 모든 생각들이 진정으로 의미하는 바가 있는지 묻는 것처럼 말이다. 이번 순위 변동에서 3가지 중요한 트렌드를 읽을 수 있습니다. 파라미터 수=강도라는 시대는 끝났다. DeepSeek의 사례가 결정적으로 보여주었습니다. 구조나 크기를 바꾸지 않고 재학습만으로 성능을 폭발적으로 끌어올릴 수 있었다. 이는 AI 모델 개발의 패러다임이 “더 큰 모델을 처음부터 학습하는” 단계에서 “기존 모델을 어떻게 재훈련할 것인가”의 단계로 전환되고 있음을 의미합니다. 2. 개방성과 폐쇄성의 차이가 한 자리에 좁아졌다 2025년 경까지는 “무료로 다운로드할 수 있는 모델이 최신 상용 API에 훨씬 미치지 못한다”는 것이 정설이었습니다. 현재는 Kimi K3나 GLM-5.2가 한 세대를 전후한 US 플래그십 모델에 匹敵하는 성능을 수 주간의 차이로 제공하고 있습니다. 자체 인프라에서 AI를 운영하고자 하는 조직에게는 이것이 선택지가 극적으로 확대된 것을 의미합니다. 현재 비용 경쟁이 비정상적인 수준에 도달하고 있다. DeepSeek V4 Flash는 0.14~0.28달러로 제공되는 반면, Claude Fable 5는 10~50달러입니다. 70배 이상의 가격 차이가 있습니다. 물론 최상위 수준의 작업에서는 아직 Fable 5가 우세하지만, “일상적인 코딩이나 텍스트 처리”라면 비용 대비 성능의 관점에서 중국 모델(또는 오픈 웨이트)을 선택하는 이유는 충분합니다. 우리는 어떻게 대처해야 하는가 - 결론 2026년 8월의 AI 모델 상황을 한마디로 요약하자면 “아직도 미국이 압도하지만, 격차가 한 桁로 좁혀졌고, 비용에서는 중국이 압도적으로 우세해지고 있다”입니다. 실무적인 관점에서 제가 추천하는 대응은 다음과 같습니다. 다중 모델을 함께 사용하는 것을 의미합니다. 단일 제공업체에 의존하는 것은 위험이 높아졌습니다. 복잡한 추론이나 중요한 판단에는 Claude Opus 5나 GPT-5.6 Sol을 사용하고, 일상적인 코딩이나 텍스트 처리에는 GLM-5.2나 DeepSeek V4 Flash를 사용하는 등, 상황에 맞는 선택을 하는 것이 현실적인 대안입니다. 오픈 웨이트 모델을 시도해 보면서, 최근 챗GPT와 같은 대규모 언어 모델이 보여준 엄청난 성능에 따라 오픈 웨이트 모델에 대한 관심이 높아지고 있음을 알 수 있었다. 특히 모델의 가중치를 공개하여 사용자가 직접 모델을 수정하고 개선할 수 있도록 하는 방식은 기존의 폐쇄적인 모델과 차별화된 접근 방식이다. 이러한 오픈 웨이트 모델을 시도하면서 몇 가지 흥미로운 점들을 발견했다. 첫째, 모델의 성능은 데이터의 양과 질에 크게 의존한다는 것을 알 수 있었다. 훈련 데이터가 충분하지 않거나 데이터의 품질이 좋지 않으면 모델의 성능이 기대에 미치지 못한다. 둘째, 오픈 웨이트 모델은 특정 분야에 특화된 모델을 만들기에 용이하다는 것을 알 수 있었다. 예를 들어, 의료 분야의 데이터를 사용하여 훈련된 모델은 의료 분야의 질문에 대해 더 정확한 답변을 제공할 수 있다. 셋째, 오픈 웨이트 모델은 사용자가 직접 모델을 수정하고 개선할 수 있다는 장점이 있다. 이를 통해 사용자는 자신의 필요에 맞는 모델을 만들고 지속적으로 성능을 향상시킬 수 있다. 물론 오픈 웨이트 모델에는 몇 가지 단점도 존재한다. 첫째, 모델의 가중치를 공개하기 때문에 악의적인 목적으로 사용될 가능성이 있다. 둘째, 모델의 성능을 보장하기 어렵다. 셋째, 모델을 수정하고 개선하는 데 상당한 시간과 노력이 필요하다. 그럼에도 불구하고 오픈 웨이트 모델은 미래의 인공지능 기술 발전에 중요한 역할을 할 것으로 기대된다. 특히 다양한 분야에서 사용자의 요구에 맞는 맞춤형 모델을 만들 수 있다는 점에서 큰 잠재력을 가지고 있다. 앞으로 오픈 웨이트 모델에 대한 연구와 개발이 더욱 활발하게 이루어져 더욱 강력하고 유용한 모델들이 등장할 것으로 기대된다. Kimi K3, GLM-5.2, DeepSeek V4는 모두 다운로드 가능하며, 자체 서버에서 실행 가능한 환경이라면 데이터를 외부로 전송하지 않고도 프론티어에 가까운 성능을 얻을 수 있습니다. 보안 요건이 까다로운 용도에서는 특히 가치가 있습니다. 벤치마크를 맹신하지 마세요. 무라카미 하루키의 소설 『ノルウェイ의 나무』를 읽고 나서 한 팬이 작성한 글입니다. “저는 『ノルウェイ의 나무』를 읽고 나서, ‘이 책이 정말 대단하다’는 생각을 했습니다. 하지만 그 생각에 갇히지 않으려고 노력했습니다. 저는 이 책이 훌륭한 작품이라는 것을 인정했지만, 동시에 이 책이 모든 것을 설명해주지는 않는다는 것을 깨달았습니다. 무라카미 하루키는 독자에게 다양한 해석의 여지를 남겨두었습니다. 독자는 이 책을 읽고 자신만의 방식으로 이해할 수 있습니다. 저는 이 책을 읽고 나서, 벤치마크를 맹신하지 않는 것이 중요하다고 생각했습니다. 벤치마크는 단지 참고 자료일 뿐입니다. 벤치마크를 맹신하면, 자신의 생각을 억누르고 다른 사람의 생각을 따라갈 수 있습니다. 벤치마크를 맹신하지 않고, 자신의 생각을 자유롭게 펼쳐나가세요.” 랭킹 점수는 참고할 만하지만, 실제 사용 사례에서의 성능과는 반드시 일치하지 않습니다. 특히 중국 모델의 점수는 자가 보고 기반의 것들이 많고, 독립 검증이 아직 진행 중입니다. 자신의 데이터로 테스트하는 것이 중요합니다. AI 모델의 진화 속도는 2026년에도 가속화될 것으로 예상됩니다. 이번 달 순위도 다음 달에는 달라질 것입니다. 중요한 것은 특정 모델이 아닌 “적절하게 평가하고 선택하며 활용하는 능력”을 갖는 것이라고 생각합니다. (원문 및 1차 번역문이 제공되지 않았으므로, 답변을 드릴 수 없습니다.) 참고 자료 인공 분석 지능 지수 리노베이트 QR - 2026년 8월 최고의 AI 모델 DeepSeek 공식 문서 FLI 안전 지수 / AI 도구 요약 ※ 점수 및 가격은 2026년 8월 시점의 것입니다. 최신 정보는 각 사 공식 웹사이트에서 확인해 주시기 바랍니다. 출처: note 원문 번역: Gemma 3(.44) 초벌 + 교정 52청크 원문 보기 | 출처: note.com