🧪제노 랩 검증|이번에는 6개 모델 모두를 직접 계약하고 동일 환경에서 실행한 비교는 아닙니다. 각사의 공식 발표와 Artificial Analysis, Arena, DeepSWE 등의 공개 데이터를 수집하여 업데이트일과 평가 조건을 확인한 후 동일한 기준으로 재정렬하여 비교했습니다. 벤더 공표값과 제3자 측정값은 분리하여 처리합니다.
2026년 9월, 인공지능의 세력 지도가 단 며칠 만에 바뀌었습니다. 9월 1일, Anthropic이 Claude Fable 5.1을 공개했습니다. 다음 날인 2일에는 Google이 Gemini 3.8 Flash, Alibaba Cloud가 Qwen3.8-Max-0902를 출시했습니다. 그리고 9월 3일에는 OpenAI가 GPT-6 Astra를 발표했습니다. 8월에는 이미 Grok 4.6와 DeepSeek V4 Pro 0813도 등장했습니다. 새로운 모델이 나올 때마다 “역대 최고”, “가장 현명하다”, “프론티어급”이라는 표현이 쏟아졌습니다. 과연 무엇이 가장 강력한 걸까요? 공개 데이터를 횡단해 보면, 답은 생각보다 단순하지 않았습니다. 종합 지능만 놓고 보면 Claude Fable 5.1이 선두였습니다. 그러나 코딩, PC 조작, 속도, 비용까지 고려하면, 승자는 계속해서 바뀌게 되었습니다. 이 기사에서는 순위를 하나 만들어 끝내는 것이 아니라, “무엇을 시키느냐”에 따라 인공지능의 모습이 얼마나 달라지는지를 정리합니다.
사전에 결론: “최강의 1모델”을 선택하는 시대가 아닙니다.
이번 공개 데이터 검증 결과, 다음과 같은 결론을 얻었습니다.
어려운 추론 및 지식 기반 업무에 적합합니다 | Claude Fable 5.1
이번 유력 후보는 Claude Fable 5.1 인공 분석 지능 지수 66으로, 이번 비교 모델 중 가장 높은 수치를 보이며, 복잡한 추론이나 지식 기반의 한계를 목표로 하는 후보입니다.
PC 운영부터 시작하여, 필요한 모든 업무를 효율적으로 해결할 수 있도록 최선을 다해 지원하겠습니다.
이번에 유력한 후보는 GPT-6로, Astra와 OpenAI에서 발표한 컴퓨터 사용/전문 분야 평가가 강력하며, 브라우저나 PC 조작을 포함한 복잡한 실무 에이전트에서 주목할 만합니다.
코딩을 빠르게 실행하려면 | Gemini 3.8 플래시 / GPT-6 아스트라
현재 유력 후보는 Gemini 3.8 Flash/GPT-6 Astra이다. OpenAI가 Astra 발표 시점에 공개한 DeepSWE v1.1 비교에서는 Astra 74.1%, Gemini 73.8%였다. 다만 DeepSWE 공식 라이브 Leaderboard는 2026년 8월 7일 업데이트 기준으로, 이 3모델은 아직 미수록이다. Gemini는 별도로 속도와 가격에서도 강점을 가지고 있다.
지능과 API 가격의 균형을 찾아서 | Grok 4.6
이번에 유력한 후보는 Grok 4.6입니다. 지능 지수는 61점으로 Astra와 동률을 이루면서 API 단가는 훨씬 저렴합니다. 성능뿐만 아니라 비용을 고려했을 때 존재감이 더욱 커질 것입니다.
개방형 가중치와 운영 자유도를 갖춘|DeepSeek V4 Pro
이번에 유력한 후보는 DeepSeek V4 Pro1M으로, 넓은 컨텍스트와 강화된 에이전트 능력을 가지고 있으며, 제3자 평가에서도 Intelligence Index 53을 기록했습니다. 자유도와 비용을 우선시한다면 다른 매력적인 부분도 발견됩니다.
1M 컨텍스트와 알리바바 환경에서 | Qwen3.8-Max-0902
이번에 유력한 후보는 Qwen3.8-Max-09021M 모델로, 장기 Coding과 멀티 툴 오케스트레이션을 강화하며 컨텍스트를 유지합니다. 알리바바 기반 툴까지 고려할 경우 유력한 후보가 됩니다. 즉, 이번 검증에서는 “Claude가 1위니까 Claude를 사용하면 된다”는 식으로 단순하게 결정할 수 없었습니다. 모델 선택은 스마트폰 벤치마크 순위를 선택하는 것보다 팀 채용에 더 가깝습니다. 사고력이 필요한지, 작업을 끝까지 완료해야 하는지, 대량 처리를 해야 하는지, 아니면 저렴하게 운영해야 하는지에 따라 최적의 솔루션이 달라집니다.
이번에 무엇을 비교했는지
이는 상당히 중요합니다. 모델 각社가 공개하는 벤치마크에는 추론 노력, 활용 도구, 에이전트 하니스, 테스트 버전 등에 차이가 있습니다. 예를 들어 “Terminal-Bench”라고 표기하더라도 v2.1, v3.0, v4.0에서는 다른 평가 결과가 나타납니다. 따라서 이번에는 다음 3단계로 정보를 분류했습니다.
- 공식 정보: 모델 위치, 가격, 컨텍스트, 공식 벤치마크
- 제3자의 공통 평가: 주로 인공지능 지수, 속도, 작업당 비용
- 특정 용도의 공개 리더보드: 아레나 등 인간 투표나 동일 하네스의 공개 결과입니다. DeepSWE의 경우에는 공식 리더보드 업데이트일까지 확인하고, 벤더 발표에만 올라가는 신모델 값은 별도로 처리합니다.
서로 다른 버전의 숫자를 억지로 섞어 독자적인 “100점 만점 종합 랭킹”으로 변환하지 않았습니다. 이 방식이 덜 화려하지만, AI 비교에서는 이것이 더 중요하다고 생각합니다.
라운드 1|“지능”만 놓고 보면 Claude Fable 5.1이 강력하다
먼저 인공 분석의 지능 지수를 확인합니다. 이는 지식, 과학, 전문 업무, 에이전트, 장문 추론 등 여러 평가를 결합한 지표입니다. 완벽한 만능 점수는 아니지만, 동일한 평가 주체가 다른 회사의 모델을 평가하는 데 사용되므로 이번 기준점으로서 활용하기에 유용합니다.
지능 지수|공개 데이터 순위
1위 클로드 페이블 5.1 맥스 (662위 GPT-6 아스트라 맥스, 612위 Grok 4.6 하이, 614위 제미니 3.8 플래쉬 하이, 595위 Qwen3.8 맥스, 586위 DeepSeek V4 Pro 0813 맥스)입니다. 숫자만 놓고 보면 페이블 5.1이 한 단계 앞서 있습니다. 하지만 이 순위는 인공지능 분석의 Intelligence Index라는 하나의 지표일 뿐입니다. 속도, 비용, 에이전트 성능까지 고려하면 상황은 완전히 달라질 것입니다.
여기만 보면 Fable 5.1의 승리는 명확합니다. 인공 분석에서는 최대 노력 시점에 66을 기록하여, 해당 회사가 측정한 결과 공개 시점의 최고치였습니다. Humanity’s Last Exam에서는 59.1%, Terminal-Bench v2.1에서는 91.4%, SciCode에서는 62.0%로 보고되었습니다. 다만 한 가지 주의할 점이 있습니다. 인공 분석의 Fable 5.1 평가에서는 Anthropic의 서버 측 fallback이 활성화되어 있으며, 안전상의 이유로 플래그된 일부 요청이 Claude Opus 4.8 또는 Opus 5로 분배되고 있습니다. 인공 분석에 따르면, Intelligence Index 평가에서 출력 토큰의 약 4%가 fallback이었습니다. 즉, 66이라는 숫자는 매우 강하지만, 완전히 Fable 5.1만을 고립시켜 비교한 것은 아니라는 점을 기억해야 합니다. 그럼에도 불구하고, 어려운 지식 작업이나 추론을 중시한다면 Fable 5.1이 현재 가장 유력한 후보 중 하나라는 결론은 변하지 않습니다.
라운드 2|하지만 “신속함”을 강조하는 순간, Gemini의 풍경은 완전히 달라진다.
다음으로 출력 속도를 확인합니다. 인공 분석 측정 결과, Gemini 3.8 Flash High는 305.5 토큰/초, Fable 5.1 Max는 약 66.4 토큰/초, Grok 4.6 High는 64.9, DeepSeek V4 Pro 0813는 60.2, Qwen3.8 Max는 38.8입니다. Astra는 출시 직후이므로 해당 페이지에서는 속도 데이터가 아직 N/A(해당 없음)로 표시되었습니다.
게미니 3.8 플래시 하이
속도: 305.5 tok/s|작업당 비용: $0.58
이번에 확인된 내용 중에서는 속도가 돋보였습니다. 많은 처리를 빠르고 효율적으로 진행하고 싶을 때 매우 두드러집니다.
클로드 페이블 5.1 맥스
속도: 66.4 tok/s|작업당 비용: $3.69 지능 지수에서는 1위를 차지하지만, 속도와 비용까지 고려했을 때 “최고 성능에 걸맞은 비용이 소요되는” 위치입니다.
Grok 4.6 High
속도: 64.9 tok/s | 작업당 비용: $0.94. 속도는 Fable과 매우 가깝고, Index 61을 유지하면서 비용을 절감하는 점이 특징입니다.
딥시크 V4 프로 0813 맥스
속도: 60.2 tok/s | 작업당 비용: $0.27 이번 가격으로는 가장 저렴하며, 절대 성능만으로는 알 수 없는 가격 대비 강력한 성능을 제공합니다.
Qwen3.8 Max
속도: 38.8 토크/초 | 작업당 비용: 0.91달러. 속도는 다소 낮지만, 1M 컨텍스트와 같은 별도의 강점을 가지고 있습니다.
GPT-6 아스트라 맥스
속도: N/A | 작업 비용: $1.67 릴리즈 직후이므로 동일 측정 페이지에서는 속도가 아직 N/A입니다. 미측정치를 추정하여 비교에 반영하지 않았습니다.
여기서 특히 흥미로웠던 부분입니다. 페이블 5.1은 인덱스 66이며, 1개 작업당 추정 비용은 3.69달러입니다. 반면 젬니 3.8 플래시는 인덱스 59이며, 비용은 0.58달러입니다. 7점의 지능 차이에도 불구하고 인공 분석의 동 평가로 진행된 작업 비용은 약 6분의 1입니다. 더불어 속도는 젬니가 약 4.6배 더 빠릅니다. “최고 성능이 필요한 1회”와 “충분히 고성능 AI를 100회 실행하는 작업”에서는 선택하는 모델이 동일하지 않을 수 있습니다.
제노의 독자적인 재계산|1달러로 얼마의 “지능 지수”를 구매할 수 있을까
여기서는 동일한 Artificial Analysis의 두 가지 공개 값을 사용하여 ZENO 측에서도 한 단계 더 계산해 보겠습니다. 계산식은 Artificial Analysis Intelligence Index를 Cost per Intelligence Index task로 나눈 것입니다. 이는 Artificial Analysis의 공식 지표가 아니며, ZENO LAB이 가격 효율을 직관적으로 보기 위해 만든 단순한 비율입니다. Intelligence Index를 선형적인 가치로 취급하는 데는 한계가 있으므로, “성능 순위”가 아닌 예산 효율의 참고 지표로 활용해 주세요. 1위는 DeepSeek V4 Pro 0813(약 196.3 point / $Index 53 ÷ $0.27)이며, 절대 성능에서는 6모델 최하위이지만 1달러당 기준으로 역전합니다. 2위는 Gemini 3.8 Flash(약 101.7 point / $Index 59 ÷ $0.58)로 높은 지능 수준과 낮은 비용을 동시에 가지고 있습니다. 3위는 Grok 4.6(약 64.9 point / $Index 61 ÷ $0.94)이며, Astra와 동일한 Index 61에서도 비용 효율은 크게 다릅니다. 4위는 Qwen3.8 Max(약 63.7 point / $Index 58 ÷ $0.91)로 Grok와 거의 동 수준의 가격 효율입니다. 5위는 GPT-6 Astra(약 36.5 point / $Index 61 ÷ $1.67)로 절대 성능은 높은 편이지만, 가격 효율만으로는 중위권 이하가 됩니다. 6위는 Claude Fable 5.1(약 17.9 point / $Index 66 ÷ $3.69)입니다. 가장 고도화된 지능을 획득하기 위해 노력하는 대신, 1달러당 효율은 가장 낮은 결과를 가져왔습니다. 이러한 재계산에서 드러나는 것은 “가장 현명한 AI”와 “가장 비용 효율적인 AI”는 완전히 다른 존재라는 것입니다. Google이 Flash라는 이름을 붙인 이유가 상당히 명확하게 숫자에 나타나고 있습니다. 또한 Google 자체는 3.8 Flash는 복잡한 작업에서 이전보다 더 많은 추론을 수행하고, 도구를 반복적으로 호출하는 경우에 발생한다고 설명하고 있습니다. 토큰 단가가 같더라도 실제 1 작업 비용이 3.7 Flash보다 증가하는 경우도 있기 때문에 “단가가 싸다는 것은 반드시 총액도 낮다는 것”은 아닙니다.
라운드 3|코딩 분야에서 ASTRA와 제미니가 급부상
다음으로 소프트웨어 개발에서는 어떻게でしょうか. 장시간의 구현 과제를 측정하는 DeepSWE v1.1에 대해 먼저 출처를 분리하겠습니다. DeepSWE 공식 라이브 Leaderboard는 2026년 8월 7일에 업데이트되었으며, 현재 시점에서는 GPT-6 Astra, Gemini 3.8 Flash, Claude Fable 5.1을 아직 게시하지 않습니다. 즉, 최신 3개 모델을 공식 Leaderboard에서 직접 비교하는 것은 9월 5일 시점에서는 불가능합니다. 반면, OpenAI가 Astra 발표 시점에 공개한 크로스 모델 비교에서는 DeepSWE v1.1이 Astra 74.1%, Gemini 73.8%, Fable 5.1 67.4%였습니다. 더욱이 Terminal-Bench 4.0에서는 Astra 57.9%, Fable 5.1 55.8%, Gemini 3.8 Flash 19.1%였습니다. 이는 중요하므로, ZENO LAB에서는 “OpenAI 공표의 비교값”으로 취급합니다. 독립 Leaderboard에서 확인된 값과는 다르게 취급합니다. 같은 “Coding”이라는 단어임에도 불구하고 결과가 크게 다릅니다. DeepSWE는 장시간의 소프트웨어 엔지니어링에 초점을 맞춘 평가 방식입니다. 반면 Terminal-Bench는 터미널을 사용한 보다 광범위한 에이전트 작업까지 포함합니다. 즉, Gemini는 “코드 작성 능력”으로 매우 뛰어나지만, 보다 넓은 환경 조작이나 복잡한 에이전트 수행까지는 동일한 수준이 아닐 수 있습니다. 벤치마크 이름 대신 “그 시험이 어떤 작업을 측정하는지”를 확인하는 것이 중요합니다.
라운드 4|사람들이 선택하자, 순위는 더욱 무너진다
벤치마크만으로는 “사람이 실제로 어떤 출력을 더 선호하는지”를 알 수 없습니다. 그래서 익명의 출력 비교를 대량의 투표로 순위화하는 Arena도 확인했습니다.
웹 개발 분야에서 Fable 5.1이 1위를, Qwen 최신 업데이트 버전이 2위를 차지했습니다.
2026년 9월 2일 Code Arena WebDev에서는 클로드 페이블 5.1 Max가 1위(점수 1765), Qwen3.8-Max-0902가 2위(1688, 예비), Grok 4.6 High가 7위(1629, 예비)였습니다. 인공 분석에서는 Qwen3.8 Max의 지능 지수가 58로 페이블의 66을 밑돌지만, WebDev의 인간 선호도에서는 업데이트된 Qwen이 2위까지 올라왔습니다.
한편, 비즈니스 분야에서는 Gemini가 Fable을 능가했다.
9월 2일 Text Arena “비즈니스, 경영 및 재무 운영” 평가에서 Style Control 없이 Gemini 3.8 Flash High는 6위(1495±18), Qwen3.8 Max는 8위(1486±12), Claude Fable 5.1 Max는 9위(1482±25)를 기록했습니다. 반면, Text Arena 전체 평가 중 Style Control 없이 Fable 5.1 Max가 1위를, Gemini 3.8 Flash High가 6위를 차지했습니다.
🔬 공개 테스트 4의 결론|Fable 5.1은 종합 및 WebDev 분야에서 매우 강력하다. 하지만 비즈니스 분야의 인간 선호도에서는 Gemini나 Qwen이 상위에 랭크될 것이다. 즉, “종합 지능 1위 = 어떤 일でも 가장 선호되는” 것은 아니다.
Arena의 신 모델은 아직 투표 수가 적어 초기 평가 결과로 표기된 것들이 있습니다. 특히 Qwen 3.8-Max-0902와 Grok 4.6의 순위는 앞으로 변동될 수 있습니다. 출처: Code Arena WebDev / Text Arena Business / Text Arena Overall
라운드 5|아스트라의 본마루는 ‘채팅의 지혜’가 아닌, 일을 움직이는 것일지도 모른다
GPT-6 Astra를 인텔리전스 지수 61로만 판단하면 Fable 5.1에 뒤쳐집니다. 하지만 Astra 발표를 보면 OpenAI가 목표로 하는 위치가 조금 다릅니다. OpenAI는 Astra를 컴퓨터 사용, 브라우징, 소프트웨어 엔지니어링, 전문 업무, 복잡한 다단계 업무를 위한 모델로 선보이고 있습니다. 회사 발표에 따르면, 실제 소프트웨어를 조작하는 Agents' Last Exam에서는 59.3%, 업무 자동화의 AutomationBench에서는 41.4%, CAD 업무의 BenchCAD에서는 95.9%를 기록했습니다. AutomationBench에서는 Fable 5.1이 31.4%, BenchCAD에서는 84.3%로 OpenAI가 제시했습니다. 물론 이는 OpenAI가 공개한 평가 결과일 뿐이며, 제3자의 완전 독립 평가와는 동등하게 취급될 수 없습니다. 그럼에도 불구하고 Astra의 방향성은 분명합니다. “질문에 가장 잘 답변하는 AI”보다 “PC에서 작업을 완료하는 AI”로 중점을 옮기고 있습니다. ChatGPT로 앞으로 Astra를 선택하는 이유는 단순한 문장 생성의 차이보다 여기서 나타날 수 있습니다. 참고로 9월 5일 현재, Astra는 단계적 롤아웃 중입니다. OpenAI의 Release Notes에서는 먼저 제한적인 조직에 제공하고, 더 넓은 사용자에게 순차적으로 확산할 것이라고 설명하고 있습니다.
라운드 5|Grok 4.6은 “61점”이라는 평가가 다르다.
이번에 개인적으로 숫자들을 살펴보면서 상당히 흥미로웠던 점은 Grok 4.6입니다. Artificial Analysis의 Intelligence Index는 61로, GPT-6 Astra와 동률입니다. 그러나 API 가격은 Grok 4.6이 토큰당 100만 개에 입력 2달러, 출력이 6달러인 반면, Astra는 입력 10달러, 출력이 50달러입니다. 물론 가격표만으로는 실제 비용이 결정되지 않는다는 점입니다. 모델에 따라 필요한 사고 토큰이나 출력이 다르기 때문입니다. 그래서 Artificial Analysis의 Cost per Intelligence Index task를 살펴보면 Grok는 0.94달러, Astra는 1.67달러입니다. 단가 차이만큼 크지는 않지만, 실타스크 기준으로도 Grok가 더 저렴하다는 결과입니다. Grok 4.6은 속도가 약 64.9 tok/s로 Gemini만큼 빠르지는 않으며, 컨텍스트는 500k로 다른 1M 세력보다 작습니다. 그럼에도 불구하고 “상당히 저렴한 가격으로 API를 통해 ‘프론티어급의 지능’을 활용하고자 하는” 용도에서는 무시할 수 없는 위치에 있습니다. SpaceXAI 자체도 4.6을 long-running agents와 interactive / visual work에 중점을 둔 모델로 설명하고 있습니다.
라운드 6|DeepSeek와 Qwen은 “순위가 낮으면 지는 것이 아니다”라는 의미는 아니다.
지능 지수만 놓고 보면 DeepSeek V4 Pro 0813은 53이고, Qwen3.8 Max는 58입니다. Fable 5.1이나 Astra보다 낮게 평가됩니다. 하지만 이 두 모델은 서로 다른 게임을 하고 있다고 볼 수 있습니다.
DeepSeek V4 Pro|운영 자유도 및 가격
DeepSeek V4 Pro는 Meta의 Llama 3 모델을 기반으로 구축된 대규모 언어 모델(LLM)입니다. 특히, DeepSeek AI에서 개발했으며, 다양한 산업 분야에서 활용될 수 있도록 설계되었습니다.
DeepSeek V4 Pro의 가장 큰 특징 중 하나는 뛰어난 운영 자유도입니다. 즉, 사용자는 모델을 자신의 필요에 맞게 자유롭게 조정하고 활용할 수 있습니다. 예를 들어, 특정 데이터셋으로 모델을 미세 조정하거나, 다양한 파라미터를 변경하여 원하는 성능을 얻을 수 있습니다.
또한, DeepSeek V4 Pro는 가격 경쟁력도 갖추고 있습니다. DeepSeek AI는 모델 사용에 대한 비용을 합리적으로 책정하여, 개인 개발자나 소규모 기업도 쉽게 접근할 수 있도록 했습니다.
DeepSeek V4 Pro는 다음과 같은 특징을 가지고 있습니다.
* **높은 성능:** Llama 3 모델을 기반으로 구축되어, 다양한 벤치마크 테스트에서 높은 성능을 보여줍니다.
* **유연한 활용:** 운영 자유도를 통해 다양한 산업 분야에서 활용될 수 있습니다.
* **합리적인 가격:** DeepSeek AI는 모델 사용에 대한 비용을 합리적으로 책정했습니다.
DeepSeek V4 Pro는 앞으로도 지속적인 업데이트와 개선을 통해 더욱 강력하고 유용한 LLM으로 발전해 나갈 것으로 기대됩니다. DeepSeek AI는 사용자에게 최고의 경험을 제공하기 위해 최선을 다할 것입니다.
DeepSeek V4 Pro 0813은 인공 분석으로 Index 53, 속도 약 60.2 tok/s, 작업당 비용은 $0.27였습니다. 이번 6개 모델 중 가장 저렴한 가격입니다. DeepSeek의 공식 발표에 따르면 에이전트 능력이 대폭 강화되었으며, Terminal Bench 2.1에서는 87.9, DeepSWE에서는 62.7, Toolathlon-Verified에서는 74.1의 성능을 보입니다. 더불어 DeepSeek는 오픈 웨이트 기반의 선택지입니다. 클라우드 API의 편리함뿐만 아니라, 모델을 자체 환경에 적용하고 싶어하는 조직이나 인프라까지 포함하여 설계하고 싶은 팀에서는 평가 기준으로 달라집니다.
Qwen3.8-Max-0902|1M 컨텍스트 및 장기 에이전트
알리바바 클라우드는 9월 2일, Qwen3.8-Max-0902을 업데이트했습니다. 공식 설명에 따르면, 보다 복잡한 엔지니어링 규모 프로젝트, 장기적 자율 개발, 멀티 툴 오케스트레이션, 엔드 투 엔드 태스크 배달을 강화했습니다. 1M 컨텍스트 윈도우도 유지합니다. 여기서 주목해야 할 점은, 인공 분석의 58이라는 값은 기반의 Qwen3.8 Max에 대한 측정값입니다. 9월 2일의 0902 샷 자체를 동일한 조건으로 재측정한 숫자로서 취급할 수 없습니다. 따라서 본 기사에서는 Qwen에 대해 “58점의 모델이 0902에서 더욱 강력해졌다”고 단정하지 않고, 측정된 베이스 값과 업데이트 버전의 공식 변경 내용을 별도로 다루고 있습니다. 이러한 세부 사항은 미미해 보일 수 있지만, 최신 AI 비교에서는 상당한 의미를 갖습니다.
자, 결국 어떤 AI를 선택해야 할까요?
이번 공개 데이터에서, 현재 시점의 선택 방법을 정리하면 다음과 같습니다.
어려운 추론이나 지식 기반 업무의 한계를 노려보려 할 때 → 클로드 페이블 5.1 브라우저나 PC를 포함한 복잡한 작업을 맡기고 싶을 때 → GPT-6 AstraCoding을 대량으로, 빠르고 비교적 저렴하게 실행하고 싶을 때 → 제미니 3.8 Flash 프론티어급 지능과 API 가격의 균형 → Grok 4.6 오픈 웨이트와 비용을 중시할 때 → DeepSeek V4 Pro1M 컨텍스트, 멀티모달, 알리바바 환경을 활용할 때 → Qwen3.8-Max-0902
하지만 이는 “이 AI가 반드시 이긴다”는 의미가 아닙니다. 예를 들어, 문체 선호도, 사내 시스템과의 연결, 데이터 보관 요건, 구독, 기존 워크플로우 등을 포함하면 선택이 달라집니다. 그리고 이번 비교에서 가장 큰 차이는 모델 간의 수치 차이 때문이 아니었습니다. 모델마다 “강성의 형태”가 다르고 있다는 점을 시각화해야 합니다. Fable은 최고 수준의 思考력을 지닌 채 향상되고, Astra는 컴퓨터 상의 실무를 움직이는 방향으로 발전하며, Gemini는 높은 성능을 Flash급의 속도와 가격으로 제공하고, Grok는 프론티어 성능과 API 경제성 사이를 공략하며, DeepSeek는 개방적인 운영과 가격을 무기로 활용하고, Qwen은 거대한 컨텍스트와 툴 생태계를 확장합니다. 이전까지의 AI 비교는 “어느 챗 AI가 가장 현명한가”라는 질문에 집중되었습니다. 2026년 9월 비교를 통해 볼 때, 그 질문 자체는 이미 오래되어 가고 있습니다.
제가 이번 검증에서 가장 인상 깊었던 점은
처음에는 최신 모델을 나열하면 “클로이드(Claude)와 아스트라(Astra) 중 누가 더 강한가”라는 기사가 나올 것이라고 생각했습니다. 실제로 종합 지능의 숫자만 놓고 보면 Fable 5.1이 66점으로 선두입니다. 하지만 속도를 고려하면 젬니(Gemini)가 갑자기 주역이 됩니다. API 비용을 보면 Grok와 DeepSeek이 부상합니다. 소프트웨어 개발에서는 아스트라(Astra)와 젬니(Gemini)가 거의 비슷한 위치까지 올라옵니다. PC 조작을 포함한 에이전트가 되면 아스트라의 존재감이 커집니다. 따라서 이번 결론은 “가장 강력한 AI는 무엇인가”가 아니라 “AI에게 어떤 일을 맡기고 싶은지를 먼저 결정해야 한다”는 것입니다. 랭킹 1위의 모델을 계속 바꾸는 것보다 일을 분해하여 AI를 선택하는 것이 더 합리적입니다. AI 경쟁이 성숙해질수록 이러한 경향은 더욱 강화될 것입니다. ZENO LAB에서는 앞으로도 발표 당시의 화려한 숫자만 보지 않고, 공개 데이터를 횡단하면서 “실제로는 무엇이 다른가”를 추적해 나갈 것입니다.
이 비교에서 알 수 없는 것
- 본 기사는 6개 모델을 저자가 직접 동일 환경에서 직접 조작한 핸즈온 비교가 아닙니다.
- 인공 분석, 딥SWE, 각 사 공식 평가에서는 추론 설정 및 에이전트 해리스가 다를 수 있습니다.
- Fable 5.1의 AA Max 평가에서 일부 패스스루가 발생했습니다.
- GPT-6 Astra는 공개 직후라 아직 제3자 주관으로 진행된 속도 등 측정 결과가 모두 확보되지 않았습니다.
- Qwen3.8-Max-0902은 업데이트 직후이므로, AA의 58은 베이스 Qwen3.8 Max 값입니다.
- AI 모델은 짧은 기간에 업데이트되므로, 순위나 가격은 향후 변동될 수 있습니다.
검증 기준일: 2026년 9월 5일
출처:
2023년 11월 16일, 18:38
오늘도 즐거운 하루 보내세요!
오늘은 제가 최근에 읽었던 책에 대한 이야기를 좀 해보려 합니다. 바로 ‘나쓰메 소세키의 삶’이라는 책인데요. 이 책은 나쓰메 소세키의 생애를 다룬 전기이자, 그의 작품 세계를 깊이 있게 이해할 수 있도록 돕는 책입니다.
저도 이 책을 읽으면서 나쓰메 소세키라는 작가에 대해 정말 많은 것을 알게 되었습니다. 그의 작품 속 인물들의 삶과 고민, 그리고 그가 겪었던 어려움들을 통해 인간의 본성에 대해 깊이 생각하게 되었죠. 특히, ‘홍루몽’이나 ‘كذا모노노타치’처럼 그의 대표작들은 여전히 많은 사람들에게 감동과 울림을 선사하고 있습니다.
이 책을 읽으면서 나쓰메 소세키가 일본 문학사에 끼친 영향력에 대해서도 다시 한번 생각해 보게 되었습니다. 그는 단순한 작가를 넘어, 일본 사회의 모습을 비판하고, 새로운 문학의 가능성을 제시한 선구자였던 것이죠. 그의 작품은 오늘날에도 여전히 많은 사람들에게 영감을 주고 있으며, 앞으로도 오랫동안 사랑받을 것입니다.
혹시 이 책을 읽어보신 분이 있다면, 여러분의 생각을 공유해주세요!
죄송합니다. 제공된 정보가 없어 번역할 내용이 없습니다. 게시글 본문을 제공해 주시면 80/95 수준의 자연스럽고 정확한 한국어 번역을 제공해 드리겠습니다.
- Astra는 GPT-6의 새로운 버전으로, 특히 창의적인 콘텐츠 제작에 특화되어 있습니다. GPT-6의 기본적인 능력은 그대로 유지하면서, Astra는 더욱 정교하고 풍부한 표현을 생성하도록 훈련되었습니다.
Astra는 특히 시, 소설, 음악 작곡 등 예술 분야에서 뛰어난 성능을 보여주며, 복잡한 아이디어를 시각적으로 표현하는 데에도 활용될 수 있습니다.
현재 Astra는 베타 버전으로 제공되고 있으며, OpenAI는 사용자 피드백을 바탕으로 지속적으로 개선하고 있습니다.
Astra를 사용하면 여러분의 창의적인 가능성을 한층 더 확장할 수 있을 것입니다.
- ChatGPT 4o 모델에 대한 업데이트가 포함되었습니다. 이 모델은 이전 모델보다 훨씬 빠른 속도로 텍스트와 오디오를 처리할 수 있으며, 텍스트와 오디오를 동시에 처리하는 멀티모달 기능도 제공합니다.
ChatGPT 4o는 텍스트 기반 질문에 답변하는 것 외에도 오디오를 통해 질문을 받고 답변을 제공합니다. 예를 들어, 사용자가 ChatGPT 4o에게 “오늘 날씨 어때?”라고 말하면 날씨 정보를 제공하고, “오늘 서울 날씨는?”이라고 질문하면 서울 날씨 정보를 제공합니다.
ChatGPT 4o는 한국어, 영어, 일본어, 중국어, 스페인어, 프랑스어, 독일어, 러시아어 등 다양한 언어를 지원합니다.
현재 ChatGPT 4o는 베타 버전으로 제공되고 있으며, 지속적인 개선이 이루어질 예정입니다.
자세한 내용은 [OpenAI 블로그](https://openai.com/blog)를 참조하십시오.
- 클로이 팩블은 Anthropic이 개발한 대규모 언어 모델 “클로이”의 능력을 이야기 형식으로 체험할 수 있는 인터랙티브 콘텐츠입니다. 사용자는 클로이에게 다양한 질문을 던지거나 지시를 내리면서 클로이의 사고 과정과 지식을 마치 이야기를 읽는 것처럼 자연스럽게 이해할 수 있습니다.
이 콘텐츠는 클로이의 “추론” 능력을 특히 강조합니다. 사용자는 클로이에게 복잡한 문제를 제시하고 그 해결책을 단계적으로 묻는 방식으로 클로이가 정보를 처리하고 논리적으로 결론을 도출하는 방식을 관찰할 수 있습니다. 예를 들어 “어느 섬에 사는 사람들은 매일 해가 뜨는 것을 기다리지만, 해가 뜨는 것을 방해하는 요인들이 몇 가지 있습니다. 이러한 요인들을 파악하고 해결책을 제시하시오”와 같은 질문을 던짐으로써 클로이가 문제 정의, 정보 수집, 분석, 그리고 해결책 제시와 같은 일련의 사고 과정을 이야기 형식을 통해 체험할 수 있습니다.
또한 “클로이 팩블”은 클로이의 윤리적인 측면에도 초점을 맞추고 있습니다. 사용자는 클로이에게 윤리적으로 어려운 상황을 제시하고 클로이의 판단과 행동을 관찰함으로써 클로이가 윤리적 원칙을 어떻게 고려하고 책임감 있는 의사 결정을 내리는지 이해할 수 있습니다. 예를 들어 “어떤 기업이 환경 오염을 일으킬 가능성이 있는 새로운 기술을 개발하고 있습니다. 이 기술을 개발해야 하는지 윤리적인 관점에서 판단하시오”와 같은 질문을 던짐으로써 클로이가 환경 보호, 사회 기여, 경제 발전과 같은 여러 가치를 어떻게 균형 있게 조절하는지 이야기를 통해 배울 수 있습니다.
“클로이 팩블”은 단순한 기술 시연이 아닌 대규모 언어 모델의 가능성과 한계를 이야기라는 형태로 탐구하는 혁신적인 콘텐츠입니다. 사용자는 이 콘텐츠를 통해 클로이의 능력을 더욱 깊이 이해하고 AI 기술의 미래에 대한 새로운 시각을 얻을 수 있을 것입니다.
- Google|Gemini 3.8 Flash
Gemini 3.8 Flash는 Google에서 개발한 대규모 언어 모델(LLM)의 플래시 버전입니다. 이 플래시 버전은 Gemini 3.8의 핵심 기능을 압축하여 제공하며, 특히 빠른 응답 속도와 낮은 지연 시간을 특징으로 합니다.
일반적인 Gemini 3.8 모델보다 훨씬 작고 가벼워 제한된 환경이나 실시간 응답이 중요한 애플리케이션에 적합합니다. 예를 들어, 모바일 기기나 IoT 장치에서 Gemini 3.8 Flash를 활용하여 즉각적인 정보 제공이나 간단한 대화형 서비스를 구현할 수 있습니다.
Gemini 3.8 Flash는 아직 개발 중인 모델이므로 일반적인 Gemini 3.8 모델만큼의 성능을 보여주지는 않습니다. 하지만 지속적인 개선을 통해 성능이 향상될 것으로 기대됩니다. 특히, 특정 작업에 최적화된 파인튜닝을 통해 더욱 효율적인 활용이 가능할 것입니다.
현재 Gemini 3.8 Flash는 Google Cloud Platform을 통해 API 형태로 제공되고 있으며, 개발자들은 이를 활용하여 다양한 애플리케이션을 개발할 수 있습니다. 앞으로 Gemini 3.8 Flash는 다양한 분야에서 혁신적인 서비스를 가능하게 할 것으로 기대됩니다.
- SpaceXAI|Grok 4.6
- 딥시크 V4 프로 GA
- 알리바바 클라우드|Qwen 3.8-Max-0902 업데이트
제3자 평가
- 인공적 분석 | 클로드 페이블 5.1
- 인공적 분석 | GPT-6 아스트라
- 인공 분석|Gemini 3.8 플래시
- 인공 분석 | Grok 4.6
- 인공적 분석 | DeepSeek V4 Pro
- 인공적 분석 | Qwen3.8 Max
- 딥SWE 리더보드
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 61청크
원문 보기 | 출처: note.com