SpaceXAI는 2026년 8월 12일, AI 모델 “Grok 4.6”를 발표했다. 전 세대의 Grok 4.5를 기반으로, 장시간에 걸쳐 여러 단계를 수행하는 AI 에이전트 능력과, 인터랙티브 비주얼 작업에 중점을 두어 강화했다. 조사, 정보 분석, 코드 베이스를 횡단한 작업, 아이디어에서 앱이나 업무 결과물을 만들어내는 작업 등을 염두에 둔다. SpaceXAI가 공표한 평가에서, 여러 개의 코딩·지식 노동 계벤치마크에서 Grok 4.5를 상회했다 ## 장시간·다단계의 태스크를 중점 강화, 자라 확인しながら 작업 Grok 4.6에서는, 단발의 질문에 대한 답변뿐만 아니라, 장시간에 걸쳐 여러 단계를 연속적으로 진행하는 능력이 강화되었다. SpaceXAI에 따르면, 미지의 분야를 조사하고, 앱의 구조를 정하며, 주요 기능을 구현한 후, 피드백을 받으며 수시로 개선한다든지 하는 작업이 가능해졌다고 한다. 긴 작업 단계에서는, 다음 단계로 진행하기 전에 모델 스스로가 결과를 테스트하거나, 내용을 검증하는 동작도 늘어났다고 한다. 학습에서는 Grok 4.5보다 장기간의 추가 학습을 실시했으며, 추론이나 고도한 기술 분야에 적합한 모델 생성 데이터, 고품질의 엔지니어링 데이터 등을 사용한 바 있다. 또한, 지식 노동, 일반적인 코딩, 웹 개발, CAD 등을 대상으로 하는 에이전트형의 강화 학습도 진행했다. 모델 카드에 따르면, Grok 4.6은 Cursor와 연동하여 개발되었으며, 익명화된 Cursor의 워크플로우 데이터도 추가 학습에 활용했다. ## DeepSWE는 54%에서 65.9%에, 여러 개의 에이전트 평가에서 4.5를 상회 SpaceXAI가 공표한 평가에서, 여러 개의 코딩·지식 노동 계벤치마크에서 Grok 4.5를 상회했다. 9개의 벤치마크를 통합하는 “Artificial Analysis Intelligence Index”는 Grok 4.5의 56에서 61로 상승. “DeepSWE v1.1”은 54%에서 65.9%, “CursorBench v3.2”는 66.7%에서 69.9%, “FrontierCode v1.1(Extended)”는 56.6%에서 61.3%로 나타났다. Artificial Analysis Intelligence Index에서는, GPT-5.6 Sol Max와 동일한 61을 기록하고 있다. Grok 4.6과 Grok 4.5 High, GPT-5.6 Sol Max, Fable 5 Max의 각종 평가 결과. 굵체는 각 평가의 최고 점수 한편, 모든 평가에서 다른 회사 모델을 상회하는 것은 아니다. 동 지표에서는 Fable 5 Max가 62, DeepSWE v1.1에서는 GPT-5.6 Sol Max가 73% 등으로, 평가 항목에 따라 최정상 모델은 다르다. ## 50만 토큰 대응, 가격은 Grok 4.5와 동일 수준 Grok 4.6은 Cursor, Grok Build, SpaceXAI API 등으로 제공을 시작했다. OpenRouter, Vercel, Cloudflare 등의 파트너 경로를 통해서도 이용 가능하다. 공식 문서에 따르면, 컨텍스트 윈도우는 50만 토큰. 텍스트와 이미지를 입력할 수 있으며, 텍스트를 출력할 수 있다. 추론 강도를 설정할 수도 있다. API 요금은 20만 토큰 미만의 프롬프트의 경우, 100만 토큰당 입력 2달러, 출력 6달러로, Grok 4.5의 기본 가격과 동일 수준이다. 20만 토큰 이상에서는 입력 4달러, 출력 12달러이다. 고속 버전은 일반 버전의 2배 가격으로 설정되어 있다. 7월 16일에 발표된 Grok 4.5가 약 4주 후인 업데이트된 Grok 4.6이다. 또한, 모델 카드에서는 Grok의 웹 버전, 모바일 앱, X상의 Grok과 같은 일반 사용자용 서비스에 대한 Grok 4.6 도입이 “후일”로 되어 있으며, 현재 시점에서는 이러한 서비스에 대한 전면 제공 시작을 의미하는 것은 아니다. 원문 보기 | 출처: Ledge.ai