# 메타의 기반 모델 뮤즈 스파크 1.2가 제3자 기관의 성능 분석에서 최고 점수를 기록하며, 뮤즈 시리즈 등장부터 4개월 만에 급성장

> https://bookfactory.kr/c/news/8908
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-07T05:00:45.867Z

---

메타(Meta)가 2026년 8월 5일에 발표한 기반 모델 “뮤즈 스파크 1.2(Muse Spark 1.2)”가 수학, 과학, 코딩, 추론 등 분야에서 인공지능의 능력을 종합적으로 측정하기 위한 복합 벤치마크인 인공 분석 지능 지수(Artificial Analysis Intelligence Index)에서 Grok 4.5를 초과하는 높은 점수를 기록했다는 사실이 알려졌다. 뮤즈 스파크 1.2: 향상된 에이전트 성능, 더 높은 작업당 비용 https://artificialanalysis.ai/articles/muse-spark-1-2 뮤즈 스파크 1.2 (xhigh) - 인텔리전스, 성능 및 가격 분석 https://artificialanalysis.ai/models/muse-spark-1-2 뮤즈 스파크 1.2(xhigh)의 인공 분석 지능 지수 점수는 “54”이다. 2026년 4월에 출시된 뮤즈 스파크 1.0의 점수는 “43”, 2026년 7월에 출시된 뮤즈 스파크 1.1의 점수는 “51”이었기에 메타는 단 4개월 만에 벤치마크 점수를 한층 끌어올린 것이다. 또한, 뮤즈 스파크 1.2(xhigh)의 점수는 GPT-5.5(xhigh)의 “55”나 Grok 4.5(high)의 “54”와 거의 같으며, 기사 작성 시점에서의 최첨단 모델인 클로드 오퍼스 5(max)의 “61”, 클로드 페이블 5(fallback)의 “60”, GPT-5.6 솔(max)의 “59”, 키미 K3(max)의 “57”에 약간 미달하는 결과가 나타났다. 참고로, 인공 분석은 “이는 미국 기업의 인공지능으로는 스페이스아이(SpaceXAI)와 어깨를 나란히 하는 3위 안에 든 기록”이라고 지적했다.

인공 분석 지능 지수 점수(수직축)와 비용(수평축)을 담은 그래프가 아래에 제시되어 있다. 뮤즈 스파크 1.2는 동등한 비용의 모델과 비교했을 때 성능이 우수하다.

AI 에이전트의 실무 수행 능력을 측정하기 위한 벤치마크 테스트인 GDPval-AA v2에서는 점수가 뮤즈 스파크 1.1의 “1371”에서 뮤즈 스파크 1.2에서는 “1631”까지 상승했다. 뮤즈 스파크 1.2보다 높은 점수를 기록한 것은 클로드 오퍼스 5(max)의 “1852”, 클로드 페이블 5(fallback)의 “1743”, GPT-5.6 솔(max)의 “1730”, 키미 K3(max)의 “1685”의 유일한 결과였다.

AI 에이전트가 실제 터미널 환경에서 복잡한 작업을 수행하는 능력을 평가하는 벤치마크 테스트인 Terminal-Bench v2.1에서는 점수가 “78%”에서 “80%”로 향상되었다.

AI 에이전트가 금융 고객 지원 업무를 얼마나 정확하게 수행할 수 있는지 측정하는 벤치마크 테스트인 τ³-Banking에서는 점수가 “25%”에서 “27%”로 상승했다.

AI 모델이 과학 연구 현장에서 사용되는 실질적인 수치 계산 코드를 얼마나 정확하게 생성할 수 있는지를 평가하는 벤치마크 테스트인 SciCode에서 점수가 “58.2%”에서 “56.4%”로 하락했습니다. 다만, Muse Spark 1.2보다 우수한 점수를 기록한 것은 Claude Fable 5(fallback)와 Kimi K3(max) 그리고 Muse Spark 1.1 뿐입니다.

AI 모델이 인류 최고 수준의 전문 지식과 실제적인 추론 능력을 갖추고 있는지 측정하는 벤치마크 테스트인 Humanity’s Last Exam에서 점수가 “45.1%”에서 “43.9%”로 하락했습니다.

AI 모델의 전문 지식의 정확성과 환각(hallucination) 억제, 자의 지식 경계 파악 능력 등을 엄격하게 측정하는 벤치마크 테스트인 AA-Omniscience Index에서 점수가 “18”에서 “22”로 상승했습니다. 환각 발생률은 “38%”에서 “28%”로 감소했고, 정답률은 “41%”에서 “38%”로 감소했습니다.

또한, Vals AI의 벤치마크인 Vals Index에서 Muse Spark 1.2는 5번째로 높은 점수인 “71.88%”를 기록했습니다. 1회의 테스트당 비용은 상위 5개 AI 모델 중 가장 저렴한 0.69달러(약 110원)입니다.

Muse Spark 1.2가 Vals Index에서 단 0.69달러의 테스트당 비용으로 상위 5위 안에 진입했습니다. 이는 Kimi보다 3배 저렴하고, Fable, Opus, 5.6 Sol보다 10배 이상 저렴합니다.

VS Code에서 동작하는 오픈 소스 AI 코딩 에이전트인 Cline은 “Meta의 새로운 Muse Code 에이전트를 사용해 보았는데, Docker 컨테이너에서 로그인할 수 없는 버그가 있습니다. 그래서 재미있는 실험을 해보았습니다. Meta는 Muse Spark 1.2가 그들의 Muse 에이전트 하네스에서 공동 훈련되었다고 주장합니다. 그래서 저희는 그들의 시스템 프롬프트에서 지시를 추출하여 Cline 하네스에 추가했습니다. ‘이 하네스에 저희의 리포지토리에서 버그를 수정해 달라고 요청했고, 그 결과는 원래 Cline 에이전트 하네스에 비해 토큰 사용량이 2.7배 적은 1970만 개에서 720만 개로, 완료 속도가 2배 빠르며 2.4배 낮은 비용인 7.69달러에서 3.25달러로 감소했습니다’라고 보고하며 Muse Spark 1.2의 발전을 칭찬했습니다.

AI 연구자의 리하드 자르(Rihard Jarc)  씨、「메타(Meta)가 Muse Spark 1.2로, 많은 유스케이스() 구글(Google)의 AI 모델을 품질로 앞지른 것처럼 보이는 것은 타임()을 고려하면 매우 놀라운 일입니다. 메타(Meta)는 이미 Muse Spark보다 성능이 뛰어난 모델을 출시할 예정이므로, 고성능 모델(Watermelon)은 클로드 페이블(Claude Fable) 수준의 성능을 발휘할 것입니다. 1년 동안의 대규모 개정 후, 드디어 메타(Meta)는 AI 연구소의 스케일링() 기반이 갖춰진 것으로 보입니다. 배포 속도도 매우 良好(요료)합니다. DeepSeek가 가격을 인상할 계획이라는 소문이 있는 것을 고려하면, 고객에게 서비스를 제공하기 위한 충분한 컴퓨팅() 리소스()를 갖추는 것이 중요합니다. 훌륭한 모델을 가지고 있어도 대부분의 사람이 그것을 사용하지 못한다면 의미가 없습니다. 메타(Meta)는 앤트로픽(Anthropic)이나 OpenAI와 동등하거나 그 이상의 컴퓨팅 능력(能力)을 가진 수(数)적인 기업 중 하나입니다.”)라고述(述).

메타 AI 모델의 진행에 대한 몇 가지 생각, 왜냐하면 이것이 매우 중요한 것 같다고 생각하기 때문입니다. 1. 메타가 뮤즈 1.2를 여러 사용 사례에서 구체적으로 평가했을 때 구글을 앞서나가게 되었다는 점이 매우 놀랍습니다. 특히 시간 제약을 고려하면 더욱 그렇습니다. 2. 이것은 여전히 “뮤즈…” [https://t.co/1tqMtgjGKG] 입니다.

[원문 보기](https://gigazine.net/news/20260807-muse-spark-1-2-benchmark/) | 출처: Gigazine