메타는 2026년 8월 10일(현지 시간), 로컬 환경에서 상시 가동되는 AI 에이전트용으로 설계한 AI 모델 “Muse Glimmer”을 공개했다. 약 296억 파라미터이지만, 양자화 버전은 24GB의 VRAM을 탑재한 하드웨어에서 작동하도록 최적화되어 있으며, 툴을 사용한 다단계 작업이나 코딩, 실패로부터의 복구 등 AI 에이전트로서 장시간 쿼리를 실행하는 능력을 중시한 모델로, 가중치는 Apache 2.0 라이선스로 공개되어 있다. ## 동 규모의 Gemma, Qwen과 비교 – 에이전트 계열에서 높은 점수 메타는 Muse Glimmer-30B를, 동 규모의 “Gemma4-31B”, “Qwen3.6-27B”와 여러 개의 벤치마크에서 비교했다. AI 에이전트의 툴 이용 능력을 측정하는 “MCP Atlas”에서는 Muse Glimmer가 75.5, Gemma4-31B가 54.2, Qwen3.6-27B가 62.5가 되었다. “DeepSearch QA”에서는 74.6, “GAIA2”에서는 43.3를 기록하여, 비교한 2 모델을 모두 상회했다. 코딩 분야에서도 “SWE-Bench Pro”에서 Muse Glimmer가 51.2가 되어, Gemma4-31B의 36.9, Qwen3.6-27B의 50.2를 상회했다. 반면, “OSWorld-Verified” 또는 “SWE-Bench Verified” 등에서는 Qwen3.6-27B가 더 높았으며, 모든 평가 항목에서 Muse Glimmer가 선두를 굳건히 지켰다고 보기 어렵다. Muse Glimmer-30B와 Gemma4-31B, Qwen3.6-27B의 에이전트/코딩 계 벤치마크 비교 한편, 메타는 평가 방법으로 인해, 제3자 모델에서는 자가 보고 값이나 메타의 재현 결과 등 유리한 결과를 채택했다고 밝혔다. 또한, 에이전트 평가에 사용한 툴이나 시스템 프롬프트 등은 제3자 모델용으로 개별 최적화되어 있지 않아, 각 모델이 본래 발휘할 수 있는 최고 성능을 반영하지 못할 수도 있다고 설명했다. ## 4비트 양자화로 20GB 미만으로 – 24GB GPU에서 로컬 AI 에이전트 실행 Muse Glimmer는 클라우드상의 AI 모델을 호출하는 대신, 모델 자체를 손수 PC 등으로 실행하여, 상시 가동되는 AI 에이전트를 구축하는 용도를 염두에 두고 있다. 따라서 메타가 중시한 것은 일반적인 하드웨어에서도 실행 가능한 모델 크기 축소이다. 약 300억 파라미터의 모델을 풀 정밀도로 실행할 경우, 55GB를 초과하는 메모리가 필요하다. 메타는 약 4비트 양자화에 의해 언어 모델 부분을 20GB 미만으로 압축했다. 공개된 “K-Quant-17GB” 버전은 16.8GB이며, 24GB VRAM 환경을 대상으로 한다. 32GB VRAM용에는, 정밀도 저하를 더욱 억제한 19.7GB의 “K-Quant-Dynamic” 버전도 마련했다. 메타에 따르면, 15가지 종류의 벤치마크의 평균에서, 풀 정밀도 버전에 대한 성능 저하는 각각 1.0%, 0.2%였다. 더욱이, 여러 개의 토큰 후보를 모아서 생성하고, 메인 모델이 검증하는 “DFlash”를 사용한 투기적 디코딩에도 대응한다. 메타의 측정 결과, NVIDIA RTX 5090에서 일반적인 생성 속도의 약 3.1배, Apple M5 Max에서 약 1.8배, M4 Max에서 약 1.5배의 생성 속도가 되었다. 모델의 가중치는 Hugging Face에서 공개되어 있습니다. Meta는 llama.cpp, ExecuTorch, MLX를 통해 로컬 실행에도 대응하고 있으며, 사용자의 터미널에서 툴 이용 및 다단계 작업의 AI 에이전트 구축을 주요 용도 중 하나로 제시하고 있습니다. 원문 보기 | 출처: Ledge.ai