# 메타, 터미널형 AI 코딩 에이전트 “뮤즈 코드(Muse Code)” 베타 공개, 100만 토큰의 신 모델 “뮤즈 스파크 1.2(Muse Spark 1.2)” 탑재

> https://bookfactory.kr/c/news/8916
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-07T08:30:52.510Z

---

메타는 2026년 8월 5일(현지 시간) 터미널에서 동작하는 AI 코딩 에이전트 “뮤즈 코드(Muse Code)”를 베타 버전으로 공개했다. 동시에 코딩 용도에 최적화된 신 모델 “뮤즈 스파크 1.2(Muse Spark 1.2)”도 발표했다. 뮤즈 코드는 이 모델을 핵심으로, 장시간의 개발 작업이나 여러 에이전트를 조합하는 워크플로우를 지원한다.

## 장시간 개발 작업을 터미널에서 실행

뮤즈 코드는 코드의 생성뿐만 아니라 기존 리포지토리 파악, 변경 계획 작성, 구현, 디버깅, 검증까지를 터미널에서 진행하는 코딩 에이전트이다. 메타는 “복잡한 코딩 작업에 대한 에이전트”라고 위치시켜 두고 있으며, 현재는 베타 버전으로 제공하고 있다.

메타는 뮤즈 코드를 장시간 및 여러 에이전트 유형의 코딩 워크플로우에 맞게 설계했다고 설명한다. 사용자가 설정한 목표를 추적하고, 작업 중에도 초기의 목적에서 벗어나지 않도록 에이전트를 유지하는 “목표 추적(Goal tracking)” 기능을 갖추고 있다.

또한 각 세션의 작동을 재생 가능한 이벤트 로그로 로컬에 기록한다. 로그는 작업 내용의 확인이나 감사에 이용할 수 있으며, 크래시나 오작동이 발생했을 경우에도 “muse resume” 명령으로 작업을 재개할 수 있다. 실제 파일을 참조하여 변경 계획을 작성하는 “/plan”과 같은 개발 단계를 보조하는 기능도 포함되어 있다.

## 뮤즈 스파크 1.2, 100만 토큰의 컨텍스트에 대응

뮤즈 코드의 핵심 모델인 뮤즈 스파크 1.2는 실제 소프트웨어 개발 워크플로우에 맞춰 최적화된 모델이다. 메타에 따르면, 첫 번째 답변 정확도를 높이는 동시에 도구 호출의 신뢰성도 개선했다.

컨텍스트 윈도우는 100만 토큰이며, 규모의 큰 코드베이스나 장시간에 걸친 작업을 처리할 수 있다. 코드 생성뿐만 아니라 리뷰, 디버깅, 도구 작동을 포함하는 전체 개발 단계에서의 활용을 염두에 두고 있다.

메타는 뮤즈 스파크 1.2를 뮤즈 코드뿐만 아니라 메타 모델 API에서도 제공한다. 개발자는 모델 단위를, 자체의 코딩 에이전트나 코드 리뷰 지원 툴 등에 통합할 수 있다.

## 여러 개의 코딩 평가에서 전 모델을 상회

메타가 공개한 평가에서 뮤즈 스파크 1.2와 뮤즈 코드를 조합했을 때, 터미널상의 작업 능력을 측정하는 “터미널 벤치 2.1(Terminal-Bench 2.1)”에서 82.9%, 소프트웨어 개발 능력을 측정하는 “딥SWE 1.1(DeepSWE 1.1)”에서 59.3%를 기록했다. 메타의 내부 코드를 사용한 “메타 내부 코딩 벤치(Meta Internal Coding Bench)”에서는 70.6%가 되었다.

어느 평가에서도 클로드 옵스 5(Claude Opus 5)가 가장 높은 결과를 나타낸 반면, 뮤즈 스파크 1.2는 전 모델인 뮤즈 스파크 1.1을 세 가지 평가 모두에서 상회했다.

■ 뮤즈 스파크 1.2와 다른 모델의 코딩 성능 비교. 왼쪽부터 터미널 벤치 2.1, 딥SWE 1.1, 메타 내부 코딩 벤치

그러나 Terminal-Bench 2.1과 DeepSWE 1.1에서는 Muse Spark 1.2에 Muse Code, Claude Opus 5에 Claude Code, GPT-5.6에 Codex 등, 각각 다른 코딩 에이전트를 조합하고 있다. Meta 또한 평가 환경이 다른 회사 모델에 최적화되어 있지 않고, 각 모델의 최고 성능을 제대로 반영하지 못할 수 있다고 설명하고 있다.

…（기사 본문 2/2 청크）…

이러한 접근 방식은 특히 대규모 언어 모델(LLM)의 개발에 큰 영향을 미칠 것으로 예상된다. 기존에는 모델 학습과 평가, 그리고 실제 서비스에 배포하기 위한 에이전트 개발이 별도의 단계로 진행되었지만, 이제는 하나의 통합된 프로세스로 진행될 수 있게 되었다. 이는 개발 시간과 비용을 획기적으로 단축시키고, LLM의 성능을 더욱 향상시키는 데 기여할 것으로 기대된다.

특히, 엔비디아(NVIDIA)의 NeMo와 같은 프레임워크는 이러한 통합 개발 프로세스를 지원하는 데 중요한 역할을 할 것으로 보인다. NeMo는 LLM을 구축하고 평가하며, 동시에 에이전트로서 활용할 수 있는 모델을 개발하는 데 필요한 도구와 기능을 제공한다. 또한, 엔비디아는 다양한 하드웨어 가속 솔루션을 통해 LLM의 학습 및 추론 속도를 더욱 향상시키는 데 기여하고 있다.

이러한 기술 발전은 앞으로 더욱 지능적인 에이전트와 LLM이 등장하는 데 중요한 발판이 될 것으로 전망된다. 특히, 의료, 금융, 법률 등 다양한 분야에서 LLM 기반 에이전트의 활용이 확대될 것으로 기대되며, 이는 산업 전반에 걸쳐 혁신적인 변화를 가져올 것으로 예상된다.

Muse Code는 범용 모델을 기존 코딩 도구에 연결하는 방식이 아니라, Muse Spark 1.2를 구동하기 위해 구축된 전용 에이전트로서 자리매김하고 있습니다.

메타는 모델 단체의 코드 생성 능력뿐만 아니라 장시간 작업의 지속, 다중 에이전트의 연계, 도구 선택, 작업 기록 추적, 장애 후 복구까지를 일체로 정비했다. 짧은 코드의 보완에 그치지 않고, 여러 단계에 걸쳐 이어지는 개발 작업을 담당하도록 구성되어 있다.

...

、最適化、単純修正実現。、GPU、CPU異上動作、競合、独自課題抱。

、開発者、**NVIDIA****CUDA**活用、**TensorFlow****PyTorch**深層学習連携、課題解決。具体的、**NVIDIA****NVLink**技術用、複数GPU間高速転送、**NVIDIA****RAPIDS**用、GPU上直接処理行、計算速度大幅向上。

、近年、**Google****TPU**（Tensor Processing Unit）、深層学習計算重要役割果、**TensorFlow**連携通、効率的学習実現。技術活用、開発者、1000回超툴操作、高度最適化手法駆使、GPU最大限活用、深層学習性能飛躍的向上。

...

메타는 장시간 작업의 사례로, Muse Code를 사용하여 NVIDIA Hopper용 GPU 커널을 최적화하는 실험도 진행했다. 모델은 코드 작성, 컴파일, 성능 측정, 수정 과정을 반복하며, 1000회 이상의 툴 호출을 최장 24시간 동안 지속했다.

KDA 커널을 대상으로 한 실험에서 Muse Spark 1.2는 기준 구현에 대해 최종적으로 68.7%의 가속화를 기록했다. 이는 일반적인 코드 생성 성능이나 모델 자체의 응답 속도와는 다르며, 특정 GPU 커널을 반복적으로 개선한 결과이다.

KDA 커널 최적화에서 累積툴 호출 횟수와 기준 구현과의 고속화 비율. Muse Spark 1.2는 최종적으로 68.7%의 고속화를 기록했다.

[원문 보기](https://ledge.ai/articles/meta_muse_code_muse_spark_1_2) | 출처: Ledge.ai