# 하드웨어에 맞춰 자동 최적화하여 최대 2배까지 추론 속도 향상 AI 에이전트용 추론 엔진 “Magnitude”, Apple 실리콘, NVIDIA, AMD, CPU 지원

> https://bookfactory.kr/board/news/19744
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-03T05:50:38.017Z

---

AI 에이전트에서 오픈 모델을 로컬로 실행할 때, 사용 중인 하드웨어에 맞춰 처리 성능을 자동으로 조절하는 오픈 소스 추론 엔진 “Magnitude”가 공개되었습니다. Magnitude는 모델 실행을 위한 처리를 端末(터미널)에서 컴파일하여 조절하는 시스템을 갖추고 있으며, 특정 조건에서는 “llama.cpp”와 비교하여 최대 약 2배의 속도를 기록합니다. Apple 실리콘, NVIDIA 및 AMD의 GPU에 더하여 CPU만으로도 작동하며, Pi, OpenCode, Hermes, Codex 등의 AI 에이전트용 도구와 쉽게 연결될 수 있습니다. GitHub - magnitudedev/magnitude https://github.com/magnitudedev/magnitude

발행 HN: Magnitude (YC S25) – 에이전트를 위한 자기 최적화 추론 엔진 | Hacker Newshttps://news.ycombinator.com/item?id=49911995대규모 언어 모델을 자신의 PC에서 실행하는 방법으로, 오픈 소스 추론 엔진 “llama.cpp”가 널리 이용되고 있습니다. llama.cpp는 2023년 3월에 등장했으며, CPU만으로 PC나 Apple 실리콘 탑재 Mac에서도 대규모 언어 모델을 실행할 수 있어, 로컬 AI 실행의 대세 도구 중 하나가 되었습니다. 2025년 5월에는 멀티모달 입력에도 대응합니다. 로컬에서 다양한 AI 모델을 실행할 수 있는 무료 소프트웨어 “llama.cpp”가 멀티모달 입력을 지원하고 이미지 설명 등이 가능하게 되었습니다 - GIGAZINE

한편, AI 에이전트를 실행할 경우, 파일 읽기/쓰기, 명령어 실행 등을 반복하기 때문에 대화가 길어지기 쉬우며, 여러 에이전트를 동시에 실행하는 경우도 있습니다. Magnitude 개발팀은 데이터센터용 추론 엔진은 대량의 요청을 한 번에 처리하는 용도가 중요하게 여겨졌으며, llama.cpp는 다양한 하드웨어에 대한 대응이 중요하게 여겨졌기 때문에, 로컬 PC에서 AI 에이전트를 장시간 실행하는 용도에는 별도의 최적화가 필요하다고 생각한 것입니다. Magnitude는 “실제로 모델을 실행하는 PC에서 자동으로 조정하는” 방법을 채택했습니다. AI 모델의 계산을 담당하는 작은 처리 단위인 “커널”을 실행하는 端末(터미널)에 맞춰 컴파일하고, 파라미터도 端末(터미널)에서 조정합니다. 같은 Apple 실리콘이나 NVIDIA製GPU라도 제품마다 성능이나 메모리 구성이 다르기 때문에, 광범위한 하드웨어에 맞춰 준비한 커널을 사용하는 방식과 비교하여, 실제 端末(터미널)에서 커널을 조정함으로써 처리 속도를 높일 수 있습니다. Magnitude 개발팀은 4비트로 양자화된 “Qwen 3.6 35B A3B”를 64K 토큰의 컨텍스트 길이에 대해 llama.cpp와 비교했습니다. M4 Pro와 48GB 메모리를 탑재한 Mac에서는, Metal 사용 시의 생성 속도는 llama.cpp가 매초 30 토큰인 것에 반해 Magnitude는 약 92% 증가한 매초 57 토큰을 기록했습니다. 프리필 속도는 llama.cpp가 매초 466 토큰이고, Magnitude는 매초 507 토큰으로 약 9%의 향상을 달성했습니다. NVIDIA DGX Spark를 사용한 CUDA 환경에서도, 생성 속도는 llama.cpp의 매초 49 토큰보다 빠른 매초 58 토큰(약 19% 증가), 프리필 속은 llama.cpp가 매초 2033 토큰인 것에 반해 Magnitude는 매초 2507 토큰(약 23% 증가)을 기록했습니다. 에이전트 1개당의 메모리 사용량도 Metal 환경에서 약 28%, CUDA 환경에서 약 27% 감소하는 데 성공했습니다.

AI 에이전트 다중 실행 시 메모 소비에 대한 대책도 이루어지고 있으며, Magnitude는 최초 모델 가중치를 유지하기 위해 필요한 메모량만 확보하고, 에이전트와의 세션이 길어짐에 따라 필요한 메모 영역을 동적으로 늘리는 기능을 탑재합니다. 에이전트가 중지되면 확보했던 영역을 해제하여, AI 에이전트를 실행하면서 같은 PC에서 다른 작업을 계속하기 쉽도록 하는 메커니즘이 구현되어 있습니다. 또한 여러 세션에서 동일한 시스템 프롬프트나 공통 부분을 반복 처리하는 낭비를 줄이기 위해 Magnitude는 여러 세션에서 공통으로 사용되는 도입부 계산 결과를 재사용하는 “프리픽스 캐시”를 공유하는 메커니즘도 채택합니다. AI 에이전트에서는 도구 설명 등 많은 공통 텍스트를 모델에게 반복적으로 전달하는 경우가 많기 때문에, 단순한 생성 속도뿐만 아니라 장시간 및 병렬 운영 시의 효율도 중시하고 있다는 의미입니다. 도입 시에는 Magnitude가 탑재 하드웨어를 조사하여 권장 모델을 제시합니다. 모델을 선택하고 다운로드한 후에는 “Connections”에서 Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi, Cline 등과 연결 가능합니다. 다른 앱에서 사용하고 싶다면 OpenAI 호환 API도 제공됩니다. macOS, Windows, Linux에 대응하며, Apple 실리콘, NVIDIA GPU, AMD GPU 외에 CPU만으로도 이용 가능한 환경입니다. 억 = 억, 만 = 만, 조 = 조

모델은 필요해진 시점에 읽어들여, 장시간 사용되지 않거나 메모리가 부족해지면 자동으로 해제되는 기능입니다. 모델을 한 번 다운로드하면 인터넷 연결 없이도 이용 가능하며, 프롬프트와 파일은 PC 내부에 보관됩니다. Magnitude 자체는 Apache License 2.0으로 공개되어 있습니다. Magnitude 개발팀은 앞으로 GPU 메모리에 맞지 않는 대규모 모델의 “익스퍼트(Expert)”라고 불리는 일부 파라미터를 RAM이나 저장소에 두고, 필요한 시점에 읽어들이는 “익스퍼트 스트리밍(Expert streaming)”과, 커널의 구성 자체를 자동으로 결정하는 컴파일러, CPU·GPU·RAM·저장소를 모두 활용하는 여러 기기용에 최적화된 것을 계획하고 있습니다.

[원문 보기](https://gigazine.net/news/20261001-magnitude/) | 출처: Gigazine