'Ollama'나 'LM Studio'와 같은 도구를 사용해 로컬 환경에서 AI가 추론 작업을 실행하도록 함에 있어, 네트워크상에 있는 호환 가능한 PC를 감지하여 연결하고 연동하여 작업에 참여시킬 수 있는 가상 추론 라우터 'PAIR(Personal AI Router)'를 NVIDIA가 공개했습니다.
NVIDIA PAIR Virtual Inference Router Expands Available Compute on Your Local Network | NVIDIA Technical Blog
https://developer.nvidia.com/blog/nvidia-pair-virtual-inference-router-expands-available-compute-on-your-local-network/
Nvidia launches free tool that links idle computers into a personal AI data center | The Verge
https://www.theverge.com/ai-artificial-intelligence/989435/nvidia-pair-personal-ai-router-home-local-llm-compute-tool-rtx-macbook
AI 에이전트는 복잡한 작업을 작은 작업으로 분할하여 각각 전문 서브 에이전트에 할당할 수 있습니다. 최근에는 사용자가 여러 AI 에이전트를 동시에 실행하는 경우도 늘어났으며, 복잡한 작업을 달성하기 위한 멀티 에이전트 워크플로우도 일반화되고 있습니다. 이러한 워크플로우에서는 작업을 완료하기까지 걸리는 시간이 단축되고 응답 품질도 향상되지만, 한편으로는 많은 요청이 동시에 GPU로 전송되기 때문에 시스템의 병목 현상이 될 가능성도 있습니다.
이 멀티 에이전트와 서브 에이전트의 병목 현상을 경감해 주는 것이 'NVIDIA PAIR'입니다. LLM을 로컬 환경에서 실행하는 Ollama나 LM Studio는 선택한 머신에서 모델을 실행합니다. PAIR는 네트워크에 참여하고 있는 다른 PC를 감지하여 요구 사항을 충족하는 경우 작업을 할당합니다. 또한 응답이 돌아올 경우 발신처로 반환합니다. 연결 개념은 다음과 같은 느낌으로, PAIR는 프록시를 통해 요청을 수신하고 엔진과 모델의 요구 사항을 파악하여 적절한 노드를 선택합니다. 노드는 해당 요청을 실행한 후 응답을 PAIR로 반환합니다. AI 에이전트 측에서 노드를 고를 필요 없이 요청을 보내기만 하면 나머지는 PAIR가 처리해 준다는 뜻입니다.
특징으로 PAIR의 프록시는 Ollama·LM Studio와 호환되므로 새로운 API를 필요로 하지 않습니다. 또한 작업을 할당할 필요가 없을 때는 적절히 불필요한 노드의 전원을 끄거나 절전 상태로 만들어 줍니다. AI 에이전트 'Hermes Agent'를 GUI로 관리할 수 있는 'Hermes Desktop'과 Ollama, PAIR를 이용해 5개의 서브 에이전트를 실행한 데모 영상이 공개되어 있습니다. PAIR가 라우팅을 수행하고, Ollama는 PAIR가 선택한 노드에서 각각의 요청을 실행하고 있습니다.
NVIDIA PAIR: Hermes 5-Subagent Demo - YouTube
알리바바의 오픈 모델 「Qwen 3.6-35B-A3B」를 사용하여 5개 서브에이전트의 워크로드가 완료될 때까지의 시간을 측정한 결과, RTX Spark 탑재 PC&DGX Spark(워크스테ーション)&RTX 5090 탑재 PC 3대를 PAIR로 클러스터화하여 처리했을 때는 평균 8분 48초였지만, RTX Spark 탑재 PC 1대일 때는 평균 18분이 걸려 대폭적인 시간 단축이 확인되었다고 합니다.
PAIR의 동작 요건은 OS가 Windows 11, DGX OS, Ubuntu 14.04, macOS Tahoe이고, GPU는 GeForce RTX(20 시리즈 또는 그보다 새로운 것)나 DGX Spark·DGX Spark GB10, Mac M4 또는 그보다 새로운 것일 것. 메모리는 최소 8GB, 여유 공간은 최소 20GB이며, 인터넷 환경은 모델 다운로드에는 필요하지만 동작 자체에는 필요 없다고 합니다. Personal AI Router for Local Inference | NVIDIA PAIRhttps://www.nvidia.com/en-us/ai-on-rtx/personal-ai-router/
원문 보기 | 출처: Gigazine