NVIDIA는 2026년 8월 11일, AI 에이전트용 오픈 모델 “NVIDIA Nemotron 3.5 Lightning”와, 여러 AI 모델에서 처리 내용에 적합한 모델을 자동으로 선택하는 오픈 소스 라이브러리 “NVIDIA NeMo Switchyard”를 발표했습니다. NVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AI | NVIDIA Blog https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/ Route AI Agents Across Models with NVIDIA NeMo Switchyard | NVIDIA Technical Blog https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard NVIDIA Nemotron 3.5 Lightning 소개 30억 개의 활성 파라미터와 300억 개의 파라미터 MoE 모델이며, 지속적으로 운영되는 에이전트가 대량의 전문적인 작업을 더 빠르게 처리할 수 있도록 구축되었습니다. 동일 크기의 모델과 비교했을 때 최대 4… pic.twitter.com/qR0JRsidhA AI 에이전트가 외부 도구를 조작하면서 대규모 처리를 수행할 경우, 코드 검토나 정보 분류와 같이 비교적 단순한 작업에 이르기까지 고성능 대규모 AI 모델을 계속 사용하면 처리 시간과 비용이 증가합니다. 반면에 소형 모델에만 맡기면, 계획 수립과 같이 복잡한 추론이 필요한 상황에서 답변 품질이 부족해질 수 있습니다. NVIDIA는 장시간 운영되는 AI 에이전트에서는 역할이 다른 여러 모델을 조합하는 “system of models”라는 접근 방식이 중요하다고 설명합니다. 이번에 발표된 AI 모델 “Nemotron 3.5 Lightning”는 대량으로 발생하는 전문적인 작업을 고속으로 처리하도록 설계되었다고 합니다. 총 300억 개의 파라미터를 가진 Mixture of Experts(MoE) 모델로, 처리 시 사용되는 활성 파라미터는 30억 개입니다. Nemotron 3.5 Lightning는 Nemotron 3 Nano에 이은 Nemotron 3 시리즈의 확장이라는 위치를 차지하며, 코드 리뷰, 툴 운영, 보안 경고 모니터링, 청구 관련 문의 등 AI 에이전트가 반복적으로 처리하는 전문 작업을 염두에 두고 있습니다. NVIDIA에 따르면 이와 유사한 모델과 비교했을 때 출력 속도는 최대 4배 증가했으며, AI 에이전트의 작업 완료 시간을 30% 단축할 수 있었다고 합니다. 또한, 조직이 보유한 데이터와 업무 절차에 맞춰 추가 학습을 시킬 수도 있습니다. Hugging Face에서는 커스터마이즈를 위한 BF16 버전과 추론 속도 및 처리 효율을 중시한 NVFP4 버전이 공개되었습니다. 둘 다 최대 100만 토큰의 컨텍스트 길이를 지원하며, 일본어도 지원합니다. NVFP4 버전은 DGX Spark 1대 또는 H100 1개로 작동 가능하도록 되어 있으며, Hugging Face에서는 Ollama 또는 LM Studio에서 활용하기 위한 양자화 모델도 안내하고 있습니다. 하지만 가볍고 빠른 모델을 준비해도 “어떤 처리를 어떤 모델에 맡출 것인지”를 인간이 매번 설정해 주어야만 AI 에이전트의 구축이 복잡해집니다. 모델 선택을 자동화하기 위해 동시에 모델 라우팅용 오픈 소스 라이브러리 “NeMo Switchyard”가 공개되었습니다. NeMo Switchyard는 AI 에이전트로부터 도착한 요청을 분석하고 개발자가 등록한 여러 모델 중에서 처리 적합한 모델로 자동으로 배정합니다. NVIDIA 제조 모델뿐만 아니라 오픈 모델 또는 프로피에터리 모델도 조합할 수 있다고 합니다. 품질을 우선하는지, 응답 속도 또는 비용을 줄이는지를 결정하여 배분 방법을 조정할 수도 있습니다. 요청 내용에서 모델을 선택하는 방식 외에도, AI 에이전트가 작업의 어느 단계에 있는지 확인하여 모델을 전환하는 방식이나, 먼저 저비용 모델에 처리하게 한 후 지속적인 문제가 감지된 경우 고성능 모델로 전환하는 방식 등도 마련되어 있다고 합니다. NVIDIA의 내부 벤치마크에서는 NeMo Switchyard를 사용하여 Claude Opus 4.8과 NVIDIA Nemotron 3.5 Lightning, Gemma 3 26B, Qwen 3.6 35B를 조합하면 Claude Opus 4.8 단일 모델과 유사한 수준의 작업 완료율을 유지하면서 비용을 크게 절감할 수 있었다고 보고되었습니다. 네모트론 3.5 라이트닝은 Hugging Face, ModelScope, OpenRouter, NVIDIA의 build.nvidia.com 등에서 이용 가능하며, LM Studio와 Ollama도 지원 안내하고 있습니다. NeMo Switchyard의 소스 코드는 GitHub에서 공개되었으며, NVIDIA는 앞으로 파트너 플랫폼에도 Switchyard를 확대할 계획입니다. 또한, NVIDIA는 AI 시스템에서 여러 모델을 조합하는 경우가 늘어남에 따라 효율, 품질, 비용의 균형을 맞추면서 작업에 적합한 모델을 선택하는 모델 라우팅이 중요하다고 강조하고 있습니다. * 관련 기사 NVIDIA가 일본 특화 소형 AI 모델 “Nemotron-Nano-9B-v2-Japanese”를 공개, 10B 이하에서 최고 성능을 달성하여 상업 이용 가능 – GIGAZINE NVIDIA가 고성능 이미지 생성 모델 및 영상 생성 모델을 포함하는 물리 AI 기반 모델 그룹 “Cosmos 3”을 공개 – GIGAZINE NVIDIA가 자율 주행차용 AI “Alpamayo 2 Super”를 무상 공개 – GIGAZINE NVIDIA가 1분 간의 영상을 생성할 수 있는 AI “SANA-WM”을 발표, 카메라 이동을 정밀하게 제어 가능 – GIGAZINE NVIDIA가 실시간 영상 생성 AI “LongLive-2.0”을 공개, FP4 양자화를 고려한 학습으로 경량화 및 고품질 생성を実現 – GIGAZINE 애플社 내에서는 폴더블 iPhone이 “iPhone Ultra”로 불리고 있습니다. 오늘도 매월 진행되는 “Windows Update”일, 400건 이상의 취약점이 수정됩니다. 2026년 08월 12일 11시 54분 00초 inAI, Posted by log1d_ts 기계 번역된 영어 기사NVIDIA has unveiled the 'Nemotron 3.5 Li…. 최근 24시간 (1시간마다 업데이트, 5분 간격은 여기) 원문 보기 | 출처: Gigazine