AI가 챗봇에서 자율 에이전트로 옮겨 가면서, 오픈 모델은 AI를 어디서 실행할지, 어떻게 배포하고 발전시킬지를 완전히 통제하려는 시장의 요구에 부응하고 있습니다.
NVIDIA는 기존 Nemotron 3 모델 제품군에 Nemotron 3.5 Lightning을 새롭게 추가했는데요, 이는 장시간 실행되는 에이전틱 AI 워크로드에서 동급 최고의 효율을 제공하는 모델입니다. Nemotron 3 Nano에 이은 이번 릴리스는 더 높은 정확도와 속도를 위해 오픈 모델을 지속적으로 개선하기 위한 NVIDIA의 노력을 단적으로 보여주는 예이기도 합니다.
대규모 멀티 에이전트 시스템 안에서 특화된 작업을 수행하도록 설계된 Nemotron 3.5 Lightning은 300억 개 파라미터의 전문가 혼합(Mixture-of-Experts, MoE) 모델로, 더 똑똑하고 효율적인 에이전틱 애플리케이션을 만드는 데 도움을 줍니다.
또한 널리 쓰이는 에이전트 도구 안에서 스마트 라우팅을 수행하는 오픈 소스 라이브러리 NeMo Switchyard를 공개했는데요, 기업은 이를 활용해 자사 요구에 맞는 라우터를 구축할 수 있습니다. 배포된 NeMo Switchyard는 개발자가 애플리케이션을 다시 작성할 필요 없이, 개발자가 조합해 쓰는 개방형·상용·NVIDIA 모델 전반에서 각 요청을 해당 작업에 가장 적합하고 유능한 모델로 지능적으로 전달합니다.
Nemotron 3.5 Lightning과 NeMo Switchyard는 PC와 워크스테이션, 데이터센터, 클라우드 전반에서 AI를 어떻게 배포하고 어디서 실행하며 얼마나 효율적으로 운영할지에 대한 통제력을 함께 높여줍니다.

Nemotron 3.5 Lightning은 대량의 에이전틱 워크플로우를 위해 설계된 작고 맞춤화 가능한 개방형 모델에 프런티어급 지능을 담았습니다.
상시 가동되는 에이전트에는 모델의 시스템이 필요합니다
현대의 에이전틱 시스템, 즉 상시 가동 에이전트는 서로 다른 작업에 특화된 여러 모델로 구성된 모델의 시스템(systems of models), 즉 모델 앙상블 형태로 작동하는 경우가 늘고 있습니다.
NVIDIA Nemotron 오픈 모델은 바로 이러한 아키텍처를 위해 설계되었습니다. Nemotron 3 Ultra나 GPT-5.6 같은 프런티어 추론 모델이 워크플로우를 계획하고 오케스트레이션하는 동안, Nemotron 3.5 Lightning 같은 더 작은 특화 모델은 코드 리뷰와 도구 사용, 보안 경보 모니터링, 청구 문의 응대처럼 목적이 분명한 작업을 수행할 수 있습니다.
Nemotron 3.5 Lightning으로 대량의 특화 작업 처리하기
NVIDIA Nemotron 3.5 Lightning은 상시 가동 에이전트를 구동하는 대량 작업을 위해 만들어진, 완전히 맞춤화 가능한 개방형 모델입니다. 이 모델은 Nemotron Coalition의 기여로 개발됐으며, 회원사들이 평가 방법론과 추론 소프트웨어, 데이터세트를 제공해 모델 발전에 힘을 보탰습니다.
이 모델은 최대 4배 빠른 출력 속도를 제공하며, 그 결과 동급 다른 모델 대비 에이전틱 작업을 30% 더 빠르게 완료합니다. 또한 개방형이면서 맞춤화가 가능하기 때문에, NVIDIA NeMo로 조직 자체의 도메인 데이터와 도구, 워크플로우에 맞춰 손쉽게 포스트 트레이닝해 특화 작업의 정확도를 높일 수 있습니다.

PinchBench 벤치마크에 따르면 Nemotron 3.5 Lightning은 동급 다른 모델 대비 프런티어급 정확도를 유지하면서 에이전틱 작업을 더 빠르게 완료합니다.
여러 산업의 AI 선도 기업들이 자사 워크로드에 맞춰 Nemotron 3.5 Lightning을 맞춤화하고 있습니다. 사이버보안 분야의 CrowdStrike, 법률 서비스 분야의 Harvey와 Trajectory, 코드 리뷰 분야의 CodeRabbit과 Baseten이 도메인 특화 에이전틱 작업의 정확도를 높이고 있습니다. 이와 함께 Lila Sciences는 물리·생명과학 전반의 에이전틱 작업에서 추론 역량을 개선하고 있으며, Fastino Labs는 이 모델을 맞춤화해 소프트웨어 개발과 금융, 헬스케어 워크로드에서 최고 수준의 정확도를 거두고 있습니다.

기업들은 Nemotron 3.5 Lightning을 맞춤화해 에이전틱 워크플로우 내 특화 작업에서 최고 수준의 정확도를 달성했습니다.
Nemotron 3.5 Lightning은 프라이버시와 배포에 대한 통제권도 제공합니다. NVIDIA RTX PC와 NVIDIA DGX Spark, NVIDIA DGX Station, NVIDIA Jetson을 비롯한 로컬 AI 시스템에서 실행해 기존 인프라 투자를 최대한 활용할 수 있고, 엔터프라이즈 활용 사례에 맞춰 엣지 AI 디바이스와 NVIDIA RTX PRO 워크스테이션, 데이터센터, 클라우드 환경으로 확장할 수도 있습니다. 또한 빠른 응답이 필요한 대량의 특화 작업을 위해 로컬이나 온프레미스에서 실행할 수 있습니다.
아울러 NVIDIA는 모든 Nemotron 출시 때와 마찬가지로 라이선스가 허용하는 범위에서 학습 데이터와 기법을 최대한 공개해 추적성과 감사, 다른 모델의 학습을 가능하게 합니다. Lightning과 함께 NVIDIA는 코딩 에이전트 역량을 위한 포스트 트레이닝에 사용된 에이전틱 강화 학습 데이터세트 Nemotron-RL-Agentic-Terminal-Pivot도 공개합니다.
모델 라우팅으로 더 효율적인 AI 앱 만들기
어떤 모델은 코딩에, 어떤 모델은 추론에, 어떤 모델은 가벼운 작업에 더 적합하고, 어떤 모델은 프라이버시와 효율을 높이기 위해 로컬 실행에 최적화돼 있습니다. 고객이 기본 모델 하나에만 의존하면 비용을 과하게 쓰거나 품질을 놓칠 수 있고, 라우팅을 수동으로 관리하면 배포를 늦추는 통합 작업이 되어버립니다.
NVIDIA NeMo Switchyard는 AI 에이전트를 위한 오픈 소스 모델 라우팅 라이브러리입니다. 이 기술은 구체적인 요구사항에 따라 에이전트 워크플로우의 각 단계마다 가장 유능하고 효율적인 모델로 프롬프트를 자동으로 전달합니다. 에이전트 애플리케이션 개발자는 품질과 지연 시간, 비용 요건 등 자신의 우선순위에 맞춰 다양한 라우팅 알고리즘으로 라우터를 조정하거나 수정할 수 있습니다. 모델의 시스템 안에서 기업은 토큰 경제성(토크노믹스)을 개선한 강력한 AI 에이전트를 만들 수 있습니다.
내부 벤치마크에 따르면 NeMo Switchyard는 프런티어급 정확도를 유지하면서 작업 완료 비용을 Opus 4.8 단독 사용 대비 약 3분의 1 수준으로 낮췄습니다.

NVIDIA 내부 벤치마크에 따르면 NeMo Switchyard는 프런티어급 정확도를 유지하면서 작업 완료 비용을 Opus 4.8 단독 사용 대비 약 3분의 1 수준으로 낮춥니다.
NVIDIA는 AI 생태계 전반의 파트너들과 협력해 개발자가 이미 사용하는 도구와 플랫폼에 지능형 모델 라우팅을 도입하고 있습니다.
- Boomi: 5가지 라우팅 역량에 걸쳐 Switchyard를 평가해 도메인 라우팅 정확도 100%를 달성했고, 트래픽의 59%를 5배 빠른 파인 튜닝 모델로 보내면서 후반 턴 지연 시간을 21% 줄였습니다.
- Cadence: 형식 검증(formal verification) 활용 사례에서 ChipStack AI Super Agent를 사용해 효율을 9.9% 개선했습니다.
- Classmethod: NeMo Switchyard로 opencode와 Fireworks 워크로드를 사내에서 운영 중이며, 초기 테스트에서 품질을 유지하면서 비용을 27% 절감했습니다.
- Cognition: NVIDIA NeMo Switchyard의 단계형 라우터를 NVIDIA 사내용 Devin Desktop에 통합해 FrontierCode Main에서 프런티어에 근접한 성능을 달성하면서, 모든 요청을 단일 프런티어 모델로 보내는 경우 대비 평균 비용을 28% 절감했습니다.
- Kong: Kong AI Gateway를 통해 NeMo Switchyard 기반 라우팅을 기본 제공합니다.
- LangChain: NeMo Switchyard로 145개 멀티턴 Deep Agents 작업에서 호출의 7%만 프런티어 모델로 라우팅해, 정확도는 6% 낮아지는 대신 비용을 74% 절감했습니다.
- LiteLLM: 개발자가 기존 스택을 바꾸지 않고도 이러한 이점을 누릴 수 있도록 NeMo Switchyard를 프록시 계층의 플러그인으로 추가하고 있습니다.
- Nous Research: 개발자가 손쉽게 설정할 수 있는 라우팅 시스템으로 에이전트 효율을 높이기 위해 NeMo Switchyard를 Hermes에 통합했습니다.
- Ramp: Ramp SWE-Bench에서 NeMo Switchyard를 사용해 프런티어 모델과 동등한 성능을 내면서 비용은 58%, 실행 시간은 33% 줄였습니다.
- Siemens: Fuse EDA AI Agent의 효율을 개선하기 위해 벤치마크를 진행하고 있습니다.
Nemotron 3.5 Lightning은 Hugging Face와 ModelScope, OpenRouter, 그리고 build.nvidia.com에서 NVIDIA NIM 마이크로서비스로 제공되며, NVIDIA 클라우드 파트너와 포스트 트레이닝 플랫폼, 추론 플랫폼, 클라우드 서비스 제공업체로 이뤄진 폭넓은 생태계를 통해서도 이용할 수 있습니다. NeMo Switchyard는 GitHub에서 제공되며, 곧 파트너 플랫폼에도 도입될 예정입니다.
