NVIDIA выпустила модель Nemotron 3.5 Lightning и роутер NeMo Switchyard для ИИ-агентов

По мере того как ИИ смещается от чат-ботов к автономным агентам, растёт спрос на открытые модели, которые компании могут полностью контролировать, где они работают и как развёртываются. NVIDIA расширила линейку открытых моделей Nemotron: следом за Nemotron 3 Nano вышла Nemotron 3.5 Lightning, по заявлению компании, самая эффективная модель в своём классе для длительных агентных нагрузок. Это модель на смеси экспертов (mixture-of-experts) с 30 млрд параметров, рассчитанная на узкоспециализированные задачи внутри более крупных мультиагентных систем. Одновременно NVIDIA выпустила NeMo Switchyard, открытую библиотеку для умной маршрутизации запросов внутри популярных агентных инструментов: на её основе компании могут построить роутер, который автоматически направляет каждый запрос к наиболее подходящей и эффективной модели из своей смеси открытых, проприетарных моделей и моделей NVIDIA, без переписывания приложений.
NVIDIA исходит из идеи, что современные постоянно работающие (always-on) агентные системы всё больше устроены как ансамбли моделей, где разные модели специализируются на разных задачах: например, флагманская модель для рассуждений, такая как Nemotron 3 Ultra или GPT-5.6, планирует и оркестрирует рабочий процесс, а компактные специализированные модели вроде Nemotron 3.5 Lightning выполняют точечные операции: код-ревью, вызов инструментов, мониторинг алертов безопасности, ответы на вопросы по биллингу.
Nemotron 3.5 Lightning, полностью кастомизируемая открытая модель для высоконагруженных задач в постоянно работающих агентах; над её созданием работала коалиция Nemotron Coalition, предоставившая методологии оценки, инференс-софт и наборы данных. По данным NVIDIA, модель выдаёт результат до 4 раз быстрее, что даёт до 30% более быстрое выполнение агентных задач по сравнению с другими моделями её класса, конкретные модели для сравнения в материале не названы. Благодаря открытости модель можно дообучать (пост-тренировать) с помощью NVIDIA NeMo на собственных данных, инструментах и рабочих процессах компании, повышая точность под конкретные задачи. Свою версию модели уже настраивают под свои нагрузки CrowdStrike (кибербезопасность), связка Harvey и Trajectory (юридические услуги) и связка CodeRabbit и Baseten (код-ревью); Lila Sciences использует модель, чтобы улучшить способности к рассуждению в агентных задачах на стыке физических и биологических наук, а Fastino Labs, дообучив модель, получила, по собственным данным, лучшую точность в задачах разработки ПО, финансов и здравоохранения.
Модель даёт компаниям контроль над приватностью и способом развёртывания: её можно запускать локально, на NVIDIA RTX PC, DGX Spark, DGX Station и Jetson, используя уже имеющуюся инфраструктуру, либо масштабировать на edge-устройства, рабочие станции RTX PRO, дата-центры и облако для корпоративных сценариев. Как и при каждом релизе Nemotron, NVIDIA публикует максимум обучающих данных и техник, насколько позволяют лицензии, это даёт возможность проверки, аудита и обучения на этой основе других моделей. Вместе с Lightning NVIDIA выпускает Nemotron-RL-Agentic-Terminal-Pivot, набор данных для обучения с подкреплением, на котором модель дополнительно тренировали для навыков агента-программиста.
NeMo Switchyard решает другую проблему: если компания полагается на одну модель по умолчанию, она либо переплачивает, либо теряет в качестве, а ручная настройка маршрутизации превращается в отдельную интеграционную работу, которая замедляет внедрение. Switchyard автоматически направляет каждый запрос агента к наиболее подходящей и эффективной модели для конкретного шага; разработчики могут настраивать или менять алгоритмы маршрутизации под свои приоритеты, качество, задержку или стоимость. По внутренним тестам NVIDIA, Switchyard сохраняет точность на уровне топовых моделей, снижая стоимость выполнения задач почти до трети от стоимости работы одной модели Opus 4.8.
NVIDIA привела результаты партнёров, уже опробовавших Switchyard. Boomi проверила библиотеку по пяти сценариям маршрутизации, получив 100% точность определения домена запроса, направив 59% трафика на дообученную модель, которая работает в 5 раз быстрее, и снизив задержку на поздних шагах диалога на 21%. Cadence повысила эффективность на 9,9% в задаче формальной верификации с помощью ChipStack AI Super Agent. Classmethod, запустив нагрузки opencode и Fireworks через Switchyard, получила в первых тестах снижение стоимости на 27% при сохранении качества. Cognition встроила поэтапный (staged) роутер Switchyard в Devin Desktop для внутреннего использования NVIDIA и добилась результата, близкого к топовым моделям, на бенчмарке FrontierCode Main, снизив среднюю стоимость на 28% по сравнению с маршрутизацией всех запросов на одну топовую модель. Kong встроил маршрутизацию через Switchyard прямо в Kong AI Gateway. LangChain на 145 многошаговых задачах Deep Agents добился снижения стоимости на 74%, направляя на топовую модель лишь 7% вызовов, ценой снижения точности на 6%. LiteLLM добавляет Switchyard как плагин в свой прокси-слой, чтобы разработчики получили эти преимущества без изменения текущего стека. Nous Research встроила Switchyard в Hermes, дав разработчикам простую в настройке систему маршрутизации. Ramp с помощью Switchyard добилась результата на уровне топовой модели, снизив расходы на 58% и время выполнения на 33% в тесте Ramp SWE-Bench. Siemens тестирует библиотеку, чтобы повысить эффективность своего агента Fuse EDA AI Agent.
Nemotron 3.5 Lightning доступна на Hugging Face, ModelScope, OpenRouter и build.nvidia.com в виде микросервиса NVIDIA NIM, а также через широкую экосистему облачных партнёров NVIDIA, платформ для дообучения, инференс-платформ и облачных провайдеров. NeMo Switchyard доступна на GitHub; поддержка на партнёрских платформах появится позже, точная дата в материале не названа.
Ключевые факты
- NVIDIA выпустила Nemotron 3.5 Lightning, открытую MoE-модель на 30 млрд параметров для узких задач внутри мультиагентных систем: до 4 раз быстрее по выдаче результата и на 30% быстрее по выполнению агентных задач, чем другие модели её класса.
- Вместе с моделью вышла NeMo Switchyard, open-source библиотека маршрутизации; по внутренним тестам NVIDIA она снижает стоимость выполнения агентных задач почти до трети от стоимости работы одной модели Opus 4.8 при сохранении топовой точности.
- Lightning уже настраивают под себя CrowdStrike, связка Harvey и Trajectory, связка CodeRabbit и Baseten, Lila Sciences и Fastino Labs, для кибербезопасности, юридических услуг, код-ревью, науки и разработки/финансов/здравоохранения соответственно.
- Switchyard тестируют или внедряют десять компаний-партнёров, Boomi, Cadence, Classmethod, Cognition, Kong, LangChain, LiteLLM, Nous Research, Ramp и Siemens, сообщая о снижении расходов от 27% до 74% в зависимости от сценария.
- Обе разработки можно запускать локально, на NVIDIA RTX PC, DGX Spark, DGX Station и Jetson, или масштабировать в облаке; Lightning доступна на Hugging Face, ModelScope, OpenRouter и build.nvidia.com.
Почему это важно
NVIDIA формулирует это как переход от одиночных моделей к системам моделей: постоянно работающий агент редко обходится одной большой моделью, вместо этого крупная модель для рассуждений планирует работу, а компактные модели вроде Lightning дешево и быстро выполняют повторяющиеся узкие шаги (код-ревью, вызов инструментов, мониторинг, ответы на типовые вопросы). Nemotron 3.5 Lightning и NeMo Switchyard закрывают именно эту связку: одна разработка даёт быструю специализированную модель, другая, механизм, который автоматически решает, какую модель из имеющегося набора использовать на каждом шаге. Это часть более широкой ставки NVIDIA на открытые модели плюс инфраструктуру вокруг них, а не только на отдельные модели.
Кому это важно
Прежде всего, командам, которые уже строят или эксплуатируют агентные продукты с несколькими моделями в конвейере, и платформенным/MLOps-командам, которым нужно снижать издержки на инференс без потери качества. Также это касается компаний с требованиями к приватности и локальному развёртыванию (кибербезопасность, юридическая сфера, здравоохранение, финансы), им важна возможность гонять модель на собственном железе. Список уже подключившихся партнёров (Boomi, Cadence, Classmethod, Cognition, Kong, LangChain, LiteLLM, Nous Research, Ramp, Siemens) показывает, что интерес идёт от разработчиков агентных инструментов, EDA/инфраструктурных компаний и финтеха одновременно.
Как это применить
Nemotron 3.5 Lightning можно скачать с Hugging Face, ModelScope, OpenRouter или получить как микросервис NVIDIA NIM на build.nvidia.com, а затем дообучить под свои данные и рабочие процессы через NVIDIA NeMo, компания подчёркивает, что модель полностью кастомизируемая. Для развёртывания без облака подходят NVIDIA RTX PC, DGX Spark, DGX Station и Jetson; для масштабирования, RTX PRO workstations, дата-центры и облачные платформы. NeMo Switchyard лежит на GitHub и уже встраивается в существующие инструменты, Kong AI Gateway, прокси-слой LiteLLM, фреймворк Hermes от Nous Research, так что для многих команд подключение маршрутизации не требует переписывать приложение с нуля; в самой библиотеке можно настраивать или менять алгоритмы маршрутизации под приоритет по качеству, задержке или стоимости.
Можно ли доверять
Материал, официальный анонс в блоге NVIDIA, и почти все цифры об эффективности (ускорение Lightning, снижение стоимости Switchyard), это внутренние тесты самой NVIDIA либо самоотчёты партнёров, а не независимые бенчмарки. Ключевые сравнительные заявления не полностью прозрачны: NVIDIA не называет, с какими именно "другими моделями в своём классе" сравнивалась скорость Lightning, не публикует отдельный бенчмарк точности для самой модели и не приводит дату анонса или дату выхода Switchyard на партнёрские платформы. Ни одно заявление в материале не подкреплено именной цитатой сотрудника NVIDIA или партнёра, только обобщённые формулировки за компанию. Это типичный корпоративный пресс-релиз: цифры правдоподобны и детализированы, но требуют проверки независимыми тестами при принятии решения.
Риски и подводные камни
Заявленные проценты экономии у партнёров (от 27% до 74%) сильно различаются по сценарию и методике измерения, и ни одна цифра не сопровождается независимым аудитом, переносить их на свою нагрузку напрямую нельзя. Компромисс между стоимостью и точностью явно виден только у LangChain (6% потери точности за 74% экономии); для остальных партнёров такой trade-off не раскрыт, хотя маршрутизация к более дешёвым моделям почти всегда подразумевает какой-то компромисс. Цена и условия лицензирования Nemotron 3.5 Lightning и NeMo Switchyard в материале не названы. Наконец, при всей риторике об открытости и контроле экосистема выстроена вокруг продуктов NVIDIA (NeMo, NIM, DGX, RTX), переход на неё усиливает зависимость от инфраструктуры одного вендора, даже если сами модели и библиотека открыты.