Nvidia выпустила Switchyard: AI-агентам больше не нужно гонять каждый шаг через дорогую модель
Nvidia выпустила Switchyard: AI-агентам больше не нужно гонять каждый шаг через дорогую модель
Nvidia показала связку для долгих AI-агентов: открытую модель Nemotron 3.5 Lightning и библиотеку NeMo Switchyard, которая распределяет разные шаги задачи между моделями. Смысл новости не в том, что появилась еще одна LLM, а в том, что агентные системы начинают собирать как набор специализированных исполнителей.
Nemotron 3.5 Lightning — 30B Mixture-of-Experts модель, у которой во время работы активны около 3 млрд параметров. Nvidia позиционирует ее не как главный “мозг” для сложного рассуждения, а как быстрый execution-слой: tool calls, проверка результатов, форматирование, рутинные действия и частые шаги внутри long-running агентов.
Зачем агенту маршрутизатор моделей
Проблема знакомая всем, кто пробовал строить рабочих агентов: если каждый мелкий шаг отправлять в самую дорогую frontier-модель, растут latency и счет за токены. Если вручную раскладывать задачи по моделям, усложняется интеграция и легко потерять качество.
NeMo Switchyard должен закрыть этот слой автоматически. Библиотека выбирает модель для каждого шага workflow по заданной стратегии: качество, задержка, стоимость или их баланс. В системе могут быть открытые, закрытые и собственные дообученные модели компании.
Nvidia приводит первые цифры. Nemotron 3.5 Lightning, по ее данным, дает до 4 раз более быструю генерацию и до 30% быстрее завершает агентные задачи в своем классе. LangChain в тесте Deep Agents сообщает о 74% снижении стоимости, если только 7% вызовов отправлять во frontier-модель. Ramp говорит, что Switchyard позволил сохранить уровень frontier-модели, но снизить стоимость на 58% и runtime на 33% в Ramp SWE-Bench.
Почему это важно для бизнеса и разработчиков
Это сдвигает разговор об агентах от демо к экономике эксплуатации. Рабочий агент не пишет один красивый ответ: он часами читает файлы, дергает инструменты, проверяет вывод, возвращается к ошибкам и повторяет однотипные операции. На таком масштабе “какой моделью думать” становится таким же инженерным решением, как выбор базы данных или очереди задач.
Для Nvidia это еще и ставка на открытые модели как инфраструктуру. Lightning доступна на Hugging Face, ModelScope, OpenRouter и build.nvidia.com, а Switchyard опубликован на GitHub. Если подход приживется, рынок агентных систем будет конкурировать не только качеством самой умной модели, но и тем, насколько грамотно продукт умеет тратить интеллект.
- blogs.nvidia.comNVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AI
- developer.nvidia.comNVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents | NVIDIA Technical Blog
- siliconangle.comNvidia releases Nemotron 3.5 Lightning and NeMo Switchyard to give enterprise AI capability options - SiliconANGLE
- techmeme.comNvidia releases Nemotron 3.5 Lightning, an open 30B-parameter MoE model, and NeMo Switchyard, an open-source model routing library for AI agents
- commons.wikimedia.orgWikimedia Commons: NVIDIA H100 photo by Geekerwan













