NVIDIA выпустила Nemotron 3.5 Lightning для длительно работающих ИИ-агентов

NVIDIA выпустила модель с открытыми весами Nemotron 3.5 Lightning, рассчитанную на высокочастотные операции в длительно работающих ИИ-агентах. MoE-модель содержит 30 млрд параметров, из которых при обработке каждого токена активируются 3 млрд, и поддерживает контекст до 1 млн токенов.

NVIDIA представила Nemotron 3.5 Lightning как модель для исполнительного уровня агентных систем: вызова инструментов, проверки результатов и делегирования задач вспомогательным агентам. Такой подход позволяет не использовать более крупную рассуждающую модель для каждой рутинной операции.

Nemotron 3.5 Lightning построена на гибридной архитектуре Mamba-2, Mixture of Experts (MoE) и Attention. Модель содержит 30 млрд параметров при 3 млрд активных и выпускается в вариантах BF16 и NVFP4. Для ускорения генерации предусмотрены многотокенное предсказание и отдельные модели спекулятивного декодирования DSpark и DFlash.

По измерениям NVIDIA, скорость вывода может в четыре раза превышать показатели сопоставимых по размеру моделей. В тесте PinchBench модель показала точность около 86% и выполнила 10 тысяч заданий на 30% быстрее Qwen3.6 35B при сопоставимой точности.

Сравнение точности и времени выполнения агентных задач моделями Nemotron 3.5 Lightning, Qwen3.6 35B и Gemma 4 26B

Веса модели опубликованы по лицензии OpenMDW 1.1 вместе с данными и рецептами обучения. Для развертывания поддерживаются vLLM, SGLang и TensorRT-LLM, а также локальные инструменты llama.cpp, Ollama и LM Studio. Одновременно NVIDIA представила библиотеку NeMo Switchyard, которая распределяет запросы между несколькими моделями в зависимости от сложности задачи.

Источник: developer.nvidia.com

Связь с редакцией