Новая эра агентов: NVIDIA выпустила Nemotron 3.5 Lightning бесплатная модель 1M контекстом, 30B параметров и 4× скоростью генерации

Nemotron 3.5 Lightning — открытую модель, которая переворачивает представление о том, какой должна быть эффективная ИИ-система для агентов. 30 млрд параметров в общей сложности, но всего 3 млрд активных на токен. Специально для долгоживущих AI-агентов, кодинга и высоконагруженных задач. Nemotron 3.5 Lightning - здесь

Новая эра агентов: NVIDIA выпустила Nemotron 3.5 Lightning бесплатная модель 1M контекстом, 30B параметров и 4× скоростью генерации

Архитектура: гибрид, который экономит ресурсы

Nemotron 3.5 Lightning построена на гибридной архитектуре, объединяющей три подхода: Mamba-2, MoE (Mixture of Experts) и классические Attention-слои. Это позволяет модели быть одновременно мощной и лёгкой.

Ключевые цифры:

· Общее количество параметров: 30 млрд

· Активных параметров на токен: ~3 млрд

· Контекстное окно: до 1 млн токенов

· Количество слоёв: 52

· Архитектура: Hybrid MoE (Mamba-2 + MoE + Attention)

Благодаря MoE, при обработке каждого токена активируется лишь около 3 млрд параметров из 30. Это позволяет запускать модель на одном H100 или даже DGX Spark, а не на кластере из десятков GPU.

Модель доступна в двух чекпоинтах: BF16 (для дообучения и кастомизации) и NVFP4 (для максимально экономного инференса).

Скорость: до 4× быстрее конкурентов

NVIDIA заявляет, что Nemotron 3.5 Lightning обеспечивает до 4 раз более высокую скорость генерации по сравнению с аналогичными открытыми моделями.

Результаты тестов:

· PinchBench: 86% точности, при этом выполнение 10 000 задач на 30% быстрее, чем у Qwen3.6 35B при аналогичной точности

· Токен-генерация: до 4× быстрее моделей аналогичного размера

Секрет скорости — спекулятивное декодирование (speculative decoding). В модели встроен Multi-Token Prediction (MTP) — механизм, предсказывающий несколько следующих токенов за один проход. Дополнительно NVIDIA выпустила два внешних drafter-модели: DSpark и DFlash, которые ускоряют инференс ещё сильнее.

Производительность: баланс между качеством и скоростью

Nemotron 3.5 Lightning - здесь

Nemotron 3.5 Lightning не пытается быть «универсальным солдатом». Она создана для высоконагруженного исполнительского слоя (execution layer) агентов: вызовы инструментов, проверка результатов, валидация, делегирование задач суб-агентам.

Бенчмарки (NVFP4-версия, по данным NVIDIA):

  • GPQA Diamond (рассуждение) 75,57
  • SWE-bench Verified (кодинг) 52,8
  • MMLU Pro (общие знания) 81,62

Источник:

Для сравнения: в NVFP4-версии результат на GPQA Diamond (75,57) даже немного выше, чем в BF16 (75,44). На SWE-bench Verified NVFP4 показывает 52,80 против 51,56 у BF16.

Модель прошла специальную пост-тренировку через SFT (Supervised Fine-Tuning) и RL (Reinforcement Learning) для задач кодинга, вызова инструментов, многошаговых агентных сценариев и структурированного вывода.

Для кого эта модель?

Nemotron 3.5 Lightning создана для «исполнительского слоя» в системах с несколькими моделями. В таких системах фронтирная модель-планировщик (например, Nemotron 3 Ultra или GPT-5.6) берёт на себя сложное планирование и оркестрацию, а Nemotron 3.5 Lightning выполняет высокочастотные, повторяющиеся задачи: ревью кода, вызов инструментов, мониторинг оповещений, ответы на типовые запросы.

Идеальные сценарии:

· Суб-агенты и высоконагруженные вызовы инструментов

· Локальный запуск на DGX Spark, RTX 5090 или Jetson

· Пост-тренировка под специализированные задачи (финансы, кибербезопасность, юриспруденция)

· Работа в популярных агентных harness: OpenClaw, Hermes Agent

Где НЕ стоит использовать: как основной кодинг-агент, если нужен топовый результат на Terminal-Bench. Для этого есть более тяжёлые модели-планировщики.

Открытость и экосистема

Модель распространяется под лицензией OpenMDW-1.1, разрешающей коммерческое использование. Веса, данные и рецепты дообучения доступны на Hugging Face и ModelScope.

Вывод Vectra

Nemotron 3.5 Lightning — это не просто модель. Это архитектурный паттерн для следующего поколения AI-агентов.

Вместо того чтобы гнаться за триллионами параметров, NVIDIA сделала ставку на эффективность исполнительского слоя. 30B параметров, из которых активны только 3B, 1M контекста, 4× скорость и возможность запуска на одном GPU — это делает модель идеальным «рабочим двигателем» для агентов, которые должны выполнять тысячи рутинных задач без задержек и без раздутых счетов.

Как пишут в обзорах: «Nemotron 3.5 Lightning — это рабочая лошадка, которая носит амбиции фронтира». И, судя по первым отзывам, она справляется с этой ролью блестяще.

Nemotron 3.5 Lightning - здесь

1