NVIDIA выпустила Nemotron 3.5 Lightning: 30B-параметров, но на каждый токен работают только 3B

NVIDIA выпустила Nemotron 3.5 Lightning: 30B-параметров, но на каждый токен работают только 3B

Новая модель сделана под долгоживущих AI-агентов, coding-задачи и дешёвый inference. Внутри гибридная архитектура Mamba-2 + MoE + Attention, контекст до 1 млн токенов, а pretraining прошёл на более чем 20 трлн токенов.

За счёт MoE из 30B параметров активируются около 3B, поэтому модель можно развернуть даже на одном H100 или DGX Spark. NVIDIA сразу выпустила и NVFP4 checkpoint для более экономного inference.

Отдельно прокачали скорость генерации. Вместе с Lightning выходят сразу три варианта speculative decoding: встроенный MTP и внешние drafter-модели DSpark и DFlash, которые пытаются предсказывать несколько следующих токенов за один проход.

По собственным eval NVIDIA, NVFP4-версия набирает 75,57 на GPQA Diamond, 52,8 на SWE-bench Verified и 81,62 на MMLU Pro. При этом модель специально готовили через SFT и RL для кода, tool calling, многошаговых агентных задач и structured output.

Получился довольно интересный «рабочий двигатель» для агентов: огромный контекст, всего 3B активных параметров и несколько способов разогнать decode без перехода к гигантской модели.

huggingface.co/collections/nvidia/nvidia-nemotron-v3

2