Эволюция серверных GPU NVIDIA от A100 до Vera Rubin: ключевые характеристики для сравнения

Эволюция серверных GPU NVIDIA от A100 до Vera Rubin: ключевые характеристики для сравнения

Эпоха LLM началась с ChatGPT и GPT3.5, которую обучали на A100 и выпустили на рынок в 2022.

В конце 2024 появился DeepSeek V3 и далее сразу R1, которые уже обучались на H800 (H100 для китайского рынка) и стали одними из первых больших открытых моделей (671B параметров).

Переход A100 -> H100 сопровождался

а) переходом на новый тех процесс (4N): более маленький размер транзисторов, ниже их емкость -> выше частоты, на которых может работать чип (выше FLOPS)

б) аппаратная поддержка формата FP8: возможность обучать и инферить модели в FP8 -> перемножение матриц в 2 раза быстрее, чем в BF16/FP16, плюс веса занимают в 2 раза меньше памяти

Далее Nvidia расширяет линейку Hopper и выпускает H200, на которой остается тот же чип GH100, но меняется память (HBM3 -> HBM3e). Рост объема памяти c 80 до 141 GB и ее скорости позволили повысить эффективность инференса - запускать более тяжелые модели на меньшем кол-ве GPU, работать с более длинным контекстом / держать больше пользователей и получить выше скорость генерации.

H100 и H200 продолжают оставаться рабочими лошадками в 2026 и, вероятно, будут актуальны еще длительное время. На этих картах NVIDIA прекратил выпуск серверных GPU в форм-факторе PCIe.

Если вы решите переходить на более современную линейку Blackwell, то будете вынуждены приобретать сервера на основе HGX-плат, на которых размещается минимум 8 GPU. И помимо высокого ценового порога входа в 550-650k USD (в РФ) на B200 HGX, вы получаете более жесткие требования по питанию (до 15 кВт) и охлаждению.

Переход Hopper -> Blackwell также сопровождается обновлением тех процесса (4N -> 4NP), но на этот раз помимо общего увеличения плотности транзисторов удалось скомпоновать два кристалла в 1 корпусе. Также была добавлена поддержка более компактных форматов - FP4. Все это в совокупности позволило сделать доп скачок в производительности (выше FLOPS, выше Memory Bandwidth)

В этом месяце в мире начинаются продажи новой серии Vera Rubin. Базовый форм-фактор - так называемый superchip, на котором размещается 2 GPU Rubin и 1 CPU Vera (первый серверный CPU с собственными ядрами от Nvidia).

Такая компоновка далее упаковывается в сборки по 72 GPU, финальная позиция для покупки - Vera Rubin NVL72. Также планируется производство DGX Rubin NVL8 на базе HGX-платы (и соответствующие HGX сервера от OEM производителей - Lenovo, Dell, Supermicro)

Rubin несет в себе обновленный тех процесс N3P и память HBM4. На бумаге заявляется ожидаемый удельный прирост в скорости вычислений для fp8 в 3.5 раза от предыдущей линейки Blackwell и почти в 9 раз от H100. (9 раз за 4 года!) Пропускная способность памяти также существенно выросла (более 2 раз от Blackwell).

На выходе Nvidia обещает следующие экономические эффекты от переход Blackwell -> Rubin

• до 10 раз дешевле стоимость токена

• до 4 раз меньше GPU для обучения (MoE моделей)

Выводы:

• растет порог входа в новые поколения GPU для on-premise (сборка от 8 GPU, питание, охлаждение) -> либо облако, либо работа на предыдущих поколениях (H100/H200)

• вычисления растут быстрее, чем объем и пропускная способность памяти, и узким местом становится память (общая тенденция)

Больше деталей о том, как создавать и запускать продукты на основе AI/ML — в моём телеграм-канале.