Я протестировал 19 видеокарт для локальных LLM. Самая дорогая оказалась худшей

Совет, который повторяют в каждом треде, в каждом дискорде и на каждом реддите, звучит одинаково: бери больше VRAM. И да, объём памяти действительно важен. Если модель не помещается в память, дальше можно даже не начинать. Это очевидно. Но есть нюанс, о котором почему то молчат.

Объём памяти решает, что вообще запустится. А вот пропускная способность памяти решает, что будет реально работать. Между этими двумя вещами гигантская разница. Я две недели гонял локальный инференс на 19 разных картах, и результаты получились местами дикими. Карты с меньшим объёмом памяти, но жирной пропускной способностью в пух и прах разносили машины с ярлыком AI-ready и 96 гигабайтами общей памяти. Разрыв даже не близкий.

Почему пропускная способность тут главная

Когда LLM выдаёт один токен, видеокарта каждый раз читает веса модели из памяти, считает внимание и слои, записывает промежуточные результаты и повторяет всё заново для следующего токена. И вот тут начинается некрасивое. Ядра видеокарты простаивают. Они ничего не делают, потому что данные ещё не приехали. Это называется упор в память, и именно это тихо убивает почти любую локальную сборку под LLM.

Я своими глазами видел, как модель на 13 миллиардов параметров еле ползёт на системе со 96 гигабайтами общей памяти. И та же самая модель летает на карте с 24 гигабайтами, но вдвое большей пропускной способностью. Проблема не в ядрах. Проблема в шине памяти. Кстати, поэтому квантизация в меньшую битность так сильно помогает: данных для перекачки становится меньше.

Немного математики, чтобы не верить мне на слово

Возьмём модель на 13 миллиардов параметров с квантизацией Q4. Это примерно 0,7 байта на параметр. На каждый токен нужно прочитать около двух байт на каждый параметр, то есть около 18 гигабайт на один токен. При пропускной способности 936 ГБ в секунду это около 19 миллисекунд на токен. При 504 ГБ в секунду уже около 36 миллисекунд. При 256 ГБ в секунду около 70 миллисекунд. Модель одна, объём памяти одинаковый, а разница в скорости почти четырехкратная. Исключительно из-за пропускной способности.

Ловушки, которые лучше обходить стороной

Первая ловушка это мини-ПК на AMD Ryzen AI Max+ 395 за две-четыре тысячи долларов. Звучит красиво: 96 гигабайт общей памяти, надпись AI-ready. Вот только встроенная Radeon 8060S тянет данные из DDR5 на скорости около 256 ГБ в секунду. Я тестировал такой в прошлом месяце. Модель 13B Q4 выдавала токены целую вечность. За премиальные деньги вы получаете процессорную производительность и графику, которая не успевает кормить сама себя.

Вторая ловушка это NVIDIA DGX Spark за четыре-четыре с половиной тысячи долларов. Личный ИИ-суперкомпьютер, 128 гигабайт LPDDR5X, выглядит впечатляюще. А пропускная способность около 273 ГБ в секунду. Бэушная RTX 3090 за 800–1050 долларов даёт 936 ГБ в секунду. Это в 3,4 раза быстрее и за четверть цены. DGX Spark имеет смысл только если вам нужно грузить модели, которые физически не влезают в 24 гигабайта. Во всех остальных случаях это очень дорогое пресс-папье. 128 гигабайт бесполезны, если данные не успевают двигаться.

Какие карты реально стоят своих денег

Первый выбор это RTX 3090 за 600–1050 долларов на вторичке. 24 гигабайта GDDR6X на 936 ГБ в секунду. Это практически та же пропускная способность, что у 5080, но больше памяти и за меньшие деньги. Я гоняю на ней Qwen3.6-27B, квантованную Llama 405B и всё, что влезает в 24 гигабайта. Работает плавно.

Второй вариант это RX 7900 XTX за 800–1000 долларов. AMD случайно сделала лучшую карту по соотношению цены и пользы для LLM. 960 ГБ в секунду, 24 гигабайта памяти, полноценная 384-битная шина. По пропускной способности она на уровне RTX 6000 Ada за долю цены. ROCm в 2026 году наконец реально работает. Я запускал llama.cpp на Linux и всё завелось без танцев с бубном. Возьмите две штуки меньше чем за 2000 долларов и получите 48 гигабайт памяти суммарно.

Третий вариант это Radeon AI PRO R9700 за 1350 долларов. Рабочая карта с ECC и 32 гигабайтами памяти. Пропускная способность ниже, 645 ГБ в секунду, но объём памяти попадает в самую точку. Если нужна надёжность и не хочется возиться со вторичкой, это ваш вариант. Драйверы теперь в порядке, я сам был удивлён.

Короткая шпаргалка по выбору

Если нужна максимальная производительность и деньги не вопрос, берите RTX PRO 6000 Blackwell за около 13 тысяч долларов. Лучшее соотношение цены и пользы для LLM даёт бэушная RTX 3090 за 600–1050 долларов. Больше всего пропускной способности на доллар у RX 7900 XTX за 800–1000 долларов. Если нужны ECC и надёжность рабочей станции, смотрите на Radeon AI PRO R9700 или бэушную RTX A5000. Если нужно 48 гигабайт без наценки за датацентр, берите бэушную RTX A6000 или две RX 7900 XTX. Для компактной сборки подойдёт RTX PRO 4000 Blackwell за около 2200 долларов.

Главный вывод

Объём памяти говорит, что поместится. Пропускная способность говорит, что будет летать. Не ведитесь на маркетинг. Смотрите на цифру пропускной способности и считайте математику. Будущий вы скажете себе спасибо, когда модель отвечает в реальном времени.

Больше материалов в телеграм-канале :

5
1