Какие локальные AI-модели запускать на 8-256 ГБ VRAM

Если хочется максимум качества из доступной видеопамяти, сейчас расклад примерно такой:

8 ГБ VRAM

Qwen3.8-27B IQ1_S

Максимально агрессивная квантизация, если хочется запустить большую модель даже на небольшой GPU.

https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-IQ1_S.gguf

16 ГБ VRAM

Qwen3.8-27B Q2_K_XL

Уже более разумный баланс между размером модели, памятью и качеством.

https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-Q2_K_XL.gguf

RTX 3090 / 24 ГБ

Qwen3.8-27B Q4_K_M

Один из наиболее интересных вариантов для домашней локальной машины.

https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-Q4_K_M.gguf

RTX 5090

Qwen3.8-27B NVFP4

Отдельная сборка с упором на современные NVIDIA GPU и 4-битный inference.

https://github.com/MiaAI-Lab/Qwen3.8-27B-NVFP4-RTX-5090

RTX PRO 6000

Qwen3.8-27B NVFP4 + SGLang

https://github.com/MiaAI-Lab/Qwen3.8-27B-RTX-6000-PRO-SGLang-DSpark

DGX Spark

Здесь уже можно смотреть в сторону DeepSeek v4 Flash и Qwen3.8-27B.

DeepSeek:

https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

Qwen:

https://github.com/MiaAI-Lab/Qwen3.8-27B-SGLang-DGX-Spark

2× DGX Spark

DeepSeek v4 Flash

https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

Если коротко: сейчас больше всего интересных локальных конфигураций строится вокруг Qwen3.8-27B и DeepSeek v4 Flash.

Контекст, KV-cache, backend, quantization и размер offload могут заметно изменить реальные требования к памяти.

Сохраняй как шпаргалку для следующего локального AI-сервера.

3