Какие локальные AI-модели запускать на 8-256 ГБ VRAM
Если хочется максимум качества из доступной видеопамяти, сейчас расклад примерно такой:
8 ГБ VRAM
Qwen3.8-27B IQ1_S
Максимально агрессивная квантизация, если хочется запустить большую модель даже на небольшой GPU.
https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-IQ1_S.gguf
16 ГБ VRAM
Qwen3.8-27B Q2_K_XL
Уже более разумный баланс между размером модели, памятью и качеством.
https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-Q2_K_XL.gguf
RTX 3090 / 24 ГБ
Qwen3.8-27B Q4_K_M
Один из наиболее интересных вариантов для домашней локальной машины.
https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-Q4_K_M.gguf
RTX 5090
Qwen3.8-27B NVFP4
Отдельная сборка с упором на современные NVIDIA GPU и 4-битный inference.
https://github.com/MiaAI-Lab/Qwen3.8-27B-NVFP4-RTX-5090
RTX PRO 6000
Qwen3.8-27B NVFP4 + SGLang
https://github.com/MiaAI-Lab/Qwen3.8-27B-RTX-6000-PRO-SGLang-DSpark
DGX Spark
Здесь уже можно смотреть в сторону DeepSeek v4 Flash и Qwen3.8-27B.
DeepSeek:
https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark
Qwen:
https://github.com/MiaAI-Lab/Qwen3.8-27B-SGLang-DGX-Spark
2× DGX Spark
DeepSeek v4 Flash
https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark
Если коротко: сейчас больше всего интересных локальных конфигураций строится вокруг Qwen3.8-27B и DeepSeek v4 Flash.
Контекст, KV-cache, backend, quantization и размер offload могут заметно изменить реальные требования к памяти.
Сохраняй как шпаргалку для следующего локального AI-сервера.