💻 Какую нейросеть запустить локально: от 8 до 512 ГБ памяти. Подборка для программирования, работы с изображениями и агентных задач.

Диапазоны рассчитаны на квантованные версии. Помимо весов, нужна память под контекст и работу движка. На Mac и DGX Spark часть общей памяти занимает система.

🟢 8 ГБ

Spark-X2.5-4B - https://huggingface.co/XHToken/Spark-X2.5-4B

Компактная модель для текста, кода и вызова инструментов. Поддерживает контекст до 1 млн токенов, но полностью использовать его на 8 ГБ не получится.

Ternary Bonsai 27B - https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf

Сжатая версия на базе Qwen3.6-27B. Веса занимают около 7,2 ГБ. На 8 ГБ могут потребоваться короткий контекст и частичная выгрузка в RAM.

🔵 16 ГБ

Gemma 4 12B - https://huggingface.co/google/gemma-4-12B-it

Поддерживает текст, изображения, аудио и видео. Подойдёт для анализа скриншотов, документов и медиаматериалов. Для 16 ГБ нужна квантованная сборка.

🟣 24 ГБ

Qwen3.8-27B - https://huggingface.co/Qwen/Qwen3.8-27B

Вариант для локального помощника по программированию и работе с инструментами. Можно рассмотреть сборки на 3,5–4 бита, оставив запас памяти под контекст.

🟠 32–64 ГБ

Nex-N2.5-mini - https://huggingface.co/nex-agi/Nex-N2.5-mini

Мультимодальная MoE-модель на 35 млрд параметров для кода и агентных задач. На каждом токене активируется часть экспертов, но хранить нужно все веса. Для 32 ГБ потребуется квантование.

🔴 96–128 ГБ

Qwen3.8-Flash-Next - https://huggingface.co/Qwen/Qwen3.8-Flash-Next

Крупная мультимодальная модель. Требования зависят от квантования, длины контекста и поддержки выгрузки весов выбранным движком.

GLM-5.3-Flash EXL3 2.0bpw - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-TR3-2.0bpw

Экспериментальная сборка, проверенная автором на DGX Spark. Требует специального окружения; ограничения перечислены в карточке.

⚙ 192–256 ГБ

DeepSeek-V4-Flash-Vision-Exp - https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

Экспериментальная мультимодальная версия для работы с текстом и изображениями. Для этого диапазона памяти нужен подходящий формат весов.

Nex-N2.5-Pro - https://huggingface.co/nex-agi/Nex-N2.5-Pro

Модель для мультимодальных и агентных сценариев. Объём памяти зависит от выбранной сборки.

GLM-5.3-500B EXL3 3bpw - https://huggingface.co/0xSero/GLM-5.3-500B-EXL3-3.0bpw

Версия с удалённой частью экспертов. Одни веса занимают около 197 ГБ, поэтому 192 ГБ недостаточно.

GLM-5.3-Flash EXL3 Q4 - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-Q4

Экспериментальная сборка: автор сообщает, что полноценный запуск сервера для неё ещё не проверен.

🖥 384–512 ГБ

GLM-5.3 - https://huggingface.co/zai-org/GLM-5.3

Крупная MoE-модель для разработки и длительных агентных задач. В этом диапазоне рассматривают квантованные сборки примерно на 3–4 бита.

Перед скачиванием проверьте формат: EXL3, GGUF и MLX требуют разных движков. Сборка для NVIDIA может не подойти для Mac, даже если памяти достаточно.

11