Локальные LLM без GPU - что реально работает на обычном железе

Где-то в 2022 году запустить языковую модель локально означало одно - профессиональная видеокарта, желательно с 24 ГБ VRAM, и несколько часов настройки. Для большинства это был закрытый клуб. Потом появилась квантизация, и уравнение поменялось.

Локальные LLM без GPU - что реально работает на обычном железе

Суть простая. Веса модели хранятся в числах с плавающей точкой - изначально 32-битных. Квантизация сжимает их до 4 бит. Модель становится в 3-4 раза легче при минимальной потере качества: 7B параметров теперь занимают 4-5 ГБ вместо 14. Ноутбук с обычными 8 ГБ RAM неожиданно превращается в рабочий стенд. Это был первый сдвиг.

Второй - Ollama. Инструмент, который убирает всё лишнее между пользователем и моделью. Не нужно настраивать Python-окружения, прописывать пути к весам, разбираться с форматами чекпоинтов. Устанавливается одной командой, сама видит GPU если она есть - NVIDIA, AMD, Apple Metal - и при её отсутствии тихо переключается на CPU. Модели качаются как Docker-образы. Один ollama run - и через несколько минут загрузки уже можно задавать вопросы.

У нас, если честно, GPU не было вовсе. Чистый CPU, Windows. Это и стало условием всего теста.

Кстати, и SYNTAX.AI собрал в одном интерфейсе ChatGPT, Claude, Gemini, Midjourney и ещё несколько десятков моделей - без VPN и отдельных подписок. Промокод NEIROSKUF даёт минус 15% к любому тарифу.

Как установить и запустить

На Linux всё решается так:

curl -fsSL https://ollama.com/install.sh | sh

На Windows и macOS - установщик с ollama.com/download, запустили, дальше то же самое. После установки первый запуск модели выглядит так:

ollama run smollm2:1.7b # Тир 1 - 1.8 ГБ ollama run phi4-mini # Тир 2 - 2.5 ГБ ollama run qwen3:8b # Тир 3 - 5.2 ГБ

При первом вызове модель скачается автоматически. Если хочется загрузить заранее, без запуска интерактивного чата - ollama pull phi4-mini. Посмотреть, что уже установлено - ollama list. Вот и весь онбординг.

Дальше интереснее.

Три тира, три уровня железа

Мы не пытались собрать топ лучших моделей 2026 года. Критерии отбора были проще: работает стабильно через Ollama, доступна прямо сейчас, приносит реальную пользу при конкретных ограничениях по железу. Никаких экзотических форков, которые надо собирать руками.

Тир 1 - 2-4 ГБ RAM, GPU не нужна. Офисный ПК или ноутбук, которому уже лет семь. Скорость выдачи - 15-20 токенов в секунду, это достаточно комфортно. Многошаговые рассуждения здесь не работают, и ожидать их не стоит. Зато с однозначными задачами - перефразировать текст, классифицировать, ответить на прямой вопрос - модели справляются.

Из этого тира приятно удивил qwen3:1.7b: весит всего 1.4 ГБ, держит контекст 40K и поддерживает русский язык. Для суммаризации длинного документа - вполне рабочий вариант. reader-lm:1.5b заточена под одну задачу - конвертировать HTML-страницы в Markdown. Узко, но если это нужно часто, лучше инструмента в таком весе найти сложно. moondream умеет описывать изображения - мультимодальность за 1.7 ГБ, что само по себе неожиданно.

smollm2:1.7b - только английский. Учитывайте это если работаете с русскоязычным контентом. Мы учли чуть позже, чем стоило.

Тир 2 - 6-8 ГБ RAM. Средний ноутбук, скорость 8-12 токенов в секунду. Тут уже чувствуется качественный скачок. Модели структурируют ответ, держат нить разговора, замечают противоречия в запросе. Часть умеет думать вслух перед ответом.

phi4-mini с контекстом 128K работает с длинными документами, объясняет код и решает задачи по шагам. phi3.5 - примерно того же уровня, но чуть лучше справляется с генерацией SQL по описанию. qwen3:4b держит контекст 256K - один из лучших показателей в этом тире - и поддерживает режим /think, когда перед ответом выводится цепочка рассуждений. Это помогает при проверке логики.

gemma3:4b-it-qat понимает изображения и отвечает на русском. Для второго тира - это уже заявка. deepseek-r1:1.5b весит около 1 ГБ, но ориентирована на логические задачи с явной цепочкой вывода. Математика, проверка ошибок. Хороший выбор, если не хватает памяти для более тяжёлых вариантов.

Тир 3 - 8-16 ГБ RAM. На чистом CPU скорость падает до 4-8 токенов в секунду. Ощутимо. Но и возможности другие.

qwen3:8b на 5.2 ГБ справляется со статьями, техническими обзорами, сложным кодом с дебагом и объяснением. qwen2.5-coder:7b - это уже специализированный инструмент для разработки: модуль с нуля, рефакторинг, юнит-тесты, code review. mistral-small на 13 ГБ тянет юридические тексты и мультиступенчатые инструкции, но занимает почти всю доступную память на 16-гигабайтной машине. С этим надо считаться.

Что мы тестировали сами

Таблица с характеристиками - это хорошо. Но она не показывает, как модель ведёт себя, когда ей дают реальную задачу. Мы взяли три разных по типу: арифметику по шагам, объяснение технического понятия и Python-функцию с документацией. Ollama v0.20.4, Windows, CPU без видеокарты. Условия одинаковые для всех.

Задачи выбирали намеренно простые - не чтобы завалить, а чтобы проверить базовое. Связность речи, следование алгоритму, структурированный вывод.

Задача 1 - арифметика

smollm2 работает только на английском, поэтому промпт шёл на EN:

"Pete has 12 apples. He ate a third of them, then split the rest equally between 2 friends. How many apples did each friend get? Show your work."

phi4-mini получила тот же вопрос по-русски.

Локальные LLM без GPU - что реально работает на обычном железе

Первый шаг smollm2 посчитала верно - треть от 12 это 4, осталось 8. А дальше сломалась. Разделила остаток на трёх, а не двух, потому что посчитала Петю участником раздела: "Pete and his two friends, making a total of 3 people". Получила 2.67, округлила до 2. Неверно - и ошибка показательная: модель не читает задачу, она угадывает шаблон.

Локальные LLM без GPU - что реально работает на обычном железе

phi4-mini дала три подписанных шага - "Шаг 1", "Шаг 2", "Шаг 3" - каждый с формулой и числом. Финал: "Итак, каждый друг получил по 4 яблока." Верно. Без лишнего.

Задача 2 - объяснить RAM

qwen3:8b с режимом /think. Промпт на русском:

"Объясни в двух предложениях что такое оперативная память (RAM) и зачем она нужна."

Локальные LLM без GPU - что реально работает на обычном железе

Прежде чем ответить, модель видимо подумала - в теге thinking появился план: как сформулировать точно, не растянуть, не скатиться в учебник. Финальный текст вышел компактным и понятным. Два предложения - ровно два. Русский - чистый.

Задача 3 - Python и палиндром

smollm2 - снова английский промпт:

"Write a Python function that checks if a string is a palindrome. Add a docstring and 2 examples."

phi4-mini и qwen3:8b получили русский вариант.

Локальные LLM без GPU - что реально работает на обычном железе

smollm2 выдала логически рабочую функцию. Но PowerShell перемешал порядок вывода - docstring появился раньше подписи функции. Код работает, а вот читать - странно.

Локальные LLM без GPU - что реально работает на обычном железе

phi4-mini написала чисто. Подробный docstring на русском с отдельными блоками Вход и Выход, двухуказательный алгоритм, два примера в конце. Аккуратно.

Локальные LLM без GPU - что реально работает на обычном железе
Локальные LLM без GPU - что реально работает на обычном железе
Локальные LLM без GPU - что реально работает на обычном железе

qwen3:8b сначала начала думать. Потом - ещё думать. Потом ответила. Функция корректная, но главное не это - к каждому шагу алгоритма она добавила контекст: объяснила логику, а не только написала формулу. Для учебного сценария это ценнее, чем просто рабочий код.

Что из этого следует

Честно скажем: 4-5 токенов в секунду у qwen3:8b на CPU - это минута-две на средний ответ. Не быстро. Если привыкли к Claude или ChatGPT, переход будет ощутимым. И это не облако - здесь ждать придётся всегда.

Но есть сценарии, где локальный запуск выигрывает не скоростью, а условиями. Документы, которые нельзя отправлять наружу. Повторяющиеся задачи без интернета. Локальный code review на машине без корпоративного VPN. Конвертация разметки в пайплайне. Под такие случаи - запустить стоит. Пользователь найдётся.

Тест получился ознакомительным, и мы это признаём. Задачи простые, моделей можно было взять больше, сценариев - шире. Но цель была другая: запустить, пощупать, оценить саму возможность. Возможность - есть.

А в моём уютном ТГ-канале - я очень хорошо и понятно пишу про нейросети. Теория, практика, готовые наборы топовых промптов. Подписывайтесь, гарантированно будет полезно!

7
3