Локальные LLM без GPU - что реально работает на обычном железе
Где-то в 2022 году запустить языковую модель локально означало одно - профессиональная видеокарта, желательно с 24 ГБ VRAM, и несколько часов настройки. Для большинства это был закрытый клуб. Потом появилась квантизация, и уравнение поменялось.
Суть простая. Веса модели хранятся в числах с плавающей точкой - изначально 32-битных. Квантизация сжимает их до 4 бит. Модель становится в 3-4 раза легче при минимальной потере качества: 7B параметров теперь занимают 4-5 ГБ вместо 14. Ноутбук с обычными 8 ГБ RAM неожиданно превращается в рабочий стенд. Это был первый сдвиг.
Второй - Ollama. Инструмент, который убирает всё лишнее между пользователем и моделью. Не нужно настраивать Python-окружения, прописывать пути к весам, разбираться с форматами чекпоинтов. Устанавливается одной командой, сама видит GPU если она есть - NVIDIA, AMD, Apple Metal - и при её отсутствии тихо переключается на CPU. Модели качаются как Docker-образы. Один ollama run - и через несколько минут загрузки уже можно задавать вопросы.
У нас, если честно, GPU не было вовсе. Чистый CPU, Windows. Это и стало условием всего теста.
Кстати, и SYNTAX.AI собрал в одном интерфейсе ChatGPT, Claude, Gemini, Midjourney и ещё несколько десятков моделей - без VPN и отдельных подписок. Промокод NEIROSKUF даёт минус 15% к любому тарифу.
Как установить и запустить
На Linux всё решается так:
На Windows и macOS - установщик с ollama.com/download, запустили, дальше то же самое. После установки первый запуск модели выглядит так:
При первом вызове модель скачается автоматически. Если хочется загрузить заранее, без запуска интерактивного чата - ollama pull phi4-mini. Посмотреть, что уже установлено - ollama list. Вот и весь онбординг.
Дальше интереснее.
Три тира, три уровня железа
Мы не пытались собрать топ лучших моделей 2026 года. Критерии отбора были проще: работает стабильно через Ollama, доступна прямо сейчас, приносит реальную пользу при конкретных ограничениях по железу. Никаких экзотических форков, которые надо собирать руками.
Тир 1 - 2-4 ГБ RAM, GPU не нужна. Офисный ПК или ноутбук, которому уже лет семь. Скорость выдачи - 15-20 токенов в секунду, это достаточно комфортно. Многошаговые рассуждения здесь не работают, и ожидать их не стоит. Зато с однозначными задачами - перефразировать текст, классифицировать, ответить на прямой вопрос - модели справляются.
Из этого тира приятно удивил qwen3:1.7b: весит всего 1.4 ГБ, держит контекст 40K и поддерживает русский язык. Для суммаризации длинного документа - вполне рабочий вариант. reader-lm:1.5b заточена под одну задачу - конвертировать HTML-страницы в Markdown. Узко, но если это нужно часто, лучше инструмента в таком весе найти сложно. moondream умеет описывать изображения - мультимодальность за 1.7 ГБ, что само по себе неожиданно.
smollm2:1.7b - только английский. Учитывайте это если работаете с русскоязычным контентом. Мы учли чуть позже, чем стоило.
Тир 2 - 6-8 ГБ RAM. Средний ноутбук, скорость 8-12 токенов в секунду. Тут уже чувствуется качественный скачок. Модели структурируют ответ, держат нить разговора, замечают противоречия в запросе. Часть умеет думать вслух перед ответом.
phi4-mini с контекстом 128K работает с длинными документами, объясняет код и решает задачи по шагам. phi3.5 - примерно того же уровня, но чуть лучше справляется с генерацией SQL по описанию. qwen3:4b держит контекст 256K - один из лучших показателей в этом тире - и поддерживает режим /think, когда перед ответом выводится цепочка рассуждений. Это помогает при проверке логики.
gemma3:4b-it-qat понимает изображения и отвечает на русском. Для второго тира - это уже заявка. deepseek-r1:1.5b весит около 1 ГБ, но ориентирована на логические задачи с явной цепочкой вывода. Математика, проверка ошибок. Хороший выбор, если не хватает памяти для более тяжёлых вариантов.
Тир 3 - 8-16 ГБ RAM. На чистом CPU скорость падает до 4-8 токенов в секунду. Ощутимо. Но и возможности другие.
qwen3:8b на 5.2 ГБ справляется со статьями, техническими обзорами, сложным кодом с дебагом и объяснением. qwen2.5-coder:7b - это уже специализированный инструмент для разработки: модуль с нуля, рефакторинг, юнит-тесты, code review. mistral-small на 13 ГБ тянет юридические тексты и мультиступенчатые инструкции, но занимает почти всю доступную память на 16-гигабайтной машине. С этим надо считаться.
Что мы тестировали сами
Таблица с характеристиками - это хорошо. Но она не показывает, как модель ведёт себя, когда ей дают реальную задачу. Мы взяли три разных по типу: арифметику по шагам, объяснение технического понятия и Python-функцию с документацией. Ollama v0.20.4, Windows, CPU без видеокарты. Условия одинаковые для всех.
Задачи выбирали намеренно простые - не чтобы завалить, а чтобы проверить базовое. Связность речи, следование алгоритму, структурированный вывод.
Задача 1 - арифметика
smollm2 работает только на английском, поэтому промпт шёл на EN:
"Pete has 12 apples. He ate a third of them, then split the rest equally between 2 friends. How many apples did each friend get? Show your work."
phi4-mini получила тот же вопрос по-русски.
Первый шаг smollm2 посчитала верно - треть от 12 это 4, осталось 8. А дальше сломалась. Разделила остаток на трёх, а не двух, потому что посчитала Петю участником раздела: "Pete and his two friends, making a total of 3 people". Получила 2.67, округлила до 2. Неверно - и ошибка показательная: модель не читает задачу, она угадывает шаблон.
phi4-mini дала три подписанных шага - "Шаг 1", "Шаг 2", "Шаг 3" - каждый с формулой и числом. Финал: "Итак, каждый друг получил по 4 яблока." Верно. Без лишнего.
Задача 2 - объяснить RAM
qwen3:8b с режимом /think. Промпт на русском:
"Объясни в двух предложениях что такое оперативная память (RAM) и зачем она нужна."
Прежде чем ответить, модель видимо подумала - в теге thinking появился план: как сформулировать точно, не растянуть, не скатиться в учебник. Финальный текст вышел компактным и понятным. Два предложения - ровно два. Русский - чистый.
Задача 3 - Python и палиндром
smollm2 - снова английский промпт:
"Write a Python function that checks if a string is a palindrome. Add a docstring and 2 examples."
phi4-mini и qwen3:8b получили русский вариант.
smollm2 выдала логически рабочую функцию. Но PowerShell перемешал порядок вывода - docstring появился раньше подписи функции. Код работает, а вот читать - странно.
phi4-mini написала чисто. Подробный docstring на русском с отдельными блоками Вход и Выход, двухуказательный алгоритм, два примера в конце. Аккуратно.
qwen3:8b сначала начала думать. Потом - ещё думать. Потом ответила. Функция корректная, но главное не это - к каждому шагу алгоритма она добавила контекст: объяснила логику, а не только написала формулу. Для учебного сценария это ценнее, чем просто рабочий код.
Что из этого следует
Честно скажем: 4-5 токенов в секунду у qwen3:8b на CPU - это минута-две на средний ответ. Не быстро. Если привыкли к Claude или ChatGPT, переход будет ощутимым. И это не облако - здесь ждать придётся всегда.
Но есть сценарии, где локальный запуск выигрывает не скоростью, а условиями. Документы, которые нельзя отправлять наружу. Повторяющиеся задачи без интернета. Локальный code review на машине без корпоративного VPN. Конвертация разметки в пайплайне. Под такие случаи - запустить стоит. Пользователь найдётся.
Тест получился ознакомительным, и мы это признаём. Задачи простые, моделей можно было взять больше, сценариев - шире. Но цель была другая: запустить, пощупать, оценить саму возможность. Возможность - есть.