Жизнь ниже Q4: играю в «американку» с нейросетями

Это как с бильярдом: хочется раскатать партию в русский, а под рукой только стол-«американка». Не то же самое, конечно, но шары катятся, лузы есть, и вечер не пропадает зря. Примерно так же я сейчас играю с локальными моделями.

Жизнь ниже Q4: играю в «американку» с нейросетями

В компе 16 ГБ видеопамяти. Хочется попробовать что-то серьёзное, а не игрушечные 7B. Полные веса не лезут. Q4 тоже не лезет. Ладно, опускаемся ниже.

Беру 30-миллиардный Qwen3-Coder в Q3_K_S — влезает, держит контекст 8192, выдаёт 15–30 токенов в секунду. Пробую ещё Qwen3.8-27B в IQ3_XS — тоже держится хорошо, что для такого урезанного квантования вообще подвиг.

И вот что забавно: эти «ужатые» модели тянут вполне взрослые задачи.

Вечером кинул ему промпт: «сделай коммерческое предложение на разработку интернет-магазина на WooCommerce, бюджет средний, сроки жёсткие». Вбросил структурированное ТЗ. Через минуту — текст, в котором почти нечего править. Структура, акценты — будто я сам писал. Перечитал два раза — думал, случайно открыл вкладку с ChatGPT.

Саммари длинной статьи — та же история. Разбор кривого WooCommerce-хука — с первого захода.

Нет, это не значит, что урезанный Q3 внезапно обогнал Q4 или облачные модели. Значит только одно: для моих задач разница оказалась гораздо меньше, чем я ожидал.

Выходит, чтобы стабильно кодить с ИИ-ассистентом, не нужен дата-центр в подвале. Достаточно уметь играть на том столе, который есть. 🎱

Заходи, если интересно, как живут модели на 16 ГБ: «Вла'д Лебедкин | Stack & Life»