🧠 Инференс, префилл, кванты — что за взрыв мозга и зачем это знать?

🧠 Инференс, префилл, кванты — что за взрыв мозга и зачем это знать?

Можно купить компьютер за полмиллиона, загрузить нейросеть и обнаружить, что модель влезла, а ждать ответ несколько часов (если запрос хотя бы чуть-чуть был сложный)

Собрал перевод с ИИшного на человеческий

Inference, prefill, decode — что происходит после запроса

  • Инференс — работа уже обученной модели: отправили запрос → получили результат
  • Префилл — обработка входных данных: промта, переписки, документов. Условно модель читает пачку бумаг перед ответом
  • Декодинг — генерация продолжения, токен за токеном. Токен — кусочек текста: слово, часть слова или знак. Префилл и декодинг по-разному нагружают железо — объяснение NVIDIA

TTFT и tok/s — почему быстрая модель тормозит

  • TTFT — время до первого токена. В него могут входить очередь, сеть и обработка запроса — документация NVIDIA
  • tok/s — токены в секунду. Всегда уточнять: скорость обработки входа, генерации одного ответа или суммарная производительность сервера
  • Reasoning — дополнительные шаги рассуждения модели. Это тоже генерация, а не префилл; если рассуждения скрыты, до видимого ответа придётся ждать дольше

Пример: 1 000 токенов при 50 tok/s — около 20 секунд генерации. Но если до ответа прошла минута, вся задача заняла примерно 80 секунд (из которых минута — размышления)

Параметры и квантизация — сколько места нужно модели

  • 70B — 70 миллиардов параметров: числовых настроек, полученных при обучении
  • Квантизация — хранение чисел с меньшей точностью. FP16 — 16 бит, Q8 — примерно 8, Q4 — примерно 4. Памяти нужно меньше, качество может измениться — документация Hugging Face
  • Арифметика для 70B: 140 ГБ при 16 битах или 35 ГБ при 4 битах. Это только веса, без служебных данных и памяти для работы

Контекст и KV cache — куда исчезает свободная память

  • Контекстное окно — сколько токенов модель может учитывать в одном запросе, включая место под продолжение
  • KV cache — сохранённые промежуточные расчёты внимания: помогают не пересчитывать прошлые токены заново. Длиннее диалог и больше одновременных запросов → обычно больше расход памяти — как работает кеш

Dense, MoE и bandwidth — почему размер не равен скорости

  • Dense — при обработке токена задействуется основная масса параметров модели
  • MoE — модель с блоками экспертов: для каждого токена выбирается часть из них. Вычислений меньше, но веса остальных экспертов всё равно нужно где-то хранить — разбор Hugging Face
  • Bandwidth — пропускная способность памяти, в ГБ/с. Объём памяти определяет, что поместится; её скорость часто ограничивает генерацию при одиночном запросе

Канал про ИИ, публикую подборки, гайды понятным языком, мнения — интересный и полезный контент.

Каждый найдет как сэкономить время и увеличить продуктивность с нейросетями⬇