TurboQuant: как алгоритм Google за день обвалил акции производителей памяти

TurboQuant: как алгоритм Google за день обвалил акции производителей памяти

В конце апреля 2025 года Google Research опубликовал статью с описанием технологии TurboQuant — алгоритма сжатия KV-кэша для инференса больших языковых моделей. На следующий день акции SK Hynix упали на 6,2%, Samsung Electronics — на 4,8%, Micron — примерно на 5%, SanDisk — до 8%. Индекс KOSPI просел на 3%. Инвесторы увидели в работе Google угрозу линейному росту спроса на память для AI-инфраструктуры — и в сети алгоритм тут же окрестили «Pied Piper из Silicon Valley». CEO Cloudflare Мэттью Принс назвал это «моментом DeepSeek для Google».

Сейчас, в середине апреля, история входит в фазу, когда техническая новость ещё не остыла, а финансовые последствия ещё не отыграны. Через девять дней, 25 апреля, TurboQuant официально представят на ICLR 2026 в Рио-де-Жанейро — и после презентации ожидается официальный код от Google во втором квартале. Это то редкое окно, когда имеет смысл разобраться в сути, пока поверх неё не легли новые слои новостей.

В чём проблема, которую решает TurboQuant

При генерации текста трансформер хранит key-value пары для каждого токена в каждом слое внимания — это и есть KV-кэш, рабочая память модели во время инференса. С ростом длины контекста кэш растёт линейно и быстро становится главным узким местом. Для Llama 3 70B на контексте 128 тысяч токенов KV-кэш занимает около 40 ГБ — целиком забивает A100 на 40 ГБ и половину 80-гигабайтной версии.

TurboQuant: как алгоритм Google за день обвалил акции производителей памяти

Именно на этой арифметике построен нарратив дефицита HBM (high bandwidth memory, высокоскоростная память) последних полутора лет: чем длиннее контексты и чем больше пользователей, тем выше спрос на память. SK Hynix и Samsung законтрактовали поставки HBM3E на 2026 год ещё прошлым летом.

Как устроен алгоритм

Схема работы TurboQuant
Схема работы TurboQuant

TurboQuant сжимает KV-кэш до 3–4 бит на значение — это примерно 6-кратное сокращение относительно FP16 при практически нулевой потере качества. На H100 вычисление attention-логитов ускоряется до 8x против 32-битных ключей. Ключевая особенность: алгоритм не требует ретрейнинга, fine-tuning или данных для калибровки — он работает на любом трансформере «из коробки».

Под капотом два шага. Первый, PolarQuant, применяет случайное ортогональное вращение к каждому KV-вектору. После вращения каждая координата подчиняется предсказуемому распределению (близкому к бета-распределению), и для него можно заранее посчитать оптимальные уровни квантизации алгоритмом Ллойда–Макса. Математика делает за вас работу, которую обычно делают данные.

Второй шаг, QJL (Quantized Johnson–Lindenstrauss), добавляет 1-битную коррекцию остаточной ошибки — делает оценку скалярных произведений несмещённой. Правда, в open-source-реализациях выяснился нюанс: для attention второй шаг на практике может ухудшать результат, потому что softmax усиливает шум.

На стандартных бенчмарках TurboQuant при 3,5 битах на значение показывает на LongBench 50,06 — ровно столько же, сколько FP16. Базовый KIVI при сопоставимом бюджете бит даёт 48,50.

Почему обвалились акции и почему реакция была резкой

Логика инвесторов простая: меньше памяти на инференс — ниже спрос на HBM и серверную DRAM. Рынок весь 2025 год закладывал в мультипликаторы линейный рост AI-нагрузки, а TurboQuant — первый громкий сигнал, что этот рост может сломаться. Отсюда скорость переоценки.

Но у истории есть важные оговорки. TurboQuant сжимает только инференс — обучение моделей по-прежнему требует огромных объёмов памяти. Эффект Джевонса: удешевление ресурса исторически увеличивает его потребление, а не сокращает. Больше контекста на том же железе — больше кейсов использования — больше GPU. Наконец, алгоритм пока существует как лабораторный результат: официальная реализация от Google ожидается во втором квартале 2026, в продакшене он нигде не развёрнут.

Что это значит для рынка

Сообщество не стало ждать Google. За несколько недель появилось больше восьми независимых реализаций на PyTorch, эксперименты в MLX показывают 5-кратное сжатие при 99,5% сохранения качества, на vLLM открыт feature request на нативную поддержку. Отдельно важна возможная интеграция в llama.cpp — движок, на котором работает Ollama. Если TurboQuant попадёт туда как стандартная фича, он автоматически дойдёт до миллионов пользователей локальных LLM без необходимости разбираться в теории квантизации.

Для ML-инженеров это означает, что 70B-модели с длинным контекстом становятся реально запускаемыми на одиночной потребительской видеокарте или Mac Studio. Для стартапов — что unit-экономика инференс-продуктов может заметно сдвинуться: тот же GPU начинает обслуживать в несколько раз больше параллельных запросов с длинным контекстом. Для memory-сектора — что рынок будет ближайший квартал искать новую точку равновесия между продолжающимся ростом AI-нагрузки и появляющимися программными оптимизациями.

Ближайшая реперная точка — 25 апреля, ICLR 2026 и официальный код. После этого станет понятно, насколько быстро алгоритм дойдёт до продакшен-фреймворков и насколько оправданной была реакция рынка на лабораторный препринт. Ждем новую волну просадок на рынке.

ТГ-канал автора:

2