DeepSeek выпустила новую модель V4.1-Flash, которая сильно экономит память при работе с длинными текстами
Китайская компания DeepSeek представила новую версию своей модели — DeepSeek-V4.1-Flash. Главная фишка этой модели — она гораздо экономнее использует память, когда работает с очень длинными контекстами.
Сначала коротко объясним, в чём вообще проблема. Когда большая языковая модель отвечает на вопрос или выполняет задачу, ей нужно «помнить» весь предыдущий текст — ваш запрос, историю разговора, документы, код и так далее. Эта «память» хранится в специальной структуре под названием KV-кэш. Чем длиннее контекст, тем больше этот кэш занимает места и тем дороже и медленнее становится работа модели. Особенно это критично для агентов — программ, которые долго работают самостоятельно, читают много информации и выполняют сложные задачи шаг за шагом. Сейчас контексты уже доходят до миллиона токенов (это примерно целая толстая книга), и обычные способы хранения памяти начинают сильно тормозить и дорожать.
DeepSeek решила эту проблему на уровне архитектуры модели. Они сделали модель асимметричной: одна часть (энкодер) обрабатывает входящий текст, а другая (декодер) генерирует ответ, используя уже подготовленную информацию. Благодаря этому при чтении длинного ввода модель активирует значительно меньше параметров, чем при генерации ответа. Плюс они сильно сжали сам KV-кэш — уменьшили его размер примерно в четыре раза по сравнению с предыдущей версией V4-Flash и в сотни раз по сравнению с самыми ранними моделями DeepSeek. В итоге на один токен теперь требуется всего около 890 байт памяти в быстром хранилище, а постоянное хранение стало ещё компактнее.Модель при этом поддерживает контекст до одного миллиона токенов, умеет работать с текстом и изображениями и, по заявлениям DeepSeek, показывает результаты лучше, чем их предыдущие более крупные модели, при этом работая быстрее и дешевле. Особенно заметна экономия в сценариях с агентами, где большая часть стоимости раньше уходила именно на хранение и обработку длинной памяти.Модель уже доступна через API DeepSeek под названием deepseek-flash. Компания также снизила цены на использование.По сути, DeepSeek сделала шаг в сторону того, чтобы длинные и сложные задачи для ИИ становились заметно дешевле и практичнее.