DeepSeek открыла модель под MIT и сделала ночной тариф вдвое дешевле дневного

DeepSeek открыла модель под MIT и сделала ночной тариф вдвое дешевле дневного

DeepSeek выпустила V4.1-Flash — модель с открытыми весами под лицензией MIT и ценами API, которые заметно ниже всего, что предлагают OpenAI, Anthropic и Google на сопоставимых условиях. Плюс отдельный ночной тариф: ровно вдвое дешевле дневного.

Для команд, которые считают расходы на нейросети, это повод пересчитать бюджет. Разбираю цифры.

Сколько стоит

Новые тарифы действуют с 10 сентября 2026 года. Цены за миллион токенов, первая цифра — вне пиковых часов, вторая — в пик:

  • вход, попадание в кэш: $0,003 / $0,006;
  • вход без кэша: $0,15 / $0,30;
  • выход: $0,60 / $1,20.

Для сравнения, старшая модель той же компании DeepSeek-V4-Pro стоит $0,66–$1,32 за вход без кэша и $1,98–$3,96 за выход. То есть новый Flash дешевле собственной старшей модели в 3–4 раза — и при этом умеет принимать изображения, чего V4-Pro не умеет.

Ночной тариф — не маркетинг, а способ сэкономить вдвое

Вне пиковых часов цена ровно вдвое ниже. Это прямо влияет на то, как строить процессы: индексация базы знаний, пакетная обработка документов, разметка данных, любые фоновые задачи без срочности — всё это можно перенести на офф-пик и платить половину. Качество ответов при этом не меняется, меняется только время запуска.

Если у вас есть регулярная пакетная нагрузка, это первое, что стоит посчитать.

Что за модель

  • Контекст 1 млн токенов, ответ до 384 тысяч токенов.
  • Понимает изображения на входе, без отдельного сервиса распознавания.
  • 552 млрд параметров в основе, но на каждый токен активируются только 8–16 млрд — отсюда и цена.
  • Кэш сжат примерно в 4 раза против прошлого поколения: длинные контексты обходятся дешевле, ответ приходит быстрее.

Главное — лицензия MIT

Веса открыты и лежат на Hugging Face под MIT. Это самая свободная из распространённых лицензий: можно разворачивать у себя, использовать коммерчески, дорабатывать, не спрашивая разрешения и не платя за API вообще.

Практический смысл для российских команд очевиден: вопрос «чем платить зарубежному сервису» просто исчезает, если модель работает на своём или арендованном сервере. Взамен появляется другой вопрос — железо: 552 млрд параметров требуют серьёзной инфраструктуры, даже с учётом того, что активна лишь часть.

Кому что подходит

Разовые задачи и небольшой поток. Берите API, ночной тариф закроет вопрос цены.

Регулярная пакетная обработка. Считайте офф-пик: на объёме экономия удваивается сама собой.

Чувствительные данные или большой постоянный поток. Здесь имеет смысл считать разворачивание у себя — MIT это позволяет, и на определённом объёме аренда GPU выходит дешевле любого API.

Нужны картинки на входе. Раньше это означало доплату за более дорогую модель. Теперь нет.