Дешёвые ИИ-API закончились: DeepSeek за неделю утроил цену, а я обещал вам экономию
На прошлой неделе я написал, что не стоит бежать переводить всю продукцию на DeepSeek — мол, привязываться к одному вендору опасно. А на этой неделе DeepSeek сделал то, чего не ожидал никто: поднял цены примерно втрое и ввёл пиковый тариф. Признаю, мой прошлый пост устарел ровно через пять дней. Давайте разберём, что произошло и что теперь делать с этим нам, интеграторам.
Что конкретно случилось
10 сентября DeepSeek выкатила V4.1 Flash — новую модель с нативным зрением и контекстом 1M. Выглядит как очередное снижение цен. Но через четыре дня, 14-го, должна была вступить в силу рокировка: все запросы, включая deepseek-v4-pro, молча маршрутизировались на Flash. Разработчики начали перекладывать прод. И тут происходит редкое: в день X они отзывают собственное уведомление. V4 Pro остаётся жить по старому биллингу. А публичные тарифы Flash оказываются не «дешевле», а «в два раза дороже в рабочее время».
Как выглядит биллинг теперь
У DeepSeek V4.1 Flash теперь два тарифа на вход: - Пиковые часы (пн–пт, 01:00–04:00 и 06:00–10:00 UTC): $0.30 за 1M входных / $1.20 выходных - Вне пика и все выходные: $0.15 / $0.60 - Кэш-вход: $0.006 в пик, $0.003 вне пика Промо-цена, на которую все завязались в августе ($0.14 / $0.28), больше не существует. V4 Pro, который все считали «дорогим», стоит $1.32 / $3.96 в пик и $0.66 / $1.98 вне — и это при том, что у него нет нативного зрения. Для контекста: GPT-5.6 Luna у OpenAI стоит $0.20 / $1.20 без всяких пиковых окон, без календаря выходных и от американского вендора. То есть «китайский бюджетный слой» в рабочие часы стал дороже, чем бюджетный слой OpenAI.
Это не очередная скидка. Это смена эпохи
Давайте честно: индекс цен на фронтирные токены упал на 84% с марта 2023-го. Весь этот год мы жили в парадигме «модели только дешевеют, надо просто ждать следующего снижения». Так вот, похоже, дно пройдено. DeepSeek был тем игроком, который это дно держал. Когда он начинает брать деньги за спрос (пик/вне пика) и отзывает «перевод на новое дешёвое», это значит, что маржа на инференсе кончилась. Следом подтянутся остальные: вводные цены Gemini 3.8 Flash ($0.75 / $3.75) — это промо до 31 декабря, с 1 января они удваиваются. Хорошая новость: мы, интеграторы, сидим на очень ликвидном рынке. Плохая: «поставил ключ и забыл» больше не работает.
Что я делаю со своим продом сейчас
Я перестал искать «одну лучшую модель» и собираю запросы по сложности. На нагрузке около 10M токенов в день расклад такой: - 80% простых задач (классификация, извлеение, первый скрипт поддержки) — самый дешёвый доступный слой. Сегодня это Luna $0.20/$1.20, без пиковых окон. Раньше тут стоял DeepSeek. - 15% стандартных (анализ документов, код-ревью, генерация) — Sonnet 5, $2/$10. - 5% тяжёлых (многочасовые агенты, юр.аналитика) — Opus 5, $30/$150. Итог: ~$13 в день. Если бы я крутил весь трафик на флагмане Fable 5.1 или GPT-6 Astra — выходило бы около $180 в день. Экономия 93%. Ключевой приём: не писать маршрутизатор руками и не хардкодить в нём имена моделей. Вендор раз в две недели меняет и цены, и пиковые окна, и имена моделей — как мы только что видели на примере DeepSeek. Слой роутинга должен менять модель по правилу «самый дешёвый, который проходит твой quality gate», а не по имени вендора.
В общем, мой прошлый пост был неправ не по выводу, а по сроку: «не привязываться к одному вендору» оказалось стратегией не на вырост, а на уже завтрашний день. Кто тоже переехал на DeepSeek на прошлой неделе — есть ли у вас в мониторинге всплеск трат за 10–18 МСК по будням? Покажите в комментах, интересно сверить. Еженедельную сводку: что подорожало, что подешевело и какие модели выпали из роутинга — веду в тг-канале @api_integrate_notes.