Самое интересное обновление DeepSeek прошло почти незаметно: одну и ту же модель несколько месяцев превращали в агента
Обычно новая версия нейросети выглядит предсказуемо: компания увеличивает модель, добавляет параметры, тратит больше вычислений и показывает новый лидерборд.
С DeepSeek V4 Flash происходит история поинтереснее.
Первая версия появилась ещё весной. Потом модель несколько месяцев дорабатывали. А 31 июля DeepSeek выпустил обновлённый V4 Flash — версию, которую обычно называют DeepSeek-V4-Flash-0731.
И отдельно подчеркнул странную деталь: архитектура и размер модели остались теми же. То есть DeepSeek не построил ещё одну более крупную нейросеть.
Он взял уже существующую и с помощью post-training научил её заметно лучше выполнять длинные агентные задачи: работать с терминалом, инструментами, репозиториями и цепочками действий.
И вот это, на мой взгляд, интереснее очередного релиза модели на триллион параметров.
Первая версия: дешёвый V4 Flash
24 апреля DeepSeek представил семейство V4.
В нём было две основные модели:
- V4 Pro — большая версия;
- V4 Flash — более дешёвая и быстрая.
Flash получил около 284 млрд общих параметров, но благодаря MoE-архитектуре при каждом токене активируется только примерно 13 млрд.
На момент апрельского релиза DeepSeek уже позиционировал V4 не только как чат-модель. Компания отдельно говорила про coding, tool use и агентные сценарии. Старые названия API deepseek-chat и deepseek-reasoner вообще временно стали указывать на разные режимы V4 Flash.
Вторая версия: тот же Flash начинают учить работать дольше
Здесь есть важная проблема современных ИИ-агентов.
Модель должна сохранять направление после десятков действий. И именно под такую работу DeepSeek постепенно начал двигать V4 Flash. Большой контекст здесь тоже нужен не для красивой цифры. Если агент работает с реальным проектом, в его историю начинают попадать исходники, результаты поиска, terminal output, ошибки компилятора, тесты, патчи и предыдущие решения.
Поэтому миллион токенов для агента — это уже не экзотический сценарий вроде «положим в prompt всю книгу».
Но есть проблема: чем больше контекст, тем дороже каждое следующее действие. Поэтому DeepSeek одновременно оптимизировал архитектуру V4 под длинный inference.
Получилось довольно необычное направление развития:
не сделать модель больше, а сделать длинную работу существующей модели дешевле.
А потом появился V4 Flash 0731
31 июля DeepSeek обновил API V4 Flash.
И здесь произошла самая интересная вещь.
Компания специально написала, что DeepSeek-V4-Flash-0731 сохраняет ту же архитектуру и тот же размер, что и предыдущий V4 Flash Preview.
Модель не стала больше. Обновление произошло в основном на уровне post-training.
И результаты особенно заметны именно на агентных тестах.
В опубликованных DeepSeek результатах для V4 Flash 0731 фигурируют:
- Terminal Bench 2.1 — 82,7;
- Toolathlon Verified — 70,3;
- DSBench FullStack — 68,7;
- DSBench Hard — 59,6;
- DeepSWE — 54,4;
- CyberGym — 76,7.
DeepSeek утверждает, что обновлённый Flash по ряду таких задач заметно превосходит даже V4 Pro Preview.
При этом архитектурно это всё ещё тот же Flash. Конечно, часть наборов принадлежит самому DeepSeek, поэтому воспринимать цифры как независимый рейтинг не стоит. Но направление изменений видно хорошо. Модель улучшали вокруг последовательности действий.
Почему post-training вдруг стал настолько важен
У современных моделей есть две большие стадии жизни.
Сначала идёт pretraining. Модель читает гигантское количество текста и кода и учится в целом понимать язык, программирование, факты и закономерности. Это самая дорогая часть. И именно здесь раньше происходила основная гонка:
больше данных → больше GPU → больше параметров → новая модель.
Но после pretraining начинается другая стадия — post-training.Модель учат, как именно использовать уже полученные знания.
Например:
когда вызвать инструмент;
когда продолжать рассуждать;
как реагировать на ошибку терминала;
как не бросить задачу после первого неудачного патча;
как разделить большую работу на шаги;
когда перечитать файл;
когда проверить результат.
И история V4 Flash хорошо показывает, насколько далеко можно уехать именно на этом этапе.
Размер практически тот же. Архитектура та же. А поведение модели — уже заметно другое.
В итоге существуют как будто две разные V4 Flash
то особенно интересно сейчас, потому что название почти одинаковое.
Есть ранний V4 Flash, который появился вместе с апрельским релизом. И есть обновлённый V4 Flash 0731, который DeepSeek отдельно дообучил под агентную работу.
И вот здесь ломается привычная гонка параметров
Последний год производители любят огромные числа.
500 миллиардов. Триллион. 1,6 триллиона. 2,4 триллиона.
Но V4 Flash показывает другую возможность.
Допустим, у нас уже есть достаточно сильная базовая модель. Следующий скачок можно получить не обязательно строительством ещё одного огромного кластера.
Можно оставить модель практически прежней и научить её лучше:
- пользоваться инструментами;
- работать с длинным контекстом;
- планировать;
- исправлять собственные ошибки;
- выполнять десятки действий подряд.
И для AI-агентов это может оказаться важнее ещё нескольких процентов знаний. Потому что кодинговому агенту редко не хватает знания синтаксиса TypeScript. Он чаще ломается потому, что забыл исходную задачу, не проверил изменение, неправильно интерпретировал результат теста или слишком рано решил, что всё готово.
И поэтому история разных V4 Flash важнее самого релиза 0731
Если смотреть только на название, произошло почти ничего.
Был DeepSeek V4 Flash. Стал DeepSeek V4 Flash 0731. Размер не увеличился. Архитектуру не поменяли. Нового триллиона параметров не появилось. Но именно это и интересно.
DeepSeek показывает, что современную LLM можно заметно изменить после того, как основное обучение уже закончено.
Что в итоге
Раньше версии нейросетей было удобно сравнивать примерно так:
V3 больше V2 → значит, скорее всего, умнее. Сейчас эта логика начинает ломаться. У DeepSeek V4 Flash гораздо интереснее смотреть не на количество параметров, а на то, чему именно научили конкретную версию после pretraining. Апрельский V4 Flash показал архитектуру. V4 Flash 0731 показал, что с этой же архитектурой можно гораздо дальше продвинуть agentic behavior.
И если направление продолжится, следующий большой скачок в ИИ может выглядеть совсем скучно в пресс-релизе. Никаких пяти триллионов параметров. Никакого нового названия.
Просто:
«мы взяли ту же модель и научили её работать».
И для реальных AI-агентов это может оказаться намного важнее очередного рекорда в размере.
Больше про LLM и AI — в нашем Telegram-канале (@devgeek_sh). Разбираем новые модели, делимся опытом и полезными находками.