DeepSeek V4.1 Flash обошла GPT-5.6 Sol в бенчмарках: разбираем новую MoE-модель для кодинга
Приветствую! Только что вышла DeepSeek V4.1 Flash - новая модель с 552 млрд параметров на архитектуре MoE (mixture-of-experts). И судя по бенчмаркам, китайцы снова наступают на пятки топовым западным моделям.
В чем сила модели
DeepSeek V4.1 Flash заточена под кодинг и агентные сценарии - то есть задачи, где модель самостоятельно выполняет многошаговые действия, а не просто отвечает на вопрос.
На бенчмарке DeepSWE v1.1 (оценивает способность решать реальные инженерные задачи) модель набрала 74,2 балла. Это выше, чем у GPT-5.6 Sol (73,0) и даже выше Claude Opus 5 (74,0).
На CyberGym, бенчмарке по кибербезопасности, DeepSeek тоже обошла GPT-5.6 Sol - 88,1 против 84,5.
А на AutomationBench, который проверяет способность модели автоматизировать задачи, DeepSeek V4.1 Flash стала лидером среди вообще всех моделей в сравнительной таблице, включая Opus, GPT, K3 и GLM.
Технические детали
Архитектура интересная - модель использует так называемый Causal Encoder-Decoder подход, который активирует всего 8 млрд параметров на этапе обработки запроса и 16 млрд на генерации ответа, хотя общий размер бэкбона 552 млрд. Это сильно снижает вычислительную стоимость, особенно для задач с большим объемом входных данных.
Контекстное окно поддерживает до 1 млн токенов, что удобно для длинных агентных сессий, где нужно держать в памяти много контекста.
Модель также умеет работать с изображениями - помимо текста, есть визуальный энкодер, так что это мультимодальная система.
Цена вопроса
По имеющимся данным, стоимость составляет $0,15 за миллион входных токенов и $0,60 за миллион выходных. Для модели такого уровня агентных способностей это действительно дешево - в разы дешевле топовых западных аналогов.
Стоит ли пробовать
Модель распространяется под MIT-лицензией, веса доступны на Hugging Face, так что можно запускать локально через vLLM или SGLang, если есть подходящее железо.
Для тех, кто строит агентные системы или продукты с автоматизацией, где важна цена за токен при сохранении качества, это однозначно стоит протестировать.
Модель: huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
Спасибо за внимание!
Больше практических гайдов по нейросетям публикую в своем Телеграм-канале. Если интересна тема AI без воды и с конкретными примерами - добро пожаловать!