DeepSeek V4.1 Flash обошла GPT-5.6 Sol в бенчмарках: разбираем новую MoE-модель для кодинга

DeepSeek V4.1 Flash обошла GPT-5.6 Sol в бенчмарках: разбираем новую MoE-модель для кодинга

Приветствую! Только что вышла DeepSeek V4.1 Flash - новая модель с 552 млрд параметров на архитектуре MoE (mixture-of-experts). И судя по бенчмаркам, китайцы снова наступают на пятки топовым западным моделям.

В чем сила модели

DeepSeek V4.1 Flash заточена под кодинг и агентные сценарии - то есть задачи, где модель самостоятельно выполняет многошаговые действия, а не просто отвечает на вопрос.

На бенчмарке DeepSWE v1.1 (оценивает способность решать реальные инженерные задачи) модель набрала 74,2 балла. Это выше, чем у GPT-5.6 Sol (73,0) и даже выше Claude Opus 5 (74,0).

На CyberGym, бенчмарке по кибербезопасности, DeepSeek тоже обошла GPT-5.6 Sol - 88,1 против 84,5.

А на AutomationBench, который проверяет способность модели автоматизировать задачи, DeepSeek V4.1 Flash стала лидером среди вообще всех моделей в сравнительной таблице, включая Opus, GPT, K3 и GLM.

Технические детали

Архитектура интересная - модель использует так называемый Causal Encoder-Decoder подход, который активирует всего 8 млрд параметров на этапе обработки запроса и 16 млрд на генерации ответа, хотя общий размер бэкбона 552 млрд. Это сильно снижает вычислительную стоимость, особенно для задач с большим объемом входных данных.

Контекстное окно поддерживает до 1 млн токенов, что удобно для длинных агентных сессий, где нужно держать в памяти много контекста.

Модель также умеет работать с изображениями - помимо текста, есть визуальный энкодер, так что это мультимодальная система.

Цена вопроса

По имеющимся данным, стоимость составляет $0,15 за миллион входных токенов и $0,60 за миллион выходных. Для модели такого уровня агентных способностей это действительно дешево - в разы дешевле топовых западных аналогов.

Стоит ли пробовать

Модель распространяется под MIT-лицензией, веса доступны на Hugging Face, так что можно запускать локально через vLLM или SGLang, если есть подходящее железо.

Для тех, кто строит агентные системы или продукты с автоматизацией, где важна цена за токен при сохранении качества, это однозначно стоит протестировать.

Модель: huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

Спасибо за внимание!

Больше практических гайдов по нейросетям публикую в своем Телеграм-канале. Если интересна тема AI без воды и с конкретными примерами - добро пожаловать!

2