ИИ подешевел вчетверо: что сделал DeepSeek и что делать бизнесу

Компании переплачивают за нейросети в разы, потому что не следят за одной китайской лабораторией. DeepSeek выложил открытую модель V4.1 Flash, и она стабильно обходит собственную старшую версию 4.0 Pro, которая стоит примерно вчетверо дороже. Ниже главное текстом и три решения, которые предпринимателю стоит принять уже сейчас.

Разбор сделан по свежему выпуску канала Two Minute Papers, его ведёт исследователь Карой Жолнаи-Фехер. Он сам запускает модели и читает научные статьи, а не пересказывает пресс-релизы, поэтому, на наш взгляд, ему можно верить.

Что случилось

DeepSeek опубликовал новую модель и, что важнее, статью о том, как она устроена. Скачать и прочитать может любой, бесплатно.

Первое, что бросается в глаза, это скорость: ответы появляются почти мгновенно. Второе: на части тестов модель сравнима с Claude Opus 5 и Kimi K3, хотя далеко не на всех. А вот свою старшую версию, DeepSeek 4.0 Pro, она обходит стабильно, и это главный сюрприз.

Разница видна и по железу. Чтобы держать старшую модель у себя, нужен сервер примерно на 300 тысяч долларов. Новая обходится примерно в четверть этой суммы, около 75 тысяч. Всё ещё дорого, но автор уверен: при такой тенденции через год подобное будет работать в кармане.

Модель ещё и видит. Ей показали картинку меню старой игры, и она написала игру, которая это меню повторяет.

Что делать: перед покупкой дорогого решения проверить, не закрывает ли задачу открытая модель.

Как её ужали: главный фокус в памяти

!Стопка протоколов на столе: так модель хранит разговор во время ответа

Пока модель отвечает, она держит весь ваш разговор в рабочей памяти, как блокнот на переговорах. Этот блокнот живёт в видеопамяти, а это самая дорогая часть сервера. Именно память делает ИИ дорогим.

У новой модели этот блокнот в 437 раз меньше, чем у первой версии три года назад. И вчетверо меньше, чем у предыдущей Flash, которая вышла всего несколько месяцев назад.

Как это сделали. Представьте компанию из десятков отделов, где каждый отдел ведёт свой протокол одной и той же встречи. Нейросеть устроена похоже: она состоит из слоёв, и раньше каждый слой хранил свою копию разговора. В новой модели слои получили общий протокол: один блок его пишет, остальные читают оттуда нужное. Сделать это сложно, потому что разным слоям нужны разные детали одной истории, но у DeepSeek получилось.

!Архив с ячейками: общий протокол вместо копии у каждого слоя

Меньше памяти значит меньше видеокарт на один запрос. Меньше видеокарт значит дешевле сервер и дешевле цена для вас.

Что делать: спросить у поставщика ИИ, на какой модели он работает и сколько стоит один запрос.

Что это даёт бизнесу

Каждый раз, когда DeepSeek публикует новую статью, ИИ дешевеет для всех. Дешевеет не только сам DeepSeek: конкурентам приходится снижать цены следом. На наш взгляд, это главный эффект новости.

Дальше три практических следствия.

  1. Своё железо или оплата по запросам. Если у компании есть сервер, открытая модель работает без абонентской платы. Если сервера нет, вы платите только за запросы.
  2. Документы остаются у вас. Для российских компаний открытая модель это ещё и способ держать договоры и переписку внутри контура, а не отправлять за рубеж. Мы так и строим корпоративные контуры: подробнее на странице про внедрение искусственного интеллекта.
  3. Скриншот вместо технического задания. Модель видит картинки, поэтому фото прайса, скриншот отчёта или фотография бумажной накладной превращаются в задачу: показали, модель сделала.

Что делать: запустить пилот на одной задаче и сравнить открытую модель с той, за которую вы платите сейчас.

Подвох, о котором не пишут в заголовках

Теперь честно про слабые места. Автор попросил три модели воспроизвести научную статью про сложную физику, похожую на пчелиные соты. GPT-6 Astra справился блестяще, Claude Opus 5 сделал физику достойно, а DeepSeek пока до них не дотянул. Сам автор уверен, что через пару таких статей DeepSeek догонит, и мы склонны с ним согласиться.

И главный подвох. Модель очень любит думать: прежде чем ответить, она долго рассуждает и сжигает огромное количество токенов. Токены это слова, за которые вы платите поставщику, включая слова, которые модель говорит сама себе. Каждое слово дешёвое, но слов очень много, и в итоге дешёвая модель может выйти дороже на конкретной задаче.

Что делать: сравнивать не цену за миллион токенов, а цену за решённую задачу.

Три решения для предпринимателя

  1. Не подписывайте годовые контракты на ИИ. Цены здесь падают каждые несколько месяцев, а модель, которая сегодня кажется лучшей, через квартал станет дорогой.
  2. Запустите пилот на одной задаче. Возьмите процесс, который уже считается в часах и деньгах, и сравните открытую модель с платной на одних и тех же данных.
  3. Считайте цену за задачу, а не за токен. Дешёвый прайс и дорогой результат легко живут вместе.

Общий вывод: рынок ИИ дешевеет рывками, поэтому раз в квартал стоит пересматривать, на какой модели вы работаете.

Если хотите разобраться, как передавать нейросети свои документы и не платить лишнего, в бесплатной Академии Solaris это разбирают на примерах из бизнеса, а не на инженерном языке.

Сам выпуск, как и остальные на канале, целиком собрал наш ИИ-агент: нашёл тему, написал сценарий, озвучил, смонтировал и загрузил. Как это устроено, можно посмотреть на странице ИИ-агента для YouTube.