$0.000084 за кадр. DeepSeek выпустила V4 Flash Vision-Exp

$0.000084 за кадр. DeepSeek выпустила V4 Flash Vision-Exp

Представьте: вы показываете нейросети скриншот экрана, а она выставляет счёт на 0,0084 цента. Не доллар. Не рубль. Восемь сотых цента. Именно столько стоит один кадр в новой модели DeepSeek — deepseek-v4-flash-vision-exp, которую компания тихо выкатила в API 21 августа. Без презентаций, без красивых постеров, просто обновила документацию и добавила строчку в прайс-лист.В тот же день вышел DeepSeek Harness версии 0.1.1-rc.1 — фреймворк для агентов, теперь с адаптером под эту самую vision-модель. Если следить за хронологией, получается забавная картина: базовая V4 Flash вышла 31 июля, флагманская V4 Pro — 13 августа, а vision-версия на Flash появилась всего через 8 дней после Pro и через три недели после своего текстового прародителя. Для индустрии, где релизы обычно планируются кварталами, это похоже на спринт, а не на спокойный роадмап.

Зачем DeepSeek это нужно

Вопрос не в том, что модель умеет видеть. Вопрос в том, где она это делает и по какому ценнику. DeepSeek не стала изобретать отдельный тариф для картинок — она просто прикрутила зрение к существующей линейке Flash. Цены остались прежними: $0,22 за миллион входных токенов в оффпик, $0,66 за миллион выходных. Пиковые часы — с 1:00 до 4:00 и с 6:00 до 10:00 по UTC, тогда цена удваивается. Но даже в пик один скриншот обходится в $0,00017.Секрет дешевизны — в жёстком ограничении на токены. Любое изображение, каким бы огромным оно ни было, DeepSeek ресайзит примерно до 800×800 и переводит максимум в 384 токена. Для сравнения: флагманские модели конкурентов жуют по 1500–1700 токенов на тот же кадр. Получается, DeepSeek буквально говорит: «Я не буду разглядывать ваш 4K-монитор в деталях, мне хватит и этого».И ещё один нюанс, который легко пропустить: у новой модели лимит concurrency — 2500 одновременных запросов. У флагманской V4 Pro всего 500. Разница в пять раз. Это не про случайных пользователей, которые загружают фото кота. Это про агентов, которые шлют десятки скриншотов в минуту, разгребая интерфейсы и автоматизируя рутину. В типичном сценарии компьютерного агента на одну задачу уходит от 10 до 50 кадров. На V4 Pro такой объём съел бы бюджет за секунды. На Flash Vision — копейки.

Что остаётся за кадром

Правда, пока это всё теория. Модель помечена суффиксом -exp, то есть «экспериментальная». Независимых бенчмарков на точность распознавания интерфейсов, OCR или координат кликов ещё нет. Неизвестно, как она справляется с мелким текстом на сложных UI. Не замерена латентность — а для агента, который работает в реальном времени, каждая миллисекунда между скриншотом и ответом критична.Забавно, что в отличие от базового Flash и Pro, vision-версия лишена поддержки FIM Completion — функции дорисовки кода по середине. Почему? Может, архитектурное ограничение, может, сознательное упрощение. Но факт остаётся фактом: это не просто Flash с прикрученными глазами, это немного другой зверь.Если у вас уже есть доступ к API и вы успели погонять модель на реальных скриншотах — кидайте цифры в комментарии. Сколько токенов съедает 1080p? Какая задержка? Не мажет ли по координатам? Пока модель в статусе эксперимента, единственный способ узнать правду — это сообщество. DeepSeek дала нам инструмент за восемь сотых цента. Теперь интересно, что он умеет на самом деле.

3