DeepSeek выпустил V4 Flash со зрением
Модель V4-Flash-Vision-Exp понимает не только текст, но и картинки, графики и другие визуальные данные. При этом текстовые возможности остались примерно на уровне обычной V4 Flash.
Главный упор сделали на агентов, которым нужно видеть происходящее на экране. По тестам самой DeepSeek, новая Flash заметно прибавила в мультимодальных агентных задачах и по ряду бенчмарков приблизилась к Opus 4.8.
Модель уже доступна через API. Изображение занимает максимум 384 токена и оплачивается по тарифам V4 Flash.
Одновременно обновили Harness до версии 0.1.1 с поддержкой новой модели и запустили бесплатный Files API, чтобы один раз загрузить картинку и потом использовать её в нескольких запросах.