DeepSeek представила мультимодальную модель V4 Flash Vision Exp — для анализа изображений и текста
Она доступна в API для разработчиков.
Источник: DeepSeek
- DeepSeek выпустила экспериментальную модель V4-Flash-Vision-Exp, которая умеет работать одновременно с текстом и изображениями. Модель пока доступна на платформе DeepSeek API, в чат-боте её нет.
- Модель может получать текст и изображения в одном запросе, анализировать фотографии и скриншоты, понимать графики и расположение элементов интерфейса и использовать их в агентных сценариях вместе с другими инструментами.
- По возможностям работы с текстом модель соответствует DeepSeek V4 Flash, отметили в компании. В тестах мультимодальных агентов V4-Flash-Vision-Exp превосходит обычную V4 Flash и приближается к Claude Opus 4.8, а в некоторых тестах обходит её.
- Стоимость в пиковые часы — $0,014-$0,44 за 1 млн входных токенов и $1,32 — за 1 млн выходных. В непиковые — $0,007-$0,22 и $0,66 соответственно. Для расчёта стоимости изображение конвертируется в токены — максимум 384 токена на картинку по тарифам V4 Flash.