HumanOmniV2: модель, которая идеально понимает контекст видео.

Alibaba Group разработали HumanOmniV2 , модель на базе Qwen2.5-Omni-7B-thinker, которая получила навык осмысления визуального контекста за счет изменения самого процесса мышления модели. Ее научили следовать строгому формату: сначала описать контекст, потом рассуждать и только затем давать ответ.

11

DeepSeek открыла веса V4.1-Flash

DeepSeek выложила (https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash) свежайшую DeepSeek-V4.1-Flash (https://www.deepseek.com/en/news/deepseek-v4-1-flash/), мультимодальную MoE-модель на 552 млрд параметров, с контекстом до миллиона токенов и методом Causal Encoder-Decoder под капотом, который вдвое удешевляет разбор входа.

Задача, под к…

11