Tencent открыла набор мультимодальных эмбеддингов

Tencent открыла набор мультимодальных эмбеддингов

Команда WeChat китайского техгиганта выложила (https://x.com/Weixin_WeChat/status/2092553629458641076) в открытый доступ семейство эмбеддинг-моделей WeMM-Embedding (https://huggingface.co/collections/tencent/wemm-embedding), предназначенных для создания универсальных векторных представлений.

Набор работает с текстом, изображениями, видеороликами, сложными визуальными документами и смешанным контентом, объединяя их в единое семантическое пространство.

Эмбеддинги учили с использованием Matryoshka Representation Learning, который позволяет на этапе применения обрезать размерность вектора, экономя память и вычисления.

Построено семейство на Qwen3.5, на выходе младшая модель дает нормализованный вектор на 2048 измерений, а старшая - на 4096.

Tencent приводят цифру, что при сжатии до 256 измерений двухмиллиардная модель сохраняет 98,7% исходного качества на задачах с фото и видео.

Опубликованы веса трех размерностей: 2B (https://huggingface.co/tencent/WeMM-Embedding-2B), 4B (https://huggingface.co/tencent/WeMM-Embedding-4B) и 9B (https://huggingface.co/tencent/WeMM-Embedding-9B)

🟡 Тесты

9B берет новый лучший общий результат на MMEB-v2 (80,6 балла), а 2B обходит Qwen3-VL-Embedding, который вчетверо больше нее.

Но есть аргумент посильнее бенчей - семейство работает в рекомендациях и поиске WeChat. Она развернута для обработки каналов, аккаунтов и электронной коммерции.

Команда мессенджера говорит, что WeMM-Embedding показали стабильные улучшения в 14 онлайновых A/B-тестах.

Модели работают с библиотекой Transformers и поддерживаются vLLM и SGLang.

Единственным ограничением текущей версии является отсутствие поддержки аудио

📌Лицензирование: Apache 2.0 License

🟡Arxiv (https://arxiv.org/pdf/2608.24053) 🟡Веса (https://huggingface.co/collections/tencent/wemm-embedding) 🖥Githib (https://github.com/Tencent/WeMM-Embedding)