Google представила EmbeddingGemma 2 для поиска по тексту, коду и медиа

Google выпустила EmbeddingGemma 2, локальную модель для поиска сразу по тексту, коду, изображениям, видео и аудио

Google представила EmbeddingGemma 2 для поиска по тексту, коду и медиа

Модель превращает все эти данные в единое пространство числовых представлений. Благодаря этому можно, например, написать запрос словами и найти подходящий момент в видео, фотографию, фрагмент кода или аудиозапись без предварительной расшифровки каждого формата.

Полная EmbeddingGemma 2 содержит 740 млн параметров, но архитектура модульная. Только текст и код требуют 270 млн параметров, текст с изображениями 440 млн, текст с аудио 570 млн. Ненужные части модели можно вообще не загружать в память.

На Pixel 11 Pro текстовая версия занимает около 191 МБ активной памяти, полная мультимодальная около 567 МБ. Данные при этом можно обрабатывать полностью на устройстве без отправки в облако.

Контекст для текста вырос до 8192 токенов. По поиску в коде новая версия набирает на 14% больше EmbeddingGemma первого поколения, а размер векторов можно уменьшать с 768 до 128 измерений, сокращая объём индекса до шести раз.

Модель открыта под Apache 2.0 и уже работает через sentence-transformers, Transformers, MLX, Ollama, LM Studio, vLLM и другие популярные инструменты.