Google представила EmbeddingGemma 2 для поиска по тексту, коду и медиа
Google выпустила EmbeddingGemma 2, локальную модель для поиска сразу по тексту, коду, изображениям, видео и аудио
Модель превращает все эти данные в единое пространство числовых представлений. Благодаря этому можно, например, написать запрос словами и найти подходящий момент в видео, фотографию, фрагмент кода или аудиозапись без предварительной расшифровки каждого формата.
Полная EmbeddingGemma 2 содержит 740 млн параметров, но архитектура модульная. Только текст и код требуют 270 млн параметров, текст с изображениями 440 млн, текст с аудио 570 млн. Ненужные части модели можно вообще не загружать в память.
На Pixel 11 Pro текстовая версия занимает около 191 МБ активной памяти, полная мультимодальная около 567 МБ. Данные при этом можно обрабатывать полностью на устройстве без отправки в облако.
Контекст для текста вырос до 8192 токенов. По поиску в коде новая версия набирает на 14% больше EmbeddingGemma первого поколения, а размер векторов можно уменьшать с 768 до 128 измерений, сокращая объём индекса до шести раз.
Модель открыта под Apache 2.0 и уже работает через sentence-transformers, Transformers, MLX, Ollama, LM Studio, vLLM и другие популярные инструменты.