Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио
Облачный поиск по личным фото и записям обычно требует сначала отправить их на сервер. Google предлагает другой маршрут: новая открытая модель EmbeddingGemma 2 сопоставляет текст, изображения, кадры видео и аудио прямо на устройстве. По замыслу компании, так можно искать «кот на клавиатуре» в своей медиатеке или нужный момент в ролике без обязательной выгрузки файлов в облако.
EmbeddingGemma 2 — мультимодальная модель на 740 млн параметров. Она переводит разные типы данных в единое векторное пространство: запрос словами и подходящий кадр оказываются рядом математически. Это не генератор ответов и не распознавание «всего на свете», а более узкий строительный блок для поиска, сортировки и маршрутизации.
Поиск без каскада отдельных моделей
Google пишет, что полный мультимодальный вариант рассчитан примерно на 567 МБ активной памяти на Pixel 11 Pro; для текстового энкодера компания указывает около 191 МБ. Это заявленные разработчиком замеры для конкретного устройства, а не гарантия для любого телефона. Но сама идея практична: вместо цепочки «распознать речь → описать изображение → искать по тексту» приложение может сравнивать исходные представления напрямую.
В Google AI Edge Gallery уже добавили два демонстратора. Instant Media Search ищет локальные фото и видео по словам или по примеру изображения, а Video Moments Finder пытается находить в локальном видео нужные визуальные моменты. Google также показывает поиск по мере набора запроса: результаты перестраиваются после каждого символа.
Цифры скорости — ориентир, не контракт
В опубликованной таблице Google приводит задержки кодирования изображения на CPU, GPU и NPU. Например, для MacBook M5 Pro GPU компания указывает 37,3 мс на изображение при выбранном бюджете визуальных токенов. Такие показатели нельзя переносить на другой телефон или ноутбук без теста: на итог влияют железо, размер входных данных, движок и настройка модели.

График: Google AI Edge.
Для интеграции Google добавляет поддержку в MediaPipe Tasks и LiteRT; это делает модель интересной для кроссплатформенных приложений. Обещанная интеграция с ML Kit для Android пока обозначена как ближайшие недели. Поэтому разработчикам стоит отделять доступные сегодня демо и пакеты от будущего системного API — и измерять качество на своей медиатеке, особенно если поиск влияет на приватные данные или действия агента.













