Назад
8 октября 2026 г. в 09:40 Google Gemma On-device AI Developer Tools AI Search Источник

Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио

Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио

Облачный поиск по личным фото и записям обычно требует сначала отправить их на сервер. Google предлагает другой маршрут: новая открытая модель EmbeddingGemma 2 сопоставляет текст, изображения, кадры видео и аудио прямо на устройстве. По замыслу компании, так можно искать «кот на клавиатуре» в своей медиатеке или нужный момент в ролике без обязательной выгрузки файлов в облако.

EmbeddingGemma 2 — мультимодальная модель на 740 млн параметров. Она переводит разные типы данных в единое векторное пространство: запрос словами и подходящий кадр оказываются рядом математически. Это не генератор ответов и не распознавание «всего на свете», а более узкий строительный блок для поиска, сортировки и маршрутизации.

Поиск без каскада отдельных моделей

Google пишет, что полный мультимодальный вариант рассчитан примерно на 567 МБ активной памяти на Pixel 11 Pro; для текстового энкодера компания указывает около 191 МБ. Это заявленные разработчиком замеры для конкретного устройства, а не гарантия для любого телефона. Но сама идея практична: вместо цепочки «распознать речь → описать изображение → искать по тексту» приложение может сравнивать исходные представления напрямую.

В Google AI Edge Gallery уже добавили два демонстратора. Instant Media Search ищет локальные фото и видео по словам или по примеру изображения, а Video Moments Finder пытается находить в локальном видео нужные визуальные моменты. Google также показывает поиск по мере набора запроса: результаты перестраиваются после каждого символа.

Цифры скорости — ориентир, не контракт

В опубликованной таблице Google приводит задержки кодирования изображения на CPU, GPU и NPU. Например, для MacBook M5 Pro GPU компания указывает 37,3 мс на изображение при выбранном бюджете визуальных токенов. Такие показатели нельзя переносить на другой телефон или ноутбук без теста: на итог влияют железо, размер входных данных, движок и настройка модели.

Таблица Google с задержкой обработки одного изображения EmbeddingGemma 2 на CPU, GPU и NPU

График: Google AI Edge.

Для интеграции Google добавляет поддержку в MediaPipe Tasks и LiteRT; это делает модель интересной для кроссплатформенных приложений. Обещанная интеграция с ML Kit для Android пока обозначена как ближайшие недели. Поэтому разработчикам стоит отделять доступные сегодня демо и пакеты от будущего системного API — и измерять качество на своей медиатеке, особенно если поиск влияет на приватные данные или действия агента.

Официальный анонс Google AI Edge

Ещё новости

В Codex CLI появился вход в MCP-серверы из терминала
8 октября 2026 г.
В Codex CLI появился вход в MCP-серверы из терминала

В версии Codex CLI 0.161.0 OpenAI добавила команду для входа в MCP-серверы из активной терминальной сессии. Обновление также меняет стандартную модель в части каталогов и добавляет настройки голосового режима.

Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле
7 октября 2026 г.
Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле

Anthropic представила Claude Haiku 5.5 — малую модель для быстрых и недорогих задач: от классификации и суммаризации до субагентов и работы в браузере. Для запросов до 100 тысяч токенов вход и выход стали в десять раз дешевле, чем у Haiku 4.5.

Google запустил Playground: игры по текстовому запросу
7 октября 2026 г.
Google запустил Playground: игры по текстовому запросу

Google открыл экспериментальную платформу Playground: пользователь описывает игру текстом, тестирует её в браузере и делится ссылкой. На старте сервис доступен совершеннолетним пользователям из США, а возможности создания зависят от подписки Google One.

OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены
7 октября 2026 г.
OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены

OpenAI открыла каталог результатов внутренней модели: 722 рукописи в 372 связанных семействах. Компания подчёркивает, что материалы находятся на разных стадиях проверки, а часть результатов без формализации в Lean может содержать ошибки.

Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой
7 октября 2026 г.
Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой

Georgia Tech получила одобрение на новую онлайн-магистратуру по искусственному интеллекту. Старт намечен на 2027 год: программа обещает шесть направлений и обязательный проект с компанией или организацией, но детали приёма и стоимости пока не раскрыты.

Mistral Large 4: API уже доступен, веса — в конце октября
6 октября 2026 г.
Mistral Large 4: API уже доступен, веса — в конце октября

Mistral открыла public preview Mistral Large 4 — мультимодальной модели с 1 трлн параметров, из которых активно 49 млрд. В API её уже можно попробовать, но обещанные open weights появятся лишь в конце октября.

Reflection показала Beam на 501 млрд параметров — но веса выйдут позже
6 октября 2026 г.
Reflection показала Beam на 501 млрд параметров — но веса выйдут позже

Reflection представила Beam — открытую по весам MoE-модель для кода, рассуждений и агентов. Пока это ранний доступ: веса, model card и технический отчёт обещаны лишь позднее в октябре.

OpenAI начнёт маркировать тексты ChatGPT и Codex в ЕС
6 октября 2026 г.
OpenAI начнёт маркировать тексты ChatGPT и Codex в ЕС

OpenAI сообщила, что будет добавлять невидимую маркировку в тексты ChatGPT и Codex для пользователей из ЕС. Метка должна помочь выполнять требования AI Act, но компания признаёт: после существенной правки текста её будет труднее обнаружить.

GitHub открыла API для запуска проверок кода Copilot
5 октября 2026 г.
GitHub открыла API для запуска проверок кода Copilot

GitHub разрешила запускать проверку pull request’ов Copilot через REST и GraphQL API. Одновременно для новых и уже существующих репозиториев стандартным уровнем тщательности стал Balanced.

AWS показала Well-Architected Agent: ИИ-ревизор для облака, но с правами и проверкой человеком
5 октября 2026 г.
AWS показала Well-Architected Agent: ИИ-ревизор для облака, но с правами и проверкой человеком

AWS открыла предварительный доступ к Well-Architected Agent — сервису, который анализирует инфраструктуру и предлагает исправления для стоимости, производительности, устойчивости и безопасности. Рекомендации могут включать изменения IaC, но AWS отдельно предупреждает: генеративный ИИ способен ошибаться.

Google урезает доступ к Gemini: бесплатным оставят Flash-Lite
4 октября 2026 г.
Google урезает доступ к Gemini: бесплатным оставят Flash-Lite

Google меняет набор моделей Gemini для бесплатных пользователей и подписки AI Plus. С 9 октября доступ к Pro исчезнет у обоих уровней, а платный AI Pro получит Deep Think.

Руководитель по безопасности OpenAI ушёл, назвав культуру компании сломанной
4 октября 2026 г.
Руководитель по безопасности OpenAI ушёл, назвав культуру компании сломанной

Дэвид Робинсон, руководивший подготовкой отчётов по безопасности к релизам OpenAI, покинул компанию. В эссе он заявил, что темп запусков не оставляет ей достаточной осторожности; OpenAI ответила, что продолжает усиливать практики безопасности и при необходимости замедляет обучение или выпуск моделей.