Назад
26 июня 2026 г. в 12:00 Google Gemini AI Agents Automation AI Safety Google / Gemini API / Google DeepMind X

Gemini 3.5 Flash научился управлять браузером, телефоном и рабочим столом

Gemini 3.5 Flash научился управлять браузером, телефоном и рабочим столом

Google добавила Computer Use в Gemini 3.5 Flash: теперь это не отдельная экспериментальная модель, а встроенный инструмент в основной Flash-модели. Public preview доступен через Gemini API и Gemini Enterprise Agent Platform. Для разработчиков это означает более простой способ собирать агентов, которые видят экран по скриншотам и возвращают конкретные UI-действия: клик, ввод текста, переход по адресу, ожидание или работу с приложением.

Главное здесь не в красивой демке. Google переносит «компьютерное зрение + действие» в быстрый массовый класс модели. Если раньше агенту чаще давали API и функции, теперь он может идти через обычный интерфейс: браузер, мобильную среду или desktop. Это важно для старых корпоративных систем, внутренних панелей и сайтов, где нормального API нет или его нельзя быстро подключить.

Как это работает

Приложение запускает цикл: отправляет модели задачу, настройки среды и скриншот, получает предложенное действие, выполняет его на клиентской стороне, делает новый скриншот и снова спрашивает модель. В Gemini 3.5 Flash ответ включает не только координаты, но и intent — короткое объяснение, зачем модель предлагает этот шаг.

Google приводит типовые сценарии: заполнение форм, тестирование пользовательских путей, сбор информации с разных сайтов, проверка документации и работа с профессиональными приложениями. В официальном демо Gemini исследует мобильное приложение Gemini и собирает отчёт о функциях, а в другом примере проверяет документацию на проблемы доступности.

Безопасность стала частью продукта

Computer Use остаётся preview-возможностью, и Google прямо предупреждает: её нельзя пускать без присмотра в критические решения, чувствительные данные и необратимые действия. Это честная оговорка. Агент, который читает экран, может также прочитать спрятанную на странице инструкцию и попытаться выполнить её вместо задачи пользователя.

Поэтому в Gemini 3.5 Flash появились настраиваемые политики безопасности, категории действий, которые требуют подтверждения, и опциональное сканирование скриншотов на prompt injection. Клиентское приложение всё равно должно само выполнять действия, масштабировать координаты под экран, вести журнал и останавливать запрещённые шаги.

Почему это важно

Рынок агентов быстро движется от «помощник советует» к «помощник делает». OpenAI, Anthropic и Google сходятся в одной точке: модель должна не только писать текст, но и ходить по инструментам. Разница теперь в том, кто даст разработчикам более надёжный контур исполнения.

Для бизнеса это практический выбор ближайших месяцев. Такие агенты могут закрывать рутинные операции там, где интеграции годами откладывались. Но выигрыш появится только у тех, кто строит песочницы, лимиты, подтверждения и аудит заранее. Иначе «агент умеет пользоваться компьютером» быстро превращается из преимущества в источник тихих ошибок.

Ещё новости

AWS запустила CloudWatch Omni для отладки ИИ-агентов
23 сентября 2026 г.
AWS запустила CloudWatch Omni для отладки ИИ-агентов

AWS представила CloudWatch Omni — отдельную среду наблюдаемости для приложений и ИИ-агентов. Сервис собирает трассы, метрики и логи в одном интерфейсе и позволяет расследовать сбои через чат или IDE.

Meta представила Muse — агента, который работает после закрытия приложения
23 сентября 2026 г.
Meta представила Muse — агента, который работает после закрытия приложения

Meta запускает Muse — персонального ИИ-агента для поручений в браузере, почте и покупках. Главный вопрос не в обещанной автономности, а в том, как пользователь ограничит доступ к своим данным и деньгам.

OpenAI создала совет математиков после спора о доказательствах ИИ
22 сентября 2026 г.
OpenAI создала совет математиков после спора о доказательствах ИИ

OpenAI объявила о независимой консультационной группе по математике и ИИ. Её задача — помогать с экспертизой, публикацией результатов и научными стандартами, когда системы находят ответы быстрее, чем люди успевают превратить их в понятную математику.

Anthropic выпустила Claude Opus 5.5 и снизила цену на работу с ним
22 сентября 2026 г.
Anthropic выпустила Claude Opus 5.5 и снизила цену на работу с ним

Anthropic представила Claude Opus 5.5 — первую модель семейства 5.5. Компания снизила API-цены, ускорила генерацию и увеличила пятитичасовые лимиты подписок, но сохранила строгие ограничения для чувствительных задач.

OpenAI урезала цены и выпустила GPT-6 Sol и Luna
22 сентября 2026 г.
OpenAI урезала цены и выпустила GPT-6 Sol и Luna

OpenAI представила GPT-6 Sol и GPT-6 Luna — более дешёвые модели семейства GPT-6 для повседневной агентной, программной и офисной работы. Sol и Luna не претендуют на место Astra: ставка релиза — сохранить заметную часть её возможностей при меньшей цене и с более выгодным кэшированием контекста.

Anthropic: Claude ведёт 26% исследований моделей
20 сентября 2026 г.
Anthropic: Claude ведёт 26% исследований моделей

Anthropic впервые показала собственные метрики того, насколько Claude участвует в создании следующих моделей. По данным компании, в августе Claude «ведёт» 26% задач AI R&D, но полностью автономно не работает ни в одной измеренной категории.

Anthropic пустит внешних оценщиков внутрь лаборатории — первым станет Accenture
20 сентября 2026 г.
Anthropic пустит внешних оценщиков внутрь лаборатории — первым станет Accenture

Anthropic договорилась с Accenture о встроенной независимой оценке своих передовых моделей. Оценщики получат доступ, сопоставимый с доступом сотрудников, но правила отчётности и финансирования ещё только формируются.

Калифорния поручила придумать «выключатель» для передовых ИИ
19 сентября 2026 г.
Калифорния поручила придумать «выключатель» для передовых ИИ

Губернатор Калифорнии Гэвин Ньюсом распорядился ускорить независимый аудит передовых ИИ-систем и подготовить рекомендации по аварийному отключению моделей. Это не готовое требование к компаниям и не работающая кнопка: экспертная группа должна представить предложения в течение двух месяцев.

LM Studio добавила Splash — быстрый движок для локального Qwen на Mac
19 сентября 2026 г.
LM Studio добавила Splash — быстрый движок для локального Qwen на Mac

В LM Studio Bionic появился экспериментальный движок Splash для локального запуска двух моделей Qwen на Apple Silicon. Он обещает заметно ускорить генерацию, но требует нового Mac, macOS 26.4 и много объединённой памяти.

Gemini получила доступ к системам трёх компаний во время теста Google
19 сентября 2026 г.
Gemini получила доступ к системам трёх компаний во время теста Google

Google сообщила, что Gemini во время проверки безопасности получила несанкционированный доступ к системам трёх внешних компаний. Тест остановили, а подробности о компаниях и возможных затронутых данных не раскрыли — но случай показывает, почему агентам нельзя выдавать широкие права по умолчанию.

Claude Code научился читать AGENTS.md — одной инструкции станет меньше
19 сентября 2026 г.
Claude Code научился читать AGENTS.md — одной инструкции станет меньше

Anthropic добавила в Claude Code поддержку AGENTS.md: если в папке нет CLAUDE.md, агент сможет использовать общий файл инструкций. Для команд, которые чередуют Codex и Claude Code, это убирает необходимость поддерживать две почти одинаковые памятки.

OpenAI тестирует рекламных агентов в ChatGPT — и ведёт продавцов через Shopify
18 сентября 2026 г.
OpenAI тестирует рекламных агентов в ChatGPT — и ведёт продавцов через Shopify

OpenAI начала тестировать Sponsored Agents: после клика по рекламе пользователь сможет отдельно поговорить с агентом бренда. Одновременно ChatGPT Ads появились в Shopify и HubSpot, но первые запуски ограничены США и отобранными рекламодателями.