Google выпустила Gemini 3.5 Flash для быстрых AI-агентов
Google выпустила Gemini 3.5 Flash — новую модель семейства Gemini, которую компания описывает как вариант для «почти Pro-интеллекта» на скорости и цене класса Flash. Это не просто очередное встраивание Gemini в поиск: главный факт в том, что у Google появилась отдельная общедоступная модель для агентного кода, параллельных агентов и длинных рабочих сценариев.
В документации Google Cloud модель уже указана с ID gemini-3.5-flash, общедоступной стадией и датой релиза 19 мая 2026 года. Она принимает текст, код, изображения, аудио, видео и PDF, а на выходе даёт текст. Лимиты крупные: до 1 048 576 входных токенов и до 65 535 выходных токенов. Дата отсечения знаний — январь 2025 года.
Что именно выпустила Google
Gemini 3.5 Flash занимает промежуточную позицию между дорогими моделями для рассуждений и массовыми Flash-вариантами. На странице DeepMind она стоит рядом с Gemini 3.1 Pro и Gemini 3.1 Flash-Lite, но роль сформулирована иначе: передовая производительность для агентов и кода. В Google Cloud формулировка ещё конкретнее: уровень Pro в программировании, параллельное выполнение агентных задач и цена со скоростью класса Flash.
Для разработчиков важны не только слова про «агентность», а набор поддерживаемых режимов. В модели заявлены привязка к Google Search, выполнение кода, системные инструкции, вызов функций, подсчёт токенов, структурированный вывод, режим рассуждения, явное и неявное кэширование контекста, а также совместимость с Chat Completions. При этом Gemini Live API и Content Credentials для этой модели не поддерживаются.
Контекст, цены и бенчмарки
На стандартном глобальном тарифе Google Cloud Gemini 3.5 Flash стоит $1,50 за 1 млн входных токенов и $9 за 1 млн выходных токенов. Кэшированный ввод стоит $0,15 за 1 млн токенов. Для Flex/Batch цены ниже: $0,75 за вход и $4,50 за выход на глобальной точке доступа. Для неглобальных регионов Google указывает наценку, которая должна вступить в силу 1 июля 2026 года.
По бенчмаркам Google рисует модель как рабочую лошадку для агентных задач. На Terminal-bench 2.1 она набирает 76,2% против 58,0% у Gemini 3 Flash и 78,2% у GPT-5.5. На SWE-Bench Pro — 55,1%, на MCP Atlas для многошаговых процессов через MCP — 83,6%, на OSWorld-Verified для компьютерного управления — 78,4%. В мультимодальных тестах заявлены 83,6% на MMMU-Pro и 84,2% на CharXiv, а в длинном контексте MRCR v2 для 1 млн токенов — 26,6%.
Отдельный акцент — скорость в реальных демонстрациях. DeepMind показывает сценарии, где Gemini 3.5 Flash генерирует несколько вариантов платёжного интерфейса меньше чем за минуту, строит интерактивные HTML-компоненты, координирует несколько агентов и разбирает длинные документы. Это не доказывает надёжность в продакшене, но хорошо объясняет позиционирование: модель должна быть достаточно сильной для агента, но достаточно быстрой для частого использования.
Где она появится
Google связывает Gemini 3.5 Flash с Agent Platform, Google AI Studio, Gemini API и корпоративными агентными сценариями. На стороне обычных пользователей похожая логика уже видна в Search AI Mode и приложении Gemini: модель не только отвечает текстом, но может строить визуальные ответы, таблицы, симуляции и небольшие интерактивные инструменты под запрос.
Для рынка это важнее сухого списка процентов. Google пытается занять слой, где сейчас конкурируют OpenAI Codex, Claude, Cursor, Windsurf, Replit и корпоративные агентные платформы: не «кто умнее в чате», а «кто дешевле и стабильнее закрывает длинную задачу с файлами, инструментами, браузером и проверкой результата».
Главный вопрос к Gemini 3.5 Flash теперь практический: выдержит ли модель обещанный баланс цены, скорости и агентной надёжности вне демонстраций. Но угол новости уже ясен. Google выпустила не просто функцию для поиска, а новую модель для массового агентного слоя — с понятным ID, лимитами, ценой, бенчмарками и местом в своей платформе.













