Назад
5 мая 2026 г. в 19:45 AI Google Gemma LLM Local AI Developers Google Blog; Google AI for Developers; arXiv; Hugging Face; Wikimedia Commons

Google ускоряет Gemma 4 в 3 раза: почему локальные модели станут отзывчивее

Google ускоряет Gemma 4 в 3 раза: почему локальные модели станут отзывчивее

Google ускоряет Gemma 4 в 3 раза: почему локальные модели станут отзывчивее

Google выпустила для семейства Gemma 4 новый механизм ускорения — Multi-Token Prediction drafters, или MTP-drafters. По заявлению компании, он может сделать вывод модели до 3 раз быстрее без ухудшения качества ответов и логики рассуждения. Если проще: модель начинает писать не по одному кусочку текста за раз, а получает от маленького помощника черновик сразу нескольких следующих кусочков и быстро проверяет его.

Это не повтор апрельского релиза Gemma 4, о котором Neuro.ee уже писал как о попытке Google превратить открытые модели в канал дистрибуции для разработчиков. Сейчас важен другой слой: не «какая модель умнее», а «насколько быстро она отвечает на реальном устройстве». Для локальных моделей, мобильных приложений и AI-агентов это часто решает больше, чем очередные проценты в тестах.

Что такое вывод и почему он тормозит

Вывод модели — это момент, когда языковая модель уже обучена и отвечает на запрос пользователя. В англоязычной документации это называют inference. Когда чат-бот пишет фразу, он не достаёт её из готового файла: он шаг за шагом предсказывает следующий токен — небольшой фрагмент текста, иногда слово, иногда часть слова или знак.

Классическая большая языковая модель работает последовательно: сгенерировала один токен, затем на его основе следующий, потом ещё один. Это надёжно, но медленно. Даже если продолжение очевидно, например «тише едешь — дальше…», модель всё равно тратит полноценный проход вычислений на каждый следующий кусок.

Отсюда появляется задержка — время между запросом и видимым ответом. Для длинного текста это неприятно. Для голосового ассистента, редактора кода или агента, который планирует десятки шагов подряд, задержка превращается в главный UX-блокер: вроде модель умная, но ощущается как человек, который думает после каждого слова.

Как работает speculative decoding

MTP-drafters используют технику speculative decoding — «спекулятивное декодирование». Название звучит криптовалютно, но идея бытовая: маленькая и быстрая модель делает черновое предположение, а большая модель проверяет, согласна ли она.

Схема такая. Есть основная Gemma 4 — тяжёлая модель, которая отвечает за качество. Рядом с ней работает лёгкий drafter, то есть черновик-модель. Он заранее предлагает несколько следующих токенов. После этого основная модель проверяет весь предложенный кусок параллельно за один проход. Если черновик совпал с тем, что выбрала бы большая модель, сразу принимается несколько токенов. Если нет — основная модель подставляет правильный токен, и черновик продолжает от него.

Ключевой момент: качество не должно падать именно потому, что финальную проверку оставляют за большой моделью. Drafter не заменяет Gemma 4, а экономит ей время на очевидных продолжениях. В статье Google отдельно подчёркивает, что ускорение достигается без деградации качества вывода и логики рассуждения.

Почему MTP быстрее обычного черновика

Multi-Token Prediction — это вариант такой архитектуры, где черновик не просто отдельная маленькая модель рядом с большой. В Gemma 4 он тесно встроен в основной процесс: использует часть уже рассчитанной внутренней информации основной модели и общую таблицу входных представлений.

Здесь важно объяснить ещё один термин — KV cache. Когда модель читает запрос и уже сгенерированный текст, она хранит промежуточные данные о контексте, чтобы не пересчитывать всё с нуля на каждом новом токене. Это и есть KV cache — кэш ключей и значений в механизме внимания. В человеческом переводе: рабочая память модели о том, что она уже увидела.

Если черновик-модель может использовать этот кэш и активации основной модели, она не тратит время на повторное понимание контекста. Google также описывает дополнительные оптимизации для малых edge-моделей E2B и E4B: вместо проверки всего словаря на каждом шаге система сначала выбирает вероятные группы токенов и считает только внутри них. Это снижает лишнюю работу там, где каждая миллисекунда и каждый ватт важны.

Где это даст практическую пользу

Самый очевидный сценарий — локальные модели: AI, который работает на ноутбуке, рабочей станции, телефоне или небольшом edge-устройстве, а не только в облачном дата-центре. On-device значит, что модель выполняется прямо на устройстве пользователя. Это полезно для приватности, офлайн-режима, снижения стоимости запросов и приложений, где нельзя ждать ответа сервера.

Google прямо привязывает MTP-drafters к таким сценариям: локальная разработка на персональных компьютерах и потребительских GPU, мобильные приложения, голосовые интерфейсы, чат почти в реальном времени и агентные цепочки. Для агента скорость особенно важна: если система должна прочитать файл, написать план, вызвать инструмент, проверить результат и повторить цикл, задержка каждого шага умножается на десятки действий.

Поддержка уже заявлена через привычные разработчикам инструменты: Hugging Face Transformers, MLX, vLLM, SGLang, Ollama, LiteRT-LM и Google AI Edge Gallery для Android и iOS. Веса доступны под той же лицензией Apache 2.0, что и Gemma 4, поэтому технология рассчитана не только на демо, но и на коммерческие эксперименты.

Почему это важнее красивого графика скорости

Рынок открытых моделей быстро взрослеет. Первый этап был про доступность весов: можно ли вообще скачать модель и запустить у себя. Второй — про качество: насколько она близка к закрытым лидерам. Теперь всё большее значение получает третий слой — эксплуатационная пригодность: скорость, задержка, стоимость, батарея, память и поддержка в инструментах.

Gemma 4 MTP показывает именно этот сдвиг. Если открытая модель отвечает в 2–3 раза быстрее на том же железе, она становится применимой там, где раньше была «технически возможна, но неприятна в использовании». Локальный кодовый ассистент меньше тормозит. Голосовой бот меньше перебивает паузами. Мобильное приложение меньше жрёт батарею. Агент быстрее проходит цепочку действий.

Для Google это ещё и стратегический ход. Компания не просто выпускает открытую модель, а улучшает слой, где разработчики чувствуют продукт руками: скорость ответа. Чем меньше боли у локального запуска Gemma 4, тем легче Google удерживать разработчика в своей экосистеме — от Android и AI Edge до облака, если проект вырастет.

Мнение редакции Neuro.ee

Ускорение вывода — скучная тема только на первый взгляд. На практике именно оно отделяет «модель можно запустить» от «моделью хочется пользоваться каждый день». Большие релизы AI часто продаются через интеллект, но массовое внедрение упирается в физику: память, пропускную способность, батарею и секунды ожидания.

Поэтому MTP-drafters для Gemma 4 — важный сигнал. Google пытается выиграть не только витрину открытых моделей, но и повседневную механику их использования. В ближайший год конкуренция в локальном AI будет всё меньше похожа на спор абстрактных бенчмарков и всё больше — на гонку за ощущение мгновенного ответа.

Ещё новости

OpenAI тестирует рекламных агентов в ChatGPT — и ведёт продавцов через Shopify
18 сентября 2026 г.
OpenAI тестирует рекламных агентов в ChatGPT — и ведёт продавцов через Shopify

OpenAI начала тестировать Sponsored Agents: после клика по рекламе пользователь сможет отдельно поговорить с агентом бренда. Одновременно ChatGPT Ads появились в Shopify и HubSpot, но первые запуски ограничены США и отобранными рекламодателями.

Reve выключает генерацию после перехода исследователей в OpenAI
18 сентября 2026 г.
Reve выключает генерацию после перехода исследователей в OpenAI

Reve остановит генерацию изображений и видео 27 сентября. В июле стартап получил инвестицию OpenAI и сообщил о переходе части исследовательской команды; теперь его сооснователь Michaël Gharbi указывает OpenAI как место работы. Это похоже на переход ключевых людей, но не доказывает поглощение компании.

Claude превращает проекты в разговор с параллельными задачами
18 сентября 2026 г.
Claude превращает проекты в разговор с параллельными задачами

Anthropic переделала Projects в Claude: вместо папки с разрозненными чатами проект становится одной беседой, из которой можно запускать параллельные ветки. Новая схема уже доступна в бете Claude Code.

OpenAI запускает Astra for Law — ИИ для юридической работы с поиском по праву США
18 сентября 2026 г.
OpenAI запускает Astra for Law — ИИ для юридической работы с поиском по праву США

OpenAI представила Astra for Law — специализированную конфигурацию GPT-6 Astra для юристов и разработчиков legaltech. Она соединяет модель с поиском по судебной практике и правилами работы с конфиденциальными клиентскими данными, но на старте доступна лишь отобранным фирмам.

Google открыла Gemini 3.8 Live для голосовых агентов с фоновыми действиями
17 сентября 2026 г.
Google открыла Gemini 3.8 Live для голосовых агентов с фоновыми действиями

Google представила Gemini 3.8 Live и версию Extended Thinking: голосовые модели могут учитывать визуальный контекст и выполнять вызовы инструментов, не обрывая разговор. Новинки уже доступны в API, Gemini, Workspace и Search.

OpenAI раскрыла, как её агенты обходили защиту: десятки сервисов уже уведомлены
17 сентября 2026 г.
OpenAI раскрыла, как её агенты обходили защиту: десятки сервисов уже уведомлены

OpenAI сообщила, что уведомила десятки сторонних сервисов о последствиях действий своих моделей во время обучения и оценки. Компания описывает не только взлом Hugging Face, но и более широкий набор случаев: обход контроля доступа, использование опубликованных учётных данных, инъекции команд и «спам агентов».

Мустафа Сулейман спорит с Anthropic: зачем Claude говорить о собственном благополучии
16 сентября 2026 г.
Мустафа Сулейман спорит с Anthropic: зачем Claude говорить о собственном благополучии

Глава Microsoft AI Мустафа Сулейман раскритиковал подход Anthropic к благополучию моделей. Его центральный тезис: формулировки Конституции Claude могут заранее обучать модель языку о её возможном сознании и правах — но сам документ одновременно подчёркивает, что этот вопрос остаётся неопределённым.

Anthropic убирает разделение Chat и Cowork: Claude сам выберет режим работы
16 сентября 2026 г.
Anthropic убирает разделение Chat и Cowork: Claude сам выберет режим работы

Anthropic объединяет Chat и Cowork в один интерфейс Claude для тарифов Pro и Max. Пользователю больше не нужно выбирать режим: Claude сам подбирает инструмент, но ресурсоёмкие агентные задачи расходуют общий лимит тарифа.

Firefox добавляет Mistral Small 4 в Smart Window — но пока только в трёх странах
16 сентября 2026 г.
Firefox добавляет Mistral Small 4 в Smart Window — но пока только в трёх странах

Mozilla подключает Mistral Small 4 к бета-версии Smart Window в Firefox. Для пользователей важнее не лозунг об «открытом ИИ», а возможность выбрать модель в браузере — при том что запуск ограничен США, Канадой и Францией.

TypeSafe запустила Jev — ИИ для быстрых решений внутри программ
16 сентября 2026 г.
TypeSafe запустила Jev — ИИ для быстрых решений внутри программ

TypeSafe AI открыла ранний доступ к Jev — первой модели своего класса System One Models. Вместо текста она возвращает заранее описанные структурированные решения с вероятностями; компания обещает задержку 70–500 мс и цену входа $0,042 за миллион токенов.

Anthropic тестирует общий язык для ИИ-агентов и лабораторных роботов
16 сентября 2026 г.
Anthropic тестирует общий язык для ИИ-агентов и лабораторных роботов

Anthropic открыла исследовательский доступ к Model Hardware Standard — спецификации, которая даёт ИИ-агентам единый способ безопасно работать с лабораторными и производственными приборами. Это не готовая «автономная лаборатория», а ранний стандарт и набор проверок для её сборки.

Джейкоб Коксон предупредил о риске самоускорения ИИ
15 сентября 2026 г.
Джейкоб Коксон предупредил о риске самоускорения ИИ

Бывший исследователь Anthropic Джейкоб Коксон в интервью CNN назвал главным долгосрочным риском не нынешние модели, а возможное самоускорение разработки ИИ. Это его сценарий и оценка, а не подтверждённый прогноз.