Google ускоряет Gemma 4 в 3 раза: почему локальные модели станут отзывчивее
Google ускоряет Gemma 4 в 3 раза: почему локальные модели станут отзывчивее
Google выпустила для семейства Gemma 4 новый механизм ускорения — Multi-Token Prediction drafters, или MTP-drafters. По заявлению компании, он может сделать вывод модели до 3 раз быстрее без ухудшения качества ответов и логики рассуждения. Если проще: модель начинает писать не по одному кусочку текста за раз, а получает от маленького помощника черновик сразу нескольких следующих кусочков и быстро проверяет его.
Это не повтор апрельского релиза Gemma 4, о котором Neuro.ee уже писал как о попытке Google превратить открытые модели в канал дистрибуции для разработчиков. Сейчас важен другой слой: не «какая модель умнее», а «насколько быстро она отвечает на реальном устройстве». Для локальных моделей, мобильных приложений и AI-агентов это часто решает больше, чем очередные проценты в тестах.
Что такое вывод и почему он тормозит
Вывод модели — это момент, когда языковая модель уже обучена и отвечает на запрос пользователя. В англоязычной документации это называют inference. Когда чат-бот пишет фразу, он не достаёт её из готового файла: он шаг за шагом предсказывает следующий токен — небольшой фрагмент текста, иногда слово, иногда часть слова или знак.
Классическая большая языковая модель работает последовательно: сгенерировала один токен, затем на его основе следующий, потом ещё один. Это надёжно, но медленно. Даже если продолжение очевидно, например «тише едешь — дальше…», модель всё равно тратит полноценный проход вычислений на каждый следующий кусок.
Отсюда появляется задержка — время между запросом и видимым ответом. Для длинного текста это неприятно. Для голосового ассистента, редактора кода или агента, который планирует десятки шагов подряд, задержка превращается в главный UX-блокер: вроде модель умная, но ощущается как человек, который думает после каждого слова.
Как работает speculative decoding
MTP-drafters используют технику speculative decoding — «спекулятивное декодирование». Название звучит криптовалютно, но идея бытовая: маленькая и быстрая модель делает черновое предположение, а большая модель проверяет, согласна ли она.
Схема такая. Есть основная Gemma 4 — тяжёлая модель, которая отвечает за качество. Рядом с ней работает лёгкий drafter, то есть черновик-модель. Он заранее предлагает несколько следующих токенов. После этого основная модель проверяет весь предложенный кусок параллельно за один проход. Если черновик совпал с тем, что выбрала бы большая модель, сразу принимается несколько токенов. Если нет — основная модель подставляет правильный токен, и черновик продолжает от него.
Ключевой момент: качество не должно падать именно потому, что финальную проверку оставляют за большой моделью. Drafter не заменяет Gemma 4, а экономит ей время на очевидных продолжениях. В статье Google отдельно подчёркивает, что ускорение достигается без деградации качества вывода и логики рассуждения.
Почему MTP быстрее обычного черновика
Multi-Token Prediction — это вариант такой архитектуры, где черновик не просто отдельная маленькая модель рядом с большой. В Gemma 4 он тесно встроен в основной процесс: использует часть уже рассчитанной внутренней информации основной модели и общую таблицу входных представлений.
Здесь важно объяснить ещё один термин — KV cache. Когда модель читает запрос и уже сгенерированный текст, она хранит промежуточные данные о контексте, чтобы не пересчитывать всё с нуля на каждом новом токене. Это и есть KV cache — кэш ключей и значений в механизме внимания. В человеческом переводе: рабочая память модели о том, что она уже увидела.
Если черновик-модель может использовать этот кэш и активации основной модели, она не тратит время на повторное понимание контекста. Google также описывает дополнительные оптимизации для малых edge-моделей E2B и E4B: вместо проверки всего словаря на каждом шаге система сначала выбирает вероятные группы токенов и считает только внутри них. Это снижает лишнюю работу там, где каждая миллисекунда и каждый ватт важны.
Где это даст практическую пользу
Самый очевидный сценарий — локальные модели: AI, который работает на ноутбуке, рабочей станции, телефоне или небольшом edge-устройстве, а не только в облачном дата-центре. On-device значит, что модель выполняется прямо на устройстве пользователя. Это полезно для приватности, офлайн-режима, снижения стоимости запросов и приложений, где нельзя ждать ответа сервера.
Google прямо привязывает MTP-drafters к таким сценариям: локальная разработка на персональных компьютерах и потребительских GPU, мобильные приложения, голосовые интерфейсы, чат почти в реальном времени и агентные цепочки. Для агента скорость особенно важна: если система должна прочитать файл, написать план, вызвать инструмент, проверить результат и повторить цикл, задержка каждого шага умножается на десятки действий.
Поддержка уже заявлена через привычные разработчикам инструменты: Hugging Face Transformers, MLX, vLLM, SGLang, Ollama, LiteRT-LM и Google AI Edge Gallery для Android и iOS. Веса доступны под той же лицензией Apache 2.0, что и Gemma 4, поэтому технология рассчитана не только на демо, но и на коммерческие эксперименты.
Почему это важнее красивого графика скорости
Рынок открытых моделей быстро взрослеет. Первый этап был про доступность весов: можно ли вообще скачать модель и запустить у себя. Второй — про качество: насколько она близка к закрытым лидерам. Теперь всё большее значение получает третий слой — эксплуатационная пригодность: скорость, задержка, стоимость, батарея, память и поддержка в инструментах.
Gemma 4 MTP показывает именно этот сдвиг. Если открытая модель отвечает в 2–3 раза быстрее на том же железе, она становится применимой там, где раньше была «технически возможна, но неприятна в использовании». Локальный кодовый ассистент меньше тормозит. Голосовой бот меньше перебивает паузами. Мобильное приложение меньше жрёт батарею. Агент быстрее проходит цепочку действий.
Для Google это ещё и стратегический ход. Компания не просто выпускает открытую модель, а улучшает слой, где разработчики чувствуют продукт руками: скорость ответа. Чем меньше боли у локального запуска Gemma 4, тем легче Google удерживать разработчика в своей экосистеме — от Android и AI Edge до облака, если проект вырастет.
Мнение редакции Neuro.ee
Ускорение вывода — скучная тема только на первый взгляд. На практике именно оно отделяет «модель можно запустить» от «моделью хочется пользоваться каждый день». Большие релизы AI часто продаются через интеллект, но массовое внедрение упирается в физику: память, пропускную способность, батарею и секунды ожидания.
Поэтому MTP-drafters для Gemma 4 — важный сигнал. Google пытается выиграть не только витрину открытых моделей, но и повседневную механику их использования. В ближайший год конкуренция в локальном AI будет всё меньше похожа на спор абстрактных бенчмарков и всё больше — на гонку за ощущение мгновенного ответа.
- blog.googleAccelerating Gemma 4: faster inference with multi-token prediction drafters
- ai.google.devSpeed-up Gemma 4 with Multi-Token Prediction
- arxiv.orgFast Inference from Transformers via Speculative Decoding
- huggingface.coGemma 4 - a google Collection
- commons.wikimedia.orgCover image source: Google Headquarters Google Logo













