Локальные ИИ-модели получили ускоритель: llama.cpp добавил MTP и сделал Qwen заметно быстрее
Локальные ИИ-модели получили ускоритель: llama.cpp добавил MTP и сделал Qwen заметно быстрее
В llama.cpp влили поддержку MTP — Multi Token Prediction. Для людей вне локального ИИ это может звучать как очередная аббревиатура из недр GitHub, но смысл довольно земной: модели учатся отвечать быстрее без отдельной маленькой draft-модели, которую раньше часто приходилось добавлять к speculative decoding.
Обычная LLM пишет ответ по одному токену: предсказала следующий кусок текста, добавила его в контекст, пошла дальше. MTP позволяет модели заранее предложить несколько следующих токенов. Потом основная проверка решает, какие из них действительно подходят. Если прогноз удачный, генерация перескакивает через несколько шагов сразу. Если нет — лишнее отбрасывается, и модель продолжает обычным темпом.
Главная новость не в теории, а в том, что это теперь появилось в llama.cpp — одном из самых важных инструментов для запуска open-weight моделей на локальных компьютерах, рабочих станциях и небольших серверах. Через него живут домашние ассистенты, локальные чат-интерфейсы, эксперименты с кодовыми моделями и корпоративные сборки, где данные не хотят отправлять в облако.
Что именно добавили
Поддержка пришла через PR #22673. Автор тестировал механизм на Qwen3.6 27B и Qwen3.6 35B-A3B. В описании PR указано, что MTP-модель загружается из того же GGUF-файла. Это важная деталь: пользователю не нужно отдельно искать маленькую модель-помощник, синхронизировать её с основной и надеяться, что вся связка не развалится на настройках.
По сути, черновой контур для предсказания следующих токенов находится внутри самой поддерживаемой модели или рядом с ней в одном файле. Поэтому MTP выглядит удобнее для массового локального запуска, чем классическая схема с двумя моделями. Скачал правильный GGUF, включил нужные параметры, получил шанс на ускорение без лишней инженерной кухни.
Но это не магический турборежим для всех старых весов. Модель должна быть обучена или собрана с MTP-головами. Если у архитектуры их нет, один только новый llama.cpp не заставит её внезапно писать вдвое быстрее. Нужны подходящие сборки, корректные параметры и дальнейшая оптимизация в рантайме.
Насколько быстрее
Первые цифры выглядят заметно. В бенчмарках из PR девять тестовых задач на Qwen3.6 без MTP заняли около 201 секунды, а скорость держалась примерно на уровне 7 токенов в секунду. С MTP и максимумом в три draft-токена те же задачи уложились примерно в 84 секунды. В отдельных сценариях скорость поднималась до 16–22 токенов в секунду.
Автор также пишет о 72–75% принятых предсказанных токенов в устойчивом режиме. Это как раз та часть, от которой зависит выигрыш: чем чаще черновые токены совпадают с тем, что основная модель готова принять, тем меньше шагов приходится делать последовательно.
Ограничения тоже названы прямо. Результат зависит от модели, железа, длины ответа, настроек и параллельности. В PR отдельно отмечено, что обработка промпта при включённом MTP может проседать из-за переносов эмбеддингов с устройства на хост, а параллельное декодирование ещё не полностью оптимизировано. Поэтому честная формулировка такая: не «всем стало в три раза быстрее», а «для подходящих моделей появился реальный путь к двукратному ускорению генерации».
Почему это важно
Локальные модели часто проигрывают облачным не только качеством, но и ощущением скорости. Пользователь может быть готов терпеть более сложную установку ради приватности, цены или контроля, но медленный ответ быстро превращает полезный инструмент в игрушку для энтузиастов.
MTP бьёт именно в это слабое место. Если 27B или 35B-модель на локальном железе начинает отвечать ближе к облачному чату, меняется набор практических сценариев: код-ассистент на рабочей машине, приватный разбор документов, локальный агент для автоматизации, внутренний помощник компании без передачи данных внешнему провайдеру.
Отдельно показательно, что тесты идут на Qwen3.6. Китайские open-weight модели уже давно не выглядят экзотикой для бенчмарков: Qwen, DeepSeek и соседние семейства используются для кода, анализа, перевода и локальных агентов. Если MTP хорошо приживётся именно там, выиграет не один репозиторий, а заметная часть локальной экосистемы.
Большая гонка ИИ обычно видна по релизам новых моделей. Но в реальной жизни не менее важна гонка инференса: сколько стоит ответ, сколько он занимает времени и можно ли запустить всё без облачного API. Поддержка MTP в llama.cpp — не финальная победа локального ИИ, а полезный инженерный шаг к тому, чтобы сильная модель на собственном компьютере отвечала не «когда-нибудь», а сейчас.












