Назад
17 мая 2026 г. в 06:00 AI Open Source Local LLM llama.cpp Qwen Inference GitHub / Reddit r/LocalLLaMA

Локальные ИИ-модели получили ускоритель: llama.cpp добавил MTP и сделал Qwen заметно быстрее

Локальные ИИ-модели получили ускоритель: llama.cpp добавил MTP и сделал Qwen заметно быстрее

Локальные ИИ-модели получили ускоритель: llama.cpp добавил MTP и сделал Qwen заметно быстрее

В llama.cpp влили поддержку MTP — Multi Token Prediction. Для людей вне локального ИИ это может звучать как очередная аббревиатура из недр GitHub, но смысл довольно земной: модели учатся отвечать быстрее без отдельной маленькой draft-модели, которую раньше часто приходилось добавлять к speculative decoding.

Обычная LLM пишет ответ по одному токену: предсказала следующий кусок текста, добавила его в контекст, пошла дальше. MTP позволяет модели заранее предложить несколько следующих токенов. Потом основная проверка решает, какие из них действительно подходят. Если прогноз удачный, генерация перескакивает через несколько шагов сразу. Если нет — лишнее отбрасывается, и модель продолжает обычным темпом.

Главная новость не в теории, а в том, что это теперь появилось в llama.cpp — одном из самых важных инструментов для запуска open-weight моделей на локальных компьютерах, рабочих станциях и небольших серверах. Через него живут домашние ассистенты, локальные чат-интерфейсы, эксперименты с кодовыми моделями и корпоративные сборки, где данные не хотят отправлять в облако.

Что именно добавили

Поддержка пришла через PR #22673. Автор тестировал механизм на Qwen3.6 27B и Qwen3.6 35B-A3B. В описании PR указано, что MTP-модель загружается из того же GGUF-файла. Это важная деталь: пользователю не нужно отдельно искать маленькую модель-помощник, синхронизировать её с основной и надеяться, что вся связка не развалится на настройках.

По сути, черновой контур для предсказания следующих токенов находится внутри самой поддерживаемой модели или рядом с ней в одном файле. Поэтому MTP выглядит удобнее для массового локального запуска, чем классическая схема с двумя моделями. Скачал правильный GGUF, включил нужные параметры, получил шанс на ускорение без лишней инженерной кухни.

Но это не магический турборежим для всех старых весов. Модель должна быть обучена или собрана с MTP-головами. Если у архитектуры их нет, один только новый llama.cpp не заставит её внезапно писать вдвое быстрее. Нужны подходящие сборки, корректные параметры и дальнейшая оптимизация в рантайме.

Насколько быстрее

Первые цифры выглядят заметно. В бенчмарках из PR девять тестовых задач на Qwen3.6 без MTP заняли около 201 секунды, а скорость держалась примерно на уровне 7 токенов в секунду. С MTP и максимумом в три draft-токена те же задачи уложились примерно в 84 секунды. В отдельных сценариях скорость поднималась до 16–22 токенов в секунду.

Автор также пишет о 72–75% принятых предсказанных токенов в устойчивом режиме. Это как раз та часть, от которой зависит выигрыш: чем чаще черновые токены совпадают с тем, что основная модель готова принять, тем меньше шагов приходится делать последовательно.

Ограничения тоже названы прямо. Результат зависит от модели, железа, длины ответа, настроек и параллельности. В PR отдельно отмечено, что обработка промпта при включённом MTP может проседать из-за переносов эмбеддингов с устройства на хост, а параллельное декодирование ещё не полностью оптимизировано. Поэтому честная формулировка такая: не «всем стало в три раза быстрее», а «для подходящих моделей появился реальный путь к двукратному ускорению генерации».

Почему это важно

Локальные модели часто проигрывают облачным не только качеством, но и ощущением скорости. Пользователь может быть готов терпеть более сложную установку ради приватности, цены или контроля, но медленный ответ быстро превращает полезный инструмент в игрушку для энтузиастов.

MTP бьёт именно в это слабое место. Если 27B или 35B-модель на локальном железе начинает отвечать ближе к облачному чату, меняется набор практических сценариев: код-ассистент на рабочей машине, приватный разбор документов, локальный агент для автоматизации, внутренний помощник компании без передачи данных внешнему провайдеру.

Отдельно показательно, что тесты идут на Qwen3.6. Китайские open-weight модели уже давно не выглядят экзотикой для бенчмарков: Qwen, DeepSeek и соседние семейства используются для кода, анализа, перевода и локальных агентов. Если MTP хорошо приживётся именно там, выиграет не один репозиторий, а заметная часть локальной экосистемы.

Большая гонка ИИ обычно видна по релизам новых моделей. Но в реальной жизни не менее важна гонка инференса: сколько стоит ответ, сколько он занимает времени и можно ли запустить всё без облачного API. Поддержка MTP в llama.cpp — не финальная победа локального ИИ, а полезный инженерный шаг к тому, чтобы сильная модель на собственном компьютере отвечала не «когда-нибудь», а сейчас.

Ещё новости

OpenAI превращает ChatGPT в рабочую платформу для людей и агентов
29 сентября 2026 г.
OpenAI превращает ChatGPT в рабочую платформу для людей и агентов

На DevDay 2026 OpenAI описала ChatGPT как общую рабочую поверхность для людей, агентов и нативных приложений разработчиков. В самом recap нет условий доступа к отдельным продуктам, поэтому их нельзя считать доступными всем пользователям.

Grok 4.7 появилась в Amazon Bedrock: для Европы — только глобальный маршрут
29 сентября 2026 г.
Grok 4.7 появилась в Amazon Bedrock: для Европы — только глобальный маршрут

Amazon Bedrock добавил Grok 4.7 от xAI. Для европейских клиентов модель доступна лишь через глобальный межрегиональный профиль: это даёт доступ к 500-тысячному контексту, но не позволяет закрепить обработку в одной европейской зоне.

Anthropic выпустила Claude Sonnet 5.5 с киберзащитой уровня Opus
29 сентября 2026 г.
Anthropic выпустила Claude Sonnet 5.5 с киберзащитой уровня Opus

Anthropic представила Claude Sonnet 5.5 — более быструю и экономичную модель для повседневных агентных задач, кодинга и работы с документами. Компания заявляет заметный прирост на тестах, но оставляет Opus 5.5 выбором для сложной открытой работы.

Anthropic идёт к IPO с убытком $42 млрд и планом потратить $518 млрд на ИИ
29 сентября 2026 г.
Anthropic идёт к IPO с убытком $42 млрд и планом потратить $518 млрд на ИИ

Reuters ознакомилось с конфиденциальным проспектом Anthropic перед IPO: при выручке $4,6 млрд за 2025 год компания показала чистый убыток $42 млрд и описала план расходов на вычисления и инфраструктуру в $518 млрд на 2027 год. Большая часть убытка — бухгалтерская переоценка инструментов, связанных с будущими акциями; откуда возьмутся деньги на заявленный план, в материале не раскрывается.

Manus даёт личному ИИ-агенту почту, телефон и кошелёк
29 сентября 2026 г.
Manus даёт личному ИИ-агенту почту, телефон и кошелёк

Manus представила Manus 2.0 и приложение Cue, где персональному агенту обещают собственные email, телефон, кошелёк и компьютер. Для бизнеса это переносит главный вопрос от качества ответов к управлению учётными записями, деньгами и журналом действий.

NVIDIA открыла платформу безопасности для ИИ-агентов
28 сентября 2026 г.
NVIDIA открыла платформу безопасности для ИИ-агентов

NVIDIA представила Open Agent Safety Platform — набор открытых компонентов и эталонную архитектуру для контроля действий ИИ-агентов. Ключевая идея: критические ограничения должны проверяться вне самой модели.

NYT: правительства всё сильнее отстают от развития ИИ
28 сентября 2026 г.
NYT: правительства всё сильнее отстают от развития ИИ

The New York Times пишет, что разрыв между скоростью развития ИИ и скоростью выработки правил стал шире, чем когда-либо. Пока модели и агенты быстро выходят за пределы лабораторий, у мира нет общего механизма, который определял бы допустимый риск и ответственность.

Bloomberg: Китай расширил ограничения на поездки семей AI- и чип-специалистов
28 сентября 2026 г.
Bloomberg: Китай расширил ограничения на поездки семей AI- и чип-специалистов

Bloomberg сообщает, что Китай распространил ограничения на зарубежные поездки ключевых сотрудников частных AI- и полупроводниковых компаний на членов их семей. Публикация не подтверждает появление отдельной системы «выездных виз»: речь идёт о мерах контроля поездок, а не о визе, которую выдаёт другая страна.

Meta добавит в WhatsApp говорящий аватар для звонков с очков
26 сентября 2026 г.
Meta добавит в WhatsApp говорящий аватар для звонков с очков

Meta готовит Hologram — цифровое изображение лица для звонков из очков Meta Ray-Ban Display. Аватар будет реагировать на голос, но первый запуск ограничен ранним доступом в США.

Google добавила говорящие аватары в Gemini Enterprise
26 сентября 2026 г.
Google добавила говорящие аватары в Gemini Enterprise

Google открыла для Gemini Enterprise Live Avatar: корпоративный голосовой агент теперь может отвечать с синхронизированным видеоаватаром. Функция полезна для сервисных сценариев, но создание собственных персонажей пока требует allowlist.

Google Beam выходит в шесть стран: 3D-видеосвязь становится ближе к офисам
26 сентября 2026 г.
Google Beam выходит в шесть стран: 3D-видеосвязь становится ближе к офисам

Google расширяет поставки Beam — системы видеосвязи с эффектом присутствия — на шесть стран и запускает сеть демонстрационных переговорных. Важно не само обещание «как в одной комнате», а то, что устройство начинает появляться там, где его можно испытать до покупки.

Microsoft встраивает Word, Excel и PowerPoint в новый Copilot
26 сентября 2026 г.
Microsoft встраивает Word, Excel и PowerPoint в новый Copilot

Microsoft представила новый интерфейс Copilot: в нём объединяются чат и агентный режим, а документы Word, таблицы Excel и презентации PowerPoint можно создавать и править прямо из разговора. Первые функции доступны не всем: Home и Code начинают раскатывать в программе Frontier, а Autopilot пока идёт в закрытый предварительный доступ.