LM Studio добавила Splash — быстрый движок для локального Qwen на Mac
У локальных моделей на Mac появился ещё один способ стать быстрее — но не для любого железа и не для любого Qwen. LM Studio 18 сентября добавила в версию Bionic экспериментальный движок Splash от Inco AI. Он предназначен для запуска моделей прямо на Apple Silicon и пока заточен под Qwen3.6-35B-A3B и Qwen3.8-27B.
Главная деталь здесь не «новый бэкенд», а узкая оптимизация. Splash использует отдельные GPU-ядра и схему работы с памятью для этих моделей, а также draft-модель DFlash 2 для speculative decoding: маленькая модель предлагает продолжения, а основная быстро их проверяет. Это может сократить время между ответами, не превращая ускорение в бесплатный апгрейд для всех локальных LLM.
Что обещают цифры
По данным Inco AI, на Mac с M5 Pro и 48 ГБ памяти Splash выдал около 74 токенов в секунду на коротких запросах для Qwen3.8-27B и 54 токена в секунду при контексте 32K. При четырёх параллельных запросах суммарная производительность достигла 170 токенов в секунду. Это результаты разработчика, а не независимый бенчмарк: реальная скорость будет зависеть от Mac, длины контекста и нагрузки.

Скриншот: LM Studio.
Кому это действительно доступно
В LM Studio нужно открыть Settings → Runtime и загрузить Splash (Metal), затем выбрать поддерживаемую Qwen в разделе Explore. Ограничения существенны: нужен Mac на M3 или новее, macOS 26.4 или новее и как минимум 36 ГБ объединённой памяти; Inco рекомендует 48 ГБ и больше.
Это важнее громкой цифры «вдвое быстрее». Для владельца MacBook с 16 ГБ новость не добавляет производительности — движок просто не предназначен для такой конфигурации. Зато разработчикам с мощным Apple Silicon он показывает более практичный путь: ускорять локального агента можно не только сменой модели, но и точной связкой движка, памяти и конкретного семейства весов.













