Alibaba открыла Qwen3.8-Flash-Next — предвестник архитектуры Qwen4
Alibaba 26 августа открыла веса Qwen3.8-Flash-Next — новой мультимодальной модели семейства Qwen. Это не очередная уменьшенная версия: сама команда называет её ранним образцом архитектуры, которая ляжет в основу Qwen4. Модель уже доступна на Hugging Face и ModelScope, а облачная Qwen3.8-Flash построена на той же базе.
Большая модель с маленьким активным ядром
У Qwen3.8-Flash-Next 125 млрд основных параметров, 51 млрд параметров n-граммных встраиваний и ещё 4 млрд в модуле предсказания токенов. При обработке каждого токена активируются 6 млрд параметров. Это схема со смесью экспертов: модель велика по общей ёмкости, но не задействует весь объём в каждом шаге.
В Qwen говорят, что по сравнению с Qwen3.7-Plus новая архитектура снижает затраты на обучение примерно до одной девятой и при этом улучшает задачи программирования и офисной работы. Это собственные результаты Alibaba, поэтому воспринимать их как независимое сравнение пока рано.
Главное техническое изменение — гибрид Gated DeltaNet и Qwen Sparse Attention. Первый компонент сжимает историю, второй выбирает значимые фрагменты контекста небольшими блоками. Компания рассчитывает, что так длинный контекст будет дешевле для агентных задач, где модель многократно читает документы, код и результаты вызова инструментов.
Проверить до прихода Qwen4
Нативное окно контекста составляет 262 тысячи токенов; в инструкции по запуску указано расширение до миллиона. Модель умеет работать с текстом и изображениями, а Qwen приводит команды для Transformers, vLLM и SGLang. Это означает, что её можно испытать локально или развернуть как совместимый с OpenAI API сервис, хотя для серьёзной нагрузки всё равно понадобится подходящая инфраструктура.
В августе Neuro.ee уже писал об открытии Qwen3.8-27B и весов огромной Qwen3.8-2.4T. Flash-Next продолжает ту же линию, но добавляет другой аргумент: Alibaba открывает не только готовую модель, а архитектурный эксперимент до выпуска следующего семейства. Для разработчиков это редкая возможность заранее проверить, дают ли обещанная экономия и работа с длинным контекстом преимущество в реальных агентных сценариях.













