DeepSeek ускоряет V4: китайская гонка ИИ теперь идет за миллисекунды
DeepSeek выпустила DSpark — фреймворк для ускорения ответов больших моделей через speculative decoding. Если коротко: маленький «черновой» модуль заранее предлагает несколько следующих токенов, а большая модель проверяет их пачкой. Правильные токены принимаются, неверный хвост отбрасывается, поэтому качество распределения не должно меняться, но пользователь видит ответ быстрее.
В новой работе DeepSeek и Пекинского университета заявлено, что DSpark уже проверяли не только в офлайн-бенчмарках на Qwen и Gemma, но и в живом serving-контуре DeepSeek-V4. По сравнению с производственным baseline MTP-1 компания указывает ускорение per-user generation на 60–85% для V4-Flash и 57–78% для V4-Pro при сопоставимой общей пропускной способности. South China Morning Post вынесла главный потребительский смысл в заголовок: быстрее ответы и ниже давление на чипы.
Почему это больше, чем инженерная оптимизация
Большая часть публичной AI-гонки всё ещё выглядит как соревнование «чья модель умнее». Но в реальных продуктах не менее важны задержка, цена и стабильность под нагрузкой. Агент, который пишет код, не делает один красивый ответ: он читает файлы, предлагает патч, ждёт тесты, исправляет ошибку и снова генерирует. Если каждый шаг становится быстрее, меняется весь рабочий цикл.
DSpark интересен тем, что DeepSeek атакует сразу две проблемы. Во-первых, черновой модуль генерирует блоки токенов полупараллельно, но добавляет лёгкую последовательную часть, чтобы конец блока не разваливался по качеству. Во-вторых, confidence-scheduled verification не заставляет систему проверять одинаково длинный хвост всегда: под высокой нагрузкой она экономит вычисления и проверяет то, что с большей вероятностью будет принято.
Китай делает ставку на дешёвый и быстрый ИИ
Новость хорошо ложится в более широкий тренд. Китайские игроки уже давят на рынок открытыми весами, длинным контекстом, низкой ценой API и быстрыми coding-моделями. Теперь отдельным фронтом становится инференс: не только обучить сильную модель, но и обслуживать её так, чтобы она была полезна в массовом продукте, а не только в демонстрации.
Есть и трезвая оговорка. Цифры DSpark пока в основном идут из самой работы DeepSeek; независимая проверка на чужой инфраструктуре будет важна. Но открытый репозиторий DeepSpec, DSpark-чекпойнты и поддержка Qwen/Gemma дают рынку материал для повторения и сравнения. Для разработчиков вывод простой: следующая конкуренция моделей всё чаще будет решаться не одной строкой в бенчмарке, а связкой интеллект + скорость + стоимость обслуживания.
- github.comGitHub - deepseek-ai/DeepSpec: DeepSpec: a full-stack codebase for training and evaluating speculative decoding algorithms
- github.comDeepSpec/DSpark_paper.pdf at main · deepseek-ai/DeepSpec
- huggingface.codeepseek-ai/DeepSeek-V4-Pro-DSpark · Hugging Face
- scmp.comFaster AI, lower costs: DSpark eases bottlenecks and chip strain, says DeepSeek
- techmeme.comDeepSeek details DSpark, a speculative decoding framework for its V4 models, saying it speeds up AI inference by up to 85% and was tested on Gemma and Qwen
- github.comGitHub - deepseek-ai/DeepSpec: DeepSpec: a full-stack codebase for training and evaluating speculative decoding algorithms












