Патч llama.cpp уместил миллион токенов DeepSeek V4 Flash на RTX 5090
Патч llama.cpp уместил миллион токенов DeepSeek V4 Flash на RTX 5090
В сообществе LocalLLaMA появился показательный пример того, как локальный ИИ становится практичнее без новой громкой модели. Разработчик опубликовал ветку llama.cpp с CUDA-ядром для lightning indexer в DeepSeek V4 Flash. По его измерениям, патч позволяет запускать модель с контекстом до 1 млн токенов на RTX 5090 с 32 ГБ VRAM.
Проблема была не в «интеллекте» модели, а в памяти. В исходной схеме lightning indexer создавал промежуточный буфер размером примерно 67 ГБ при 256K контекста и теоретически около 256 ГБ при 1M. Для потребительской видеокарты это означает отказ или резкое снижение скорости. Новый fused CUDA kernel не материализует огромную матрицу целиком и снижает буфер до нескольких гигабайт.
Что показали тесты
В документации к ветке автор указывает железо: RTX 5090, Ryzen 9 9950X3D и 96 ГБ DDR5. На 256K контекста prefill вырос с 56 до примерно 204 токенов в секунду в сравнительном сценарии, а в длинном документе доходил до 263 токенов в секунду. На 1M контекста запуск потребовал около 31,2 ГБ VRAM и 72,6 ГБ RAM, prefill составил примерно 159 токенов в секунду, decode держался около 13,7 токена в секунду.
Это не магическая кнопка «запустить frontier-модель дома». Использовалась смешанная квантизация DeepSeek V4 Flash, часть MoE-экспертов выгружалась в оперативную память, а ветка пока не является обычным стабильным релизом llama.cpp. В документе отдельно сказано, что quantized KV cache в этой кодовой базе сейчас дает некорректный вывод без другого исправления.
Почему это важно шире одного патча
Для обычного пользователя главный вывод простой: локальные модели упираются не только в размер весов, но и в качество инференс-стека. Один удачный kernel может превратить «невозможно на этом железе» в «дорого, сложно, но работает». Это особенно важно для сценариев с большими документами, кодовыми базами, архивами переписки и локальными агентами, где длинный контекст часто важнее красивого бенчмарка.
История также показывает, как открытая экосистема конкурирует с облаком. Большие лаборатории выигрывают качеством моделей и удобством API, но llama.cpp, GGUF, квантизация и подобные патчи постепенно снижают цену независимого запуска. Для компаний и энтузиастов это означает больше контроля над данными и больше вариантов между «все отправить провайдеру» и «ждать ответа локальной модели вечность».
Пока это материал для тех, кто готов читать инструкции сборки и понимать ограничения. Но именно из таких инженерных улучшений складывается зрелость локального ИИ: меньше демонстраций ради шума, больше конкретных снятых ограничений.
- raw.githubusercontent.comDeepSeek V4 Flash: CUDA Lightning Indexer Kernel
- reddit.comReddit - Please wait for verification
- github.comGitHub - spencer-zaid/llama.cpp at deepseek-lid-cuda
- github.comNew GGML_OP_LIGHTNING_INDEXER that implements DeepSeek V3.2/V4 lightning indexer by fairydreaming · Pull Request #24231 · ggml-org/llama.cpp













