Назад
3 июля 2026 г. в 15:00 AI Open Source Local LLM DeepSeek llama.cpp Inference GitHub; Reddit r/LocalLLaMA

Патч llama.cpp уместил миллион токенов DeepSeek V4 Flash на RTX 5090

Патч llama.cpp уместил миллион токенов DeepSeek V4 Flash на RTX 5090

Патч llama.cpp уместил миллион токенов DeepSeek V4 Flash на RTX 5090

В сообществе LocalLLaMA появился показательный пример того, как локальный ИИ становится практичнее без новой громкой модели. Разработчик опубликовал ветку llama.cpp с CUDA-ядром для lightning indexer в DeepSeek V4 Flash. По его измерениям, патч позволяет запускать модель с контекстом до 1 млн токенов на RTX 5090 с 32 ГБ VRAM.

Проблема была не в «интеллекте» модели, а в памяти. В исходной схеме lightning indexer создавал промежуточный буфер размером примерно 67 ГБ при 256K контекста и теоретически около 256 ГБ при 1M. Для потребительской видеокарты это означает отказ или резкое снижение скорости. Новый fused CUDA kernel не материализует огромную матрицу целиком и снижает буфер до нескольких гигабайт.

Что показали тесты

В документации к ветке автор указывает железо: RTX 5090, Ryzen 9 9950X3D и 96 ГБ DDR5. На 256K контекста prefill вырос с 56 до примерно 204 токенов в секунду в сравнительном сценарии, а в длинном документе доходил до 263 токенов в секунду. На 1M контекста запуск потребовал около 31,2 ГБ VRAM и 72,6 ГБ RAM, prefill составил примерно 159 токенов в секунду, decode держался около 13,7 токена в секунду.

Это не магическая кнопка «запустить frontier-модель дома». Использовалась смешанная квантизация DeepSeek V4 Flash, часть MoE-экспертов выгружалась в оперативную память, а ветка пока не является обычным стабильным релизом llama.cpp. В документе отдельно сказано, что quantized KV cache в этой кодовой базе сейчас дает некорректный вывод без другого исправления.

Почему это важно шире одного патча

Для обычного пользователя главный вывод простой: локальные модели упираются не только в размер весов, но и в качество инференс-стека. Один удачный kernel может превратить «невозможно на этом железе» в «дорого, сложно, но работает». Это особенно важно для сценариев с большими документами, кодовыми базами, архивами переписки и локальными агентами, где длинный контекст часто важнее красивого бенчмарка.

История также показывает, как открытая экосистема конкурирует с облаком. Большие лаборатории выигрывают качеством моделей и удобством API, но llama.cpp, GGUF, квантизация и подобные патчи постепенно снижают цену независимого запуска. Для компаний и энтузиастов это означает больше контроля над данными и больше вариантов между «все отправить провайдеру» и «ждать ответа локальной модели вечность».

Пока это материал для тех, кто готов читать инструкции сборки и понимать ограничения. Но именно из таких инженерных улучшений складывается зрелость локального ИИ: меньше демонстраций ради шума, больше конкретных снятых ограничений.

Ещё новости

OpenClaw представил Enterprise для пилотов корпоративных ИИ-агентов
1 октября 2026 г.
OpenClaw представил Enterprise для пилотов корпоративных ИИ-агентов

OpenClaw открыл разработку Enterprise — платформы управления постоянными ИИ-агентами в корпоративной инфраструктуре. Проект пока предназначен для внутренних пилотов, но уже заявляет изоляцию задач, аудит и гибкую замену компонентов агента.

HydraFusion появился в VS Code и приложении GitHub Copilot
1 октября 2026 г.
HydraFusion появился в VS Code и приложении GitHub Copilot

GitHub расширил исследовательский предварительный доступ к HydraFusion: режим выбора нескольких моделей теперь доступен не только в Copilot CLI. Для команд это означает больше контроля над сложными задачами, но пока с условиями предварительного доступа.

IBM Bob разрешили запускать внутри закрытой инфраструктуры
1 октября 2026 г.
IBM Bob разрешили запускать внутри закрытой инфраструктуры

IBM добавила для своего агентного инструмента разработки Bob self-hosted-развёртывание. Компания позиционирует его для команд, которым нельзя отправлять код и контекст приложений во внешний облачный сервис.

Google показала Gemini 4 Argon, но пока не отдаёт её разработчикам
1 октября 2026 г.
Google показала Gemini 4 Argon, но пока не отдаёт её разработчикам

Google представила Gemini 4 Argon — новую флагманскую модель для программирования, корпоративных задач и киберзащиты. Но первый доступ получили только доверенные защитники в программе Fairwind: публичный API и приложение Gemini пока не открыты.

Airbnb добавляет ИИ-поиск: голосом, своими словами и с сравнением жилья
30 сентября 2026 г.
Airbnb добавляет ИИ-поиск: голосом, своими словами и с сравнением жилья

Airbnb запустила в США ИИ-инструменты для планирования поездки: поиск и фильтры обычным языком, краткие описания объявлений и сравнение сохранённых вариантов. Для европейских пользователей важная оговорка: в анонсе эти функции не обещаны, зато доставка еды и продуктов расширяется в Европе лишь в отдельных городах.

OpenAI Dots: агент в ChatGPT, которому дают работать между сообщениями
30 сентября 2026 г.
OpenAI Dots: агент в ChatGPT, которому дают работать между сообщениями

OpenAI представила Dots — платный агентный продукт внутри ChatGPT. Его идея не в одиночном ответе, а в непрерывной рабочей переписке, где задача может продолжаться в фоне.

OpenAI превращает ChatGPT в рабочую платформу для людей и агентов
29 сентября 2026 г.
OpenAI превращает ChatGPT в рабочую платформу для людей и агентов

На DevDay 2026 OpenAI описала ChatGPT как общую рабочую поверхность для людей, агентов и нативных приложений разработчиков. В самом recap нет условий доступа к отдельным продуктам, поэтому их нельзя считать доступными всем пользователям.

Grok 4.7 появилась в Amazon Bedrock: для Европы — только глобальный маршрут
29 сентября 2026 г.
Grok 4.7 появилась в Amazon Bedrock: для Европы — только глобальный маршрут

Amazon Bedrock добавил Grok 4.7 от xAI. Для европейских клиентов модель доступна лишь через глобальный межрегиональный профиль: это даёт доступ к 500-тысячному контексту, но не позволяет закрепить обработку в одной европейской зоне.

Anthropic выпустила Claude Sonnet 5.5 с киберзащитой уровня Opus
29 сентября 2026 г.
Anthropic выпустила Claude Sonnet 5.5 с киберзащитой уровня Opus

Anthropic представила Claude Sonnet 5.5 — более быструю и экономичную модель для повседневных агентных задач, кодинга и работы с документами. Компания заявляет заметный прирост на тестах, но оставляет Opus 5.5 выбором для сложной открытой работы.

Anthropic идёт к IPO с убытком $42 млрд и планом потратить $518 млрд на ИИ
29 сентября 2026 г.
Anthropic идёт к IPO с убытком $42 млрд и планом потратить $518 млрд на ИИ

Reuters ознакомилось с конфиденциальным проспектом Anthropic перед IPO: при выручке $4,6 млрд за 2025 год компания показала чистый убыток $42 млрд и описала план расходов на вычисления и инфраструктуру в $518 млрд на 2027 год. Большая часть убытка — бухгалтерская переоценка инструментов, связанных с будущими акциями; откуда возьмутся деньги на заявленный план, в материале не раскрывается.

Manus даёт личному ИИ-агенту почту, телефон и кошелёк
29 сентября 2026 г.
Manus даёт личному ИИ-агенту почту, телефон и кошелёк

Manus представила Manus 2.0 и приложение Cue, где персональному агенту обещают собственные email, телефон, кошелёк и компьютер. Для бизнеса это переносит главный вопрос от качества ответов к управлению учётными записями, деньгами и журналом действий.

NVIDIA открыла платформу безопасности для ИИ-агентов
28 сентября 2026 г.
NVIDIA открыла платформу безопасности для ИИ-агентов

NVIDIA представила Open Agent Safety Platform — набор открытых компонентов и эталонную архитектуру для контроля действий ИИ-агентов. Ключевая идея: критические ограничения должны проверяться вне самой модели.