SubQ обещает языковым моделям окно контекста на 12 млн токенов
SubQ обещает языковым моделям окно контекста на 12 млн токенов
Subquadratic представила SubQ — языковую модель, которая, по заявлению компании, построена на субквадратичной архитектуре внимания и рассчитана на работу с очень длинным окном контекста: до 12 млн токенов. Если упростить, речь о попытке дать модели возможность читать не отдельные фрагменты, а целые кодовые базы, большие архивы документов или длинную историю работы агента за один проход.
Это сильная стратегическая заявка на один из главных узких участков современных языковых моделей. Но её стоит читать аккуратно: Subquadratic говорит о закрытой бете, обещает технический отчёт позже и пока не дала рынку достаточно публичных независимых испытаний, чтобы называть SubQ доказанной революцией.
Что такое окно контекста и почему все упёрлись в токены
Окно контекста — это объём текста и данных, который языковая модель может «держать перед глазами» в одном запросе. Измеряется оно не словами, а токенами: условными кусочками текста, из которых модель собирает предложение. Один токен может быть словом, частью слова, числом или знаком препинания.
Для пользователя это звучит просто: чем больше окно, тем больше документов, кода или переписки можно загрузить модели сразу. Для разработчика всё сложнее. Даже если модель формально принимает миллион токенов, она не всегда одинаково хорошо находит нужные детали внутри такого объёма, а стоимость и задержка запроса быстро растут.
Причина — механизм внимания. В классическом трансформере модель сравнивает токены друг с другом, чтобы понять, какие части текста связаны. Это и позволяет ей уловить, что переменная в одном файле относится к функции в другом, а аргумент в начале документа важен для вывода в конце. Но плотное внимание сравнивает почти всё со всем.
Отсюда квадратичная сложность: если вход стал в два раза длиннее, работы становится примерно в четыре раза больше. При коротких запросах это терпимо. При миллионах токенов экономика начинает ломаться: дорого, медленно и трудно масштабировать.
Что SubQ обещает сделать иначе
Subquadratic утверждает, что SubQ использует sparse attention — разреженное внимание. Идея простая: вместо того чтобы сравнивать каждый токен с каждым, модель должна выбирать только те связи, которые действительно важны для текущего запроса. Поэтому архитектуру называют subquadratic: вычислительная нагрузка растёт медленнее, чем в классическом квадратичном сценарии.
По данным самой компании, SubQ 1M-Preview показывает конкурентные результаты на длинноконтекстных тестах, а исследовательская конфигурация работает до 12 млн токенов. На сайте Subquadratic заявлены скорость около 150 токенов в секунду, стоимость около одной пятой от других ведущих моделей и почти 1000-кратное сокращение вычислений внимания на 12 млн токенов по сравнению с плотным вниманием. SiliconANGLE отдельно пишет, что 12 млн токенов — это примерно 9 млн слов, то есть масштаб не «чуть длиннее документа», а ближе к сотне книг.
The New Stack добавляет важную деталь: Subquadratic называет свою архитектуру Subquadratic Selective Attention и говорит о линейном масштабировании по вычислениям и памяти относительно длины контекста. Издание также напоминает, что похожие попытки уже были: Longformer, Mamba, гибридные архитектуры, sparse attention у DeepSeek и другие подходы. Историческая проблема не в том, чтобы придумать экономное внимание, а в том, чтобы не потерять качество модели.
Почему это может изменить RAG и агентов
Сегодня длинные задачи часто решаются не за счёт огромного окна контекста, а через RAG — retrieval-augmented generation, то есть генерацию с поиском по внешней базе. Система сначала ищет релевантные куски в документах, потом отправляет модели только найденное. Это дешевле, чем загружать всё подряд, но создаёт отдельную хрупкость: если поиск не достал важный фрагмент, модель его просто не увидит.
Длинное и дешёвое окно контекста не убьёт RAG автоматически. Поиск всё равно нужен для свежих данных, прав доступа, фильтрации мусора и контроля источников. Но баланс может сдвинуться. Там, где сейчас строят сложные цепочки «найди — нарежь — переранжируй — подай модели», можно будет чаще давать модели гораздо более полный массив информации сразу.
Особенно это важно для long-context agents — агентов, которым нужно долго работать над задачей без постоянной потери памяти. Кодовый агент, например, должен видеть не только один файл, а архитектуру проекта, историю изменений, тесты, баг-репорты и промежуточные решения. Если контекстное окно реально становится на порядок больше и дешевле, такие агенты получают не магическую сознательность, а более практичную рабочую память.
Где здесь осторожность
У SubQ пока слишком много «если». Компания заявляет $29 млн seed-финансирования, команду с исследователями из крупных лабораторий и закрытый доступ к API, SubQ Code и SubQ Search. Это серьёзнее обычной демки на лендинге, но всё ещё не равно массово проверенному продукту.
Главные вопросы остаются открытыми. Насколько хорошо модель использует весь контекст не в синтетических тестах, а в реальных задачах компаний? Как она ведёт себя на противоречивых документах, старом коде, шумных логах и длинной переписке? Не съедает ли экономию другая часть системы — память, маршрутизация, инфраструктура, постобработка? И главное: смогут ли внешние исследователи воспроизвести ключевые результаты после публикации технического отчёта?
The New Stack справедливо напоминает про осторожный фон: рынок уже видел громкие заявления о гигантских окнах контекста, которые потом не становились широко доступной реальностью. Поэтому правильная позиция здесь не «всё изменилось», а «появилась интересная проверяемая гипотеза».
Что теперь стоит смотреть
Если Subquadratic подтвердит заявления, это будет важный сдвиг в инфраструктуре языковых моделей. Не потому, что RAG исчезнет или агенты внезапно станут безошибочными, а потому что у разработчиков появится другой компромисс: меньше ручной нарезки знания, больше прямой работы модели с полной картиной.
Для бизнеса это может означать более простые системы анализа больших архивов, репозиториев и внутренних баз знаний. Для разработчиков — новые архитектуры кодовых агентов. Для рынка моделей — давление на всех игроков, которые сегодня продают длинный контекст, но часто заставляют пользователей платить за него скоростью, ценой и нестабильным качеством извлечения.
💬 Мнение редакции Neuro.ee
SubQ интересен не как очередной рекорд «сколько текста влезает в prompt», а как удар по экономике внимания. Если субквадратичное внимание действительно сохранит качество на миллионах токенов, длинный контекст станет не маркетинговой цифрой, а рабочей инфраструктурой для агентов. Но до публикации отчёта и независимых тестов это именно сильная заявка, а не новая физика рынка, высеченная в камне.
- subq.aiSubquadratic — Efficiency is Intelligence
- subq.aiSubquadratic — Efficiency is Intelligence
- thenewstack.ioThe context window has been shattered: Subquadratic debuts a 12-million-token window
- siliconangle.comSubquadratic launches with $29M to bring 12M-token context windows to AI - SiliconANGLE
- bizneworleans.comCover image source: Justin Dangel - Biz New Orleans













