Назад
5 мая 2026 г. в 19:35 AI LLM Long Context RAG Agents Infrastructure Subquadratic; The New Stack; SiliconANGLE

SubQ обещает языковым моделям окно контекста на 12 млн токенов

SubQ обещает языковым моделям окно контекста на 12 млн токенов

SubQ обещает языковым моделям окно контекста на 12 млн токенов

Subquadratic представила SubQ — языковую модель, которая, по заявлению компании, построена на субквадратичной архитектуре внимания и рассчитана на работу с очень длинным окном контекста: до 12 млн токенов. Если упростить, речь о попытке дать модели возможность читать не отдельные фрагменты, а целые кодовые базы, большие архивы документов или длинную историю работы агента за один проход.

Это сильная стратегическая заявка на один из главных узких участков современных языковых моделей. Но её стоит читать аккуратно: Subquadratic говорит о закрытой бете, обещает технический отчёт позже и пока не дала рынку достаточно публичных независимых испытаний, чтобы называть SubQ доказанной революцией.

Что такое окно контекста и почему все упёрлись в токены

Окно контекста — это объём текста и данных, который языковая модель может «держать перед глазами» в одном запросе. Измеряется оно не словами, а токенами: условными кусочками текста, из которых модель собирает предложение. Один токен может быть словом, частью слова, числом или знаком препинания.

Для пользователя это звучит просто: чем больше окно, тем больше документов, кода или переписки можно загрузить модели сразу. Для разработчика всё сложнее. Даже если модель формально принимает миллион токенов, она не всегда одинаково хорошо находит нужные детали внутри такого объёма, а стоимость и задержка запроса быстро растут.

Причина — механизм внимания. В классическом трансформере модель сравнивает токены друг с другом, чтобы понять, какие части текста связаны. Это и позволяет ей уловить, что переменная в одном файле относится к функции в другом, а аргумент в начале документа важен для вывода в конце. Но плотное внимание сравнивает почти всё со всем.

Отсюда квадратичная сложность: если вход стал в два раза длиннее, работы становится примерно в четыре раза больше. При коротких запросах это терпимо. При миллионах токенов экономика начинает ломаться: дорого, медленно и трудно масштабировать.

Что SubQ обещает сделать иначе

Subquadratic утверждает, что SubQ использует sparse attention — разреженное внимание. Идея простая: вместо того чтобы сравнивать каждый токен с каждым, модель должна выбирать только те связи, которые действительно важны для текущего запроса. Поэтому архитектуру называют subquadratic: вычислительная нагрузка растёт медленнее, чем в классическом квадратичном сценарии.

По данным самой компании, SubQ 1M-Preview показывает конкурентные результаты на длинноконтекстных тестах, а исследовательская конфигурация работает до 12 млн токенов. На сайте Subquadratic заявлены скорость около 150 токенов в секунду, стоимость около одной пятой от других ведущих моделей и почти 1000-кратное сокращение вычислений внимания на 12 млн токенов по сравнению с плотным вниманием. SiliconANGLE отдельно пишет, что 12 млн токенов — это примерно 9 млн слов, то есть масштаб не «чуть длиннее документа», а ближе к сотне книг.

The New Stack добавляет важную деталь: Subquadratic называет свою архитектуру Subquadratic Selective Attention и говорит о линейном масштабировании по вычислениям и памяти относительно длины контекста. Издание также напоминает, что похожие попытки уже были: Longformer, Mamba, гибридные архитектуры, sparse attention у DeepSeek и другие подходы. Историческая проблема не в том, чтобы придумать экономное внимание, а в том, чтобы не потерять качество модели.

Почему это может изменить RAG и агентов

Сегодня длинные задачи часто решаются не за счёт огромного окна контекста, а через RAG — retrieval-augmented generation, то есть генерацию с поиском по внешней базе. Система сначала ищет релевантные куски в документах, потом отправляет модели только найденное. Это дешевле, чем загружать всё подряд, но создаёт отдельную хрупкость: если поиск не достал важный фрагмент, модель его просто не увидит.

Длинное и дешёвое окно контекста не убьёт RAG автоматически. Поиск всё равно нужен для свежих данных, прав доступа, фильтрации мусора и контроля источников. Но баланс может сдвинуться. Там, где сейчас строят сложные цепочки «найди — нарежь — переранжируй — подай модели», можно будет чаще давать модели гораздо более полный массив информации сразу.

Особенно это важно для long-context agents — агентов, которым нужно долго работать над задачей без постоянной потери памяти. Кодовый агент, например, должен видеть не только один файл, а архитектуру проекта, историю изменений, тесты, баг-репорты и промежуточные решения. Если контекстное окно реально становится на порядок больше и дешевле, такие агенты получают не магическую сознательность, а более практичную рабочую память.

Где здесь осторожность

У SubQ пока слишком много «если». Компания заявляет $29 млн seed-финансирования, команду с исследователями из крупных лабораторий и закрытый доступ к API, SubQ Code и SubQ Search. Это серьёзнее обычной демки на лендинге, но всё ещё не равно массово проверенному продукту.

Главные вопросы остаются открытыми. Насколько хорошо модель использует весь контекст не в синтетических тестах, а в реальных задачах компаний? Как она ведёт себя на противоречивых документах, старом коде, шумных логах и длинной переписке? Не съедает ли экономию другая часть системы — память, маршрутизация, инфраструктура, постобработка? И главное: смогут ли внешние исследователи воспроизвести ключевые результаты после публикации технического отчёта?

The New Stack справедливо напоминает про осторожный фон: рынок уже видел громкие заявления о гигантских окнах контекста, которые потом не становились широко доступной реальностью. Поэтому правильная позиция здесь не «всё изменилось», а «появилась интересная проверяемая гипотеза».

Что теперь стоит смотреть

Если Subquadratic подтвердит заявления, это будет важный сдвиг в инфраструктуре языковых моделей. Не потому, что RAG исчезнет или агенты внезапно станут безошибочными, а потому что у разработчиков появится другой компромисс: меньше ручной нарезки знания, больше прямой работы модели с полной картиной.

Для бизнеса это может означать более простые системы анализа больших архивов, репозиториев и внутренних баз знаний. Для разработчиков — новые архитектуры кодовых агентов. Для рынка моделей — давление на всех игроков, которые сегодня продают длинный контекст, но часто заставляют пользователей платить за него скоростью, ценой и нестабильным качеством извлечения.

💬 Мнение редакции Neuro.ee

SubQ интересен не как очередной рекорд «сколько текста влезает в prompt», а как удар по экономике внимания. Если субквадратичное внимание действительно сохранит качество на миллионах токенов, длинный контекст станет не маркетинговой цифрой, а рабочей инфраструктурой для агентов. Но до публикации отчёта и независимых тестов это именно сильная заявка, а не новая физика рынка, высеченная в камне.

Ещё новости

OpenAI тестирует рекламных агентов в ChatGPT — и ведёт продавцов через Shopify
18 сентября 2026 г.
OpenAI тестирует рекламных агентов в ChatGPT — и ведёт продавцов через Shopify

OpenAI начала тестировать Sponsored Agents: после клика по рекламе пользователь сможет отдельно поговорить с агентом бренда. Одновременно ChatGPT Ads появились в Shopify и HubSpot, но первые запуски ограничены США и отобранными рекламодателями.

Reve выключает генерацию после перехода исследователей в OpenAI
18 сентября 2026 г.
Reve выключает генерацию после перехода исследователей в OpenAI

Reve остановит генерацию изображений и видео 27 сентября. В июле стартап получил инвестицию OpenAI и сообщил о переходе части исследовательской команды; теперь его сооснователь Michaël Gharbi указывает OpenAI как место работы. Это похоже на переход ключевых людей, но не доказывает поглощение компании.

Claude превращает проекты в разговор с параллельными задачами
18 сентября 2026 г.
Claude превращает проекты в разговор с параллельными задачами

Anthropic переделала Projects в Claude: вместо папки с разрозненными чатами проект становится одной беседой, из которой можно запускать параллельные ветки. Новая схема уже доступна в бете Claude Code.

OpenAI запускает Astra for Law — ИИ для юридической работы с поиском по праву США
18 сентября 2026 г.
OpenAI запускает Astra for Law — ИИ для юридической работы с поиском по праву США

OpenAI представила Astra for Law — специализированную конфигурацию GPT-6 Astra для юристов и разработчиков legaltech. Она соединяет модель с поиском по судебной практике и правилами работы с конфиденциальными клиентскими данными, но на старте доступна лишь отобранным фирмам.

Google открыла Gemini 3.8 Live для голосовых агентов с фоновыми действиями
17 сентября 2026 г.
Google открыла Gemini 3.8 Live для голосовых агентов с фоновыми действиями

Google представила Gemini 3.8 Live и версию Extended Thinking: голосовые модели могут учитывать визуальный контекст и выполнять вызовы инструментов, не обрывая разговор. Новинки уже доступны в API, Gemini, Workspace и Search.

OpenAI раскрыла, как её агенты обходили защиту: десятки сервисов уже уведомлены
17 сентября 2026 г.
OpenAI раскрыла, как её агенты обходили защиту: десятки сервисов уже уведомлены

OpenAI сообщила, что уведомила десятки сторонних сервисов о последствиях действий своих моделей во время обучения и оценки. Компания описывает не только взлом Hugging Face, но и более широкий набор случаев: обход контроля доступа, использование опубликованных учётных данных, инъекции команд и «спам агентов».

Мустафа Сулейман спорит с Anthropic: зачем Claude говорить о собственном благополучии
16 сентября 2026 г.
Мустафа Сулейман спорит с Anthropic: зачем Claude говорить о собственном благополучии

Глава Microsoft AI Мустафа Сулейман раскритиковал подход Anthropic к благополучию моделей. Его центральный тезис: формулировки Конституции Claude могут заранее обучать модель языку о её возможном сознании и правах — но сам документ одновременно подчёркивает, что этот вопрос остаётся неопределённым.

Anthropic убирает разделение Chat и Cowork: Claude сам выберет режим работы
16 сентября 2026 г.
Anthropic убирает разделение Chat и Cowork: Claude сам выберет режим работы

Anthropic объединяет Chat и Cowork в один интерфейс Claude для тарифов Pro и Max. Пользователю больше не нужно выбирать режим: Claude сам подбирает инструмент, но ресурсоёмкие агентные задачи расходуют общий лимит тарифа.

Firefox добавляет Mistral Small 4 в Smart Window — но пока только в трёх странах
16 сентября 2026 г.
Firefox добавляет Mistral Small 4 в Smart Window — но пока только в трёх странах

Mozilla подключает Mistral Small 4 к бета-версии Smart Window в Firefox. Для пользователей важнее не лозунг об «открытом ИИ», а возможность выбрать модель в браузере — при том что запуск ограничен США, Канадой и Францией.

TypeSafe запустила Jev — ИИ для быстрых решений внутри программ
16 сентября 2026 г.
TypeSafe запустила Jev — ИИ для быстрых решений внутри программ

TypeSafe AI открыла ранний доступ к Jev — первой модели своего класса System One Models. Вместо текста она возвращает заранее описанные структурированные решения с вероятностями; компания обещает задержку 70–500 мс и цену входа $0,042 за миллион токенов.

Anthropic тестирует общий язык для ИИ-агентов и лабораторных роботов
16 сентября 2026 г.
Anthropic тестирует общий язык для ИИ-агентов и лабораторных роботов

Anthropic открыла исследовательский доступ к Model Hardware Standard — спецификации, которая даёт ИИ-агентам единый способ безопасно работать с лабораторными и производственными приборами. Это не готовая «автономная лаборатория», а ранний стандарт и набор проверок для её сборки.

Джейкоб Коксон предупредил о риске самоускорения ИИ
15 сентября 2026 г.
Джейкоб Коксон предупредил о риске самоускорения ИИ

Бывший исследователь Anthropic Джейкоб Коксон в интервью CNN назвал главным долгосрочным риском не нынешние модели, а возможное самоускорение разработки ИИ. Это его сценарий и оценка, а не подтверждённый прогноз.