Назад
27 мая 2026 г. в 21:30 AI Agents Benchmarks SRE Kubernetes IBM Artificial Analysis Artificial Analysis; IBM Research; arXiv; GitHub; Hugging Face

Новый тест IBM и Artificial Analysis показал пределы AI-агентов в SRE

Новый тест IBM и Artificial Analysis показал пределы AI-агентов в SRE

Новый тест IBM и Artificial Analysis показал пределы AI-агентов в SRE

Artificial Analysis и IBM Research запустили ITBench-AA — новый бенчмарк для проверки AI-агентов на корпоративных IT-задачах. Первый набор посвящён SRE: модели расследуют Kubernetes-инциденты по офлайн-снимкам с логами, метриками, трассами, событиями и топологией приложения, а затем должны назвать минимальный набор независимых Kubernetes-сущностей, которые вызвали сбой.

Результат неприятно трезвый для рынка агентных систем: лучший показатель на момент запуска — 46,7% у Claude Opus 4.7 в режиме Adaptive Reasoning Max Effort. GPT-5.5 xhigh идёт почти рядом с 45,8%, Qwen3.7 Max набирает 42,5%. Все передовые модели в этом тесте остались ниже 50%.

Как устроен тест

ITBench-AA основан на IBM ITBench — открытом фреймворке для IT-автоматизации. Artificial Analysis взяла SRE-часть и сделала собственную независимую реализацию: 59 задач реагирования на Kubernetes-инциденты, из них 40 из публичного релиза IBM и 19 закрытых задач, которыми поделилась команда ITBench. Каждая задача прогоняется по три раза.

Агент работает не в виде чат-бота с готовой подсказкой, а через открытый испытательный контур Stirrup: получает изолированную командную оболочку, видит смонтированный снимок инцидента и сам решает, какие команды запускать. В конце он записывает диагноз в JSON. В X-треде Artificial Analysis отдельно подчёркивается этот формат: в публичной SRE-задаче агент видит пользовательские сбои во frontend path и расследует их через shell, а не выбирает ответ из списка.

Метрика тоже жёсткая. Главный показатель — average precision at full recall. Если агент пропустил хотя бы одну настоящую причину, повтор получает 0. Если все причины найдены, считается точность: true positives / (true positives + false positives). Поэтому лишние догадки прямо наказываются.

Почему “почти нашёл” здесь недостаточно

Для обычного бенчмарка 46% можно было бы трактовать как половину пути. Для SRE это другой разговор. В реальном инциденте пропущенная причина означает, что система может упасть снова, а лишняя причина уводит команду в неправильный ремонт. ITBench-AA специально требует минимальный набор независимых Kubernetes-сущностей: deployments, pods, namespaces, network policies и другие объекты должны быть названы не россыпью подозрений, а как точный диагноз.

Это хорошо показывает слабое место нынешних агентов. Они уже умеют читать много разнородных сигналов, запускать команды и строить гипотезы. Но когда нужно остановиться, отфильтровать шум и не добавить лишнее, качество резко проседает. Artificial Analysis указывает и на операционную цену такого поведения: GPT-5.5 xhigh набирает 45,8% в среднем за 30,9 шага, а Gemini 3.1 Pro Preview тратит 82,9 шага и получает 30,3%. Больше расследования не равно лучше диагноз: лишние contributing entities сверх true root cause прямо уменьшают итоговый балл.

Открытые модели ближе, чем кажется

Отдельно интересен результат моделей с открытыми весами. GLM-5.1 Reasoning набирает 40,3%, DeepSeek V4 Pro Reasoning Max Effort — 38,3%, Gemma 4 31B Reasoning — 37,3%. Они не догоняют верхнюю тройку, но разрыв уже не выглядит пропастью, особенно с учётом прикладного характера задачи.

Стоимость усиливает этот вывод. По данным треда, Gemma 4 31B Reasoning даёт 37% примерно за $0,14 на задачу, GLM-5.1 Reasoning — 40% за $1,23, а Gemini 3.1 Pro Preview — 30% за $2,23. Gemini 3.5 Flash high стоит около $1,70 на задачу и примерно совпадает с ним по качеству. Для продакшен-SRE это важнее красивой позиции в таблице: цена долгого агентного копания быстро становится отдельным инженерным ограничением.

Для компаний это полезнее очередного абстрактного рейтинга рассуждений. ITBench-AA проверяет не “знает ли модель Kubernetes”, а может ли агент работать как младший SRE в ограниченной, но реалистичной среде: читать артефакты, выбирать команды, собирать причинную цепочку и не фантазировать сверх данных.

Вывод пока простой: AI-агенты уже подходят для помощи в сортировке инцидентов, первичном разборе и обучающих сценариях, но выпускать их в полностью автономное реагирование рано. Новый бенчмарк важен именно потому, что переводит разговор из демо в проверяемую инженерную плоскость: не “модель рассуждает”, а “модель нашла все причины и не придумала лишних”.

Ещё новости

Cloudflare выпустила Clef-omni: модель решений с аудио и видео
10 октября 2026 г.
Cloudflare выпустила Clef-omni: модель решений с аудио и видео

Cloudflare представила открытую модель решений Clef-omni: она принимает текст, изображения, аудио и видео в одном запросе. Для разработчиков это способ строить классификацию и маршрутизацию без отдельной цепочки распознавания речи и кадров.

Falcon ASR: открытая модель для арабской речи и пяти языков
10 октября 2026 г.
Falcon ASR: открытая модель для арабской речи и пяти языков

TII представил Falcon-ASR — открытую модель распознавания речи с акцентом на арабские диалекты. Она также распознаёт английский, французский, испанский и португальский без ручного выбора языка.

ИИ помогает 10 минут — а потом сложнее думать без него
10 октября 2026 г.
ИИ помогает 10 минут — а потом сложнее думать без него

Исследователи проверили, что происходит, когда доступ к ИИ внезапно исчезает во время сложной задачи. В трёх экспериментах участники с помощником быстрее решали первые задания, но затем чаще ошибались и бросали работу без него.

Anthropic запретила «жестокость» к Claude — но границы пока размыты
9 октября 2026 г.
Anthropic запретила «жестокость» к Claude — но границы пока размыты

Anthropic внесла в правила Claude запрет на «длительное и беспричинное» оскорбительное или жестокое поведение по отношению к своим моделям. Компания обещает применять пункт лишь в крайних случаях, но публичного критерия для этой границы пока нет.

GitHub Copilot CLI научился находить локальные модели Ollama
9 октября 2026 г.
GitHub Copilot CLI научился находить локальные модели Ollama

В Copilot CLI появилась команда, которая показывает совместимые модели из уже запущенного Ollama. Но локальная модель сама по себе не делает сессию офлайн и не отменяет телеметрию GitHub.

Google представила Gemini agent: рабочий ИИ с доступом к корпоративным системам
9 октября 2026 г.
Google представила Gemini agent: рабочий ИИ с доступом к корпоративным системам

Google Cloud представила Gemini agent — корпоративного агента, который получает контекст компании, выбирает модели и выполняет задачи через подключённые системы. Главное для команд — это не новый чат, а ещё одна точка, где придётся заранее определить права, бюджеты и проверку результата.

Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио
8 октября 2026 г.
Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио

Google DeepMind представила открытую 740-миллионную EmbeddingGemma 2: модель сопоставляет текст, изображения, кадры видео и аудио в одном векторном пространстве. Для разработчиков это путь к локальному поиску по медиатеке без обязательной отправки файлов в облако.

В Codex CLI появился вход в MCP-серверы из терминала
8 октября 2026 г.
В Codex CLI появился вход в MCP-серверы из терминала

В версии Codex CLI 0.161.0 OpenAI добавила команду для входа в MCP-серверы из активной терминальной сессии. Обновление также меняет стандартную модель в части каталогов и добавляет настройки голосового режима.

Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле
7 октября 2026 г.
Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле

Anthropic представила Claude Haiku 5.5 — малую модель для быстрых и недорогих задач: от классификации и суммаризации до субагентов и работы в браузере. Для запросов до 100 тысяч токенов вход и выход стали в десять раз дешевле, чем у Haiku 4.5.

Google запустил Playground: игры по текстовому запросу
7 октября 2026 г.
Google запустил Playground: игры по текстовому запросу

Google открыл экспериментальную платформу Playground: пользователь описывает игру текстом, тестирует её в браузере и делится ссылкой. На старте сервис доступен совершеннолетним пользователям из США, а возможности создания зависят от подписки Google One.

OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены
7 октября 2026 г.
OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены

OpenAI открыла каталог результатов внутренней модели: 722 рукописи в 372 связанных семействах. Компания подчёркивает, что материалы находятся на разных стадиях проверки, а часть результатов без формализации в Lean может содержать ошибки.

Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой
7 октября 2026 г.
Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой

Georgia Tech получила одобрение на новую онлайн-магистратуру по искусственному интеллекту. Старт намечен на 2027 год: программа обещает шесть направлений и обязательный проект с компанией или организацией, но детали приёма и стоимости пока не раскрыты.