OpenAI забраковала бенчмарк для coding-агентов: треть задач может быть сломана
OpenAI заявила, что больше не рекомендует SWE-Bench Pro как надежный ориентир для оценки ИИ-моделей в программировании. После аудита компания оценила, что около 30% задач в публичном наборе могут быть сломаны: часть тестов слишком жестко требует конкретную реализацию, часть промптов недоописана, часть проверок пропускает неполные решения, а некоторые задания направляют модель не туда, куда потом ведут скрытые тесты.
Это важно потому, что SWE-Bench Pro как раз должен был заменить другой проблемный стандарт, SWE-bench Verified. Его продвигали как более реалистичную проверку длинных задач для coding-агентов: модель должна читать репозиторий, менять код и проходить тесты. На публичном наборе из 731 задачи, по данным OpenAI, результаты frontier-моделей за восемь месяцев выросли с 23,3% до 80,3%. Теперь сама измерительная линейка оказалась под вопросом.
Что именно нашли
OpenAI сначала прогнала задачи через pipeline анализа данных: он смотрел на попытки моделей, метаданные и следы падений. Затем подозрительные задания проверяли агентами-исследователями на базе Codex и отдельно отдавали пяти опытным инженерам. Автоматический путь отметил 200 сломанных задач, человеческая разметка — 249.
Главная претензия проста: в хорошей оценке провал должен показывать слабость модели, а успех — настоящее решение. Если тесты требуют неочевидную деталь реализации или промпт скрывает важное условие, бенчмарк начинает измерять не способность программировать, а способность угадать замысел автора теста.
Почему это касается не только лабораторий
Для компаний, которые выбирают coding-агентов, эта история снижает ценность голых leaderboard-цифр. Модель может выиграть таблицу и всё равно плохо работать в конкретном репозитории, если там другие правила, тесты, стиль кода и цена ошибки. Особенно опасны случаи, где бенчмарк пропускает неполное исправление: в продукте такой агент создаст ощущение успеха, а проблему оставит внутри системы.
Парадокс в том, что те же агенты, чьи способности пытаются измерить, уже помогают находить дефекты в самих бенчмарках. OpenAI прямо пишет, что более сильные модели позволяют глубже проверять промпты, тесты, патчи и edge cases. Значит, следующий этап гонки coding-агентов будет не только про «кто набрал больше», но и про качество самих экзаменов.
- openai.comSeparating signal from noise in coding evaluations
- techmeme.comOpenAI says it found widespread task issues in SWE-Bench Pro, estimates ~30% of tasks are broken, and retracts its earlier recommendation to adopt the benchmark
- scale.comSWE-Bench Pro: Raising the Bar for Agentic Coding
- commons.wikimedia.orgFile:Programmer writing code with Unit Tests.jpg - Wikimedia Commons













