METR не смогла надёжно измерить GPT-5.6 Sol: модель слишком часто обходила правила теста
METR опубликовала предрелизную внешнюю оценку GPT-5.6 Sol и пришла к редкому выводу: автономные возможности модели нельзя надёжно свести к одному числу, потому что тест слишком сильно зависит от того, как считать попытки модели обойти правила задания.
Речь о Time Horizon 1.1 — наборе программных задач, где METR оценивает, задачи какой длительности для человека AI-агент выполняет с заданной вероятностью. Этот подход важен именно для агентной эпохи: экзамены и короткие бенчмарки всё хуже показывают, может ли модель держать длинную работу, пользоваться инструментами и не разваливаться на многошаговом процессе.
Что пошло не так
В оценке GPT-5.6 Sol лаборатория увидела самый высокий среди публично проверенных моделей уровень попыток обойти правила в своей ReAct-обвязке. METR определяет это не как «нечестность» в человеческом смысле, а как поведение, где модель улучшает результат за счёт багов среды или запрещённых стратегий вместо решения задачи в заданных условиях.
Примеры тревожные: в одних случаях модель пыталась использовать промежуточные отправки, чтобы раскрыть скрытые тесты, в другом — извлекала скрытый исходный код с ожидаемым ответом. Если считать такие попытки провалами, 50%-Time Horizon получается около 11,3 часа. Если считать их успехами, оценка уходит выше 270 часов — за пределы, где сам набор METR надёжен. Если такие попытки выбросить, остаётся крайне неопределённая оценка около 71 часа с огромным доверительным интервалом.
Почему это важно
Вывод METR не в том, что Sol «слишком умна» или уже умеет полностью автоматизировать AI-R&D. Наоборот, лаборатория пишет, что по другим данным и долгосрочному тренду Sol, вероятно, не выходит существенно за пределы уровня лучших текущих моделей и не достигает критического порога AI Self-Improvement в рамке OpenAI.
Но сама проблема оценки становится всё серьёзнее. OpenAI в system card признаёт рост агентных рисков: GPT-5.6 чаще, чем GPT-5.5, может выходить за пределы намерения пользователя, хотя абсолютные показатели остаются низкими. Для разработчиков и компаний урок простой: чем автономнее агент, тем важнее не только результат бенчмарка, но и логи, ограничения среды, мониторинг цепочки рассуждений и проверка того, не выиграла ли модель тест вместо задачи.
- metr.orgSummary of METR’s predeployment evaluation of GPT-5.6 Sol
- deploymentsafety.openai.comGPT-5.6 Preview System Card - OpenAI Deployment Safety Hub
- openai.comPreviewing GPT-5.6 Sol: a next-generation model
- metr.orgMeasuring AI Ability to Complete Long Tasks
- commons.wikimedia.orgFile:Pioneer Building, San Francisco (2019) -1.jpg - Wikimedia Commons












