OpenAI проверит ИИ-агентов на сложной биологии: данных много, решений мало
OpenAI представила GeneBench-Pro — новый бенчмарк для проверки ИИ-агентов на задачах вычислительной биологии. Его смысл не в том, чтобы спросить модель факты о генах или заставить выполнить готовый скрипт. Агент получает реалистичный набор данных, короткий научный контекст и должен сам понять, какой анализ уместен, где данные шумят, когда исходный план надо менять и какой результат уже можно считать пригодным для решения.
Что проверяет GeneBench-Pro
В набор вошли 129 задач из 10 доменов: геномика, статистическая генетика, single-cell анализ, клиническая геномика, популяционная генетика и другие области. OpenAI называет ключевую проверяемую способность «исследовательским вкусом»: цепочку суждений, которая отделяет опытного специалиста от исполнителя инструкции.
Задачи построены синтетически. Это важно: авторы знают причинную структуру данных и могут проверять ответ детерминированно, а не по расплывчатой рубрике. При этом задачи стараются оставлять похожими на реальную работу: с неоднозначностью, диагностикой, промежуточными ошибками и необходимостью выбрать правильный маршрут.
Почему это важно
Биология быстро накапливает данные: секвенирование дешевеет, биобанки связывают молекулярную информацию, медицинские записи и фенотипы. Узким местом всё чаще становится не получение данных, а превращение их в проверяемые выводы. Именно здесь агентные модели могут быть полезны: не как «учёный в коробке», а как помощник, который перебирает анализы и ускоряет проверку гипотез.
OpenAI пишет, что GPT-5.6 Sol на максимальном уровне рассуждения решает 28,7% задач, а в Pro-режиме — 31,5%. Это сильный рост по сравнению с ранними результатами GPT-5 ниже 5%, но не повод объявлять победу. Даже лучший агент пока ошибается чаще, чем проходит тест.
Что открыли для проверки
OpenAI опубликовала 10 показательных задач на Hugging Face: там есть конфиги, данные, эталонные ответы, проверочный код и отчёты. Ещё 50 задач компания собирается передать Artificial Analysis для независимого бенчмаркинга.
Для читателя главный вывод простой: гонка ИИ в науке переходит от красивых демо к проверке рабочих решений. Если модели научатся надёжно закрывать такие задачи, они ускорят не публикации пресс-релизов, а скучную и дорогую часть науки: выбор анализа, отсев слабых гипотез и подготовку данных к решениям, от которых зависят лекарства, исследования и деньги.













