Назад
5 июля 2026 г. в 12:00 OpenAI AI for Science Biology Benchmarks Agents OpenAI / Hugging Face

OpenAI проверит ИИ-агентов на сложной биологии: данных много, решений мало

OpenAI проверит ИИ-агентов на сложной биологии: данных много, решений мало

OpenAI представила GeneBench-Pro — новый бенчмарк для проверки ИИ-агентов на задачах вычислительной биологии. Его смысл не в том, чтобы спросить модель факты о генах или заставить выполнить готовый скрипт. Агент получает реалистичный набор данных, короткий научный контекст и должен сам понять, какой анализ уместен, где данные шумят, когда исходный план надо менять и какой результат уже можно считать пригодным для решения.

Что проверяет GeneBench-Pro

В набор вошли 129 задач из 10 доменов: геномика, статистическая генетика, single-cell анализ, клиническая геномика, популяционная генетика и другие области. OpenAI называет ключевую проверяемую способность «исследовательским вкусом»: цепочку суждений, которая отделяет опытного специалиста от исполнителя инструкции.

Задачи построены синтетически. Это важно: авторы знают причинную структуру данных и могут проверять ответ детерминированно, а не по расплывчатой рубрике. При этом задачи стараются оставлять похожими на реальную работу: с неоднозначностью, диагностикой, промежуточными ошибками и необходимостью выбрать правильный маршрут.

Почему это важно

Биология быстро накапливает данные: секвенирование дешевеет, биобанки связывают молекулярную информацию, медицинские записи и фенотипы. Узким местом всё чаще становится не получение данных, а превращение их в проверяемые выводы. Именно здесь агентные модели могут быть полезны: не как «учёный в коробке», а как помощник, который перебирает анализы и ускоряет проверку гипотез.

OpenAI пишет, что GPT-5.6 Sol на максимальном уровне рассуждения решает 28,7% задач, а в Pro-режиме — 31,5%. Это сильный рост по сравнению с ранними результатами GPT-5 ниже 5%, но не повод объявлять победу. Даже лучший агент пока ошибается чаще, чем проходит тест.

Что открыли для проверки

OpenAI опубликовала 10 показательных задач на Hugging Face: там есть конфиги, данные, эталонные ответы, проверочный код и отчёты. Ещё 50 задач компания собирается передать Artificial Analysis для независимого бенчмаркинга.

Для читателя главный вывод простой: гонка ИИ в науке переходит от красивых демо к проверке рабочих решений. Если модели научатся надёжно закрывать такие задачи, они ускорят не публикации пресс-релизов, а скучную и дорогую часть науки: выбор анализа, отсев слабых гипотез и подготовку данных к решениям, от которых зависят лекарства, исследования и деньги.

Ещё новости

GitHub Copilot получил доступ к настольным приложениям
4 октября 2026 г.
GitHub Copilot получил доступ к настольным приложениям

GitHub открыл preview режима Computer Use для Copilot CLI и приложения Copilot на macOS и Windows. Агент может работать с графическим интерфейсом, но перед управлением программой обязан запросить подтверждение.

За ИИ платят лишь 2,2% домохозяйств США — но чек растёт
3 октября 2026 г.
За ИИ платят лишь 2,2% домохозяйств США — но чек растёт

В отчёте a16z State of Markets II доля американских домохозяйств с платной AI-подпиской достигла 2,2% к весне 2026 года. Это не оценка всего рынка ИИ и не число пользователей: график фиксирует только оплачиваемые подписки домохозяйств, зато показывает одновременно рост проникновения и среднего ежемесячного чека.

NVIDIA выпустит DGX Spark с 64 ГБ памяти за $4 999
3 октября 2026 г.
NVIDIA выпустит DGX Spark с 64 ГБ памяти за $4 999

NVIDIA добавляет более доступную версию DGX Spark с 64 ГБ объединённой памяти. Один компьютер рассчитан на локальные модели до 100 млрд параметров, а пара устройств может объединять память до 128 ГБ.

Meta открыла SDK для устройств Muse: агент можно подключить к ESP32 и Raspberry Pi
3 октября 2026 г.
Meta открыла SDK для устройств Muse: агент можно подключить к ESP32 и Raspberry Pi

Meta опубликовала открытые SDK и прошивки для самодельных устройств, подключаемых к персональному агенту Muse. Практический смысл — вывести агента из приложения на кнопки, дисплеи, датчики и домашние сценарии, но для сопряжения всё равно нужен токен и режим разработчика.

ИИ помог прочитать шифр Наполеоновской войны, молчавший 217 лет
2 октября 2026 г.
ИИ помог прочитать шифр Наполеоновской войны, молчавший 217 лет

ИИ-инженер Картер Чёрч с помощью GPT-6 Astra расшифровал письмо для генерала Огюста де Мармона, известное лишь по скану 1969 года. Важен не только результат, но и рабочий процесс: модель одновременно читала рукописные знаки, строила ключ гомофонического шифра и проверяла гипотезы по исходному изображению.

Microsoft выпустила расшифровку, которая начинает работать до конца фразы
2 октября 2026 г.
Microsoft выпустила расшифровку, которая начинает работать до конца фразы

Microsoft AI представила потоковую модель MAI-Transcribe-2-Streaming и две голосовые модели. Главная ставка — голосовые агенты, которые могут начать обработку запроса ещё во время речи.

Калифорния запретила увольнять людей по решению одного ИИ
2 октября 2026 г.
Калифорния запретила увольнять людей по решению одного ИИ

Губернатор Калифорнии Гэвин Ньюсом подписал пакет законов о применении ИИ на работе. Работодатель больше не может опираться только на автоматизированную систему при дисциплинарном взыскании или увольнении.

Google вывел на орбиту спутник для проверки ИИ-инфраструктуры в космосе
2 октября 2026 г.
Google вывел на орбиту спутник для проверки ИИ-инфраструктуры в космосе

Google подтвердил работу первого спутника Project Suncatcher. Эксперимент должен показать, выдержат ли TPU физические условия космоса — это ранняя проверка идеи орбитальной инфраструктуры для машинного обучения.

OpenClaw представил Enterprise для пилотов корпоративных ИИ-агентов
1 октября 2026 г.
OpenClaw представил Enterprise для пилотов корпоративных ИИ-агентов

OpenClaw открыл разработку Enterprise — платформы управления постоянными ИИ-агентами в корпоративной инфраструктуре. Проект пока предназначен для внутренних пилотов, но уже заявляет изоляцию задач, аудит и гибкую замену компонентов агента.

HydraFusion появился в VS Code и приложении GitHub Copilot
1 октября 2026 г.
HydraFusion появился в VS Code и приложении GitHub Copilot

GitHub расширил исследовательский предварительный доступ к HydraFusion: режим выбора нескольких моделей теперь доступен не только в Copilot CLI. Для команд это означает больше контроля над сложными задачами, но пока с условиями предварительного доступа.

IBM Bob разрешили запускать внутри закрытой инфраструктуры
1 октября 2026 г.
IBM Bob разрешили запускать внутри закрытой инфраструктуры

IBM добавила для своего агентного инструмента разработки Bob self-hosted-развёртывание. Компания позиционирует его для команд, которым нельзя отправлять код и контекст приложений во внешний облачный сервис.

Google показала Gemini 4 Argon, но пока не отдаёт её разработчикам
1 октября 2026 г.
Google показала Gemini 4 Argon, но пока не отдаёт её разработчикам

Google представила Gemini 4 Argon — новую флагманскую модель для программирования, корпоративных задач и киберзащиты. Но первый доступ получили только доверенные защитники в программе Fairwind: публичный API и приложение Gemini пока не открыты.