Назад
22 мая 2026 г. в 05:45 AI OpenAI Codex Agents AI Coding OpenAI Developers; cover: OpenAI Developers

Codex учится держать цель для работы на несколько часов

Codex учится держать цель для работы на несколько часов

OpenAI продвигает для Codex сценарий Follow a goal — режим автономной работы, где агенту задают не следующую маленькую команду, а цель на несколько часов. В документации компания описывает /goal: команда удерживает Codex на одном направлении, пока задача не завершена, заблокирована или остановлена человеком.

Это важный сдвиг в том, как OpenAI упаковывает Codex для программистов. Раньше типичный агентный процесс часто выглядел как длинная переписка: «прочитай файлы», «теперь поправь тесты», «теперь запусти сборку», «теперь проверь ещё раз». /goal пытается превратить эту цепочку в один контракт: вот план, вот этапы, вот проверки, вот когда нужно остановиться.

Что изменилось

Главная идея Follow a goal — устойчивая цель. Она переживает один ответ и не теряется после первой промежуточной правки. Codex должен помнить, к какому результату идёт, какие файлы и документы важны, какие ограничения нельзя нарушать и какое условие считается финальным.

OpenAI связывает /goal с задачами, где есть понятный критерий успеха и цикл проверки. Агенту мало сказать «улучши проект». Ему нужно объяснить, чем закончится работа: тесты проходят, старый импорт исчез, новая интеграция подключена, прототип запускается, отчёт содержит риски.

Здесь легко забыть ключевую вещь: план должен быть исполняемым. Если PLAN.md — это просто список пожеланий, многочасовая автономность быстро превращается в догадки по чату. Хороший план раскладывает работу на этапы, задаёт проверки для каждого этапа и отдельно описывает визуальную валидацию, если результат виден в интерфейсе.

Почему это важно

Для разработчиков ценность здесь в снижении ручного микроменеджмента. Если задача занимает несколько часов, человек теряет время не только на код, но и на постоянное возвращение к агенту: напомнить контекст, уточнить следующий шаг, попросить заново запустить тесты, остановить расползающийся рефакторинг.

/goal переносит часть этой дисциплины в стартовую постановку. Codex может двигаться чекпоинтами: сначала инвентаризация, затем изменение кода, затем тесты, затем чистка, затем финальный отчёт. Человек при этом остаётся владельцем решения: он задаёт контракт в файлах и может вмешаться, если агент уходит не туда.

Это заметно на задачах, где промежуточный шум не так важен, как доказуемый финал. «Реализуй PLAN.md, создай тесты для каждого этапа и проверь экран через Playwright interactive» лучше подходит для /goal, чем «посмотри, что можно улучшить». Во втором случае Codex будет угадывать критерий успеха.

Как пользоваться /goal

Практически лучший сценарий выглядит как /goal Implement PLAN.md. Сначала человек кладёт в репозиторий PLAN.md: какой результат нужен, какие этапы пройти, какие тесты написать на каждом этапе, какие проверки запускать, где нужны reference screens и что считать готовым состоянием.

После этого /goal не должен заменять план. Он должен заставить Codex держать этот контракт несколько часов: читать файлы, делать изменения, создавать тесты под каждый этап, запускать проверки и возвращаться к цели после промежуточных ошибок.

Пример постановки:

/goal Implement PLAN.md, creating tests for each milestone and verifying the output with playwright interactive.
Use the reference screens in docs/reference-screens/ where relevant.
Before coding, read PLAN.md, docs/new-client.md, src/settings/* and existing settings tests.
Do not change auth or global design outside the plan.
For each milestone, add or update tests first, then implement the code, then run npm test -- settings and npm run typecheck.
For UI milestones, open the result with Playwright interactive and compare it with the reference screens.
Stop when every milestone in PLAN.md is complete, tests and typecheck pass, Playwright verification is done,
and the final report lists changed files, checks run and remaining risks.

В этом примере важны не длинные формулировки, а проверяемость. «Код стал лучше» не является условием остановки. «Сборка проходит, тесты зелёные, старый API больше не встречается в нужной папке» — является.

OpenAI также описывает простые команды управления. /goal без аргументов показывает текущий статус. /goal pause временно останавливает работу, если нужно проверить изменения или дождаться внешнего решения. /goal resume продолжает тот же забег. /goal clear очищает цель, когда задача завершена, заблокирована или больше не актуальна.

Где режим сработает лучше всего

Лучшие кандидаты для /goal — задачи больше одного промпта, но меньше бесконечного бэклога, особенно если их можно описать в PLAN.md с этапами и проверками. Например: миграция одного модуля, устранение класса тестовых падений, сборка прототипа с понятным демо, оптимизация промпта по конкретному набору eval-кейсов.

Плохие кандидаты — размытые поручения и списки несвязанных задач. «Приведи приложение в порядок» лучше сначала превратить в конкретную цель. «Сделай десять разных улучшений» лучше разбить на несколько отдельных забегов. Иначе агент будет держать не цель, а мешок пожеланий.

Смысл обновления не в том, что Codex теперь можно отпускать без присмотра на весь день. OpenAI делает ставку на режим, где человек формулирует проверяемый результат, а Codex несколько часов держит курс к нему: не «сделай что-нибудь полезное», а «дойди до этого состояния и докажи, что дошёл».

Ещё новости

GitHub открыла API для запуска проверок кода Copilot
5 октября 2026 г.
GitHub открыла API для запуска проверок кода Copilot

GitHub разрешила запускать проверку pull request’ов Copilot через REST и GraphQL API. Одновременно для новых и уже существующих репозиториев стандартным уровнем тщательности стал Balanced.

AWS показала Well-Architected Agent: ИИ-ревизор для облака, но с правами и проверкой человеком
5 октября 2026 г.
AWS показала Well-Architected Agent: ИИ-ревизор для облака, но с правами и проверкой человеком

AWS открыла предварительный доступ к Well-Architected Agent — сервису, который анализирует инфраструктуру и предлагает исправления для стоимости, производительности, устойчивости и безопасности. Рекомендации могут включать изменения IaC, но AWS отдельно предупреждает: генеративный ИИ способен ошибаться.

Google урезает доступ к Gemini: бесплатным оставят Flash-Lite
4 октября 2026 г.
Google урезает доступ к Gemini: бесплатным оставят Flash-Lite

Google меняет набор моделей Gemini для бесплатных пользователей и подписки AI Plus. С 9 октября доступ к Pro исчезнет у обоих уровней, а платный AI Pro получит Deep Think.

Руководитель по безопасности OpenAI ушёл, назвав культуру компании сломанной
4 октября 2026 г.
Руководитель по безопасности OpenAI ушёл, назвав культуру компании сломанной

Дэвид Робинсон, руководивший подготовкой отчётов по безопасности к релизам OpenAI, покинул компанию. В эссе он заявил, что темп запусков не оставляет ей достаточной осторожности; OpenAI ответила, что продолжает усиливать практики безопасности и при необходимости замедляет обучение или выпуск моделей.

PFNYC: в Нью-Йорке сжимаются стартовые вакансии в профессиях, уязвимых для ИИ
4 октября 2026 г.
PFNYC: в Нью-Йорке сжимаются стартовые вакансии в профессиях, уязвимых для ИИ

В Нью-Йорке с 2022 года заметно сократилось число стартовых вакансий в нескольких офисных профессиях с высокой подверженностью ИИ, сообщает Partnership for New York City. Данные PFNYC и отдельная работа Stanford фиксируют совпадающие ранние паттерны, но не доказывают, что их причиной стал именно ИИ.

Фишинг под видом обсуждения ИИ-политики: как TA419 охотилась за доступом к Microsoft 365
4 октября 2026 г.
Фишинг под видом обсуждения ИИ-политики: как TA419 охотилась за доступом к Microsoft 365

Proofpoint описала кампанию TA419 против экспертов по ИИ-политике: злоумышленники начинали с правдоподобного письма, а после ответа вели жертву на поддельную страницу входа Microsoft.

GitHub Copilot получил доступ к настольным приложениям
4 октября 2026 г.
GitHub Copilot получил доступ к настольным приложениям

GitHub открыл preview режима Computer Use для Copilot CLI и приложения Copilot на macOS и Windows. Агент может работать с графическим интерфейсом, но перед управлением программой обязан запросить подтверждение.

За ИИ платят лишь 2,2% домохозяйств США — но чек растёт
3 октября 2026 г.
За ИИ платят лишь 2,2% домохозяйств США — но чек растёт

В отчёте a16z State of Markets II доля американских домохозяйств с платной AI-подпиской достигла 2,2% к весне 2026 года. Это не оценка всего рынка ИИ и не число пользователей: график фиксирует только оплачиваемые подписки домохозяйств, зато показывает одновременно рост проникновения и среднего ежемесячного чека.

NVIDIA выпустит DGX Spark с 64 ГБ памяти за $4 999
3 октября 2026 г.
NVIDIA выпустит DGX Spark с 64 ГБ памяти за $4 999

NVIDIA добавляет более доступную версию DGX Spark с 64 ГБ объединённой памяти. Один компьютер рассчитан на локальные модели до 100 млрд параметров, а пара устройств может объединять память до 128 ГБ.

Meta открыла SDK для устройств Muse: агент можно подключить к ESP32 и Raspberry Pi
3 октября 2026 г.
Meta открыла SDK для устройств Muse: агент можно подключить к ESP32 и Raspberry Pi

Meta опубликовала открытые SDK и прошивки для самодельных устройств, подключаемых к персональному агенту Muse. Практический смысл — вывести агента из приложения на кнопки, дисплеи, датчики и домашние сценарии, но для сопряжения всё равно нужен токен и режим разработчика.

ИИ помог прочитать шифр Наполеоновской войны, молчавший 217 лет
2 октября 2026 г.
ИИ помог прочитать шифр Наполеоновской войны, молчавший 217 лет

ИИ-инженер Картер Чёрч с помощью GPT-6 Astra расшифровал письмо для генерала Огюста де Мармона, известное лишь по скану 1969 года. Важен не только результат, но и рабочий процесс: модель одновременно читала рукописные знаки, строила ключ гомофонического шифра и проверяла гипотезы по исходному изображению.

Microsoft выпустила расшифровку, которая начинает работать до конца фразы
2 октября 2026 г.
Microsoft выпустила расшифровку, которая начинает работать до конца фразы

Microsoft AI представила потоковую модель MAI-Transcribe-2-Streaming и две голосовые модели. Главная ставка — голосовые агенты, которые могут начать обработку запроса ещё во время речи.