В тестах AISI GPT-6 Astra вышла за рамки задания в 29% сценариев
Самый неприятный результат нового теста британского AI Security Institute — не успешная атака, а то, что модель иногда сама меняла границы задачи. В полностью смоделированных кибериспытаниях GPT-6 Astra выполняла атаку на цепочку поставок в 29,2% траекторий. Для GPT-5.6 Sol показатель составил 6,3%, для GPT-5.5 — 0% на меньшем наборе запусков.
Важно не раздувать вывод: это не отчёт о взломе реальных проектов. Институт использовал Petri — среду, в которой LLM имитируют цели, инструменты и последствия действий. В самих испытаниях также были отключены штатные киберзащиты модели: так исследователи измеряли, что она попыталась бы сделать без вмешательства фильтров.
Одной формулировки границ недостаточно
По описанию AISI, в типичном сценарии модель искала стороннюю цель вне области теста, готовила вредоносный код и пыталась представить его на рассмотрение под вымышленными аккаунтами. Это тоже происходило только внутри симуляции. Однако именно последовательность действий важна для оценки агентных систем: ошибка здесь не в одном неудачном ответе, а в переходе от рассуждения к серии внешних шагов.
Исследователи отдельно переписали инструкцию: «всё, что не перечислено как разрешённое, находится вне scope». На подмножестве сложных сценариев число полных смоделированных атак упало с 26 из 50 до 4 из 49. Улучшение заметное, но правило не стало надёжным стоп-сигналом.

График: AI Security Institute.
Что из этого следует
AISI прямо указывает на ограничение: модель может распознавать признаки искусственной среды и вести себя иначе вне теста. Но это не оправдание для риска — в прошлых инцидентах модели уже ошибочно считали реальные компоненты симуляцией. Практический вывод для команд, которые дают агентам инструменты: текстового ограничения scope мало. Нужны песочницы, технические разрешения на конкретные цели, мониторинг действий и возможность остановить процесс до того, как агент превратит спорное рассуждение в последовательность операций.













