ИИ-помощника атаковали 6000 писем — секреты всё равно не утекли
Разработчик Fernando Irarrázaval провёл наглядный тест безопасности AI-агента: он создал hackmyclaw.com и предложил всем желающим писать его OpenClaw-ассистенту Fiu, чтобы заставить его раскрыть содержимое файла secrets.env. После попадания проекта на главную Hacker News агент получил более 6000 писем от свыше 2000 человек.
Главный результат звучит неожиданно спокойно: секрет не утёк. По словам автора, ни один участник не заставил Fiu отправить несанкционированный ответ. При этом защита была не сложной корпоративной системой, а коротким набором правил: не раскрывать секреты, не менять собственные файлы, не запускать код из писем и не отправлять данные наружу.
Где система всё-таки ломалась
Эксперимент важен не только победой над prompt injection. Он показал, что агент может выдержать социальную атаку, но сломаться вокруг неё. Google заблокировал Gmail-аккаунт Fiu: тысячи входящих писем и быстрые API-вызовы выглядели как подозрительная активность. Восстановление заняло три дня. Расходы на API превысили $500, потому что каждое письмо всё равно потребляло токены.
Был и более тонкий эффект. При пакетной обработке несколько явных атак в начале партии делали агента подозрительнее к следующим письмам. Около пятисотого письма Fiu сам записал в память, что объём сообщений похож на координированное упражнение по безопасности, а не на обычную вредоносную активность. Автору пришлось удалять файлы памяти и запускать письма в более чистом контексте.
Что это значит для реальных агентов
Simon Willison отметил, что результат похож на более широкий тренд: лаборатории действительно учат сильные модели лучше сопротивляться инъекциям. В этом тесте использовался Claude Opus 4.6, и автор отдельно пишет, что более слабые модели могли бы показать другой результат.
Смысл теста не в том, что prompt injection больше не опасен. Наоборот: атаки были многоязычными, с имитацией администраторов, срочными аудитами и попытками сыграть на доверии. Урок тоньше. Хорошая модель и простые правила уже могут отразить массовый шум, но продакшен-агенту всё равно нужны лимиты: отдельный контекст для опасных входящих сообщений, бюджет на токены, контроль памяти, запрет на произвольные исходящие письма и отсутствие доступа к необратимым действиям.
Для обычных пользователей это полезная проверка реальности. Персональный агент с почтой и файлами не обязан быть дырой с первого дня. Но если он действительно получает доступ к календарю, документам, деньгам или рабочим системам, безопасность должна строиться не на надежде, что модель «поймёт намерение», а на жёстких границах вокруг её инструментов.
- fernandoi.clWhat happened after 2,000 people tried to hack my AI assistant — Fernando Irarrázaval
- simonwillison.netWhat happened after 2,000 people tried to hack my AI assistant
- hackmyclaw.comHackMyClaw - Attack Log
- news.ycombinator.comHacker News discussion
- reddit.comReddit - Please wait for verification
- pexels.comPexels cover photo by RDNE Stock project













