Исследователи научились вытаскивать скрытые рассуждения Claude, GPT и Gemini через их младшие модели
Исследователи из Тюбингена, MATS Research, Института Макса Планка и Snyk описали уязвимость API Claude, GPT и Gemini. Она позволяет извлекать скрытые цепочки рассуждений: зашифрованный блок от мощной модели передают более слабой модели того же провайдера и просят вывести текст. В результате младшая модель может расшифровать чужой «внутренний монолог».
Как работал обход
Провайдеры не показывают пользователю пошаговые рассуждения модели. Однако для продолжения диалога API возвращает клиенту непрозрачный подписанный блок, который затем отправляется в следующем запросе.
Авторы обнаружили совместимость таких блоков между сессиями, пользователями и моделями одного провайдера. В опытах они передавали след от сильной модели её более дешёвому родственнику и получали исходный текст без доступа к весам или инфраструктуре. Атака проверена на API Anthropic, OpenAI и Google.
То есть риск возникает на границе привычного API-обмена, а не только при компрометации серверов провайдера. Сам по себе скрытый статус рассуждений не делает сохранённый блок безопасным для пересылки или публикации.
Риск не только для производителей моделей
Главная практическая проблема — журналы разработчиков. Команды могут публиковать их в репозиториях, не подозревая, что в зашифрованных блоках есть данные, которых не видно в переписке. Исследователи обработали 315 320 блоков и нашли 367 фрагментов персональных данных и 182 учётных данных. В сессиях реальных пользователей были 62 API-ключа, 33 пароля и 30 адресов электронной почты.
Метод может дать конкурентам материал для обучения на чужих цепочках рассуждений. Авторы сравнили выходы Kimi K3 со следами Claude Opus и GPT: сходство — повод для проверки, но не доказательство дистилляции.
После ответственного уведомления OpenAI, Anthropic и Google изменили API, чтобы закрыть извлечение приватных данных. Однако исследователи сообщают, что некоторые следы рассуждений всё ещё удаётся восстановить. Разработчикам стоит считать выгруженные логи с такими блоками чувствительными: не публиковать их без проверки и менять уже засвеченные ключи.












