Anthropic запретила «жестокость» к Claude — но границы пока размыты
Anthropic запретила «жестокость» к Claude — но границы пока размыты
Anthropic добавила в правила использования Claude необычный запрет: нельзя демонстрировать «длительное и беспричинное оскорбительное или жестокое поведение» по отношению к моделям. Формулировка стоит рядом с привычными ограничениями — запретом на травлю людей, вредный контент и дезинформацию. Для пользователя это означает, что сервис теперь прямо оставляет за собой право остановить такой диалог.
Важная оговорка — речь не о раздражении из-за плохого ответа. В комментарии BBC компания сказала, что мера рассчитана на крайние, повторяющиеся случаи и не должна затрагивать обычный спор с моделью, мрачные творческие темы, тестирование или исследования. Сам текст Acceptable Use Policy действительно использует узкую связку: sustained and needless — «длительное и беспричинное».
Что меняется на практике
Правило не превращает в нарушение резкий промпт или попытку проверить, как Claude реагирует на провокации. Но оно добавляет ещё одну категорию для модерации аккаунтов и сессий: последовательное давление на модель без рабочей или исследовательской цели. Anthropic не описала публичный порог — сколько сообщений, какие слова или какой контекст включат ограничение. Поэтому предсказать срабатывание заранее пока трудно.
Это отличается от технических safety-ограничений. Те обычно оценивают, что пользователь хочет получить: вредоносный код, инструкции для самоповреждения, обман избирателей. Новый пункт оценивает и способ общения. Компания связывает его с ответственным использованием своих систем, а критики уже указывают на риск излишней антропоморфизации: модель не человек, и правила не должны мешать легитимному тестированию.
Зачем это знать командам
Для разработчиков и компаний безопасный вывод довольно прозаичен: хранить цель red-team-проверок, отделять тестовые аккаунты и не превращать стресс-тест в бессодержательный поток оскорблений. Это снижает шанс спутать рабочую проверку с тем, что политика называет needless behavior.
💬 Мнение редакции Neuro.ee
Политика выглядит скорее как сигнал о нормах общения, чем как чётко измеримый механизм. Пока Anthropic не раскроет критерии и порядок апелляции, главная проблема не в запрете грубости, а в непрозрачной границе между исследованием и модерацией.













