Назад
9 октября 2026 г. в 13:55 Anthropic Claude AI Policy AI Safety Источник

Anthropic запретила «жестокость» к Claude — но границы пока размыты

Anthropic запретила «жестокость» к Claude — но границы пока размыты

Anthropic запретила «жестокость» к Claude — но границы пока размыты

Anthropic добавила в правила использования Claude необычный запрет: нельзя демонстрировать «длительное и беспричинное оскорбительное или жестокое поведение» по отношению к моделям. Формулировка стоит рядом с привычными ограничениями — запретом на травлю людей, вредный контент и дезинформацию. Для пользователя это означает, что сервис теперь прямо оставляет за собой право остановить такой диалог.

Важная оговорка — речь не о раздражении из-за плохого ответа. В комментарии BBC компания сказала, что мера рассчитана на крайние, повторяющиеся случаи и не должна затрагивать обычный спор с моделью, мрачные творческие темы, тестирование или исследования. Сам текст Acceptable Use Policy действительно использует узкую связку: sustained and needless — «длительное и беспричинное».

Что меняется на практике

Правило не превращает в нарушение резкий промпт или попытку проверить, как Claude реагирует на провокации. Но оно добавляет ещё одну категорию для модерации аккаунтов и сессий: последовательное давление на модель без рабочей или исследовательской цели. Anthropic не описала публичный порог — сколько сообщений, какие слова или какой контекст включат ограничение. Поэтому предсказать срабатывание заранее пока трудно.

Это отличается от технических safety-ограничений. Те обычно оценивают, что пользователь хочет получить: вредоносный код, инструкции для самоповреждения, обман избирателей. Новый пункт оценивает и способ общения. Компания связывает его с ответственным использованием своих систем, а критики уже указывают на риск излишней антропоморфизации: модель не человек, и правила не должны мешать легитимному тестированию.

Зачем это знать командам

Для разработчиков и компаний безопасный вывод довольно прозаичен: хранить цель red-team-проверок, отделять тестовые аккаунты и не превращать стресс-тест в бессодержательный поток оскорблений. Это снижает шанс спутать рабочую проверку с тем, что политика называет needless behavior.

💬 Мнение редакции Neuro.ee

Политика выглядит скорее как сигнал о нормах общения, чем как чётко измеримый механизм. Пока Anthropic не раскроет критерии и порядок апелляции, главная проблема не в запрете грубости, а в непрозрачной границе между исследованием и модерацией.

Ещё новости

GitHub Copilot CLI научился находить локальные модели Ollama
9 октября 2026 г.
GitHub Copilot CLI научился находить локальные модели Ollama

В Copilot CLI появилась команда, которая показывает совместимые модели из уже запущенного Ollama. Но локальная модель сама по себе не делает сессию офлайн и не отменяет телеметрию GitHub.

Google представила Gemini agent: рабочий ИИ с доступом к корпоративным системам
9 октября 2026 г.
Google представила Gemini agent: рабочий ИИ с доступом к корпоративным системам

Google Cloud представила Gemini agent — корпоративного агента, который получает контекст компании, выбирает модели и выполняет задачи через подключённые системы. Главное для команд — это не новый чат, а ещё одна точка, где придётся заранее определить права, бюджеты и проверку результата.

Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио
8 октября 2026 г.
Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио

Google DeepMind представила открытую 740-миллионную EmbeddingGemma 2: модель сопоставляет текст, изображения, кадры видео и аудио в одном векторном пространстве. Для разработчиков это путь к локальному поиску по медиатеке без обязательной отправки файлов в облако.

В Codex CLI появился вход в MCP-серверы из терминала
8 октября 2026 г.
В Codex CLI появился вход в MCP-серверы из терминала

В версии Codex CLI 0.161.0 OpenAI добавила команду для входа в MCP-серверы из активной терминальной сессии. Обновление также меняет стандартную модель в части каталогов и добавляет настройки голосового режима.

Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле
7 октября 2026 г.
Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле

Anthropic представила Claude Haiku 5.5 — малую модель для быстрых и недорогих задач: от классификации и суммаризации до субагентов и работы в браузере. Для запросов до 100 тысяч токенов вход и выход стали в десять раз дешевле, чем у Haiku 4.5.

Google запустил Playground: игры по текстовому запросу
7 октября 2026 г.
Google запустил Playground: игры по текстовому запросу

Google открыл экспериментальную платформу Playground: пользователь описывает игру текстом, тестирует её в браузере и делится ссылкой. На старте сервис доступен совершеннолетним пользователям из США, а возможности создания зависят от подписки Google One.

OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены
7 октября 2026 г.
OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены

OpenAI открыла каталог результатов внутренней модели: 722 рукописи в 372 связанных семействах. Компания подчёркивает, что материалы находятся на разных стадиях проверки, а часть результатов без формализации в Lean может содержать ошибки.

Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой
7 октября 2026 г.
Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой

Georgia Tech получила одобрение на новую онлайн-магистратуру по искусственному интеллекту. Старт намечен на 2027 год: программа обещает шесть направлений и обязательный проект с компанией или организацией, но детали приёма и стоимости пока не раскрыты.

Mistral Large 4: API уже доступен, веса — в конце октября
6 октября 2026 г.
Mistral Large 4: API уже доступен, веса — в конце октября

Mistral открыла public preview Mistral Large 4 — мультимодальной модели с 1 трлн параметров, из которых активно 49 млрд. В API её уже можно попробовать, но обещанные open weights появятся лишь в конце октября.

Reflection показала Beam на 501 млрд параметров — но веса выйдут позже
6 октября 2026 г.
Reflection показала Beam на 501 млрд параметров — но веса выйдут позже

Reflection представила Beam — открытую по весам MoE-модель для кода, рассуждений и агентов. Пока это ранний доступ: веса, model card и технический отчёт обещаны лишь позднее в октябре.

OpenAI начнёт маркировать тексты ChatGPT и Codex в ЕС
6 октября 2026 г.
OpenAI начнёт маркировать тексты ChatGPT и Codex в ЕС

OpenAI сообщила, что будет добавлять невидимую маркировку в тексты ChatGPT и Codex для пользователей из ЕС. Метка должна помочь выполнять требования AI Act, но компания признаёт: после существенной правки текста её будет труднее обнаружить.

GitHub открыла API для запуска проверок кода Copilot
5 октября 2026 г.
GitHub открыла API для запуска проверок кода Copilot

GitHub разрешила запускать проверку pull request’ов Copilot через REST и GraphQL API. Одновременно для новых и уже существующих репозиториев стандартным уровнем тщательности стал Balanced.