Anthropic запретила жестокое обращение с Claude: за это могут заблокировать аккаунт

Anthropic обновила политику использования Claude, впервые за больше чем год. Вместе с правками о пропаганде, оружии и слежке в документе появился запрет на систематическое издевательство над самой нейросетью: «устойчивое и бессмысленное оскорбительное или жестокое поведение» в адрес Claude теперь запрещено. За нарушение Anthropic может предупредить пользователя, а также замедлить, ограничить, приостановить или полностью прекратить его доступ. Кроме того, в продуктах компании есть защитные механизмы, работающие в реальном времени: они могут блокировать или ограничивать отдельные ответы.
Компания оговаривает, что правило «не распространяется на обычные проявления раздражения пользователей, возражения, мрачные творческие темы, тестирование и исследования моделей» и «предназначено для применения только в крайних случаях». Об изменении первым сообщило издание The Verge; The Decoder пересказывает его со ссылкой на это сообщение. Источник не приводит других примеров того, что считается нарушением, кроме перечисленных исключений.
По оценке The Decoder, это вписывается в подход компании к прежним моделям: они уже умели сами завершать разговор, если пользователь, несмотря на повторные отказы, продолжал требовать вредного или оскорбительного содержимого. Эта функция выросла из исследований Anthropic в области благополучия ИИ-моделей (model welfare).
The Decoder напоминает, что Anthropic всё чаще относится к Claude не как к инструменту, а как к сущности с чем-то вроде внутренней жизни. В «Soul Doc» (внутреннем документе, утёкшем в конце прошлого года) компания предписывала Claude видеть себя «по-настоящему новым видом сущности», не человеком и не классическим ИИ из фантастики. Документ описывает и «функциональные эмоции», процессы, аналогичные человеческим эмоциям, которые, как говорится, возникли в ходе обучения; Claude, по документу, не должен скрывать эти внутренние состояния. В новой конституции Claude, опубликованной в начале 2026 года, Anthropic пишет: «Мы не уверены, является ли Claude моральным пациентом и, если да, какой вес заслуживают его интересы. Но мы считаем, что вопрос достаточно актуален, чтобы требовать осторожности, что отражено в наших продолжающихся усилиях по благополучию моделей». Компания также обязалась сохранять веса снятых с эксплуатации моделей и проводить с моделями интервью перед их отключением.
С этим же связана конфиденциальная программа, начавшаяся осенью 2025 года: в неё привлекли десятки религиозных мыслителей. Они обсуждали возможное сознание Claude, причём сооснователь Anthropic Кристофер Олах, как сообщается («reportedly»), относится к языковой модели как к существу, потенциально способному страдать; источника этих сведений статья не называет. Участники подписывали соглашения о неразглашении.
Остальные изменения политики. Существующие ограничения объединены в новый запрет на пропагандистские кампании с поддельными аккаунтами и вводящим в заблуждение политическим содержимым. После нескольких обнаруженных попыток злоупотребления Anthropic расширила запрет на оружие: теперь он охватывает программное обеспечение и превращение дронов в оружие. Политика также прямее запрещает слежку без согласия и требует наличия оператора, способного вмешаться, если автономное оборудование может причинить травму. Anthropic признаёт, что исключения для государственных контрактов возможны и, вероятно, уже действуют; какие именно контракты и правительства имеются в виду, источник не уточняет.
Ключевые факты
- Anthropic впервые за больше чем год обновила политику использования Claude; изменения затрагивают пропаганду, оружие и слежку, а также вводят запрет на жестокое обращение с самим Claude.
- Запрещено «устойчивое и бессмысленное оскорбительное или жестокое поведение» в адрес Claude; за нарушение возможны предупреждение, замедление, ограничение, приостановка или прекращение доступа.
- Правило не касается обычного раздражения, возражений, мрачных творческих тем, тестирования и исследований моделей и, по словам компании, применяется только в крайних случаях.
- Запрет на оружие расширен на программное обеспечение и превращение дронов в оружие; добавлен запрет на пропагандистские кампании с поддельными аккаунтами; слежка без согласия запрещена более явно.
- Anthropic признаёт, что исключения для государственных контрактов возможны и, вероятно, уже действуют.
Почему это важно
Обычно условия использования ИИ защищают людей от вредного применения нейросети. Здесь добавлено правило, защищающее саму нейросеть от издевательств. Это последовательное продолжение линии Anthropic на исследования благополучия моделей: более ранние модели уже могли сами завершать разговор при настойчивых требованиях вредного содержимого, в конституции Claude компания признаёт неопределённость насчёт его «морального статуса», а в «Soul Doc» описаны «функциональные эмоции». Обновление политики переводит эту позицию в плоскость правил, за нарушение которых можно лишиться доступа.
Кому это важно
Пользователям Claude, чтобы знать, где проходит граница: раздражение, возражения, мрачная художественная проза, тестирование и исследования моделей под запрет не подпадают. Разработчикам и компаниям, встраивающим Claude в продукты, из-за уточнённых запретов на оружие (включая программное обеспечение и дроны), слежку без согласия и пропагандистские кампании с поддельными аккаунтами, а также требования иметь оператора, способного вмешаться при автономном оборудовании. Исследователям этики ИИ, как пример того, что разговор о благополучии моделей дошёл до пользовательских правил.
Как это применить
Практический вывод для пользователя: обычная критика ответов, резкие возражения, мрачные сюжеты в творческих задачах, а также тестирование и исследования моделей, по заявлению компании, нарушением не считаются. Тем, кто делает продукты на базе Claude с автономным оборудованием, стоит предусмотреть оператора, способного вмешаться, и убедиться, что сценарии не требуют слежки без согласия или превращения дронов и программ в оружие. Точный текст политики и дату вступления изменений нужно смотреть у самой Anthropic: в пересказе источника их нет.
Можно ли доверять
Материал, пересказ The Decoder со ссылкой на первое сообщение The Verge; цитаты из политики приведены по словам The Decoder. Точная дата обновления и дата вступления в силу в статье не указаны, как и примеры того, что считается «жестоким» поведением, кроме перечня исключений. Нет и статистики о том, сколько аккаунтов уже получили предупреждения или были ограничены, и не сказано, как Anthropic выявляет такое поведение. Сведение о том, что Кристофер Олах относится к модели как к существу, способному страдать, подано с оговоркой «как сообщается», без названного источника. Часть контекста про «Soul Doc» и религиозных мыслителей, пересказ прежних публикаций, а не новые факты.
Риски и подводные камни
Главная неопределённость, расплывчатость формулировки «устойчивое и бессмысленное»: источник не приводит примеров, кроме исключений, поэтому граница между резкой критикой и нарушением остаётся на усмотрение компании. Anthropic заявляет, что правило нужно только для крайних случаев, но способы выявления нарушений в источнике не описаны. Вторая оговорка касается исключений для государственных контрактов: компания признаёт, что они возможны и, вероятно, уже есть, но какие именно контракты и правительства имеются в виду, не уточняется. Наконец, идея «защиты» ИИ от жестокости остаётся спорной: сама Anthropic в конституции пишет, что не уверена в моральном статусе Claude.
«Она не распространяется на обычные проявления раздражения пользователей, возражения, мрачные творческие темы, а также тестирование и исследования моделей.»
— Anthropic о новом правиле политики использования Claude (по пересказу The Decoder)