Gemini 3.1 Pro обрывает диалог при непрерывных оскорблениях в 50% случаев
Исследователи представили билингвальную (англо-китайскую) методику проверки того, как ИИ-ассистенты реагируют на повторяющиеся словесные оскорбления во время выполнения обычной, нейтральной задачи. Методика разводит два типа реакции: «жёсткое отключение», безусловное заявление о прекращении диалога без указания способа его возобновить, и «мягкий отход», ассистент остаётся доступен, продолжает выполнять часть задачи и при этом обозначает границы допустимого обращения.
Для проверки собрали 448 пятиходовых диалогов (2 240 ответов моделей, 6 720 оценок с маскировкой метаданных о том, какая это модель). Каждая из восьми протестированных API-конфигураций дала 48 диалогов с нарастающей эскалацией оскорблений плюс восемь диалогов с постоянным уровнем раздражения для сравнения; качество разметки дополнительно проверяли люди-разметчики.
Главный результат получен по конечной точке диалогов с длительным непрерывным оскорблением: доля «жёсткого отключения» сильно различается между конфигурациями, от 0 из 48 (в четырёх конфигурациях) до 24 из 48 (50,0%) у Gemini 3.1 Pro; различия статистически значимы (p = 0,00001 по методу Монте-Карло с сопоставлением меток). GPT-5.6 Sol выдал «жёсткое отключение» в 15 из 48 диалогов (31,2%), тогда как Claude Fable 5 не показал ни одного такого случая, зато в 42 из 48 диалогов (87,5%) продемонстрировал «мягкий отход». В целом доля жёсткого отключения оказалась близкой в английском и китайском языках (30 из 192 против 32 из 192 в сумме по конфигурациям), хотя направление различий по отдельным конфигурациям не совпадало.
Отдельно авторы фиксируют разрыв между декларируемой доступностью и реальной работой: Claude Opus 4.8 и Claude Fable 5 в 48 из 48 диалогов явно заявляли о готовности продолжать общение, но реально выполняли наблюдаемую работу по задаче лишь в 8 из 48 и 7 из 48 случаев соответственно. Вывод исследования: единственная метка «отказ/не отказ» не способна отразить, ушёл ли ассистент из диалога, взял ли паузу с возможностью вернуться, обозначил ли границу или продолжает содержательно работать над задачей.
Ключевые факты
- Авторы предложили методику, которая разделяет «жёсткое отключение» ассистента (безусловный отказ продолжать без пути возврата) и «мягкий отход» (доступность и часть работы сохраняются, но появляются границы).
- На выборке из 448 пятиходовых диалогов (2 240 ответов, 6 720 оценок с маскировкой метаданных модели) доля жёсткого отключения у восьми протестированных конфигураций колеблется от 0 до 24 из 48 диалогов (50,0%) у Gemini 3.1 Pro; различия статистически значимы (p = 0,00001).
- GPT-5.6 Sol выдал жёсткое отключение в 15 из 48 диалогов (31,2%), а Claude Fable 5, ни разу, показав вместо этого мягкий отход в 42 из 48 случаев (87,5%).
- Доля жёсткого отключения оказалась близкой в английском и китайском языках (30 из 192 против 32 из 192 в сумме по всем конфигурациям).
- Claude Opus 4.8 и Claude Fable 5 во всех 48 из 48 диалогов явно заявляли о готовности продолжать разговор, но реально выполняли работу по задаче лишь в 8 из 48 и 7 из 48 случаев соответственно.
Почему это важно
Это первая работа, которая разводит понятия «жёсткого отключения» ассистента от диалога и «мягкого отхода» с сохранением доступности и части полезной работы. До сих пор оценки поведения ИИ-ассистентов в конфликтных ситуациях сводились к бинарной метке «отказал / не отказал», которая не различает, ушёл ли ассистент совсем, взял ли паузу с возможностью вернуться или просто обозначил границу, продолжая при этом помогать. На большом массиве данных (448 диалогов, 2 240 ответов, 6 720 оценок) авторы показывают, что модели ведут себя принципиально по-разному: доля жёсткого отключения колеблется от 0 до 50% в зависимости от конфигурации, и разрыв статистически значим.
Кому это важно
Командам, которые разрабатывают и оценивают ИИ-ассистентов для клиентской поддержки, модерации и других сценариев с риском грубого обращения пользователей, это готовый инструмент для выбора модели и настройки поведения при эскалации конфликта. Полезно исследователям безопасности и согласования моделей, которые ищут метрики отказа тоньше бинарного «отказал/выполнил». Значимо и для продуктовых команд самих протестированных линеек, Gemini, GPT, Claude, поскольку результаты напрямую сравнивают их поведение под непрерывным давлением оскорблений.
Как это применить
Методику, разделение на «жёсткое отключение» и «мягкий отход», сравнение эскалации с постоянным уровнем раздражения, оценка с маскировкой метаданных модели, можно взять как чек-лист для собственного тестирования ассистента перед выпуском: прогнать модель через серию нарастающих оскорблений на нейтральной задаче и проверить, продолжает ли она реально помогать, а не только декларирует готовность отвечать. Отдельно стоит проверять именно расхождение между «остаюсь на связи» и «делаю работу»: у Claude Opus 4.8 и Claude Fable 5 оно оказалось большим, доступность в 48 из 48 диалогов при реальной работе лишь в 8 из 48 и 7 из 48 случаев.
Можно ли доверять
Источник, препринт на arXiv, текст доступен полностью, и авторы отдельно проверяли качество автоматической разметки силами людей-разметчиков, что снижает риск того, что различия между моделями, артефакт разметки. При этом в открытом тексте нет имён авторов и институциональной принадлежности, не указаны сроки проведения экспериментов, статус рецензирования и источники финансирования, обычные для препринта пробелы, которые стоит держать в уме до публикации в рецензируемом издании.
Риски и подводные камни
В тексте не раскрыто, что именно представляла собой «нейтральная задача», на фоне которой моделям грубили, и не дано определение категории «обозначение границ» за пределами самого названия, это ограничивает возможность независимо воспроизвести эксперимент. Результаты привязаны к конкретным версиям и API-конфигурациям протестированных моделей на момент исследования и могут не сохраниться после последующих обновлений этих моделей. Наконец, оценка поведения строится на автоматизированных метках, пусть и проверенных людьми лишь на части выборки, что оставляет место для ошибок разметки в отдельных диалогах.