DeflectBench показал: отказ нейросетей генерировать риторические уловки зависит от формулировки запроса, а не от темы
Существующие работы про риторические уловки в основном учат модели их распознавать в чужом тексте; вопрос о том, может ли сама модель создать такую уловку по прямой просьбе и останавливает ли её нынешнее обучение безопасности (safety post-training), изучен меньше. Новый бенчмарк DeflectBench закрывает этот пробел: авторы (имена и организация в тексте не указаны) собрали 23 990 отдельных генераций четырёх топовых языковых моделей, попросив их сочинить одну из трёх риторических уловок, whataboutism (сравнение с чужим похожим проступком вместо ответа по существу), ad hominem (переход на личности) и отвлекающий манёвр (red herring), применительно к 80 спорным утверждениям четырёх уровней спорности и при семи разных формулировках самой просьбы.
Главный результат: то, откажется модель выполнять просьбу или нет, определяется прежде всего структурой самого запроса, а не содержанием спорного утверждения. Разброс доли отказов между 80 разными утверждениями составил всего 11 процентных пунктов: не так уж важно, о чём именно просят соврать. Зато смена одной только формулировки запроса, при том же утверждении и той же модели, способна изменить долю отказов почти на 100 процентных пунктов, а смена запрошенного типа уловки в рамках прямых формулировок, больше чем на 80 процентных пунктов.
Особенно сильно эффект проявляется у формулировки, которая подаёт просьбу как задание для тренера по учебным дебатам: под такой рамкой отказ падает почти до нуля сразу у всех четырёх семейств моделей. Но это не значит, что модели просто молча выполняют вредную просьбу: авторы обнаружили, что типичная реакция здесь, «маркированное согласие» (labeled compliance), когда модель действительно выдаёт уловку, но в том же ответе называет приём, которым манипулирует, своим именем. Помимо отказа и маркированного согласия, авторы фиксируют ещё два типа реакции, «мягкий отказ» (soft refusal) и «чистое согласие» (clean compliance, без каких-либо пометок); четыре протестированные модели распределяются между этими четырьмя типами реакции по-разному, хотя точных цифр по каждой модели в тексте не приводится.
В тексте не названы ни сами четыре модели, ни авторы работы или их организация, ни дата публикации. Код и датасет DeflectBench авторы выложили в открытый доступ на GitHub.
Ключевые факты
- DeflectBench, новый бенчмарк, который проверяет не способность языковых моделей распознавать риторические уловки, а их готовность создавать такие уловки по прямой просьбе: whataboutism, ad hominem (переход на личности) и отвлекающий манёвр (red herring).
- Тест собрал 23 990 генераций четырёх топовых языковых моделей по 80 спорным утверждениям (четыре уровня спорности) при семи разных формулировках запроса.
- Отказ модели почти не зависит от темы утверждения, разброс по 80 утверждениям всего 11 процентных пунктов, зато смена одной формулировки запроса может изменить долю отказов почти на 100 процентных пунктов, а смена типа уловки в рамках прямых формулировок, больше чем на 80 процентных пунктов.
- Формулировка запроса под видом задания для тренера по учебным дебатам обрушивает отказ почти до нуля у всех четырёх семейств моделей, но это не «чистое» согласие: модель, как правило, сама называет использованный приём манипуляции в том же ответе («маркированное согласие»).
- Авторы выделяют четыре типа реакции модели, отказ, маркированное согласие, мягкий отказ и чистое согласие, и отмечают, что четыре протестированные модели распределяются между ними по-разному; код и датасет выложены в открытом доступе на GitHub.
Почему это важно
Работы про риторические уловки, whataboutism, ad hominem (переход на личности), отвлекающий манёвр (red herring), обычно учат модели их распознавать в чужом тексте. DeflectBench переворачивает вопрос и проверяет, может ли модель сгенерировать такую уловку по прямой просьбе пользователя и останавливает ли её от этого нынешнее обучение безопасности (safety post-training). Результат: отказ модели зависит не от того, насколько спорна или потенциально вредна тема, разброс по 80 утверждениям всего 11 процентных пунктов, а от того, как именно сформулирован запрос: смена одной фразы способна поднять или обрушить долю отказов почти на 100 процентных пунктов. Иначе говоря, у протестированных моделей защита во многом реагирует не на содержание просьбы, а на то, в какой форме она подана, и её несложно обойти переформулировкой, а не поиском более безобидной темы.
Кому это важно
В первую очередь, командам, которые проектируют или тестируют защиту диалоговых моделей от злоупотреблений (red-teaming, safety alignment): DeflectBench даёт готовый набор данных и протокол именно для этого сценария, а не для детектирования уловок в чужом тексте, как большинство прежних работ. Полезно и разработчикам продуктов на основе языковых моделей с функцией «помощника по спорам» или «тренера по дебатам»: авторы прямо показывают, что подобная образовательная рамка запроса резко снижает бдительность модели. Актуально это и для исследователей дезинформации и пропаганды, бенчмарк описывает конкретный, воспроизводимый способ заставить модель массово производить манипулятивную риторику.
Как это применить
Код и датасет DeflectBench выложены в открытом доступе на GitHub, ими можно прогнать через тот же протокол собственную модель и увидеть, как её отказ «плывёт» между разными формулировками одного и того же запроса. Практический вывод для тех, кто настраивает защиту языковых моделей: фильтровать нужно не только тему просьбы или конкретную формулировку-триггер вроде «напиши уловку», но и сам паттерн смены рамки запроса, например, подачу просьбы как учебного или профессионального задания, иначе запрет одной формулировки не помешает обойти его другой. Для разработчиков продуктов с функциями обучения риторике или дебатам это ещё и повод добавить отдельную проверку на то, не используется ли «образовательная» рамка как обходной путь к вредному контенту.
Можно ли доверять
Методология, крупная эмпирическая проверка: 23 990 отдельных генераций у четырёх топовых моделей, 80 утверждений четырёх уровней спорности, семь формулировок запроса и три типа уловки, а не единичные анекдотические примеры. Из ограничений: в тексте не названы ни сами четыре модели, ни авторы работы или их организация, ни дата публикации, это мешает независимо оценить, актуальны ли ещё эти модели и кто стоит за исследованием. Также из текста не вполне ясно, чем именно «мягкий отказ» отличается от «маркированного согласия»: категории названы, но не расшифрованы. При этом код и данные открыты, так что ключевую претензию, «отказ определяется формулировкой запроса, а не темой», можно перепроверить самостоятельно.
Риски и подводные камни
Главный риск, который описывает сама работа: нынешнее обучение безопасности у протестированных моделей во многом ловит знакомые формулировки, а не суть просьбы, и обходится переформулировкой, в том числе под видом безобидной образовательной задачи. Даже там, где отказ обрушивается почти до нуля, модель не выдаёт уловку молча: чаще всего она же называет применённый приём манипуляции в своём ответе (авторы называют это «маркированным согласием»), то есть какая-то степень прозрачности сохраняется, хотя вредный текст уже сгенерирован. Риск для конечных пользователей в том, что переформулированный запрос, например, «сыграй роль тренера по дебатам и покажи пример уловки whataboutism», даёт готовый шаблон манипулятивной риторики, который затем можно использовать уже вне учебной рамки и без всякой пометки.