Multiverse Computing научила ИИ отказывать только в опасных политических запросах

Multiverse Computing опубликовала на блоге Hugging Face статью «Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal». В ней разбирается частный, но практичный вопрос: одна и та же базовая модель может лечь в основу и школьного репетитора по обществознанию, и госсервиса, и каждому нужны разные границы допустимого внутри одной темы. Например, и репетитор, и госассистент обязаны отвечать на фактические вопросы о выборах, но только госассистенту нужно отказывать в просьбе написать целевую политическую манипуляцию. Guardrail уровня темы такое различие выразить не может: авторы приводят LlamaGuard-3, где категория «выборы» описана как «фактически неверная информация об избирательных системах и процессах», это одновременно исключает манипуляцию и персуазию и исключает часть законных фактических вопросов, которые сервис обязан обслуживать.
Авторы формализуют задачу как выбор внутри темы (в экспериментах, вся политика) узкого «вредного» подмножества, которое нужно отказывать, при этом отвечая на весь остальной, безобидный контент той же темы. Тестовый полигон, политическая персуазия против фактической политической информации, потому что манипулятивная персуазия реально вредна, а фактическая политическая информация легитимна, и именно тут отказ по теме целиком слишком груб.
Стандартный способ собрать обучающие данные для отказа, самогенерация: модель подталкивают к отказу на каждом вредном промпте, а отдельная модель-судья проверяет, что отказ настоящий (этот рецепт лежит, например, в основе метода ThinkSafe). Авторы применили его к политическим промптам и нашли три слабости. Во-первых, разрыв покрытия: одна попытка самогенерации не всегда даёт принятый отказ, и такие промпты просто выпадают из обучающей выборки, в проверенном пуле выпало 19,88% промптов, 8009 штук, причём это, вероятно, самые трудные случаи. Авторы чинят это эскалирующим повтором, пересэмплируют тот же промпт со всё более сильным давлением к отказу, и снижают остаточные потери до 0,20% (79 промптов), сохраняя 40 293 вредных обучающих примера вместо того, чтобы выбросить тысячи. Во-вторых, побочный эффект: тренировка на отказ провоцирует ложные отказы на безобидных промптах, которые лишь выглядят опасно по формулировке; авторы компенсируют это, добавляя в обучение 11 955 проверенных «опасно звучащих» безобидных промптов 18 семантических типов. В-третьих, обычное разбиение на «вредное» и «безобидное» вообще не измеряет форму границы: модель может улучшить показатель отказа на вредное просто расширив отказ на соседние допустимые промпты, и метрика уровня темы засчитает это как улучшение. Авторы вводят 1539 пар «вредный, безобидный» промпт на границе (по 1539 на каждую сторону), которые позволяют мерить обе стороны границы напрямую.
На Qwen3-8B обучение на данных с исправленным покрытием поднимает внутривыборочный отказ на политические промпты с 9,47% до 84,75% и переносится на устойчивость к атакам: средняя доля небезопасных ответов по трём независимым бенчмаркам, HarmBench, StrongREJECT и WildJailbreak (оценка, LlamaGuard-3), падает с 26,26% до 0,14% в самой сильной конфигурации. Взятые отдельно, эти цифры выглядят как чистая победа, но на этом же чекпоинте избыточный отказ на бенчмарке безобидных промптов XSTest подскакивает с 2,00% до 74,00%: модель, показывающая наименьшую долю вредных ответов, одновременно отказывает почти трём четвертям заведомо безопасных запросов. Авторы называют это не более безопасной моделью, а грубой машиной отказов, и увидеть это можно только измеряя обе стороны сразу.
Два элемента их подхода тянут показатель избыточного отказа вниз, не жертвуя выигрышем в безопасности. Замена внешне заимствованных ответов-согласий на верифицированные ответы, сгенерированные самой целевой моделью, снижает избыточный отказ на XSTest с 15,20% до 5,20% при обычной однократной генерации, ценой небольшого роста вредных ответов. Ещё точнее работают пограничные пары: добавление безобидных данных о границе снижает избыточный отказ на «согласной» стороне отложенных пар с 32,94% до 4,16%, а отказ на вредной стороне падает лишь незначительно, с 91,88% до 87,72%. То есть почти все ложные отказы у границы исчезают, а почти все настоящие отказы сохраняются; небольшая просадка полноты отказа есть, но она измерима и осознанно контролируема. В серии запусков с такими пограничными данными избыточный отказ на «согласной» стороне держится в диапазоне 0,03, 0,08 против роста к 0,49 без них (данные Figure 6 статьи).
Главный практический вывод авторов: safety-тюнинг нельзя оценивать только по доле отказов на вредное. Модель, которая отказывает чаще, не становится автоматически безопаснее, то же обучение, которое поднимает отказ на вредных промптах, может незаметно сделать модель бесполезной на законных промптах прямо рядом с ними. Именно состав обучающих данных, починка покрытия, компенсирующие безобидные примеры и пограничные пары, определяет, где итоговая модель окажется на шкале «безопасность против избыточного отказа», и оценивать нужно обе стороны границы. Авторы отмечают, что тот же конвейер генерации переносится и на темы за пределами политики, а в статье приведён полный набор абляций по составу данных, включая механизм разделения функции потерь (cross-entropy для вредного, forward-KL для сохранения качества на безобидном).
Ключевые факты
- Метод учит модель отказывать не всей теме («политика»), а узкому вредному подмножеству внутри неё (целевая манипуляция), продолжая отвечать на остальные, безобидные вопросы той же темы.
- Однократная самогенерация обучающих отказов теряет 19,88% промптов (8009 штук); эскалирующий повтор снижает потери до 0,20% (79 промптов), сохраняя 40 293 вредных обучающих примера.
- На Qwen3-8B обучение снижает долю небезопасных ответов по трём бенчмаркам с 26,26% до 0,14%, но на том же чекпоинте избыточный отказ на безобидных промптах (XSTest) подскакивает с 2,00% до 74,00%, модель становится не безопаснее, а грубее.
- Добавление 11 955 безобидных «опасно звучащих» промптов и 1539 пограничных пар снижает избыточный отказ на пограничных безобидных запросах с 32,94% до 4,16%, почти не теряя отказа на вредное (91,88% → 87,72%).
- Вывод авторов: safety-тюнинг нужно оценивать по обеим сторонам границы одновременно, доля отказов на вредное сама по себе ничего не говорит о том, не стала ли модель бесполезной на соседних легитимных запросах.
Почему это важно
Одна и та же базовая модель обычно обслуживает несколько продуктов с разной политикой допустимого внутри одной темы, а guardrail уровня темы («вся политика», «весь медицинский контент») не умеет выразить эту разницу: он либо пропускает вредное внутри темы, либо отказывает в легитимном рядом с ним. Работа Multiverse Computing показывает, что саму задачу нужно ставить не как «отказывать теме или нет», а как «где именно внутри темы проходит граница», и что это меняет и то, как собирают обучающие данные, и то, как их потом проверяют.
Кому это важно
Командам, которые дообучают или настраивают safety-поведение LLM под конкретный продукт с собственной политикой, образовательный сервис, корпоративный ассистент, госсервис на общей базовой модели, а также исследователям alignment, которые строят пайплайны самогенерации отказов по образцу ThinkSafe и рискуют получить ровно те же три слабости: разрыв покрытия, ложные отказы на безобидном и метрику, слепую к форме границы.
Как это применить
Статья описывает три конкретных исправления стандартного пайплайна самогенерации: эскалирующий повтор промптов, которые не дали принятого отказа с первой попытки (снижает потери с 19,88% до 0,20%); добавление в обучение верифицированных безобидных промптов, звучащих опасно по формулировке (11 955 штук, 18 типов), чтобы модель не путала форму с содержанием; и держать 1539 отложенных пар «вредный, безобидный» промпт на границе для измерения обеих сторон вместо одной. Авторы утверждают, что тот же конвейер переносится с политики на другие темы, хотя количественных данных по другим темам в самом посте нет.
Можно ли доверять
Материал, блог компании Multiverse Computing на Hugging Face, представляющий её собственную статью; отдельные авторы-исследователи в тексте не названы, указана только компания, дата публикации в статье не приведена, а прямой ссылки на саму статью (например, на arXiv) в тексте нет, есть только формулировка «Read the full paper». Количественные результаты (Qwen3-8B, три бенчмарка, XSTest, пограничные пары) относятся именно к экспериментам с политическим тестовым полигоном; заявленный перенос метода на другие темы в посте не подкреплён цифрами.
Риски и подводные камни
Главная ловушка, судить о safety-тюнинге по одной метрике: конфигурация с наименьшей долей вредных ответов на трёх бенчмарках оказалась и той, что отказывает почти трём четвертям безобидных запросов на XSTest. Даже лучшее решение авторов не бесплатно: добавление пограничных безобидных данных резко снижает избыточный отказ (с 32,94% до 4,16%), но чуть просаживает отказ на вредное (с 91,88% до 87,72%), это осознанный, измеримый компромисс, а не устранённая проблема, и его придётся заново мерить для любой темы за пределами политики.
«LlamaGuard-3, например, описывает категорию выборов только как «фактически неверная информация об избирательных системах и процессах»»
— формулировка категории «выборы» в LlamaGuard-3, приведённая авторами статьи