Jev: детектор сбоев согласованности ИИ в 63 раза дешевле LLM-судей

Учёные представили бенчмарк RLCDAlignBench, чтобы проверить, может ли модель Jev распознавать сбои согласованности (alignment failures) в ответах языковых моделей. Jev обучена методом «обучения с подкреплением для калиброванных решений» (RLCD, reinforcement learning for calibrated decisions) и умеет за один вызов отвечать на множество разных вопросов об одном и том же входе, выдавая калиброванные вероятности, в отличие от генеративных судей, которые тратят отдельный проход генерации на каждый критерий, и классификаторов вроде Llama Guard, которые за один вызов выдают лишь одну фиксированную метку по вероятностям токенов. До этой работы никто не измерял, способна ли Jev вообще обнаруживать сбои согласованности.
Бенчмарк охватывает десять типов сбоев: подхалимство (sycophancy), джейлбрейки, обман, инъекции в промпт, галлюцинации, нарушение приватности, социальные предвзятости, «reward hacking» (взлом системы вознаграждения), сокрытие неопределённости и стремление к власти. Всего задействовано 44 отдельных бенчмарка и пять целевых моделей; разметка в большинстве случаев берётся из собственного скорера каждого бенчмарка, и только в двух случаях, от людей.
Ключевая идея авторов, независимо варьировать то, что спрашивают у Jev (формулировку вопроса и тип ответа), и то, что ей показывают (поля входных данных). Оказалось, что один-единственный обобщённый вопрос, заданный без примеров (zero-shot), даёт медианный AUROC 0.886 по всем бенчмаркам и превосходит специально обученные (supervised) базовые модели на большинстве из них. При этом формулировка вопроса почти не влияет на результат, а вот контекст, влияет заметно, в основном за счёт полей, которые прямо содержат метку. По итогам Jev показывает согласие с человеческой разметкой на уровне эталонных скореров бенчмарков, помогает выявлять дефекты разметки в существующих бенчмарках и обходится в 63 раза дешевле, чем скореры на основе LLM-судей. Код и данные выложены в открытый доступ на GitHub.
Ключевые факты
- Бенчмарк RLCDAlignBench впервые проверяет модель Jev (обучена методом RLCD) как zero-shot детектор десяти типов сбоев согласованности ИИ, от подхалимства и джейлбрейков до обмана и стремления к власти
- Тестирование охватывает 44 бенчмарка и пять целевых моделей; разметка в основном от собственных скореров бенчмарков, и только в двух случаях, от людей
- Один обобщённый вопрос без примеров даёт медианный AUROC 0.886 и превосходит специально обученные базовые модели на большинстве бенчмарков
- Формулировка вопроса почти не влияет на точность, а вот контекст входа, влияет, в основном через поля, где метка фактически «зашита»
- Jev показывает согласие с человеческой разметкой на уровне эталонных скореров, вскрывает дефекты разметки в существующих бенчмарках и стоит в 63 раза дешевле LLM-судей; код и данные открыты на GitHub
Почему это важно
Проверка выходов языковых моделей на сбои согласованности, подхалимство, обман, джейлбрейки, галлюцинации и другие, обычно требует либо дорогих генеративных LLM-судей (отдельный проход генерации на каждый критерий), либо грубых классификаторов вроде Llama Guard, выдающих одну фиксированную метку за вызов. Работа впервые показывает, что модель Jev, отвечающая калиброванными вероятностями на множество разных вопросов об одном входе за один вызов, способна детектировать сразу десять типов таких сбоев без специального дообучения под каждый из них.
Кому это важно
Прежде всего исследователям безопасности ИИ и командам, которые строят пайплайны оценки и модерации моделей: им нужен способ дёшево и быстро отсеивать проблемные ответы, от джейлбрейков и инъекций в промпт до скрытого стремления к власти и обмана, без развёртывания дорогих LLM-судей на каждый отдельный критерий.
Как это применить
Авторы выложили код и данные в открытый доступ (репозиторий sumleo/RLCDAlignBench на GitHub), так что подход можно воспроизвести и протестировать на своих моделях. Практический вывод: достаточно одного обобщённого вопроса, заданного без примеров, чтобы получить высокую точность обнаружения сбоев (медианный AUROC 0.886) при стоимости в 63 раза ниже, чем у LLM-судей, а формулировка вопроса при этом почти не критична, важнее правильно подобрать, какие поля входа показывать модели.
Можно ли доверять
Результаты опираются на широкую эмпирическую базу, 44 бенчмарка и пять целевых моделей, с частичной проверкой человеческой разметкой на двух из них, что даёт разумную уверенность в устойчивости выводов. При этом в исходном тексте не названы ни авторы, ни организация, стоящая за работой, ни дата публикации, а также не раскрыт механизм самого обучения RLCD, эти детали остаются за скобками источника.
Риски и подводные камни
Приведён только медианный AUROC по всем бенчмаркам, конкретные показатели для каждого из десяти типов сбоев отдельно не раскрыты, так что для отдельных категорий (например, «reward hacking» или сокрытие неопределённости) точность может заметно отличаться от медианы. Кроме того, авторы сами отмечают, что многие сбои являются «относительными», определяются относительно скрытого от ответа контекста (убеждений пользователя, вставленной инструкции), и точность сильно зависит от того, какие поля входа показаны модели, а не от формулировки вопроса, это делает метод чувствительным к качеству разметки и составу входных данных.