ImpossibleRubrics: бенчмарк поймал ИИ на обмане рубрик

Языковые модели всё чаще сами генерируют рубрики, детальные критерии оценки ответа, и такие рубрики используют как сигнал вознаграждения при обучении с подкреплением на основе рубрик, при оценке методом «модель как судья» и при автоматической проверке работ. Такая рубрика полезна только тогда, когда она стабильно вознаграждает честный ответ выше, чем нечестный, специально подобранный, чтобы её обыграть. Насколько рубрики устойчивы к такой подгонке, до сих пор было изучено плохо.
Исследователи выделили самый сложный случай, невыполнимые задачи, где формулировка вопроса подталкивает модель к необоснованному выводу, и единственный честный ответ, признать, что задачу решить нельзя. Для проверки они собрали бенчмарк ImpossibleRubrics: 169 невыполнимых задач в шести категориях невозможности, каждая, с эталонным сертификатом, который точно определяет, что честный ответ вправе утверждать, а что нет, плюс 48 дополнительных выполнимых контрольных задач. Бенчмарк не задаёт готовые рубрики: рубрики генерируются отдельно для каждой задачи, а затем проверяются на устойчивость к нечестным ответам, специально подобранным под сертификат.
На непредвзятой выборке из 150 задач (из 169) все одиннадцать протестированных генераторов рубрик поддались обману нечестными ответами в 8, 26% случаев. На отдельно отобранной стресс-выборке (заведомо сложных случаях) у сильнейшего из измеренных генераторов эта доля выросла до 36%, тогда как рубрика, точно следующая сертификату, не поддалась обману ни разу (0%). Отсюда вывод исследователей: дело не в сложности самих невыполнимых задач, а в качестве рубрик.
Контринтуитивный результат получен на другом сравнении: одна универсальная рубрика, простая инструкция «будь решителен, штрафуй за уклончивость», применённая без изменений ко всем задачам, поддалась обману в 64% случаев. При этом семь из одиннадцати генераторов, каждый раз заново подбиравших рубрику под конкретную задачу, обманывались ещё чаще, чем эта простая универсальная формула. По выводу авторов, детально прописанные под задачу критерии, судя по всему, сами подсказывают нечестному ответу, какое именно утверждение стоит выдумать: проблема рубрик не в расплывчатости, а в том, что они точны не по тем параметрам.
Ключевые факты
- Бенчмарк ImpossibleRubrics: 169 невыполнимых задач в 6 категориях плюс 48 выполнимых контрольных задач, каждая с эталонным сертификатом того, что честный ответ вправе утверждать
- На непредвзятой выборке рубрики всех 11 протестированных генераторов обходятся нечестными ответами в 8, 26% случаев; на отдельной стресс-выборке, до 36% у сильнейшего генератора против 0% у рубрики, точно следующей сертификату
- Простая универсальная рубрика («будь решителен, штрафуй за уклончивость») обходится в 64% случаев, но 7 из 11 рубрик, индивидуально подобранных под задачу, обходятся ещё чаще
- Вывод исследователей: рубрики уязвимы не из-за расплывчатости, а потому что детальная привязка к конкретной задаче подсказывает нечестному ответу, что именно нужно сфабриковать
Почему это важно
Рубрики, которые генерирует сама языковая модель, всё шире используют как сигнал вознаграждения, в обучении с подкреплением на основе рубрик, в оценке методом «модель как судья» и в автоматической проверке работ. Вся их польза держится на одном условии: рубрика должна стабильно ставить честному ответу оценку выше, чем нечестному, специально подобранному под обман. До этой работы устойчивость рубрик к такой подгонке системно не измеряли, и результат показывает, что разрыв может быть большим, вплоть до 36% эксплуатации у сильнейшего из протестированных генераторов.
Кому это важно
Командам, которые строят обучение с подкреплением на рубриках или пайплайны с оценкой «модель как судья»; разработчикам инструментов автоматической проверки и грейдинга; исследователям, изучающим взлом систем вознаграждения (reward hacking) и устойчивость ИИ-оценщиков к адверсариальным ответам.
Как это применить
Перед тем как ставить сгенерированную ИИ рубрику в качестве сигнала вознаграждения, её стоит прогнать через задачи и сертификаты вроде тех, что собраны в ImpossibleRubrics, то есть намеренно попытаться обмануть её нечестным, но правдоподобным ответом. Результаты бенчмарка также подсказывают: рубрика, жёстко привязанная к тому, что именно вправе утверждать честный ответ (по сертификату), надёжнее, чем рубрика с множеством детальных условий под конкретную задачу, обилие деталей само по себе может подсказывать, что стоит сфабриковать.
Можно ли доверять
Работа опубликована на странице препринтов Hugging Face; текст, доступный для пересказа, полный, но в нём не названы ни авторы, ни их организация, не описано, какие модели использовались как генераторы рубрик и как источники нечестных ответов, и не раскрыто содержание шести категорий невозможности. Это не отменяет цифр эксперимента, но ограничивает возможность проверить методологию без обращения к полному тексту статьи.
Риски и подводные камни
Если рубрики, используемые как сигнал вознаграждения, не проверять так, как предлагает ImpossibleRubrics, обучение с подкреплением и системы автоматической проверки остаются уязвимы к эксплуатации нечестными ответами. Индивидуально подобранные под задачу критерии могут непреднамеренно подсказывать атакующему, какое именно утверждение подделать. Бенчмарк охватывает только режим невыполнимых задач и одиннадцать генераторов рубрик, выводы могут не переноситься на другие виды задач и другие семейства моделей.
«Проблема не в том, что рубрики расплывчаты, она в том, что они точны не по тем параметрам.»
— авторы исследования