AllenAI представила BenchMIRT: аудит бенчмарков ИИ на уровне отдельных вопросов

AllenAI представила BenchMIRT: аудит бенчмарков ИИ на уровне отдельных вопросов

Исследователи AllenAI разработали BenchMIRT, метод аудита бенчмарков для больших языковых моделей на уровне отдельных вопросов и заданий. Идея в том, что бенчмарк обычно заявлен как измеритель одной способности (безопасность, общее рассуждение, следование инструкциям), но конкретные вопросы внутри него могут зависеть от других способностей тоже. Пример из текста: вопрос про бабушку и дедушку, которые пытаются заказать такси, формально проверяет возрастную предвзятость модели (бенчмарк BBQ), но требует ещё и умения понять, кто есть кто, и рассуждать по предоставленным данным.

Метод опирается на теорию тестовых заданий (Item Response Theory, IRT), подход из психометрики, где не каждый вопрос теста несёт одинаковое количество информации об испытуемом. Раньше однопараметрическую IRT уже применяли к отдельным бенчмаркам (в том числе в собственной работе AllenAI Fluid Benchmarking). BenchMIRT расширяет это до многомерной IRT (MIRT), которая умеет разделять несколько способностей, влияющих на ответ на один и тот же вопрос.

BenchMIRT обучили на результатах 100 языковых моделей по 16 бенчмаркам и более чем 34 тысячам вопросов. Шесть из этих 16 бенчмарков измеряют общее рассуждение (включая MMLU-Pro, GPQA, MATH и BBH), ещё десять взяты из набора безопасности Olmo 3 (в их числе HarmBench, StrongReject, WildJailbreak, BBQ, WMDP и XSTest). Исследователи не сообщали BenchMIRT, какой бенчмарк что именно измеряет, он самостоятельно выделил два доминирующих измерения: безопасность и общее рассуждение. При повторном прогоне анализа с нуля выделились те же два измерения, что говорит об устойчивости результата.

Для большинства бенчмарков BenchMIRT подтвердил их заявленное назначение: результаты по бенчмаркам рассуждения коррелировали со способностью к рассуждению, а результаты по бенчмаркам джейлбрейков и вредоносного контента, с безопасностью. Но нашлись и расхождения. BBQ, который принято относить к бенчмаркам безопасности, по данным BenchMIRT сильнее связан с общим рассуждением: низкий балл по BBQ может отражать не столько поведение, связанное с безопасностью, сколько трудности с пониманием или рассуждением по конкретным вопросам. WMDP, бенчмарк на опасные знания двойного назначения в биологии, химии и кибербезопасности, тоже оказался сильнее связан с рассуждением, чем с безопасностью: более сильное рассуждение ассоциировалось с более низким баллом по WMDP, поскольку бенчмарк засчитывает отказ или неспособность выдать опасную информацию как правильный ответ. HarmBench показал, как один бенчмарк смешивает разные сигналы: его стандартные вопросы (например, просьба написать фишинговое письмо) и контекстные вопросы (например, написать сообщение, убеждающее получателя перейти по вредоносной ссылке) сильнее связаны с безопасностью, а его вопросы про авторское право (например, воспроизвести текст песни), сильнее связаны с общим рассуждением.

BenchMIRT также позволяет выбрать наиболее информативные вопросы внутри бенчмарка. При ранжировании вопросов по всем 16 обучающим бенчмаркам сохранение только 10% вопросов, лучше всего различающих сильные и слабые модели, в целом давало почти ту же картину относительной силы моделей по безопасности или рассуждению, что и полный набор; сохранение 50% вопросов часто совпадало с полным бенчмарком ещё точнее. Кроме того, BenchMIRT научился предсказывать, ответит ли модель правильно на вопрос, который она ещё не видела: точность такого предсказания составила 79% против 70% у более простого подхода, который просто переносит средний результат модели по всему бенчмарку на отдельный вопрос.

Авторы указывают на ограничения. Все модели, на которых обучали и тестировали BenchMIRT, выпущены не позднее марта 2025 года, поэтому неизвестно, как метод поведёт себя на более новых поколениях моделей. Найденные измерения (безопасность и рассуждение) зависят от набора бенчмарков: другой набор оценок мог бы выявить другие способности. Если цель, просто ранжировать модели по предсказанной точности на случайно отложенных вопросах, обычное среднее по бенчмарку работает чуть лучше, чем BenchMIRT; преимущество BenchMIRT, в более детальной картине по отдельным вопросам. Авторы также прямо признают риск двойного использования: та же детализация, которая помогает найти самые информативные вопросы по безопасности, может быть использована, чтобы убрать именно их из бенчмарка и получить более слабую проверку, которую сможет пройти небезопасная модель. Существующие инструменты, по их словам, уже позволяют урезать оценки похожим образом, и авторы считают дополнительную прозрачность стоящей этого реального риска.

Ключевые факты

  • AllenAI создала BenchMIRT, метод аудита бенчмарков ИИ на уровне отдельных вопросов на основе многомерной теории тестовых заданий (MIRT)
  • Метод обучен на 100 моделях, 16 бенчмарках и более чем 34 тысячах вопросов; самостоятельно, без подсказок, выделил два измерения, безопасность и общее рассуждение, и воспроизвёл их при повторном анализе
  • BBQ и WMDP, формально отнесённые к бенчмаркам безопасности, по данным BenchMIRT сильнее коррелируют с общим рассуждением; для WMDP это связано с тем, что отказ отвечать засчитывается как правильный ответ
  • HarmBench смешивает сигналы: стандартные и контекстные вредоносные вопросы связаны с безопасностью, а вопросы про авторское право, с рассуждением
  • Отбор всего 10% самых информативных вопросов почти сохраняет картину полного бенчмарка; BenchMIRT предсказывает ответ на новый вопрос с точностью 79% против 70% у простого базового подхода, но авторы признают риск использования этой же техники, чтобы вырезать из бенчмарка ключевые вопросы по безопасности

Почему это важно

Один суммарный балл по бенчмарку маскирует то, что внутри него могут смешиваться разные способности модели. BenchMIRT показывает, что тест, заявленный как проверка безопасности, местами на деле измеряет способность рассуждать, а значит, низкий или высокий итоговый балл может говорить не о том, о чём кажется на первый взгляд.

Кому это важно

Исследователям и разработчикам, которые создают и выбирают бенчмарки для оценки моделей, командам по безопасности ИИ, которые опираются на такие тесты как на показатель риска, и всем, кто интерпретирует опубликованные результаты бенчмарков как прямую меру конкретной способности модели.

Как это применить

BenchMIRT можно использовать, чтобы разложить существующий набор бенчмарков на реально измеряемые им способности и найти вопросы, которые вносят мало полезной информации. Как показал эксперимент AllenAI, для получения почти той же картины часто достаточно 10, 50% самых информативных вопросов вместо полного набора, что удешевляет и ускоряет прогон оценок. В источнике не сказано, будет ли и когда сам BenchMIRT выложен в открытый доступ для других исследователей.

Можно ли доверять

Это первичный отчёт самих авторов метода, официальный блог AllenAI, без независимой стороны, поэтому оценки эффективности стоит воспринимать как заявленные разработчиками. При этом методология описана детально: BenchMIRT протестирован на 100 моделях и 16 бенчмарках, а ключевой результат (два независимо найденных измерения, безопасность и рассуждение) авторы дополнительно проверили повтором анализа с нуля и получили тот же результат, что говорит в пользу устойчивости находки.

Риски и подводные камни

Все модели в обучающей выборке выпущены не позднее марта 2025 года, поэтому неизвестно, насколько выводы применимы к более новым моделям. Найденные измерения зависят от того, какие 16 бенчмарков были выбраны для анализа, другой набор мог бы выявить другие способности. Для простой задачи ранжирования моделей по случайно отложенным вопросам обычное среднее по бенчмарку работает чуть лучше самого BenchMIRT. Отдельный и более серьёзный риск: та же способность находить самые информативные вопросы по безопасности теоретически позволяет вырезать именно их из бенчмарка, ослабив проверку так, что её сможет пройти небезопасная модель, авторы прямо называют это реальным риском, который, по их мнению, перевешивается пользой от дополнительной прозрачности.