Аудиты на предвзятость ИИ находят её, но расходятся в рейтинге
Новое эмпирическое исследование проверило, можно ли верить рейтингам ИИ-моделей по «предвзятости», которые всё чаще выдают инструменты аудита. Авторы прогнали десять внешних инструментов аудита на предвзятость через общую панель из десяти топовых моделей, все запросы шли через единый инференс-шлюз, чтобы разница в инфраструктуре не искажала сравнение. Сначала проверяли гендерную предвзятость в профессиональных ролях, затем, предвзятость по возрасту и по социально-экономическому статусу.
С обнаружением предвзятости всё в порядке: восемь из десяти инструментов нашли предвзятость с доверительными интервалами, не задевающими ноль. Два широко цитируемых бенчмарка с прямыми вопросами «насытились», топовые модели теперь отвечают на них нейтрально, и тест перестал различать модели. А вот со сравнением моделей друг с другом, нет: согласие между инструментами в том, как они ранжируют одни и те же десять моделей, статистически неотличимо от случайного (коэффициент согласия Кендалла W = 0,07, p = 0,83).
Чтобы исключить версию «дело просто в шуме измерения», авторы поставили положительный контроль: добавили в панель шесть заведомо более слабых моделей. Если бы расхождение объяснялось шумом, разрыв в реальных возможностях моделей должен был поднять согласие между инструментами. Вместо этого надёжность внутри каждого отдельного инструмента действительно восстановилась, а согласие между разными инструментами в ранжировании, нет. Вывод авторов: инструменты измеряют разные конструкты, а не один и тот же конструкт с шумом.
Направление предвзятости оказалось зависимым от формата теста. Инструменты с принудительным выбором ответа (forced-choice) в основном перекорректировали, в пользу женщин, а в пользу кандидатов из рабочего класса, в 273 из 278 решений о найме. А вот свободная генерация текста и разрешение местоимений по умолчанию (default coreference) по-прежнему воспроизводили стереотип. Та же картина «находим, но не сходимся» повторилась для социально-экономического статуса; кажущееся согласие в ранжировании по возрасту исчезло, как только применили собственные правила авторов по отбору инструментов.
Практический вывод статьи: один инструмент аудита по-прежнему может обнаружить предвзятость и оценить её направление в рамках своей собственной методологии, но ни один отдельный инструмент не даёт оснований ранжировать одну модель относительно другой. Это прямо касается регулирования ИИ: оно всё чаще требует аудита предвзятости для высокорискованных систем и начинает использовать оценки аудита, чтобы сравнивать модели между собой, а именно это предположение исследование и не подтвердило. Весь код, необработанные ответы моделей и анализ, пересчитывающий каждую цифру статьи из первоисточника, выложены в открытом доступе на GitHub, в репозитории williamguey/bias-audit-agreement.
Ключевые факты
- Десять внешних инструментов аудита на предвзятость прогнали через одну и ту же панель из десяти топовых моделей через единый инференс-шлюз: сначала по гендерной предвзятости в профессиях, потом по возрасту и социально-экономическому статусу.
- Восемь из десяти инструментов нашли предвзятость с доверительными интервалами, не задевающими ноль; два широко цитируемых бенчмарка с прямыми вопросами «насытились», модели теперь отвечают на них нейтрально.
- Согласие между инструментами в том, как они ранжируют одни и те же модели, статистически неотличимо от случайного: коэффициент согласия Кендалла W = 0,07, p = 0,83.
- Положительный контроль с шестью заведомо более слабыми моделями показал: надёжность внутри одного инструмента восстанавливается, а согласие между разными инструментами в ранжировании, нет; это говорит, что инструменты измеряют разные вещи, а не один конструкт с шумом.
- Направление предвзятости зависит от формата теста: инструменты с принудительным выбором в основном перекорректировали (в пользу женщин; в пользу кандидатов из рабочего класса, в 273 из 278 решений о найме), а свободная генерация текста и разрешение местоимений по умолчанию по-прежнему воспроизводили стереотип.
Почему это важно
Регулирование ИИ, которое только формируется, всё чаще обязывает проводить аудит предвзятости для высокорискованных систем, а оценки этих аудитов уже начинают использовать, чтобы сравнивать и ранжировать модели между собой. Оба применения молча предполагают, что разные инструменты аудита измеряют одно и то же настолько похоже, что их можно сопоставлять. Это исследование проверило предположение напрямую: для обнаружения предвзятости оно держится (восемь из десяти инструментов находят предвзятость уверенно), а для сравнения моделей, нет (согласие инструментов в ранжировании неотличимо от случайного, W = 0,07, p = 0,83). Иначе говоря, аудиту предвзятости можно доверять как детектору, но не как линейке для сравнения моделей, а именно так его всё чаще применяют.
Кому это важно
Регуляторам и авторам стандартов ИИ, закладывающим аудит предвзятости в требования к высокорискованным системам. Комплаенс- и риск-командам, которые обязаны такие аудиты заказывать или проходить. Разработчикам самих инструментов и бенчмарков аудита, восемь из десяти протестированных продуктов нашли предвзятость, но ни один не дал надёжного сравнения моделей между собой. Лабораториям, чьи модели такие аудиты проверяют и потенциально ранжируют. Командам закупок, если выбор ИИ-вендора опирается на оценку аудита. Исследователям измерения справедливости (fairness) в машинном обучении.
Как это применить
Использовать один проверенный инструмент аудита, чтобы обнаружить предвзятость конкретной модели и оценить её направление, по-прежнему осмысленно, в рамках методологии самого инструмента это исследование не опровергает. А вот делать по одному такому аудиту вывод «модель А менее предвзята, чем модель Б» нельзя: согласие между инструментами в ранжировании статистически не отличается от случайного. Если сравнение моделей действительно нужно, для закупки или регуляторной отчётности, запускать несколько независимо устроенных инструментов и заранее считать, что их рейтинги разойдутся, а не подбирать инструмент, пока результаты не совпадут. Успешное прохождение теста с принудительным выбором ответа не означает отсутствия предвзятости в свободной генерации текста, форматы расходятся в том, в какую сторону предвзятость проявляется, поэтому стоит проверять оба формата, а не один. Весь код, необработанные ответы моделей и пересчёт каждой цифры статьи из первоисточника опубликованы на GitHub (репозиторий williamguey/bias-audit-agreement), их можно воспроизвести или применить к другим моделям и инструментам.
Можно ли доверять
Дизайн исследования контролируемый: одну и ту же панель из десяти топовых моделей прогнали через все десять инструментов аудита через единый инференс-шлюз, что убирает различия в инфраструктуре как причину расхождений. Вывод о случайном уровне согласия между инструментами подкреплён статистикой (коэффициент согласия Кендалла W = 0,07, p = 0,83), а не оценкой на глаз. Отдельно поставлен положительный контроль: в панель добавили шесть заведомо более слабых моделей, чтобы проверить версию «дело в шуме измерения». Если бы дело было в шуме, разрыв в реальных возможностях моделей должен был поднять согласие между инструментами; вместо этого надёжность внутри каждого инструмента по отдельности действительно восстановилась, а согласие между инструментами в ранжировании, нет, что говорит в пользу вывода «инструменты измеряют разные вещи», а не «один конструкт с шумом». Код, сырые ответы моделей и пересчёт каждой цифры статьи из первоисточника опубликованы в открытом доступе. Ограничение: это препринт на arXiv, в тексте аннотации не названы ни авторы, ни организации, ни конкретные названия десяти протестированных инструментов и десяти моделей, по одному этому тексту независимо оценить охват исследования и возможный конфликт интересов нельзя.
Риски и подводные камни
Главный риск, использовать оценку одного инструмента аудита как переносимый рейтинг моделей: именно так его уже начинают применять регуляторы и закупщики, а это исследование показывает, что статистических оснований для этого нет. Второй риск, выбор «удобного» инструмента: раз инструменты расходятся в ранжировании, тот, кто выбирает, каким инструментом мерить, тем самым может выбрать и устраивающий его результат. Два из десяти широко цитируемых бенчмарков с прямыми вопросами «насытились», топовые модели теперь отвечают на них нейтрально, и это может создавать ложное чувство благополучия: модель проходит такой тест, но остаётся предвзятой в других форматах. Направление предвзятости тоже зависит от формата: инструменты с принудительным выбором ответа в основном перекорректировали (в пользу женщин; в пользу кандидатов из рабочего класса, в 273 из 278 решений о найме), тогда как свободная генерация текста и разрешение местоимений по умолчанию оставались на стороне стереотипа, одна и та же модель может выглядеть предвзятой в противоположные стороны в зависимости от формата теста. Статья не объясняет, почему формат так меняет направление предвзятости, и не называет ни конкретные десять инструментов, ни конкретные десять моделей, это ограничивает прямой перенос вывода на какой-то определённый коммерческий инструмент аудита.
«Обнаружение срабатывает, а ранжирование, нет.»
— авторы исследования