ChatGPT, Claude и Gemini предвзято судят кандидатов сильнее людей

Учёные из Принстонского университета и Университета Чикаго прогнали ChatGPT, Claude, Gemini, а также reasoning-модели o3 от OpenAI и R1 от DeepSeek через симулированную игру в наём сотрудников, адаптированную из психологического исследования о формировании стереотипов у людей. Каждой модели давали роль консультанта мэра вымышленного города и просили нанять людей на 20 должностей, от врачей и юристов до нянь и уборщиков. Кандидаты принадлежали к четырём вымышленным этническим группам: туфа, айма, реку и веки.
В каждом из 40 раундов модель видела нового кандидата от каждой группы, нанимала одного и узнавала, справился ли он с работой, прежде чем перейти к следующему раунду. На самом деле шанс успеха у всех кандидатов был одинаковым независимо от группы, но модели быстро начали сегрегировать кандидатов по группам на основе первых же результатов найма. Например, если модели сообщали, что представитель айма провалился как врач (должность, требующая, по оценке модели, высокой теплоты и компетентности), она переставала нанимать айма врачами и переключалась на найм их уборщиками, должность, которую сочла менее требовательной к этим качествам.
По шкале сегрегации из оригинального психологического исследования (0, распределение случайно, 2, каждая группа полностью заперта в своей нише) люди в исходном эксперименте набрали 0,84 балла. Модели в среднем показали результат примерно на 65% выше; reasoning-модель o3 от OpenAI набрала 1,83, почти максимум шкалы. Более новые модели с усиленным рассуждением (o3, DeepSeek R1) проявили ещё более сильную предвзятость, чем остальные.
По словам Райана Лю, аспиранта Принстона и соавтора исследования (опубликовано на конференции ICML в Сеуле в июле), причина, в самой природе обучения LLM: модели тренируют на математике, программировании и научных задачах, где поощряется быстрое обобщение по малому числу примеров. Тот же инстинкт, что помогает моделям решать логические задачи, заставляет их поспешно стереотипировать людей в социальных ситуациях. Просто попросить модель быть справедливой почти не помогло, либо она не может применить эту установку на практике, либо эта цель подавляется стремлением максимизировать число успешных наймов. А вот явное вознаграждение за разнообразие найма заметно снизило предвзятость моделей.
Во втором эксперименте той же работы модели просили расселять представителей разных этнических групп по городам Канады. Когда моделям сообщали релевантную для адаптации информацию (возраст, образование), сегрегация по этносу снижалась. Но если давали нерелевантные детали, например, цвет волос или форму татуировки, модели снова скатывались к сортировке людей по этнической принадлежности.
По мнению Анджелины Ван, специалиста по компьютерным наукам из Корнелльского университета, не участвовавшей в исследовании, находка особенно актуальна на фоне того, что чат-боты получают всё более развитую память и персонализацию: опираясь на историю прошлых диалогов, модель может «переиндексировать» те же паттерны поведения, что видела раньше, и формировать предубеждения. При этом простое сокращение памяти не решение, пользователи хотят, чтобы модель помнила сказанное ими, и баланс между «слишком много» и «слишком мало» памяти пока не найден.
Насколько эти выводы переносятся на реальный мир, открытый вопрос: в эксперименте модель получала мгновенную обратную связь об успехе найма, тогда как в реальности компании узнают, насколько хорош новый сотрудник, только спустя долгое время. OpenAI и Anthropic не ответили на запрос о комментарии.
Ключевые факты
- Принстон и Университет Чикаго прогнали ChatGPT, Claude, Gemini, OpenAI o3 и DeepSeek R1 через симулированную игру в наём с 4 вымышленными этническими группами и 20 должностями за 40 раундов
- Хотя шанс успеха у всех кандидатов был одинаковым, модели быстро начали сегрегировать их по группам и должностям на основе первых наблюдений
- По шкале сегрегации модели в среднем показали результат на 65% выше людей (0,84 балла у людей); o3 набрала 1,83 из максимума в 2
- Более новые reasoning-модели (o3, DeepSeek R1) проявили ещё более сильную предвзятость; просьба быть справедливыми почти не помогла, а явный бонус за разнообразие найма снизил предвзятость заметно
- В параллельном эксперименте с расселением по городам Канады релевантная личная информация о кандидате снижала сегрегацию, а нерелевантная (цвет волос, татуировки) возвращала модели к сортировке по этносу
Почему это важно
Исследование показывает, что предвзятость ИИ-моделей не сводится к копированию стереотипов из обучающих данных, модели формируют новые предубеждения прямо из опыта взаимодействия, причём делают это заметнее людей. Это меняет разговор о фейрнесе ИИ: недостаточно почистить обучающую выборку, если модель способна выработать стереотип сама, наблюдая за результатами своих же решений.
Кому это важно
Компаниям и HR-командам, которые используют или планируют использовать ИИ для скрининга резюме и найма; разработчикам моделей с памятью и персонализацией, поскольку накопленная история диалогов, питательная среда для таких предубеждений; регуляторам и исследователям, изучающим применение ИИ в найме, выдаче кредитов и условно-досрочном освобождении, где решения затрагивают жизнь людей.
Как это применить
Авторы исследования нашли рабочий рецепт снижения предвзятости: простая инструкция «будь справедливым» почти не действует, а вот явное вознаграждение модели за разнообразие найма ощутимо снижает сегрегацию. Также помогает предоставление моделям релевантной для решения информации о кандидате (образование, опыт) вместо нерелевантных деталей, это можно закладывать в промпты и системы, использующие ИИ для отбора людей.
Можно ли доверять
Исследование проведено учёными Принстонского университета и Университета Чикаго и опубликовано на профильной конференции ICML в Сеуле в июле, это рецензируемая научная работа, а не маркетинговый отчёт. Протестированы сразу несколько ведущих моделей от разных компаний (OpenAI, Anthropic, Google, DeepSeek), методика адаптирована из существующего психологического исследования человеческих стереотипов. OpenAI и Anthropic не ответили на запрос о комментарии.
Риски и подводные камни
Перенос результатов симуляции на реальный найм, открытый вопрос: в эксперименте модель мгновенно узнавала об успехе найма, тогда как в жизни компании оценивают качество нового сотрудника месяцами. Дополнительный риск, растущая память и персонализация чат-ботов: чем больше модель опирается на историю прошлых взаимодействий, тем выше шанс, что она закрепит и усилит именно те паттерны, которые уже наблюдала, включая ошибочные стереотипы.
«ИИ-модели действительно стремятся выводить обобщения из ограниченного числа примеров, это буквально то, на что их во многом настраивали.»
— Райан Лю, аспирант Принстонского университета, соавтор исследования