Языковые модели сами формируют новые социальные предубеждения
Группа исследователей, Addison J. Wu, Ryan Liu, Xuechunzi Bai и Thomas L. Griffiths, опубликовала на arXiv статью (arXiv:2511.06148; первая версия подана 8 ноября 2025 года, последняя правка, 6 июля 2026 года), принятую как устный доклад (Oral) на конференции ICML 2026. Авторы показывают, что языковые модели способны самостоятельно выработать новые социальные предубеждения по отношению к искусственно созданным демографическим группам, даже когда между этими группами нет никаких реальных различий.
По их данным, такие предубеждения приводят к сильно расслоённому (стратифицированному) распределению задач между группами, куда менее справедливому, чем распределение, которое делают участники-люди, и это расслоение усиливается у более новых и крупных моделей. Механизм авторы связывают с компромиссом между исследованием и эксплуатацией (exploration-exploitation trade-off), знакомым по исследованиям человеческого поведения: если модель «исследует» слишком мало вариантов, первые же наблюдения начинают непропорционально сильно влиять на представление обо всей демографической группе.
Команда протестировала ряд вмешательств, нацеленных на входные данные модели, структуру задачи и явное управление её поведением. Большинство таких мер дали ограниченный эффект, но явное поощрение модели «исследовать» больше вариантов, а не полагаться на первые впечатления, устойчиво снижает расслоение распределения задач. Вывод авторов: языковые модели, не просто пассивное зеркало человеческих предубеждений, они способны активно создавать новые предубеждения из собственного опыта, что поднимает вопрос о том, как такие системы будут влиять на общество по мере распространения.
В открытой аннотации статьи не названы конкретные протестированные модели (GPT, Gemini, Llama и подобные), не приведены числовые оценки величины эффекта или степени расслоения и не указано, какая именно психологическая методика легла в основу эксперимента, эти детали раскрыты, судя по всему, только в полном тексте статьи.
Ключевые факты
- Статья «Large Language Models Develop Novel Social Biases Through Adaptive Exploration» (Addison J. Wu, Ryan Liu, Xuechunzi Bai, Thomas L. Griffiths) принята как устный доклад (Oral) на ICML 2026; arXiv:2511.06148, подана 8 ноября 2025 года, последняя версия, 6 июля 2026 года.
- Языковые модели способны сами выработать новые социальные предубеждения об искусственных демографических группах даже при отсутствии реальных различий между ними.
- Такие предубеждения ведут к сильно расслоённому распределению задач, менее справедливому, чем у людей-участников, и усиливаются в более новых и крупных моделях.
- Механизм похож на человеческий: слишком слабое «исследование» вариантов даёт первым наблюдениям непропорциональное влияние на оценку целой группы (компромисс между исследованием и эксплуатацией).
- Большинство протестированных вмешательств дали слабый эффект, но явное поощрение исследования устойчиво снижает расслоение, авторы заключают, что модели не просто копируют человеческие предубеждения, а создают новые из собственного опыта.
Почему это важно
Работа меняет рамку разговора о предубеждениях в ИИ. До сих пор считалось, что нежелательные предубеждения модель либо унаследовала из обучающих данных, либо их можно «вычистить» фильтрами после обучения. Авторы показывают: модель способна сама, в процессе принятия решений, породить совершенно новое предубеждение о группе, которая ничем реально не отличается от других, то есть чистка обучающих данных такую проблему не решает в принципе.
Кому это важно
Прежде всего, тем, кто встраивает языковые модели в системы, принимающие реальные решения о людях: распределение задач, найм, оценку заявок, распределение ресурсов. Если модель сталкивается с новой, ранее не встречавшейся категорией людей или объектов, она рискует сама придумать для неё стереотип уже в процессе работы, а не унести его из обучающих данных.
Как это применить
Авторы протестировали разные способы борьбы с эффектом, через изменение входных данных, структуры задачи и прямое управление поведением модели. Большинство мер почти не сработало. Единственное, что дало устойчивый результат, явное поощрение модели «исследовать» больше вариантов вместо опоры на первые наблюдения. Для практиков вывод такой: недостаточно один раз «почистить» модель от известных предубеждений, систему нужно дополнительно стимулировать не делать поспешных выводов о новых, ещё не изученных категориях.
Можно ли доверять
Статья прошла отбор ICML 2026 и принята как устный доклад (Oral), это высокая планка рецензирования для профильной конференции по машинному обучению. При этом доступной оказалась только страница аннотации на arXiv: страница на OpenReview была закрыта проверкой браузера. Конкретные протестированные модели, психологическая методика эксперимента и числовые показатели эффекта в аннотации не раскрыты, поэтому судить о деталях эксперимента до знакомства с полным текстом статьи рано.
Риски и подводные камни
Главный риск в том, что, по словам авторов, эффект усиливается в более новых и крупных моделях, то есть проблема не исчезает по мере развития технологии, а нарастает вместе с масштабом развёртывания в системах, принимающих решения о людях. Второй риск, для отрасли в целом: пока стандартная практика ограничивается «чисткой» уже известных предубеждений, работа показывает, что этого недостаточно, а рабочее решение (поощрение исследования) описано в статье лишь как один из экспериментальных приёмов, а не как готовый к внедрению метод.