Языковые модели чаще людей ждут наказание за нарушение норм

Прежние усилия по согласованию (alignment) языковых моделей с человеческими ценностями учили их в основном нормам первого порядка, что социально приемлемо, а что нет (например, «не воруй»). Но полноценное социальное мышление требует ещё одного слоя: понимания, кто и как отреагирует на нарушение нормы, публичным осуждением, стыдом или даже тюремным заключением. Такие ожидания реакции называют метанормами, и именно они управляют реальным социальным регулированием.

Авторы работы предлагают методику оценки метанорм в языковых моделях по двум осям, эмоциональная оценка и поведенческий ответ, и вводят две классификационные задачи: предсказание самонаказания (как сам нарушитель реагирует на собственный проступок) и предсказание реакции наблюдателей (как окружающие отвечают на чужое нарушение). Вместе с методикой выпущен датасет NormReact: 450 сценариев нарушения норм, размеченных вручную по эмоциям и поведенческим реакциям, с учётом пола нарушителя и социальной близости наблюдателя к нему.

Проверка на шести языковых моделях показала: ИИ рисует более жестокий социальный мир, чем есть на самом деле, модели систематически переоценивают вероятность негативных санкций именно там, где люди в большинстве случаев ожидали бы бездействия. Кроме того, совпадение прогнозов модели с человеческими суждениями ухудшается по мере роста социальной дистанции между наблюдателем и нарушителем: чем дальше друг от друга эти двое социально, тем хуже модель угадывает реальную человеческую реакцию.

Авторы предупреждают: ИИ-системы, применяемые в норм-чувствительных задачах, от медиации конфликтов до симуляции политических решений, рискуют выдавать искажённую картину социального регулирования, которая переоценивает наказание и недооценивает терпимость, сдержанность и умение соизмерять реакцию с ситуацией, характерные для реального применения норм людьми.

Ключевые факты

  • Новая методика оценивает не сами социальные нормы, а метанормы, реакцию на их нарушение, по двум осям: эмоциональная оценка и поведенческий ответ.
  • Две задачи классификации: предсказать реакцию самого нарушителя на свой проступок и реакцию наблюдателей на чужой.
  • Датасет NormReact: 450 сценариев нарушения норм, размеченных вручную по эмоциям и поведению, с учётом пола нарушителя и социальной близости наблюдателя.
  • На шести моделях ИИ систематически завышает ожидания наказания там, где люди чаще ждут бездействия.
  • Совпадение с человеческими оценками ухудшается по мере роста социальной дистанции между наблюдателем и нарушителем.

Почему это важно

Согласование языковых моделей с человеческими ценностями до сих пор в основном сводилось к нормам первого порядка, обучению тому, что можно и что нельзя. Но реальное социальное мышление требует ещё и понимания второго порядка: кто и как отреагирует на нарушение, осуждением, стыдом, санкциями. Эти ожидания реакции (метанормы) и определяют, как на самом деле работает социальное регулирование. Если модель систематически неверно предсказывает реакцию людей на проступок, любой её совет или оценка чужого поведения окажутся смещены относительно реальности.

Кому это важно

Разработчикам систем, где ИИ оценивает или предсказывает социальные реакции, модерация контента, HR-инструменты, медиация конфликтов, симуляция политических и управленческих решений. А также исследователям согласованности языковых моделей, изучающим её за пределами простого разделения «можно/нельзя».

Как это применить

Методика и датасет NormReact дают конкретный инструмент проверки: можно прогнать модель через 450 размеченных сценариев и увидеть, насколько её прогнозы эмоциональной и поведенческой реакции, своей и чужой, расходятся с человеческими. Командам, которые строят агентов для норм-чувствительных задач, стоит проверять эту калибровку отдельно, а не считать её побочным следствием общего alignment-обучения.

Можно ли доверять

В доступном тексте, только аннотация препринта: имена авторов, их организации и конкретные названия шести протестированных моделей не раскрыты, дата публикации тоже отсутствует. Утверждения о завышении наказания и ухудшении согласованности с ростом социальной дистанции даны только как направление эффекта, числового размера расхождения в тексте нет. Как именно и кем размечались 450 сценариев, за рамками формулировки «вручную», тоже не раскрыто. Работа построена на собственном новом датасете, независимой проверки результатов пока нет.

Риски и подводные камни

Если ИИ ожидает более суровую реакцию людей на нарушение норм, чем происходит в реальности, системы, которые на это опираются, от медиаторов конфликтов до симуляторов политики, рискуют выдавать чрезмерно карательную картину социального регулирования и недооценивать терпимость и сдержанность, характерные для реальной жизни. Хуже того, точность модели падает именно там, где наблюдатель и нарушитель социально дальше друг от друга, то есть ровно в тех случаях (посторонние, незнакомцы), где непредвзятая оценка нужна больше всего.