Исследователи представили Fuse, фреймворк для проверки социального мышления ИИ-ассистентов

Исследователи представили Fuse, фреймворк для проверки социального мышления ИИ-ассистентов

Языковые модели всё чаще дают людям социальные советы, например, как понять мотивы коллеги или партнёра, но оценить, насколько хорошо ассистент справляется с таким рассуждением, сложно: оценка идёт по субъективным рассказам пользователей, а такие свойства, как истинные намерения другого человека, обычно не имеют проверяемого эталона.

Чтобы решить эту проблему, исследователи представили Fuse, фреймворк мультиагентной симуляции для изучения социального мышления с участием пользователя-посредника. В симуляции целевой агент со скрытым мотивом взаимодействует с другими агентами, один из которых представляет пользователя. Затем этот пользовательский агент консультируется с оцениваемым ИИ-ассистентом, чтобы определить истинный мотив целевого агента. Поскольку мотив задан заранее при построении симуляции, у задачи появляется проверяемый эталон ответа, то, чего раньше не хватало.

Достоверность самой симуляции, то, насколько она похожа на реальное человеческое поведение, проверили в исследовании с участием людей: собрали 24 тысячи аннотаций. Затем Fuse применили к 12 языковым моделям и с его помощью выявили несколько закономерностей: во-первых, посредничество пользователя усложняет и без того трудную задачу социального мышления; во-вторых, модели систематически чувствительны к тому, как пользователь предвзято формулирует ситуацию; в-третьих, некоторым моделям требуется больше деталей, чем человеку, чтобы прийти к верному выводу; в-четвёртых, более длинные диалоги не всегда улучшают результат, даже когда дают модели возможность задавать уточняющие вопросы.

Авторы выложили в открытый доступ и сам фреймворк Fuse, и датасет из 21 тысячи примеров.

Ключевые факты

  • Fuse, фреймворк, где целевой агент со скрытым мотивом общается с другими агентами (включая агента-«пользователя»), который затем консультируется с проверяемым ИИ-ассистентом, чтобы понять мотив, так получается проверяемый эталон ответа
  • Достоверность симуляции подтвердили отдельным исследованием с участием людей: собрали 24 тысячи аннотаций
  • Fuse применили к 12 языковым моделям
  • Выявлено: посредничество пользователя усложняет задачу, модели чувствительны к предвзятой формулировке пользователя, иногда требуют больше деталей, чем люди, а более длинные диалоги не всегда помогают
  • Fuse и датасет из 21 тысячи примеров выложены в открытый доступ

Почему это важно

Оценивать, насколько хорошо ИИ-ассистент понимает социальную ситуацию с чужих слов, раньше было почти нечем: у таких свойств, как истинные намерения человека, обычно нет проверяемого правильного ответа, а сама оценка требует, чтобы ассистент судил о ситуации по субъективному пересказу пользователя. Fuse решает это тем, что мотив целевого агента задаётся заранее при построении симуляции, значит, правильный ответ известен заранее и его можно с чем-то сверить.

Кому это важно

Тем, кто разрабатывает ИИ-ассистентов для личных и социальных советов, и тем, кто занимается их оценкой и безопасностью: Fuse даёт инструмент, чтобы проверять, действительно ли ассистент понимает мотивы людей, а не просто складно отвечает.

Как это применить

Фреймворк Fuse и датасет из 21 тысячи примеров выложены в открытый доступ, так что их можно использовать для тестирования и сравнения собственных моделей на задачах социального рассуждения, вместо того чтобы придумывать такую проверку с нуля.

Можно ли доверять

Это исследовательская работа с независимой проверкой: авторы не просто предложили метод, а подтвердили правдоподобие своей симуляции отдельным исследованием на 24 тысячах человеческих аннотаций. В тексте не названы ни авторы, ни их место работы, ни то, когда проводились эксперименты, и не приведены конкретные результаты по каждой из 12 моделей, судить о них можно только по описанным закономерностям.

Риски и подводные камни

Сами найденные закономерности, это же и предупреждение: модели по-разному и не всегда предсказуемо реагируют на то, как пользователь описывает ситуацию, иногда нуждаются в куда большем количестве деталей, чем человек, а более длинный диалог с уточняющими вопросами не гарантирует более точного вывода о мотивах другого человека. Это стоит учитывать, полагаясь на ИИ-ассистента в советах о реальных людях.