Mind2Dialogue научил модели угадывать невысказанные убеждения и цели пользователя

По мере того как языковые модели становятся мощнее, долгосрочное взаимодействие с ними, в обучении, рассуждениях и принятии решений, требует, чтобы модель глубже понимала людей, которым помогает. Но обучение языковых моделей, ориентированных на человека, упирается в то, что авторы называют фундаментальным пробелом в обучающих данных: нынешние наборы данных для обучения ИИ-ассистентов содержат мало, если вообще содержат, продуманных ответов, которые явно опираются на невысказанные убеждения и цели пользователя. Масштабировать такой обучающий сигнал сложно в принципе, поскольку реальное ментальное состояние человека нельзя наблюдать напрямую.
Чтобы закрыть этот пробел, авторы предлагают фреймворк Mind2Dialogue: вместо того чтобы пытаться наблюдать реальные ментальные состояния пользователей, система их симулирует и использует симуляцию как привилегированный обучающий сигнал, доступный только на этапе обучения. Сначала психологически обоснованный симулятор генерирует связные диалоги: личностные черты «пользователя» остаются неизменными, а его ментальное состояние обновляется по ходу разговора. Ключевая идея, задать общее, эволюционирующее ментальное состояние, которое одновременно определяет поведение симулированного пользователя и направляет ответы ассистента-оракула: в отличие от модели, которая в итоге пойдёт в использование, этот ассистент-оракул имеет прямой доступ к ментальному состоянию. Дальше этап привилегированной дистилляции обучает выпускаемую модель на продуманных ответах ассистента-оракула, так итоговая модель учится действовать так, будто понимает убеждения и цели пользователя, хотя при реальном использовании доступа к самому ментальному состоянию у неё нет.
Оценивать результат авторы предлагают, объединив персонализацию с теорией психического (theory of mind), проверяя не только то, понимает ли модель человека, но и то, действует ли она исходя из этого понимания.
На полном обучающем корпусе Mind2Dialogue версии Qwen, Llama и OLMo обошли собственные базовые версии, дообученные на инструкциях (instruction-tuned), по каждой из заявленных метрик персонализации, включая прирост от 26,6 до 40,9 процентного пункта в метрике генерации с учётом предпочтений (preference-following generation). У Qwen и Llama улучшение не ограничилось персонализацией: оно распространилось и на задачи, где модель рассуждает об убеждениях и действиях собеседника, хотя точную величину этого прироста авторы не приводят, отмечая лишь, что эффект распространяется с результата по предпочтениям.
Авторы описывают Mind2Dialogue как основу для ИИ-помощников нового типа, способных понимать убеждения и намерения, стоящие за словами человека, и поддерживать его долгосрочные цели в образовании, работе и повседневной жизни. Но это заявлено как направление на будущее, а не как уже продемонстрированный результат.
Ключевые факты
- Mind2Dialogue, фреймворк для обучения языковых моделей, ориентированных на человека: он симулирует ментальное состояние пользователя и использует эту симуляцию как привилегированный обучающий сигнал, которого нет в обычных датасетах для ассистентов.
- Психологически обоснованный симулятор сохраняет неизменными личностные черты «пользователя», но по ходу диалога обновляет его ментальное состояние; это же состояние одновременно определяет поведение пользователя и ответы ассистента-оракула, у которого есть прямой доступ к состоянию.
- Привилегированная дистилляция обучает выпускаемую модель только на продуманных ответах ассистента-оракула, так модель учится действовать, будто понимает убеждения и цели пользователя, хотя доступа к его реальному ментальному состоянию при использовании у неё нет.
- На полном обучающем корпусе Mind2Dialogue версии Qwen, Llama и OLMo обошли свои базовые версии, дообученные на инструкциях, по всем метрикам персонализации, прибавив от 26,6 до 40,9 процентного пункта в метрике генерации с учётом предпочтений.
- У Qwen и Llama прирост распространился и на рассуждения об убеждениях и действиях собеседника, за пределы одной персонализации, хотя точная величина этого прироста в статье не названа.
Почему это важно
Обучающие датасеты для ИИ-ассистентов сегодня почти не содержат ответов, явно опирающихся на невысказанные убеждения и цели пользователя, а масштабировать такой сигнал сложно, потому что реальное ментальное состояние человека нельзя пронаблюдать напрямую. Mind2Dialogue обходит эту проблему не попыткой подсмотреть настоящие ментальные состояния, а их симуляцией: психологически обоснованный симулятор генерирует диалоги с эволюционирующим состоянием пользователя, а ассистент-оракул с прямым доступом к этому состоянию даёт продуманные ответы. Модель, которая в итоге пойдёт в использование, обучается на этих ответах через привилегированную дистилляцию, и при работе с настоящими пользователями доступ к их ментальному состоянию ей уже не нужен. Это попытка закрыть нехватку данных о скрытых мотивах пользователя не сбором таких данных, а их синтезом.
Кому это важно
В первую очередь, исследователям и лабораториям, которые разрабатывают модели с персонализацией и теорией психического (theory of mind), особенно тем, кто отталкивается от Qwen, Llama или OLMo: именно эти три семейства авторы взяли базовыми для сравнения. Авторы формулируют и более широкую цель, использовать симуляцию пользователя как основу для ИИ-помощников, которые понимают убеждения и намерения за словами человека и поддерживают его долгосрочные цели в образовании, работе и повседневной жизни. Но эта цель заявлена как направление на будущее, а не как уже работающий продукт.
Как это применить
То, что описано в статье, двухэтапный процесс обучения, а не готовый инструмент или релиз. Сначала психологически обоснованный симулятор генерирует диалоги, обновляя общее ментальное состояние, которое определяет поведение симулированного пользователя, а ассистент-оракул с доступом к этому состоянию даёт на него продуманные ответы. Затем привилегированная дистилляция обучает выпускаемую модель исключительно на ответах ассистента-оракула. В тексте не сказано, будут ли открыты исходный код и обучающий корпус Mind2Dialogue, и не указаны ни размер этого корпуса, ни размеры или версии базовых моделей Qwen, Llama и OLMo, поэтому воспроизвести пайплайн или сравнение по одной аннотации пока не получится.
Можно ли доверять
Источник, карточка препринта на HuggingFace Papers, то есть цифры, это результаты, заявленные самими авторами. То, что прирост по всем метрикам персонализации повторяется сразу на трёх независимых семействах базовых моделей, Qwen, Llama и OLMo, разумная внутренняя проверка на согласованность, но абстракт не даёт ни внешнего бенчмарка, ни доверительных интервалов, ни сравнения с обучением на реальных, а не симулированных, ментальных состояниях. На момент подготовки этого материала запись на HuggingFace Papers набрала всего 2 отметки и 1 комментарий, независимая проверка сообществом пока минимальна.
Риски и подводные камни
Продуманные ответы ассистента-оракула опираются на симулированное ментальное состояние, а не на настоящее, значит, качество обучающего сигнала целиком зависит от того, насколько психологически обоснованный симулятор точно воспроизводит реальные убеждения и намерения людей; систематическая ошибка симулятора перейдёт прямиком в обученного ассистента. Для прироста в рассуждениях об убеждениях и действиях собеседника у Qwen и Llama авторы не приводят числа, в отличие от точного диапазона для метрики генерации с учётом предпочтений, сказано лишь, что эффект распространяется. В тексте не указан размер обучающего корпуса Mind2Dialogue, а также размеры и версии базовых моделей Qwen, Llama и OLMo, из-за этого масштаб и честность сравнения нельзя независимо оценить по одной аннотации.
«Ключевая идея, задать общее, эволюционирующее ментальное состояние, которое определяет поведение пользователя и направляет ответы ассистента-оракула.»
— авторы Mind2Dialogue