BAIR предложила ABBEL для обучения нейросетей на длинных диалогах

BAIR предложила ABBEL для обучения нейросетей на длинных диалогах

Berkeley AI Research (BAIR) представила ABBEL, фреймворк для обучения языковых моделей, которым приходится работать с человеком сотни или тысячи шагов. Полную историю такого взаимодействия невозможно постоянно держать в контексте, поэтому модели обычно периодически делают краткое резюме истории. Авторы отмечают, что этот подход экономит контекст, но заметно ухудшает качество: в игре Combination Lock, похожей на Wordle и допускающей до 16 попыток, модель с резюме улучшалась при дообучении с подкреплением, однако так и не догнала модель с полным контекстом.

В ABBEL резюме оформляется как естественно-языковое «состояние убеждений». После нового наблюдения модель обновляет это состояние, а при выборе следующего действия использует только обновлённое состояние, а не всю историю. Отдельная процедура belief grading оценивает, сохранилась ли в таком состоянии нужная информация. Для задач программирования критериями могут быть, например, краткость состояния и возможность восстановить изменения в Git; когда подходящие эвристики трудно задать, BAIR предлагает оценивать, насколько текущая модель сможет по состоянию убеждений восстановить последнее наблюдение.

Авторы проверили общий вариант с оценкой по восстановлению в CollabBench из Sweet-RL, среде для совместного программирования, где агент задаёт уточняющие вопросы и затем сдаёт функцию на скрытые модульные тесты. По их данным, ABBEL примерно вдвое сократил разрыв с моделями, которым доступен полный контекст, и достиг результата за 50% меньшее число шагов обучения, чем модель, которую учат суммаризировать без belief grading. После обучения ABBEL по-прежнему использует существенно меньше памяти.

Ключевые факты

  • ABBEL заменяет полную историю длинного диалога естественно-языковым состоянием убеждений, которое модель периодически обновляет по новым данным.
  • Обычная рекурсивная суммаризация экономит контекст, но в тесте Combination Lock модель с резюме не ликвидировала отставание от модели с полным контекстом даже при дообучении с подкреплением.
  • Belief grading добавляет вспомогательную задачу обучения с подкреплением: состояние оценивают по тому, какую полезную информацию из истории оно сохраняет.
  • В CollabBench метод с оценкой по восстановлению сократил разрыв с полным контекстом примерно на 50% и потребовал на 50% меньше шагов обучения, чем обучение суммаризации без этой оценки.

Почему это важно

Длинные взаимодействия особенно нужны помощникам по программированию, но хранить всю историю сотен или тысяч шагов в контексте непрактично. ABBEL пытается сохранить выгоду от сжатия контекста, отдельно обучая модель тому, что именно должно оставаться в её кратком рабочем состоянии.

Кому это важно

Подход адресован разработчикам и исследователям языковых моделей для длительных интерактивных задач, прежде всего совместного программирования. В качестве мотивирующего примера BAIR использует агента, который уточняет задачу у человека и пишет функцию для проверки скрытыми тестами.

Как это применить

В ABBEL после наблюдения модель обновляет текстовое состояние убеждений, а затем выбирает действие, опираясь на него. При обучении можно задать предметные критерии качества такого состояния, например, баланс краткости и возможности восстановить Git diff, либо использовать оценку того, насколько модель восстановит последнее наблюдение по состоянию убеждений.

Можно ли доверять

Это исследовательское сообщение BAIR с описанием метода и собственных экспериментов. Приведённые результаты относятся к CollabBench из Sweet-RL и к сравнению с обучением суммаризации без belief grading; в тексте не утверждается, что метод уже доказал преимущество во всех длительных задачах.

Риски и подводные камни

Качество сжатого состояния зависит от того, удерживает ли оно критически важные детали истории. Авторы прямо показывают, что простая суммаризация может не догнать полный контекст; кроме того, для некоторых областей трудно вручную сформулировать хорошие критерии оценки, поэтому ABBEL предлагает общий критерий восстановления последнего наблюдения.

«Мы сокращаем разрыв в качестве с моделями с полным контекстом примерно на 50% и обучаемся за 50% меньшее число шагов по сравнению с обучением моделей суммаризировать без belief grading.»

— Berkeley AI Research