BAIR предложила ABBEL для обучения нейросетей на длинных диалогах

Berkeley AI Research (BAIR) представила ABBEL, фреймворк для обучения языковых моделей, которым приходится работать с человеком сотни или тысячи шагов. Полную историю такого взаимодействия невозможно постоянно держать в контексте, поэтому модели обычно периодически делают краткое резюме истории. Авторы отмечают, что этот подход экономит контекст, но заметно ухудшает качество: в игре Combination Lock, похожей на Wordle и допускающей до 16 попыток, модель с резюме улучшалась при дообучении с подкреплением, однако так и не догнала модель с полным контекстом.
В ABBEL резюме оформляется как естественно-языковое «состояние убеждений». После нового наблюдения модель обновляет это состояние, а при выборе следующего действия использует только обновлённое состояние, а не всю историю. Отдельная процедура belief grading оценивает, сохранилась ли в таком состоянии нужная информация. Для задач программирования критериями могут быть, например, краткость состояния и возможность восстановить изменения в Git; когда подходящие эвристики трудно задать, BAIR предлагает оценивать, насколько текущая модель сможет по состоянию убеждений восстановить последнее наблюдение.
Авторы проверили общий вариант с оценкой по восстановлению в CollabBench из Sweet-RL, среде для совместного программирования, где агент задаёт уточняющие вопросы и затем сдаёт функцию на скрытые модульные тесты. По их данным, ABBEL примерно вдвое сократил разрыв с моделями, которым доступен полный контекст, и достиг результата за 50% меньшее число шагов обучения, чем модель, которую учат суммаризировать без belief grading. После обучения ABBEL по-прежнему использует существенно меньше памяти.
Ключевые факты
- ABBEL заменяет полную историю длинного диалога естественно-языковым состоянием убеждений, которое модель периодически обновляет по новым данным.
- Обычная рекурсивная суммаризация экономит контекст, но в тесте Combination Lock модель с резюме не ликвидировала отставание от модели с полным контекстом даже при дообучении с подкреплением.
- Belief grading добавляет вспомогательную задачу обучения с подкреплением: состояние оценивают по тому, какую полезную информацию из истории оно сохраняет.
- В CollabBench метод с оценкой по восстановлению сократил разрыв с полным контекстом примерно на 50% и потребовал на 50% меньше шагов обучения, чем обучение суммаризации без этой оценки.
Почему это важно
Длинные взаимодействия особенно нужны помощникам по программированию, но хранить всю историю сотен или тысяч шагов в контексте непрактично. ABBEL пытается сохранить выгоду от сжатия контекста, отдельно обучая модель тому, что именно должно оставаться в её кратком рабочем состоянии.
Кому это важно
Подход адресован разработчикам и исследователям языковых моделей для длительных интерактивных задач, прежде всего совместного программирования. В качестве мотивирующего примера BAIR использует агента, который уточняет задачу у человека и пишет функцию для проверки скрытыми тестами.
Как это применить
В ABBEL после наблюдения модель обновляет текстовое состояние убеждений, а затем выбирает действие, опираясь на него. При обучении можно задать предметные критерии качества такого состояния, например, баланс краткости и возможности восстановить Git diff, либо использовать оценку того, насколько модель восстановит последнее наблюдение по состоянию убеждений.
Можно ли доверять
Это исследовательское сообщение BAIR с описанием метода и собственных экспериментов. Приведённые результаты относятся к CollabBench из Sweet-RL и к сравнению с обучением суммаризации без belief grading; в тексте не утверждается, что метод уже доказал преимущество во всех длительных задачах.
Риски и подводные камни
Качество сжатого состояния зависит от того, удерживает ли оно критически важные детали истории. Авторы прямо показывают, что простая суммаризация может не догнать полный контекст; кроме того, для некоторых областей трудно вручную сформулировать хорошие критерии оценки, поэтому ABBEL предлагает общий критерий восстановления последнего наблюдения.
«Мы сокращаем разрыв в качестве с моделями с полным контекстом примерно на 50% и обучаемся за 50% меньшее число шагов по сравнению с обучением моделей суммаризировать без belief grading.»
— Berkeley AI Research