Experience Distillation переносит опыт ИИ-агентов в веса модели

Обучение ИИ-агентов в реальных условиях часто дорого: им приходится проводить длительные эксперименты или получать обратную связь от людей. Обучение в контексте позволяет агенту эффективно использовать историю собственных взаимодействий, но этот эффект исчезает, когда историю убирают из контекста.
Авторы называют предложенный способ Experience Distillation, дистилляцией опыта. Он переносит информацию из уже собранной истории взаимодействий в веса модели и не требует после этого дополнительных взаимодействий со средой. Тем самым работа пытается совместить экономность обучения в контексте с возможностью сохранить полученный опыт в самой модели.
Метод проверили на 749 отобранных задачах по разработке программного обеспечения и шести текстовых приключенческих играх. В обеих областях он сохранял не менее 64,8% улучшения, которое давало обучение в контексте. Для сравнения, прямое контролируемое дообучение на собранном опыте восстанавливало лишь 3,8% этого улучшения.
В сравнении с классическими базовыми методами обучения с подкреплением схема «обучение в контексте на опыте проб и ошибок, затем дистилляция опыта» достигала сопоставимой производительности, используя как минимум в 9,6 раза меньше образцов среды.
Ключевые факты
- Experience Distillation переносит историю уже собранных взаимодействий агента в веса модели и не требует новых взаимодействий со средой.
- Проверка охватила 749 задач по разработке программного обеспечения и шесть текстовых приключенческих игр.
- Метод сохранил не менее 64,8% выигрыша от обучения в контексте в обеих областях.
- Прямое контролируемое дообучение на том же опыте восстановило только 3,8% выигрыша от обучения в контексте.
- По сравнению с классическими методами обучения с подкреплением подходу потребовалось как минимум в 9,6 раза меньше образцов среды при сопоставимой производительности.
Почему это важно
История проб и ошибок помогает агенту учиться в контексте, но польза пропадает, если эту историю удалить. Предложенная дистилляция опыта предназначена для сохранения части такого выигрыша в весах модели без дополнительного сбора опыта во внешней среде.
Кому это важно
Подход относится к разработчикам и исследователям ИИ-агентов, для которых взаимодействия со средой дороги: например, когда нужны длительные эксперименты или обратная связь от людей. Авторы также проверяли его на задачах программирования и текстовых играх.
Как это применить
Сначала агент обучается в контексте на уже собранном опыте проб и ошибок, затем этот опыт дистиллируют в веса модели. По описанию работы, после сбора опыта этот этап не требует дополнительных взаимодействий со средой.
Можно ли доверять
Результаты основаны на экспериментах авторов на 749 задачах по разработке программного обеспечения и шести текстовых приключенческих играх. В этих двух наборах метод сохранил не менее 64,8% выигрыша от обучения в контексте; это заявленные в работе экспериментальные результаты.
Риски и подводные камни
Сравнение охватывает две области, задачи по разработке программного обеспечения и текстовые приключенческие игры. Из приведённого описания не следует, что те же показатели сохранятся для других сред и типов агентных задач; кроме того, метод сохраняет часть, а не весь выигрыш от обучения в контексте.