Microsoft Research представила EvoLib, модели учатся на опыте без дообучения

Microsoft Research опубликовала исследование «Test-Time Learning with an Evolving Library» и представила фреймворк EvoLib. Он позволяет большим языковым моделям учиться на собственном опыте прямо во время инференса (то есть в процессе обычной работы модели), без размеченных данных и без внешней обратной связи, и без изменения весов самой модели. Это значит, что EvoLib можно применить к любой модели или ИИ-системе, доступной только через API, то есть к «чёрному ящику», веса которого недоступны.
Вместо того чтобы просто копить в памяти сырые записи прошлых попыток, диалоги, цепочки рассуждений, истории действий, EvoLib извлекает из опыта переиспользуемые единицы знания: навыки, полученные из успешных решений, и рефлексивные выводы, извлечённые из ошибок. Эти единицы хранятся в «библиотеке знаний», которая постоянно перестраивается за счёт двух механизмов. Консолидация: когда появляется новое знание, система ищет в библиотеке похожее и объединяет их в более общую и переиспользуемую форму, применимую сразу к нескольким типам задач. Взвешивание: важность каждой единицы знания пересчитывается не только по немедленной пользе для текущей задачи, но и по вкладу, который она вносит в решение будущих задач, так знания с наибольшим долгосрочным эффектом со временем становятся заметнее в библиотеке.
Авторы проверили EvoLib на трёх типах задач: решение математических задач, написание кода с ограничениями по эффективности и принятие решений в сценариях взаимодействия со средой на длинном горизонте. На всех трёх типах EvoLib стабильно обходит подходы на основе поиска по памяти (retrieval-based) и другие механизмы абстрактной памяти, расходуя при этом меньше токенов. Отдельно оценили, насколько эффективно EvoLib превращает вычисления на этапе тестирования (test-time compute) в прирост качества: на всех трёх бенчмарках EvoLib показывает более высокое качество на большей части диапазона вычислений и растёт быстрее при увеличении их объёма, как по сравнению с методами масштабирования вычислений, решающими каждую задачу изолированно, так и по сравнению с сильными подходами на основе обучающейся памяти. Конкретные числовые показатели прироста в тексте блога не приводятся, там даны только графики и качественное сравнение.
Отдельно проверили устойчивость к порядку поступления задач: на одном и том же наборе разнородных задач, но в разной последовательности, EvoLib стабильно превосходит существующие подходы на основе обучающейся памяти и сохраняет устойчивое качество независимо от порядка. По словам авторов, это указывает на практическую пригодность фреймворка в реальных условиях, где агент сталкивается со смешанным потоком разнотипных запросов без заранее выстроенной программы обучения.
Код и результаты экспериментов выложены в открытом доступе на GitHub, для дальнейших исследований памяти и эволюции знаний в ИИ-системах.
Ключевые факты
- Microsoft Research представила EvoLib, фреймворк, который учит языковые модели на собственном опыте во время инференса, без разметки, без внешней обратной связи и без обновления весов модели.
- Опыт превращается не в архив сырых записей, а в переиспользуемые единицы знания: навыки из успешных решений и рефлексивные выводы из ошибок.
- Эволюция знаний строится на двух механизмах, консолидации похожих единиц в более общие и взвешивании важности знаний по их долгосрочной пользе для будущих задач.
- На задачах по математике, написанию кода с ограничениями по эффективности и принятию решений в длинных сценариях EvoLib обходит подходы на основе поиска по памяти при более экономном расходе токенов; точных цифр прироста в тексте не приведено.
- Качество EvoLib устойчиво к порядку поступления задач; код и результаты экспериментов опубликованы на GitHub.
Почему это важно
Большинство современных ИИ-агентов умеют хранить историю прошлых диалогов и действий, но простое накопление памяти, это ещё не обучение: чем больше архив, тем сложнее вытащить из него именно то знание, которое пригодится для новой задачи. EvoLib предлагает другой принцип, превращать опыт в компактную и постоянно уточняемую библиотеку навыков и выводов, а не в растущую свалку сырых записей. Это принципиально важно по мере того, как агенты берут на себя всё более длинные и сложные задачи: без механизма отбора и обобщения знания память быстро становится бесполезной.
Кому это важно
В первую очередь, разработчикам ИИ-агентов и систем на основе больших языковых моделей, у которых нет доступа к весам самой модели, а есть только доступ через API. Для них EvoLib предлагает способ «доучивать» систему поведением поверх модели, а не внутри неё. Также это важно исследователям, которые работают с архитектурами памяти и retrieval-подходами для агентов, EvoLib даёт альтернативный ориентир, с которым можно сравнивать собственные разработки.
Как это применить
Поскольку EvoLib не требует переобучения или дообучения весов, его в принципе можно подключить к любой языковой модели или ИИ-системе, работающей через API, как надстройку: система копит попытки решения задач, извлекает из них навыки и выводы, а дальше сама поддерживает библиотеку в актуальном состоянии через консолидацию и взвешивание. Практически это означает необходимость реализовать логику извлечения знания, хранения библиотеки и её периодического пересчёта; авторы опубликовали код и результаты экспериментов на GitHub, что позволяет разобраться в деталях реализации и опробовать подход на своих задачах.
Можно ли доверять
Это блог Microsoft Research по мотивам собственной исследовательской работы: результаты представлены самими авторами, без указания точных числовых показателей прироста качества в тексте публикации, только сравнительные графики и качественные формулировки вроде «стабильно обходит» и «показывает более высокое качество». Свидетельств независимой проверки или рецензирования сторонними лабораториями в тексте нет. При этом код и результаты экспериментов выложены в открытом доступе, что даёт возможность независимой проверки заявленных результатов.
Риски и подводные камни
В тексте не раскрываются вычислительные затраты на саму работу механизмов консолидации и взвешивания, а также то, как размер библиотеки знаний ведёт себя при очень долгой эксплуатации системы. Проверка проведена только на трёх типах задач, математических рассуждениях, написании кода и принятии решений в средах, поэтому неясно, насколько устойчиво преимущество подхода в других доменах и при выходе за пределы протестированных бенчмарков. Конкретных числовых показателей прироста качества автор блога не приводит, из-за чего масштаб реального выигрыша по сравнению с альтернативами трудно оценить со стороны.