CAST: игровые решатели стали учителями для ИИ-агентов

CAST: игровые решатели стали учителями для ИИ-агентов

Обучение LLM-агентов действовать в длинных многошаговых играх, шаг к универсальным системам принятия решений, но обучение с подкреплением по проверяемым наградам (RLVR) обычно опирается на редкую финальную награду: агент узнаёт, выиграл он партию или нет, но не узнаёт, какие именно ходы по пути к результату были верными или ошибочными.

Авторы работы заметили, что игровой решатель (программа, умеющая просчитывать игру) по ходу партии меняет свою оценку состояния, и по этому изменению видно, приближает конкретное действие агента к успеху или отдаляет от него. На этой идее построен метод CAST (Credit Assignment from Solver Teachers, присвоение заслуги от решателей-учителей): он превращает изменения оценки решателя в показатель преимущества (solver advantage) и добавляет его в RLVR как сигнал на уровне каждого отдельного хода, а не только в конце партии.

Авторы также показывают: при допущении, что решатель «почти оптимален» (soft-optimal solver), максимизация этого показателя преимущества математически эквивалентна дистилляции на основе текущей политики агента (on-policy distillation) от решателя-учителя. Разница в том, что для такой дистилляции нужны только скалярные оценки состояния, а не полные логиты учителя, как в классической дистилляции моделей, это упрощает интеграцию решателя в обучение.

Метод проверили на трёх играх: Сокобан (Sokoban), Сапёр (Minesweeper) и головоломке про разъезд машин Rush Hour. CAST обошёл все обученные базовые модели на каждой из трёх игр, и на привычных уровнях сложности, и на уровнях, которых агент не видел при обучении. Кроме того, среди сравниваемых методов CAST показал лучший средний результат без дополнительного обучения (zero-shot) на двух других бенчмарках агентов, ALFWorld и WebShop, где решателя для подсказок уже не использовали.

Код для воспроизведения работы выложен в открытом доступе на GitHub (Wloner0809/CAST).

Ключевые факты

  • CAST превращает изменения оценки состояния у игрового решателя в сигнал преимущества (solver advantage) и добавляет его в RLVR как награду за каждый отдельный ход агента, а не только за итог партии
  • При допущении «почти оптимального» решателя максимизация этого сигнала эквивалентна дистилляции от решателя на основе текущей политики агента, и требует только скалярных оценок состояния, а не полных логитов учителя
  • На играх Сокобан, Сапёр и Rush Hour CAST обошёл все обученные базовые модели, и на обычных уровнях сложности, и на уровнях, не встречавшихся при обучении
  • На бенчмарках ALFWorld и WebShop, где решателя не применяли, CAST показал лучший средний результат без дополнительного обучения среди сравниваемых методов
  • Код работы открыт на GitHub (Wloner0809/CAST)

Почему это важно

Главная проблема обучения ИИ-агентов на длинных задачах с обучением с подкреплением по проверяемым наградам (RLVR), редкая награда: агент узнаёт только итог всей партии, а не то, какие из десятков промежуточных ходов были решающими. Это делает обучение медленным и шумным. CAST предлагает способ получить плотный сигнал на каждый ход, используя не человеческую разметку, а готовый игровой решатель, программу, которая и так умеет просчитывать состояние игры.

Кому это важно

Работа адресована исследователям, которые обучают LLM-агентов действовать в многошаговых средах, играх, симуляциях, задачах планирования, методами обучения с подкреплением. Полезна тем, кто ищет способ давать агенту обратную связь за каждый шаг без дорогой разметки человеком, если для задачи существует (или может быть построен) достаточно точный решатель.

Как это применить

Код метода и эксперименты выложены в открытом доступе на GitHub (Wloner0809/CAST). Практическое условие применения, наличие игрового решателя, способного оценивать состояние игры числом; метод требует только этих скалярных оценок, а не полного набора логитов учителя, что упрощает интеграцию по сравнению с классической дистилляцией моделей.

Можно ли доверять

Результаты показаны на трёх играх (Сокобан, Сапёр, Rush Hour) с проверкой как на привычных, так и на незнакомых уровнях сложности, а также на двух независимых бенчмарках агентов (ALFWorld, WebShop) без дополнительного обучения, это указывает на способность метода обобщаться за пределы игр, где его тренировали. Это препринт HuggingFace Papers с открытым кодом; независимой проверки или публикации в рецензируемом издании в тексте не упомянуто, а все проверки пока ограничены игровыми и симуляционными средами, а не реальными задачами.

Риски и подводные камни

Метод работает только там, где есть (или может быть построен) достаточно точный игровой решатель, для большинства реальных задач вне игр такого решателя просто нет. Теоретическая эквивалентность CAST дистилляции от решателя опирается на допущение о «почти оптимальности» решателя (soft-optimal solver), которое на практике выполняется лишь приблизительно. Наконец, все результаты получены на компактных играх-головоломках, перенос подхода на более сложные и реалистичные среды пока не проверен.