ActObs: агентов научили предсказывать наблюдения среды, а не только действия

Авторы препринта «Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL» указывают на особенность типового обучения ИИ-агентов: на этапе контролируемого дообучения (SFT) модель штрафуют только за токены собственных действий, а токены наблюдений среды, то, что агент видит в ответ на свои шаги, используются лишь как контекст и никогда не становятся целью предсказания. Авторы задаются вопросом, даёт ли такой подход лучшую стартовую точку для последующего обучения с подкреплением (RL), и предлагают метод ActObs, который дополнительно обучает модель предсказывать и токены наблюдений, те, что и так уже есть в записанных траекториях агента. Развёрнутый агент никогда сам не генерирует наблюдения, но, по мысли авторов, обучение их предсказывать заставляет модель выстраивать внутреннее представление о последствиях своих действий, без дополнительных данных, параметров, токенов в последовательности или дополнительных проходов по сети.
На этапе SFT ActObs и обычный (action-only) подход показывают похожие результаты, но расходятся после RL-обучения по алгоритму GRPO. На модели Qwen3-4B агент, дообученный по ActObs, на бенчмарке Terminal-Bench 2.0 показывает более высокий pass@k (доля решённых задач при k попытках) при любом проверенном бюджете попыток, чем агент, обученный только на действиях, точная величина разрыва в тексте не приводится. На модели Qwen3-8B картина иная: ActObs немного жертвует надёжностью с первой попытки (pass@1), но выигрывает по pass@k, прирост составляет +3,4 процентного пункта на pass@16, и решает больше уникальных задач. Преимущество сохраняется и на смежной задаче редактирования кода на бенчмарке aider-polyglot, чьи задачи модель не видела ни на этапе SFT, ни на этапе RL: здесь прирост pass@1 у 4B-модели составляет +4,2 процентного пункта.
По наблюдениям авторов, при RL-обучении ActObs сохраняет больше энтропии политики и требует меньшего сдвига параметров, так что итоговая модель остаётся ближе к своей точке после SFT. Разбирая причины, авторы прослеживают разницу к самому этапу SFT: при обучении только на действиях градиенты, отвечающие за действия и за наблюдения, быстро становятся ортогональными друг другу, при этом у наблюдений остаётся крупный «остаточный» градиент, а способность модели предсказывать реакцию среды после такого обучения падает ниже уровня базовой модели. Совместное обучение на действиях и наблюдениях, по утверждению авторов, не даёт возникнуть этой односторонней специализации: модель сохраняет способность предсказывать последствия своих шагов, что и готовит её к более эффективному исследованию среды на этапе RL.
Ключевые факты
- ActObs дополнительно обучает модель предсказывать токены наблюдений среды, а не только действия, без новых данных, параметров и вычислений.
- После SFT методы почти не отличаются, расхождение проявляется только после RL-обучения по алгоритму GRPO.
- На Qwen3-8B ActObs даёт +3,4 п.п. по pass@16 на Terminal-Bench 2.0 ценой части надёжности pass@1, решая при этом больше задач.
- На задаче редактирования кода aider-polyglot (не видна модели при обучении) прирост pass@1 у 4B-модели, +4,2 п.п.
- Причина эффекта, в SFT: при обучении только на действиях градиенты действий и наблюдений расходятся, и способность предсказывать среду проседает ниже базовой модели; совместное обучение это предотвращает.
Почему это важно
Работа указывает на слепое пятно в типичном пайплайне обучения ИИ-агентов: стандартное дообучение перед RL полностью игнорирует наблюдения среды как обучающий сигнал, хотя они присутствуют в каждой записанной траектории агента бесплатно. ActObs показывает, что это упущение не нейтрально: обучение только на действиях не просто «недоиспользует» данные, а активно портит способность модели предсказывать последствия своих шагов, она проседает ниже уровня базовой модели ещё до начала RL. Это меняет стартовую точку для всего последующего обучения с подкреплением и, как показывают эксперименты, отражается на итоговом качестве агента.
Кому это важно
Прежде всего, исследователям и инженерам, которые обучают ИИ-агентов (для работы с терминалом, кодом, инструментами) по связке «SFT + RL». Метод не требует дополнительных данных или вычислительных ресурсов сверх уже используемых при обучении, меняется только то, какие токены штрафуются на этапе SFT. Это делает ActObs практичной надстройкой поверх существующих пайплайнов дообучения агентов, а не отдельной дорогостоящей техникой.
Как это применить
Технически ActObs, это модификация функции потерь на этапе SFT: помимо токенов действий агента, в неё включаются токены уже присутствующих в траектории наблюдений среды. Дальше модель дообучается обычным RL-алгоритмом (в экспериментах, GRPO). Авторы проверили подход на моделях Qwen3-4B и Qwen3-8B на задачах работы в терминале (Terminal-Bench 2.0) и редактирования кода (aider-polyglot); в тексте не раскрыты ни конкретная формула добавленного лосса, ни требования по вычислительным ресурсам или времени обучения сверх стандартной схемы.
Можно ли доверять
Материал, препринт на Hugging Face Papers, авторство в самой аннотации не раскрыто (указано только по метаданным площадки). Заявленные числа (+3,4 п.п. на pass@16 для Qwen3-8B, +4,2 п.п. на pass@1 для 4B-модели на aider-polyglot) взяты дословно из текста, но это результаты одной исследовательской группы без независимого воспроизведения; для случая Qwen3-4B на Terminal-Bench 2.0 в тексте вообще нет числового значения, только формулировка «выше при любом бюджете попыток».
Риски и подводные камни
В тексте не раскрыты ни точная формула лосса ActObs, ни затраты по вычислениям или времени обучения, оценить стоимость внедрения метода со стороны нельзя. Результаты получены на сравнительно небольших моделях (4B и 8B параметров) и двух конкретных бенчмарках; неясно, сохранится ли эффект на более крупных моделях или других типах задач агентов. ActObs также жертвует частью надёжности с первой попытки (pass@1) ради роста pass@k на Qwen3-8B, то есть выигрыш зависит от того, сколько попыток решения задачи допускает конкретный сценарий использования.