ASPIRE: бенчмарк показал, что ИИ-агенты пока слабо самообучаются по расплывчатым целям

ASPIRE: бенчмарк показал, что ИИ-агенты пока слабо самообучаются по расплывчатым целям

Многие важные формы обучения человека начинаются с расплывчатой цели, например, «стать лучше как физик» или «прокачать исследовательские навыки». Человеку приходится самому истолковать цель, найти пробелы в собственных знаниях и умениях, решить, как учиться, и в конце понять, действительно ли он продвинулся. Работы по самообучению (self-evolution) языковых моделей устроены иначе: агенту заранее задают конкретную задачу и метрику оценки, и самообучение сводится к оптимизации явно сформулированной цели, а не к самостоятельному решению, чему и как учиться.

Чтобы проверить агентов в более реалистичной постановке, авторы работы представили ASPIRE, бенчмарк для оценки самообучения именно по расплывчатым целям. В ASPIRE агенту дают только словесную формулировку цели на естественном языке, а итоговые задачи, по которым его будут оценивать, от него скрыты. Агент должен сам операционализировать цель: выбрать данные и способ дообучения, построить сигналы для тренировки и проверки и решить, когда пора оценивать результат. ASPIRE поддерживает и эволюцию весов самой модели, и эволюцию её обвязки (harness) в едином интерактивном окружении, а итоговые системы проверяют на скрытом наборе из 520 заданий, составленном экспертами и охватывающем шесть разных целей.

Эксперименты показали: расплывчатая цель заставляет агентов тратить основные усилия на то, чтобы понять саму цель, а не на решение задачи. Современные агенты регулярно доводят до конца циклы обучения и правки собственной обвязки, но улучшение на уровне весов модели остаётся редким и нестабильным, а лучшая из полученных обвязок всё равно уступает заранее написанному вручную эталонному решению Qwen-Agent. Агенты часто обучаются на данных, которые плохо соответствуют цели, и слишком доверяют собственной, узко построенной самооценке, из-за этого локальные улучшения не переносятся на скрытую проверку, а продолжение поиска и обучения иногда стирает уже достигнутый прогресс.

Ключевые факты

  • ASPIRE, бенчмарк, который проверяет, способны ли ИИ-агенты самостоятельно совершенствоваться, получив только расплывчатую словесную цель (например, «стать лучше как физик»), без заранее заданных задач и метрик.
  • Агенту не показывают итоговые задачи оценки: он сам выбирает данные и способ дообучения, строит сигналы для тренировки и проверки и решает, когда пора оценивать прогресс.
  • ASPIRE охватывает и эволюцию весов модели, и эволюцию её обвязки (harness); системы проверяют на скрытом наборе из 520 заданий по шести целям, составленном экспертами.
  • Современные агенты доводят до конца циклы обучения и правки обвязки, но улучшение весов модели остаётся редким и нестабильным, а лучшая обвязка всё равно уступает эталонному решению Qwen-Agent.
  • Агенты часто обучаются на несоответствующих цели данных и слишком доверяют собственной узкой самооценке: локальные успехи не подтверждаются на скрытой проверке, а долгое обучение иногда стирает уже достигнутый прогресс.

Почему это важно

Большинство работ о «самообучающихся» ИИ-агентах на деле проверяет их на уже готовых, явно сформулированных задачах и метриках, агент просто оптимизирует то, что ему заранее подсказали. ASPIRE впервые системно проверяет более сложный, близкий к человеческому сценарий: агенту дают только расплывчатую цель, а понять, что и как улучшать, приходится ему самому. Это меняет саму постановку вопроса о самообучении, с «умеет ли агент оптимизировать заданную метрику» на «умеет ли агент понять, чего от него вообще хотят».

Кому это важно

Тем, кто разрабатывает и оценивает автономных ИИ-агентов и методы их дообучения: бенчмарк даёт способ проверить агента не на подогнанной под задачу метрике, а на изначально нечётко поставленной цели, ближе к тому, как люди на практике ставят задачи друг другу. Важно и тем, кто сравнивает разные способы построения обвязки (harness) агентов: ASPIRE явно разделяет улучшение весов модели и улучшение её обвязки как два разных канала прогресса.

Как это применить

ASPIRE можно использовать как тестовый стенд при разработке новых методов самообучения агентов: агенту дают только словесное описание цели, реальные критерии оценки скрывают и смотрят, справится ли он, через дообучение весов модели или через правку собственной обвязки. Результат сверяют со скрытым набором из 520 составленных экспертами заданий по шести целям, не позволяя агенту заранее подсмотреть в критерии оценки.

Можно ли доверять

В тексте не назван ни один конкретный агент или модель, участвовавшие в экспериментах, только Qwen-Agent как заранее написанный вручную эталон для сравнения; конкретных численных показателей (баллов, точности) не приведено, только качественные формулировки вроде «редкий и нестабильный прирост» и «уступает эталону». Это не позволяет независимо оценить масштаб эффекта по цифрам, но сама методика, скрытая оценка на 520 экспертных заданиях вместо явно заданной агенту метрики, выглядит содержательным ответом на проблему, которую описывают сами авторы: агенты слишком доверяют собственной, узко построенной самооценке.

Риски и подводные камни

Главный риск, который выявляет сам бенчмарк: агенты обучаются не на тех данных, которые реально нужны для цели, и оценивают свой прогресс по метрикам, которые придумали себе сами, из-за чего локальные успехи не подтверждаются на скрытой проверке. Второй риск, нестабильность: по данным экспериментов, продолжение поиска и обучения иногда не улучшает, а стирает уже достигнутый прогресс, то есть более долгая тренировка не гарантирует более сильный результат. Наконец, лучшая из полученных агентами обвязок всё ещё уступает заранее написанному вручную решению Qwen-Agent, самостоятельная эволюция агента пока не обгоняет инженерную работу человека даже на этом тесте.