Исследователи Google предложили метод RRSI: агенты не заучивают тесты

Исследователи Google предложили метод RRSI: агенты не заучивают тесты

Современный ИИ-агент, это фиксированная языковая модель в «обвязке» (harness): наборе промптов, рабочих процессов, инструментов, памяти и логики, которая управляет тем, что модель видит на каждом шаге. Обвязка решает, прочитает ли агент нужный файл перед правкой, оправится ли после ошибки и аккуратно ли сдаст результат. По данным новой научной статьи, значительная часть недавнего прогресса агентов связана с работой над обвязкой, а не с новыми моделями.

Раньше обвязку правили вручную: люди разбирали неудачные прогоны и вносили исправления. Новые методы автоматизируют цикл: языковая модель сама раз за разом переписывает обвязку по обратной связи от тестовых задач. Исследователи называют это практической формой рекурсивного самоулучшения.

У такого подхода есть ловушка. Агент всё время работает на одном ограниченном наборе тестовых задач и в итоге запоминает их: баллы на обучающих задачах растут, а выигрыш на новых, невиданных задачах уменьшается или полностью исчезает. По словам исследователей, это происходит несколькими путями: поиск запоминает закономерности, подходящие только к одному бенчмарку; отдаёт предпочтение кандидатам, которые набирают баллы просто случайно; и накапливает лишнюю сложность, которая поднимает оценку, но не делает агента лучше.

RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) вмешивается в двух точках цикла, не лишая обвязку возможности полностью редактироваться. При предложении правок бюджет ограничивает, сколько независимых изменений кандидат может объединить сразу. Бюджет со временем сокращается: в первых раундах допустимы крупные переписывания, в поздних, лишь небольшие правки, которые можно чётко связать с результатом. Система помнит прошлые попытки, чтобы не гоняться за одними и теми же провальными идеями, а когда прогресс останавливается, намеренно пробует ещё не тронутые части обвязки. При отборе правок критик проверяет каждое предложение и отбрасывает те, в которых зашиты названия задач, готовые решения или другие приёмы, привязанные к конкретному бенчмарку. Ещё одно правило принимает рост вычислительных затрат только при измеримом приросте качества, а компоненты, переставшие помогать, удаляются.

RRSI проверили на восьми бенчмарках: программирование, офисные задачи агентов и инженерное проектирование. Базовая модель Claude Opus 4.8 всё время оставалась замороженной. Метод сравнили с неизменённой базовой обвязкой и четырьмя недавними методами оптимизации. По данным статьи, RRSI даёт прирост до 14,1 балла на задачах, на которых обучался, и до 4,7 балла на пяти бенчмарках, которых не видел (максимум, на JobBench). Расход токенов во время работы примерно на 30 процентов ниже, чем у версии без регуляризации. На невиданных бенчмарках результат ни разу не опустился ниже базового уровня, что для заучившей задачи обвязки обычно не так.

Все методы хорошо показали себя на обучающих задачах, но на новых результаты перевернулись: два метода оказались даже ниже базовой обвязки. У RRSI был самый маленький прирост на обучении среди всех вариантов, зато только он оказался заметно выше базового уровня на новых задачах. Среди оптимизированных обвязок RRSI требует меньше всего токенов и шагов, хотя неизменённая базовая обвязка ещё экономнее.

Находки переносятся и на более слабые модели: кодовая обвязка, оптимизированная с Gemini 3.5 Flash, подняла точность заметно более слабой Gemini 3.1 Flash Lite с 11,2 до 14,6 балла без каких-либо изменений. Найденные системой механизмы не зависят от возможностей модели, с помощью которой их обнаружили. Авторы отмечают, что исследование охватывает только обвязки вокруг замороженных моделей и не касается случаев, когда веса модели меняются. Вывод авторов: самоулучшение делает ИИ-агентов надёжно способнее только тогда, когда повторяющаяся обратная связь превращается в устойчивые изменения. Код доступен на GitHub.

Контекст из других работ: вручную спроектированные обвязки часто не обобщаются на новые задачи, на ARC-AGI-3 Opus 4.6 с целевой обвязкой набрал 97,1 процента в знакомой среде и 0 процентов в незнакомой. Nvidia недавно представила родственный метод SoL-Pi, где исследовательский агент автоматически перестраивает обвязку кодирующих агентов и сокращает расход токенов до 49 процентов без заметной потери качества.

Ключевые факты

  • RRSI, метод Google Cloud AI Research и нескольких университетов: языковая модель переписывает обвязку агента, но бюджет правок, критик и учёт затрат не дают ей подогнаться под тестовые задачи; сама модель остаётся замороженной.
  • Проверка на восьми бенчмарках (программирование, офисные задачи агентов, инженерное проектирование) с моделью Claude Opus 4.8 и в сравнении с четырьмя методами оптимизации.
  • Прирост до 14,1 балла на обучающих задачах и до 4,7 балла на пяти невиданных бенчмарках (максимум, на JobBench); на невиданных задачах результат ни разу не упал ниже базовой обвязки.
  • Около 30 процентов экономии токенов относительно версии метода без регуляризации; неизменённая базовая обвязка при этом ещё экономнее.
  • Обвязка, оптимизированная с Gemini 3.5 Flash, подняла Gemini 3.1 Flash Lite с 11,2 до 14,6 балла; исследование не охватывает случаи с изменением весов модели.

Почему это важно

Если значительная часть прогресса агентов приходит от обвязки, а не от новых моделей, то автоматическая оптимизация обвязки становится ключевым рычагом. Работа показывает слабое место такого подхода: агент заучивает тестовые задачи, и обучающие баллы не отражают реальной пользы. RRSI предлагает способ растить качество так, чтобы оно переносилось на новые задачи, и при этом тратить меньше токенов.

Кому это важно

Командам, которые строят ИИ-агентов и автоматизируют настройку их промптов, инструментов и рабочих процессов. Исследователям, оценивающим агентов на бенчмарках: работа напоминает, что рост оценки на знакомых задачах может быть подгонкой. Тем, кто следит за расходом токенов в продакшене.

Как это применить

Код опубликован на GitHub (ссылка в источнике не приведена). Идеи метода можно переносить на собственные циклы автооптимизации: ограничивать число независимых правок за шаг и сокращать этот лимит со временем, отсеивать правки с зашитыми названиями задач и решениями, принимать рост затрат только при измеримом приросте, удалять бесполезные компоненты. Оценивать результат стоит на задачах, которых оптимизатор не видел.

Можно ли доверять

Числа взяты из пересказа статьи в The Decoder, сама статья дана со слов издания: в тексте не названы ни название работы, ни конкретные авторы и университеты, ни полный список бенчмарков и конкурирующих методов. Результаты принадлежат авторам метода, а оценка «лучше всех на новых задачах» относится к их собственному набору из восьми бенчмарков и одной замороженной модели.

Риски и подводные камни

Исследование охватывает только обвязки вокруг замороженных моделей; случаи с меняющимися весами авторы не рассматривают. Прирост на невиданных задачах невелик (до 4,7 балла), а в источнике «баллы» не уточнены как процентные пункты или относительный рост. Экономия около 30 процентов токенов, относительно версии без регуляризации, а не базовой обвязки, которая экономнее. Результат переноса на более слабую модель описан для кодовой обвязки, а не для всех бенчмарков.