Elo-per-token: методика показала предел роста ИИ-агентов

Elo-per-token: методика показала предел роста ИИ-агентов

ИИ-агенты на основе больших языковых моделей тратят вычисления во время работы неравномерно: они переписывают решения, вызывают инструменты, пробуют альтернативы и сами решают, когда остановиться. Из-за этого трудно измерить, как качество агента растёт вместе с объёмом потраченных вычислений, обычные метрики плохо ловят прогресс внутри длинной сессии. Чтобы закрыть этот пробел, исследователи предложили метод Elo-per-token analysis.

Метод работает на задачах с открытым концом, где промежуточные попытки решения можно оценить числом сразу, а не только по финальному результату, так прогресс виден на всей траектории. Elo-per-token отслеживает лучшее из найденных решений на каждом уровне израсходованных токенов, а затем через модель Брэдли-Терри переводит внутризадачные ранжирования в рейтинг Эло, который можно сравнивать между задачами с разными шкалами оценки. Метод применили к четырём универсальным ИИ-агентам на четырёх открытых бенчмарках, с сессиями длиной до 100 млн токенов, а также к трём инструментам оптимизации на основе обратной связи от LLM в контролируемых экспериментах на одной задаче. Названия конкретных агентов, бенчмарков и инструментов оптимизации в тексте не раскрываются.

В качестве опорной линии авторы используют независимую (случайную) выборку решений, для которой теоретически рейтинг Эло растёт линейно с логарифмом объёма вычислений. Относительно этой опоры агенты на старте наращивают Эло быстрее случайного перебора, но их предельный прирост со временем сокращается и в итоге падает ниже опорного уровня, агент «замедляется». Для контраста авторы посмотрели на сильнейших людей-участников прошлых соревнований AtCoder Heuristic Contest на тех же задачах: их результат со временем улучшается сверхлинейно, то есть люди продолжают учиться по ходу решения и обладают заметным запасом роста уже после того момента, где агенты замедляются.

На основе этого авторы вводят «точку перегиба масштабирования», бюджет токенов на одну сессию, при котором предельный прирост Эло сравнивается с опорным уровнем случайной выборки. Использовав эту точку как размер одной сессии, они разбили общий бюджет в 100 млн токенов на несколько параллельных сессий на задаче FrontierCS Polyomino Packing и получили +264 Эло по сравнению с одной длинной сессией и +355 Эло по сравнению с десятью короткими сессиями.

Ключевые факты

  • Elo-per-token отслеживает лучшее решение агента на каждом уровне израсходованных токенов и через модель Брэдли-Терри переводит прогресс в рейтинг Эло, сравнимый между задачами с разными шкалами оценки.
  • Метод применили к четырём универсальным ИИ-агентам на четырёх открытых бенчмарках (сессии до 100 млн токенов) и к трём инструментам оптимизации на основе обратной связи от LLM; их названия в тексте не раскрыты.
  • Относительно случайного перебора решений, чей рейтинг Эло теоретически растёт линейно с логарифмом вычислений, агенты сначала наращивают Эло быстрее, но со временем предельный прирост падает ниже этого опорного уровня.
  • Сильнейшие люди-участники соревнований AtCoder Heuristic Contest на тех же задачах улучшают результат сверхлинейно со временем, у людей остаётся запас роста, которого агентам не хватает.
  • Авторы ввели «точку перегиба масштабирования», размер сессии, при котором предельный прирост Эло сравнивается с опорным уровнем случайной выборки; разбив 100 млн токенов на параллельные сессии такого размера на задаче FrontierCS Polyomino Packing, получили +264 Эло против одной длинной сессии и +355 Эло против десяти коротких.

Почему это важно

Агенты на базе LLM тратят вычисления во время работы неравномерно и сами решают, когда остановиться, поэтому обычные метрики плохо показывают, как их качество растёт вместе с объёмом вычислений внутри одной длинной сессии. Elo-per-token даёт единую шкалу, которая переводит прогресс агента на разных задачах и бенчмарках в сравнимые рейтинги Эло. Ключевой эмпирический результат, у современных агентов есть реальный потолок: прирост качества с ростом бюджета токенов затухает и в какой-то момент становится хуже, чем у простого случайного перебора вариантов, тогда как у сильнейших людей на тех же задачах рост, наоборот, ускоряется.

Кому это важно

В первую очередь, исследователям и разработчикам, которые строят и оценивают ИИ-агентов и системы автоматической LLM-оптимизации: метод даёт способ измерить, окупает ли себя увеличение бюджета токенов на одну сессию. Полезно и тем, кто занимается законами масштабирования тестового времени (test-time scaling) в целом, работа даёт конкретную точку сравнения между поведением агентов и теоретической опорной линией случайной выборки.

Как это применить

Практический вывод исследования: вместо одной очень длинной сессии агента выгоднее заранее определить «точку перегиба масштабирования», бюджет токенов, после которого агент перестаёт эффективно превращать вычисления в качество, и разбить общий бюджет на несколько параллельных сессий такого размера. В эксперименте на задаче FrontierCS Polyomino Packing это дало прирост в +264 Эло по сравнению с одной длинной сессией и +355 Эло по сравнению с десятью короткими. Это методика измерения и распределения уже существующего бюджета вычислений, а не способ сделать агента более способным как такового; о выпуске кода или данных в тексте не сообщается.

Можно ли доверять

Исследование опирается на эксперименты на четырёх универсальных ИИ-агентах и четырёх открытых бенчмарках с сессиями до 100 млн токенов, плюс на трёх инструментах LLM-оптимизации в контролируемых экспериментах на одной задаче, то есть охват заметный. При этом в доступном тексте не названы ни конкретные агенты и бенчмарки, ни авторы работы, ни их организации, ни место публикации, это ограничивает возможность независимо оценить методику и воспроизвести результат по одному только описанию.

Риски и подводные камни

Числа +264 и +355 Эло получены на одной конкретной задаче (FrontierCS Polyomino Packing), и в тексте не сказано, переносится ли этот эффект на другие задачи и бенчмарки, это остаётся открытым вопросом. «Точка перегиба масштабирования» может отличаться от задачи к задаче, поэтому её практическое применение потребует отдельной настройки под каждую задачу. И главное: сам метод, инструмент измерения и распределения бюджета вычислений, а не способ преодолеть тот предел качества, который он же и показывает у современных агентов.