FM-Bench заставляет ИИ-агентов 20 лет управлять футбольным клубом

У ИИ-агентов уже неплохо получается доводить до конца короткие, ограниченные по времени задачи. Но способны ли они удерживать качество решений на длинной дистанции, там, где каждый шаг имеет накопительные последствия, а среда отвечает на выбор агента, до сих пор почти не измерялось. Новый бенчмарк FM-Bench (Football Management Benchmark, «бенчмарк управления футбольным клубом») закрывает именно этот пробел: ИИ-агент берёт под управление футбольный клуб на 20 игровых лет и за это время проходит через 26 инструментов и примерно 340, 400 точек принятия решений. Агент набирает состав в рамках того же бюджета, что и у соперников, ведёт трансферы игроков, договаривается о контрактах, вкладывается в инфраструктуру клуба и молодёжную академию, расставляет составы на матчи и отчитывается перед советом директоров, который вправе его уволить.
Итоговый счёт считает исключительно детерминированный движок: он суммирует результаты каждого года в одну финальную оценку без участия ИИ-судьи или человека-эксперта. Тестирование устроено в двух режимах. В одиночном режиме каждая из 15 передовых моделей играет против одного и того же неизменного, заранее прописанного сценарного мира. В режиме «Арена» те же модели вместе со сценарным «якорем»-соперником одновременно играют в одном общем 20-летнем мире, по словам авторов, это первое сравнение моделей такого масштаба в одной партии друг против друга. Отдельно, за кулисами итогового счёта, измеряются шесть поведенческих характеристик агентов, но какие именно, в тексте не раскрывается.
При трёх прогонах с разными случайными настройками все 15 моделей проходят весь 20-летний горизонт целиком, тогда как слепые сценарные соперники без адаптации выбывают почти во всех своих попытках. Лучший средний результат, и в одиночном режиме, и в «Арене», показывает модель claude-fable-5, хотя лидерство внутри самой «Арены» по ходу партии переходит между десятью разными моделями, а не удерживается одной. Ни размер модели, ни её цена, ни вендор не предсказывают итоговый порядок мест, расстановка становится ясна только ближе к концу дистанции. Даже лучший результат среди людей, сыгравших в такую игру впервые, оказывается на последнем месте рейтинга, ниже всех проверенных моделей.
Авторы показывают, что разницу между моделями создаёт не вычислительная мощность, а управленческое поведение. Модели с более высоким счётом ближе к концу срока сокращают вложения с медленной окупаемостью, держат деньги в деле, а не простаивающими, и заранее, задолго до дедлайна, открывают продление контрактов игроков; расходы токенов при этом со счётом не связаны. При этом ни одна из моделей так и не научилась угадывать скрытые рыночные цены по сотням отклонённых предложений на трансферном рынке. Самостоятельно управляемая память агентов тоже подводит, причём двумя противоположными способами: либо превращается в архив, который бесконтрольно растёт, либо в план, который агент переписывает заново каждый игровой сезон.
Код FM-Bench опубликован в открытом доступе на GitHub, в репозитории Analogy-AI/fm-bench.
Ключевые факты
- FM-Bench превращает управление футбольным клубом в 20-летний тест для ИИ-агентов: 26 инструментов и примерно 340, 400 точек принятия решений за партию.
- Итог считает только детерминированный движок, без ИИ-судьи и без человека-эксперта; проверены 15 передовых моделей в одиночном режиме и вместе, в режиме «Арена».
- При трёх прогонах с разными случайными настройками все 15 моделей проходят весь 20-летний горизонт, а слепые сценарные соперники выбывают почти всегда.
- Лучший средний результат, у модели claude-fable-5, но лидерство внутри «Арены» по ходу партии переходит между десятью моделями; ни масштаб, ни цена, ни вендор итоговый порядок не предсказывают.
- Модели с более высоким счётом раньше продлевают контракты, держат деньги в деле и снижают долгосрочные вложения ближе к концу срока; расходы токенов на результат не влияют, а скрытые рыночные цены и устойчивую память так и не осилила ни одна модель.
Почему это важно
Большинство существующих тестов проверяет, может ли ИИ-агент один раз правильно выполнить короткую, ограниченную по времени задачу. FM-Bench устроен иначе: он растягивает задачу на 20 игровых лет с сотнями решений подряд, где каждый шаг имеет накопительные последствия, а среда, соперники, рынок трансферов, совет директоров, отвечает на действия агента. Это ближе к тому, как реально используют автономных ИИ-агентов: в планировании, управлении ресурсами, многошаговых операциях, где долгосрочная устойчивость решений важнее точности на одном шаге. Итог при этом считает детерминированный движок, а не ИИ-судья, это отдельный довод в пользу объективности результата.
Кому это важно
Тем, кто строит или выбирает ИИ-агентов для длинных, многошаговых задач с накопительным эффектом, планирование, управление ресурсами, автономные операции. Исследователям, которым нужна воспроизводимая метрика долгосрочной агентности, не зависящая от вкуса ИИ-судьи. И тем, кто сравнивает конкурирующие модели именно по управленческому поведению, а не только по результатам разовых тестов.
Как это применить
Код FM-Bench открыт на GitHub, в репозитории Analogy-AI/fm-bench, так что тест воспроизводим: свою модель можно прогнать как против фиксированного сценарного мира (одиночный режим), так и против других моделей в общем мире, в режиме «Арена», и сравнить результат по единому детерминированному счёту, а не по субъективной оценке. Поскольку расходы токенов не предсказывают результат, при выборе модели для длинных агентных задач не стоит полагаться на размер или цену модели, управленческое поведение (когда вкладывать деньги, когда придерживать их, когда продлевать контракты) нужно проверять напрямую, тестом такого рода.
Можно ли доверять
Источник, публикация самих авторов на HuggingFace; текст загрузился полностью, но внешний отклик пока минимальный (в карточке 15 отметок и всего 1 комментарий, то есть независимого обсуждения работы почти не было). Кто именно авторы, в самом тексте не сказано, независимое повторение результатов не упоминается, а конкретных числовых очков или величины разрыва между моделями текст не приводит, только то, что claude-fable-5 «лидирует», а лидерство в «Арене» «переходит» между десятью моделями, без цифр. Заявление о «первом сравнении такого масштаба» тоже делают сами авторы, без внешнего подтверждения. При этом сам принцип оценки, детерминированный движок вместо ИИ-судьи или человека-эксперта, делает результат более проверяемым, чем у типичных тестов «на глаз».
Риски и подводные камни
Текст не называет ни авторов, ни организацию, создавшую FM-Bench, есть только адрес репозитория на GitHub. Из 15 протестированных моделей по имени назван только claude-fable-5, кто занял остальные места и какие именно десять моделей по очереди лидируют в «Арене», неизвестно. Шесть «поведенческих характеристик», которые бенчмарк измеряет за кулисами счёта, нигде не перечислены и не описаны. «Лучший результат среди людей» в тексте относится к партии, сыгранной впервые, а не к результату опытного менеджера, но сколько людей вообще пробовали и кто они, текст не сообщает, так что вывод о превосходстве моделей над человеком стоит воспринимать осторожно. Ни одна модель так и не научилась угадывать скрытые рыночные цены по отклонённым предложениям, а самостоятельно управляемая память у всех моделей ломается, либо в бесконтрольно растущий архив, либо в план, переписываемый каждый сезон заново; значит, для практического долгосрочного применения такого агента память нужно проектировать отдельно.