StateM: рантайм поднял точность ИИ-агентов до 95,3% на Terminal-Bench

StateM: рантайм поднял точность ИИ-агентов до 95,3% на Terminal-Bench

Авторы работы отмечают: агенты, работающие над длинными цепочками задач, проваливаются даже тогда, когда лежащая в их основе модель способна решить каждый отдельный шаг по отдельности. Причины, модель теряет след изменяемого состояния, не подключает уроки из прошлых запусков, пропускает известные процедуры или останавливается раньше времени. Вместо переобучения модели авторы предлагают масштабировать инфраструктуру исполнения (harness) вокруг агента, не трогая веса модели, и представляют StateM, агентный рантайм, который строит выполнение вокруг устойчивых состояний, локального по фазам контекста, проверяемых переходов между шагами, восстанавливаемых runbook-сценариев и версионируемых процедурных практик, доступных для проверки и агенту, и человеку.

На бенчмарке Terminal-Bench 2.1 StateM поднимает точность GPT-5.5 xhigh до 92,1% против эталонных 83,1% и против 91,9% у GPT-5.6 Sol Ultra. Тот же runbook без изменений переносится на GPT-5.6: с моделью GPT-5.6 Sol xhigh StateM достигает 95,3% необработанной точности на 445 прогонах и решает все 89 задач бенчмарка хотя бы один раз. Фиксированный (замороженный) профиль поднимает результат GPT-5.6 Luna с 76,7% до 85,4%, выше эталонных 84,9% для Sol xhigh.

Тот же рантайм, структура runbook и «золотые правила» переносятся и на модель другого разработчика: доработка дешевле $38 подняла точность DeepSeek-V4 Flash с 82,7% до 88,1% при стандартных таймаутах и до 89,1% на общем ядре из 88 задач. Донастройка единственной задачи, чувствительной к задержке ответа, довела результат до заявленных 88,8%, уровня GPT-5.6 Sol max. При этом финальный оценочный прогон на DeepSeek обошёлся примерно в $15 против $574,68 у эталонного прогона на GPT, а весь эксперимент с DeepSeek, в $52,22.

На бенчмарке BusinessBench runbook-сценарии, настроенные под конкретные семейства задач на основе отложенных обучающих данных, дали прирост 0,55 балла по макро-метрике и 1,34 балла по микро-метрике на новых, не видимых при настройке данных; для двух семейств задач, чья структура совпала с механизмом runbook, прирост достиг 10,04 балла. Авторы заключают: конкретные правила переносятся между задачами, если у тех совпадает структура выполнения, а сама методология контроля работает шире. StateM превращает отдельные выводы разбора сбоев (постмортемов) в устойчивые, исполняемые предусловия и практики, делая усвоенные правила контроля явными и обязательными, а не подразумеваемыми. Код StateM опубликован на GitHub: github.com/henryqin1997/statem.

Ключевые факты

  • StateM, агентный рантайм поверх модели: устойчивые состояния, локальный по фазам контекст, проверяемые переходы, восстанавливаемые runbook-сценарии и версионируемые процедурные практики, без изменения весов модели
  • На Terminal-Bench 2.1 с GPT-5.6 Sol xhigh StateM достиг 95,3% необработанной точности на 445 прогонах и решил все 89 задач хотя бы раз; на GPT-5.5 xhigh точность выросла с эталонных 83,1% до 92,1%
  • Тот же runbook, перенесённый на DeepSeek-V4 Flash за доработку дешевле $38, поднял точность с 82,7% до 88,1% (до 89,1% на общем ядре из 88 задач)
  • Финальный оценочный прогон на DeepSeek обошёлся примерно в $15 против $574,68 у эталонного прогона на GPT; весь эксперимент с DeepSeek, $52,22
  • На BusinessBench тематические runbook-сценарии дали прирост 0,55/1,34 балла (макро/микро) на отложенных данных, а для двух подходящих по структуре семейств задач, 10,04 балла; код опубликован на GitHub

Почему это важно

StateM показывает, что для длинных агентных задач узкое место часто не в самой модели, а в инфраструктуре исполнения вокруг неё: агент теряет след состояния, забывает прошлые уроки, пропускает известные шаги. Надстройка рантайма без переобучения модели поднимает точность на разных моделях, с 83,1% до 92,1% и с 76,7% до 85,4% на Terminal-Bench 2.1, то есть прирост можно получить инженерными средствами, а не только за счёт более мощной модели.

Кому это важно

Разработчикам ИИ-агентов и командам, строящим длинные автономные цепочки, терминальные, кодовые, бизнес-агенты, поверх моделей вроде GPT-5.5/5.6 и DeepSeek-V4 Flash; инженерам инфраструктуры агентов и исследователям, которые оценивают агентов на бенчмарках вроде Terminal-Bench и BusinessBench.

Как это применить

Код StateM открыт на GitHub (github.com/henryqin1997/statem). Runbook переносится между моделями практически без изменений: тот же сценарий, разработанный для GPT-5.5/5.6, адаптировали под DeepSeek-V4 Flash менее чем за $38 работы и получили сопоставимый прирост точности. Внедрение не требует переобучения модели, только настройку рантайма и runbook-сценариев вокруг существующего агента.

Можно ли доверять

Материал, препринт на HuggingFace Papers с открытым кодом на GitHub, результаты приведены сразу на нескольких бенчмарках (Terminal-Bench 2.1, BusinessBench) и нескольких моделях (GPT-5.5, GPT-5.6, DeepSeek-V4 Flash), что снижает риск случайного результата. В то же время это самоотчёт авторов: в тексте нет ни имён/аффилиаций авторов, ни независимой проверки или рецензии результатов третьей стороной, только код и цифры от самой команды.

Риски и подводные камни

Цифры, самоотчёт разработчиков StateM без упомянутой независимой проверки. В источнике не описано, что именно измеряет BusinessBench, кроме названия. Перенос runbook между моделями показан пока на двух семействах (GPT и DeepSeek), нет данных, как метод ведёт себя на моделях с принципиально другой архитектурой или на задачах вне терминальных и бизнес-сценариев.

«Агенты, работающие над длинными цепочками задач, могут проваливаться даже тогда, когда лежащие в их основе модели способны решить каждый отдельный шаг по отдельности»

— авторы StateM