Компилятор Activity Frames сжимает суточный контекст ИИ-агента в 86 раз с точностью 98,4%

Сегодняшняя память ИИ-агентов хранит то, что пользователь сказал, а не то, что он сделал, поэтому агент, работающий с компьютером, каждый раз заново, ценой полного обращения к передовой (frontier) модели, выводит рутинные действия, которые пользователь уже выполнял раньше. Исследователи представили Activity Frames, детерминированный конвейер без единой модели в цикле, который компилирует пассивно записанный поток экранной активности в структурированные «кадры активности»: типизированные, ограниченные по времени эпизоды, несущие данные о приложении, сайте, тайминге, объёме ввода и указатели-ссылки на исходные строки записи. Поскольку модель нигде не участвует, результат компиляции побайтово одинаков при повторном запуске, кэшируем и поддаётся механической проверке.
Метод проверили на корпусе экранной активности одного профессионала (личность, профессия и работодатель в источнике не названы), 128 756 кадров за 51 активный день. Компилятор сжимает сырую запись одного дня в готовый для промпта блок контекста в 86 раз за 68 миллисекунд. Агент, читающий такой блок, отвечает на вопросы о прошедшем дне с точностью 98,4% (доверительный интервал Уилсона 95%: 91,7, 99,7%) относительно независимого эталона (oracle), против 66, 80% у обычного пересказа того же захвата языковой моделью. При этом модель среднего уровня, читающая сжатый блок, показывает результат на уровне передовой модели.
Тот же компилятор авторы используют как инструмент для измерения стоимости на стороне спроса: считывая пассивную, неделегированную активность человека (а не прогоны самого агента), он даёт две величины, которые модели стоимости агентов до сих пор предполагали, но, по утверждению авторов, не измеряли напрямую. Первое измеренное значение коэффициента избыточности рутины (Routine Overhead Ratio, R), модельная верхняя граница в диапазоне 60, 343 раз. Доля повторяющихся, делегируемых сценариев (recurrence, h) составила 9,0% на обучающей выборке и 7,7% на отложенной, то есть реалистичный потолок токенов для всего флота агентов лежит около 8%. Скомпилированную рутину можно детерминированно воспроизвести без участия модели: авторы продемонстрировали это вживую при нулевом расходе токенов модели на точном совпадении защитного условия (guard-matched hit). Схема данных, сам компилятор и инструмент оценки выложены в открытый доступ.
Ключевые факты
- Activity Frames, детерминированный, безмодельный конвейер, который превращает пассивно записанную экранную активность в типизированные «кадры» с данными о приложении, сайте, тайминге и вводе
- На корпусе одного профессионала (128 756 кадров, 51 активный день) сжатие дня активности в контекст-блок для промпта, 86x за 68 мс
- Агент, читающий сжатый блок, отвечает на вопросы о дне с точностью 98,4% (95% ДИ 91,7, 99,7%) против 66, 80% у обычного LLM-пересказа того же захвата
- Модель среднего уровня на сжатом блоке работает наравне с передовой моделью
- Впервые измерены параметры модели стоимости агентов: коэффициент избыточности рутины R = 60, 343x (верхняя граница) и делегируемая повторяемость h = 9,0% / 7,7% (in-/out-of-sample), что даёт реалистичный потолок токенов флота около 8%; схема, компилятор и инструмент оценки открыты
Почему это важно
ИИ-агенты, работающие с компьютером, сегодня платят полную стоимость обращения к передовой модели за то, чтобы заново «понять», какую рутинную последовательность действий уже выполнял пользователь, просто потому, что память агента хранит сказанное, а не сделанное. Activity Frames показывает, что для этой задачи не нужна модель вообще: детерминированный компилятор сжимает день активности в 86 раз быстрее и точнее, чем пересказ той же активности языковой моделью (98,4% против 66, 80%). Отдельно важно, что работа впервые даёт измеренные, а не предполагаемые значения двух параметров, которые модели стоимости агентов закладывали как допущение: избыточность повторного вывода рутины (R) и долю действительно повторяющихся, делегируемых сценариев (h).
Кому это важно
Разработчикам агентов и агентных платформ, работающих с экраном пользователя (computer-use агенты), и командам, которые считают стоимость эксплуатации флота таких агентов в токенах, метод напрямую снижает объём контекста, который приходится прогонять через модель, и даёт цифры для оценки предельной экономии.
Как это применить
Схема данных, сам компилятор и инструмент оценки выложены в открытый доступ, то есть конвейер можно взять и подключить к собственному потоку записи экранной активности, чтобы сжимать историю действий пользователя в компактный контекст для памяти агента. Для сценариев, где рутина совпадает с уже виденной (guard-matched hit), возможно детерминированное воспроизведение действия вообще без обращения к модели, авторы показали это вживую при нулевом расходе токенов. Параметры R и h можно использовать как ориентир при прикидке верхней и реалистичной границы токен-бюджета для флота агентов (в данном случае, около 8% в реалистичном сценарии).
Можно ли доверять
Метод сравнивался с независимым эталоном (oracle), а точность 98,4% дана с доверительным интервалом Уилсона (91,7, 99,7%), что указывает на аккуратную статистическую проверку, а не оценку на глаз. При этом вся эмпирика построена на корпусе ОДНОГО профессионала за 51 день, источник не раскрывает ни личность, ни профессию, ни то, какие именно приложения и сайты покрывает захват, так что обобщаемость на других пользователей и роли пока не подтверждена тем же корпусом. Сами авторы отмечают, что значение R (60, 343x), модельная верхняя граница, а не прямое измерение.
Риски и подводные камни
Ключевое ограничение, единственный источник данных: 128 756 кадров от одного человека не доказывают, что 86-кратное сжатие и 98,4% точности воспроизведутся на других профессиях, стилях работы или наборах приложений. Разница между повторяемостью сценариев на обучающей выборке (9,0%) и на отложенной (7,7%) говорит о том, что часть «повторяемости» может быть переоценена и на новых данных давать более скромную экономию. Метод по построению требует непрерывной фоновой записи экранной активности пользователя, что именно захватывается и как это архивируется, источник не описывает.