gpt-oss-120b удержала состояние за 196 вызовов инструментов при вычислении MD5

Долгие задачи, где каждый следующий шаг зависит от результата предыдущего, редко встречаются в тестах языковых моделей, и не случайно: точность на отдельном шаге, которая в изоляции выглядит отличной, катастрофически падает на длинной цепочке, потому что ошибки накапливаются, и вероятность провала всей цепочки резко растёт с её длиной. Существующие агентные бенчмарки измеряют успех задачи целиком, но смешивают в одном числе саму способность держать состояние с пониманием инструкций, не дают контрольной группы, которая отделяла бы одно от другого, и уязвимы к обходным путям вроде угаданного финального ответа, из-за этого по ним нельзя понять, почему именно длинный прогон сорвался.

Авторы предложили чистый тест этой способности отдельно от понимания инструкций: заставить модель вручную, шаг за шагом, вычислить криптографический хеш MD5. Это последовательность из 196 зависимых вызовов инструментов на 64 раунда, в ходе которых модель обязана хранить в собственном контексте от одного вызова к другому четыре 32-битных слова состояния, a, b, c и d. Модель сама реализует алгоритм MD5 с нуля по спецификации RFC 1321, поэтому интерпретация задания тривиальна, а каждый вызов можно свести к эталонной трассе и сверить итоговый хеш побитово: любая ошибка здесь, чистая ошибка учёта состояния, а не непонимания задачи.

Модель gpt-oss-120b, модель с архитектурой mixture-of-experts, у которой на каждый токен активируется только около 5,5 млрд параметров, при температуре 0 и коротком фиксированном промпте пронесла полное состояние через все 196 вызовов и вернула верный хеш на большинстве завершённых прогонов (точная доля успешных прогонов в тексте не названа). В самой сложной версии эксперимента исследователи заменили все инструменты-примитивы второй языковой моделью: пара «драйвер и воркер» считает весь хеш с нуля, без точного арифметического оракула в цепочке. Успех в этой постановке определили два фактора, ни один из которых не требует переобучения модели: модель должна на каждом ходу сохранять в контексте собственные предыдущие рассуждения, а результаты воркера с включённым режимом рассуждений нужно получать через голосование по нескольким ответам, чтобы убрать его ошибки в модульной арифметике. Оставшиеся сбои авторы разложили по источникам: отдельно то, что вызвано потерей состояния, отдельно, ошибками арифметики, отдельно, сбоями самой инфраструктуры обслуживания запросов.

Ключевые факты

  • Тест: 196 зависимых вызовов инструментов на 64 раунда, MD5 реализован моделью с нуля по RFC 1321, каждый шаг сверяется с эталонной трассой побитово
  • Модель хранит между вызовами четыре 32-битных слова состояния (a, b, c, d) в собственном контексте
  • gpt-oss-120b (mixture-of-experts, около 5,5 млрд активных параметров на токен) при температуре 0 пронесла полное состояние через все 196 вызовов и вернула верный хеш на большинстве завершённых прогонов
  • В самой сложной постановке все инструменты-примитивы заменены второй LLM: пара «драйвер-воркер» считает хеш с нуля без точного арифметического оракула
  • Успех обеспечивают два фактора без изменения весов модели: сохранение собственных рассуждений в контексте на каждом ходу и голосование по ответам думающего воркера для устранения ошибок модульной арифметики

Почему это важно

Существующие агентные бенчмарки меряют успех задачи целиком и не отделяют способность модели нести состояние от понимания инструкций, а ещё уязвимы к угаданным ответам без реального выполнения шагов, из таких тестов нельзя понять, почему длинная цепочка сорвалась. Эта работа впервые изолированно проверяет именно способность точно нести состояние через десятки зависимых шагов, убрав из уравнения сложность понимания задания: интерпретация тривиальна, а каждый шаг сверяется побитово с эталоном.

Кому это важно

Тем, кто строит многошаговые агентные системы и конвейеры на базе вызовов инструментов, где результат одного шага передаётся в следующий: разработчикам агентных фреймворков и авторам бенчмарков для оценки LLM-агентов. Результат показывает, что задача сохранения точного состояния на десятках зависимых шагов в принципе решаема моделью среднего размера, а не только самыми крупными.

Как это применить

Авторы называют два конкретных приёма, которые повышают надёжность длинных цепочек без дообучения модели: держать в контексте модели её собственные промежуточные рассуждения на каждом шаге вместо того, чтобы передавать только голые данные состояния, и для шагов, которые выполняет вторая модель-«воркер» с включённым режимом рассуждений, брать результат голосованием по нескольким её ответам, это убирает случайные ошибки в модульной арифметике.

Можно ли доверять

Методология тестируема и прозрачна: модель сама реализует MD5 по открытой спецификации RFC 1321, и любой прогон можно сверить с эталонной трассой побитово, что исключает угадывание ответа. При этом текст не приводит точную долю успешных прогонов (только «большинство»), не сравнивает результат gpt-oss-120b с другими моделями и не даёт числовой разбивки по типам сбоев, ограничиваясь их разделением по происхождению, состояние, арифметика, инфраструктура.

Риски и подводные камни

Результат получен на одной модели, gpt-oss-120b, и без сопоставления с другими моделями его нельзя напрямую обобщить на LLM в целом. «Большинство завершённых прогонов» означает, что часть прогонов всё же заканчивалась ошибкой, а точная частота отказа неизвестна. Оба приёма, которые авторы называют решающими, требуют сохранения полного контекста рассуждений и повторных вызовов для голосования, то есть заметно увеличивают длину и стоимость каждого запроса по сравнению с наивной передачей одного лишь текущего состояния.