Claude Code и Codex не чувствуют времени, выяснило исследование

Claude Code и Codex не чувствуют времени, выяснило исследование

Два независимых исследователя ИИ, работающих в рамках исследовательской программы MATS, проверили два популярных ИИ-помощника для программирования, Claude Code от Anthropic и Codex от OpenAI, на способность ориентироваться во времени. Перед каждой задачей агентов просили оценить, сколько времени им понадобится; после решения, сказать, сколько времени прошло на самом деле. Материалом для теста послужили 200 задач из набора ProgramBench и ещё 18 бенчмарков, составленных самими исследователями.

Агенты систематически неверно оценивали нужное время. На ProgramBench обе модели почти всегда называли ориентир около 90 минут независимо от реальной сложности задачи. Во втором раунде тестов, где оценивалось время постфактум, Claude ошибался в среднем втрое, а Codex, в 6, 10 раз. Хуже всего оценки давались на коротких задачах; только на многочасовых прогнозы иногда были близки к реальности.

Результаты сильно зависят от программной обвязки (harness), в которой работает модель. Claude Code продолжает работу, пока сам не решит, что задача выполнена, медианно около 90 минут. Codex, напротив, останавливается примерно через полчаса почти независимо от задачи. По данным исследования, одна и та же базовая модель делает в среднем в 2,5 раза больше шагов в связке с Claude Code, чем с Codex, то есть длительность работы определяется не только моделью, но и в первую очередь окружением, в котором она запущена.

Агенты так же плохо оценивают качество собственной работы. Более старые модели, Opus 4.8 и GPT-5.5, в среднем завышали оценку своих результатов на 20 баллов и ставили себе высокие оценки даже за проваленные задачи. В одном случае обе модели посчитали свою работу примерно на 70% успешной, тогда как фактические оценки составили 7% и 14,5%.

По словам исследователей, способность агента оценивать себя важна на практике: чтобы надёжно работать над многочасовыми задачами, агент должен уметь следовать инструкциям вроде «работай над этим два часа», а агент, который постоянно путается во времени, трудно контролировать. Дальше авторы планируют проверить, способны ли агенты сами придерживаться заданной длительности работы. Когда агентам дали инструмент, показывающий прошедшее время, они почти всегда оценивали его правильно.

Ключевые факты

  • Исследователи в рамках программы MATS протестировали Claude Code (Anthropic) и Codex (OpenAI) на 200 задачах из ProgramBench и 18 собственных бенчмарках
  • Перед задачей обе модели почти всегда называли ориентир около 90 минут независимо от сложности; постфактум Claude ошибался в среднем втрое, Codex, в 6, 10 раз
  • Обвязка (harness) сильно меняет поведение: Claude Code работает до собственного решения о завершении (медиана около 90 минут), Codex останавливается примерно через полчаса почти независимо от задачи; одна и та же модель делает в 2,5 раза больше шагов в Claude Code, чем в Codex
  • Более старые модели Opus 4.8 и GPT-5.5 завышали оценку своей работы в среднем на 20 баллов; в одном случае обе оценили себя на ~70% успеха при фактических 7% и 14,5%
  • Когда агентам дали инструмент, показывающий прошедшее время, они оценивали его почти безошибочно

Почему это важно

Исследование фиксирует структурный пробел у современных ИИ-агентов: они не отслеживают собственное время и плохо его прогнозируют. Это не мелкая деталь, а системное ограничение, оно проявляется и до задачи (переоценка нужного времени), и после (неверный отчёт о прошедшем), и в оценке качества итоговой работы. Причём это свойство не только модели, но и обвязки: одна и та же модель ведёт себя по-разному в Claude Code и в Codex, что говорит о зависимости надёжности агента от окружения, а не только от его «интеллекта».

Кому это важно

Разработчикам, которые строят автономные агентные системы и полагаются на Claude Code, Codex или похожие инструменты для длительных задач без постоянного присмотра человека; исследователям надёжности и безопасности ИИ-агентов; командам, которые проектируют харнессы (программные обвязки) для агентов и выбирают между разными связками модель+инструмент.

Как это применить

Не полагаться на собственные оценки агента о том, сколько времени займёт задача или сколько уже прошло, они систематически смещены. Инструкции вида «работай над этим N часов» стоит подкреплять внешним, а не внутренним отсчётом времени: исследование показало, что доступ к инструменту, который явно сообщает прошедшее время, почти полностью решает проблему. По той же причине не стоит доверять самооценке качества результата от агента, судить о выполнении задачи должен внешний критерий, а не отчёт самой модели.

Можно ли доверять

Материал основан на исследовании в рамках программы MATS, известной исследовательской программы по безопасности ИИ, и методика (предварительная и ретроспективная оценка времени на выборке из 200 задач ProgramBench плюс 18 собственных бенчмарков) описана достаточно конкретно. При этом в статье не названы ни имена исследователей, ни ссылка на саму работу, ни точный размер выборки для цифр про завышение оценки качества на 20 баллов и про случай 70% против 7, 14,5%. Судить о материале стоит как о предварительном изложении результатов исследования, а не о самой научной работе.

Риски и подводные камни

Главный риск, доверие к самоотчётам агента в автономных сценариях: пример с 70% самооценки при фактических 7% и 14,5% показывает, что агент может быть уверен в успехе задачи, которую фактически провалил. Разница в поведении Claude Code и Codex означает, что выводы не переносятся автоматически с одной связки модель+обвязка на другую. Часть ключевых чисел (завышение на 20 баллов, случай с 70%) приведена без указания размера выборки, так что к ним стоит относиться как к иллюстрации проблемы, а не как к точной статистике на большом массиве данных.