OpenDiscoveryTrace показал: Claude Opus 4.6 ошибается в 30 раз чаще GPT-5.4
Исследователи опубликовали на arXiv препринт OpenDiscoveryTrace, открытый датасет из 558 полных трасс работы ИИ-агентов над научными задачами. Мотивация авторов такая: существующие бенчмарки для автономных ИИ-агентов в роли исследователя оценивают только конечный результат (код, гипотезу или готовую статью) и выбрасывают сам процесс рассуждения, которым этот результат получен. Из-за этого нельзя проверить методологию агента, диагностировать, на каком шаге и почему он ошибся, и отличить системное рассуждение от удачной догадки.
Каждая трасса в датасете фиксирует не только итог, а весь ход работы агента: структурированную запись из 9 полей на каждый шаг. В аннотации названы шесть из них: мысли агента, вызовы инструментов, результаты наблюдений, ошибки, точки пересмотра решения и самооценка уверенности модели; про оставшиеся три поля схемы источник не сообщает. Агенты решают 124 научные задачи из четырёх областей: разработка лекарств, материаловедение, геномика и анализ научной литературы. Датасет охватывает семь моделей. Три топовые модели, GPT-5.4, Claude Opus 4.6 и Gemini 3.1 Pro, представлены 124 трассами каждая, сбалансированными по областям и уровню сложности. Четыре открытые модели, Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini и Qwen2.5-1.5B, представлены 30 трассами каждая. Отдельно добавлены ещё 60 трасс варианта с живым поиском данных (live retrieval).
Пилотный анализ 363 трасс, оценённых с помощью LLM-судьи (языковой модели, которая сама выставляет оценку по инструкции), показал следующее. Все три топовые модели достигают сопоставимой доли успешного решения задач: от 84 до 89%. Однако Claude Opus 4.6 совершает в 30 раз больше ошибок за одну трассу, чем GPT-5.4: 2,5 ошибки против 0,08 в среднем на трассу (различие статистически значимо, p < 0,0001; дельта Клиффа как мера величины эффекта равна 0,613). При этом ошибки разного рода: у Claude Opus 4.6 на неверное использование инструментов приходится 66,7% ошибок, а у GPT-5.4 на ошибки рассуждения приходится 83,6% ошибок. Авторы делают вывод: трассы рассуждения вскрывают поведенческие различия между моделями, невидимые при оценке только по конечному результату.
Отдельно авторы определяют пять эталонных задач для бенчмаркинга на этих трассах и приводят для них базовые модели: логистическую регрессию, случайный лес, LSTM и трансформер. Что именно предсказывают эти пять задач, в аннотации не раскрывается, названы только использованные базовые подходы. Датасет, схема трасс, программная обвязка агента (harness) и определения эталонных задач выложены в открытый доступ по лицензии CC BY 4.0, чтобы поддержать исследования в области оценки на уровне процесса, аудита научных ИИ-агентов и управления рисками ИИ (AI governance).
Ключевые факты
- OpenDiscoveryTrace: открытый датасет из 558 полных трасс работы ИИ-агентов на 124 научных задачах (разработка лекарств, материаловедение, геномика, анализ научной литературы).
- Каждая трасса фиксирует весь ход рассуждения агента, а не только итог: 9 полей на каждый шаг, включая мысли, вызовы инструментов, наблюдения, ошибки, точки пересмотра решения и самооценку уверенности.
- Датасет охватывает семь моделей: три топовые (GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro) по 124 трассы каждая и четыре открытые (Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini, Qwen2.5-1.5B) по 30 трасс каждая, плюс ещё 60 трасс варианта с живым поиском данных.
- В пилотном анализе 363 трасс у трёх топовых моделей сопоставимая доля успеха: от 84 до 89%. Но Claude Opus 4.6 совершает в 30 раз больше ошибок за одну трассу, чем GPT-5.4 (2,5 против 0,08 в среднем), и они разного типа: у Claude Opus 4.6 на неверное использование инструментов приходится 66,7% ошибок, а у GPT-5.4 на ошибки рассуждения приходится 83,6% ошибок.
- Датасет, схема трасс, программная обвязка агента и определения пяти эталонных задач для бенчмаркинга выложены в открытый доступ по лицензии CC BY 4.0.
Почему это важно
Существующие бенчмарки для автономных ИИ-агентов в роли исследователя оценивают только конечный результат (код, гипотезу или готовую статью) и выбрасывают сам процесс рассуждения. Из-за этого нельзя проверить методологию агента, понять, на каком шаге он ошибся, и отличить системное рассуждение от удачной догадки. OpenDiscoveryTrace наглядно показывает цену этого пробела. Если судить только по доле успешно решённых задач, GPT-5.4, Claude Opus 4.6 и Gemini 3.1 Pro выглядят почти одинаково: от 84 до 89% успеха. Но как только исследователи заглянули в саму трассу рассуждений, разница оказалась огромной: Claude Opus 4.6 совершает в 30 раз больше ошибок за одну трассу, чем GPT-5.4, и ошибки эти разного рода. У Claude Opus 4.6 это в основном неверное использование инструментов, а у GPT-5.4 в основном ошибки рассуждения. Метрика, которая смотрит только на факт решения задачи, такую разницу никогда бы не показала.
Кому это важно
Прежде всего, командам, которые уже строят или оценивают ИИ-агентов для сложных многошаговых задач и пока выбирают между моделями по одной цифре, доле успешных прогонов. Датасет показывает, что за одинаковым результатом может стоять совершенно разное поведение агента. Также он важен исследователям методологии оценки ИИ и специалистам по аудиту поведения агентов: авторы прямо называют это одной из целей публикации, наряду с вопросами управления рисками ИИ (AI governance). Наконец, он важен командам, которые разворачивают модели именно в областях датасета: в разработке лекарств, материаловедении, геномике и анализе научной литературы. Для них разница в 30 раз по числу ошибок при одинаковой доле успеха означает разницу в том, сколько человеческого контроля потребует внедрение той или иной модели.
Как это применить
Датасет, схема трасс, программная обвязка агента (harness) и определения эталонных задач выложены в открытый доступ по лицензии CC BY 4.0. Практически это даёт несколько вещей. Во-первых, готовую схему из 9 полей на шаг, которую можно взять за образец, чтобы логировать рассуждения собственного агента и потом так же подробно разбирать его ошибки. Во-вторых, уже собранные трассы семи моделей и программную обвязку как ориентир, с которым можно сравнить поведение своего агента на похожих научных задачах. В-третьих, пять эталонных задач для бенчмаркинга на трассах с базовыми решениями на логистической регрессии, случайном лесе, LSTM и трансформере. Что именно эти пять задач предсказывают, аннотация не раскрывает, названы только использованные базовые подходы, поэтому для реального применения нужен полный текст статьи или репозиторий, а не только аннотация. Главный же практический вывод пилотного анализа такой: перед тем как доверить агенту реальную научную задачу, стоит смотреть не только на долю успеха, а ещё и на то, какого рода ошибки он обычно допускает, путает ли инструменты или ошибается в самом рассуждении, ведь это разные риски и разная нужная подстраховка.
Можно ли доверять
Это препринт на arXiv: рецензирование не упомянуто, а в аннотации не указаны ни авторы, ни организации, ни дата публикации. Собственная арифметика авторов не сходится: сумма разбивки по группам (3 топовые модели по 124 трассы, 4 открытые модели по 30 трасс, плюс 60 трасс с живым поиском) даёт 552 трассы, а не заявленные 558; разницу в 6 трасс источник не объясняет. Главное сравнение (30-кратная разница в числе ошибок между Claude Opus 4.6 и GPT-5.4) получено на подвыборке из 363 трасс, оценённых LLM-судьёй, но какая модель выступала судьёй и насколько надёжны были её оценки, в аннотации не сказано. Эта же подвыборка не описана по составу: неясно, сколько трасс каждой модели в неё вошло. И, что важнее всего, подробное сравнение по типам ошибок дано только для пары Claude Opus 4.6 и GPT-5.4: для Gemini 3.1 Pro, у которой тоже сопоставимая доля успеха, и для всех четырёх открытых моделей таких цифр в источнике нет. Различие между Claude Opus 4.6 и GPT-5.4 статистически значимо (p < 0,0001, дельта Клиффа как мера величины эффекта равна 0,613), но это подтверждает лишь сам факт разницы между этими двумя моделями внутри пилотного анализа, а не полноту картины по всему датасету.
Риски и подводные камни
Работа фиксирует, что профиль ошибок у Claude Opus 4.6 и GPT-5.4 разный: у Claude Opus 4.6 на неверное использование инструментов приходится 66,7% ошибок, а у GPT-5.4 на ошибки рассуждения приходится 83,6% ошибок. Но почему так выходит, источник не объясняет: это наблюдение, а не диагноз с понятным механизмом. Детальное сравнение по типам ошибок сделано только для двух моделей из семи, поэтому выводы не стоит переносить на Gemini 3.1 Pro (у неё тоже сопоставимая доля успеха, но таких цифр для неё в источнике нет) или на четыре открытые модели, и тем более не стоит обобщать находку до разницы между закрытыми и открытыми моделями: источник для такого обобщения оснований не даёт. Пять эталонных задач для бенчмаркинга названы только по использованным базовым подходам (логистическая регрессия, случайный лес, LSTM, трансформер), а не по содержанию, поэтому опираться на них как на готовый набор тестов, не открыв полный текст статьи, преждевременно. Наконец, показатели пилотного анализа получены через оценку LLM-судьёй, чья личность и надёжность в аннотации не раскрыты, так что цифру «в 30 раз больше ошибок» стоит воспринимать как результат конкретного пилотного прогона, а не как окончательно проверенный факт.