Claude Opus 5 решил 30% задач в новом научном бенчмарке ИИ-агентов Terminal-Bench-Science

Стэнфордский университет вместе с командой, стоящей за оригинальным Terminal-Bench, и экспертами из разных научных дисциплин по всему миру выпустили Terminal-Bench-Science 0.1, открытый бенчмарк для проверки ИИ-агентов на реальных рабочих процессах учёных. Идея в том, чтобы планку научных способностей ИИ задавали сами учёные, а не разработчики моделей или поставщики данных. Задачи отбирались через открытый процесс на GitHub с обсуждением в Discord: из 920 присланных предложений одобрили 464, по ним открыли 386 пул-реквестов, а в итоговый релиз 0.1 вошли только 70 задач, по каждой проверяли, объективно ли она верифицируется, действительно ли сложна для современных ИИ-агентов и не решают ли её топовые системы уже сейчас без труда. Финальную проверку задача проходит через профильного рецензента (научная корректность), технического рецензента (конструкция и проверка задачи) и финального контролёра качества. Все 70 задач относятся к пяти направлениям, науки о жизни, физические науки, науки о Земле, математические и инженерные науки, и охватывают анализ научных данных, статистический вывод, моделирование, оптимизацию, доказательство теорем, восстановление изображений, обработку сигналов, обратные задачи, калибровку датчиков, подгонку моделей, классификацию и научное машинное обучение.

Каждую модель проверяли тремя независимыми попытками на задачу по всем 70 задачам. Лучший результат показал Claude Opus 5 в связке с агентом Claude Code, 30,0% решённых задач; на втором месте GPT-5.6 Sol с Codex (22,4%), на третьем, Claude Fable 5 с Claude Code (21,4%). Claude Opus 4.8 расположился в середине таблицы с 10,5%. GPT-5.6 Terra, Kimi K3 и Grok 4.6 не дотянули до 10% каждый, точных цифр по каждой из трёх моделей источник не приводит. Лучшей моделью с открытыми весами стала GLM 5.3, 8,1%, последнее место у GPT-5.6 Luna, 3,3%. Для сравнения: старый бенчмарк Terminal-Bench 3.0 различает модели примерно так же хорошо, но результаты на Terminal-Bench-Science ниже больше чем на 10 процентных пунктов у каждой модели, которую проверяли на обоих бенчмарках, авторы прямо говорят, что разрыв сделан намеренно: задачи откалибровали так, чтобы бросить вызов новейшим топовым моделям.

По затратам полный прогон всех 70 задач обошёлся Claude Opus 5 в $7,0 тыс. GPT-5.6 Sol показал результат на уровне Claude Fable 5 (21,4%) за $4,2 тыс. против $14,2 тыс. у Fable 5, меньше трети её бюджета. По токенам Claude Fable 5 набрал тот же результат, что и GPT-5.6 Sol, истратив примерно на четверть меньше токенов (6,4 млрд против 8,4 млрд). По направлениям модели Anthropic и OpenAI занимают первые два места во всех направлениях, кроме инженерных наук, где второе место с GPT-5.6 Sol (14,8% именно в этом направлении) делит Grok 4.6, при меньших затратах и меньшем числе токенов. Единственное направление, где Claude Opus 5 не лидирует, математические науки: там первые два места у Claude Fable 5 (33,3%) и GPT-5.6 Sol (31,4%).

Авторы называют Terminal-Bench-Science непрерывным бенчмарком: он не публикуется один раз и не забрасывается, а регулярно обновляется, добавляются новые задачи, часть старых снимается, если модели решают их слишком легко или рецензия находит задачу плохо специфицированной, а таблица лидеров пересчитывается по мере выхода новых топовых моделей. Задачи версионируются, поэтому прогоны можно переиспользовать, перепроверять или перезапускать одной командой Harbor. Работа над версией 0.2 уже идёт, дедлайн по пул-реквестам, 5 октября 2026 года; учёный с реальным рабочим процессом, который сегодняшние топовые агенты выполнить не могут, может предложить задачу через форму на сайте проекта. Проект работает под эгидой Стэнфордского университета и Laude Institute вместе со Стэнфордской лабораторией ИИ (SAIL), Стэнфордским институтом человекоориентированного ИИ (HAI), Stanford AI Measurement Science, NSF-институтом IFML и Allen Institute for AI; научные руководители проекта, Ludwig Schmidt и Sanmi Koyejo.

Ключевые факты

  • Terminal-Bench-Science 0.1, 70 задач по пяти научным направлениям, отобранных из 920 предложений (464 одобрено, 386 пул-реквестов, только 70 вошли в релиз)
  • Каждую модель проверяли тремя независимыми попытками на задачу; лидер, Claude Opus 5 с агентом Claude Code, 30,0% решённых задач
  • Далее по местам: GPT-5.6 Sol с Codex, 22,4%, Claude Fable 5 с Claude Code, 21,4%, Claude Opus 4.8, 10,5%; GPT-5.6 Terra, Kimi K3 и Grok 4.6, все ниже 10%; лучшая открытая модель GLM 5.3, 8,1%, последняя GPT-5.6 Luna, 3,3%
  • GPT-5.6 Sol повторил результат Claude Fable 5 менее чем за треть её бюджета ($4,2 тыс. против $14,2 тыс.), однако по токенам примерно на четверть меньше потратила сама Claude Fable 5; полный прогон Claude Opus 5 стоил $7,0 тыс.
  • Бенчмарк непрерывный: задачи будут сниматься по мере насыщения, приём предложений на версию 0.2 идёт до 5 октября 2026 года

Почему это важно

Большинство бенчмарков для ИИ либо составляют сами разработчики моделей, либо превращают их в разовую публикацию, которая устаревает вместе с прогрессом моделей. Terminal-Bench-Science устроен иначе на обоих уровнях: задачи предлагают и проверяют практикующие учёные из разных дисциплин, а сам бенчмарк регулярно обновляется, задачи добавляются, слишком лёгкие снимаются, таблица лидеров пересчитывается под новые модели. Итоговая цифра тоже отрезвляет: даже лучшая из проверенных систем, Claude Opus 5, решает всего 30% задач, то есть по строгим научным меркам, а не по маркетинговым демонстрациям, современные ИИ-агенты ещё далеки от статуса надёжного научного ассистента.

Кому это важно

Разработчикам моделей и агентных систем, прямой ориентир, где именно текущие агенты проваливаются на реальной науке, а не на упрощённых тестах. Учёным и научным организациям, которые думают, доверять ли ИИ-агентам черновую работу по анализу данных, симуляциям и доказательствам, фактический замер того, что агенты умеют сегодня. Компаниям вроде Anthropic и OpenAI, чьи модели возглавляют таблицу, публичное сравнение по свежей и намеренно сложной для их же систем метрике. Университетам и грантодателям, которые решают, куда вкладывать средства в ИИ для науки, открытая инфраструктура измерения прогресса.

Как это применить

Учёный с реальным рабочим процессом, который сегодняшние топовые агенты выполнить не могут, предлагает задачу через форму на сайте проекта; дальше путь такой: предложение → реализация → рецензия предметным и техническим рецензентами → финальная проверка качества, всё в открытую на GitHub и в канале #tb-science в Discord. Разработчики агентов могут использовать версионированные задачи и команду Harbor, чтобы прогнать, перепроверить или переиграть тесты на своей модели и сверить результат с открытой таблицей лидеров и общедоступным дашбордом. Ближайший практический дедлайн, пул-реквесты для версии 0.2 принимают до 5 октября 2026 года.

Можно ли доверять

Организационно бенчмарк выглядит основательно: ведёт Стэнфордский университет вместе с Laude Institute, партнёры, Стэнфордская лаборатория ИИ (SAIL), Стэнфордский институт человекоориентированного ИИ (HAI), Stanford AI Measurement Science, NSF-институт IFML и Allen Institute for AI, научные руководители, Ludwig Schmidt и Sanmi Koyejo. Отбор задач жёсткий: из 920 предложений в релиз 0.1 попали только 70, каждая прошла проверку предметным рецензентом, техническим рецензентом и финальным контролем качества. Из оговорок: часть API-кредитов на сами прогоны лидерборда предоставили несколько компаний, включая Anthropic и Google, хотя модель в лидерборде есть не у всех спонсоров, например, у Google её нет; источник указывает это в разделе благодарностей, но отдельно не поясняет, как именно результат трёх попыток на задачу сводится в одну итоговую цифру по каждой модели.

Риски и подводные камни

Прогресс моделей обгонит конкретную версию бенчмарка, авторы сами закладывают это в дизайн, планируя снимать задачи, которые агенты «выучили» решать. Полный прогон дорогой: у лучших моделей счёт идёт на тысячи долларов (от $4,2 тыс. до $14,2 тыс. за все 70 задач), это ограничивает круг тех, кто может независимо перепроверить результаты. Главный риск, не про сам бенчмарк, а про то, как его результат используют: даже у модели-лидера 70% задач остаются нерешёнными, так что доверять сегодняшним агентам самостоятельную интерпретацию и валидацию научных результатов без человека в цепочке, рано.