SWE-bench Science: лучший ИИ-агент (Claude Code) решает меньше половины научных задач

Исследователи представили SWE-bench Science, бенчмарк уровня целого репозитория для оценки того, умеют ли ИИ-агенты чинить научное программное обеспечение. Авторы отмечают, что научный код сегодня фактически становится частью самого измерительного инструмента: ошибка в нём портит не только работу программы, но и достоверность научных выводов, которые на этой программе основаны. При этом существующие тесты кодинг-агентов обычно меряют только долю решённых задач в сумме и почти не объясняют, почему агенты проваливаются именно на научном коде.
Бенчмарк состоит из 119 задач, собранных из 98 репозиториев на GitHub, охватывающих 20 научных областей. Каждая задача относится к одному из трёх типов: основанные на issue-тикетах, экспертно-исследовательские (когда решение требует самостоятельного разбирательства без готового описания бага) и задачи на интеграцию в инженерную систему в целом.
Даже лучший из протестированных агентов, Claude Code с Opus-5 (max), показал долю успешных решений с первой попытки (pass@1) ниже 50%. Точная цифра в тексте не названа. Авторы выделили четыре повторяющихся механизма провала: нехватка научных знаний или неумение их обобщить в абстракцию для кода, ошибочный путь исследования или поверхностный «косметический» фикс вместо реального исправления, неполное покрытие исправления или интеграции с остальной системой, и неспособность перенести научные знания на случаи, не встречавшиеся ранее.
Отдельно авторы провели парный абляционный эксперимент: убрали явные научные подсказки агенту, оставив сам репозиторий и рабочее инженерное окружение нетронутыми. Результат оказался не таким однозначным, как ожидалось: научные знания помогают не всегда. Хорошо обоснованная информация ограничивает агента рамками задачи и повышает и среднюю успешность, и эффективность по токенам, а вот плохо подобранная подсказка вызывает эффект «якоря», агент цепляется за неё, и не обязательно повышает долю точных исправлений.
Ключевые факты
- SWE-bench Science, 119 задач из 98 репозиториев GitHub по 20 научным областям, три типа задач: issue-тикеты, экспертно-исследовательские, интеграционные
- Лучший протестированный агент, Claude Code с Opus-5 (max), решает с первой попытки (pass@1) меньше 50% задач; точный процент не приводится
- Авторы называют четыре повторяющихся причины провала: нехватка научных знаний, поверхностный фикс вместо разбора причины, неполное исправление, неумение переносить знания на новые случаи
- Абляционный эксперимент показал: явные научные подсказки помогают агенту, только если они точно подобраны, иначе вызывают эффект «якоря» и не увеличивают долю верных решений
- Бенчмарк создан именно чтобы понять причины провалов агентов на научном коде, а не только измерить итоговый процент успеха
Почему это важно
Научное ПО перестало быть просто вспомогательным инструментом, по сути оно стало частью измерительного прибора, и ошибка в коде искажает не только вывод программы, но и научные заключения, построенные на этих расчётах. При этом существующие тесты кодинг-агентов почти всегда меряют только итоговый процент решённых задач и не объясняют, где именно и почему агент ломается на научном коде. SWE-bench Science закрывает этот пробел: 119 задач из 98 реальных репозиториев в 20 научных дисциплинах дают возможность разбирать не просто "решил/не решил", а конкретный механизм провала.
Кому это важно
В первую очередь, разработчикам самих кодинг-агентов (включая команды, стоящие за такими инструментами, как Claude Code), которым бенчмарк даёт конкретную карту слабых мест вместо абстрактного процента успеха. Во вторую, исследователям и инженерам в науке, которые всё чаще доверяют ИИ-агентам поддержку и починку исследовательского кода: результат прямо показывает, что такому агенту пока нельзя доверять без проверки даже в лучшем случае.
Как это применить
Авторы предлагают ориентироваться не на агрегированный процент, а на четыре выявленных типа провала, недостаток научных знаний, поверхностный фикс, неполное покрытие правки, неумение переносить знания на новые случаи, как на чек-лист при выборе или дообучении агента для работы с научным кодом. Отдельный практический вывод из абляционного эксперимента: просто добавлять агенту побольше научного контекста в подсказку недостаточно и может даже навредить, если подсказка подобрана плохо, агент "цепляется" за неё и не обязательно точнее находит решение; ценность имеет только хорошо обоснованная, точно подобранная информация.
Можно ли доверять
Источник, препринт научной статьи, опубликованный на площадке Hugging Face Papers; в доступном тексте (аннотации) нет ни имён авторов, ни аффилиаций, ни даты публикации, это ограничение самого источника, а не пересказа. Методология описана предметно: указано число задач, репозиториев и областей, названы типы задач и проведён отдельный контролируемый (абляционный) эксперимент, что говорит в пользу серьёзности работы. Точный числовой результат pass@1 в тексте не приведён, известно только, что он ниже 50%.
Риски и подводные камни
Главный риск, превратно понять вывод об абляции: научные знания не «вредны сами по себе», вредна плохо подобранная, не соответствующая задаче подсказка. Из текста неясно, какая доля задач в принципе разрешима нынешними агентами в целом (не только лучшим) и какие именно предметные области оказались сложнее прочих, эти детали в аннотации не раскрыты. Так как использована только аннотация исследования, часть методологических нюансов (конкретные метрики, примеры задач, состав репозиториев) остаётся за кадром.