Представлен AutoSciBench: тесты для научных ИИ-агентов создаются автоматически

В статье представлен AutoSciBench, фреймворк, который автоматически создаёт и итеративно дорабатывает бенчмарки (наборы тестовых задач) для научных ИИ-агентов. Исходная проблема, по описанию авторов статьи: по мере быстрого развития агентов существующие бенчмарки насыщаются, перестают различать возможности агентов и выявлять оставшиеся слабые места. В научных областях обновлять бенчмарки особенно трудно: это требует много времени, труда и экспертизы в предметной области, поэтому оценка не поспевает за ростом возможностей агентов.
Каждая задача в AutoSciBench описывается на двух уровнях. Высокоуровневый концепт задаёт научную область, тип данных и требуемый подход к рассуждению. Низкоуровневый рецепт определяет, как строятся и проверяются вопрос, среда и эталонный ответ.
Дальше работает цикл доработки. Агенты пытаются решить задачу, и в результате появляются траектории решений и соответствующие отзывы судьи (judge). По ним AutoSciBench пересматривает рецепт или концепт: закрывает замеченные «лазейки» (shortcuts) и сдвигает задачи в сторону повторного анализа сырых данных, интерпретации промежуточных результатов и сведения доказательств воедино. Опыт, извлечённый из завершённых циклов доработки, затем направляет генерацию новых концептов, так что уроки прошлых задач учитываются при построении следующих бенчмарков.
Оценка проводилась на трёх областях: вычислительная биология, материаловедение и клиническая визуализация (медицинские изображения); генерация стартовала от существующих бенчмарков. Сгенерированные бенчмарки снижают среднюю точность решателей на 22,4 п.п. в вычислительной биологии и на 25,5 п.п. в материаловедении по сравнению с бенчмарками, составленными людьми. При этом сгенерированные задачи получили более высокие средние оценки качества во всех трёх областях. Авторы делают осторожный вывод: результаты говорят о том, что оценка научных агентов может адаптироваться по мере роста их возможностей.
Ключевые факты
- AutoSciBench, фреймворк, который автоматически генерирует и итеративно переписывает бенчмарки для научных ИИ-агентов.
- Задача описывается концептом (область, тип данных, подход к рассуждению) и рецептом (как строятся и проверяются вопрос, среда и эталонный ответ).
- Траектории решений и отзывы судьи используются, чтобы закрывать лазейки и смещать задачи к анализу сырых данных, интерпретации промежуточных результатов и сведению доказательств.
- Средняя точность решателей на сгенерированных бенчмарках ниже на 22,4 п.п. (вычислительная биология) и 25,5 п.п. (материаловедение) относительно бенчмарков, составленных людьми.
- Средние оценки качества сгенерированных задач выше, чем у исходных, во всех трёх областях: вычислительная биология, материаловедение, клиническая визуализация.
Почему это важно
Бенчмарки для агентов быстро насыщаются, а в науке их обновление требует много времени, труда и экспертизы. AutoSciBench предлагает автоматизировать эту работу: задачи не фиксируются раз и навсегда, а перестраиваются по результатам попыток агентов. Если подход подтвердится, оценка научных агентов сможет идти в ногу с их развитием; сами авторы формулируют это как «предположение», а не доказанный факт.
Кому это важно
Исследователям, которые строят и сопоставляют научных ИИ-агентов, и тем, кто составляет для них тесты в вычислительной биологии, материаловедении и клинической визуализации. Тем, кто следит за оценкой агентов, полезна и сама идея: бенчмарк, который обновляется вместе с агентами.
Как это применить
Из доступного текста видно только общую схему: описать задачу концептом и рецептом, прогнать агентов, по траекториям и отзывам судьи исправить рецепт или концепт, а накопленный опыт использовать для новых концептов. Сведений о выпуске кода, наборов данных или о вычислительной стоимости в тексте нет, поэтому практическое применение пока остаётся вопросом к полной статье.
Можно ли доверять
Пересказ основан на аннотации статьи; полный текст в основу не входил. Результаты, собственные заявления авторов. В аннотации не названы агенты-решатели и судьи, исходные бенчмарки, размеры сгенерированных наборов и способ получения оценок качества, так что проверить масштаб и надёжность эффекта по ней нельзя.
Риски и подводные камни
Снижение точности указано только для вычислительной биологии и материаловедения; для клинической визуализации такой цифры нет. Это абсолютная разница в процентных пунктах, а не относительное падение, и абсолютные уровни точности не приведены. Кроме того, неизвестно, кто и по какой шкале оценивал качество задач, а вывод авторов сформулирован осторожно: результаты лишь «предполагают» возможность адаптации оценки.