OpenAI: ИИ-агенты ускорили научный код в 60 раз, но не могут проверить его научную корректность

OpenAI: ИИ-агенты ускорили научный код в 60 раз, но не могут проверить его научную корректность

OpenAI совместно с академическими партнёрами опубликовала полевой отчёт о восьми кейсах, в основном в биологии, где научные группы использовали ИИ-агентов, Codex и Claude Code, для модернизации, оптимизации и полного переписывания устаревшего исследовательского ПО. Многие такие инструменты изначально писались небольшими академическими командами как вспомогательный код для одной статьи, без времени и ресурсов на тестирование, поддержку и оптимизацию; со временем они становятся хрупкими, но остаются критичными для целых научных областей.

Примеры из отчёта. Библиотеку cyvcf2 для чтения генетических данных модель GPT-5.5 избавила от устаревшего процесса сборки и установки. В проекте MHCflurry, иммунологической модели, предсказывающей мишени для иммунных клеток, Claude Code и Codex поочерёдно выступали разработчиком и ревьюером, перенеся около 10 000 строк кода с TensorFlow на PyTorch; более ранняя попытка такого переноса в начале 2025 года провалилась, и разработчик Сергей Фельдман связывает это не с самими инструментами, а с недостаточной надёжностью тогдашних моделей. Инструмент STAR для картирования результатов секвенирования (более 20 000 строк C и C++, давно не поддерживается) переписали с нуля на Rust под именем rustar-aligner: на 10 000 коротких прочтений из клеток дрожжей совпадение с оригиналом составило 99,815% для одиночных прочтений и 99,883% для парных, и ни один из инструментов не пропустил прочтение, которое смог картировать другой. RustQC объединила 15 отдельных инструментов контроля качества в одну программу и на большом наборе данных сократила время выполнения с 15 часов 34 минут до 14 минут 54 секунд, более чем в 60 раз, самое большое ускорение в отчёте. HelixForge перенесла генерацию синтетических геномных данных на GPU: на данных одного донора и участке генома в десять миллионов пар оснований весь конвейер отработал в 59,6 раза быстрее BamSurgeon, а основной вычислительный шаг, в 98,6 раза быстрее. Для сборщика генома hifiasm GPT-5.5 нашла изменения, сократившие время выполнения на реальных данных генома человека почти на 15%; для библиотеки симуляции генетических данных HI.SIM один проход GPT-5.2 и второй проход более новой моделью вместе сократили время выполнения примерно на 31% без изменения результата.

При этом скорость не гарантирует правильность. Агенты хорошо справлялись с чётко очерченными задачами, но не могли достоверно оценить, верен ли результат с научной точки зрения, и порой уверенно выдавали код с ошибками. Показателен кейс bayesm: Rust-версия работала в 2, 20 раз быстрее оригинала, но первые версии двух продвинутых методов содержали ошибки, трудноразличимые по одному только выводу программы. В одном случае агент перепутал ключевой управляющий параметр, из-за чего программа использовала обратную величину вместо нужной; отдельная ошибка касалась самого расчёта, обе нашли только после детального калибровочного теста на тысячах синтетических наборов данных с известными результатами. Другой метод, HART, давал в целом правдоподобные результаты, но содержал изъяны, избыточно затратные вычисления и неверно масштабированный поправочный коэффициент; одной правдоподобности вывода оказалось недостаточно, чтобы считать код корректным.

Во всех проектах разделение труда было одинаковым: цели, критерии успеха и методы проверки задавали люди, агенты занимались реализацией. Например, прежде чем поручить GPT-5.5 оптимизацию hifiasm, исследователь заранее подготовил тестовый стенд с раздельными обучающей и проверочной выборками.

Авторы приводят и оценку потенциальной экономии: если агенты смогут закрывать от четверти до половины всех проблем установки исследовательского ПО, экономия времени в пересчёте на 100 пакетов составит от 600 000 до почти 5 миллионов долларов; для одного только NumPy отчёт оценивает потенциальную экономию примерно в 650 часов работы по поддержке в год. Но дешёвые переписывания создают собственную проблему, они способны дробить сообщества пользователей и ещё сильнее распылять и без того ограниченное время опытных сопровождающих. Команды решали вопрос владения кодом по-разному: часть изменений вошла напрямую в исходные проекты, rustar-aligner перешёл под опеку исследовательского консорциума scverse (поскольку STAR больше не поддерживается), а автор FastQC отказался заменять оригинальный инструмент Rust-версией и вместо этого перенёс найденные улучшения в исходную Java-версию, которая получила то же трёхкратное ускорение.

Авторы отчёта отдельно подчёркивают: это не репрезентативное исследование, а набор рассказов участников уже завершённых проектов. Главным узким местом они видят смещение фокуса с написания кода на проверку, научную экспертизу и ответственность за дальнейшую поддержку. Похожая картина видна и за пределами науки: исследование METR показало, что реальные сопровождающие проектов отклонили бы около половины решений, которые тест SWE-bench Verified засчитывает как успешные, а проект curl закрыл программу поиска уязвимостей за вознаграждение после того, как отчёты об уязвимостях, сгенерированные ИИ, отнимали время сопровождающих, не принося пользы.

Отчёт, часть более широкой ставки OpenAI на науку: в компании есть отдельная научная команда под руководством Кевина Уэйла, который ожидает, что 2026 год станет для науки тем же, чем 2025-й стал для разработки ПО. В апреле OpenAI представила GPT-Rosalind, модель для исследований в науках о жизни, и выпустила бесплатный плагин для Codex в этой области, подключающий модели более чем к 50 публичным базам данных и биологическим инструментам.

Ключевые факты

  • Восемь кейсов, в основном в биологии: агенты Codex и Claude Code ускорили модернизацию научного ПО, RustQC более чем в 60 раз (с 15 ч 34 мин до 14 мин 54 с), HelixForge в 59,6, 98,6 раза, HI.SIM примерно на 31%.
  • Переписанный с нуля на Rust инструмент rustar-aligner совпал с оригинальным STAR в 99,815% случаев для одиночных прочтений и 99,883% для парных.
  • Агенты уверенно выдают код с ошибками: в проекте bayesm агент перепутал ключевой параметр и использовал обратную величину, баг нашли только после калибровочного теста на тысячах синтетических наборов данных.
  • Во всех проектах цели, критерии успеха и методы проверки задавали люди, агенты отвечали только за реализацию, судить о корректности результата им не доверяли.
  • Оценка авторов: от 600 тысяч до почти 5 миллионов долларов экономии на 100 пакетов, если агенты закроют от четверти до половины проблем установки; для NumPy, около 650 часов поддержки в год.

Почему это важно

Отчёт системно показывает, где проходит граница возможностей ИИ-агентов в науке: они действительно радикально ускоряют рутинную инженерную работу над исследовательским кодом, модернизацию, оптимизацию, полное переписывание, но не заменяют человека там, где нужно судить о корректности результата. Это меняет распределение труда в научных группах: узкое место смещается с написания кода на его проверку.

Кому это важно

Разработчикам и сопровождающим научного ПО, в первую очередь в биоинформатике, исследовательским группам, которые полагаются на устаревшие, но критичные инструменты вроде STAR, а также самой OpenAI, отчёт часть её ставки на науку под руководством Кевина Уэйла, который рассчитывает, что 2026 год станет для науки тем же, чем 2025-й был для разработки софта.

Как это применить

Судя по описанным кейсам, рабочая схема такая: человек заранее готовит независимый тестовый стенд с обучающей и проверочной выборками и чёткими критериями успеха, а агенту, в отчёте использовались Codex, Claude Code, GPT-5.5 и GPT-5.2, поручают саму реализацию: модернизацию сборки, перенос кода между фреймворками или языками, поиск оптимизаций. Ни в одном кейсе агенту не доверяли самому судить, верен ли его результат, эту роль выполнял отдельный тест, построенный человеком.

Можно ли доверять

Цифры ускорения в отчёте подтверждены измерениями, например, точное совпадение результатов rustar-aligner со STAR в 99,8%+ случаев, а не оценка на глаз, но авторы прямо оговаривают: это не репрезентативное исследование, а набор рассказов участников уже завершённых проектов. Показателен и кейс bayesm: код с ошибкой (агент перепутал ключевой параметр и использовал обратную величину вместо нужной) выглядел правдоподобно и прошёл бы поверхностную проверку; поймать баг удалось только детальным калибровочным тестом на тысячах синтетических наборов данных.

Риски и подводные камни

Главный риск, уверенный, но неверный код: по описанию Филипа Юэлса, руководившего проектом RustQC, агенты бывают «красноречивы, убедительны и уверенно неправы так, что это легко пропустить». Дешёвые переписывания создают и организационную проблему, они способны дробить сообщества пользователей и ещё сильнее распылять ограниченное время опытных сопровождающих; именно поэтому команда rustar-aligner передала проект консорциуму scverse, а автор FastQC вовсе отказался заменять оригинал переписанной версией. Похожий эффект отмечен и вне науки: исследование METR показало, что сопровождающие реальных проектов отклонили бы около половины решений, которые тест SWE-bench Verified засчитывает как успешные, а проект curl закрыл программу поиска уязвимостей за вознаграждение из-за потока бесполезных ИИ-сгенерированных отчётов.

«Агенты красноречивы, убедительны и уверенно неправы так, что это легко пропустить.»

— Филип Юэлс, руководитель проекта RustQC