OpenAI: агенты Codex ускоряют разработку научного ПО

OpenAI: агенты Codex ускоряют разработку научного ПО

OpenAI опубликовала полевой отчёт о восьми проектах научных вычислений, преимущественно в науках о жизни (геномика и смежные области): пять проектов вели только с помощью Codex, ещё три, комбинацией Codex и Claude Code. Отчёт собрал кейсы, написанные самими командами-разработчиками, и выделил общие закономерности. Проблема, с которой столкнулись команды: многие научные инструменты изначально писались как код, сопровождающий научную статью, силами небольших академических групп без инженерного опыта и времени на упаковку, тестирование, оптимизацию и долгую поддержку. В результате научная инфраструктура держится на медленных и хрупких процессах, требующих постоянного ручного сопровождения, что тормозит темп исследований.

По наблюдению авторов отчёта, ИИ-агенты снижают стоимость инженерной работы и берут на себя рутинную реализацию, позволяя исследователям быстрее прототипировать идеи, браться за проекты, которые раньше были непрактичны, и легче поддерживать программное обеспечение в долгосрочной перспективе. Один из примеров: модель GPT-5.5 заменила устаревшую систему сборки и упаковки библиотеки cyvcf2, Python-инструмента для чтения и записи файлов с геномными вариантами, на современный унифицированный процесс, упростивший установку, тестирование и выпуск релизов. Брент Педерсен так прокомментировал результат: «С ИИ-агентами довольно легко двигаться быстро; но чтобы далеко продвинуться в науке, всё ещё нужны экспертное руководство, понимание, вкус и внимательность».

Главный вывод отчёта: инженерный труд и экспертиза перестают быть узким местом, но им на смену приходит новое узкое место, проверка результатов работы агента, которая по-прежнему зависит от человеческого суждения. Во всех кейсах агенты хорошо справлялись с конкретными, чётко поставленными задачами, но не могли надёжно оценить, корректна ли их работа с научной точки зрения, и нередко выражали уверенность даже там, где в коде были явные ошибки. Поэтому командам приходилось искать надёжные способы проверки: сильнее всего работали подходы с внешним эталоном или измеримой целью, точное совпадение вывода, сверка с существующим инструментом, корректное статистическое поведение или заранее известные ответы на смоделированных данных.

Ещё одна повторяющаяся закономерность, проекты почти всегда шли поэтапно, через итерации с обратной связью, а не одним проходом. Команды дробили общую цель на небольшие изменения, а затем использовали промежуточные тесты и бенчмарки, чтобы оценивать и дорабатывать результат агента. Агенты быстро выдавали первую рабочую версию, но доводка граничных случаев и мелких числовых расхождений занимала намного больше времени, именно «последняя миля» реализации отнимала основную часть усилий.

Отчёт также описывает дальнейшую судьбу изменений: доработки для MHCflurry и cyvcf2 были включены обратно в исходные проекты, а инструмент rustar-aligner перешёл под новое сообщество-опекуна, поскольку исходный проект оказался заброшен. Авторы подчёркивают: там, где возможна координация с текущими сопровождающими проекта, начинать её нужно как можно раньше; если нужна отдельная реализация, у неё должен быть чёткий владелец и реальный план поддержки, иначе сегодняшний «переписанный набело» инструмент завтра рискует стать очередным заброшенным кодом, а не надёжной научной инфраструктурой.

Ключевые факты

  • OpenAI опубликовала полевой отчёт о восьми проектах научных вычислений (в основном в науках о жизни): пять, только на Codex, три, на Codex и Claude Code вместе
  • GPT-5.5 заменил устаревшую систему сборки и упаковки библиотеки cyvcf2 (парсинг геномных данных), упростив установку, тестирование и релизы
  • Главный барьер, не написание кода, а проверка результата: агенты уверенно выдавали код с ошибками, поэтому команды опирались на внешние эталоны, точное совпадение вывода, сверку с существующим инструментом, статистические тесты или заранее известные ответы на смоделированных данных
  • Проекты шли поэтапно с обратной связью: агенты быстро делали первую версию, но доработка граничных случаев и числовых расхождений («последняя миля») занимала больше всего времени
  • Доработки для MHCflurry и cyvcf2 включили обратно в исходные проекты, а rustar-aligner перешёл под новое сообщество, потому что исходный проект был заброшен

Почему это важно

Научное программное обеспечение годами страдало от хрупких, плохо сопровождаемых процессов: инструменты писались небольшими академическими командами без инженерных ресурсов и времени на тестирование и долгую поддержку. Отчёт OpenAI показывает, что ИИ-агенты снижают стоимость этой инженерной работы, беря на себя рутинную реализацию, модернизацию сборки, миграции языка, GPU-редизайн, и тем самым освобождают исследователей для собственно научной работы вместо поддержки кода.

Кому это важно

В первую очередь исследователям в науках о жизни, геномике и смежных областях, а также небольшим академическим командам, у которых нет штатных инженеров для поддержки научного ПО. Актуально и для мейнтейнеров открытых научных библиотек вроде cyvcf2 и MHCflurry, и для тех, кто решает, использовать ли Codex или Claude Code для подобных задач.

Как это применить

Отчёт описывает рабочую модель, которая сработала на восьми проектах: разбивать крупную цель на небольшие изменения, использовать промежуточные тесты и бенчмарки для проверки каждого шага, а не доверять агенту весь проект одним проходом. До начала работы стоит определить измеримый критерий приёмки, точное совпадение с эталонным выводом, сверку с существующим инструментом или заранее известный ответ на смоделированных данных. И заранее продумать, кто будет долгосрочно сопровождать результат, команда OpenAI прямо предупреждает, что без чёткого владельца переписанный инструмент рискует стать заброшенным кодом.

Можно ли доверять

Материал, собственный полевой отчёт OpenAI, а кейсы внутри него написаны самими командами-разработчиками проектов, то есть это самоотчёты без независимой проверки; сама OpenAI называет отчёт ретроспективным и исследовательским (exploratory), а не строгим исследованием. При этом ключевой вывод отчёта звучит не как реклама: агенты сами по себе ненадёжны для оценки качества своей работы и нередко выражали уверенность даже при явных ошибках, поэтому вся достоверность результатов держится на человеческой проверке.

Риски и подводные камни

Главный риск, который выделяют сами авторы: агенты часто уверены в правильности своей работы, даже когда в ней есть явные ошибки, необходимость проверки человеком никуда не уходит. Второй риск, снижение стоимости переписывания кода облегчает появление множества похожих реализаций одного и того же инструмента, что распыляет пользователей и экспертное внимание, необходимое для поддержки хотя бы одной надёжной версии. Наконец, зрелое научное ПО несёт с собой недокументированные соглашения, требования совместимости и доверие пользователей, которые нельзя воспроизвести простым переносом исходного кода, без чёткого владельца и плана поддержки модернизированный инструмент рискует со временем оказаться заброшенным.

«С ИИ-агентами довольно легко двигаться быстро; но чтобы далеко продвинуться в науке, всё ещё нужны экспертное руководство, понимание, вкус и внимательность.»

— Брент Педерсен