ScienceIDE учит ИИ-агентов на научном коде из репозиториев

ScienceIDE учит ИИ-агентов на научном коде из репозиториев

Авторы описывают проблему: научные кодовые репозитории хранят десятилетия человеческого знания в виде исполняемых моделей, методов и инструментов, но раздробленные наборы инструментов, неявные отраслевые соглашения и специфичные для каждой области критерии корректности мешают превратить это знание в надёжный обучающий опыт для ИИ. Эту трудность авторы называют «дефицитом научного опыта» (scientific experience bottleneck).

Для решения этой проблемы представлена ScienceIDE, инфраструктура, которая превращает существующий в мире научный код в программируемые среды для обучения научных ИИ-агентов. Процесс опирается на заданные экспертами научные кейсы и критерии приёмки: агенты преобразуют репозитории в исполняемые среды, поддерживающие генерацию задач, их выполнение и научную верификацию результата. Такие среды становятся общей основой сразу для трёх типов обучения моделей: контролируемого дообучения (supervised fine-tuning), обучения с подкреплением (reinforcement learning) и оценки (evaluation).

На проверенных траекториях взаимодействия, полученных с помощью ScienceIDE, авторы обучили семейство моделей PhAI-IDE трёх размеров: PhAI-IDE-72B, PhAI-IDE-9B и PhAI-IDE-4B. По заявлению авторов, эти модели показывают прирост качества на отложенной задаче исправления научного кода, а также на отдельных общих бенчмарках по коду, рассуждениям и знаниям, конкретные названия бенчмарков и числовые показатели прироста в тексте не приводятся. Авторы трактуют этот результат как свидетельство положительного переноса: опыт, накопленный на научном коде, улучшает и более широкие способности модели за пределами узкой научной задачи.

Авторы позиционируют ScienceIDE как основу для будущего интегрированного рабочего пространства, объединяющего обучение агентов и научную практику, с целью превратить весь массив научного ПО человечества в общий субстрат для развития научного интеллекта. Код проекта опубликован на GitHub (aitofound/ScienceIDE), но что именно там выложено, веса моделей, сами обучающие среды или только код инфраструктуры, в тексте не уточняется.

Ключевые факты

  • ScienceIDE превращает научные кодовые репозитории в исполняемые среды обучения для ИИ-агентов на основе заданных экспертами кейсов и критериев приёмки
  • Среды поддерживают три режима использования: контролируемое дообучение, обучение с подкреплением и оценку моделей
  • На этих средах обучено семейство моделей PhAI-IDE трёх размеров, 72B, 9B и 4B параметров
  • Модели показывают прирост на задаче исправления научного кода и на отдельных общих бенчмарках по коду, рассуждениям и знаниям, конкретные цифры не названы
  • Авторы называют это свидетельством переноса научного опыта на более широкие способности модели; код опубликован на GitHub

Почему это важно

Научный код, это огромный и во многом неиспользуемый источник знаний для обучения ИИ: он кодирует проверенные методы и модели, накопленные за десятилетия. Но обучать на нём агентов напрямую мешают раздробленные инструменты, неявные соглашения конкретных научных областей и специфичные критерии правильности результата, это то, что авторы называют дефицитом научного опыта. ScienceIDE предлагает системное решение: превращать такой код в стандартизированные, проверяемые среды, на которых можно и обучать, и оценивать агентов.

Кому это важно

В первую очередь, исследователям, которые разрабатывают ИИ-агентов для научных и инженерных задач, и командам, которые обучают модели на коде и рассуждениях. Работа также интересна тем, кто строит инфраструктуру для RL- и SFT-обучения агентов: ScienceIDE предлагает единый формат сред вместо разрозненных наборов задач под каждый отдельный репозиторий.

Как это применить

Практический выход работы, сама инфраструктура ScienceIDE для превращения репозиториев в обучаемые среды, а также готовое семейство моделей PhAI-IDE (72B, 9B, 4B параметров). Код проекта доступен на GitHub по адресу aitofound/ScienceIDE. При этом в тексте не сказано, что именно опубликовано в репозитории, веса моделей, сгенерированные обучающие среды или только код самой инфраструктуры, это стоит уточнять отдельно перед тем как рассчитывать на конкретный артефакт.

Можно ли доверять

Источник, карточка препринта на Hugging Face Papers с авторским описанием работы; независимой проверки заявленных результатов в тексте нет. В самом тексте не указаны ни имена авторов, ни их принадлежность к организациям, ни дата публикации или сроки доступности ScienceIDE. Заявления о приросте качества на задаче исправления научного кода и на общих бенчмарках не сопровождаются названиями конкретных бенчмарков или числовыми показателями, это декларация авторов, а не воспроизводимый результат, который можно проверить по цифрам.

Риски и подводные камни

Главная неопределённость, отсутствие конкретики: нет цифр, подтверждающих заявленный прирост качества, нет описания объёма и состава обучающих данных или «проверенных траекторий взаимодействия», нет ясности, что именно выложено в открытый доступ. Кроме того, подход зависит от экспертов, вручную задающих научные кейсы и критерии приёмки для каждой области, это ограничивает масштабируемость метода теми областями, где такая экспертная разметка вообще существует.