ScienceBuddy, научная платформа с самоулучшающимися ИИ-агентами

ScienceBuddy, научная платформа с самоулучшающимися ИИ-агентами

Исследователи представили ScienceBuddy, интерактивную рабочую среду, которая встраивает непрерывно совершенствующихся научных ИИ-агентов в повседневную работу учёных. Система помогает исследователям выполнять научные задачи и одновременно превращает их запросы, обратную связь и результаты выполнения задач в новые обучающие задания и критерии оценки для непрерывного дообучения агентов.

В основе ScienceBuddy, метод, который авторы называют рекурсивным самоулучшением по схеме «рекурсия в рекурсии»: он соединяет эволюцию обвязки агента (то есть окружающих модель подсказок, инструментов и порядка шагов) с обучением самой модели с подкреплением. Внутренняя рекурсия дорабатывает обвязку при неизменной модели, а внешняя, дообучает модель уже поверх обновлённой обвязки. По описанию авторов, это замкнутый цикл: изменения в обвязке формируют опыт, на котором учится модель, а по мере того как модель обучается, у неё появляются новые возможности для дальнейшей доработки самой обвязки.

В работе показаны кейсы взаимодействия с исследователями, доработки обвязки и обучения модели; бенчмарк-кейсы охватывают четыре семейства научных задач, но какие именно, авторы не называют и не описывают. ScienceBuddy выпущен как исследовательский продукт, то есть доступен научному сообществу, а не остаётся только внутренним прототипом; сайт проекта, science-buddy.io. Более широкую цель авторы формулируют как «discovery intelligence» (буквально, «интеллект для открытий»): научный ИИ, который развивается через постоянное сотрудничество с исследователями и меняется вместе с исследованиями, которые он поддерживает.

Ключевые факты

  • ScienceBuddy, интерактивная рабочая среда, которая встраивает непрерывно совершенствующихся научных ИИ-агентов в повседневную работу исследователей и превращает их запросы, обратную связь и результаты выполнения задач в новые обучающие задания и критерии оценки.
  • В основе системы, рекурсивное самоулучшение по схеме «рекурсия в рекурсии»: внутренняя рекурсия дорабатывает обвязку агента при неизменной модели, а внешняя, дообучает саму модель уже поверх обновлённой обвязки.
  • Доработка обвязки и обучение модели образуют замкнутый цикл: изменения обвязки формируют опыт для обучения модели, а обучение модели открывает новые возможности для дальнейшей доработки обвязки.
  • Авторы приводят кейсы взаимодействия с исследователями, доработки обвязки и обучения модели; бенчмарк-кейсы охватывают четыре семейства научных задач, но какие именно, в тексте не раскрывается.
  • ScienceBuddy выпущен как исследовательский продукт, доступный научному сообществу (сайт, science-buddy.io); более широкую цель авторы называют «discovery intelligence», ИИ для научных открытий, который развивается вместе с исследованиями, которые поддерживает.

Почему это важно

Обычно доработку ИИ-агента для науки ведут как два раздельных процесса: инженеры вручную правят обвязку, подсказки, инструменты, порядок шагов вокруг модели, а отдельно дообучают саму модель, и формальной связи между этими процессами чаще всего нет. ScienceBuddy предлагает соединить их в один цикл: внутренняя рекурсия при неизменной модели доводит обвязку до состояния, которое даёт более качественный обучающий опыт, а внешняя рекурсия дообучает модель уже поверх обновлённой обвязки; по мере того как модель обучается, у неё, по словам авторов, появляются новые возможности для дальнейшей доработки самой обвязки. Источник данных для этого цикла, не синтетический бенчмарк, а реальные запросы, обратная связь и результаты выполнения задач, которые оставляют исследователи в повседневной работе с системой.

Кому это важно

В первую очередь, исследователям, которые уже используют ИИ-агентов для научных задач и хотят, чтобы такой агент со временем подстраивался именно под их манеру ставить задачи, а не оставался статичным после однократного обучения. Также это касается инженерных команд, которые строят обвязку вокруг научных агентов: сейчас доработка подсказок и инструментов чаще всего делается вручную и отдельно от переобучения модели, а ScienceBuddy предлагает формализованную схему, где обвязка и модель меняются как части одного цикла. Наконец, это релевантно всем, кто занимается непрерывным дообучением ИИ-агентов на данных реального использования, а не только на заранее собранных датасетах.

Как это применить

В тексте не сказано, доступен ли код ScienceBuddy или сама система целиком, известен только адрес сайта проекта, science-buddy.io, и то, что авторы называют релиз «исследовательским продуктом», то есть чем-то, доступным сообществу, а не только внутренним прототипом. Но сам паттерн можно перенять уже сейчас, не дожидаясь деталей реализации: не вести обучение модели и доработку обвязки агента как два независимых процесса, а формализовать связь между ними в виде двух вложенных циклов, и системно превращать обратную связь и результаты реальных задач пользователей в обучающие примеры и критерии оценки.

Можно ли доверять

Материал, карточка препринта на Hugging Face Papers; первым в списке авторов значится Шухань Сюэ, а остальной состав команды и её организационная принадлежность в аннотации не названы. В тексте нет ни одной бенчмарк-цифры, показателя точности или прямого сравнения с другими агентными системами, все формулировки об эффективности подхода пока описательные и исходят от самих авторов, без опоры на числа. Обсуждение на Hugging Face на момент публикации минимальное, 16 отметок и один комментарий. Прежде чем полагаться на подход как на проверенный, стоит дождаться полной версии работы с конкретными результатами и, если авторы их раскроют, кода и данных.

Риски и подводные камни

Главный источник неопределённости, сам текст работы: в нём нет ни бенчмарк-цифр, ни показателей точности, ни сравнения с другими агентными системами, так что реальный выигрыш от рекурсивной схемы пока подтверждён только описанием авторов, а не числами. Неизвестна и базовая модель, на которой работает ScienceBuddy, без этого трудно оценить как воспроизводимость подхода, так и его вычислительную стоимость. По конструкции система непрерывно превращает реальные запросы, обратную связь и результаты работы исследователей в обучающие примеры для модели, а значит качество и направление её дальнейшего обучения будут напрямую зависеть от того, как именно исследователи пользуются системой изо дня в день. Наконец, «четыре семейства научных задач», на которых показаны кейсы, нигде не названы и не описаны, так что оценить реальную широту применимости подхода по одной аннотации нельзя.