OmniScientist: ИИ-учёный воспринимает сырые данные напрямую, а не их сводки

Системы «ИИ-учёный» уже умеют автоматизировать всё более полный цикл исследования, от выдвижения гипотезы и выполнения кода до подготовки текста статьи. Но полнота этого цикла не равна доступу ко всем доказательствам, на которых строится открытие: такие системы обычно рассуждают над текстом, кодом, метками или уже готовыми сводками данных, а пространственные, временные, межканальные и процедурные связи, то, как выглядит снимок, как звучит сигнал, как во времени меняется 3D-структура, часто и оказываются решающей уликой конкретного исследования, и текстовая сводка их стирает.
Исследователи представили OmniScientist, сквозного омнимодального ИИ-учёного, который ведёт мультидисциплинарное исследование напрямую по разнородным сырым данным, а не по их описаниям. Систему образуют слой восприятия и три автономных агента, по генерации идей, по проведению экспериментов и по написанию текста статьи, работающие внутри детерминированного конвейера: наблюдения над сырыми данными формируют исследовательские вопросы, экспериментальные решения и итоговые утверждения на всех этапах цикла, а не только на старте. Проверки идеи на новизну, методологической строгости и итоговых утверждений реализованы прямо в коде: система автоматически отсеивает неновые идеи, проверяет статистическую корректность выводов, отслеживает происхождение результатов выполнения экспериментов и следит, чтобы числа в тексте статьи были прослеживаемы до реальных вычислений.
OmniScientist протестировали на 36 реальных задачах из пяти групп научных дисциплин и четырёх категорий научных данных; в набор вошли изображения, сигналы, аудио, видео, 3D-структуры, траектории, таблицы, формулы и графы. Система прошла полный путь от сырых данных до готовой статьи во всех 36 случаях, а средняя итоговая оценка статьи с эталонной базовой моделью рассуждений составила 6,3. В попарных сравнениях со «слепым» вариантом системы, которому давали только заранее просчитанные числовые признаки без прямого доступа к сырым данным, прямое восприятие улучшило показатели по всем 7 оцениваемым параметрам и победило в 85% сравнений «один на один».
Авторы работы делают вывод: восприятие данных на всех этапах жизненного цикла необходимо для научных открытий, подкреплённых доказательствами, и это даёт практический путь к по-настоящему универсальным ИИ-учёным.
Ключевые факты
- Архитектура: слой восприятия сырых данных плюс три автономных агента, генерации идей, экспериментов и написания текста статьи, работающие в едином детерминированном конвейере на всех этапах исследования.
- Проверки встроены прямо в код: автоматический отсев неновых идей, статистическая корректность выводов, прослеживаемость хода экспериментов и происхождения чисел в итоговом тексте.
- Тест на 36 реальных задачах из 5 групп научных дисциплин и 4 категорий научных данных: изображения, сигналы, аудио, видео, 3D-структуры, траектории, таблицы, формулы, графы.
- Во всех 36 случаях система прошла полный путь от сырых данных до готовой статьи; средняя оценка статьи с эталонной базовой моделью рассуждений, 6,3.
- В попарных сравнениях со «слепым» вариантом (только готовые числовые признаки, без сырых данных) прямое восприятие улучшило все 7 оцениваемых параметров и победило в 85% сравнений.
Почему это важно
Системы «ИИ-учёный» уже умеют автоматизировать всё более полный цикл исследования, от выдвижения гипотезы и выполнения кода до подготовки текста статьи. Но полнота цикла не равна доступу ко всем доказательствам, на которых строится открытие: такие системы обычно рассуждают над текстом, кодом, метками или уже готовыми сводками данных, а пространственные, временные, межканальные и процедурные детали, то, как выглядит снимок, как звучит сигнал, как во времени меняется 3D-структура, часто и есть решающая улика конкретного исследования, и текстовая сводка её стирает. OmniScientist переносит восприятие сырых данных на весь жизненный цикл: не только на этапе постановки вопроса, но и при экспериментальных решениях и формулировке итоговых утверждений.
Кому это важно
В первую очередь, командам, которые строят автоматизированные системы для науки и работают с данными за пределами чистого текста: снимками, сигналами, видео, 3D-структурами, траекториями. Результат показывает, что для таких задач текстовой сводки исходных данных недостаточно, нужен прямой доступ к самим сырым данным на каждом шаге конвейера, а не только при постановке вопроса. Это релевантно и разработчикам мультидисциплинарных ИИ-агентов для науки в целом: тест охватил сразу пять групп научных дисциплин и единые для всех них проверки строгости и достоверности выводов.
Как это применить
Ключевая практическая идея, закладывать проверки прямо в код конвейера, а не полагаться на то, что модель «сама не ошибётся»: автоматический отсев неновых идей, проверка статистической корректности выводов, отслеживание происхождения результатов выполнения экспериментов и прослеживаемость чисел в итоговом тексте статьи до реальных вычислений. Для команд, которые строят похожие агентные конвейеры для науки или прикладных исследований, это ориентир и на архитектуру («восприятие сырых данных плюс отдельные агенты для идеи, эксперимента и текста» вместо одной модели-универсала на всё), и на то, какие проверки достоверности стоит закладывать в код, а не оставлять на усмотрение языковой модели.
Можно ли доверять
Проверяли не на игрушечных примерах: 36 реальных задач из разных дисциплин и типов данных, а сравнение поставлено как эксперимент, а не как рекламная демонстрация, «слепому» варианту с теми же тремя агентами намеренно оставили только готовые числовые признаки, без прямого доступа к сырым данным, и сравнивали именно эффект прямого восприятия, а не системы «в вакууме»: по всем 7 параметрам оценки и в 85% попарных сравнений. Это делает вывод о пользе прямого восприятия сырых данных достаточно обоснованным. Слабее обоснована абсолютная величина среднего балла статьи, 6,3: шкала и максимум в описании работы не указаны, поэтому само число не говорит, насколько хороши получившиеся статьи в абсолютном выражении.
Риски и подводные камни
Выборка, 36 задач на 5 групп дисциплин и 4 категории данных, то есть в среднем считаные случаи на каждую комбинацию; заявку на мультидисциплинарную универсальность стоит воспринимать как первую демонстрацию работоспособности, а не как статистически устоявшийся результат. Автоматические проверки в коде, новизна, статистическая корректность, происхождение чисел, ловят формальные и воспроизводимые ошибки, но это не замена содержательной экспертной оценке статьи специалистом по конкретной дисциплине. Итоговый балл системы напрямую зависит от выбранной базовой модели рассуждений: смена этой модели, скорее всего, сдвинет и результат.
«Результаты показывают, что восприятие данных на всех этапах жизненного цикла необходимо для научных открытий, подкреплённых доказательствами, и даёт практический путь к по-настоящему универсальным ИИ-учёным.»
— авторы работы