Google представила Biomarker Discovery Framework, ИИ для поиска биомаркеров по данным носимых устройств

Google представила Biomarker Discovery Framework, ИИ для поиска биомаркеров по данным носимых устройств

Исследователи Google Research представили Biomarker Discovery Framework, мультиагентную систему, которая отбирает и приоритизирует кандидатов в биомаркеры по данным носимых устройств (частота сердечных сокращений, паттерны сна и другие непрерывные физиологические сигналы) через итеративный цикл: выдвижение гипотез, статистический анализ и рассуждение с опорой на научную литературу. Авторы отмечают, что существующие ИИ-агенты для науки часто ломаются на физиологических временных рядах: они оптимизируются под предсказательную точность и упускают статистическую строгость, из-за чего возникают ложные корреляции, утечки данных и хрупкие признаки.

Framework сочетает детерминированные вычисления для числового анализа с генеративным рассуждением для формирования и интерпретации гипотез. Агент-оркестратор превращает запрос на естественном языке в план выполнения и проводит специализированных агентов через шесть фаз, вплоть до состязательной проверки результата, а общая память, структурный фактлист и общие инструменты обеспечивают прослеживаемость каждого шага. Всё происходит под контролем человека: финальное решение остаётся за исследователем.

На примере запроса «приоритизировать признаки носимых устройств, связанные с тяжестью депрессии» framework профилировал датасет DWB, предложил признаки вариабельности времени сна и оценил связь между вариабельностью длительности сна и тяжестью депрессии по шкале PHQ-8 (ρ = 0,252, p < 0,001). После этого система проверила устойчивость результата, утечки данных, согласованность по подгруппам и альтернативные объяснения и оформила находку как гипотезу о циркадной нестабильности с опорой на литературу, для рассмотрения человеком.

Framework протестировали на трёх крупных когортах общим объёмом 9279 наблюдений участников: DWB и GLOBEM (психическое здоровье) и WEAR-ME (метаболические заболевания). Система самостоятельно определила 41 кандидата в цифровые биомаркеры для психического здоровья и 25, для метаболических исходов. В когорте GLOBEM вариабельность времени засыпания дала лишь разведочную, слабую связь с депрессией по шкале PHQ-4 (ρ = 0,126, p < 0,001; AUC при кросс-валидации = 0,535). Поскольку когорты, конечные показатели и определения признаков различаются и ни один идентичный кандидат не воспроизвёлся в обеих выборках, авторы подчёркивают: это не прямая репликация находки из DWB, а лишь предположительное схождение на уровне конструкта. В метаболической области framework вывел новый составной признак, индекс сердечно-сосудистой формы (число шагов, делённое на пульс покоя), как неинвазивный коррелят инсулинорезистентности, связав его с прежними работами о регуляции глюкозы и кардиометаболической форме. Добавление найденных framework-ом признаков к демографическим переменным улучшило предсказательную способность моделей: ΔR² = 0,040 для депрессии и 0,021 для инсулинорезистентности.

Качество работы системы оценивали 15 экспертов в медицине, биомедицинской науке о данных, машинном обучении, биоинформатике и цифровом здравоохранении, они вслепую читали отчёты Biomarker Discovery Framework и трёх других современных ИИ-систем для научной работы: AI co-scientist от Google DeepMind, Biomni и Data Science Agent на базе Google ADK. Biomarker Discovery Framework, Biomni и Data Science Agent оценивали вместе в 21 сессии, а Biomarker Discovery Framework отдельно, ещё в 13 сессиях по той же методике. В слепой оценке framework набрал наивысшие средние баллы по всем семи параметрам качества и оказался единственной системой, получившей от рецензентов оценки «принять» или «незначительная правка» по условной редакционной шкале: 2 «принять», 8 «незначительная правка», 8 «серьёзная правка» и 3 «отклонить». Рецензенты оценили, что в среднем сохранили бы 56,9% сгенерированного framework-ом текста отчёта, против 18,8, 30,4% у систем сравнения, а в сессиях прямого ранжирования четырёх систем поставили Biomarker Discovery Framework на первое место в 9 из 13 случаев.

Работу возглавил Юбин Ким, аспирант MIT, во время стажировки в Google под руководством Дэниела Макдаффа и Хамида Палангхи; все трое, соавторы блог-поста Google Research, опубликованного 21 августа 2026 года.

Ключевые факты

  • Google Research представила Biomarker Discovery Framework, мультиагентную систему с оркестратором и шестью фазами анализа, которая сочетает детерминированную статистику с генеративным рассуждением под контролем человека
  • На трёх когортах общим объёмом 9279 наблюдений система нашла 41 кандидата в биомаркеры для психического здоровья и 25, для метаболических заболеваний
  • Пример находки: вариабельность длительности сна связана с тяжестью депрессии по шкале PHQ-8 (ρ = 0,252); для метаболической области выведен индекс сердечно-сосудистой формы (шаги / пульс покоя) как коррелят инсулинорезистентности
  • Добавление найденных признаков к демографическим данным повышает точность прогноза: ΔR² = 0,040 для депрессии и 0,021 для инсулинорезистентности
  • В слепом сравнении 15 экспертов framework получил высшие оценки по всем 7 параметрам среди четырёх ИИ-систем для науки, первое место в 9 из 13 сессий ранжирования и готовность сохранить 56,9% его текста против 18,8, 30,4% у конкурентов

Почему это важно

Носимые устройства уже собирают физиологические данные в масштабе целых популяций, узким местом стал не сбор сигналов, а превращение их в надёжные и клинически осмысленные биомаркеры. Авторы указывают, что существующие ИИ-агенты для научной работы часто оптимизируются только под предсказательную точность и упускают статистическую строгость на физиологических временных рядах, из-за чего получаются ложные корреляции, утечки данных и хрупкие признаки. Biomarker Discovery Framework отвечает на это архитектурно: жёстко разделяет детерминированные вычисления и генеративное рассуждение и заставляет агентов состязательно проверять собственные находки, сохраняя человека в контуре принятия решений.

Кому это важно

В первую очередь, исследователям в биомедицинской науке о данных и цифровом здравоохранении, которые ищут ранние физиологические маркеры болезней по данным носимых устройств, а также разработчикам самих устройств и клиническим исследователям депрессии и метаболических нарушений. Во вторую, командам, строящим ИИ-агентов для научной работы: framework показывает конкретную архитектуру (оркестратор плюс шестифазный процесс с общей памятью и фактлистом), которая в слепой оценке обошла три другие системы того же класса, включая AI co-scientist от Google DeepMind.

Как это применить

Framework работает от запроса на естественном языке: исследователь формулирует направление поиска (например, «найти признаки носимых устройств, связанные с тяжестью депрессии»), агент-оркестратор превращает это в план выполнения, а специализированные агенты профилируют датасет, предлагают признаки, проводят статистический анализ, проверяют устойчивость находки, утечки данных и согласованность по подгруппам и оформляют результат как гипотезу с опорой на литературу, для финального рассмотрения человеком. Источник не сообщает, планируется ли открыть код framework или сами рецензируемые отчёты в открытом доступе.

Можно ли доверять

Оценку качества проводили 15 независимых экспертов в медицине, биомедицинской науке о данных, машинном обучении, биоинформатике и цифровом здравоохранении, вслепую сравнивавших отчёты framework с тремя другими ИИ-системами для науки, по семи параметрам framework получил самые высокие средние баллы. При этом сами авторы делают оговорки: величины найденных эффектов скромные, что типично для пассивного сенсорного фенотипирования; связь, найденная в когорте GLOBEM, разведочная и слабая (AUC = 0,535); а совпадение находок между DWB и GLOBEM авторы описывают не как прямую репликацию, а лишь как предположительное схождение на уровне конструкта, поскольку когорты, конечные показатели и определения признаков различались. Колонка «механизм» в результатах, литературная гипотеза, а не причинный вывод, и оценки достоверности, это не клиническая валидация, проведённая в этой работе.

Риски и подводные камни

Источник не раскрывает, будут ли framework, его код или рецензируемые отчёты опубликованы в открытом доступе, не называет состав экспертной панели и индивидуальные баллы систем сравнения за пределами диапазона удержания текста, не даёт разбивку 9279 наблюдений по отдельным когортам и не сообщает сроков клинической валидации или внедрения найденных кандидатов в биомаркеры. Сравнение при этом частично проводилось с собственными системами Google (AI co-scientist от Google DeepMind, Data Science Agent на базе Google ADK), а доля текста, которую рецензенты «сохранили бы», субъективная оценка, а не независимый аудит результатов.

«В цифровой медицине узкое место, уже не сбор данных, а принципиальная, строгая генерация гипотез.»

— Юбин Ким, Дэниел Макдафф и Хамид Палангхи, Google Research