Google представила Biomarker Discovery Framework, ИИ для поиска биомаркеров по данным носимых устройств

Исследователи Google Research представили Biomarker Discovery Framework, мультиагентную систему, которая отбирает и приоритизирует кандидатов в биомаркеры по данным носимых устройств (частота сердечных сокращений, паттерны сна и другие непрерывные физиологические сигналы) через итеративный цикл: выдвижение гипотез, статистический анализ и рассуждение с опорой на научную литературу. Авторы отмечают, что существующие ИИ-агенты для науки часто ломаются на физиологических временных рядах: они оптимизируются под предсказательную точность и упускают статистическую строгость, из-за чего возникают ложные корреляции, утечки данных и хрупкие признаки.
Framework сочетает детерминированные вычисления для числового анализа с генеративным рассуждением для формирования и интерпретации гипотез. Агент-оркестратор превращает запрос на естественном языке в план выполнения и проводит специализированных агентов через шесть фаз, вплоть до состязательной проверки результата, а общая память, структурный фактлист и общие инструменты обеспечивают прослеживаемость каждого шага. Всё происходит под контролем человека: финальное решение остаётся за исследователем.
На примере запроса «приоритизировать признаки носимых устройств, связанные с тяжестью депрессии» framework профилировал датасет DWB, предложил признаки вариабельности времени сна и оценил связь между вариабельностью длительности сна и тяжестью депрессии по шкале PHQ-8 (ρ = 0,252, p < 0,001). После этого система проверила устойчивость результата, утечки данных, согласованность по подгруппам и альтернативные объяснения и оформила находку как гипотезу о циркадной нестабильности с опорой на литературу, для рассмотрения человеком.
Framework протестировали на трёх крупных когортах общим объёмом 9279 наблюдений участников: DWB и GLOBEM (психическое здоровье) и WEAR-ME (метаболические заболевания). Система самостоятельно определила 41 кандидата в цифровые биомаркеры для психического здоровья и 25, для метаболических исходов. В когорте GLOBEM вариабельность времени засыпания дала лишь разведочную, слабую связь с депрессией по шкале PHQ-4 (ρ = 0,126, p < 0,001; AUC при кросс-валидации = 0,535). Поскольку когорты, конечные показатели и определения признаков различаются и ни один идентичный кандидат не воспроизвёлся в обеих выборках, авторы подчёркивают: это не прямая репликация находки из DWB, а лишь предположительное схождение на уровне конструкта. В метаболической области framework вывел новый составной признак, индекс сердечно-сосудистой формы (число шагов, делённое на пульс покоя), как неинвазивный коррелят инсулинорезистентности, связав его с прежними работами о регуляции глюкозы и кардиометаболической форме. Добавление найденных framework-ом признаков к демографическим переменным улучшило предсказательную способность моделей: ΔR² = 0,040 для депрессии и 0,021 для инсулинорезистентности.
Качество работы системы оценивали 15 экспертов в медицине, биомедицинской науке о данных, машинном обучении, биоинформатике и цифровом здравоохранении, они вслепую читали отчёты Biomarker Discovery Framework и трёх других современных ИИ-систем для научной работы: AI co-scientist от Google DeepMind, Biomni и Data Science Agent на базе Google ADK. Biomarker Discovery Framework, Biomni и Data Science Agent оценивали вместе в 21 сессии, а Biomarker Discovery Framework отдельно, ещё в 13 сессиях по той же методике. В слепой оценке framework набрал наивысшие средние баллы по всем семи параметрам качества и оказался единственной системой, получившей от рецензентов оценки «принять» или «незначительная правка» по условной редакционной шкале: 2 «принять», 8 «незначительная правка», 8 «серьёзная правка» и 3 «отклонить». Рецензенты оценили, что в среднем сохранили бы 56,9% сгенерированного framework-ом текста отчёта, против 18,8, 30,4% у систем сравнения, а в сессиях прямого ранжирования четырёх систем поставили Biomarker Discovery Framework на первое место в 9 из 13 случаев.
Работу возглавил Юбин Ким, аспирант MIT, во время стажировки в Google под руководством Дэниела Макдаффа и Хамида Палангхи; все трое, соавторы блог-поста Google Research, опубликованного 21 августа 2026 года.
Ключевые факты
- Google Research представила Biomarker Discovery Framework, мультиагентную систему с оркестратором и шестью фазами анализа, которая сочетает детерминированную статистику с генеративным рассуждением под контролем человека
- На трёх когортах общим объёмом 9279 наблюдений система нашла 41 кандидата в биомаркеры для психического здоровья и 25, для метаболических заболеваний
- Пример находки: вариабельность длительности сна связана с тяжестью депрессии по шкале PHQ-8 (ρ = 0,252); для метаболической области выведен индекс сердечно-сосудистой формы (шаги / пульс покоя) как коррелят инсулинорезистентности
- Добавление найденных признаков к демографическим данным повышает точность прогноза: ΔR² = 0,040 для депрессии и 0,021 для инсулинорезистентности
- В слепом сравнении 15 экспертов framework получил высшие оценки по всем 7 параметрам среди четырёх ИИ-систем для науки, первое место в 9 из 13 сессий ранжирования и готовность сохранить 56,9% его текста против 18,8, 30,4% у конкурентов
Почему это важно
Носимые устройства уже собирают физиологические данные в масштабе целых популяций, узким местом стал не сбор сигналов, а превращение их в надёжные и клинически осмысленные биомаркеры. Авторы указывают, что существующие ИИ-агенты для научной работы часто оптимизируются только под предсказательную точность и упускают статистическую строгость на физиологических временных рядах, из-за чего получаются ложные корреляции, утечки данных и хрупкие признаки. Biomarker Discovery Framework отвечает на это архитектурно: жёстко разделяет детерминированные вычисления и генеративное рассуждение и заставляет агентов состязательно проверять собственные находки, сохраняя человека в контуре принятия решений.
Кому это важно
В первую очередь, исследователям в биомедицинской науке о данных и цифровом здравоохранении, которые ищут ранние физиологические маркеры болезней по данным носимых устройств, а также разработчикам самих устройств и клиническим исследователям депрессии и метаболических нарушений. Во вторую, командам, строящим ИИ-агентов для научной работы: framework показывает конкретную архитектуру (оркестратор плюс шестифазный процесс с общей памятью и фактлистом), которая в слепой оценке обошла три другие системы того же класса, включая AI co-scientist от Google DeepMind.
Как это применить
Framework работает от запроса на естественном языке: исследователь формулирует направление поиска (например, «найти признаки носимых устройств, связанные с тяжестью депрессии»), агент-оркестратор превращает это в план выполнения, а специализированные агенты профилируют датасет, предлагают признаки, проводят статистический анализ, проверяют устойчивость находки, утечки данных и согласованность по подгруппам и оформляют результат как гипотезу с опорой на литературу, для финального рассмотрения человеком. Источник не сообщает, планируется ли открыть код framework или сами рецензируемые отчёты в открытом доступе.
Можно ли доверять
Оценку качества проводили 15 независимых экспертов в медицине, биомедицинской науке о данных, машинном обучении, биоинформатике и цифровом здравоохранении, вслепую сравнивавших отчёты framework с тремя другими ИИ-системами для науки, по семи параметрам framework получил самые высокие средние баллы. При этом сами авторы делают оговорки: величины найденных эффектов скромные, что типично для пассивного сенсорного фенотипирования; связь, найденная в когорте GLOBEM, разведочная и слабая (AUC = 0,535); а совпадение находок между DWB и GLOBEM авторы описывают не как прямую репликацию, а лишь как предположительное схождение на уровне конструкта, поскольку когорты, конечные показатели и определения признаков различались. Колонка «механизм» в результатах, литературная гипотеза, а не причинный вывод, и оценки достоверности, это не клиническая валидация, проведённая в этой работе.
Риски и подводные камни
Источник не раскрывает, будут ли framework, его код или рецензируемые отчёты опубликованы в открытом доступе, не называет состав экспертной панели и индивидуальные баллы систем сравнения за пределами диапазона удержания текста, не даёт разбивку 9279 наблюдений по отдельным когортам и не сообщает сроков клинической валидации или внедрения найденных кандидатов в биомаркеры. Сравнение при этом частично проводилось с собственными системами Google (AI co-scientist от Google DeepMind, Data Science Agent на базе Google ADK), а доля текста, которую рецензенты «сохранили бы», субъективная оценка, а не независимый аудит результатов.
«В цифровой медицине узкое место, уже не сбор данных, а принципиальная, строгая генерация гипотез.»
— Юбин Ким, Дэниел Макдафф и Хамид Палангхи, Google Research