Google Research выяснила: данные европейцев помогают прогнозу риска для японцев только при малых выборках

Google Research выяснила: данные европейцев помогают прогнозу риска для японцев только при малых выборках

Полигенные риск-баллы (PRS), способ оценить риск заболевания по генетическим вариантам: как правило, учитывается от сотен до миллионов вариантов сразу. Несмотря на потенциал, в клинической практике PRS используются мало, во многом потому, что почти все крупные полногеномные исследования ассоциаций (GWAS) исторически проводились на европейских когортах. Из-за различий в генетической архитектуре, структуре популяций и частотах вариантов между группами модели, обученные на европейцах, заметно теряют точность при переносе на неевропейские популяции. Проводить собственное GWAS на сотнях тысяч человек для каждой популяции с нуля дорого практически для любой системы здравоохранения, поэтому один из вариантов решения, перенос обучения: дополнять большие европейские данные GWAS данными меньшего объёма, но специфичными для целевой популяции.

Инженеры Google Research Joey Poomarin Phloyphisut (Software Engineer) и Cory McLean (Senior Staff Software Engineer) в блоге компании (3 сентября 2026 года) описали исследование, где для восьми клинических признаков, индекса массы тела, систолического и диастолического давления, числа эритроцитов и лейкоцитов, холестерина HDL и LDL, уровня глюкозы, варьировали размер и европейской, и целевой выборки. Источником европейских данных выступил Биобанк Великобритании (UK Biobank, UKB, сотни тысяч человек), целевой популяцией, Биобанк Японии (Biobank Japan, BBJ, почти 200 тысяч человек). Доля изменчивости признака, объяснимая измеренными генетическими вариантами (SNP-наследуемость), в UKB для этих признаков составила от 0,07 до 0,28. Точность моделей на отложенной выборке BBJ измеряли через корреляцию Пирсона.

Главный результат: перенос европейских данных помогает, только пока своя, японская, выборка мала. При очень маленькой целевой выборке, например, 5 000 образцов, добавление европейских данных UKB даёт заметный статистический выигрыш. Но по мере роста японской выборки польза от объединения с европейскими данными снижается, и начиная с 15 тысяч образцов и больше модели, обученные исключительно на японских данных, уже точнее моделей с добавлением UKB: судя по всему, совместное обучение с внешними европейскими данными ограничивает прирост точности, который могла бы дать более широкая своя выборка. Эта закономерность подтвердилась по всем восьми признакам.

Порог, после которого перенос данных перестаёт помогать, зависит от признака. Долю «общей генетики» между популяциями авторы оценивают через генетическую корреляцию признака между ними. У «консервативных» признаков с высокой генетической корреляцией между популяциями (например, индекс массы тела) выгода от европейских данных UKB сохраняется вплоть до намного больших японских выборок, 25, 40 тысяч образцов и более, прежде чем данные, специфичные для целевой популяции, догоняют по точности. У популяционно-специфичных признаков, холестерина HDL и LDL и, в меньшей степени, глюкозы, этот порог значительно ниже, и оптимальный объём добавляемых европейских данных тоже меньше: такие признаки слабее выигрывают от данных UKB, потому что те дальше от распределения целевой популяции.

Первые эксперименты ограничивали набор генетических вариантов теми, что были обнаружены в европейской выборке UKB, не учитывая варианты, специфичные для BBJ. Чтобы это исправить, авторы протестировали ещё два метода. Первый, межпопуляционный метаанализ: результаты полного GWAS по UKB объединяются с GWAS по BBJ нужного размера, из объединённых данных отбираются варианты-кандидаты, а поверх них обучается модель elastic net. Второй метод, PRS-CSx, который объединяет сводную статистику GWAS обеих популяций, динамически взвешивая вклад каждой.

Метаанализ слабо влияет на консервативные признаки, во многом из-за меньшей статистической мощности сравнительно небольшой выборки BBJ. А для популяционно-специфичных признаков, HDL, LDL и, в меньшей степени, глюкозы, метаанализ заметно превосходит обучение на одной популяции. Выигрыш здесь в основном за счёт того, какие варианты попадают на вход elastic net: добавление европейских образцов UKB немного улучшало прогноз, только пока выборка BBJ составляла 10 000 образцов или меньше, на больших выборках BBJ этот эффект уже не проявлялся. PRS-CSx по конструкции должен быть менее чувствителен к тому, консервативен признак или популяционно-специфичен, поскольку динамически взвешивает вклад каждой популяции, но на практике ему нужно больше данных, чем elastic net: при целевой выборке до 25 тысяч образцов PRS-CSx уступает лучшей модели elastic net по всем признакам, кроме индекса массы тела, а при приближении к 100 тысячам образцов сравнивается с лучшей моделью или превосходит её по всем признакам, кроме глюкозы.

Вывод авторов: более крупные внешние наборы данных не всегда полезны при построении оценок генетического риска для недопредставленных групп, оптимальная стратегия зависит и от наследуемости конкретного признака, и от размера доступной целевой выборки. Точный прогноз для разных популяций, по их оценке, потребует одновременно расширения локальных и разнообразных биобанков и осознанного выбора метода моделирования под конкретный признак и объём данных. Оговорка: несмотря на то что в названии исследования фигурируют «недопредставленные популяции» во множественном числе, в качестве целевой протестирована только одна, японская, через Biobank Japan; результаты по точности приведены только как качественные сравнения и пороги по размеру выборки, без конкретных значений корреляции, а ссылки на рецензируемую публикацию или препринт авторы не приводят.

Ключевые факты

  • Google Research сравнила точность прогноза генетического риска для японской когорты Biobank Japan (BBJ, почти 200 тысяч человек) с добавлением и без добавления данных крупной европейской когорты UK Biobank (UKB), по восьми клиническим признакам, от индекса массы тела до уровня глюкозы.
  • Перенос европейских данных помогает, только пока японская выборка мала: при 5 000 образцов выигрыш заметен, а начиная с 15 000 образцов точнее оказываются модели, обученные только на японских данных.
  • Порог зависит от признака: у «консервативных» признаков вроде индекса массы тела выгода от европейских данных сохраняется до 25, 40 тысяч образцов и более, у популяционно-специфичных (HDL, LDL, глюкоза) порог значительно ниже.
  • Межпопуляционный метаанализ (GWAS UKB и BBJ через elastic net) заметно улучшает прогноз именно для популяционно-специфичных признаков, где простой перенос данных не работает.
  • Продвинутому методу PRS-CSx нужен большой объём данных: при выборке до 25 тысяч образцов он уступает elastic net почти по всем признакам, но к 100 тысячам догоняет или превосходит лучшую модель, кроме глюкозы.

Почему это важно

Полигенные риск-баллы, один из немногих инструментов, способных предсказать риск распространённых заболеваний по одному лишь генотипу, но их клиническое применение сдерживается именно тем, что исходные данные почти всегда европейские, а модели на них плохо переносятся на другие популяции. Работа показывает, что интуитивно понятный рецепт, добавить к своим данным побольше чужих, европейских, работает только до определённого объёма собственной выборки, а дальше начинает вредить. Это меняет саму стратегию: недостаточно просто накопить больше внешних данных, нужно ещё правильно выбрать метод под конкретный признак и текущий размер своей выборки.

Кому это важно

В первую очередь, исследователям геномики и биоинформатикам, которые строят модели PRS для новых, недостаточно изученных популяций, и, вероятно, операторам национальных биобанков за пределами Европы и США, не только японского Biobank Japan. Во вторую, системам здравоохранения и разработчикам клинических инструментов на основе генетики, которым нужно решать, когда можно опираться на перенос данных, а когда лучше подождать накопления собственной выборки. Наблюдение интересно и шире геномики: это конкретный пример того, как перенос обучения (transfer learning) из «богатого» данными домена в «бедный» имеет свой предел и разворачивается во вред по мере роста данных внутри целевого домена.

Как это применить

Практический вывод авторов сводится к выбору стратегии по двум параметрам, сколько данных уже есть у целевой популяции и насколько «консервативен» интересующий признак. Если целевая выборка совсем небольшая (порядка 5 000 образцов и меньше), есть смысл смешивать её с крупными европейскими данными. Если выборка уже перевалила за 15 000 образцов, модель, обученная только на своих данных, скорее всего точнее, чем модель с добавлением европейских данных. Для признаков с сильной популяционной спецификой, липидного профиля, глюкозы, стоит отдельно попробовать межпопуляционный метаанализ (GWAS обеих популяций плюс elastic net): по наблюдению авторов, именно для таких признаков этот метод даёт наибольший прирост по сравнению с обучением на одной популяции. Метод PRS-CSx имеет смысл рассматривать только при по-настоящему больших целевых выборках, ближе к 100 000 образцов, на меньших объёмах он проигрывает более простому elastic net.

Можно ли доверять

Это собственный блог Google Research, а не рецензируемая научная публикация: авторы, инженеры компании (Software Engineer и Senior Staff Software Engineer), ссылки на препринт, статью или DOI в тексте нет. При этом исследование опирается на два реальных, широко используемых в науке набора данных, UK Biobank и Biobank Japan, и упоминает участие сотрудников RIKEN и Института медицинских наук Токийского университета, которые курируют Biobank Japan: это снижает риск, что цифры по выборкам попросту придуманы. Слабое место, сам текст приводит только качественные сравнения и пороги по размеру выборки, ни одного конкретного значения корреляции Пирсона не названо, из-за чего масштаб эффекта читателю приходится принимать на веру. Формально в названии работы фигурируют «недопредставленные популяции» во множественном числе, но проверена в ней только одна, японская.

Риски и подводные камни

Главный риск, переобобщение: результаты получены на одной паре популяций (европейцы UK Biobank и японцы Biobank Japan) и на восьми конкретных признаках, но по формулировке блога легко решить, что вывод верен для любой недопредставленной группы и любого генетического признака, сама работа этого не проверяла. Второй риск, обратное прочтение: кто-то может увидеть в исследовании тезис «данные о европейцах вредны» и вовсе отказаться от переноса данных, хотя авторы показывают обратное, при малых выборках такой перенос как раз помогает. Наконец, метод PRS-CSx, который выглядит наиболее универсальным, по данным авторов начинает выигрывать у более простых моделей лишь при выборках около 100 000 образцов, даже вся когорта Biobank Japan (почти 200 тысяч человек) даёт не так много запаса сверх этого порога, так что для более молодых и не столь крупных биобанков других недопредставленных популяций метод рискует оказаться попросту неприменим при нынешнем объёме данных.