OncoTriad-QA: бенчмарк для ИИ-диагностики рака сразу по снимкам, тканям и генам
Большинство бенчмарков для медицинских языковых и мультимодальных моделей проверяют их на одной модальности за раз, либо только на снимках, либо только на узких задачах «изображение плюс текст». Оценка на уровне отдельного пациента, где нужно свести воедино данные из разных источников, оставалась почти непроверенной областью, хотя именно так реальная диагностика рака и устроена: врач опирается сразу на снимки, ткани и генетику одного и того же человека.
Исследователи представили OncoTriad-QA, бенчмарк для вопросно-ответных задач по широкому спектру видов рака на уровне пациента. Он включает 86,1 тысячи вопросов по 9 281 случаю пациентов из базы The Cancer Genome Atlas (TCGA), охватывающих 32 онкологические когорты (типа рака). Для каждого случая сведены лучевая диагностика (КТ/МРТ), полные гистологические срезы опухолевой ткани, соматические мутации, изменения числа копий генов, метилирование ДНК, данные секвенирования РНК и клинические метаданные. Разметку строили по конвейеру с участием LLM, опираясь на выверенные метки, диагностические заключения, молекулярные профили и данные самих модальностей как источники истины, с автоматическими проверками согласованности и последующей проверкой врачами.
Вместе с бенчмарком представили OncoVLM, эталонную мультимодальную модель, которая переводит «родные» данные лучевой диагностики, патоморфологии, метилирования ДНК и RNA-seq в формат, понятный языковой модели, через обучаемые проекционные слои.
Эксперименты показали, что существующие универсальные и медицинские языковые модели плохо справляются с комплексными вопросами по раку, особенно там, где нужно одновременно учитывать находки на снимках, морфологию опухоли и молекулярные данные. После дообучения на OncoTriad-QA модель OncoVLM превзошла MedGemma-4B в среднем на 10,7 балла (по совокупности точности на вопросах с выбором ответа и метрики BERTScore-F1 для открытых ответов), причём прирост стабильно сохранялся и на вопросах с выбором ответа, и на открытых вопросах, в режимах «только снимки», «только гистология» и «все данные вместе».
Ключевые факты
- OncoTriad-QA: 86,1 тысячи вопросов по 9 281 случаю пациентов из базы TCGA, охватывающих 32 онкологические когорты
- Бенчмарк впервые сводит воедино данные одного пациента: КТ/МРТ, гистологические срезы тканей, соматические мутации, изменения числа копий генов, метилирование ДНК, RNA-seq и клинические метаданные
- Разметка построена через конвейер с участием LLM на основе выверенных меток и заключений, с автоматическими проверками согласованности и проверкой врачами
- Представлена эталонная модель OncoVLM, которая переводит данные разных модальностей в формат для языковой модели через обучаемые проекционные слои
- После дообучения на OncoTriad-QA OncoVLM превзошла MedGemma-4B в среднем на 10,7 балла, с устойчивым приростом на снимках, гистологии и в режиме всех данных вместе
Почему это важно
Большинство существующих бенчмарков для медицинского ИИ тестируют модели на одной модальности сразу, либо на снимках, либо на узких задачах «картинка плюс текст». Реальная онкологическая диагностика так не работает: врач сопоставляет снимки, гистологию опухоли и молекулярные данные одного и того же пациента. OncoTriad-QA, первый бенчмарк, который проверяет модели именно в такой постановке, на уровне пациента и сразу по трём типам данных: лучевой диагностике, патоморфологии и геномике, на материале 9 281 случая из 32 онкологических когорт.
Кому это важно
В первую очередь, разработчикам медицинских языковых и мультимодальных моделей, которым нужен способ честно проверить, справляется ли модель с комплексными клиническими вопросами, а не с отдельными изображениями. Полезен и клиникам с исследовательскими подразделениями, оценивающим системы поддержки диагностики: бенчмарк показывает, что универсальные и даже специализированные медицинские модели пока плохо справляются с задачами, где нужно свести снимки, ткани и гены воедино.
Как это применить
OncoTriad-QA можно использовать как тестовый набор для проверки существующих моделей на комплексных онкологических вопросах или как обучающий набор для дообучения новых, именно так авторы дообучили на нём собственную модель OncoVLM. В источнике не указано, доступны ли набор данных и код публично и на каких условиях, поэтому судить о лицензии и способе получения доступа преждевременно.
Можно ли доверять
Разметка построена не вручную с нуля, а через конвейер с участием языковой модели, но с опорой на выверенные источники, диагностические заключения, молекулярные профили и данные самих модальностей, плюс автоматические проверки согласованности и финальную проверку врачами. Сам набор данных пациентов взят из The Cancer Genome Atlas, устоявшейся и широко используемой в онкологических исследованиях базы. В тексте источника не указаны авторы, их место работы и дата публикации, поэтому судить о статусе рецензирования работы нельзя.
Риски и подводные камни
Разметка вопросов и ответов создавалась с участием LLM, а не только людьми, что может унаследовать её систематические ошибки, несмотря на проверки. Количественное сравнение приведено только с одной моделью, MedGemma-4B; насколько OncoVLM опережает другие современные медицинские или мультимодальные модели, из текста не следует. Улучшение на бенчмарке само по себе не означает готовность к клиническому применению: OncoVLM остаётся исследовательской моделью, а не проверенным диагностическим инструментом.