GPT-5.2 набрал 77,6% в тесте ИИ-агента для дородового наблюдения PATHFinder
Дородовое наблюдение, профилактическая услуга, от которой напрямую зависят исходы беременности. Американский колледж акушеров и гинекологов (ACOG) недавно ввёл рекомендации по индивидуализированному дородовому наблюдению под названием PATH (Plan for Tailored Healthcare, «план индивидуализированной помощи»).
Авторы статьи представляют систему PATHFinder Agent (Planner for Appropriate Tailored Healthcare), сквозного разговорного ИИ-агента, который через структурированный диалог собирает у пациентки данные о здоровье и социальном контексте, составляет индивидуальный план дородового наблюдения в соответствии с рекомендациями PATH и подбирает подходящие ресурсы поддержки из базы Michigan 211 (справочная служба социальных и медицинских ресурсов штата Мичиган). Работа системы разбита на четыре этапа: приём данных пациентки, динамическое интерактивное взаимодействие, синтез плана и проверка врачом.
Авторы оценили несколько передовых языковых моделей по составленным экспертами критериям в пяти клинических измерениях. Лучший средний результат показала GPT-5.2, 77,6%. При этом авторы выявили заметные пробелы в рекомендациях по антенатальному тестированию (дородовым лабораторным и инструментальным обследованиям).
Авторы отмечают, что дальнейшая проверка системы потребует исследований с участием живых пациентов и рандомизированных контролируемых испытаний, на этом этапе речь идёт о прототипе и лабораторной оценке, а не о клиническом внедрении.
Ключевые факты
- ACOG ввёл рекомендации PATH (Plan for Tailored Healthcare) по индивидуализированному дородовому наблюдению
- PATHFinder Agent, разговорный ИИ-агент, который через диалог с пациенткой собирает данные о здоровье и соцконтексте и строит план наблюдения по PATH
- Система также подбирает подходящие социальные ресурсы из базы Michigan 211 и включает этап проверки плана врачом
- Работа состоит из четырёх этапов: приём данных, динамическое взаимодействие, синтез плана, врачебный контроль
- Из протестированных передовых LLM по пяти клиническим критериям лучший результат показала GPT-5.2, 77,6%, но авторы выявили пробелы в рекомендациях по антенатальному тестированию
Почему это важно
Работа показывает конкретный путь применения диалоговых ИИ-агентов в медицине: не заменить врача, а автоматизировать сбор структурированной информации о пациентке и сборку индивидуального плана наблюдения по официальным клиническим рекомендациям (ACOG PATH), оставляя финальное решение за клиницистом.
Кому это важно
Разработчикам медицинских ИИ-систем и клиникам, которые внедряют индивидуализированное дородовое наблюдение по стандарту PATH; исследователям, оценивающим применимость передовых LLM к узким клиническим сценариям с высокими требованиями к точности.
Как это применить
Система задумана как вспомогательный инструмент в четыре этапа: сбор данных о пациентке в диалоге, интерактивное уточнение контекста, автоматический синтез плана наблюдения и обязательная проверка плана врачом перед использованием; результат работы дополнительно связывается с базой социальных ресурсов Michigan 211.
Можно ли доверять
Авторы честно фиксируют ограничения: даже у лучшей из проверенных моделей, GPT-5.2, средний балл по клиническим рубрикам составил 77,6%, а не близко к максимуму, и отдельно выявлены пробелы в рекомендациях по антенатальному тестированию. Оценка проведена по экспертным рубрикам, но без исследований с участием реальных пациентов.
Риски и подводные камни
Система пока не проверена на живых пациентах и в рандомизированных контролируемых испытаниях, авторы прямо называют это следующим шагом. Пробелы в рекомендациях по антенатальному тестированию означают, что без обязательного врачебного контроля план ИИ-агента может упустить важные обследования.