GxP-Agent: агентная система на базе DAG довела Claude Sonnet 4.6 до 100% точности в данных клинических испытаний

Исследователи показали, что подготовка данных клинических испытаний, перевод протоколов исследования в готовые к анализу наборы данных по стандарту CDISC, плохо поддаётся обычным LLM-агентам. В базовом тесте пять топовых моделей сделали в сумме 11 попыток сгенерировать такой набор с одного захода, и ни одна попытка не дала валидный набор данных на уровне отдельного субъекта исследования.

В ответ авторы представили GxP-Agent, мультиагентную систему, которая кодирует порядок регуляторного процесса в виде ориентированного ациклического графа (DAG). Вместо того чтобы поручить генерацию всего набора данных одному агенту, система разбивает задачу на 15 узлов графа, каждый из которых закрывает свою предметную часть; узлы выполняют агенты-воркеры с доступом к контексту библиотек pharmaverse (набор R-пакетов для клинической статистики), проходят через контрольные точки валидации и при сбое запускают повторную попытку по заданным условиям.

Систему проверили на новом бенчмарке CDISC-Bench, построенном на основе пилотной заявки в FDA CDISCPilot01, реального набора данных из 254 субъектов исследования с 49 эталонными переменными ADSL (набор данных уровня субъекта). GxP-Agent на базе Claude Sonnet 4.6 добился 100% структурного совпадения, все 49 переменных и все 254 записи совпали с эталоном, в трёх независимых прогонах подряд. Для сравнения: лучший из базовых подходов на поиске по документации (retrieval-augmented) дал 59,2% совпадения, а все варианты с одним агентом или с плоской (без иерархии) мультиагентной схемой, 0%.

DAG-топология помогает и более слабым моделям: GPT-4.1 под управлением того же графа набрал в среднем 59,2% структурного совпадения, при том что под любой другой архитектурой та же модель показывала 0%. Подход также перенесли на другой тип данных, ADAE (нежелательные явления): 9-узловой ветвящийся граф, 55 переменных, 1191 запись, и с первой же попытки получили 100% структурного совпадения.

Авторы делают вывод: именно кодирование знания о регуляторном процессе в топологию графа, а не расчёт на рассуждающие способности самой модели, оказывается ключевым условием надёжной, соответствующей нормам GxP (регуляторным стандартам качества в фармотрасли) генерации данных клинических испытаний.

Ключевые факты

  • Базовый тест: пять топовых LLM сделали 11 попыток сгенерировать набор данных клинического испытания с одного захода, ни одна попытка не дала валидный результат
  • GxP-Agent разбивает генерацию на DAG из 15 предметных узлов, которые обрабатывают агенты-воркеры с контекстом pharmaverse, контрольными точками валидации и условным повтором
  • На бенчмарке CDISC-Bench (реальная заявка FDA CDISCPilot01: 254 субъекта, 49 переменных) GxP-Agent с Claude Sonnet 4.6 дал 100% структурного совпадения в трёх независимых прогонах, против 59,2% у лучшего retrieval-baseline и 0% у одноагентных и плоских мультиагентных схем
  • Та же DAG-топология подняла результат GPT-4.1 с 0% (под любой другой архитектурой) до 59,2% структурного совпадения
  • Подход перенесли на данные о нежелательных явлениях (ADAE, 9-узловой ветвящийся граф, 55 переменных, 1191 запись), 100% совпадения с первой попытки

Почему это важно

Подготовка данных клинических испытаний под регуляторные стандарты, узкое место в подаче заявок на регистрацию лекарств: работа трудоёмкая, требует точного следования протоколу, а ошибка означает риск для всей заявки. Авторы показывают, что LLM-агенты в обычном, однократном режиме с этой задачей не справляются вообще: 11 попыток пяти топовых моделей, и ни одного валидного результата. GxP-Agent демонстрирует, что проблема решается не более мощной моделью, а тем, как задачу структурировать: явное кодирование порядка регуляторного процесса в виде графа доводит точность до 100% там, где прежде было 0%.

Кому это важно

В первую очередь, фармкомпаниям и контрактным исследовательским организациям (CRO), которые готовят наборы данных для подачи в регуляторы вроде FDA по стандарту CDISC. Также, разработчикам ИИ-агентов для регулируемых отраслей: работа показывает конкретный архитектурный приём (граф процесса вместо единого агента), который можно переносить и на другие задачи с жёстким регуляторным порядком действий. Отдельно это полезно исследователям бенчмарков: CDISC-Bench, новый открытый эталон для проверки подобных систем, построенный на реальной пилотной заявке в FDA.

Как это применить

Архитектура GxP-Agent раскладывает генерацию набора данных на DAG из специализированных узлов, 15 штук для набора уровня субъекта (ADSL) и 9 в ветвящемся варианте для данных о нежелательных явлениях (ADAE). Каждый узел обрабатывает отдельный агент-воркер с контекстом библиотек pharmaverse, проходит контрольную точку валидации и при неудаче переоткрывается по заданным условиям повтора. Ключевой практический вывод: топология графа не просто повышает точность топовой модели (Claude Sonnet 4.6, 100%), но и вытягивает более слабую модель (GPT-4.1, с 0% до 59,2%), то есть выигрыш даёт не сама модель, а структура процесса, в которую её встроили.

Можно ли доверять

Источник, препринт на arXiv с полным текстом аннотации; результаты получены на новом, но методологически прозрачном execution-based бенчмарке CDISC-Bench, построенном на реальной пилотной заявке FDA (CDISCPilot01), а не на синтетических данных. Ключевой результат, 100% совпадение, воспроизведён в трёх независимых прогонах подряд, что снижает вероятность случайной удачи. При этом в доступном тексте не указаны имена авторов и их организации, дата публикации, стоимость и вычислительные затраты на прогон, а также какие именно из пяти моделей использовались в базовом однократном тесте, эти детали проверить по тексту нельзя.

Риски и подводные камни

Результат пока проверен только на двух типах наборов данных (ADSL и ADAE) в рамках одного пилотного проекта FDA, не факт, что 100% точность сохранится на других доменах CDISC или в реальных, более разнородных протоколах испытаний. В тексте не раскрыты вычислительные затраты и стоимость запуска системы, а также то, какие именно контрольные точки валидации и условия повтора срабатывали в ходе прогонов, без этого сложно оценить эксплуатационную сложность и цену внедрения такой системы в реальном регуляторном процессе.