Microsoft опубликовала RetroChimera, ИИ для планирования синтеза молекул

Microsoft Research опубликовала в журнале Nature статью о ретросинтетической модели RetroChimera и одновременно открыла её код и веса. Ретросинтез, это планирование того, как собрать целевую молекулу из более простых и доступных исходных веществ: модель шаг за шагом раскладывает молекулу на предшественники, двигаясь от результата к сырью. Авторы сравнивают эту задачу со стратегическими играми вроде шахмат и го, но с гораздо большим числом возможных ходов на каждом шаге и без явного понимания, какие ходы вообще допустимы для конкретной молекулы. Ручное планирование синтеза остаётся медленным и дорогим и всё чаще становится узким местом в разработке лекарств и новых материалов, даже когда вычислительные методы уже позволяют перебирать множество кандидатных молекул.
RetroChimera строится на двух моделях с разными сильными сторонами. R-SMILES 2, модель на основе трансформера, которая генерирует предшественники напрямую по входной молекуле; это даёт гибкость и позволяет учиться на данных без жёстких ограничений, но делает модель более склонной к «галлюцинациям», предложениям несуществующих реакций. NeuralLoc, напротив, модель на графовой нейросети (GNN): она кодирует и целевую молекулу, и библиотеку известных реакционных шаблонов в виде графов, выбирает подходящий шаблон и указывает, куда его применить. Её предсказания опираются на реально встречавшиеся в обучающих данных реакционные паттерны, поэтому они надёжнее, но модель хуже справляется с реакциями, которых нет в библиотеке шаблонов. По данным авторов, R-SMILES 2 сильнее на реакциях с крупными структурными изменениями, а NeuralLoc, на редких и точечных (локализованных) реакциях.
Обе модели объединены обученной схемой голосования: каждая присваивает предсказанному набору реагентов вес, зависящий от места этого варианта в её собственном рейтинге, а если варианты обеих моделей совпадают, голоса складываются. Так RetroChimera учится, какой модели доверять в каждом конкретном случае, и по качеству приближается к лучшей из двух моделей на каждом классе реакций, а не просто усредняет их. В слепых тестах химики с учёной степенью (PhD) предпочитали отдельные предсказания RetroChimera предсказаниям предыдущих моделей и даже реакциям, зафиксированным в научной литературе. В более сложном тесте, разложении сложных молекул на стадии синтеза, эксперты-химики предпочитали варианты RetroChimera не только вариантам моделей-компонентов и более ранних подходов, но и вариантам из самого тестового набора данных.
Microsoft Research открыла код и веса RetroChimera на GitHub под лицензией MIT, модель также доступна через Microsoft Foundry; инструкции по получению весов, в репозитории. В компании считают, что RetroChimera поможет химикам быстрее находить пригодные маршруты синтеза, ускорит цикл «спроектировать, изготовить, проверить» в разработке лекарств и материалов и вместе с растущей автоматизацией лабораторий приблизит замкнутые самообучающиеся системы планирования и выполнения синтеза. Авторы приглашают химическое сообщество опробовать RetroChimera на собственных задачах, чтобы выявить её сильные и слабые стороны.
Ключевые факты
- Microsoft Research опубликовала в Nature статью о модели RetroChimera для ретросинтеза, планирования, как собрать целевую молекулу из простых исходных веществ
- Модель объединяет две: R-SMILES 2 (трансформер, напрямую генерирует предшественников, но склонна к «галлюцинациям») и NeuralLoc (графовая нейросеть, выбирает и применяет проверенные реакционные шаблоны)
- Предсказания двух моделей комбинируются обученной схемой голосования с весами, зависящими от ранга предсказания; при совпадении вариантов голоса складываются
- В слепых тестах химики с PhD предпочитали предсказания RetroChimera предсказаниям прежних моделей, отдельных моделей-компонентов и даже вариантам из литературы и тестового набора
- Код и веса модели открыты на GitHub под лицензией MIT, доступ также через Microsoft Foundry
Почему это важно
Планирование синтеза молекул, исторически ручная, медленная и дорогая работа, которая тормозит разработку лекарств и материалов даже тогда, когда сами кандидатные молекулы уже найдены вычислительными методами. RetroChimera предлагает готовые маршруты синтеза автоматически, и её качество проверено не только внутренними метриками, но и рецензируемой публикацией в Nature и слепыми тестами с участием практикующих химиков.
Кому это важно
В первую очередь, химикам-синтетикам, командам по разработке лекарств и новых материалов, а также исследовательским группам, которые строят автоматизированные («самообучающиеся») лабораторные конвейеры и заинтересованы в ускорении цикла «спроектировать, изготовить, проверить».
Как это применить
Реализация и веса RetroChimera открыты на GitHub под лицензией MIT; инструкции по получению весов приведены в самом репозитории. Модель также доступна через облачную платформу Microsoft Foundry.
Можно ли доверять
Результаты прошли рецензирование при публикации в Nature и проверены слепыми тестами: PhD-химики сравнивали предсказания RetroChimera с предсказаниями прежних моделей, её собственных подмоделей, записями из научной литературы и даже с вариантами из тестового набора данных, и в этих сравнениях предпочитали RetroChimera. При этом сам разбор Microsoft не приводит числовых метрик точности или размера выборки экспертов, сравнения описаны качественно, как предпочтения экспертов, а не как проценты.
Риски и подводные камни
У модели есть встроенное ограничение: одна из двух её составных частей, R-SMILES 2, генерирует предшественников без жёстких ограничений и потому более склонна предлагать несуществующие, «галлюцинированные» реакции, этот риск снимается второй, более консервативной моделью NeuralLoc лишь частично, через голосование. Кроме того, авторский текст не раскрывает, сколько именно химиков и молекул участвовало в слепых тестах и какие именно институты выступали внешними коллабораторами, так что независимая проверка масштаба результатов по самому блогу невозможна.