C3LM, языковая модель для ретросинтеза, обученная на 45 млн реакций

Ретросинтез, задача разложения целевой молекулы на более простые реагенты, из которых её можно синтезировать, центральная часть компьютерного планирования химического синтеза. У задачи по своей природе много правильных решений: одну и ту же молекулу можно собрать разными путями. Авторы указывают, что существующие протоколы оценки и бенчмарки требуют один-единственный «правильный» ответ и потому плохо отражают это разнообразие.
Чтобы решить эту проблему, авторы предлагают Top-K prompting, метод обучения и вывода, который учит модель явно выдавать набор из нескольких правдоподобных вариантов реакции, а не один ответ. Под эту задачу собран датасет CREED-CCV-2+USPTO-XL, сверхбольшой набор примерно из 45,6 млн проверенных химических реакций. На нём обучена модель C3LM (Chemistry Constraint-Consistent Language Model).
Обучение C3LM дополнено дообучением (fine-tuning) с двумя видами наград: на основе ChemCensor и наградой за новизну предсказаний. Итоговая модель, по заявлению авторов, достигает наилучшего результата (state-of-the-art) на внедоменном (out-of-distribution) бенчмарке URSA-expert-2026, сам числовой показатель и предыдущий лучший результат для сравнения в тексте не приводятся.
Отдельный анализ уникальности предсказанных реакций показал, что языковые модели вроде C3LM и классические (неязыковые) модели ретросинтеза находят разные, взаимодополняющие варианты реакций. Из этого авторы делают вывод, что перспективно строить не одну универсальную модель, а ансамблевые системы, комбинирующие LLM-подход с традиционными методами. Работу авторы описывают как обоснование Top-K и учёта правдоподобия реакций как практического направления для дальнейшего развития LLM-планирования синтеза.
Ключевые факты
- Ретросинтез, задача с множеством правильных решений, а стандартные бенчмарки на один ответ плохо её оценивают; авторы предлагают метод Top-K prompting для обучения и вывода с учётом этого разнообразия
- Собран датасет CREED-CCV-2+USPTO-XL примерно из 45,6 млн проверенных реакций, на котором обучена модель C3LM (Chemistry Constraint-Consistent Language Model)
- Дообучение C3LM использует награды на основе ChemCensor и награду за новизну предсказаний
- По заявлению авторов, C3LM достигает state-of-the-art результата на внедоменном бенчмарке URSA-expert-2026
- Анализ показал, что языковые и классические модели ретросинтеза покрывают разные пространства реакций, авторы видят в этом довод в пользу ансамблевых систем
Почему это важно
Работа закрывает методологический разрыв между тем, как реально устроена задача ретросинтеза (много правильных путей синтеза одной молекулы), и тем, как её принято оценивать (один правильный ответ). Top-K prompting, попытка обучать и проверять модели способом, который явно допускает несколько верных вариантов, а не штрафует модель за то, что она предложила не тот единственный ответ, что стоит в бенчмарке.
Кому это важно
В первую очередь тем, кто занимается компьютерным планированием химического синтеза и разработкой лекарств: химикам-синтетикам, специалистам по автоматизированному поиску путей синтеза, а также исследователям, применяющим языковые модели к научным и инженерным задачам за пределами текста.
Как это применить
Практическая ценность работы, сам метод Top-K prompting и датасет CREED-CCV-2+USPTO-XL, которые в перспективе позволяют дообучать модели ретросинтеза так, чтобы они предлагали набор правдоподобных вариантов реакции, а не один ответ. В тексте нет данных о доступности кода, весов модели или условиях использования, сведений о лицензии, цене или публичном релизе C3LM не приводится.
Можно ли доверять
Источник, научная публикация с полным текстом аннотации, но в самом тексте не названы ни авторы, ни их организации, ни дата публикации. Заявление о state-of-the-art результате принадлежит самим авторам работы и не сопровождается конкретным числовым показателем или ссылкой на предыдущий лучший результат для сравнения, независимой проверки заявления в тексте нет.
Риски и подводные камни
Ключевое ограничение, отсутствие в тексте конкретных чисел производительности и данных о том, кто и как проводил сравнение с прежними методами: заявление о превосходстве пока опирается только на слова авторов. Также не раскрыты детали устройства наград ChemCensor и за новизну, а происхождение и состав бенчмарка URSA-expert-2026 в тексте не поясняются.