C3LM, языковая модель для ретросинтеза, обученная на 45 млн реакций

C3LM, языковая модель для ретросинтеза, обученная на 45 млн реакций

Ретросинтез, задача разложения целевой молекулы на более простые реагенты, из которых её можно синтезировать, центральная часть компьютерного планирования химического синтеза. У задачи по своей природе много правильных решений: одну и ту же молекулу можно собрать разными путями. Авторы указывают, что существующие протоколы оценки и бенчмарки требуют один-единственный «правильный» ответ и потому плохо отражают это разнообразие.

Чтобы решить эту проблему, авторы предлагают Top-K prompting, метод обучения и вывода, который учит модель явно выдавать набор из нескольких правдоподобных вариантов реакции, а не один ответ. Под эту задачу собран датасет CREED-CCV-2+USPTO-XL, сверхбольшой набор примерно из 45,6 млн проверенных химических реакций. На нём обучена модель C3LM (Chemistry Constraint-Consistent Language Model).

Обучение C3LM дополнено дообучением (fine-tuning) с двумя видами наград: на основе ChemCensor и наградой за новизну предсказаний. Итоговая модель, по заявлению авторов, достигает наилучшего результата (state-of-the-art) на внедоменном (out-of-distribution) бенчмарке URSA-expert-2026, сам числовой показатель и предыдущий лучший результат для сравнения в тексте не приводятся.

Отдельный анализ уникальности предсказанных реакций показал, что языковые модели вроде C3LM и классические (неязыковые) модели ретросинтеза находят разные, взаимодополняющие варианты реакций. Из этого авторы делают вывод, что перспективно строить не одну универсальную модель, а ансамблевые системы, комбинирующие LLM-подход с традиционными методами. Работу авторы описывают как обоснование Top-K и учёта правдоподобия реакций как практического направления для дальнейшего развития LLM-планирования синтеза.

Ключевые факты

  • Ретросинтез, задача с множеством правильных решений, а стандартные бенчмарки на один ответ плохо её оценивают; авторы предлагают метод Top-K prompting для обучения и вывода с учётом этого разнообразия
  • Собран датасет CREED-CCV-2+USPTO-XL примерно из 45,6 млн проверенных реакций, на котором обучена модель C3LM (Chemistry Constraint-Consistent Language Model)
  • Дообучение C3LM использует награды на основе ChemCensor и награду за новизну предсказаний
  • По заявлению авторов, C3LM достигает state-of-the-art результата на внедоменном бенчмарке URSA-expert-2026
  • Анализ показал, что языковые и классические модели ретросинтеза покрывают разные пространства реакций, авторы видят в этом довод в пользу ансамблевых систем

Почему это важно

Работа закрывает методологический разрыв между тем, как реально устроена задача ретросинтеза (много правильных путей синтеза одной молекулы), и тем, как её принято оценивать (один правильный ответ). Top-K prompting, попытка обучать и проверять модели способом, который явно допускает несколько верных вариантов, а не штрафует модель за то, что она предложила не тот единственный ответ, что стоит в бенчмарке.

Кому это важно

В первую очередь тем, кто занимается компьютерным планированием химического синтеза и разработкой лекарств: химикам-синтетикам, специалистам по автоматизированному поиску путей синтеза, а также исследователям, применяющим языковые модели к научным и инженерным задачам за пределами текста.

Как это применить

Практическая ценность работы, сам метод Top-K prompting и датасет CREED-CCV-2+USPTO-XL, которые в перспективе позволяют дообучать модели ретросинтеза так, чтобы они предлагали набор правдоподобных вариантов реакции, а не один ответ. В тексте нет данных о доступности кода, весов модели или условиях использования, сведений о лицензии, цене или публичном релизе C3LM не приводится.

Можно ли доверять

Источник, научная публикация с полным текстом аннотации, но в самом тексте не названы ни авторы, ни их организации, ни дата публикации. Заявление о state-of-the-art результате принадлежит самим авторам работы и не сопровождается конкретным числовым показателем или ссылкой на предыдущий лучший результат для сравнения, независимой проверки заявления в тексте нет.

Риски и подводные камни

Ключевое ограничение, отсутствие в тексте конкретных чисел производительности и данных о том, кто и как проводил сравнение с прежними методами: заявление о превосходстве пока опирается только на слова авторов. Также не раскрыты детали устройства наград ChemCensor и за новизну, а происхождение и состав бенчмарка URSA-expert-2026 в тексте не поясняются.