SciForma: новая модель точно рисует научные диаграммы без ошибок в структуре

Научные методологические диаграммы (схемы, которые объясняют логику исследования) требуют структурной точности: если хотя бы одна стрелка развёрнута не туда или формула нечитаема, вся схема теряет смысл. Авторы называют это свойство конъюнктивным, правильность по одному параметру не компенсирует ошибку по другому. По их наблюдению, существующие открытые модели с этим не справляются: обучение с учителем (SFT) даёт правдоподобную компоновку, но не гарантирует структурную корректность, а обучение по скалярной награде не показывает, какой именно параметр структуры сломан.
Для решения этой проблемы представлена SciForma, фреймворк для генерации научных диаграмм с сохранением структурной точности. Метод раскладывает качество диаграммы на три оси: компоненты (Component), стрелки (Arrow) и текст (Text), опираясь на структурный инвентарь (structural inventory), формальное описание элементов схемы. Под эту схему собраны два набора данных: SciFormaData-700K для обучения и SciFormaBench-2K, бенчмарк с логической верификацией для оценки результата.
Чтобы закрыть пробел, который оставляет обучение с учителем, авторы разработали метод Multi-Dimensional Conjunctive Preference Optimization (M-DPO, многомерная конъюнктивная оптимизация предпочтений). Он заставляет модель одновременно соблюдать правильность по всем трём осям и на этапе дообучения адаптивно направляет градиенты на ту ось, где ошибок больше всего. Тот же структурный инвентарь используется и во время генерации: модель может итеративно редактировать схему, исправляя оставшиеся ошибки.
В итоге модель SciForma-9B, по данным авторов, превзошла все открытые модели-аналоги и модель GPT-Image-1.5 на бенчмарках SciFormaBench-2K и AIBench, приблизив качество открытой генерации научных диаграмм к уровню закрытых (proprietary) решений. Код и данные авторы обещают опубликовать в репозитории Microsoft на GitHub (microsoft/SciForma).
Ключевые факты
- SciForma, фреймворк для генерации научных методологических диаграмм с упором на структурную точность (компоненты, стрелки, текст)
- Собраны датасет SciFormaData-700K для обучения и бенчмарк SciFormaBench-2K с логической верификацией
- Новый метод дообучения M-DPO одновременно требует правильности по всем трём структурным осям и направляет обучение на самую слабую ось
- Модель поддерживает итеративное редактирование диаграммы прямо во время генерации, чтобы исправлять оставшиеся ошибки
- SciForma-9B превзошла открытые модели и GPT-Image-1.5 на SciFormaBench-2K и AIBench; код и данные обещаны на GitHub Microsoft
Почему это важно
Схема исследования, не иллюстрация, а часть аргументации: неверная стрелка или нечитаемая формула искажают саму логику работы. Авторы показывают, что открытые модели генерации изображений плохо держат такую точность: обучение с учителем даёт красивую, но не всегда корректную компоновку, а обучение по единой скалярной награде не подсказывает, какой именно элемент схемы сломан. SciForma впервые раскладывает задачу на три проверяемые оси и учит модель одновременно соблюдать все три, а не искать компромисс между ними.
Кому это важно
В первую очередь, исследователям и научным коллективам, которые готовят статьи и презентации и хотят автоматизировать отрисовку методологических схем без ручной доводки. Также релевантно инженерам, которые строят инструменты генерации диаграмм и иллюстраций для научных публикаций, и издателям, заинтересованным в качестве иллюстративного материала.
Как это применить
Практическое применение, генерация методологической диаграммы по описанию исследования с последующим итеративным редактированием той же моделью: SciForma умеет находить и исправлять остаточные ошибки в уже сгенерированной схеме, опираясь на тот же структурный инвентарь, что использовался при обучении. Авторы обещают опубликовать код и данные (включая SciFormaData-700K и SciFormaBench-2K) в открытом репозитории Microsoft на GitHub, что должно сделать метод доступным сторонним разработчикам.
Можно ли доверять
Заявления о превосходстве опираются на два бенчмарка, собственный SciFormaBench-2K с логической верификацией и внешний AIBench, а также на сравнение и с открытыми моделями, и с закрытой GPT-Image-1.5. На момент публикации репозитория код и данные ещё не выложены («will be available»), поэтому независимо воспроизвести и проверить результаты пока нельзя, оценка держится на доверии к методологии авторов и опубликованному описанию.
Риски и подводные камни
Модель имеет масштаб 9B параметров и заточена под конкретный класс изображений, научные методологические диаграммы; неясно, насколько подход переносится на другие типы схем или визуализаций. Ключевая часть проверяемости (код, датасеты, веса) на момент новости ещё не опубликована, а сравнение проводится по бенчмаркам, собранным самими авторами, что стоит учитывать при оценке заявленного превосходства над GPT-Image-1.5.