Учёные представили SCAFFOLD, датасет из 157 тысяч пар для обучения нейросетей читать научные диаграммы

Авторы работы отмечают: статьи по компьютерным наукам держатся на диаграммах, архитектурных схемах, блок-схемах систем, чертежах конвейеров обработки данных, и эти рисунки часто несут больше информации, чем окружающий их текст. При этом, по словам авторов, до сих пор не существовало открытого набора данных, который связывал бы именно такие диаграммы с подписями, контекстом, вопросами и ответами к ним, а также с пошаговыми цепочками рассуждений, а именно это нужно, чтобы обучить визуально-языковую модель понимать подобные изображения.

Чтобы закрыть этот пробел, авторы собрали SCAFFOLD, структурированный набор данных, в котором каждая запись, это связка из изображения диаграммы, подписи к ней, окружающего текстового контекста, пары «вопрос-ответ» и цепочки рассуждений. Материал взят из статей по компьютерным наукам на arXiv и подготовлен с помощью детекции разметки страницы и разбора PDF-файлов, а вопросы к диаграммам сгенерированы с помощью ИИ.

В итоге получилось три версии датасета разного размера: крупная SCAFFOLD-157K, 3058 статей, 29 887 диаграмм и 157 387 пар «изображение-вопрос-ответ-рассуждение»; средняя SCAFFOLD-37K, 36 797 таких пар; и малая SCAFFOLD-12K, 12 000 пар. Именно малую версию, SCAFFOLD-12K, авторы использовали для базовых экспериментов на модели Qwen2.5-VL-3B-Instruct, сами числовые результаты этих экспериментов в тексте не приведены. Имена авторов и их организации в доступном тексте не указаны; ссылка на код и данные дана через сноску на GitHub.

Ключевые факты

  • SCAFFOLD связывает диаграммы из статей по компьютерным наукам с подписями, контекстом, вопросами-ответами и цепочками рассуждений, авторы утверждают, что открытого датасета именно такого рода раньше не было
  • Данные подготовлены из статей arXiv с помощью детекции разметки страницы, разбора PDF и генерации вопросов с помощью ИИ
  • Крупная версия SCAFFOLD-157K охватывает 3058 статей, 29 887 диаграмм и 157 387 пар «вопрос-ответ-рассуждение»
  • Есть также средняя версия SCAFFOLD-37K (36 797 пар) и малая SCAFFOLD-12K (12 000 пар)
  • Малую версию, SCAFFOLD-12K, использовали для базовых экспериментов на модели Qwen2.5-VL-3B-Instruct; конкретные показатели точности в тексте не приведены

Почему это важно

Схемы, блок-диаграммы и чертежи конвейеров, стандартный способ передать устройство системы в статье по компьютерным наукам, и, как подчёркивают авторы, такие рисунки нередко несут больше сути, чем сопровождающий их текст. До SCAFFOLD не существовало открытого набора данных, который бы напрямую связывал такие диаграммы с вопросами, ответами и пошаговыми рассуждениями о них, а без этого визуально-языковые модели учатся понимать научные схемы лишь косвенно, на разнородных и не заточенных под эту задачу данных.

Кому это важно

Датасет адресован исследователям, которые обучают или дообучают визуально-языковые модели (vision-language models) для чтения научных изображений: разбора архитектур нейросетей по схемам, понимания блок-схем экспериментальных пайплайнов, ответов на вопросы по чертежам. Он полезен и тем, кто строит инструменты для автоматического анализа научной литературы, поиска, суммаризации, извлечения фактов из статей, где диаграммы часть содержания, а не иллюстрация.

Как это применить

Датасет доступен в трёх размерах, SCAFFOLD-157K, SCAFFOLD-37K и SCAFFOLD-12K, что позволяет выбрать объём под задачу: от полноценного предобучения до быстрых базовых экспериментов. Именно малая версия, SCAFFOLD-12K, уже использовалась авторами для базовых прогонов на модели Qwen2.5-VL-3B-Instruct, это может служить отправной точкой для дообучения или сравнения других визуально-языковых моделей на той же задаче.

Можно ли доверять

Материал доступен как препринт на arXiv, а данные и код авторы выложили на GitHub, что позволяет самостоятельно проверить состав и качество датасета. При этом в доступном тексте не указаны ни имена авторов, ни их организации, не приведены конкретные числовые результаты базовых экспериментов и нет прямого сравнения с какими-либо другими существующими наборами данных, заявление об отсутствии аналогов остаётся общим утверждением авторов, не подкреплённым сопоставлением.

Риски и подводные камни

Часть датасета сгенерирована с помощью ИИ (вопросы и, судя по описанию, цепочки рассуждений), а не размечена людьми вручную, что может закладывать в данные систематические ошибки или смещения самой генерирующей модели. Отсутствие опубликованных числовых результатов базовых экспериментов не позволяет пока оценить, насколько датасет действительно улучшает понимание диаграмм моделями по сравнению с обучением без него.