K12-KGraph: граф знаний школьной программы Китая выявил пробелы у ИИ-моделей

Группа исследователей во главе с Хао Ляном (Hao Liang) представила K12-KGraph, граф знаний, построенный по официальным школьным учебникам издательства People's Education Press (государственного издателя школьных учебников Китая) по математике, физике, химии и биологии для начальной, средней и старшей школы. Граф охватывает девять типов узлов и четырнадцать типов связей: цепочки предварительных знаний (что нужно знать заранее для новой темы), таксономии понятий, связи между экспериментами и понятиями, педагогическую последовательность изложения материала и привязку понятий к иллюстрациям в учебниках. Такую способность ориентироваться в структуре программы авторы называют «учебным познанием» (curriculum cognition) и отмечают, что существующие тесты для ИИ в основном проверяют лишь ответы на экзаменационные вопросы, а не понимание того, как устроена и визуально представлена сама программа.
На основе графа построен бенчмарк K12-Bench, 23 640 вопросов с множественным выбором, разделённых на пять типов заданий: Ground (привязка к тексту или иллюстрации учебника), Prereq (предварительные знания), Neighbor (связанные понятия), Evidence (подтверждающие факты) и Locate (определение места понятия в программе). На этом бенчмарке модель Gemini-3-Flash показала лишь 57% точных совпадений, а Gemma-4-31B-IT, 46%; сложнее всего моделям дались задания на предварительные знания (Prereq) и связанные понятия (Neighbor).
Чтобы показать, что этот разрыв можно сократить, авторы также собрали обучающий набор K12-Train, 7 335 примеров для дообучения (supervised fine-tuning) на основе того же графа: 2 267 текстовых пар «вопрос-ответ» и 5 068 мультимодальных пар «вопрос-изображение-ответ». При одинаковом бюджете в 2 300 примеров текстовая версия набора, K12-Train-Text, превзошла равные по размеру выборки из восьми популярных корпусов для инструктивного дообучения на тестах GaokaoBench и EduEval. Для мультимодальных моделей полная версия набора, K12-Train-Full, показала лучшие результаты на тестах Gaokao-MM, MDK12-medium и K12Vista среди всех сравниваемых конфигураций обучения, притом что использовала меньше примеров, чем полные наборы DataFlow и WizardLM. Она также превзошла версии, обученные только на тексте или только на мультимодальных данных, что говорит о взаимодополняющей пользе текстового и визуального обучения. Авторы публикуют в открытом доступе сам граф, бенчмарк, обучающие данные и весь конвейер построения.
Ключевые факты
- K12-KGraph, граф знаний по официальным школьным учебникам Китая (математика, физика, химия, биология; начальная/средняя/старшая школа): 9 типов узлов, 14 типов связей.
- Бенчмарк K12-Bench включает 23 640 вопросов с множественным выбором и пять типов заданий: Ground, Prereq, Neighbor, Evidence, Locate.
- На K12-Bench Gemini-3-Flash набрала только 57% точных совпадений, а Gemma-4-31B-IT, 46%; труднее всего моделям даются задания Prereq и Neighbor.
- Обучающий набор K12-Train (7 335 примеров: 2 267 текстовых и 5 068 мультимодальных) при равном бюджете в 2 300 примеров обходит восемь популярных инструктивных корпусов на тестах GaokaoBench и EduEval.
- Мультимодальная версия K12-Train-Full лидирует на бенчмарках Gaokao-MM, MDK12-medium и K12Vista, используя меньше данных, чем DataFlow и WizardLM; текстовое и визуальное обучение дополняют друг друга.
Почему это важно
Большинство существующих тестов для ИИ в образовании проверяют только умение отвечать на экзаменационные вопросы, но не то, понимает ли модель, как устроена сама программа: что из чего следует, какие понятия связаны между собой, как теория соотносится с экспериментами и иллюстрациями в учебнике. K12-KGraph и K12-Bench впервые системно проверяют именно такую «структурную» грамотность на реальных школьных учебниках, а результаты показывают, что даже сильные модели вроде Gemini-3-Flash ошибаются почти в половине случаев (57% точных совпадений на K12-Bench), то есть пробел ощутимый и касается практических задач, например подсказки ученику, что нужно повторить перед новой темой.
Кому это важно
В первую очередь, разработчикам образовательных ИИ-сервисов и репетиторов на основе языковых моделей, особенно ориентированных на китайский рынок и программу издательства People's Education Press. Результаты также интересны командам, которые обучают и оценивают мультимодальные модели, работающие одновременно с текстом и изображениями учебников, и исследователям, изучающим, как ИИ выстраивает связи между понятиями, а не просто запоминает факты для экзамена.
Как это применить
Авторы выложили в открытый доступ сам граф знаний K12-KGraph, бенчмарк K12-Bench, обучающий набор K12-Train и полный конвейер построения графа, значит, любая команда может напрямую прогнать свою модель через K12-Bench, чтобы проверить, насколько она понимает структуру школьной программы, а не только отвечает на готовые вопросы. Из экспериментов следует практический вывод: даже небольшой обучающий набор, выстроенный по графу знаний (2 300 примеров), при дообучении эффективнее равного по размеру обычного инструктивного корпуса, то есть для образовательных моделей структура данных важнее простого объёма.
Можно ли доверять
Работа опирается на официальные учебники утверждённой государственной программы Китая (издательство People's Education Press) и заявляет открытую публикацию графа, бенчмарка, обучающих данных и кода конвейера, это позволяет проверить результаты независимо. Авторы приводят конкретные цифры точности (57% и 46%), а не только общие оценки, и сравнивают свой обучающий набор с восемью известными альтернативами на нескольких независимых бенчмарках (GaokaoBench, EduEval, Gaokao-MM, MDK12-medium, K12Vista). Вместе с тем на момент публикации на Hugging Face материал набрал всего 16 отметок и 1 комментарий, то есть широкого независимого обсуждения или воспроизведения результатов сообществом пока не было, и работа похожа на препринт, а не на многократно проверенную рецензированную публикацию.
Риски и подводные камни
Граф и бенчмарк построены исключительно на китайской государственной программе одного издательства, неясно, насколько выводы переносятся на учебники других стран или образовательных систем. Формат вопросов с множественным выбором, упрощение реального понимания программы, а не прямое доказательство того, что модель способна объяснить материал ученику. Кроме того, обучающий набор K12-Train построен на основе того же графа знаний, что и бенчмарк K12-Bench, оценка и часть тренировочных данных происходят из одного источника, и часть выигрыша в результатах может объясняться близостью формата данных, а не только более глубоким «пониманием» программы моделью.