Исследователи выпустили OmniEdu, открытые модели для школьного обучения и преподавания

Исследователи выпустили OmniEdu, открытые модели для школьного обучения и преподавания

Исследователи представили OmniEdu, открытое семейство базовых языковых моделей, дообученных специально для школьного (K-12) обучения и преподавания. Авторы отмечают, что существующие образовательные языковые модели обычно решают либо задачи (problem solving), либо помогают в обучении (tutoring), а обучающие выборки для них собираются по источнику данных или типу задания, а не по конкретному навыку модели.

Для OmniEdu собрали инструктивный корпус из более чем 100 образовательных и общих источников данных, организованный вокруг четырёх способностей: владение предметом, привязка к учебной программе, диагностическое рассуждение и педагогическое сопровождение (подсказки и поддержка ученика). Конвейер обработки данных включает детерминированную очистку, семантический аудит и переписывание, оценку качества под конкретную задачу, отбор с учётом бюджета токенов для разнообразия и распределение примеров по педагогическим инструкциям. В результате получено 69 999 примеров и 15,96 млн размеченных токенов ответов, из которых 60 951 пример, специфичен именно для образования.

На этом корпусе дообучили модели с 4, 9 и 27 млрд параметров и проверили их на трёх группах образовательных бенчмарков, привязка к учебной программе, решение школьных задач и педагогический тьюторинг, а также на общих бенчмарках способностей. По утверждению авторов, ориентированное на образование дообучение стабильно улучшает результаты по всем трём образовательным группам бенчмарков на всех размерах модели.

Старшая модель, OmniEdu-27B, показала 63,12% точных совпадений (EM) и 76,69% F1 на бенчмарке K12-Bench, 85,89% на MathFish, 86,95% на EDUMATH и 78,74% в режиме Scaffold бенчмарка MathTutorBench. На бенчмарке LongTutor она получила самый высокий средний балл по разделу «Обучение» (Teaching) среди всех сравниваемых моделей, 3,02. Авторы делают вывод, что тщательно отобранные и сбалансированные по способностям обучающие данные позволяют адаптировать обычные языковые модели под образовательные задачи, от решения задач и понимания учебной программы до педагогического сопровождения.

Ключевые факты

  • OmniEdu, открытое семейство моделей на 4, 9 и 27 млрд параметров, дообученных для школьного (K-12) обучения и преподавания
  • Инструктивный корпус собран из более чем 100 образовательных и общих источников: итог, 69 999 примеров и 15,96 млн токенов ответов, из них 60 951 пример, образовательный
  • Конвейер данных включает очистку, семантический аудит и переписывание, оценку качества по задаче, отбор с учётом бюджета токенов и распределение по педагогическим инструкциям
  • OmniEdu-27B: 63,12% EM и 76,69% F1 на K12-Bench, 85,89% на MathFish, 86,95% на EDUMATH, 78,74% на MathTutorBench (режим Scaffold)
  • На бенчмарке LongTutor модель показала лучший средний балл по обучающей способности (3,02) среди сравниваемых моделей

Почему это важно

Авторы указывают на разрыв в существующих образовательных языковых моделях: одни умеют решать задачи, другие, вести диалог с учеником, а обучающие данные для них собираются по источнику или типу задания, а не по конкретному навыку. OmniEdu пытается закрыть этот разрыв, объединив в одной модели четыре способности сразу: знание предмета, понимание учебной программы, диагностику затруднений ученика и педагогическую поддержку.

Кому это важно

Работа адресована разработчикам образовательных продуктов и исследователям, которые создают системы для школьного обучения и тьюторинга: собранный корпус, методика его отбора и набор бенчмарков (K12-Bench, MathFish, EDUMATH, MathTutorBench, LongTutor) дают готовую точку отсчёта для оценки таких систем.

Как это применить

OmniEdu выпущена как семейство из трёх моделей размером 4, 9 и 27 млрд параметров, можно выбрать масштаб под доступные вычислительные ресурсы. В источнике не указаны ни дата релиза, ни лицензия, ни доступность весов или данных, поэтому практическое использование модели вне описанных в статье экспериментов на момент публикации проверить нельзя.

Можно ли доверять

Источник, полный текст аннотации статьи с конкретными числами по корпусу и бенчмаркам, что позволяет проверить заявленные результаты. При этом в тексте нет имён авторов или их организационной принадлежности, не указана дата релиза, лицензия или доступность модели, а сравнение приведено не с конкретной именованной базовой моделью, только с общим утверждением о разрыве в существующих подходах.

Риски и подводные камни

Все показатели взяты из самоотчёта авторов без независимого сравнения с конкретными конкурирующими моделями. Разработка узкоспециализирована под школьное (K-12) образование, и без данных о лицензии и доступности пока неясно, смогут ли сторонние разработчики воспроизвести или использовать OmniEdu на практике.