GPT-5.4 занижает сложность тестовых заданий, выяснило исследование

Исследование проверило, насколько хорошо большие языковые модели (LLM) умеют предсказывать уровень сложности заданий, это ключевая задача при формирующем оценивании и при масштабных тестах с высокими ставками. Материалом послужили задания реального крупномасштабного теста по чтению и письму. Авторы прогнали несколько LLM через разные стратегии промптинга и настройки параметров, а затем сравнили их точность с encoder-моделями (модели, которые только кодируют текст в представление, без генерации) и с классическими моделями машинного обучения на вручную заданных признаках.

Лучший результат среди LLM показала модель GPT-4.1 в режиме zero-shot (без примеров-подсказок) при температуре 0: квадратичная взвешенная каппа (QWK, метрика согласия между предсказанием и реальным уровнем сложности) составила 0.578. Однако все LLM в целом уступили encoder-модели ConvBERT, которая показала QWK = 0.625, выше не только всех LLM, но и лучшей модели на классических признаках.

Дополнительный анализ показал, что все протестированные LLM плохо справлялись именно со сложными заданиями, им труднее давалась именно верхняя граница шкалы трудности. Отдельно отмечено, что более новая и продвинутая модель GPT-5.4 склонна занижать уровень сложности заданий, то есть с ростом возможностей модели проблема не исчезает, а проявляется по-прежнему.

Авторы также визуализировали эмбеддинги (векторные представления) заданий после снижения размерности и обнаружили, что задания разных уровней сложности перемешаны между собой в этом пространстве. Это означает, что одной семантической информации из текста задания, судя по всему, недостаточно для точного предсказания его сложности.

Вывод исследования: раз LLM эмпирически не демонстрируют понимания уровня сложности заданий и склонны считать большинство заданий лёгкими по мере роста собственных возможностей, использовать их для автоматической генерации заданий с заданным целевым уровнем сложности стоит с осторожностью.

Ключевые факты

  • Исследование сравнило несколько LLM, encoder-модель ConvBERT и классическую модель машинного обучения на признаках в задаче предсказания уровня сложности заданий теста по чтению и письму
  • Лучший результат среди LLM, у GPT-4.1 в режиме zero-shot при температуре 0: квадратичная взвешенная каппа (QWK) = 0.578
  • ConvBERT (encoder-модель) обошла все протестированные LLM и лучшую модель на классических признаках: QWK = 0.625
  • Все LLM плохо справлялись с определением сложных заданий, а более новая GPT-5.4 склонна занижать уровень сложности
  • Снижение размерности эмбеддингов заданий показало, что задания разной сложности перемешаны в пространстве представлений, одной семантики текста недостаточно для предсказания сложности

Почему это важно

LLM всё чаще предлагают использовать для автоматической генерации тестовых заданий с заданным уровнем сложности, это экономит время составителей тестов. Исследование показывает, что сама способность модели верно оценивать сложность задания остаётся слабым местом: даже лучшая из протестированных LLM (GPT-4.1) уступила специализированной, но гораздо более простой encoder-модели ConvBERT. При этом более новая и продвинутая GPT-5.4 не решает проблему, а показывает её отчётливее, склонна занижать сложность заданий.

Кому это важно

Разработчикам образовательных платформ и систем тестирования, специалистам по психометрике и составителям экзаменов, которые рассматривают LLM как инструмент для автоматической генерации заданий или оценки их трудности.

Как это применить

Если задача, сгенерировать задания под конкретный целевой уровень сложности, полагаться на суждение LLM об этой сложности стоит с осторожностью: исследование прямо указывает на риск ошибки, особенно на сложных заданиях. Более узкоспециализированные encoder-модели вроде ConvBERT в этой конкретной задаче показали результат лучше, чем универсальные LLM.

Можно ли доверять

Это научная работа с чёткой экспериментальной постановкой: несколько LLM с разными стратегиями промптинга и параметрами сравниваются с encoder-моделями и классическим машинным обучением на одном и том же материале, заданиях реального крупномасштабного теста по чтению и письму, с явной количественной метрикой (QWK). Имена авторов, институциональная принадлежность, точный размер выборки и период проведения исследования в тексте не приведены.

Риски и подводные камни

Главный риск, использовать LLM для генерации заданий с заданной сложностью в тестах с высокими ставками, полагаясь на её собственную оценку трудности задания. Судя по результатам, ошибка не исчезает по мере роста возможностей модели: более продвинутая GPT-5.4 всё равно склонна занижать сложность, то есть выдавать сложные задания за лёгкие.