ChatGPT делает ответы студентов лучше, а критическое мышление, оригинальнее

ChatGPT делает ответы студентов лучше, а критическое мышление, оригинальнее

Исследователи Университета Боккони совместно с исследовательской группой OpenAI Economic Research провели рандомизированный эксперимент с участием более 1000 первокурсников. Студентам дали реальный бизнес-кейс, разработать маркетинговые рекомендации для университетского магазина мерча (фирменных товаров с символикой вуза). По учебным потокам, а не по желанию отдельных студентов, их случайным образом распределили на четыре группы: одни получили доступ к ChatGPT на базе GPT-4o, другие прошли тренировку причинно-следственного мышления, конкретной формы критического мышления, которая учит связывать причину и следствие и объяснять, почему то или иное решение может сработать или провалиться, третьи получили и то и другое, а четвёртая группа, ни того, ни другого. Тренировка не была связана с ИИ: студентов учили причинно-следственному мышлению через игру, примеры, вопросы и обратную связь.

Работы оценивали двумя независимыми способами. Обученные эксперты-люди выставляли оценку по пятибалльной шкале, которая измеряла только одно, насколько рекомендации достигают двух стандартных маркетинговых целей: роста узнаваемости магазина и роста его использования. Отдельно исследователи применили автоматический анализ текста, чтобы посчитать количество и разнообразие идей в каждой работе, найти признаки причинно-следственного мышления и сравнить работы студентов с рекомендациями трёх экспертов.

Студенты с доступом к ChatGPT получили в среднем почти на балл больше из пяти по шкале оценивания. Их работы содержали больше идей, были логически более чёткими и ближе к рекомендациям экспертов, иными словами, ИИ помог новичкам сделать работу более похожей на профессиональную. При этом студенты не просто переносили ответ ChatGPT в свою работу: им всё равно приходилось решать, что спросить, оценивать полученные ответы и отбирать, что включить в финальный текст.

Эффект тренировки причинно-следственного мышления оказался более неожиданным. Студенты, прошедшие тренировку, яснее объясняли, почему их идеи могут сработать или, наоборот, провалиться, но на оценке по пятибалльной шкале это никак не сказалось, шкала измеряла только соответствие двум маркетинговым целям и не учитывала оригинальность решений. Зато автоматический анализ текста показал: работы этой группы содержали более широкий набор идей, которые заметнее отличались от работ остальных студентов, эффект, который стандартная шкала оценивания просто не улавливала.

Студенты, получившие и доступ к ChatGPT, и тренировку, показали пользу от обоих факторов сразу. Разнообразие их идей было на уровне группы, прошедшей только тренировку, а оценки по шкале и количество идей, на уровне группы с доступом к ChatGPT. Вдобавок их работы отличались более сильной логической связностью и более явными попытками искать объяснения и подвергать сомнению собственные предположения. В итоге именно эта группа показала улучшения по самому широкому набору показателей из всех четырёх.

Авторы подчёркивают: рандомизированный дизайн эксперимента позволил отдельно измерить эффект доступа к ChatGPT, эффект тренировки причинно-следственного мышления и эффект их сочетания, это делает работу заметным вкладом в растущий массив исследований о влиянии ИИ на учёбу. Если ИИ помогает студентам получать отточенный, похожий на экспертный финальный ответ, то оценка только по этому ответу говорит всё меньше о том, что студент на самом деле понимает, на это указывают авторы. В материале отмечается, что многие преподаватели уже сталкиваются с тем, что задания и критерии оценивания, возможно, придётся менять: вознаграждать стоит оригинальность, ход рассуждений и рассмотрение нескольких подходов, а не только гладкость и правильность финального текста. Это, по формулировке материала, продолжение многолетнего процесса, в котором технологии и образование меняются вместе.

Ключевые факты

  • Университет Боккони и исследовательская группа OpenAI Economic Research провели рандомизированный эксперимент на более чем 1000 первокурсниках: студенты писали маркетинговые рекомендации для университетского магазина мерча.
  • Студентов случайным образом по учебным потокам распределили на четыре группы: доступ к ChatGPT на базе GPT-4o, тренировка причинно-следственного мышления, оба фактора сразу или ни один из них.
  • Работы оценивали двумя способами: люди-эксперты, по пятибалльной шкале, ограниченной двумя маркетинговыми целями (рост узнаваемости и рост использования магазина), и отдельно, автоматический анализ текста со сравнением с рекомендациями трёх экспертов.
  • Доступ к ChatGPT поднял оценку почти на балл из пяти и сделал работы более похожими на экспертные, но студенты сами решали, что спрашивать и что включать в ответ, а не копировали вывод ИИ целиком.
  • Тренировка причинно-следственного мышления не подняла оценку по шкале, но, по данным анализа текста, сделала идеи студентов более разнообразными и оригинальными; группа, получившая оба фактора, показала прирост по самому широкому набору показателей.

Почему это важно

Спор «учить студентов думать самим или учить их пользоваться ИИ» обычно подают как выбор одного из двух вариантов. Рандомизированный эксперимент развёл эти факторы и показал: они работают по-разному и складываются, а не конкурируют. Доступ к ChatGPT поднимает качество и связность финального текста, тренировка причинно-следственного мышления, разнообразие и оригинальность идей; вместе они дают прирост по самому широкому набору показателей. Одновременно исследование указывает на слепое пятно традиционного оценивания: если ИИ помогает делать финальный ответ более отточенным и похожим на экспертный, оценка по одному лишь этому ответу говорит всё меньше о том, что студент на самом деле понял и придумал сам.

Кому это важно

Преподавателям и методистам, которые составляют задания и критерии оценки в вузах и школах: исследование прямо показывает, что стандартная пятибалльная шкала не улавливает эффект от тренировки мышления, хотя он реально есть. Университетской администрации и тем, кто решает, разрешать ли студентам ChatGPT на заданиях. Исследователям влияния ИИ на образование: дизайн с четырьмя группами позволяет отдельно измерить эффект доступа к ИИ и эффект тренировки мышления, а не смешивать их в один результат. Самим студентам и родителям, чтобы понимать, что доступ к ChatGPT и развитие собственного мышления дают разную, взаимодополняющую пользу, а не взаимоисключающую.

Как это применить

Из результатов вытекает практический вывод для тех, кто проектирует задания и оценивание. Разрешать ChatGPT на заданиях не обязательно означает потерю оригинальности, по данным эксперимента, риск снижается, если доступ к ИИ сопровождается отдельной тренировкой причинно-следственного мышления, а не заменяет её. Критерии оценки стоит дополнять тем, что не ловит стандартная пятибалльная шкала: разнообразием и оригинальностью идей, а не только гладкостью и правильностью текста, иначе именно тот эффект, который даёт тренировка мышления, останется невидимым для оценки. Там, где это возможно, стоит сочетать оценку человеком с автоматическим анализом текста: в эксперименте именно эта комбинация выявила эффект, который одна лишь человеческая шкала пропустила.

Можно ли доверять

Дизайн исследования, сильная сторона: студентов распределяли по группам случайным образом, групп четыре, а не две, что позволяет отдельно измерить оба фактора и их сочетание, а не смешивать эффекты; участников больше 1000; оценка сделана двумя независимыми способами, людьми-экспертами и отдельным автоматическим анализом текста со сравнением против работ трёх реальных экспертов. При этом материал опубликован на сайте OpenAI, а OpenAI Economic Research, не сторонний рецензент, а соисполнитель исследования наравне с Университетом Боккони; у компании есть прямой интерес показать пользу собственного продукта, и это стоит держать в уме. В самом материале не названы ни даты проведения и публикации исследования, ни имена конкретных исследователей, фигурируют только названия организаций; не указан размер каждой из четырёх групп; не раскрыта база сравнения, от которой отсчитан «почти балл» разницы; не приведены ни статистическая значимость, ни доверительные интервалы ни для одного результата, материал излагает выводы, но не даёт возможности проверить их устойчивость самостоятельно.

Риски и подводные камни

Главный риск называют сами авторы: если студент способен получить отточенный, похожий на экспертный ответ с помощью ИИ, оценка только по финальному тексту всё меньше говорит о том, что он на самом деле понимает и может сделать сам. Второй риск, рассогласование между тем, что развивает тренировка мышления (оригинальность, разнообразие идей), и тем, что измеряет стандартная шкала оценивания (соответствие заданным целям): пока критерии оценки не учитывают оригинальность, у школ и вузов нет стимула поощрять именно тот навык, который тренировка действительно развивает. Третий риск, за пределами самого эксперимента: если студенты получают доступ к ChatGPT без параллельной тренировки мышления, велика вероятность, что их работы станут более гладкими, но менее оригинальными, ровно тот эффект, который в эксперименте компенсировало только сочетание обоих факторов, а не один лишь доступ к ИИ. Наконец, поскольку в материале не приведены статистическая значимость и размер каждой группы, судить о том, насколько надёжны и воспроизводимы количественные результаты, по одному этому тексту нельзя.