Цепочка рассуждений (CoT) помогает ИИ не всегда, только в сложных задачах

Новое эмпирическое исследование проверяет расхожее убеждение, что цепочка рассуждений (chain-of-thought, CoT), пошаговое рассуждение модели перед ответом, всегда улучшает качество работы больших языковых моделей. Авторы отталкиваются от теоретической концепции «границы пропускной способности» H_dp (H_dp bandwidth bound), предложенной Chen et al. в 2024 году: формальная граница этой модели работает строго только при астрономически длинных промптах, но указывает на реальное архитектурное ограничение, последовательные вычисления, которые не умещаются в один проход трансформера, приходится «выносить наружу», и именно это делает CoT.

Исследователи протестировали три дообученные на инструкциях модели, Qwen-2.5-7B, Qwen-2.5-32B и Llama-3.1-8B, на пяти стандартных тестах NLP при практичных длинах контекста. Главный результат: точность без CoT (за один проход) монотонно падает по мере роста «последовательной глубины» задачи внутри одного теста, а точность с CoT остаётся примерно неизменной вне зависимости от этой глубины.

На задачах с высокой последовательной глубиной, относящихся к классу сложности P-complete (GSM8K, MATH), CoT даёт прирост точности («разрыв восстановления») от +54 до +68 процентных пунктов, и это верно для всех трёх моделей. На «неглубоких» задачах класса TC^0 (MMLU, ARC) CoT оказывается структурно избыточным: эффект лежит в диапазоне от 0,0 до +4,6 п.п., статистически значимого отрицательного эффекта нет. Правда, авторы оговариваются: базовая точность без CoT на ARC доходит до 95%, что может объясняться утечкой тестовых данных в обучающую выборку, поэтому этот нулевой результат нельзя считать чистой архитектурной проверкой.

Промежуточный по сложности класс L, представленный тестом HumanEval, показал переход, зависящий от размера модели: CoT даёт +23,2 п.п. на 32-миллиардной модели Qwen, +9,1 п.п. на 8-миллиардной Llama, но ухудшает результат на -28,7 п.п. на 7-миллиардной Qwen-2.5.

Корреляция между глубиной задачи и приростом от CoT по всем тестам, коэффициент Спирмена 0,661 (p = 0,007, n = 15); 9 из 15 тестов на уровне отдельных бенчмарков дали статистически значимый результат по критерию Макнемара после поправки Бонферрони. Исследование заранее зарегистрировано на платформе OSF (Open Science Framework).

Вывод авторов: цепочка рассуждений, не универсальный усилитель качества рассуждений ИИ, а «обход ограничения пропускной способности»: она помогает там, где последовательные вычисления не помещаются в один проход модели, и избыточна там, где задача и так решается за один проход.

Ключевые факты

  • На трёх моделях (Qwen-2.5-7B/32B, Llama-3.1-8B) и пяти тестах показано: без CoT точность падает с ростом последовательной глубины задачи, с CoT, остаётся почти неизменной.
  • На сложных P-complete задачах (GSM8K, MATH) CoT даёт +54…+68 п.п.; на неглубоких TC^0 задачах (MMLU, ARC), лишь 0,0…+4,6 п.п. без значимого вреда.
  • На HumanEval эффект CoT зависит от размера модели: от +23,2 п.п. на 32B до -28,7 п.п. на самой маленькой из протестированных моделей, Qwen-2.5-7B.
  • Корреляция глубины задачи и выигрыша от CoT, 0,661 (p=0,007, n=15); 9 из 15 тестов статистически значимы после поправки Бонферрони.
  • Исследование заранее зарегистрировано на OSF; вывод авторов, CoT не универсальный усилитель рассуждений, а обход ограничения пропускной способности модели.

Почему это важно

Работа бьёт по расхожему допущению индустрии, что пошаговые рассуждения всегда полезны и их стоит включать по умолчанию. Авторы показывают: польза CoT зависит от того, насколько задача требует именно последовательных, многошаговых вычислений, на неглубоких задачах эффект близок к нулю, а на некоторых моделях и задачах CoT может даже вредить.

Кому это важно

Тем, кто проектирует промпты и пайплайны на базе больших языковых моделей: инженерам, встраивающим CoT в продукты, и исследователям, изучающим границы возможностей трансформеров. Результат даёт ориентир, когда включать пошаговые рассуждения оправданно, а когда это лишние токены и задержка без выигрыша в точности.

Как это применить

Для задач с высокой последовательной глубиной, многошаговая арифметика и математика вроде GSM8K и MATH, CoT стоит применять: прирост точности в исследовании достигал +54…+68 п.п. Для неглубоких задач, близких по структуре к MMLU и ARC (по сути, прямой выбор ответа без длинной цепочки шагов), включение CoT почти не даёт выигрыша и может не окупать дополнительные токены и время генерации. При этом стоит проверять эффект CoT именно на своей модели: на HumanEval исследователи увидели, что для самой маленькой модели (Qwen-2.5-7B) CoT не помог, а ухудшил результат на -28,7 п.п.

Можно ли доверять

Исследование заранее зарегистрировано на платформе OSF, что снижает риск подгонки гипотез под результат задним числом. Выводы опираются на статистику, корреляцию Спирмена и тесты Макнемара с поправкой Бонферрони, и проверены на трёх разных моделях и пяти тестах. В тексте нет имён авторов, институциональной принадлежности и места публикации, поэтому оценить рецензирование и репутацию авторов по самому источнику невозможно; также сами авторы честно отмечают неопределённость с возможной утечкой данных теста ARC в обучающую выборку.

Риски и подводные камни

Выборка ограничена тремя моделями и пятью тестами, обобщать выводы на все архитектуры и задачи преждевременно. Высокая точность без CoT на ARC (до 95%) может объясняться утечкой тестовых данных в обучающую выборку, но подтверждения этому в тексте нет, авторы называют это лишь предположением. Случай HumanEval показывает, что эффект CoT для маленьких моделей непредсказуем и может быть отрицательным, поэтому включать CoT «на всякий случай» без проверки на конкретной задаче и модели рискованно.

«Цепочка рассуждений, не универсальный усилитель качества рассуждений; она работает как обход ограничения пропускной способности: помогает там, где последовательные вычисления не умещаются в один проход модели, и избыточна там, где задача и так решается за один проход.»

— авторы исследования