Рекурсивные языковые модели обобщаются лучше CoT вне распределения

Авторы сравнивают два способа организовать пошаговое рассуждение языковой модели. Первый, стандартная цепочка мыслей (chain-of-thought, CoT): модель на каждом шаге видит всю накопленную трассу рассуждения целиком. Второй, рекурсивные языковые модели: при решении каждой подзадачи модель ограничивает себя изолированным контекстом, не видя остального.

Внутри тренировочного распределения (in-distribution) разница почти не проявляется: CoT способна эффективно сымитировать рекурсивное правило, поэтому гарантия обобщения меняется лишь на константу, и рекурсивная изоляция контекста не даёт заметного преимущества.

Вне распределения (out-of-domain) картина меняется. CoT может подогнаться под обучающую выборку, опираясь на контекст за пределами текущей подзадачи, то есть находить обходной путь (short-cut), который перестаёт работать, как только эти сторонние токены меняются. Рекурсивная изоляция контекста исключает такой обходной путь в принципе: подзадаче физически неоткуда взять информацию извне.

Ключевой вывод: даже когда класс гипотез, которые способна выразить CoT, всё ещё содержит верное рекурсивное правило, склонность к простоте (simplicity bias) на этапе обучения выбирает более простой обходной путь вместо истинного правила. Из этого следует, что для настоящего рассуждения, не просто точности на тестовом распределении, недостаточно, чтобы правильное правило в принципе входило в класс гипотез модели. Это расходится с интуицией классической теории обучения, где покрытие правильной гипотезы обычно и есть цель.

Ключевые факты

  • Сравниваются два режима рассуждения: CoT с полным доступом к трассе и рекурсивные языковые модели, решающие каждую подзадачу в изолированном контексте.
  • Внутри тренировочного распределения CoT эффективно имитирует рекурсивное правило, гарантия обобщения меняется лишь на константу, рекурсия почти не выигрывает.
  • Вне распределения CoT может подгоняться под обучающую выборку за счёт контекста вне текущей подзадачи, обходной путь, который ломается при смене этого контекста.
  • Изоляция контекста у рекурсивных моделей структурно исключает этот обходной путь.
  • Даже когда верное рекурсивное правило доступно классу гипотез CoT, склонность к простоте выбирает обходной путь вместо истины, одного лишь наличия верной гипотезы в классе недостаточно для истинного рассуждения, что расходится с классической теорией обучения.

Почему это важно

Работа даёт теоретическое объяснение известной практической проблемы: модели, которые рассуждают пошагово через цепочку мыслей, часто хорошо работают на тестовых данных, похожих на тренировочные, но проваливаются при малейшем сдвиге условий. Авторы показывают механизм этого провала: CoT не ошибается из-за нехватки выразительности, верное правило ей доступно, а из-за того, что при обучении более простой обходной путь, использующий посторонний контекст, оказывается предпочтительнее для алгоритма обучения. Рекурсивная архитектура, которая физически изолирует контекст подзадачи, устраняет саму возможность такого обходного пути, а не просто снижает его вероятность.

Кому это важно

В первую очередь, исследователям, которые проектируют архитектуры рассуждения для языковых моделей и агентов: разработчикам многошаговых цепочек, декомпозиции задач на подзадачи и рекурсивных/иерархических схем промптинга. Работа даёт им теоретический аргумент в пользу изоляции контекста как структурного приёма, а не просто эвристики.

Как это применить

Практический вывод, при проектировании систем, которым нужно надёжно обобщаться на условия за пределами тренировочного распределения, стоит закладывать изоляцию контекста подзадачи как архитектурный принцип, а не полагаться на то, что модель сама научится не использовать посторонний контекст. В исходном тексте нет описания конкретной реализации, бенчмарков или численных результатов, это теоретическая работа, и её выводы описывают общий принцип, а не готовый рецепт.

Можно ли доверять

Источник, препринт на arXiv, то есть работа пока не прошла (или не описан статус) рецензирования. В доступном тексте нет имён авторов, их принадлежности к организациям, экспериментальных результатов или конкретных моделей, на которых проверялось утверждение, есть только теоретическая аргументация. Формально это не снижает ценность самого рассуждения, но означает, что эмпирическое подтверждение на реальных больших языковых моделях в разобранном тексте не приведено.

Риски и подводные камни

Главный риск, переносить теоретический результат на практику без оговорок: авторы формулируют его на уровне гарантий обобщения и класса гипотез, а не на конкретных моделях или задачах, поэтому насколько сильно эффект проявляется у реальных языковых моделей на реальных данных, из текста не следует. Также стоит учитывать, что рекурсивная изоляция контекста имеет свою цену, потерю информации, которая в отдельных задачах могла быть полезной, но это компромисс уже за пределами того, что раскрывает источник.

«Хотя класс гипотез CoT всё ещё покрывает рекурсивное правило, склонность к простоте выбирает обходной путь вместо истины.»

— авторы исследования