A*-Thought-V2 сжимает цепочки рассуждений нейросетей и повышает точность

A*-Thought-V2 сжимает цепочки рассуждений нейросетей и повышает точность

Chain-of-Thought (CoT), пошаговое рассуждение вслух, повышает точность больших языковых моделей, но резко увеличивает длину ответа, а вместе с ней расход вычислений и контекстного окна. Существующие способы сжатия такого рассуждения решают эту проблему грубо: одни жёстко вырезают часть шагов и теряют промежуточную информацию, другие не имеют внятного критерия, какие шаги можно сжимать непрерывно, а какие нужно сохранить целиком.

Исследователи представили A*-Thought-V2, метод, который представляет цепочку рассуждений как траекторию скрытых состояний модели. Представления вопроса, каждого шага рассуждения и итогового решения проецируются в трёхмерное пространство методом главных компонент (PCA), после чего для каждого перехода между соседними шагами измеряется угол отклонения от общего направления «вопрос → решение». Шаги, чей переход близко совпадает с этим направлением, остаются обычным текстом; шаги, которые от него отклоняются, например, там, где модель что-то проверяет, исправляет ошибку или исследует побочную ветку рассуждения, не удаляются, а сжимаются в непрерывные латентные токены. По наблюдению авторов, величина угла несёт смысл сама по себе: маленькие углы соответствуют прямому исполнению шага и формированию ответа, большие, проверке, исправлению и разведке альтернатив, а то, как угол меняется вдоль всей цепочки, показывает стадии исследования, схождения к ответу и уточнения.

Чтобы научить модель работать в таком смешанном явно-латентном формате, авторы вводят два новых приёма обучения: «stepwise embedding forcing» (пошаговое объединение эмбеддингов) объединяет каждый избыточный шаг в единственный латентный эмбеддинг, а «label forcing» (принудительное мягкое обучение метке) учит латентный токен не на одной жёсткой правильной метке, а на мягком распределении вероятностей по нескольким вариантам словаря.

Метод проверили на двух моделях семейства Qwen, Qwen3.5-9B и Qwen3.6-27B, на шести бенчмарках внутри и за пределами обучающего домена. По сравнению с существующими методами A*-Thought-V2 повышает среднюю точность до 2,6 процентного пункта и одновременно сокращает длину ответа не более чем на 50%, повышает показатель «точность на единицу вычислений» в 2,29 раза, а время предобработки и обучения сокращает на 94,6% и до 80,3% соответственно.

Отдельный анализ внутренних представлений модели говорит о том, что латентные состояния группируются в компактную область, отдельную от текстовых состояний, а более высокая энтропия (неопределённость) в позициях латентных токенов отражает более широкие мягкие цели обучения, которые, как полагают авторы, помогают модели осваивать более богатые признаки на уровне отдельных шагов рассуждения.

Ключевые факты

  • A*-Thought-V2 сжимает цепочку рассуждений языковой модели не жёстким удалением шагов, а проекцией представлений вопроса, шага и решения в 3D-пространство методом главных компонент (PCA) и измерением угла между каждым переходом и направлением «вопрос → решение».
  • Шаги, совпадающие по направлению с решением, остаются обычным текстом; отклоняющиеся шаги, проверки, исправления, побочные ветки рассуждения, сжимаются в непрерывные латентные токены вместо удаления.
  • Обучение опирается на два новых приёма: stepwise embedding forcing объединяет избыточный шаг в один латентный эмбеддинг, а label forcing учит латентный токен на мягком распределении по словарю вместо жёсткой one-hot метки.
  • На моделях Qwen3.5-9B и Qwen3.6-27B на шести бенчмарках метод повышает среднюю точность до 2,6 процентного пункта, сокращает длину ответа не более чем на 50% и увеличивает показатель «точность на единицу вычислений» в 2,29 раза.
  • Время предобработки метод сокращает на 94,6%, время обучения, до 80,3%; латентные состояния при этом образуют отдельную от текстовых состояний компактную область в пространстве представлений.

Почему это важно

Пошаговое рассуждение (цепочка рассуждений), стандартный способ поднять точность больших языковых моделей: модель «думает вслух», прежде чем дать ответ, а плата за это, сильно возросшая длина ответа и расход вычислений и контекста. Прежние методы сжатия такого рассуждения либо жёстко вырезают часть шагов и теряют информацию, либо сжимают без ясного критерия, что можно убрать без потерь. A*-Thought-V2 предлагает содержательный критерий вместо произвольного порога, геометрию: угол между локальным шагом рассуждения и общим направлением к ответу, и по нему решает, какой шаг оставить текстом, а какой заменить компактным латентным представлением. При этом на шести бенчмарках метод не просто экономит место, а одновременно поднимает точность (до 2,6 процентного пункта), сжатие здесь не компромисс «короче ценой качества», а выигрыш по обоим параметрам сразу.

Кому это важно

В первую очередь, командам, которые обучают или дообучают модели с цепочкой рассуждений и упираются в стоимость и задержку долгих ответов: результат напрямую сокращает объём генерируемого текста и время предобработки и обучения. Во вторую, исследователям в области эффективного инференса и сжатия моделей: статья предлагает не эвристику, а измеримый геометрический критерий отбора шагов, который можно переиспользовать в других методах сжатия цепочки рассуждений. Разработчикам инфраструктуры для инференса важна экономия на длине ответа и вычислениях, это прямая статья расходов при масштабировании таких моделей.

Как это применить

A*-Thought-V2, метод дообучения, а не готовый инструмент или API: его проверяли на моделях Qwen3.5-9B и Qwen3.6-27B, дообучая их с помощью двух новых приёмов, stepwise embedding forcing и label forcing, чтобы модель сама научилась решать, какие шаги рассуждения оставлять текстом, а какие сжимать в латентные токены. Технически это значит, что метод применим к уже существующим открытым языковым моделям как этап дообучения, а не требует архитектуры с нуля. Текст источника не сообщает, выложены ли код, веса модели или обучающие данные, этот вопрос остаётся открытым до отдельного анонса от авторов.

Можно ли доверять

Материал, карточка препринта на Hugging Face Papers, и цифры в нём, результаты собственных экспериментов авторов: доступный текст не называет ни методы сравнения поимённо, ни шесть бенчмарков, ни авторов и их принадлежность к организациям, ни дату публикации, не сообщает и об абсолютном уровне точности, только размер прироста (до 2,6 процентного пункта), и не уточняет, выложены ли код и данные. Для раннего исследовательского анонса это обычная картина, но она означает, что сверить цифры с чем-то, кроме текста самой карточки, здесь нельзя; тестирование ограничено двумя размерами одного семейства моделей (Qwen, 9B и 27B), что подтверждает метод, но не гарантирует его перенос на другие архитектуры.

Риски и подводные камни

Все ключевые цифры, верхние границы («до»): фактический прирост точности или сокращение длины ответа в конкретной задаче может оказаться заметно меньше заявленных 2,6 процентного пункта и 50%. Метод проверен только на двух моделях семейства Qwen, перенос на модели других архитектур ничем не подтверждён. Замена части явных текстовых шагов рассуждения на непрерывные латентные токены снижает прозрачность рассуждения: часть шагов перестаёт быть текстом, который человек может прочитать и проверить, это может быть критично там, где важен аудит цепочки рассуждений модели, например в задачах с повышенными требованиями к безопасности и объяснимости.