Исследователи извлекли скрытые цепочки рассуждений GPT-6 Astra и других моделей

Исследователи извлекли скрытые цепочки рассуждений GPT-6 Astra и других моделей

Рост возможностей передовых языковых моделей обычно объясняют улучшением их способности рассуждать, но проверить это напрямую нельзя: у закрытых систем «сырые» цепочки промежуточных рассуждений (chain-of-thought) скрыты от пользователя и исследователей. Авторы работы предложили способ обойти это ограничение: они регистрируют простой кастомный инструмент через стандартную функцию API моделей, и это побуждает модель externalize, выносить наружу, свои промежуточные рассуждения, которые иначе остались бы внутри.

Поскольку извлечённые таким образом рассуждения теоретически могут быть не подлинным ходом мысли модели, а постфактум-рационализацией уже готового ответа, авторы сначала проверили метод на открытых моделях: там извлечённые рассуждения можно напрямую сравнить с настоящей внутренней цепочкой рассуждений (native CoT), к которой у исследователей есть доступ. Убедившись в надёжности подхода, они распространили его на закрытые передовые модели, в том числе на модель GPT-6 Astra.

Ключевой результат: извлечённые рассуждения по качеству ответов совпадают с нативными рассуждениями моделей и заметно превосходят подход без явных рассуждений, это подтвердилось на задачах олимпиадной математики, естественных наук и генерации кода. Дальше авторы проанализировали, как именно передовые модели структурируют промежуточные рассуждения, по эффективности использования токенов, по типам шагов рассуждения и по деревьям возможных ходов рассуждения, и обнаружили систематические различия в том, как разные модели выносят наружу, сжимают и организуют свои рассуждения.

Отдельно отмечается поведение GPT-6 Astra: модель демонстрирует «экономную по токенам направленную» стратегию рассуждений, она раньше других выбирает верную траекторию решения, элементарные шаги решает «про себя», не показывая их, и выносит наружу только действительно важные для решения рассуждения. Авторы называют это «поведенческой линзой» на рассуждения передовых моделей, которая даёт дополнительную информацию помимо обычных баллов в бенчмарках.

Ключевые факты

  • Метод: регистрация кастомного инструмента через стандартную функцию API моделей заставляет их выносить наружу скрытые промежуточные рассуждения.
  • Метод сначала проверили на открытых моделях, сравнив извлечённые рассуждения с настоящей внутренней цепочкой рассуждений (native CoT), затем распространили на закрытые передовые модели, включая GPT-6 Astra.
  • Извлечённые рассуждения по качеству совпадают с нативными и заметно превосходят ответы без явных рассуждений, на задачах олимпиадной математики, естественных наук и генерации кода.
  • GPT-6 Astra демонстрирует экономную по числу токенов направленную стратегию: раньше выбирает верную траекторию решения, элементарные шаги решает «про себя» и выносит наружу только ключевые рассуждения.
  • Авторы предупреждают: извлечённые следы рассуждений теоретически могут быть постфактум-рационализацией, а не подлинным процессом мышления модели.

Почему это важно

Рост возможностей передовых языковых моделей принято объяснять улучшением их способности рассуждать, но проверить это у закрытых систем напрямую нельзя, их внутренние цепочки рассуждений скрыты. Предложенный метод даёт способ заглянуть внутрь этого процесса, не полагаясь только на итоговые баллы в бенчмарках.

Кому это важно

Исследователям интерпретируемости и безопасности ИИ, а также разработчикам моделей, которым важно понимать, действительно ли модель рассуждает перед ответом или лишь имитирует рассуждение постфактум.

Как это применить

Сам метод, регистрация кастомного инструмента через стандартную функцию API, может использоваться исследователями как техника для получения промежуточных рассуждений закрытых моделей там, где прямого доступа к ним нет.

Можно ли доверять

В тексте источника не указаны ни авторы, ни институции, ни дата публикации работы, а конкретные числовые результаты (баллы, проценты, число токенов) в доступном фрагменте не приведены, они, вероятно, есть в полной версии статьи. Сами авторы прямо оговаривают ограничение метода: извлечённые рассуждения теоретически могут оказаться постфактум-рационализацией, а не подлинным ходом мысли модели.

Риски и подводные камни

Главный риск, тот, о котором пишут сами авторы: нет гарантии, что вынесенные наружу рассуждения отражают реальный внутренний процесс модели, а не правдоподобное объяснение уже готового ответа. Кроме того, в доступном тексте не названы конкретные открытые модели, использованные для сравнения, и не приведены числовые показатели, что затрудняет независимую проверку масштаба заявленных улучшений.

«Эти следы рассуждений могут отражать постфактум-рационализацию, а не подлинное рассуждение.»

— авторы исследования