Статья на arXiv призвала не называть токены ИИ «мышлением»

Позиционная статья («position paper»), выложенная на arXiv (arxiv.org/abs/2504.09762), возражает против того, чтобы промежуточные токены, текст, который языковая модель генерирует перед итоговым ответом, называли «трассами рассуждений» (reasoning traces) или даже «трассами мышления» (thinking traces). Генерация таких промежуточных токенов (ITG, intermediate token generation) уже стала стандартным приёмом: модель сначала выдаёт дополнительный текст и только потом, решение, и это стало обычным способом повышать качество ответов языковых моделей на задачах, где требуются рассуждения.

По мнению авторов, называть эти токены «рассуждениями» или «мышлением», значит незаметно очеловечивать модель: складывается впечатление, что перед нами шаги, которые сделал бы человек, решая сложную задачу, и что через эти токены пользователь получает прозрачное окно в то, как модель «думает» на самом деле. Авторы настаивают: это не безобидное упрощение языка, а по-настоящему вредная ошибка, она искажает представление о природе языковых моделей и о том, как их правильно применять, и уже привела к сомнительным исследованиям, построенным на этой ложной предпосылке. Статья прямо призывает сообщество отказаться от подобной антропоморфизации промежуточных токенов.

При этом сама аннотация не называет конкретных примеров «сомнительных исследований»: среди девяти авторов работы первым значится Суббарао Камбхампати, указанный в истории подачи материала также как отправитель на arXiv. У работы уже четыре версии, с 14 апреля 2025 года (первая) по 9 июня 2026 года (последняя), а обсуждение на Hacker News набрало 200 голосов и 122 комментария примерно за 41 час.

Ключевые факты

  • Позиционная статья на arXiv (2504.09762) призывает не называть промежуточные токены языковых моделей «трассами рассуждений» или «трассами мышления».
  • Генерация промежуточных токенов (ITG), модель выдаёт текст до итогового ответа, стала стандартным способом повышать качество ответов на задачах, требующих рассуждений.
  • По мнению авторов, ярлыки «рассуждения»/«мышление» очеловечивают модель, создавая у пользователя иллюзию, что через эти токены виден настоящий ход её мыслей.
  • Авторы утверждают, что эта метафора уже привела к сомнительным исследованиям, и прямо призывают сообщество отказаться от такой антропоморфизации.
  • У статьи девять авторов, первый из которых, Суббарао Камбхампати; аннотация не приводит конкретных примеров «сомнительных исследований», а работа прошла четыре редакции, с 14 апреля 2025 по 9 июня 2026 года.

Почему это важно

Генерация промежуточных токенов перед итоговым ответом, когда модель как бы «рассуждает вслух», прежде чем дать решение, стала стандартным способом повышать качество ответов языковых моделей на сложных задачах. Проблема, которую поднимает статья, не в самой технике, а в том, как о ней говорят: называя эти токены «трассами рассуждений» или «трассами мышления», исследователи, компании и журналисты незаметно приписывают модели человеческий мыслительный процесс. У читателя и даже у части исследователей возникает ощущение, что перед ними прозрачная запись того, как ИИ на самом деле «думает», а не просто текст, который статистически помогает модели выдать более точный ответ. Авторы настаивают, что эта путаница, не безобидная фигура речи: она меняет то, как сообщество ставит эксперименты и интерпретирует результаты, и, по их словам, уже привела к сомнительным исследованиям, построенным на ложной предпосылке, будто видимые токены достоверно отражают внутренний процесс модели.

Кому это важно

В первую очередь, исследователям интерпретируемости языковых моделей: если промежуточные токены принимать за буквальный отчёт о работе модели, а не за один из артефактов её вычислений, выводы экспериментов могут опираться на ошибочную посылку. Также это касается команд, которые встраивают в свои продукты панели «хода мыслей» или «рассуждений» модели для конечных пользователей, формулировки в интерфейсе задают ожидания, которым сама модель может не соответствовать. И, наконец, это важно для всех, кто пишет и говорит об ИИ, от научных статей до популярных текстов, поскольку именно такой словарь, по мнению авторов, закрепляет неверное представление о природе этих систем.

Как это применить

Практический вывод статьи: к тексту, который модель генерирует перед финальным ответом, стоит относиться как к промежуточному техническому результату, повышающему качество итогового ответа, а не как к достоверной стенограмме «мыслей» модели. Для исследователей это значит, не принимать содержание промежуточных токенов за прямое доказательство того, как модель решает задачу, и отдельно проверять, действительно ли видимый текст соответствует внутренним вычислениям, прежде чем делать на этом выводы. Для продуктовых команд и авторов текстов об ИИ, избегать формулировок, которые прямо обещают пользователю доступ к «мышлению» или «рассуждениям» системы, если такой гарантии на самом деле нет.

Можно ли доверять

Это позиционная статья (position paper), развёрнутый аргумент авторов, а не отчёт о новом эксперименте или наборе данных; сама аннотация прямо называет себя таковой. При этом она не приводит ни одного конкретного примера «сомнительных исследований», о которых говорит, ни примеров антропоморфных формулировок в реальных продуктах или публикациях, читателю предлагается общий тезис без разбора конкретных случаев. Площадка публикации указана: в карточке arXiv отмечено «Appears in ICML 2026», работа принята на рецензируемую конференцию ICML 2026, хотя текст остаётся доступен на arXiv. Авторы названы, их девять, первым в списке значится Суббарао Камбхампати, который также указан в истории подачи материала как отправитель («From:»). При этом статья прошла уже четыре редакции больше чем за год (с апреля 2025 по июнь 2026), а обсуждение на Hacker News набрало 200 голосов и 122 комментария примерно за 41 час, это говорит о живом интересе сообщества, но не подтверждает сами тезисы статьи.

Риски и подводные камни

Главный риск, статья не даёт материала для независимой проверки: без конкретных примеров «сомнительных исследований» или конкретных случаев антропоморфных формулировок читателю остаётся судить только по общему аргументу авторов, а не по разобранным случаям. Кроме того, это призыв к сообществу изменить словарь и способ говорить о технике, а не техническое исправление, а значит, его влияние зависит от того, подхватят ли этот призыв авторы будущих статей, продуктовые команды и журналисты, что происходит медленно и неравномерно, тем более что термины «reasoning trace» и «thinking trace» уже прочно закрепились в этой области. Наконец, аннотация не говорит, предлагают ли авторы конкретную замену этим терминам, без неё призыв «не называйте так» проще принять на словах, чем реализовать на практике.

«Эта антропоморфизация, не безобидная метафора, а по-настоящему опасная вещь: она искажает представление о природе этих моделей и о том, как их эффективно использовать, и ведёт к сомнительным исследованиям.»

— авторы статьи (arXiv 2504.09762)