When2Think ускорил рассуждения ИИ-моделей: точность выше на 10%, токенов меньше почти на 28%

When2Think ускорил рассуждения ИИ-моделей: точность выше на 10%, токенов меньше почти на 28%

Крупные модели рассуждения (LRM, Large Reasoning Models) часто тратят вычисления неэффективно: чрезмерно долго размышляют над лёгкими задачами и, наоборот, слишком быстро сдаются на сложных. Существующие способы борьбы с этим, единый штраф за длину рассуждения или жёсткая маршрутизация между режимами, решают проблему ценой компромисса: экономят вычисления на лёгких примерах, но теряют точность на сложных.

Авторы предлагают When2Think, фреймворк дообучения (post-training) гибридных моделей рассуждения, который распределяет вычисления в зависимости от сложности конкретной задачи. В основе, механизм Instance-level Difficulty-Aware Control (IDAC): он использует заранее посчитанную статистику по каждой задаче (точность и типичный расход токенов), чтобы регулировать глубину рассуждения именно для неё. IDAC сочетается с наградами на основе верификатора и с попакетно стандартизированными оценками преимущества, что позволяет обучать модель стабильно и без критика, то есть без отдельной обучаемой модели вознаграждения и без обращений к эталонной модели в процессе обучения.

По сути When2Think учит модель переключаться между «Системой 1» (быстрый прямой ответ без развёрнутого рассуждения, режим NoThink) и «Системой 2» (развёрнутое пошаговое рассуждение, режим Think), отвечать сразу на лёгких задачах и сохранять полноценное рассуждение на сложных.

На математических бенчмарках метод показал заметный выигрыш: на AIME24 показатель Pass@3 вырос на 10,0%, а расход токенов при этом снизился на 27,9% относительно базовой модели. На AIME25 When2Think достиг 40,0% по Pass@3, обойдя базовые методы сжатия рассуждений и маршрутизации без дообучения (routing-only).

Ключевые факты

  • When2Think, фреймворк дообучения гибридных моделей рассуждения, который сам решает, когда отвечать сразу, а когда рассуждать долго.
  • В основе, механизм IDAC: использует заранее посчитанную статистику точности и расхода токенов по задачам, чтобы регулировать глубину рассуждения.
  • Обучение обходится без отдельной модели-критика и без обращений к эталонной модели в процессе тренировки.
  • На AIME24 Pass@3 вырос на 10,0%, а расход токенов упал на 27,9% относительно базовой модели.
  • На AIME25 When2Think достиг 40,0% по Pass@3, превзойдя методы сжатия рассуждений и маршрутизации без дообучения.

Почему это важно

Модели рассуждения тратят вычисления не там, где нужно: избыточно долго думают над простыми задачами и недостаточно, над сложными. When2Think решает это не ручной настройкой штрафов за длину и не жёсткой маршрутизацией, а адаптивным правилом, которое подстраивается под сложность конкретного примера, это снижает стоимость инференса без потери точности на трудных задачах.

Кому это важно

Командам, которые обучают или дообучают собственные модели рассуждения (LRM) и хотят сократить расход токенов на инференсе без потери качества. Также, исследователям в области обучения с подкреплением, которым интересна схема IDAC как способ стабильного дообучения без отдельной модели-критика.

Как это применить

When2Think, это не готовый продукт или API, а метод дообучения (post-training) гибридной модели рассуждения. Применить его можно на этапе RL-дообучения собственной reasoning-модели: механизм IDAC регулирует глубину рассуждения по заранее посчитанной статистике точности и расхода токенов для каждой задачи, комбинируясь с наградами от верификатора.

Можно ли доверять

Результаты получены на математических бенчмарках AIME24 и AIME25 и приведены как прямое сравнение с базовой моделью и альтернативными методами (сжатие, маршрутизация без дообучения). В тексте не указаны авторы и их принадлежность к организации, размер и идентичность базовой модели, дата публикации, а также сравнение на бенчмарках, отличных от AIME24 и AIME25, это ограничивает возможность независимо оценить общность результата.

Риски и подводные камни

Заявленный выигрыш проверен только на двух математических бенчмарках (AIME24, AIME25); неизвестно, переносится ли эффект на другие типы задач или на модели другого размера. Отсутствие данных о базовой модели и вычислительных затратах на само дообучение не позволяет оценить, насколько метод практичен для внедрения за пределами экспериментов авторов.