When2Think ускорил рассуждения ИИ-моделей: точность выше на 10%, токенов меньше почти на 28%

Крупные модели рассуждения (LRM, Large Reasoning Models) часто тратят вычисления неэффективно: чрезмерно долго размышляют над лёгкими задачами и, наоборот, слишком быстро сдаются на сложных. Существующие способы борьбы с этим, единый штраф за длину рассуждения или жёсткая маршрутизация между режимами, решают проблему ценой компромисса: экономят вычисления на лёгких примерах, но теряют точность на сложных.
Авторы предлагают When2Think, фреймворк дообучения (post-training) гибридных моделей рассуждения, который распределяет вычисления в зависимости от сложности конкретной задачи. В основе, механизм Instance-level Difficulty-Aware Control (IDAC): он использует заранее посчитанную статистику по каждой задаче (точность и типичный расход токенов), чтобы регулировать глубину рассуждения именно для неё. IDAC сочетается с наградами на основе верификатора и с попакетно стандартизированными оценками преимущества, что позволяет обучать модель стабильно и без критика, то есть без отдельной обучаемой модели вознаграждения и без обращений к эталонной модели в процессе обучения.
По сути When2Think учит модель переключаться между «Системой 1» (быстрый прямой ответ без развёрнутого рассуждения, режим NoThink) и «Системой 2» (развёрнутое пошаговое рассуждение, режим Think), отвечать сразу на лёгких задачах и сохранять полноценное рассуждение на сложных.
На математических бенчмарках метод показал заметный выигрыш: на AIME24 показатель Pass@3 вырос на 10,0%, а расход токенов при этом снизился на 27,9% относительно базовой модели. На AIME25 When2Think достиг 40,0% по Pass@3, обойдя базовые методы сжатия рассуждений и маршрутизации без дообучения (routing-only).
Ключевые факты
- When2Think, фреймворк дообучения гибридных моделей рассуждения, который сам решает, когда отвечать сразу, а когда рассуждать долго.
- В основе, механизм IDAC: использует заранее посчитанную статистику точности и расхода токенов по задачам, чтобы регулировать глубину рассуждения.
- Обучение обходится без отдельной модели-критика и без обращений к эталонной модели в процессе тренировки.
- На AIME24 Pass@3 вырос на 10,0%, а расход токенов упал на 27,9% относительно базовой модели.
- На AIME25 When2Think достиг 40,0% по Pass@3, превзойдя методы сжатия рассуждений и маршрутизации без дообучения.
Почему это важно
Модели рассуждения тратят вычисления не там, где нужно: избыточно долго думают над простыми задачами и недостаточно, над сложными. When2Think решает это не ручной настройкой штрафов за длину и не жёсткой маршрутизацией, а адаптивным правилом, которое подстраивается под сложность конкретного примера, это снижает стоимость инференса без потери точности на трудных задачах.
Кому это важно
Командам, которые обучают или дообучают собственные модели рассуждения (LRM) и хотят сократить расход токенов на инференсе без потери качества. Также, исследователям в области обучения с подкреплением, которым интересна схема IDAC как способ стабильного дообучения без отдельной модели-критика.
Как это применить
When2Think, это не готовый продукт или API, а метод дообучения (post-training) гибридной модели рассуждения. Применить его можно на этапе RL-дообучения собственной reasoning-модели: механизм IDAC регулирует глубину рассуждения по заранее посчитанной статистике точности и расхода токенов для каждой задачи, комбинируясь с наградами от верификатора.
Можно ли доверять
Результаты получены на математических бенчмарках AIME24 и AIME25 и приведены как прямое сравнение с базовой моделью и альтернативными методами (сжатие, маршрутизация без дообучения). В тексте не указаны авторы и их принадлежность к организации, размер и идентичность базовой модели, дата публикации, а также сравнение на бенчмарках, отличных от AIME24 и AIME25, это ограничивает возможность независимо оценить общность результата.
Риски и подводные камни
Заявленный выигрыш проверен только на двух математических бенчмарках (AIME24, AIME25); неизвестно, переносится ли эффект на другие типы задач или на модели другого размера. Отсутствие данных о базовой модели и вычислительных затратах на само дообучение не позволяет оценить, насколько метод практичен для внедрения за пределами экспериментов авторов.