Gambit ускоряет вывод рассуждающих ИИ-моделей и экономит токены

Масштабирование вычислений во время вывода (test-time compute), главный способ повысить качество ответов у крупных рассуждающих моделей (LRM), но существующие методы тратят эти вычисления крайне неэффективно. Вопрос сместился с «сколько вычислений выделить» на «куда их направить»: авторы формализуют задачу как распределение фиксированного аппаратного бюджета между частичными цепочками рассуждений. У обоих существующих подходов есть изъян: параллельный сэмплинг обрабатывает цепочки независимо друг от друга и упирается в память, а «вычитающая» обрезка (pruning) недогружает аппаратуру простоем и недостаточно активно смещает распределение выходов в сторону лучших вариантов.
Чтобы устранить этот компромисс, Лицзе Ян с соавторами представили Gambit, алгоритм вывода, который выполняет лучевой поиск (beam search) на уровне отдельных мыслей. Gambit периодически обрезает неперспективные цепочки рассуждений и сразу же ответвляется от лучших префиксов; направление вычислений задаёт лёгкий скорер, анализирующий скрытые состояния модели, за счёт этого вычисления динамически концентрируются на самых многообещающих цепочках, а аппаратура остаётся загруженной непрерывно, без простоев.
В экспериментах на нескольких моделях и бенчмарках Gambit, по утверждению авторов, строго превосходит существующие базовые методы. При одинаковых аппаратных ограничениях по сравнению с методами обрезки точность выросла до 6,7 процентных пунктов на бенчмарке HMMT-24 и до 3,3 процентных пунктов на AIME-25; пропускная способность по завершению цепочек рассуждений выросла более чем вдвое по сравнению с базовыми методами; а расход токенов по сравнению со стандартным параллельным сэмплингом сократился до 68,5%.
Ключевые факты
- Gambit, новый алгоритм вывода для рассуждающих моделей (LRM): лучевой поиск на уровне отдельных мыслей, который периодически обрезает слабые цепочки рассуждений и ответвляется от лучших префиксов.
- Направление вычислений на перспективные цепочки задаёт лёгкий скорер, анализирующий скрытые состояния модели, при этом аппаратура остаётся загруженной непрерывно.
- На HMMT-24 точность выросла до 6,7 процентных пунктов, на AIME-25, до 3,3 процентных пунктов по сравнению с методами обрезки при одинаковых аппаратных ограничениях.
- Пропускная способность по завершению цепочек рассуждений выросла более чем вдвое, а расход токенов сократился до 68,5% по сравнению со стандартным параллельным сэмплингом.
- Метод проверен на нескольких моделях и бенчмарках; авторы утверждают, что Gambit строго превосходит существующие базовые подходы.
Почему это важно
Масштабирование вычислений при выводе, главный рычаг качества у рассуждающих моделей, но существующие способы тратить эти вычисления работают крайне неэффективно: вопрос сместился с «сколько тратить» на «куда направлять». Параллельный сэмплинг обрабатывает цепочки рассуждений независимо и упирается в память; обрезка неперспективных цепочек недогружает аппаратуру простоем и недостаточно смещает результат в сторону лучших вариантов. Gambit предлагает третий путь, динамически концентрировать вычисления на лучших цепочках, сохраняя аппаратуру постоянно загруженной.
Кому это важно
Разработчикам и исследователям, которые строят или эксплуатируют рассуждающие модели (LRM) и оптимизируют вывод при фиксированном аппаратном бюджете: им нужен способ не наращивать вычисления, а тратить их на те цепочки рассуждений, что дают отдачу.
Как это применить
Gambit, алгоритм вывода: он периодически обрезает неперспективные цепочки рассуждений и сразу ответвляется от лучших префиксов, используя лёгкий скорер, анализирующий скрытые состояния модели, чтобы непрерывно перенаправлять вычисления на самые многообещающие варианты. Заявленный эффект, рост точности до 6,7 п.п. на HMMT-24 и до 3,3 п.п. на AIME-25 по сравнению с методами обрезки, более чем двукратный рост пропускной способности и сокращение расхода токенов до 68,5% по сравнению со стандартным параллельным сэмплингом.
Можно ли доверять
Это препринт (arXiv 2608.08020); в самом тексте аннотации не указаны авторы, организации и дата публикации, а поле «автор» у материала (Лицзе Ян), это, вероятно, только первый автор, не полный состав. Не раскрыты детали устройства скорера, частота обрезки и ветвления, ширина луча, а из бенчмарков в самом тексте названы только HMMT-24 и AIME-25, независимого воспроизведения результатов пока нет.
Риски и подводные камни
Заявленные цифры прироста, это максимум («до»), а не гарантированный результат на любой задаче. Метод добавляет постоянные накладные расходы на скоринг скрытых состояний, что может ограничивать выигрыш за пределами протестированных бенчмарков. Без раскрытых деталей реализации сторонним командам будет сложно самостоятельно воспроизвести заявленные цифры.