Gambit ускоряет рассуждение ИИ-моделей лучевым поиском на уровне мыслей и экономит до 68,5% токенов

Gambit ускоряет рассуждение ИИ-моделей лучевым поиском на уровне мыслей и экономит до 68,5% токенов

У крупных рассуждающих моделей (LRM) качество ответа определяется не только размером и обучением, но и тем, сколько вычислений тратится уже во время вывода, вычислениями на этапе вывода (test-time compute). Проблема в том, что существующие способы расходовать этот бюджет крайне неэффективны, и вопрос «сколько вычислений выделить» на практике уже менее важен, чем вопрос «куда их направить». Авторы формализуют рассуждение на этапе вывода как задачу распределения ограниченного вычислительного бюджета между частичными траекториями рассуждения.

При фиксированном аппаратном бюджете ни один из существующих подходов не умеет активно направлять вычисления на самые перспективные частичные результаты. Параллельная выборка (parallel sampling) обрабатывает каждую траекторию независимо и упирается в серьёзные ограничения по памяти. Прореживание (pruning), то есть отбрасывание слабых вариантов, наоборот, оставляет оборудование недогруженным и недостаточно сильно меняет итоговое распределение ответов.

Чтобы преодолеть это противоречие, авторы предложили Gambit, алгоритм вывода, который выполняет лучевой поиск не на уровне отдельных токенов, а на уровне целых мыслей (в оригинале, thought-level beam search). Алгоритм периодически отсекает бесперспективные траектории рассуждения и сразу же ветвится от префиксов высокого качества; какие траектории считать перспективными, решает лёгкий модуль оценки, который анализирует скрытые состояния модели. За счёт этого вычисления динамически концентрируются на самых многообещающих траекториях, а оборудование остаётся загруженным постоянно, без простоев.

В экспериментах на нескольких моделях и бенчмарках авторы утверждают, что Gambit «строго превосходит» существующие базовые методы. При одинаковом аппаратном бюджете, по сравнению с методами прореживания, точность выросла до 6,7 процентного пункта на бенчмарке HMMT-24 и до 3,3 процентного пункта на AIME-25. Пропускная способность по завершению траекторий выросла более чем вдвое, конкретный метод сравнения для этой цифры в тексте не назван. А расход токенов по сравнению со стандартной параллельной выборкой снижается, экономия достигает 68,5%.

Ключевые факты

  • Gambit, алгоритм вывода, который выполняет лучевой поиск на уровне целых мыслей: периодически отсекает слабые траектории рассуждения и сразу ветвится от префиксов высокого качества.
  • Какие траектории считать перспективными, решает лёгкий модуль оценки, анализирующий скрытые состояния модели, это позволяет держать оборудование загруженным постоянно, без простоев.
  • При одинаковом аппаратном бюджете, по сравнению с методами прореживания, точность выросла до 6,7 процентного пункта на бенчмарке HMMT-24 и до 3,3 процентного пункта на AIME-25.
  • Пропускная способность по завершению траекторий выросла более чем вдвое, а расход токенов по сравнению со стандартной параллельной выборкой снизился, экономия достигает 68,5%.
  • По словам авторов, классические подходы упираются в разные ограничения: параллельная выборка независимых траекторий, в память, а прореживание слабых вариантов, в простаивающее оборудование.

Почему это важно

У современных рассуждающих моделей качество ответа во многом зависит не от размера модели, а от того, сколько вычислений потрачено уже во время вывода, вычислений на этапе вывода (test-time compute). Но чем больше такой бюджет, тем острее вопрос, куда его направить: наивное увеличение числа параллельных попыток упирается в память, а простое отбрасывание слабых вариантов оставляет оборудование недогруженным и слабо меняет итоговое распределение ответов. Gambit показывает, что при одном и том же аппаратном бюджете можно получить одновременно и более высокую точность, и меньший расход токенов, то есть сама стратегия распределения вычислений внутри вывода оказывается не менее важным рычагом, чем масштаб модели.

Кому это важно

Прежде всего инженерным командам, которые встраивают рассуждающие модели в свои продукты и платят за вывод: более эффективное распределение вычислений может снизить расход токенов и, соответственно, счёт за GPU или API, не жертвуя точностью ответов. Также это релевантно исследователям, которые занимаются распределением вычислений на этапе вывода и ищут альтернативу параллельной выборке и прореживанию, и авторам библиотек для вывода, которые решают, какие стратегии генерации встраивать по умолчанию.

Как это применить

В тексте источника не упоминаются ни публикация кода, ни готовая модель, ни библиотека, на данный момент это описание алгоритма, а не готовый инструмент. По сути метод встраивается в цикл генерации ответа рассуждающей модели и заменяет параллельную выборку или прореживание на периодическое отсечение слабых траекторий и ветвление от лучших префиксов под управлением лёгкого модуля оценки скрытых состояний. Командам, которые уже применяют распределение вычислений на этапе вывода в проде, стоит следить за возможной публикацией кода и проверить подход на своих бенчмарках, прежде чем встраивать его в продакшен.

Можно ли доверять

Материал, препринт на HuggingFace Papers, по сути зеркало arXiv; в самом тексте не указаны ни имена авторов, ни организация, ни дата публикации, ни статус рецензирования, источник об этом просто не сообщает. Приведённые цифры, это результаты собственных экспериментов авторов на «нескольких моделях и бенчмарках»; конкретные модели и бенчмарки за пределами HMMT-24 и AIME-25 в тексте не названы, независимой проверки или воспроизведения результатов источник не упоминает. Устройство «лёгкого модуля оценки» тоже не раскрыто, известно только, что он анализирует скрытые состояния модели.

Риски и подводные камни

Все цифры, самоотчёт авторов по их собственным экспериментам, без упоминания независимой проверки или рецензирования; сравнение приведено против «базовых методов» и «стандартной параллельной выборки» без указания конкретных реализаций. Заявленный прирост точности подкреплён числами только для двух бенчмарков по математике, HMMT-24 и AIME-25; авторы говорят об «обширных» тестах на нескольких моделях и бенчмарках в целом, но остальные в тексте не названы, и судить о переносимости результата за пределы этих двух математических тестов по источнику нельзя. Для показателя пропускной способности (более чем вдвое) в тексте не назван конкретный метод сравнения. Дополнительная нагрузка от самого модуля оценки скрытых состояний в цифрах экономии токенов отдельно не учтена.