Метод FLEET ускоряет генерацию текста LLM втрое и повышает точность в кодинге

Большие языковые модели (LLM) часто повышают точность и стабильность ответов за счёт температурного сэмплирования, генерации нескольких вариантов ответа из распределения вероятностей с последующим агрегированием. Авторы работы указывают, что этот подход «безпамятный»: он не учитывает предыдущие генерации и их оценки, из-за чего с ростом числа сэмплов растёт доля семантически повторяющихся ответов, а отдача от каждого нового сэмпла падает.
Чтобы решить эту проблему, предложен метод FLEET, встраивающий механизм памяти прямо в процесс генерации. Каждая генерация представляется как разреженная траектория через состояния, чья энтропия превышает заданный порог; на основе этих траекторий вычисляются оценки полезности (utility scores) для каждого токена, которые корректируют логиты, то есть сырые предсказания модели перед выбором следующего токена.
По результатам тестов на бенчмарках FLEET достигает той же точности, что и базовый метод повторного сэмплирования, но втрое быстрее. На сложных задачах программирования метод существенно повышает точность: показатель LiveCodeBench Pass@32 вырастает с 59,9% до 66,2% при одинаковом вычислительном бюджете.
В протестированной конфигурации с жадным декодированием (greedy decoding) метод детерминирован и использует всего один калибровочный проход для настройки основных гиперпараметров, что, по словам авторов, требует лишь минимальных изменений в существующих пайплайнах LLM.
Ключевые факты
- FLEET заменяет «безпамятное» температурное сэмплирование механизмом памяти, отслеживающим разреженные траектории через состояния с высокой энтропией
- На основе траекторий метод вычисляет оценки полезности для каждого токена и корректирует ими логиты модели
- При равной точности с базовым методом повторного сэмплирования FLEET даёт трёхкратное ускорение
- На LiveCodeBench Pass@32 точность растёт с 59,9% до 66,2% при том же вычислительном бюджете
- В конфигурации с жадным декодированием метод детерминирован и требует лишь одного калибровочного прохода и минимальных изменений в существующих пайплайнах
Почему это важно
Температурное сэмплирование, стандартный способ повышать качество ответов LLM за счёт генерации нескольких вариантов, но с ростом числа сэмплов отдача падает: модель всё чаще повторяет уже сгенерированные варианты. FLEET предлагает способ учитывать историю генераций внутри самого процесса вывода, а не просто наращивать число независимых попыток, это принципиально иной подход к оптимизации инференса.
Кому это важно
Прежде всего это интересно разработчикам и исследователям, которые строят пайплайны инференса LLM с многократным сэмплированием, например, для задач программирования, где точность традиционно повышают перебором вариантов (Pass@k). Метод также релевантен командам, ищущим способы снизить вычислительные затраты на инференс без потери качества.
Как это применить
По описанию авторов, FLEET требует минимальных изменений существующих пайплайнов LLM: в конфигурации с жадным декодированием метод детерминирован и настраивается одним калибровочным проходом для определения основных гиперпараметров. Это делает интеграцию потенциально более простой, чем полную замену стратегии генерации.
Можно ли доверять
Материал, сжатая аннотация научной публикации, полный текст с деталями методологии, экспериментальной установки и авторами (в источнике имена и организация авторов не указаны) недоступен из аннотации. Заявленные цифры, трёхкратное ускорение и рост точности на LiveCodeBench, приведены авторами публикации и независимой проверки в этом материале не проходили.
Риски и подводные камни
Источник не указывает, какая именно конфигурация базового метода повторного сэмплирования (число сэмплов и параметры) использовалась для сравнения скорости, что затрудняет независимую оценку заявленного ускорения. Также не названы конкретные модели LLM, на которых проводились тесты, и не ясны сроки появления метода в открытых или промышленных пайплайнах.
«Этот безпамятный подход принципиально неоптимален: поскольку он не учитывает предыдущие генерации и их оценки, он производит всё большую долю семантически дублирующихся ответов по мере роста числа сэмплов, что приводит к убывающей отдаче»
— авторы исследования