AdaptiveSpec делает генерацию LLM до 56% быстрее EAGLE-3, без дообучения
Спекулятивное декодирование, стандартный способ ускорить генерацию текста у больших языковых моделей (LLM) без изменения их весов: лёгкая модель-черновик предлагает несколько токенов вперёд, а основная (целевая) модель проверяет их за один проход. Широко используемые черновики с древовидной структурой кандидатов, такие как EAGLE-3, обычно жёстко фиксируют два параметра: строгое правило проверки (черновой токен принимается, только если он в точности совпадает с тем, что выбрала бы целевая модель) и статическую форму дерева кандидатов, её размер и ветвление не меняются по ходу генерации. Прежние попытки смягчить эти ограничения решали лишь одну из двух проблем и только при дополнительных допущениях: одни работы жертвовали точностью проверки ради длинных черновых цепочек, другие адаптировали форму дерева, но лишь в рамках фиксированного бюджета токенов.
Авторы предлагают AdaptiveSpec, метод, который не требует дополнительного обучения моделей и адаптирует оба параметра одновременно, на каждом шаге генерации, используя сигналы, которые декодирование и так уже вычисляет. Первый механизм, пошаговое правило по вероятностям: если токен, предложенный черновиком, не совпал с выбором целевой модели, он всё равно принимается, когда отношение вероятности целевой модели для этого токена к её же наивысшей (топ-1) вероятности превышает заданный порог; правило работает одинаково независимо от длины черновой цепочки и от архитектуры самого черновика. Второй механизм, пошаговая политика дерева: она напрямую меняет глубину, ширину и число узлов дерева кандидатов на основе объединённого сигнала, уверенности черновика в своём топ-1 токене и скользящей истории того, как часто черновик и целевая модель соглашались друг с другом на последних шагах. За счёт этого общее число предлагаемых токенов может расти или сокращаться, а не просто перераспределяться внутри фиксированного бюджета. Оба механизма действуют на независимых, не пересекающихся параметрах и усиливают друг друга: эффект от их совместного применения складывается, а не гасится.
Метод реализован поверх SGLang, реального движка промышленного уровня для обслуживания LLM, а не только исследовательского прототипа. По сравнению с EAGLE-3, который авторы называют современным методом авторегрессивного спекулятивного декодирования, AdaptiveSpec повышает пропускную способность генерации до 56%. При этом точность решения задач, по совокупности тестов GSM8K, MATH-500 и HumanEval на трёх целевых моделях (DeepSeek-R1-Distill-Llama-8B, Llama-3.1-8B-Instruct и Qwen3-8B), сохраняется в диапазоне от 93% до полностью безошибочного уровня относительно обычного, не ускоренного декодирования. Разбивки по отдельным моделям или тестам авторы не приводят, только эти агрегированные диапазоны.
Ключевые факты
- AdaptiveSpec, метод спекулятивного декодирования без дообучения моделей: в отличие от EAGLE-3, он на каждом шаге генерации адаптирует сразу два решения, правило проверки токенов и форму дерева кандидатов, а не одно из них.
- Пошаговое правило проверки принимает несовпавший токен, предложенный черновиком, если отношение вероятности целевой модели для этого токена к её же топ-1 вероятности превышает порог, независимо от длины черновой цепочки и архитектуры черновика.
- Пошаговая политика дерева меняет глубину, ширину и число узлов дерева кандидатов по сигналу из уверенности черновика и скользящей истории его совпадений с целевой моделью, общее число предлагаемых токенов может расти или падать, а не только перераспределяться.
- На движке SGLang метод повышает пропускную способность генерации до 56% относительно EAGLE-3, сохраняя точность решения задач в диапазоне от 93% до полностью безошибочного уровня на тестах GSM8K, MATH-500 и HumanEval и трёх моделях (DeepSeek-R1-Distill-Llama-8B, Llama-3.1-8B-Instruct, Qwen3-8B).
- Оба механизма действуют на независимых параметрах и усиливают друг друга, эффект от их совместного применения складывается, а не взаимно гасится.
Почему это важно
Спекулятивное декодирование, один из немногих способов ускорить генерацию текста у LLM без изменения весов модели и без потери точности, поэтому оно стало стандартом в промышленных системах обслуживания. Но широко используемые черновики с деревом кандидатов, такие как EAGLE-3, жёстко фиксируют два параметра, правило проверки токенов и форму дерева кандидатов, и тем самым недобирают возможного ускорения. AdaptiveSpec показывает, что оба параметра можно адаптировать на каждом шаге генерации, используя сигналы, которые декодирование и так уже вычисляет, без дополнительного обучения моделей и без нового движка с нуля. Это даёт реальный прирост пропускной способности (до 56% относительно EAGLE-3) почти без потери точности решения задач, то есть почти бесплатное с инженерной точки зрения ускорение уже развёрнутых систем.
Кому это важно
В первую очередь, инженерам, которые обслуживают LLM в проде и считают стоимость и задержку генерации на запрос: команды, эксплуатирующие движки для обслуживания моделей (такие как SGLang), и все, у кого уже настроен конвейер спекулятивного декодирования на черновиках в духе EAGLE. Во вторую очередь, исследователям и инженерам, которые сами занимаются алгоритмами ускорения генерации текста: метод даёт конкретный, воспроизводимый способ совместить адаптивную проверку токенов и адаптивную форму дерева кандидатов.
Как это применить
AdaptiveSpec, не отдельный продукт, а два дополнительных механизма поверх уже существующей пары «черновик + целевая модель»: пошаговое правило проверки по соотношению вероятностей и пошаговая политика формы дерева кандидатов. Оба работают во время инференса, на сигналах, которые движок и так вычисляет (вероятности целевой модели, уверенность черновика, история недавних совпадений), поэтому дообучать ни черновик, ни целевую модель не нужно. Авторы реализовали и проверили метод на движке SGLang, это значит, что такая интеграция технически осуществима в реальном, а не только лабораторном стеке обслуживания. Проверка прошла на трёх целевых моделях (DeepSeek-R1-Distill-Llama-8B, Llama-3.1-8B-Instruct, Qwen3-8B) и трёх тестах (GSM8K, MATH-500, HumanEval), что говорит скорее в пользу переносимости метода между моделями, чем о пользе для какой-то одной конкретной модели.
Можно ли доверять
Это препринт на arXiv: доступный текст, аннотация к статье, и все числа в ней, самоотчёт авторов, без подтверждения независимым рецензированием или сторонним воспроизведением. В тексте нет имён авторов и организаций, поэтому в пересказе они не названы. Приведённые цифры, агрегированные диапазоны сразу по трём тестам и трём моделям, а не результаты по каждой комбинации отдельно: 56%, верхняя граница ускорения, а не типичное значение, и на какой именно модели и тесте она достигнута, не сообщается. Абсолютных цифр пропускной способности (токенов в секунду), а также описания оборудования и конфигурации запуска в тексте тоже нет, только относительный прирост к EAGLE-3. Это не делает результат недостоверным, но означает, что независимо проверить конкретные числа по опубликованному тексту нельзя.
Риски и подводные камни
Источник данных один: числа известны только со слов авторов препринта, без стороннего воспроизведения. Диапазон точности «от 93% до полностью безошибочного уровня» означает, что на части моделей или тестов метод всё же немного теряет в точности относительно обычного декодирования, какая именно комбинация попадает в нижнюю границу диапазона, из текста не ясно. Сравнение приведено только с EAGLE-3; насколько AdaptiveSpec лучше или хуже другого упомянутого в статье направления работ, адаптивной формы дерева при фиксированном бюджете токенов, числами не подтверждено. Наконец, результат получен на одном движке (SGLang) и на моделях уровня 8B, перенос этих цифр на другие движки, более крупные модели или другое оборудование не гарантирован.