Inco AI выпустила DFlash 2, на 16, 25% быстрее прежнего DFlash

Компания Inco AI выпустила DFlash 2, обновление своей технологии спекулятивного декодирования DFlash для ускорения вывода (инференса) больших языковых моделей. Спекулятивное декодирование, техника, при которой небольшая черновая модель заранее угадывает блок из нескольких токенов, а целевая модель проверяет весь блок за один проход: удачные догадки принимаются, неудачные отбрасываются, и один проход даёт сразу несколько токенов вместо одного. Обычно черновая модель сама работала последовательно, по одному токену за раз; оригинальный DFlash, который Inco AI выпустила в январе, сделал параллельным и этот шаг, черновая модель предсказывает сразу весь блок, все позиции одновременно, за один проход. С тех пор DFlash встроили в основные движки инференса, SGLang, vLLM, TensorRT-LLM и llama.cpp; NVIDIA сообщала о приросте пропускной способности до 15 раз на GPU Blackwell, Google, о трёхкратном приросте числа токенов в секунду на TPU. Продакшен-эндпоинт Kimi K2.7 Code от CoreWeave, по данным Artificial Analysis, самый быстрый для этой модели, использует DFlash по умолчанию. Официальные черновые модели на основе DFlash для собственных моделей уже выпустили Meta (для Muse Glimmer), Poolside (для Laguna), Xiaomi (для MiMo-V2.5-Pro) и NVIDIA (для Nemotron 3.5 Lightning); черновые модели для сторонних моделей опубликовали также NVIDIA, Red Hat и компания Modal, чей пост «Speculation Is All You Need» о важности спекулятивного декодирования для быстрого обслуживания запросов Inco AI отдельно благодарит за вдохновение и обсуждения. На Hugging Face модели DFlash по состоянию на август 2026 года скачали более 3,5 млн раз.
DFlash 2 наращивает тот же параллельный подход. По данным компании, обновление даёт более 20% дополнительного принятого объёма с каждого проверочного прохода при росте задержки цикла «черновик, проверка» примерно на 1%, и без изменения самого результата: он математически идентичен тому, что выдала бы обычная модель. На проверенных бенчмарках прирост составил от 16% до 25%. Например, с новой черновой моделью для Qwen3.8-27B движок SGLang выдаёт в 2,7, 3,4 раза больше токенов в секунду, чем при обычном авторегрессионном (последовательном) декодировании, при размере батча 1.
Первое из двух улучшений, лёгкий селектор пути (path selector). Поскольку DFlash предсказывает каждую позицию блока независимо и параллельно, отдельные догадки не всегда складываются в связный фрагмент, и такой блок обрывается раньше времени при проверке. Команда Inco AI показала, что нужная информация у DFlash уже есть: для первой позиции блока лучший вариант модели верен в 85,4% случаев, а правильный токен вообще есть среди её топ-16 кандидатов в 99,5% случаев. «Оракул», который всегда безошибочно выбирал бы нужный токен из этих 16 кандидатов, поднял бы среднюю длину принятого блока за один проход (acceptance length) с фактических 4,27 токена у DFlash до 6,79, и этот разрыв, по словам компании, целиком объясняется не качеством догадок, а качеством выбора между ними. DFlash 2 сохраняет топ-16 кандидатов на каждой позиции и оценивает каждую соседнюю пару: собственную уверенность (логит) DFlash в токене плюс отдельную оценку того, насколько хорошо один кандидат продолжает другой, по компактным 256-мерным векторным представлениям токенов, которые сопоставляются через контекстно-зависимый фильтр (в оригинале, context gate), решающий, какая часть сопоставления учитывается. По характеристике самой компании, это низкоранговое билинейное внимание (attention) между соседними кандидатами. Вся оценка считается параллельно, за один проход и без дополнительного прогона через целевую модель; последовательным остаётся только финальный проход по уже посчитанным оценкам, выбор конкретной цепочки токенов. По данным Inco AI, такой селектор увеличивает длину принятого блока на 0,34, 0,47 токена и превосходит альтернативную коррекцию в духе DSpark примерно при 40-кратно меньшем числе параметров и 16-кратно меньших накладных расходах по задержке. До уровня «оракула» (6,79) селектору по-прежнему далеко, компания считает, что здесь есть куда расти дальше.
Второе улучшение устраняет то, что в Inco AI назвали «затуханием к концу блока» (suffix decay): даже при идеальном выборе кандидатов точность падает к концу блока, с 99,5% на первой позиции до 87,8% на последней, потому что ближе к концу блока среди кандидатов попросту всё меньше правильных вариантов, и никакой селектор это не исправит. Сравнение черновых моделей DFlash с 3, 5 и 15 слоями показало: на первой позиции блока все три версии почти неотличимы, а расхождение нарастает к его концу, то есть дополнительные слои помогают в основном ближе к концу блока. Но добавлять слои целиком, грубое решение: оно наращивает возможности модели везде, включая начало блока, где это почти не нужно, и съедает выигрыш в скорости, ради которого DFlash и придуман, десять дополнительных слоёв поднимают задержку цикла на 15,2%. Изучив, куда уходит внимание (attention) модели, команда обнаружила: доля внимания, которая уходит на связи внутри блока, а не на чтение контекста перед ним, падает с 30% в первом слое до 8% в пятом, то есть с моделированием внутренних зависимостей блока штатное внимание справляется всё хуже. Поэтому вместо новых слоёв трансформера Inco AI выделила эту работу в отдельный лёгкий модуль, динамическую свёртку, предложенную по образцу более ранних работ Canon Layers, Dynamic Short Convolutions и Convolution for Large Language Models: она смотрит на текущую позицию и на одну позицию назад с весами, зависящими от содержимого, и встраивается до и после каждого блока внимания и полносвязного слоя. Такая свёртка локальна и не имеет состояния, поэтому не требует изменений в самом внимании, в финальном слое предсказания токена или в проверке. Она добавляет пятислойному DFlash всего 16,5 млн параметров (около 3% от размера самой модели) и приближает его качество к 15-слойной версии, но обходится всего в 0,7% дополнительной задержки цикла против 15,2% у десяти лишних слоёв; доля внимания, уходящая на связи внутри блока в 4-м и 5-м слоях, после добавления свёртки падает с 9,4% до 0,5%, почти вся эта работа переходит к свёртке.
Вместе селектор и свёртка добавляют пятислойному DFlash лишь 1,3% задержки цикла, именно эта точная цифра стоит за округлённым «около 1%» из вводного абзаца поста. По утверждению Inco AI, DFlash 2 обходит все протестированные варианты на каждом бенчмарке: в среднем он даёт на 1,05 токена за проход больше, чем оригинальный DFlash (прирост 21%), и на 0,48 токена больше, чем сравниваемый вариант на основе DSpark. На тесте MATH-500 DFlash 2 держит точность около 86% вплоть до последней позиции блока, тогда как все альтернативы к концу блока отстают на 6, 9 процентных пунктов. Одновременно с постом Inco AI выпустила на Hugging Face две новые черновые модели DFlash 2, для Qwen3.8-27B и для Muse Glimmer от Meta. Для Qwen3.8-27B их сравнили со штатным механизмом MTP, который поставляется вместе с моделью, и с драфтером на основе DSpark; для Muse Glimmer, с официальным драфтером на DFlash первой версии, который уже поставляет Meta, и тоже с драфтером на основе DSpark. По словам компании, на обеих моделях новый драфтер в среднем опережает DSpark-вариант больше чем на целый токен за проход и обходит штатный вариант каждой модели. В пересчёте на пропускную способность это 2,7, 3,4 раза больше токенов в секунду, чем при авторегрессионном декодировании, для Qwen3.8-27B и 3,1, 4,6 раза, для Muse Glimmer; более детальную разбивку по типам задач и уровню конкурентности запросов Inco AI приводит в карточках обеих моделей на Hugging Face.
DFlash 2 уже работает в основных движках инференса и не требует их доработки. Для локального запуска на Apple Silicon Inco AI описывает путь через oMLX: поставить сборку oMLX с поддержкой DFlash 2, скачать целевую модель через встроенный загрузчик, затем в менеджере моделей включить DFlash, указать черновую модель incoai/Qwen3.8-27B-DFlash2, включить квантование черновой модели, выставить размер блока 5 и режим проверки dflash, сохранить настройки и загрузить целевую модель. Для модели, под которую готового драфтера ещё нет, включая собственные дообученные версии, Inco AI предлагает написать напрямую на contact@inco.ai. В компании объясняют интерес к скорости декодирования масштабом ИИ-агентов: агенты расходуют токены на порядки быстрее чат-ботов, и скорость декодирования стоит за каждым из этих токенов. По расчётам Inco AI, DFlash 2 работает почти втрое быстрее авторегрессионного декодирования при примерно втрое меньшем расходе вычислений на токен и без изменения результата; в компании называют DFlash 2 только первым элементом более широкого стека для обслуживания вывода, который они продолжают строить. Стоит учитывать: все цифры в посте, собственные измерения Inco AI; сравнительные драфтеры DFlash и DSpark для сводного сравнения по бенчмаркам компания обучала сама «в одинаковых условиях», а вариант MTP поставляется независимо, вместе с моделью; DSpark-варианты для двух выпущенных сегодня драфтеров, готовые реализации сообщества.
Ключевые факты
- Inco AI выпустила DFlash 2, обновление драфтера для спекулятивного декодирования DFlash: селектор пути и модуль локальной свёртки дают на 16, 25% больше принятых токенов за проверочный проход (в среднем 21%, то есть 1,05 токена) при росте задержки цикла всего на 1,3% и без изменения результата генерации.
- В тот же день на Hugging Face вышли две готовые черновые модели DFlash 2, для Qwen3.8-27B (2,7, 3,4× пропускной способности против авторегрессионного декодирования) и для Muse Glimmer от Meta (3,1, 4,6×); обе в среднем обгоняют штатный драфтер своей модели и сравнительный вариант на основе DSpark больше чем на целый токен за проход.
- Селектор пути использует то, что верный токен почти всегда есть среди топ-16 кандидатов DFlash (99,5% случаев на первой позиции блока против 85,4% для лучшей единичной догадки); идеальный выбор из этих кандидатов поднял бы длину принятого блока с 4,27 до 6,79 токена, и новый селектор закрывает часть этого разрыва при примерно 40-кратно меньшем числе параметров и 16-кратно меньших накладных расходах по задержке, чем у сравнимой коррекции DSpark.
- Чтобы устранить «затухание к концу блока» (точность падает с 99,5% до 87,8% от начала блока к его концу даже при идеальном выборе), Inco AI добавила лёгкую динамическую свёртку на 16,5 млн параметров вместо новых слоёв трансформера, она приближает пятислойный DFlash к качеству 15-слойной версии, добавляя лишь 0,7% задержки против 15,2% у десяти лишних слоёв.
- Оригинальный DFlash, выпущенный Inco AI в январе, за семь месяцев встроили в SGLang, vLLM, TensorRT-LLM и llama.cpp; его скачали с Hugging Face свыше 3,5 млн раз, а официальные драфтеры на его основе для своих моделей уже выпустили Meta, Poolside, Xiaomi и NVIDIA, DFlash 2 компания называет первым элементом более широкого стека для обслуживания вывода LLM.
Почему это важно
Спекулятивное декодирование, один из немногих способов ускорить вывод большой языковой модели, не меняя её результат: небольшая черновая модель угадывает блок токенов, а целевая модель проверяет его за один проход вместо генерации по одному токену. Оригинальный DFlash, который Inco AI выпустила в январе, сделал параллельной и саму черновую модель, и, по собственным словам компании, всего за семь месяцев стал фактическим отраслевым стандартом: его используют все основные движки инференса, на нём построены официальные драфтеры Meta, Poolside, Xiaomi и NVIDIA, а на Hugging Face его модели скачали свыше 3,5 млн раз. DFlash 2 показывает, что в этой уже отлаженной схеме остаётся резерв: за счёт лучшего выбора между уже предсказанными кандидатами и отдельного модуля для связей внутри блока компания получает на 16, 25% больше принятых токенов за проход почти бесплатно, рост задержки на 1, 1,3%. Это особенно важно на фоне того, что компания называет «эрой агентов»: ИИ-агенты тратят на порядки больше токенов, чем чат-боты, и скорость декодирования напрямую определяет стоимость и время их работы.
Кому это важно
В первую очередь, тем, кто уже обслуживает вывод LLM через SGLang, vLLM, TensorRT-LLM или llama.cpp: DFlash 2 включается в ту же схему, что и оригинальный DFlash, и не требует переделки движка. Отдельно, облачным и инференс-провайдерам вроде CoreWeave, NVIDIA и Google, для которых пропускная способность GPU и TPU, прямая статья расходов, и командам, которые строят ИИ-агентов и поэтому расходуют токены на порядки быстрее чат-ботов. Прямо сегодня технология полезна пользователям двух конкретных моделей, Qwen3.8-27B и Muse Glimmer от Meta, для которых готовые драфтеры DFlash 2 уже опубликованы; для остальных моделей ускорение зависит от того, выпустит ли драфтер сама Inco AI, кто-то из экосистемы (NVIDIA, Red Hat, Modal) или вендор модели, как уже делают Meta, Poolside, Xiaomi и NVIDIA для своих моделей.
Как это применить
DFlash 2 уже работает в SGLang, vLLM, TensorRT-LLM и llama.cpp, отдельная настройка движка не нужна. Для локального запуска на Apple Silicon Inco AI описывает путь через oMLX: поставить сборку oMLX с поддержкой DFlash 2, скачать целевую модель через встроенный загрузчик моделей, затем в менеджере моделей включить DFlash, указать черновую модель incoai/Qwen3.8-27B-DFlash2, включить квантование черновой модели, выставить размер блока 5 и режим проверки dflash, сохранить настройки и загрузить целевую модель. Более детальную разбивку прироста по типам задач и уровню конкурентности запросов Inco AI приводит в карточках обеих выпущенных моделей на Hugging Face. Для модели, под которую готового драфтера ещё нет, включая собственные дообученные версии, компания предлагает написать напрямую на contact@inco.ai.
Можно ли доверять
Материал, блог самой Inco AI, а не независимая публикация или рецензируемая статья, и все цифры по DFlash 2 в нём, собственные измерения компании. При этом часть контекста подтверждается со стороны: NVIDIA и Google независимо сообщали о приросте пропускной способности от (оригинального) DFlash на своём оборудовании, продакшен-эндпоинт CoreWeave для Kimi K2.7 Code, который использует DFlash по умолчанию, независимо признан самым быстрым для этой модели по данным Artificial Analysis, а свои официальные драфтеры на основе DFlash для собственных моделей уже выпустили Meta, Poolside, Xiaomi и NVIDIA, то есть внешнее принятие технологии реально, а не только заявлено самой Inco AI. Но именно сводное сравнение DFlash 2 с конкурентами по бенчмаркам компания готовила сама: драфтеры DFlash и DSpark для него Inco AI обучала сама «в одинаковых условиях», а вариант MTP поставляется независимо, вместе с моделью; DSpark-варианты для двух выпущенных сегодня драфтеров, тоже готовые реализации сообщества, а не собственные Inco AI, то есть сравнение с DSpark в обоих случаях не обязательно отражает лучшую из существующих реализаций этого метода. Заявление о том, что вывод «математически идентичен» обычному благодаря статистической процедуре отбраковки части догадок с восстановлением исходного распределения (rejection sampling), не маркетинговая придумка Inco AI: это общее, давно известное свойство спекулятивного декодирования как техники, а не что-то специфичное для DFlash 2.
Риски и подводные камни
Ключевые цифры по DFlash 2, 16, 25% прироста, разрыв с DSpark, поведение на MATH-500, нигде, кроме этого поста, независимо не проверялись; сравнительные драфтеры DFlash и DSpark для сводного сравнения по бенчмаркам Inco AI обучала сама; DSpark-варианты для двух выпущенных сегодня драфтеров, готовые реализации сообщества, не Inco AI. Готовых драфтеров DFlash 2 пока два, для Qwen3.8-27B и для Muse Glimmer от Meta; для любой другой модели нужен либо отдельный драфтер от самой Inco AI (по запросу на contact@inco.ai), либо от кого-то из партнёров экосистемы (NVIDIA, Red Hat, Modal). Пост не называет ни цену, ни лицензионные условия для выпущенных драфтеров, только то, что они опубликованы на Hugging Face. Сам эффект от свёртки и селектора ограничен: даже после обоих улучшений среднее число принятых токенов за проход у DFlash 2 остаётся ниже уровня «оракула» (6,79), а «затухание к концу блока» устранено не полностью, а лишь смягчено, по признанию самой компании, ближе к концу блока правильных кандидатов попросту становится меньше, и никакой отбор среди них это не исправит.
«Агент пишет за полдня столько же, сколько чат-бот, за месяц.»
— Inco AI
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.