Divergence Decoding объединяет ИИ-специалиста и универсала на лету без дообучения
Учёные представили Divergence Decoding, training-free (не требующий дообучения) метод объединения возможностей двух готовых языковых моделей: узкоспециализированной (например, «заточенной» под химию) и универсальной, которая хуже знает предметную область, но лучше рассуждает и устойчивее к нестандартным вопросам. Идея решает конкретное противоречие: специализированные модели знают домен глубоко, но из-за узкой донастройки теряют часть общей логики и надёжности; универсальные модели рассуждают сильнее, но недостаточно знают специфику узкой научной области.
Метод перестраивает схему «черновик и проверка» из спекулятивного декодирования (техники ускорения генерации текста) в механизм адаптивной маршрутизации. На каждом токене метод считает дивергенцию Йенсена-Шеннона, меру расхождения между распределениями вероятностей следующего токена у специализированной и универсальной моделей. Если специализированная модель расходится с универсальной сильно, это трактуется как риск ошибки в рассуждении, и генерацию этого токена мгновенно передают универсальной модели. Так система на лету комбинирует знания специалиста и логику универсала, не смешивая веса моделей и не переобучая ни одну из них.
Метод проверили на моделях семейств Qwen и Llama на трёх научных бенчмарках: общем тесте на рассуждение GPQA и двух химических, ChemBench и ChemCoTBench (проверяет пошаговые цепочки рассуждений в химии). По итогам экспериментов Divergence Decoding превзошёл и специализированную, и универсальную модели по отдельности, обойдя большинство одномодельных (single-model) сравнений. Авторы делают вывод, что метод, это общий training-free способ совмещать разные возможности языковых моделей через адаптивное взаимодействие моделей уже на этапе вывода (инференса), а не обучения.
Ключевые факты
- Divergence Decoding, метод слияния специализированной и универсальной языковых моделей без дообучения, работающий на этапе генерации текста (инференса)
- На каждом токене метод считает дивергенцию Йенсена-Шеннона между предсказаниями двух моделей и по ней решает, кому доверить следующий токен
- Схема построена на переработке «черновик-и-проверка» из спекулятивного декодирования, техники, обычно используемой для ускорения генерации
- Проверено на моделях семейств Qwen и Llama на бенчмарках GPQA, ChemBench и ChemCoTBench
- Комбинация специалиста и универсала превзошла обе модели по отдельности и большинство одномодельных сравнений
Почему это важно
Компании и исследователи часто оказываются перед выбором: взять модель, дообученную под узкую научную область (химия, медицина, право), и получить глубокие знания домена ценой просевшей общей логики, либо взять универсальную модель с сильным рассуждением, но поверхностным знанием специфики. Divergence Decoding предлагает третий путь, получить оба преимущества сразу, комбинируя уже готовые модели во время генерации ответа, без затрат на повторное обучение.
Кому это важно
В первую очередь, тем, кто разворачивает языковые модели в узких научных и технических областях (химия, биология, инженерные расчёты) и уже имеет и специализированную, и универсальную модель под рукой. Также важно исследователям, которые занимаются совмещением (композицией) разных языковых моделей и оптимизацией инференса: метод показывает, что дополнительное обучение для такой комбинации не обязательно.
Как это применить
Метод не меняет веса моделей и не требует их совместного дообучения, нужны только уже готовые специализированная и универсальная модели из разных семейств (в статье, Qwen и Llama). Во время генерации ответа система на каждом токене сравнивает распределения вероятностей у обеих моделей через дивергенцию Йенсена-Шеннона; при превышении расхождения управление передаётся универсальной модели. Это делает метод применимым как надстройку поверх уже существующей инфраструктуры инференса, а не как отдельный тренировочный пайплайн.
Можно ли доверять
Результаты проверены на двух разных семействах моделей (Qwen и Llama) и трёх бенчмарках разного профиля, общем тесте на рассуждение GPQA и двух предметных химических (ChemBench, ChemCoTBench с пошаговыми цепочками рассуждений). Авторы сообщают, что комбинированный метод обошёл обе исходные модели по отдельности и большинство сравнений с одной моделью, что говорит о воспроизводимости эффекта за пределами одной пары моделей или одного теста. Это работа на уровне научной публикации без сведений о промышленном внедрении, поэтому воспринимать её стоит как убедительное лабораторное доказательство идеи, а не как готовое к продакшену решение.
Риски и подводные камни
Метод требует одновременного запуска двух моделей и вычисления дивергенции на каждом токене, что означает дополнительную вычислительную нагрузку и, вероятно, задержку по сравнению с одной моделью, конкретных цифр по накладным расходам в источнике нет. Проверка ограничена парами моделей из семейств Qwen и Llama и научными бенчмарками (GPQA, ChemBench, ChemCoTBench), насколько подход переносится на другие пары моделей, другие домены (не научные) или на модели с существенно разными токенизаторами, в источнике не разбирается.