Новый метод EAACD снижает галлюцинации LLM в MoE-моделях
Один из способов борьбы с галлюцинациями языковых моделей (LLM), контрастное декодирование: метод сопоставляет предсказания разных слоёв сети и подавляет то, на чём модель чаще ошибается. До сих пор эту технику проверяли только на классических трансформерных моделях вроде GPT, а архитектуру со смесью экспертов (mixture-of-experts, MoE), которая пропускает разные токены через разные подсети-«эксперты», а не через единую сеть, обходили стороной.
Авторы работы проверили, сохраняются ли для MoE те же послойные различия, на которых строится обычное контрастное декодирование. Результат оказался неоднозначным. В MoE-моделях с общими (shared) экспертами, теми, через которые проходят все токены, таких послойных различий не нашлось: классическая схема контрастного декодирования там не работает. Зато в верхних слоях разных MoE-архитектур обнаружился другой сигнал: разные эксперты активируются в зависимости от того, выдаёт модель достоверный ответ или галлюцинацию.
На этом наблюдении построен новый метод, EAACD (Expert-Aware Adaptive Contrast Decoding, адаптивное контрастное декодирование с учётом экспертов). Эксперты верхних слоёв делятся на одну группу «высокой надёжности» и несколько групп «низкой надёжности», по уверенности и согласованности их предсказаний. Предсказание надёжной группы сопоставляется с предсказанием каждой ненадёжной группы, и на основе этого сравнения корректируется итоговый ответ модели. Чтобы контраст был более чётким, EAACD дополнительно усиливает склонность ненадёжных экспертов к галлюцинациям, через механизм внимания и маскирование, получая более выраженный «отрицательный» ориентир для сравнения.
По результатам экспериментов EAACD превзошёл все базовые методы на четырёх наборах данных в задачах вопрос-ответ.
Ключевые факты
- Классическое контрастное декодирование, которое борется с галлюцинациями LLM через различия между слоями сети, в MoE-моделях с общими (shared) экспертами не работает, авторы не нашли там таких послойных различий.
- Зато в верхних слоях разных MoE-архитектур эксперты активируются по-разному в зависимости от того, выдаёт модель достоверный ответ или галлюцинацию, это и стало рабочим сигналом.
- На этом сигнале построен новый метод EAACD (адаптивное контрастное декодирование с учётом экспертов): эксперты верхних слоёв делятся на группу высокой и несколько групп низкой надёжности по уверенности и согласованности предсказаний.
- EAACD сопоставляет предсказание надёжной группы с предсказаниями ненадёжных и корректирует итоговый ответ; ненадёжных экспертов дополнительно подталкивают к галлюцинациям через внимание и маскирование, для более чёткого контраста.
- По результатам экспериментов EAACD превзошёл все базовые методы на четырёх наборах данных в задачах вопрос-ответ.
Почему это важно
Галлюцинации, искажённые или выдуманные факты в ответах языковых моделей (LLM), остаются одной из главных нерешённых проблем. Существующие методы борьбы с ними (инженерия промптов, дообучение модели) либо почти не меняют внутренние знания модели, либо плохо переносятся между предметными областями. Контрастное декодирование, альтернативный подход через сопоставление предсказаний разных слоёв сети, до сих пор проверяли только на классических трансформерных моделях вроде GPT. Эта работа впервые системно проверяет, применим ли такой подход к архитектуре со смесью экспертов (MoE), которая лежит в основе части современных крупных моделей и устроена принципиально иначе. Важен сам вывод: классический механизм контрастного декодирования для MoE с общими экспертами не работает, зато нашёлся другой рабочий сигнал, и на его основе построен метод, реально снижающий долю галлюцинаций.
Кому это важно
В первую очередь, исследователям и инженерам, которые разрабатывают или дообучают модели на архитектуре MoE (смесь экспертов): это распространённая схема для крупных современных LLM, где вычисления идут не через единую сеть, а через набор специализированных подсетей-«экспертов». Результаты полезны командам, которые строят вопрос-ответные и поисково-генеративные (RAG) системы на MoE-моделях и хотят снизить долю галлюцинаций без переобучения модели целиком. Массовому пользователю LLM работа не адресована напрямую, это методологическое исследование для тех, у кого есть доступ к внутреннему устройству модели.
Как это применить
EAACD применяется на этапе декодирования (генерации ответа), а не через переобучение модели: метод перераспределяет вклад экспертов верхних слоёв в момент генерации токена. Эксперты делятся на группу «высокой надёжности» и несколько групп «низкой надёжности», по уверенности и согласованности их предсказаний; предсказание надёжной группы сопоставляется с предсказаниями ненадёжных, и на основе этого контраста корректируется итоговый ответ, а для более чёткого контраста склонность ненадёжных экспертов к галлюцинациям дополнительно усиливают через механизм внимания и маскирование. В источнике нет сведений о готовом инструменте, библиотеке или коде, это результат, проверенный авторами на четырёх наборах данных в задачах вопрос-ответ; применение требует доступа к внутренним активациям экспертов конкретной MoE-модели, то есть подходит командам, которые сами обучают или дообучают такие модели.
Можно ли доверять
Это препринт на arXiv; ни авторы, ни организация, ни статус рецензирования в тексте источника не указаны, независимая проверка результатов пока не проводилась. Превосходство над базовыми методами показано в экспериментах самих авторов на четырёх наборах данных; конкретные числовые показатели прироста источник не приводит. По содержанию это точечное развитие уже известной техники (контрастного декодирования) для нового класса архитектур, а не принципиально новый результат, но оно закрывает реальный пробел: раньше контрастное декодирование для MoE никто системно не проверял.
Риски и подводные камни
Результат не универсален для всех MoE-архитектур: авторы сами показывают, что классическое контрастное декодирование в MoE с общими экспертами не работает, значит, поведение существенно зависит от конкретной конструкции MoE, и перенос EAACD на другую модель не гарантирован без отдельной проверки. Метод требует на этапе генерации разбивать экспертов на группы и сравнивать несколько предсказаний одновременно, это дополнительные вычисления, которые могут увеличить задержку по сравнению с обычным декодированием; источник не приводит цифр по накладным расходам. Результаты подтверждены только на четырёх наборах данных в задачах вопрос-ответ, перенос на другие типы задач не проверялся. Наконец, метод требует доступа к внутренним активациям модели и потому неприменим к закрытым моделям, доступным только через API без такого доступа.