Chain-of-Models: лучший ИИ-аудитор для предвзятости ИИ-судей зависит от типа ошибки
LLM всё чаще выступают автоматическими судьями, оценивают ответы других моделей, но их вердикты уязвимы к когнитивным искажениям. Существующие способы борьбы с этим либо хрупкие (промпт-инструкции против конкретной предвзятости плохо переносятся на другие её виды), либо не масштабируются (проверка человеком). Авторы предлагают Chain-of-Models (CoM), конвейер аудита, в котором вторая модель проверяет цепочку рассуждений первой модели, прежде чем та вынесет финальное решение. Ключевой вопрос конструкции: должен ли аудитор быть той же моделью, моделью того же семейства или моделью из другого семейства.
Авторы протестировали связку из 9 моделей 6 семейств на 4 видах когнитивной предвзятости и 4 фактологических датасетах. Выяснилось два момента. Во-первых, устойчивость модели к искажениям сама по себе не предсказывает, насколько хорошо она справится с ролью аудитора: Kimi-K2.5, сильнейшая из протестированных моделей по устойчивости к нескольким видам предвзятости, но при этом слабый аудитор для предвзятых цепочек рассуждений модели Qwen2.5-72B. Во-вторых, лучший аудитор оказался специфичен именно для конкретного вида предвзятости: GPT-4o сильнее всех справляется с конформизмом (следованием за большинством), доверием к авторитету источника и отвлекающими деталями, а GLM-5, с угодливостью (склонностью модели соглашаться с пользователем в ущерб точности).
На основе этих наблюдений авторы предложили правило подбора аудитора под конкретный тип предвзятости: кандидаты оцениваются по функциональному разнообразию, собственной устойчивости к данной предвзятости и калиброванной эффективности в роли аудитора. При разбиении данных на калибровочную и тестовую выборки такой подбираемый аудитор дал точность 0,884 на четырёх предвзятых срезах данных, против 0,824 у лучшего единого фиксированного аудитора и 0,805 у базового варианта вовсе без аудита. Авторы выложили данные, конфигурации экспериментов и агентский навык (LLM-agent skill) для воспроизведения метода в анонимном репозитории.
Ключевые факты
- Chain-of-Models (CoM), конвейер, где вторая модель проверяет цепочку рассуждений первой модели-судьи перед вынесением вердикта, чтобы снизить когнитивную предвзятость оценки
- Проверено 9 моделей из 6 семейств на 4 видах предвзятости (конформизм, авторитет, отвлекающие детали, угодливость) и 4 фактологических датасетах
- Устойчивость модели к предвзятости сама по себе не гарантирует, что она будет хорошим аудитором: Kimi-K2.5 сильна как самостоятельная модель, но слаба как аудитор для Qwen2.5-72B
- Лучший аудитор зависит от конкретного вида предвзятости: GPT-4o лидирует на конформизме, авторитете и отвлекающих деталях, GLM-5, на угодливости
- Правило подбора аудитора под конкретную предвзятость дало точность 0,884 против 0,824 у лучшего фиксированного аудитора и 0,805 без аудита вообще
Почему это важно
LLM всё чаще выступают в роли автоматических судей, оценивают ответы других моделей при обучении, бенчмаркинге и модерации. Но такие оценки систематически искажаются когнитивными предубеждениями: судья может подстраиваться под мнение большинства, доверять источнику из-за его формального авторитета, отвлекаться на несущественные детали текста или просто соглашаться с пользователем. Промпт-инструкции против конкретной предвзятости плохо переносятся на другие её виды, а проверка человеком не масштабируется на объёмы, которые обрабатывают автоматические судьи. Chain-of-Models предлагает третий путь, автоматический аудит одной моделью рассуждений другой.
Кому это важно
Тем, кто строит пайплайны автоматической оценки на базе LLM: разработчикам бенчмарков, командам, использующим модели как судей при дообучении (RLHF и аналоги), и всем, кто полагается на автоматическую модерацию или проверку ответов ИИ-системами вместо людей. Результат прямо касается выбора конкретной модели-аудитора при проектировании таких систем.
Как это применить
Авторы формализуют выбор аудитора как отдельную задачу: под конкретный вид предвзятости кандидаты в аудиторы оцениваются по трём осям, функциональное разнообразие относительно проверяемой модели, собственная устойчивость к данному виду предвзятости и калиброванная эффективность именно в роли аудитора (эти три свойства не совпадают). Это правило превзошло и любой единый фиксированный аудитор, и вариант без аудита вовсе. Авторы опубликовали данные, конфигурации экспериментов и агентский навык для CoM в анонимном репозитории, это исходная точка для тех, кто хочет воспроизвести или адаптировать метод.
Можно ли доверять
Это препринт на arXiv без указания авторов, аффилиаций или места публикации; сопутствующий код и данные выложены в анонимном репозитории. Заявленные цифры (0,884 против 0,824 и 0,805) относятся к конкретной комбинации из 9 моделей, 4 видов предвзятости и 4 датасетов, насколько устойчиво это правило подбора аудитора работает за пределами протестированного набора моделей, из текста не следует. Механизм самой проверки, как именно аудитор «инспектирует» цепочку рассуждений, в источнике не детализирован.
Риски и подводные камни
Схема CoM требует запуска второй модели на каждую проверку, что удваивает вычислительные затраты по сравнению с судьёй без аудита. Правило подбора аудитора специфично для вида предвзятости, значит, для нового или ранее не встречавшегося вида искажения потребуется заново подбирать и калибровать аудитора, готового решения «на все случаи» метод не даёт. Контринтуитивный результат (сильнейшая самостоятельная модель, слабый аудитор для конкретной другой модели) означает, что интуитивный выбор «возьмём лучшую модель в аудиторы» может ошибаться на практике.