Метод CKM снижает разворот решений ИИ-моделей на 82%, но не повышает их точность
Большие языковые модели могут давать разные ответы на одну и ту же задачу принятия решения при повторных запусках, а также менять решение на противоположное, если им показать их собственный прежний ответ как часть контекста. Авторы работы проверяли, можно ли измерить и частично сократить эту нестабильность без изменения весов модели.
Для этого предложен метод CKM (Cognitive Kernel Model), надстройка над промптом. Перед тем как принять решение, модель обязана разложить входные данные на три роли: Факт (данное или проверяемое), Эвристика (выведенное или предполагаемое) и Эмоция (оценочный или приоритетный сигнал). CKM не добавляет модели новых возможностей, он заставляет её явно фиксировать, какого рода информацию она использует перед действием. Формально метод поддерживает структурированное состояние S_t = {F_t, H_t, E_t}, которое обновляется функцией перехода на каждом шаге.
Метод протестировали на кореязычных сценариях принятия решений четырёх типов, неоднозначность, этический конфликт, распределение ресурсов, обработка ошибок, на 26 моделях от четырёх компаний-разработчиков, собрав 37 403 наблюдения. Проверка включала четыре основных эксперимента, абляцию с 4 вариантами, «пустую» (sham) абляцию с 5 вариантами и отдельный прогон с изменением температуры сэмплирования.
Результаты: (1) CKM снижает разброс повторяющихся ответов одной и той же модели (Hedges' g=1,09, 95% доверительный интервал [0,83; 1,35], по 31 паре моделей); (2) сохранение состояния между ответами снижает частоту разворота решения на 82% у более новых моделей (g=1,52); (3) эффект не сводится к простому JSON-форматированию, при пересчёте только значений без структуры g=2,24; (4) собственная случайность при фиксированном состоянии-«якоре» пренебрежимо мала; (5) преимущество CKM растёт при повышении случайности сэмплирования, g=2,87 при температуре 0,7; (6) «пустая» абляция показывает, что около 45% выигрыша даёт сама структура ответа (формат), а 55%, содержательное разделение на факты, эвристики и эмоции; при этом CKM оказался единственным из проверенных вариантов, который одновременно повышает консистентность и снижает частоту разворотов.
Ключевая оговорка авторов: CKM не улучшает правильность рассуждений модели, только их устойчивость. Итоговый вывод работы узкий и осторожный: поведенческая консистентность моделей измерима, различается между моделями и частично улучшается, если заставить модель до принятия решения разделять факты, предположения и оценочные сигналы.
Ключевые факты
- CKM, надстройка над промптом (веса модели не меняются): перед ответом модель обязана разложить входные данные на Факт, Эвристику (предположение) и Эмоцию (оценочный сигнал) и поддерживать это состояние между ответами.
- Проверка на 26 моделях от четырёх компаний-разработчиков и 37 403 наблюдениях на кореязычных сценариях решений (неоднозначность, этический конфликт, распределение ресурсов, обработка ошибок) показала значимое снижение разброса повторяющихся ответов (Hedges' g=1,09).
- У более новых моделей сохранение состояния снижает частоту разворота собственного решения на 82% (g=1,52).
- Контрольные проверки исключили тривиальные объяснения: эффект не сводится к JSON-форматированию (g=2,24 при пересчёте только значений), случайность при фиксированном состоянии-«якоре» пренебрежимо мала, а преимущество CKM растёт при повышении температуры сэмплирования (g=2,87 при 0,7).
- «Пустая» абляция раскладывает эффект: около 45% выигрыша даёт сама структура ответа, 55%, содержание (факты/эвристики/эмоции). Важная оговорка: CKM повышает устойчивость решений, но НЕ улучшает правильность рассуждений.
Почему это важно
Нестабильность решений, практическая проблема для любого продукта на LLM: одна и та же модель может дать разные ответы на идентичный запрос при повторных прогонах, а увидев собственный прежний ответ в контексте, может развернуть решение на противоположное без новых фактов. Это подрывает доверие к моделям как к инструментам принятия решений (модерация контента, распределение ресурсов, этические оценки). Работа предлагает измеримый и воспроизводимый способ сократить эту нестабильность без переобучения, простой промпт-уровневой надстройкой.
Кому это важно
Разработчикам агентных систем и продуктов, где модель принимает повторяющиеся или последовательные решения, модерация, скоринг, распределение ресурсов, этическая оценка кейсов; исследователям, занимающимся оценкой устойчивости и надёжности LLM; командам, которым нужна предсказуемость поведения модели без дообучения весов.
Как это применить
CKM реализуется на уровне промпта и не требует дообучения или доступа к весам модели: систему просят явно разделить вход на факты, предположения и оценочные сигналы и поддерживать это структурированное состояние между шагами диалога. Это делает метод применимым как надстройка к уже существующим пайплайнам на любых API-моделях.
Можно ли доверять
Масштаб проверки внушительный: 26 моделей от четырёх компаний-разработчиков, 37 403 наблюдения, четыре основных эксперимента плюс две отдельные абляции (4 и 5 вариантов) и отдельный прогон по температуре, с указанием размеров эффекта и доверительных интервалов, что говорит о методологической аккуратности. При этом работа опубликована на arXiv как препринт, по тексту не видно данных о независимом рецензировании (peer review), а все сценарии тестировались только на корейском языке, что сужает подтверждённую область применения.
Риски и подводные камни
Главный риск, путать консистентность с правильностью: авторы прямо пишут, что CKM не улучшает точность рассуждений, а значит уверенно неправильное решение модели может стать не «случайно иногда верным», а «стабильно неверным». Все сценарии тестировались исключительно на корейском языке, неясно, переносится ли эффект на другие языки и предметные области. Как препринт, работа пока не прошла независимую рецензию.