Нейросети знают скрытое ограничение, но не используют его

Языковые модели часто ошибаются в особом типе запросов: когда явная, заметная подсказка в тексте запроса указывает на один ответ, а скрытое, нигде прямо не проговорённое ограничение на выполнимость, на другой. Авторы новой работы по интерпретируемости показывают: если просто мерить долю правильных ответов на таких заданиях, картина получается обманчивой. Модель может дать правильный ответ двумя разными путями, либо действительно вывести скрытое ограничение и учесть его, либо просто по умолчанию ответить осторожно вне зависимости от того, действует ограничение или нет. В сырой метрике точности эти два случая неразличимы.

Чтобы развести их, авторы вводят понятие условной активации ограничения, диагностику из четырёх частей, которую сами называют «квартетом». «Знание» проверяет, закодировано ли ограничение вообще где-то во внутренних активациях модели. «Симметрия», выглядит ли это внутреннее представление одинаково независимо от того, есть ограничение в запросе или нет. «Маршрутизация», действительно ли закодированное ограничение используется при формировании ответа. «Починка», причинно проверяет, можно ли исправить сбой маршрутизации, подставив модели донорскую активацию из случая, где ограничение было учтено верно.

Этот квартет прогнали на 14 моделях и обнаружили два разных типа сбоя. На двух моделях с открытыми весами авторы пошли дальше: зонды, обученные на внутренних активациях, распознают скрытое ограничение с точностью выше 88%, это точность считывания внутреннего представления, а не точность самой модели в решении задачи, но она подтверждает, что информация об ограничении действительно есть внутри модели, даже когда ответ модели это ограничение игнорирует. Патчинг активаций, подстановка донорской активации, чтобы проверить, чинит ли она сбойную маршрутизацию, сработал на одной из двух моделей (эффект +6,4 ната, это единица измерения количества информации), но не на другой (эффект -0,07, то есть фактически никакого улучшения).

Авторы также проверили набор вмешательств на уровне промпта, попытки исправить проблему одной лишь текстовой правкой запроса, без вмешательства во внутренние активации модели. Ни одно из них не достигло эффекта, сопоставимого с прямым патчингом активаций. Вместо этого все проверенные вмешательства действовали одним и тем же способом: они явно упоминали ограничение прямо в тексте промпта, и в результате просто делали модель более осторожной по умолчанию во всех случаях, а не учили её точнее различать, когда ограничение действительно применимо, а когда нет.

Итоговый вывод авторов сформулирован прямо: сбой при работе со скрытым ограничением, это проблема маршрутизации знания к решению, а не проблема нехватки самого знания. Модель, судя по результатам работы, «знает» о скрытом ограничении, но это знание не всегда доходит до места, где формируется её итоговый ответ.

Ключевые факты

  • Зонды на внутренних активациях двух моделей с открытыми весами распознают скрытое ограничение с точностью выше 88%, это точность считывания внутреннего представления, а не точность модели в самой задаче.
  • Несмотря на это, при формировании ответа модель не всегда использует эту информацию: сбой происходит на этапе маршрутизации знания к решению, а не из-за отсутствия самого знания.
  • Четырёхчастную диагностику («квартет»: Знание, Симметрия, Маршрутизация, Починка) прогнали на 14 моделях и выявили два разных типа такого сбоя.
  • Донорский патчинг активаций чинит маршрутизацию у одной из двух проверенных моделей (+6,4 ната), но не у второй (-0,07).
  • Ни одна из проверенных текстовых техник на уровне промпта не достигает эффекта патчинга активаций, все они лишь делают модель более осторожной по умолчанию через явное упоминание ограничения в запросе.

Почему это важно

Когда модель ошибается на задаче со скрытым ограничением, обычно предполагают, что она просто не знает об этом ограничении, а значит, чинить нужно нехватку знаний: больше данных, более чёткие инструкции. Эта работа показывает другое: как минимум в проверенных случаях ограничение уже закодировано во внутренних активациях модели с высокой точностью (зонды распознают его выше 88%), сбой происходит позже, на этапе, где это внутреннее представление должно повлиять на итоговый ответ, и там оно иногда просто теряется. Это меняет то, куда должна целиться починка: пробел в знаниях лечится обучением, а пробел в маршрутизации, это механистическая проблема внутри модели, и, как показывают собственные результаты авторов по вмешательствам на уровне промпта, поверхностной правкой текста запроса она надёжно не закрывается. Ещё одна методологическая деталь: обычная точность ответов на таких задачах смешивает два разных случая, модель либо действительно рассуждает об ограничении, либо просто осторожничает по умолчанию, и раздельно эти случаи не увидеть без диагностики вроде предложенной.

Кому это важно

В первую очередь, исследователям интерпретируемости, согласованности и безопасности языковых моделей: у них появляется конкретный диагностический инструмент, чтобы отличать сбой знания от сбоя маршрутизации в собственных моделях. Разработчикам ИИ-агентов и систем, которые должны учитывать неявные ограничения, доступные разрешения, условия безопасности, реальную выполнимость задачи, а не просто реагировать на самую заметную подсказку в запросе, этот результат объясняет один из возможных источников ошибок: агент может «знать» об ограничении и всё равно его не применить. Тем, кто строит бенчмарки и оценки для задач с ограничениями, стоит учитывать, что агрегированная точность может маскировать чистую осторожность модели вместо настоящего рассуждения. Наконец, это касается всех, кто пытается чинить подобные сбои правкой промптов: результаты работы прямо показывают потолок такого подхода.

Как это применить

У работы нет продукта или релиза, это диагностический метод. Практическая ценность в самой четырёхчастной диагностике («Знание / Симметрия / Маршрутизация / Починка»): её можно применить к собственной модели, чтобы понять, где именно ломается обработка скрытого ограничения, на уровне знания или на уровне маршрутизации, и уже исходя из этого выбирать способ починки, а не гадать. Отдельный практический вывод, предостережение: не стоит рассчитывать, что явное упоминание ограничения в промпте надёжно решает проблему. По данным авторов, это лишь делает модель более осторожной по умолчанию во всех случаях, а не учит её точнее различать, когда ограничение применимо, а когда нет, и по эффекту такая правка не сравнима с прямой починкой на уровне активаций. При этом даже починка на уровне активаций сработала лишь на одной из двух проверенных моделей, то есть инженерное решение, найденное на одной архитектуре, не обязательно переносится на другую: каждую модель, судя по всему, нужно диагностировать отдельно.

Можно ли доверять

Это препринт на arXiv: в тексте, на который опирается пересказ, не указаны ни авторы, ни их организации, ни дата публикации, ни место публикации, независимо проверить эти данные по нему нельзя. Сама методология, зондирование внутренних активаций и причинный патчинг активаций, стандартный, устоявшийся инструментарий механистической интерпретируемости, что добавляет доверия к подходу. При этом самые сильные, причинные утверждения про патчинг активаций опираются всего на две модели с открытыми весами, и даже между ними результат разошёлся: у одной модели починка сработала, у другой нет. Более широкая поведенческая диагностика с выводом о «двух типах сбоя» прогонялась на 14 моделях, что расширяет базу для этого вывода, но в тексте не названы ни эти 14 моделей, ни те две модели с открытыми весами, ни конкретный пример задания, где сталкиваются подсказка и ограничение, так что читатель не может самостоятельно свериться с постановкой эксперимента, не открывая полный текст статьи.

Риски и подводные камни

Единственный рычаг, который сработал у вмешательств на уровне промпта, явное упоминание ограничения в тексте, не чинит рассуждение, а лишь делает модель более осторожной по умолчанию. Значит, попытка исправить конкретный сбой такой правкой рискует сделать модель избыточно осторожной и в случаях, где ограничение на самом деле не действует, то есть просто сдвигает проблему в другую сторону. Отдельный риск, сама метрика: агрегированная точность на задачах с ограничениями может выглядеть высокой просто из-за общей осторожности модели, а не из-за того, что она действительно правильно рассуждает, команды, которые опираются на такую точность при оценке моделей или агентов, рискуют принять осторожность за настоящее понимание. Наконец, причинные выводы о «починке» через патчинг активаций получены всего на двух моделях с открытыми весами и разошлись между ними, так что результат может не переноситься на другие архитектуры, включая закрытые модели, для которых такой анализ активаций в принципе недоступен.

«Сбой при обработке скрытого ограничения, это проблема маршрутизации, а не проблема знания.»

— авторы работы