Guide Labs выяснила: интерпретируемость ИИ растёт вместе с масштабом модели

Guide Labs выяснила: интерпретируемость ИИ растёт вместе с масштабом модели

Статья «Scaling Inherently Interpretable Language Models» (команда Guide Labs) оспаривает распространённое предположение, что интерпретируемость, это налог на возможности модели: сначала обучают непрозрачную систему, а потом задним числом пытаются её объяснить методами, чью надёжность трудно установить. Авторы предлагают другой путь: сделать интерпретируемость частью самого процесса обучения, оптимизируя её вместе с языковой целью, а не пристраивая объяснения после того, как модель уже готова.

В экспериментах, охвативших диапазон вычислений протяжённостью в три порядка величины и включивших как авторегрессионные, так и диффузионные языковые модели, интерпретируемость росла вместе со способностями модели, а не за их счёт. По словам авторов, неожиданным оказалось то, что с ростом масштаба внутренние представления модели становятся более разделёнными (менее перепутанными между собой) и лучше соответствуют понятиям, которые понятны человеку.

Этот подход к обучению воплощён в модели Steerling-8B, диффузионной языковой модели с каузальной маской внимания. Для любой группы сгенерированных токенов Steerling-8B указывает, какие входные токены, человеко-понятные концепты и примеры из обучающих данных на неё повлияли. Такая атрибуция открывает возможность замкнутого цикла вмешательства: диагностировать проблемный ответ через привязку к концепту или признаку, найти похожие обучающие примеры и скорректировать поведение модели через направленное изменение (в оригинале, concept steering), без повторного обучения.

По общей производительности Steerling-8B остаётся конкурентоспособной по сравнению с открытыми моделями-аналогами, обученными на вычислениях в 2, 16 раз больше. Авторы читают это как свидетельство другого пути масштабирования: интерпретируемость не обязательно реконструировать после обучения, её можно заложить в модель заранее, и с ростом масштаба она становится только лучше.

В самой аннотации не названы конкретные бенчмарки, наборы данных или числовые показатели точности для Steerling-8B, не указаны абсолютные единицы вычислений (например, FLOPs или GPU-часы) для упомянутых «трёх порядков величины» и «2, 16 раз», и не сказано, будут ли открыты веса, код или обучающие данные модели.

Ключевые факты

  • Работа делает интерпретируемость частью цели обучения, а не объяснением, добавляемым после того, как модель уже обучена.
  • На диапазоне вычислений протяжённостью в три порядка величины, на авторегрессионных и диффузионных моделях, интерпретируемость росла вместе со способностями модели, а не за их счёт.
  • С ростом масштаба внутренние представления модели становятся более разделёнными и лучше соответствуют понятным человеку концептам.
  • Демонстрационная модель Steerling-8B, диффузионная языковая модель с каузальной маской внимания, для любой группы сгенерированных токенов указывает связанные с ней входные токены, концепты и обучающие примеры.
  • Steerling-8B сохраняет конкурентоспособность по сравнению с открытыми моделями, обученными на вычислениях в 2, 16 раз больше.

Почему это важно

Обычно интерпретируемость, это то, за что платят задним числом: обучают мощную, но непрозрачную модель, а потом пытаются объяснить её методами, которым трудно доверять. Центральное утверждение этой работы идёт наперекор такому подходу. Сделав интерпретируемость частью цели обучения, а не надстройкой поверх готовой модели, авторы сообщают, что она растёт вместе со способностями, а не приносится им в жертву, и это подтверждено на диапазоне вычислений протяжённостью в три порядка величины, на авторегрессионных и диффузионных моделях. Если результат подтвердится, он подрывает расхожее мнение, что более способные модели неизбежно становятся более непонятными.

Кому это важно

Прямая аудитория, исследователи и команды, работающие над интерпретируемостью и безопасностью моделей, а также все, кто до сих пор считал объяснимость статьёй расходов, а не встроенным свойством. Механизм атрибуции и направленной коррекции также полезен командам, которым нужно диагностировать и исправлять поведение модели в проде без цикла повторного обучения.

Как это применить

Подход воплощён в Steerling-8B, диффузионной языковой модели с каузальной маской внимания. Для любой группы сгенерированных токенов она указывает, какие входные токены, человеко-понятные концепты и обучающие примеры на неё повлияли. Эта цепочка атрибуции даёт замкнутый цикл вмешательства: диагностировать ответ через привязку к концепту или признаку, найти похожие обучающие примеры и скорректировать поведение через направленное изменение по концептам, без повторного обучения. В источнике не сказано, открыты ли веса, код или обучающие данные Steerling-8B, поэтому ничего сказанного здесь нельзя читать как заявление о доступности модели.

Можно ли доверять

Результат «интерпретируемость растёт вместе со способностями» проверен на диапазоне вычислений в три порядка величины и на моделях двух разных типов, авторегрессионных и диффузионных, это широкий охват. По общей производительности Steerling-8B описана как конкурентоспособная относительно открытых моделей-аналогов, обученных на вычислениях в 2, 16 раз больше. При этом в аннотации не названы конкретные бенчмарки, наборы данных или числовые показатели точности ни для утверждения об интерпретируемости, ни для утверждения о производительности, и не даны абсолютные единицы вычислений вроде FLOPs или GPU-часов, поэтому сравнение верно ровно в тех относительных терминах, в которых его формулируют авторы.

Риски и подводные камни

Изложенные утверждения взяты из собственной аннотации статьи; независимых оценок по бенчмаркам, наборов данных или абсолютных цифр по вычислениям, которые позволили бы их перепроверить, не приведено. Также не сказано, будут ли открыты веса, код или обучающие данные Steerling-8B, поэтому пока нельзя сказать, кто и как сможет воспроизвести эту работу или продолжить её.

«Удивительно, но с ростом масштаба внутренние представления модели становятся более разделёнными и лучше согласуются с понятными человеку концептами.»

— из аннотации статьи