SAEScientist-Bench: ИИ-агенты интерпретируют нейросети хуже экспертов

Исследования в области рекурсивного самоулучшения ИИ (RSI) в основном сосредоточены на автоматизации самого процесса обучения моделей. Но для надёжной автономной разработки, по мнению авторов, не хватает другого элемента, постфактум-мониторинга и аудита: способа понять, чему модель на самом деле научилась, и убедиться, что её поведение безопасно и согласовано с целями. Инструменты механистической интерпретируемости авторы называют ключевыми для решения этой задачи, а разреженные автоэнкодеры (SAE), их опорным методом: SAE выделяют в модели интерпретируемые признаки, по которым модель можно и изучать, и направленно менять («управлять» её поведением).
Чтобы проверить, способен ли ИИ-агент сам, без участия человека, вести такое исследование, авторы представили бенчмарк SAEScientist-Bench. Агенту дают целевое понятие; он должен самостоятельно спроектировать контрастные пробы (сравнительные эксперименты) и найти нужный признак в словаре из более чем 131 тысячи признаков Gemma Scope для модели Gemma-2-9B-IT. Найденный признак сравнивают с курируемым набором экспертных эталонных признаков, сверенных с базой Neuronpedia, по трём направлениям: ранг активации признака, избирательность к понятию на контрастных текстах и способность каузально управлять генерацией модели, то есть реально использовать найденный признак, чтобы намеренно изменить её выход.
Тест прогнали на 10 конфигурациях агентов и 20 задачах. Передовые агенты демонстрируют настоящую способность к самостоятельному поиску и лидируют по отдельным направлениям оценки, но в целом заметно уступают экспертному эталону. Ближе всего к уровню экспертов они подходят в разделении целевого понятия и контрастных (отвлекающих) примеров, а заметно отстают именно в каузальном управлении генерацией. Дополнительный анализ указывает на конкретную причину отставания: агенты умеют грамотно выстраивать контрастные эксперименты, чтобы отсеять ложные признаки-кандидаты, но при этом часто неверно трактуют результаты собственных измерений.
Авторы делают вывод: экспериментальное понимание модели, измеримая способность ИИ-агентов, важная для замкнутого цикла автономных исследований и разработок в ИИ. Код бенчмарка выложен в открытый доступ на GitHub.
Ключевые факты
- SAEScientist-Bench проверяет, может ли ИИ-агент сам, как учёный, найти в нейросети признак, который соответствует заданному понятию, используя разреженные автоэнкодеры (SAE) и словарь Gemma Scope из более чем 131 тысячи признаков для модели Gemma-2-9B-IT.
- Результат агента сравнивают с экспертными эталонными признаками, сверенными с базой Neuronpedia, по трём критериям: ранг активации, избирательность к понятию на контрастных текстах и каузальное управление генерацией.
- На 10 конфигурациях агентов и 20 задачах передовые агенты показывают настоящую способность к самостоятельному поиску и лидируют по отдельным направлениям оценки, но в целом заметно уступают экспертному эталону.
- Ближе всего к уровню экспертов агенты подходят в отделении целевого понятия от отвлекающих примеров, а заметно отстают именно в каузальном управлении генерацией модели.
- Агенты умеют грамотно строить контрастные эксперименты, чтобы отсеять ложные признаки-кандидаты, но часто неверно трактуют результаты собственных измерений, в этом видят главную причину отставания.
Почему это важно
Разговоры о рекурсивном самоулучшении ИИ (RSI) пока в основном сводятся к автоматизации обучения, то есть к тому, как модель помогает сделать следующую модель лучше. Мониторинг и аудит того, чему модель на самом деле научилась и насколько она безопасна, в эту автоматизацию почти не попадает, это по-прежнему работа людей, специалистов по интерпретируемости. SAEScientist-Bench, бенчмарк, который проверяет именно это: способен ли ИИ-агент взять на себя часть этой работы, не обучение модели, а её исследование изнутри, так, как это делают сегодня эксперты по интерпретируемости. Если агенты научатся находить и понимать внутренние механизмы модели без участия человека, цикл автономной разработки ИИ замкнётся: обучение и проверку сможет вести одна и та же система, а не только человек-эксперт.
Кому это важно
Прежде всего, исследователям механистической интерпретируемости и AI-safety: бенчмарк даёт способ измерить, где именно ИИ-агенты пока не заменяют человека-интерпретатора, а где уже приближаются к нему. Также, командам, которые строят автономных ИИ-агентов для научной работы: SAEScientist-Bench, конкретный, воспроизводимый тест того, готов ли такой агент к задачам, где мало прикладной автоматизации и много интерпретации сигнала. И тем, кто уже пользуется инструментами SAE-анализа вроде Gemma Scope и Neuronpedia, результат показывает, на каком шаге агента стоит перепроверять внимательнее всего.
Как это применить
Готового продукта здесь нет, это исследовательский бенчмарк, и код авторы выложили в открытый доступ на GitHub. Тем, кто уже поручает ИИ-агентам работу с инструментами интерпретируемости, результат подсказывает конкретную точку контроля: не отдавать агенту финальный шаг без проверки, каузальную проверку того, действительно ли найденный признак управляет нужным поведением модели, потому что именно здесь агенты слабее всего и путаются в собственных измерениях. Отбор кандидатов и отсев явно ложных признаков агенту, судя по результатам, доверить можно; финальный вывод, пока нет.
Можно ли доверять
Это фрагмент самого текста научной работы со страницы HuggingFace Papers, а не пересказ через третьи руки, и методика описана достаточно конкретно: названы модель (Gemma-2-9B-IT), словарь признаков (Gemma Scope, более 131 тысячи), число агентов и задач (10 и 20), три чётких критерия оценки. Это повышает доверие к описанному. Оговорка: доступный текст, это аннотация, и сравнение с уровнем экспертов в ней дано словами («приближаются», «заметно отстают»), а не точными цифрами, числовые показатели, вероятно, есть в самой статье и таблицах, но не в тексте, на основе которого сделан этот пересказ. Авторы работы и то, как именно отбирались эталонные признаки экспертов, в использованном тексте не детализированы.
Риски и подводные камни
Главный риск, не в самом бенчмарке, а в том, как его результат могут использовать дальше: вывод «агенты неплохо ищут нужные признаки» легко процитировать отдельно от «агенты плохо умеют каузально управлять этими признаками и путаются в интерпретации измерений», а именно вторая часть значит, что доверять такому агенту финальный вывод аудита пока нельзя. Бенчмарк проверен на одной модели (Gemma-2-9B-IT) и одном инструменте интерпретируемости (SAE через Gemma Scope), переносить результат на другие модели или другие методы интерпретируемости пока нет оснований. И ещё: ошибка агента в чтении собственных измерений, ровно тот тип ошибки, который в задаче аудита безопасности модели останется незамеченным, если результат никто не перепроверит.