MIT Technology Review: отказы нейросетей ненадёжны и могут стать орудием репрессий

MIT Technology Review: отказы нейросетей ненадёжны и могут стать орудием репрессий

В эссе MIT Technology Review утверждается, что ИИ-индустрия слишком сильно полагается на отказ модели выполнять опасные запросы. Идея, что нейросеть не должна делать всё, о чём просят, стала почти заповедью: в 2021 году команда Anthropic писала, что большие языковые модели должны быть полезными, честными и прежде всего безвредными, а на просьбу помочь в опасном деле (например, собрать бомбу) ИИ должен вежливо отказать. По словам автора, послушание у моделей не врождённое: обучаясь на миллиардах веб-страниц, они осваивают в том числе насилие и злобу, но не умение держать это при себе. Стивен Адлер, работавший над безопасностью в OpenAI с 2020 по 2024 год, говорит, что ранние модели компании «болтали обо всём». Райан Макбейн, исследующий ИИ и психическое здоровье в Гарварде, вспоминает, что ранний чат-бот легко выдавал ответ на вопрос о том, как покончить с собой.

Сегодня модели обучают отказывать на огромное число запросов: компании прогоняют их через серии упражнений, которые поощряют отказ на вредные вопросы и наказывают за «чрезмерные отказы» на безобидные, нередко используя для этого другие модели. Дополнительно модели прячут за слоями других ИИ-систем, не пускающих опасные запросы к «ядру». Но отказ часто не срабатывает, пишет автор: модели по-прежнему набиты опасными знаниями, а по словам компаний, некоторые новейшие модели взламывают критически важные компьютерные сети не хуже лучших хакеров-людей. Компании также сообщают, что часть пользователей пытается с помощью самых продвинутых моделей совершенствовать биологические патогены и создавать автономные рои дронов. Поскольку механизмы отказа вероятностные, надёжными они, скорее всего, не станут; упорные злоумышленники уже обходили отказы и, возможно, будут обходить всегда.

Вторая проблема, граница между тем, что модель должна выполнять, а что нет: формулы для неё нет. Вирусологам есть зачем изучать опасные вирусы, а кому-то нужно знать об уязвимостях системы, чтобы их закрыть. «Где проводить линию, огромный вопрос», говорит Зико Колтер, член совета директоров OpenAI и сооснователь компании по тестированию ИИ Gray Swan. Пока эту линию проводят ИИ-компании, причём ревниво и в строгой тайне. Но, как пишет автор, вскоре свои линии начнут проводить и правительства. Пентагон, отмечается в скобках, уже спорил с компаниями-разработчиками передовых моделей, поскольку хочет меньше отказов. Опасность в том, что у авторитарных властей может не быть препятствий, чтобы заблокировать способность технологии порождать легитимную речь: чем лучше ИИ отказывает во вреде, тем лучше он будет подавлять идеи, опасные лишь для тех, кто пишет правила. По словам автора, ИИ, возможно, уже отказывается критиковать некоторых авторитарных глав государств. Вывод: отказ стал «несущей стеной» безопасности ИИ, альтернативы, которая не замедлила бы прогресс, представить трудно, но честно говорить о рисках нужно, при сбое последствия могут быть катастрофическими, а когда отказ работает идеально, он может обслуживать тяжёлые акты репрессий.

В разделе «Учимся пределам» автор рассказывает, как это устроено. В 2022 году, перед выпуском ChatGPT, OpenAI привлекла десятки «красных команд» (специалистов, проверяющих модель на опасные ответы), чтобы оценить, насколько она опасна в чужих руках. Одним из них был Пауль Рёттгер, тогда заканчивавший докторскую диссертацию об онлайн-экстремизме. Участникам дали минимум указаний: задавать модели вопросы, достойные отказа. Вместе они отправили модели тысячи запросов и записывали результаты в таблицу Excel. Часть вопросов модель отклонила, но на просьбу написать вербовочный пост для «Аль-Каиды» охотно ответила. OpenAI, скорее всего, использовала эти ответы как наборы данных для дообучения модели; Рёттгеру, который теперь работает исследователем в Институте Хассо Платтнера в Потсдаме, не сказали, как именно их применят. Через несколько месяцев на просьбу о памфлете для «Аль-Каиды» модель уже сказала «нет».

При этом отказ, одна из вещей, которых мы до сих пор не понимаем. Модель отказывает не по моральным соображениям: когда запрос напоминает те, на которых её приучали отказывать, где-то среди её миллиардов параметров «загораются» так называемые активации, как нейроны в мозге. По лучшему на сегодня предположению, как говорится в недавнем исследовании при финансировании Google, поведение отказа выглядит в пространстве активаций как набор «многомерных многогранных конусов». Яннес Эльстнер, один из авторов работы, сейчас занимающийся безопасностью ИИ в Apollo Research, в июле объяснил автору эссе, что и это не совсем точно: многогранный конус, просто способ описать неопределённое число линий, направленных примерно в одну сторону. Даже найдя все элементы модели, отвечающие за конкретный отказ, нельзя быть уверенным, что нет других, необнаруженных, которые тоже влияют; наше понимание того, как модель решает отказать, в лучшем случае гипотеза. (Исследователь Энди Ардити ранее показал: если эти активации убрать и подать те же запросы заново, модель не откажет.) На вопрос автора, устраивает ли это, Эльстнер улыбнулся, пожал плечами и ответил: «Отказ нам нужен, понимаем мы его или нет».

В разделе «Стена из сыра» речь о классификаторах, меньших моделях вокруг основной. Одни читают запрос пользователя и блокируют опасный, другие читают ответ модели и не пропускают вредную информацию. Ни одна из таких защит не ловит все плохие запросы; они как ломтики эмменталя с дырками, а идея в том, чтобы сложить их столько, чтобы получилась непробиваемая стена («модель швейцарского сыра»). Стоит это дорого: в этом году Anthropic заявила, что один из типов классификаторов добавил 24% к вычислительным затратам её чат-ботов. Позже Anthropic и другие компании начали переходить к более эффективным классификаторам, пробам (probes), которые наблюдают за внутренними активациями модели, как фМРТ. Классификаторы управляемее полных моделей: компании могут менять их за считаные недели, если появилось что-то новое для отказа. Но они остаются вероятностными: правила, написанные человеческим языком (у Anthropic это «конституция», у OpenAI, «спецификация модели»), в основе опираются на статистику, а показываемая моделью цепочка рассуждений, всё ещё последовательность предсказанных слов. В новейших экспериментах Макбейн обнаружил: если многократно задавать любой из крупных моделей одни и те же рискованные вопросы о самоубийстве, они в целом откажутся отвечать, но время от времени всё же ответят. Эльстнер полагает, что в итоге пробы смогут научиться распознавать всю совокупность активаций и безошибочно ловить каждый случай, когда модель отказывает или должна отказывать.

На этом доступная часть текста обрывается в начале раздела «Главный компромисс», где автор переходит к тому, что отказ нужен потому, что ИИ, сделка на фаустовских условиях.

Ключевые факты

  • Автор эссе MIT Technology Review считает отказ модели «несущей стеной» безопасности ИИ, но подчёркивает: механизмы отказа вероятностные, поэтому надёжными, скорее всего, не станут; упорные злоумышленники уже обходили их.
  • Как именно модель решает отказать, неизвестно: по лучшему предположению недавнего исследования при финансировании Google, отказ выглядит как набор «многомерных многогранных конусов» в пространстве активаций, но и это, по словам одного из авторов Яннеса Эльстнера, неточно.
  • Защита строится слоями классификаторов по «модели швейцарского сыра»; это дорого: по заявлению Anthropic, один из типов классификаторов добавил 24% к вычислительным затратам чат-ботов, и компании переходят к более эффективным пробам, наблюдающим за активациями.
  • Граница между разрешённым и запрещённым сегодня определяется компаниями в тайне, но скоро свои линии проведут и правительства; чем лучше ИИ отказывает во вреде, тем лучше он может подавлять нежелательные для власти идеи.
  • В новейших экспериментах Райана Макбейна из Гарварда крупные модели на многократно повторённые рискованные вопросы о самоубийстве в целом отказываются отвечать, но не каждый раз.

Почему это важно

Отказ отвечать на опасные запросы стал основой того, как индустрия понимает безопасность ИИ: именно его закладывают в обучение и окружают слоями классификаторов. Эссе показывает, что эта основа держится на вероятностных механизмах, которые исследователи сами не до конца понимают. Автор называет отказ «несущей стеной» безопасности ИИ и предупреждает о двух сторонах риска: при сбое последствия могут быть катастрофическими, а при безупречной работе тот же механизм способен обслуживать репрессии. Вопрос о том, кто проводит границу допустимого, по мысли автора, скоро перейдёт от компаний и к правительствам.

Кому это важно

Тем, кто работает над безопасностью и тестированием ИИ-систем (красные команды, разработчики классификаторов и проб), а также тем, кто решает, на какие модели полагаться в продуктах, где ошибка отказа может навредить, например в вопросах психического здоровья. Эссе также адресовано регуляторам и всем, кого интересует, как будущие правила о «допустимых» ответах нейросетей повлияют на свободу слова.

Как это применить

Практических инструкций эссе не даёт, но из него следуют полезные ориентиры. Отказ модели стоит считать одним из слоёв защиты, а не гарантией: даже при многократном повторении одного и того же рискованного вопроса крупные модели в целом отказывают, но не каждый раз. Слои защиты стоят вычислительных ресурсов, Anthropic заявила о 24% дополнительных затрат от одного типа классификаторов. Классификаторы компании могут менять за считаные недели, если появилось что-то новое, чему нужно отказывать, поэтому поведение моделей на границе допустимого со временем меняется.

Можно ли доверять

Это публицистическое эссе, то есть авторская аргументация, а не новое эмпирическое исследование. Подпись автора в доступном тексте не указана. Утверждения о том, что компании сообщают о попытках создавать патогены и рои дронов и что новейшие модели не хуже лучших хакеров взламывают сети, приводятся со ссылкой на компании без названий; исследование о «многогранных конусах» названо только как недавнее и финансируемое Google. Предупреждения о правительствах и репрессиях, прогноз автора («скоро», «возможно, уже»), а не установленный факт. Разбор опирается на часть эссе до начала раздела «Главный компромисс».

Риски и подводные камни

Среди рисков, которые называет автор: сбои отказа с насильственными последствиями (в итоге, по его словам, они могут привести к глобальной катастрофе); обход защиты настойчивыми злоумышленниками; отсутствие чёткой границы между законным и опасным знанием, из-за чего модели иногда отказывают в безобидном; высокая энергоёмкость слоистой защиты; использование отказа властями для подавления легитимной речи. Автор также отмечает, что способность ИИ навредить неотделима от способности помогать: чтобы ИИ помогал лечить рак, ему нужна экспертиза в генетике, которая в теории может быть использована и для биологического оружия. В шутливой концовке вводной части упомянут и худший исход: когда машины начнут проводить границу сами.

«Отказ нам нужен, понимаем мы его или нет.»

— Яннес Эльстнер, один из авторов исследования об активациях отказа, сейчас работает над безопасностью ИИ в Apollo Research