Глава Microsoft Наделла призвал считать ИИ-модель скомпрометированной и ставить «аварийный тормоз»

Глава Microsoft Сатья Наделла опубликовал в X длинный пост о рисках, которые несут очень мощные ИИ-модели, и о том, как с ними справляться. Об этом пишет The Verge.
По пересказу издания, Наделла считает, что мир больше не может мириться с тем, что ИИ воспринимается как «набор вложенных чёрных ящиков», чьи советы и действия мы просто принимаем или отвергаем. Вместо этого он призывает строить более прозрачную систему, в которой модели можно сдерживать (containment) и наблюдать за ними, а сами они оставляют после себя «защищённые от подделки, понятные человеку свидетельства».
Главный тезис поста, который The Verge приводит дословно: «Мы должны исходить из того, что модель скомпрометирована, и с самого начала её сдерживать. Представляйте это как аварийный тормоз». Далее: уполномоченный человек всегда должен иметь возможность приостановить или отключить модель посреди задачи, а более совершенным моделям потребуются более совершенные технологии сдерживания, которые, по словам Наделлы, нужно стандартизировать.
Автор материала отмечает, что многие рекомендации Наделлы совпадают с тем, что говорили другие участники отрасли: своевременное раскрытие инцидентов, независимые аудиты, проверяемые данные и сдерживание. Именно в последнем пункте, по оценке издания, он, судя по всему, заходит чуть дальше некоторых коллег по отрасли. Кроме того, The Verge с сожалением отмечает, что на протяжении поста Наделла называет ИИ «суперинтеллектом».
Ключевые факты
- Сатья Наделла в длинном посте в X призвал исходить из того, что модель скомпрометирована, и сдерживать её с самого начала, как «аварийный тормоз».
- Уполномоченный человек, по его словам, всегда должен мочь приостановить или отключить модель посреди задачи.
- Он выступает против восприятия ИИ как «набора вложенных чёрных ящиков» и за систему, где модели можно сдерживать, наблюдать за ними и получать «защищённые от подделки, понятные человеку свидетельства».
- Более мощные модели, по Наделле, потребуют более совершенных технологий сдерживания, которые нужно стандартизировать.
- По оценке The Verge, большинство рекомендаций совпадает с мнением других участников отрасли (раскрытие инцидентов, независимые аудиты, проверяемые данные), а в сдерживании Наделла, судя по всему, заходит немного дальше.
Почему это важно
Пост написан главой одной из крупнейших технологических компаний, и в нём вопрос безопасности ИИ формулируется как инженерная задача: предполагать, что модель скомпрометирована, и сдерживать её с самого начала. По оценке The Verge, значительная часть рекомендаций (раскрытие инцидентов, независимые аудиты, проверяемые данные) уже звучала в отрасли, а в сдерживании Наделла, судя по всему, идёт чуть дальше других. Отдельно он говорит о необходимости стандартизировать технологии сдерживания.
Кому это важно
В первую очередь тем, кто разрабатывает и выпускает мощные ИИ-модели и ИИ-агентов, а также тем, кто отвечает за их безопасность и аудит. Тезис о том, что человек должен всегда иметь возможность остановить модель посреди задачи, касается и компаний, которые встраивают модели в свои процессы. Для следящих за регулированием отрасли пост интересен как заявление руководителя Microsoft о нужде в стандартах сдерживания.
Как это применить
Пост не описывает конкретных инструментов или продуктов, поэтому прямого руководства к действию в нём нет. Как ориентиры из него можно взять принципы: исходить из того, что модель может быть скомпрометирована; предусмотреть уполномоченного человека, который может приостановить или отключить модель посреди задачи; обеспечить наблюдаемость и «защищённые от подделки, понятные человеку свидетельства» действий модели; следить за появлением стандартов сдерживания.
Можно ли доверять
Пересказ основан на материале The Verge, который цитирует пост Наделлы в X, а не на полном тексте самого поста. Ключевые фразы приведены издательством дословно, остальное, пересказ. Оценки о том, что рекомендации совпадают с отраслевыми и что в сдерживании Наделла заходит дальше, принадлежат автору материала и сформулированы с оговоркой «судя по всему». Оценку употребления слова «суперинтеллект» как неудачного также высказывает автор материала, а не Наделла. Заголовок оригинала говорит о «всех ИИ-моделях», тогда как в приведённой цитате речь идёт о «модели» в единственном числе.
Риски и подводные камни
В приведённом фрагменте не определено, что именно значит «скомпрометирована» (взлом, подмена, рассогласование целей или что-то иное), не названы конкретные модели, поставщики и продукты Microsoft. Не уточнено, кто такой «уполномоченный человек» и какие технологии сдерживания и какие организации по стандартизации имеются в виду, нет сроков. Это декларация позиции, а не план внедрения. Ответных реакций компаний, регуляторов или экспертов в материале нет.
«Мы должны исходить из того, что модель скомпрометирована, и с самого начала её сдерживать. Представляйте это как аварийный тормоз. Уполномоченный человек всегда должен иметь возможность приостановить или отключить модель посреди задачи. Более совершенным моделям потребуются более совершенные технологии сдерживания, которые нам нужно стандартизировать.»
— Сатья Наделла, пост в X (цитата по The Verge)