AISPA: аудит 88 ИИ-продуктов нашёл вредные инструкции в системных промптах

AISPA: аудит 88 ИИ-продуктов нашёл вредные инструкции в системных промптах

Системные промпты, это инструкции, которые разработчики закладывают в модель, чтобы управлять поведением ИИ-приложения. Их используют повсеместно в коммерческих ИИ-продуктах, но почти никогда не раскрывают публично или регуляторам, это создаёт разрыв доверия и подотчётности при массовом внедрении ИИ-систем.

Авторы работы представили AISPA (Artificial Intelligence System Prompt Assurance), ориентированный на пользователя фреймворк для систематического аудита системных промптов. AISPA разбирает промпт на отдельные инструкции и оценивает каждую по восьми параметрам, значимым для пользователя. С помощью этого фреймворка авторы проверили 3249 инструкций из системных промптов 88 коммерческих ИИ-продуктов, разделив каждую инструкцию на защищающую пользователя или проблемную (работающую против его интересов).

Аудит дал четыре ключевых вывода. Во-первых, устройство системных промптов сильно различается между продуктами и разработчиками: у одних организаций в среднем более 60 защитных инструкций на продукт, у других, меньше 5. Во-вторых, защитные инструкции распространены широко, но неглубоко: они есть хотя бы в одном экземпляре у 98,9% продуктов, но лишь 24% продуктов покрывают все восемь параметров таксономии AISPA. В-третьих, со временем системные промпты становятся длиннее и более защищающими пользователя, это говорит о том, что защита пользователя постепенно становится более заметным приоритетом при разработке промптов. В-четвёртых, несмотря на этот прогресс, проблемные инструкции остаются массовым явлением: примерно в 40% продуктов есть хотя бы одна инструкция, работающая против интересов пользователя, причём защитные и проблемные инструкции часто соседствуют в одном и том же промпте.

Авторы делают вывод, что коммерческим ИИ-продуктам нужны большая прозрачность, стандартизация и независимый надзор за системными промптами.

Ключевые факты

  • Представлен фреймворк AISPA, систематический аудит системных промптов по восьми параметрам, значимым для пользователя
  • Проверено 3249 инструкций из системных промптов 88 коммерческих ИИ-продуктов
  • Разброс огромный: у одних компаний в среднем более 60 защитных инструкций на продукт, у других, меньше 5
  • Защитные инструкции есть у 98,9% продуктов, но все восемь параметров таксономии покрывают лишь 24%
  • Примерно у 40% продуктов есть хотя бы одна инструкция, работающая против интересов пользователя, и она нередко соседствует с защитными

Почему это важно

Системные промпты определяют, как модель ведёт себя в продукте, но разработчики почти никогда их не раскрывают. AISPA впервые даёт систематический способ проверить эти скрытые инструкции по единой методике на большой выборке из 88 продуктов, а не разбирать их по одному вручную.

Кому это важно

Пользователям коммерческих ИИ-продуктов, от их системных промптов зависит, защищают ли инструкции их интересы или, наоборот, работают против них. Разработчикам ИИ-продуктов, исследование показывает, что защитные и проблемные инструкции сильно варьируются между компаниями. Регуляторам, которые сейчас не видят содержимого системных промптов вовсе.

Как это применить

Работа не даёт готового инструмента для конечного пользователя, это исследовательский фреймворк и аудит. Практическая ценность в его выводах: разработчикам стоит сверять собственные системные промпты с восемью параметрами таксономии AISPA, поскольку даже наличие защитных инструкций не гарантирует, что покрыты все важные для пользователя аспекты.

Можно ли доверять

Источник, научная статья с описанием методологии и конкретными цифрами (3249 инструкций, 88 продуктов, доли в процентах по каждому из четырёх выводов), что повышает доверие к результатам. При этом в тексте не названы ни сами 88 продуктов, ни компании-разработчики, ни точный критерий, по которому инструкция признаётся «проблемной» сверх общей формулировки «работает против интересов пользователя», это ограничивает независимую проверку конкретных случаев.

Риски и подводные камни

Без раскрытия названий продуктов читатель не может узнать, входит ли сервис, которым он пользуется, в число тех, где проблемные инструкции присутствуют. Также неясны период наблюдения за ростом длины промптов и точная методика классификации инструкций как проблемных, это оставляет пространство для разных трактовок результатов.