OpenAI анонсировала Private Safety Processing: проверку рисков без доступа сотрудников к данным

OpenAI анонсировала Private Safety Processing: проверку рисков без доступа сотрудников к данным

У OpenAI уже действует политика Zero Data Retention (ZDR, «нулевое хранение данных»): для подпадающих под неё клиентов API компания не сохраняет ни присланный запрос, ни ответ модели после того, как он обработан. Содержимое недоступно для просмотра сотрудникам OpenAI, а данные корпоративных клиентов не используются для обучения моделей, если клиент явно не разрешил это сам.

Проблема в том, что нынешние системы безопасности, совместимые с ZDR, оценивают каждое взаимодействие с моделью по отдельности. По мере того как модели берут на себя всё более длинные, сложные и агентные задачи, часть по-настоящему серьёзных рисков видна не в одном запросе, а только при сопоставлении нескольких связанных взаимодействий: например, если пользователь методично проверяет защитные механизмы на прочность, координирует действия сразу с нескольких аккаунтов или маскирует угрозу под рутинное исследование. Похожий риск возникает и в агентных задачах: система может продолжать действовать после того, как её явно попросили остановиться, и тем самым выйти за рамки данных ей полномочий.

По словам OpenAI, некоторые другие поставщики передовых моделей требуют от клиентов разрешить сохранение чувствительного содержимого ради мониторинга безопасности, а это для многих организаций напрямую противоречит их собственным требованиям к защите данных.

Чтобы закрыть этот разрыв, не отказываясь от ZDR, компания показала предварительную версию новой функции Private Safety Processing. Она построена поверх уже действующей в ZDR автоматической защиты, но, в отличие от неё, сопоставляет связанные между собой взаимодействия, а не только каждое по отдельности, и делает это тоже автоматически, без доступа сотрудников OpenAI к самому содержимому. Функция задумана так, чтобы работать при любом способе хранения данных клиента. В классическом варианте ZDR содержимое остаётся на инфраструктуре, которую контролирует сам клиент. Отдельно OpenAI разрабатывает вариант, при котором данные хранятся на инфраструктуре самой OpenAI, но шифруются ключами, которые контролирует клиент: копий этих ключей у сотрудников OpenAI нет, то есть добраться до содержимого они физически не могут.

Когда автоматические системы обнаруживают риск, OpenAI получает не само содержимое, а узко очерченный сигнал о типе выявленной активности, по аналогии с тем, как уже работают её нынешние системы безопасности. Этот сигнал используется, чтобы решить, нужны ли меры в отношении аккаунта; доступа к содержимому у сотрудников компании нет и после того, как сигнал сработал. Разбираться в причине срабатывания клиент может по собственным логам и системам. Если клиент хочет оспорить решение или помочь в расследовании подтверждённого злоупотребления, делиться ли с OpenAI дополнительной информацией, решает он сам: по умолчанию компания её не получает.

Private Safety Processing сейчас тестируется с ограниченным числом ранних клиентов. OpenAI объясняет публикацию предпросмотра тем, что клиенты давно просят предсказуемости: по мере роста возможностей моделей организациям нужно заранее понимать, как будет защищено их содержимое. Компания говорит, что развивает функцию вместе с клиентами из разных отраслей, регионов и разного масштаба, среди которых организации, работающие с финансовой отчётностью, медицинскими данными, конфиденциальными бизнес-планами и результатами исследований: защита такой информации нужна им и для соответствия регуляторным требованиям, и для сохранения доверия клиентов и конкурентного преимущества. Один из таких клиентов, компания Glean, приводится в тексте анонса с отзывом о работе с OpenAI.

По плану OpenAI, полноценное внедрение Private Safety Processing и публикация технического документа (white paper) с описанием подхода начнутся в сентябре; конкретный год в анонсе не указан. До этого момента компания обещает и дальше согласовывать с клиентами технические и организационные детали и заранее предупреждать обо всех изменениях, которые затронут действующие обязательства по ZDR.

Отдельная оговорка касается материалов о сексуальном насилии над детьми (CSAM): по закону OpenAI обязана сообщать об обнаруженных материалах такого рода, поэтому изображения, помеченные как потенциальный CSAM, по-прежнему сохраняются для ручной проверки и отчётности. Это действует уже сейчас и остаётся в силе даже в развёртываниях с нулевым хранением данных.

Ключевые факты

  • Private Safety Processing анализирует не отдельные запросы, а связанные цепочки взаимодействий: так виднее, если пользователь раз за разом проверяет защитные механизмы на прочность, координирует действия сразу с нескольких аккаунтов, маскирует угрозу под рутинное исследование или агент продолжает действовать после явной команды остановиться.
  • Даже когда система находит риск, OpenAI получает только узко очерченный сигнал о типе активности: доступа к самому содержимому запросов и ответов у сотрудников компании нет ни в обычном режиме, ни после срабатывания сигнала.
  • В классическом варианте ZDR данные остаются на инфраструктуре клиента; в разрабатываемом варианте хранения на инфраструктуре OpenAI содержимое шифруется ключами клиента, и копий этих ключей у OpenAI нет.
  • Если клиент хочет оспорить решение или помочь в расследовании подтверждённого злоупотребления, делиться ли с OpenAI дополнительной информацией, решает он сам: по умолчанию компания её не получает.
  • Функция сейчас тестируется с ограниченным числом ранних клиентов; полноценный запуск и технический документ о её устройстве OpenAI обещает в сентябре, год в анонсе не назван.

Почему это важно

Системы безопасности, совместимые с ZDR, до сих пор проверяли каждое взаимодействие с моделью по отдельности. По мере того как модели решают всё более длинные, сложные и агентные задачи, часть по-настоящему серьёзных рисков видна не в одном запросе, а только при сопоставлении нескольких связанных взаимодействий подряд: методичная проверка защитных механизмов на прочность, координация действий сразу с нескольких аккаунтов, маскировка угрозы под рутинное исследование или агент, который продолжает действовать после явной команды остановиться и тем самым выходит за рамки данных ему полномочий. При этом, по словам OpenAI, некоторые другие поставщики передовых моделей ставят клиентов перед выбором: либо разрешить провайдеру сохранять чувствительное содержимое ради мониторинга безопасности, либо остаться без такого мониторинга, а это для многих организаций прямо противоречит их собственным обязательствам по защите данных. Private Safety Processing и задуман как способ закрыть разрыв в мониторинге многошаговых рисков, не жертвуя обещанием нулевого хранения данных, которое отличает OpenAI на рынке корпоративных ИИ-сервисов.

Кому это важно

В первую очередь это касается компаний, которые уже работают или планируют работать с API OpenAI на условиях ZDR и при этом обязаны защищать чувствительные данные: финансовую отчётность, медицинские данные, конфиденциальные бизнес-планы, результаты исследований. Для таких организаций требование отдавать провайдеру ИИ содержимое запросов ради мониторинга безопасности часто прямо противоречит их регуляторным обязательствам или собственным обещаниям клиентам. OpenAI говорит, что развивает Private Safety Processing вместе с клиентами из разных отраслей, регионов и разного масштаба; один из них, компания Glean, приводится в тексте анонса с отзывом о работе с OpenAI. Важно это и самой OpenAI, для которой способность держать данные корпоративных клиентов закрытыми, не отказываясь при этом от мониторинга безопасности, служит конкурентным аргументом в продаже API бизнесу.

Как это применить

Пока это предпросмотр: Private Safety Processing тестируется с ограниченным числом ранних клиентов, а не доступна всем подряд. Технически предусмотрены два варианта хранения данных. В классическом варианте ZDR содержимое остаётся на инфраструктуре, которую контролирует сам клиент, как и раньше. Второй вариант OpenAI ещё разрабатывает: данные хранятся на инфраструктуре самой OpenAI, но шифруются ключами клиента, и копий этих ключей у сотрудников OpenAI нет. В обоих случаях, если автоматика находит риск, OpenAI получает не содержимое, а узко очерченный сигнал о типе активности, а клиент разбирается в причине по собственным логам и системам. Если нужно оспорить решение или помочь в расследовании подтверждённого злоупотребления, поделиться дополнительной информацией с OpenAI можно по собственному желанию, это не обязательное условие. OpenAI обещает и дальше согласовывать с клиентами технические и операционные детали до полноценного запуска, который вместе с техническим документом (white paper) о принципе работы запланирован на сентябрь; год в анонсе не указан.

Можно ли доверять

Всё, что известно о Private Safety Processing, пока исходит только от самой OpenAI: это официальный блог компании, без упоминания независимого технического аудита или подтверждения со стороны. Ключевые утверждения, что сотрудники OpenAI не имеют доступа к ключам шифрования и не видят содержимое даже при срабатывании сигнала риска, звучат убедительно, но технических подробностей о том, как устроено сопоставление паттернов между взаимодействиями, в анонсе нет: технический документ с деталями компания обещает опубликовать только в сентябре. До этого момента заявления нельзя проверить снаружи. Сама функция ещё предпросмотр, который тестируется с ограниченным числом ранних клиентов, а не отлаженная в реальной эксплуатации система. У обещания нулевого хранения данных есть и прямо названное исключение: изображения, помеченные как потенциальный CSAM, OpenAI по закону обязана сохранять для ручной проверки и отчётности даже в ZDR, и это единственная документированная оговорка к политике.

Риски и подводные камни

Обещание нулевого хранения не абсолютно: изображения, которые система помечает как потенциальный CSAM, по закону обязаны сохраняться для ручной проверки и отчётности, это исключение действует уже сейчас и останется в силе после запуска Private Safety Processing. OpenAI описывает сигнал о риске как узко очерченный, но не приводит ни одного примера того, что конкретно в нём содержится, поэтому со стороны оценить его реальную узость нельзя. Не описано и то, что происходит при ложном срабатывании: бремя разбирательства и решение, делиться ли дополнительной информацией с OpenAI, компания перекладывает на самого клиента, отдельного процесса проверки на своей стороне она не раскрывает. Вариант с хранением на инфраструктуре OpenAI и шифрованием ключами клиента ещё разрабатывается и пока недоступен: сегодня реально работает только классический вариант ZDR с инфраструктурой клиента. Наконец, по словам OpenAI, некоторые недавние развёртывания других поставщиков передовых моделей требуют от клиентов разрешить сохранение чувствительных данных ради мониторинга, но какие именно провайдеры имеются в виду, компания не называет, сравнить это напрямую не получится.

«Внедрение ИИ в корпоративном секторе целиком держится на том, что данные контролирует сам клиент, без прямого или производного использования за пределами выбранного сервиса. Обязательство OpenAI не использовать данные для обучения моделей и политика ZDR дают Glean уверенность работать с OpenAI. По мере роста возможностей моделей OpenAI показывает: уровень безопасности может расти, не жертвуя приватностью и контролем, на которых держится доверие корпоративных клиентов.»

— Glean