OpenAI Privacy Filter: независимая проверка нашла провалы на кириллице и арабском

Исследователи провели первую независимую систематическую проверку Privacy Filter, двунаправленного детектора персональных данных (PII) от OpenAI на 1,5 млрд параметров. Модель без дополнительного дообучения (zero-shot) протестировали на 42 синтетических бенчмарках, охватывающих 22 языка и 5 предметных областей, и сравнили с тремя альтернативами: Presidio, XLM-RoBERTa и GPT-4o.

На бенчмарке AI4Privacy OPF показал F1=0,855, заметно выше Presidio (0,431) и XLM-RoBERTa (0,269). На медицинском бенчмарке SPY результат ниже: F1=0,464 у OPF против 0,273 у Presidio и 0,111 у XLM-RoBERTa. Но при распознавании именованных сущностей (NER) на 13 индийских и других не-латинских языках XLM-RoBERTa обошёл OPF во всех 13 случаях. Хуже того, когда персональные данные встроены в связный повествовательный текст, а не в структурированные поля, качество OPF на NER-бенчмарках падает до диапазона F1=0,04, 0,57, а для нелатинских алфавитов результат почти нулевой: 0,04 на арабском и 0,03 на кириллице.

В медицинских, юридических и финансовых текстах точнее оказался GPT-4o, в среднем F1=0,643 на бенчмарках SPY и 0,527 на Gretel. Сам OPF при этом лидирует на структурированных синтетических данных (среднее F1=0,71) и в текстах поддержки клиентов (F1=0,60). По типам данных OPF сильнее всего на структурно регулярных полях, email (0,78) и телефон (0,76), и слабее всего на культурно изменчивых: имена людей (0,40) и адреса (0,49).

Авторы также отмечают смещение модели в сторону полноты в ущерб точности на медицинских, юридических данных и в поддержке клиентов: точность там держится в диапазоне 0,31, 0,54 при полноте 0,70, 0,85. По всем доменам вместе взятым точность OPF колеблется от 0,31 до 0,86. Авторы работы, дата публикации и институциональная принадлежность в тексте не указаны; из 42 бенчмарков поимённо названы только три (AI4Privacy, SPY и Gretel), методика построения остальных не раскрыта.

Ключевые факты

  • Независимая оценка на 42 синтетических бенчмарках, 22 языках и 5 доменах сравнила Privacy Filter OpenAI (1,5 млрд параметров) с Presidio, XLM-RoBERTa и GPT-4o
  • На AI4Privacy OPF без дообучения получил F1=0,855 против 0,431 у Presidio и 0,269 у XLM-RoBERTa; на медицинском бенчмарке SPY, 0,464 против 0,273 и 0,111
  • На распознавании именованных сущностей в 13 индийских и других не-латинских языках XLM-RoBERTa обошёл OPF во всех случаях; на кириллице F1 OPF падает до 0,03, на арабском, до 0,04
  • В медицинских, юридических и финансовых текстах точнее оказался GPT-4o (в среднем 0,643 на SPY, 0,527 на Gretel), а OPF лидирует на структурированных синтетических данных (0,71) и в поддержке клиентов (0,60)
  • OPF смещён в сторону полноты в ущерб точности на медицинских, юридических и клиентских данных: точность 0,31, 0,54 при полноте 0,70, 0,85; общая точность по всем доменам, от 0,31 до 0,86

Почему это важно

Это первая независимая проверка встроенного в продукты OpenAI фильтра персональных данных, до сих пор о его качестве судили в основном по заявлениям разработчика. Результат показывает, что защита данных работает неровно и сильно зависит от языка текста и того, оформлены ли данные как структурированное поле или как часть связного повествования.

Кому это важно

Разработчикам, которые встраивают Privacy Filter или похожие модели в продукты с пользователями из разных стран, особенно с текстом на кириллице, арабском или индийских языках, а также командам, работающим с медицинскими, юридическими и финансовыми данными, где цена пропущенного или ложно найденного PII высока.

Как это применить

Полагаться на OPF как на единственный фильтр для не-латинских языков (кириллица, арабский, индийские языки) рискованно, там F1 падает почти до нуля. Для текста в форме повествования, а не структурированных полей, нужна дополнительная проверка. Для медицинских, юридических и финансовых данных в тесте точнее оказался GPT-4o, а для структурированных данных вроде email и телефона, сам OPF.

Можно ли доверять

Оценка систематическая, 42 бенчмарка, 22 языка, 5 доменов, сравнение сразу с тремя альтернативными системами. Но в доступном тексте не указаны авторы, их принадлежность и дата публикации, а из 42 бенчмарков поимённо названы лишь три; как построены остальные, не раскрыто, что мешает независимо оценить методологию по одному только этому описанию.

Риски и подводные камни

Смещение в сторону полноты (точность 0,31, 0,54 при полноте 0,70, 0,85 на медицинских, юридических и клиентских данных) означает много ложных срабатываний, избыточную блокировку контента. Обратная сторона, почти нулевое распознавание PII на кириллице (0,03) и арабском (0,04): персональные данные пользователей этих языков рискуют остаться незамеченными. Общая точность по доменам колеблется от 0,31 до 0,86, то есть надёжность фильтра сильно зависит от конкретного сценария использования.