OpenAI внедряет водяные знаки textGrain для текстов в ЕС

OpenAI рассказала, как будет выполнять требование AI Act (закона ЕС об ИИ): по нему поставщики генеративного ИИ должны делать сгенерированный текст машиночитаемо опознаваемым. Компания называет свой подход поэтапным и подчёркивает, что водяные знаки на тексте и их обнаружение остаются ранними технологиями со значительными ограничениями.
Три шага. Во-первых, с сегодняшнего дня клиенты API по всему миру могут по желанию включить водяные знаки для отдельных моделей (какие именно, не названо); по умолчанию в API функция остаётся выключенной. OpenAI также работает с облачными партнёрами, чтобы в ближайшие недели сделать водяные знаки доступными для выводов моделей через их сервисы. Во-вторых, в ближайшие недели невидимый водяной знак появится в подходящих текстовых ответах ChatGPT и Codex для пользователей всех тарифов, но только в Евросоюзе; глобальной настройкой по умолчанию на старте он не станет. В-третьих, открыт приём заявок на доступ к детектору: сначала его получат только одобренные исследователи и экспертные организации, по принципу «случай за случаем», в соответствии с Кодексом практики. Публично детектор не открывают из-за риска пропущенных знаков и ложных срабатываний. Инструмент сообщает лишь, обнаружен ли водяной знак OpenAI, и не раскрывает ни пользователя, ни его запросы и переписку. Эти ограничения касаются только текста: средства проверки изображений и аудио (openai.com/verify и Content Provenance API) остаются общедоступными.
Как это устроено. Технология textGrain добавляет невидимый статистический сигнал в выбор слов моделью, а детектор ищет этот сигнал. В собственных тестах OpenAI textGrain сравнялся с другими проверенными подходами или превзошёл их, включая SynthID для текста. Подробности обещаны в техническом отчёте, который обновят в ближайшие недели; компания также планирует открыть технологию (open source), но срока и репозитория не называет.
Цифры и ограничения. При целевой доле ложных срабатываний 1% детектор нашёл знак примерно в 80% отрывков по 200 токенов и примерно в 95% отрывков по 400 токенов (для таких текстов, как по психологии). Для математики показатели существенно ниже: там меньше свободы в выборе слов; чисел не приведено. Правка ослабляет знак: на отрывках по 400 токенов замена 10% слов синонимами снижает обнаружение примерно с 92% до 66%, замена 25% слов, до 17%. На бенчмарках, которыми OpenAI оценивает свою новейшую модель Astra, заметной разницы с водяным знаком и без него компания не видит.
Что знак не доказывает. По словам OpenAI, он не измеряет вклад человека, не определяет владельца и ответственного, не идентифицирует пользователя, аккаунт, запрос или беседу и не подтверждает правдивость текста. Отсутствие знака не доказывает, что текст написал человек: он мог быть слишком коротким, отредактированным или переведённым, создан неподдерживаемой моделью, до появления водяных знаков или инструментами другой компании. Для изображений и аудио OpenAI уже использует Content Credentials (соответствует C2PA) и невидимые водяные знаки SynthID. Компания обещает пересматривать подход по мере развития технологий, стандартов и доказательств.
Ключевые факты
- С сегодняшнего дня клиенты API по всему миру могут включить водяные знаки для отдельных моделей; по умолчанию функция в API выключена.
- В ближайшие недели невидимый водяной знак textGrain появится в подходящих текстах ChatGPT и Codex для всех тарифов, только в ЕС.
- Детектор пока доступен лишь одобренным исследователям и экспертным организациям; публично его не открывают из-за риска ошибок.
- При целевых 1% ложных срабатываний знак находят примерно в 80% отрывков по 200 токенов и в 95% по 400 токенов; замена 25% слов снижает обнаружение до 17%.
- Водяной знак не показывает вклад человека, не определяет автора или владельца, а его отсутствие не доказывает авторство человека.
Почему это важно
AI Act требует от поставщиков генеративного ИИ делать сгенерированный текст машиночитаемо опознаваемым. OpenAI публично показывает, как собирается это выполнять: ограниченно, только в ЕС для ChatGPT и Codex и по желанию клиента в API. Заодно компания откровенно описывает пределы технологии, а это редкость для заявлений о происхождении контента.
Кому это важно
Пользователям ChatGPT и Codex в Евросоюзе, чьи тексты в ближайшие недели получат невидимый знак. Разработчикам и компаниям на API OpenAI, которые решают, включать ли водяные знаки. Исследователям и экспертным организациям, которые могут подать заявку на доступ к детектору. Тем, кто занимается прозрачностью и происхождением контента.
Как это применить
Клиенты API могут включить водяные знаки для выбранных моделей (их список не назван): компания говорит, что так клиенты сами решают, как знаки вписываются в их обязательства по прозрачности. Исследователи и экспертные организации могут подать заявку на доступ к детектору; критерии одобрения и число допущенных не названы. Про цены и тарифы в тексте ничего не сказано.
Можно ли доверять
Это собственная публикация OpenAI: все оценки качества, включая превосходство textGrain над другими подходами и SynthID для текста, получены самой компанией. Независимых проверок, реакции регуляторов ЕС и внешних экспертов в материале нет. Цифры обнаружения приведены для конкретных условий; соотношение 95% и 92% для отрывков по 400 токенов в тексте не объяснено (оценки сделаны в разных постановках).
Риски и подводные камни
Знак легко ослабить правкой: замена 10% слов синонимами снижает обнаружение с примерно 92% до 66%, замена 25%, до 17%. Короткие и жёстко ограниченные тексты, например математические, определяются хуже. Отсутствие знака не доказывает, что текст написал человек, а наличие знака не говорит ни о владельце, ни о пользователе, ни о достоверности. Открытие технологии пока лишь планируется, без срока.
«Высокие результаты в идеальных условиях не гарантируют надёжного обнаружения в повседневном использовании.»
— OpenAI, «Our approach to EU text provenance rules»