OpenAI начнёт добавлять невидимые водяные знаки в тексты, созданные ChatGPT и Codex — пока только на территории Евросоюза. Технологию внедрят в ближайшие недели для пользователей всех тарифов — это связано с требованиями европейского закона об искусственном интеллекте.
Для маркировки компания разработала систему textGrain. Она незаметно встраивает статистический сигнал в то, какие слова модель выбирает при генерации текста. Специальный детектор затем может определить, присутствует ли в отрывке такой водяной знак. При этом обычным способом увидеть метку нельзя.
По оценкам OpenAI, технология практически не влияет на качество ответов. В тестах на модели Astra результаты с водяным знаком и без него оставались сопоставимыми в различных бенчмарках.
Однако у textGrain есть серьёзные ограничения. Чем короче текст и чем меньше вариантов его формулировки, тем сложнее обнаружить метку. Например, при допустимой доле ложных срабатываний в 1% детектор находил водяной знак примерно в 80% текстов длиной 200 токенов и примерно в 95% текстов на 400 токенов в заданиях по психологии. В математических текстах показатели были заметно ниже.
Редактирование тоже быстро ослабляет сигнал. В тестах с фрагментами длиной 400 токенов замена 10% слов синонимами снижала вероятность обнаружения водяного знака примерно с 92 до 66%, а замена четверти слов — до 17%. Поэтому отсутствие метки ещё не означает, что текст написал человек.
Водяной знак не содержит сведений о конкретном пользователе, его аккаунте, промптах или переписке. Он не показывает, насколько сильно человек отредактировал текст, кому принадлежит материал и соответствует ли написанное действительности.
Публичного доступа к детектору пока не будет. OpenAI сначала откроет его одобренным исследователям и профильным организациям, а позже планирует опубликовать технологию с открытым исходным кодом. Клиенты API по всему миру уже могут включать водяные знаки для некоторых моделей добровольно — по умолчанию функция там отключена.