OpenAI объявила, что в ближайшие недели начнёт добавлять невидимые водяные знаки в текстовые ответы ChatGPT и Codex для пользователей Евросоюза. Маркировку введут на всех тарифах для выполнения требований европейского закона об ИИ — AI Act.
За пределами ЕС компания пока не планирует включать её по умолчанию. Разработчики, которые используют API, уже могут активировать водяные знаки для поддерживаемых моделей в любой стране. Детали в материале Postium.
Читайте также: Как заставить ИИ писать как человек
Как работают водяные знаки в ChatGPT
Технология OpenAI называется textGrain. Во время генерации она слегка меняет выбор слов и их частей. В результате в тексте появляется статистический рисунок, который может распознать специальный детектор.
Читатель метку не видит: система не добавляет скрытые символы, невидимые пробелы или необычную пунктуацию. Обычное копирование текста и очистка форматирования сохраняют водяной знак.
Метка указывает, что модель OpenAI могла сгенерировать или обработать текст. Она не раскрывает аккаунт, запрос или переписку пользователя и не показывает, сколько работы выполнил человек.
Насколько точна проверка? Детектор лучше распознаёт длинные тексты, в которых модель свободно выбирает формулировки. В тестах OpenAI на темах вроде психологии он находил метку примерно в 80% фрагментов длиной 200 токенов и в 95% фрагментов длиной 400 токенов — при заданной доле ложных срабатываний 1%. Для математических ответов результаты были существенно ниже.
Редактура ослабляет водяной знак. В отдельном тесте англоязычных фрагментов длиной 400 токенов замена 10% слов синонимами снизила долю обнаруженных меток примерно с 92% до 66%, а замена 25% — до 17%. Гарантии удаления метки такая замена не даёт.
Ранее водяные знаки в ответы Claude начала добавлять Anthropic. У неё маркировка действует по всему миру, включая приложение, API и Claude Code. Детектор Claude доступен ограниченному кругу организаций.