Способность определять, был ли контент создан искусственным интеллектом, остается серьезной проблемой во всем мире. Технологические компании разработали более надежные способы встраивания невидимых водяных знаков в изображения и видео, что упрощает определение того, были ли они сгенерированы или изменены с помощью ИИ.
Однако определение того, был ли текст сгенерирован ИИ, остается серьезной технической проблемой даже для ведущих ИИ-лабораторий. На рынке существуют десятки инструментов, которые утверждают, что обнаруживают текст, сгенерированный ИИ, но их результаты часто ненадежны. По мере развития моделей ИИ эти внешние инструменты обнаружения могут стать еще менее эффективными.
Еще в 2024 году OpenAI подтвердила, что разработала метод наложения водяных знаков на текст, но не выпустила его широко. В то время существовали опасения по поводу того, как такая технология может повлиять на пользователей ChatGPT, включая студентов, чьи работы потенциально могли быть помечены как сгенерированные ИИ.
Сегодня OpenAI наконец внедряет наложение водяных знаков на текст для ChatGPT. Это в основном связано с Законом ЕС об искусственном интеллекте, который требует от поставщиков генеративных моделей ИИ делать контент, созданный ИИ, идентифицируемым в машиночитаемой форме.
С сегодняшнего дня клиенты OpenAI API по всему миру могут выбрать наложение водяных знаков на текст для определенных моделей. В течение следующих недель OpenAI также будет автоматически добавлять невидимые водяные знаки к соответствующему тексту ChatGPT и Codex, сгенерированному в Европейском Союзе.
Важно отметить, что водяной знак ChatGPT не будет добавлять скрытые символы, необычную пунктуацию, невидимые пробелы или дополнительные токены к выводу. Вместо этого техника OpenAI textGrain тонко изменяет статистический шаблон слов и токенов, выбранных моделью. При генерации текста модель ИИ обычно присваивает вероятности нескольким возможным следующим токенам. textGrain корректирует эти вероятности в соответствии с секретным шаблоном, побуждая модель выбирать определенные альтернативы.
OpenAI утверждает, что ее техника textGrain соответствовала или превосходила другие протестированные подходы, включая SynthID от Google для текста. Эта технология также будет предоставлена исследователям и другим организациям, чтобы они могли создавать инструменты для обнаружения текста, сгенерированного ИИ.
Однако OpenAI упомянула, что наложение водяных знаков на текст гораздо менее надежно, чем наложение водяных знаков на изображения или аудио. Чем короче текст, тем сложнее OpenAI определить, был ли он сгенерирован ИИ. По данным внутренних тестов, детектор OpenAI смог идентифицировать около 80% фрагментов объемом 200 токенов с водяными знаками и примерно 95% фрагментов объемом 400 токенов.
Даже небольшие правки могут значительно ослабить водяной знак. В тестах OpenAI замена всего 10% слов другими словами снизила скорость обнаружения с примерно 92% до 66%. Замена 25% слов снизила ее всего до 17%.
Чтобы избежать ложных срабатываний, приводящих к обвинениям, OpenAI упомянула, что обнаружение водяного знака не следует рассматривать как доказательство того, что кто-то просто скопировал весь текст из ChatGPT. Водяной знак может указывать на то, что модель OpenAI сгенерировала или обработала часть контента, но он не может определить, насколько обширно пользователь его отредактировал или сколько человеческого труда было вложено в конечный результат.
Помимо OpenAI, Anthropic также внедрил невидимые водяные знаки для текста в поддерживаемых моделях Claude в рамках усилий по соблюдению Закона ЕС об искусственном интеллекте.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pradeep Viswanathan




