Антропик заявляет, что схема текстовых водяных знаков опирается на незначительные слова

вотермаркинг антропик клод ии закон ес Synthid theregister.com

Узнайте, как Anthropic внедряет вотермаркинг в Claude для соблюдения закона ЕС об ИИ: техника меняет несущественные слова, не влияя на качество текста. Поймите, почему метку легко удалить полной переработкой и как это снижает риски для бизнеса.

В рамках усилий по «маркировке» текста, сгенерированного Claude, и соблюдению Закона ЕС об ИИ, компания Anthropic в пятницу представила план изменения выбора слов своими ботами таким образом, чтобы это можно было обнаружить как продукт ИИ.

Традиционные вотермарки — это узоры или изображения, нанесённые на валюту, почтовые марки или официальные документы для подтверждения подлинности. В цифровой сфере этот термин более гибок и может обозначать различные методы нанесения идентификатора на электронные данные.

Подход Anthropic заключается во влиянии на несущественный выбор слов, совершаемый её моделями — эта техника представлена в статье SynthID-Text от Google DeepMind.

Если упрощённо, большие языковые модели — это продвинутые автодополнители, работающие на основе предсказания следующего слова в последовательности. Anthropic объясняет, что при построении вывода предложения вроде «Погода сегодня была холодной и…» такая модель, как Claude, может ответить словами «холодной» или «серой», но вряд ли ответит словом «сахарной».

Такова теория, но при фактической попытке завершить это предложение Claude Opus 4.8 слегка перестарался: «…бодрящей, такой холод, что пощипывает кончики пальцев и превращает дыхание в маленькие облачка. Небо было бледным, выцветшим, и всё казалось резким и чётким».

А затем он проверил, считают ли пользователи это полезным, спросив: «Хотите, чтобы я придал тексту определённую атмосферу — уютную, мрачную, весёлую? Или продолжить в том же тоне?»

Но уберите всё обучение, направленное на повышение вовлечённости и имитацию литературного стиля, — и по сути Claude делает именно это: предсказывает следующее слово в последовательности.

Anthropic утверждает, что в большинстве случаев пример предложения может быть завершён либо словом «холодный», либо «серый», и «смысл предложения в любом случае остаётся в значительной мере одинаковым».

Вотермарк генерируется путём отклонения от предсказанного слова к чему-то другому. Используется иной источник случайности, который можно обнаружить с помощью цифрового ключа.

Как поясняют исследователи Google DeepMind в своей статье: «Генеративная маркировка работает путём тщательной модификации процедуры выборки следующего токена, чтобы внедрить тонкие, контекстно-зависимые изменения в распределение генерируемого текста. Такие модификации вносят статистическую сигнатуру в сгенерированный текст; на этапе обнаружения вотермарка эта сигнатура может быть измерена, чтобы определить, был ли текст действительно сгенерирован маркированной LLM».

Anthropic настаивает, что это будет делаться с малозначимыми фрагментами текста, не меняя смысла. «Во внутреннем тестировании мы не заметили никакого влияния маркировки на содержание, уровень креативности или читабельность текста Claude», — заявила компания, добавив, что в контролируемом исследовании оценщики-люди не увидели разницы в качестве между маркированными и немаркированными ответами.

Это предположение зависит от того, что вотермарк не применяется к значимому тексту. Как поясняет Anthropic: «Маркировка реже применяется к фактическим фрагментам, где меньше вариантов выбора, которые можно сделать без снижения точности текста». Компания продолжает: аналогичная ситуация с кодом — алгоритм маркировки не может просто начать заменять имена методов.

В контексте литературы представление о том, что некоторые слова взаимозаменяемы, вероятно, вызовет негодование. Хотя может быть приятным мысленным экспериментом представить, как Claude выдаёт «Это было лучшее из времён, это было худшее из времён…» или «Позвони мне Измаил», любой, кто пытается выдать сгенерированный текст за серьёзное литературное произведение, вероятно, должен столкнуться с той социальной реакцией, которую может повлечь за собой маркировка.

С другой стороны, версия вотермаркинга от Anthropic не является чрезмерно навязчивой. Она не включает никакой личной информации и служит лишь для указания на то, что Claude, вероятно, участвовал на каком-то этапе создания размеченного текста.

Более того, ожидается, что данная техника будет лишь полуэффективной. В разделе FAQ компания Anthropic отмечает, что некоторый объём редактирования должен удалить вотермарк.

«Лёгкое редактирование, скорее всего, не удалит вотермарк полностью; полное переписывание, при котором заменяется каждое слово, — удалит, — говорит компания. — В последнем случае, конечно, спорно, можно ли по-прежнему считать текст сгенерированным ИИ».

По всей вероятности, Anthropic всё равно не волнует, можно ли обойти её схему маркировки. Из публикации компании ясно, что она внедряет эту меру, чтобы продемонстрировать попытки соблюдения требований, и выбрала решение, которое не увеличивает затраты.

«Маркировка оказывает незначительное влияние на скорость работы моделей, и, поскольку она не создаёт дополнительных токенов, стоимость обслуживания и использования модели остаётся прежней», — заявили в компании.

Хей, Claude, как ещё назвать демонстративное соблюдение требований? ®

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: