Компания Anthropic объявила, что вскоре начнёт маркировать водяными знаками контент, который обрабатывается (а не только генерируется!) любой из её моделей. В статье поддержки Anthropic пояснила, что внедряет машиночитаемые водяные знаки для соблюдения Закона ЕС об искусственном интеллекте, который требует от всех поставщиков систем ИИ маркировать созданные или изменённые с помощью ИИ аудио-, изображения, текст и видео. Закон распространяется на любые модели ИИ, выпущенные после 2 августа, и предоставляет льготный период до декабря 2026 года для обновления ранее выпущенных моделей.
Anthropic подтвердила, что впредь все новые модели, предлагаемые по всему миру (не только в ЕС), будут маркировать созданный ИИ контент «с первого дня». Текстовые результаты будут «содержать встроенные водяные знаки», невидимые для пользователя, а другие «сгенерированные файлы будут включать цифровые метаданные происхождения, где это поддерживается», — заявили в Anthropic.
Примечательно, что Anthropic применяет подход «выжечь всё дотла», нанося водяные знаки на весь обработанный контент, где это возможно, хотя ЕС не требует этого в случаях, когда ИИ выполняет «вспомогательную функцию для стандартного редактирования» (в руководстве приводится пример грамматической коррекции) или не «существенно изменяет» текст пользователя или его смысл. Водяной знак на уровне модели не может отличить полную генерацию от исправления запятой, поэтому Claude может в итоге ставить штамп именно на тот контент, который закон предписывал не трогать. Насколько тщательно будут наноситься водяные знаки, станет известно только после того, как Anthropic выпустит инструмент обнаружения, который можно будет протестировать. Компания заявила, что планирует в конечном счёте поделиться подробностями о том, как обнаруживать метки, чтобы обеспечить техническую поддержку, требуемую законом ЕС.
Anthropic также отметила, что водяные знаки не будут работать на «некоторых платформах или функциях», которые их не поддерживают. Для нетекстового контента Anthropic будет использовать метаданные C2PA для фиксации происхождения.
,
Легко обойти, легко неверно истолковать
Описанный ЕС и реализованный Anthropic подход, к сожалению, тривиально легко обойти злоумышленникам, при этом он может наказать пользователей, которые доверяют системе точной маркировке результатов. Текстовые водяные знаки работают за счёт смещения выбора слов модели в определённом шаблоне, распределённом по всему документу, который можно обнаружить только в совокупности с помощью правильного инструмента. Загвоздка в том, что «невидимый» может также означать, что модель иногда выбирает не самое лучшее слово, а чуть хуже, лишь бы сохранить сигнал. Anthropic отметила, что эти метки «будут перемещаться вместе с текстом при его копировании и вставке в другое место и могут сохраняться при некотором редактировании». Но если текст с водяным знаком вставить в другую чат-систему, которая его отредактирует, водяной знак может быть уничтожен. Для изображений и видео достаточно сделать скриншот/запись или использовать любой приличный редактор метаданных, чтобы удалить эту информацию. А как только Anthropic расскажет миру, как идентифицировать эти водяные знаки, создать систему для их удаления будет тривиально.
Кроме того, вероятность неверного толкования высока: водяной знак не очень информативен. Anthropic пояснила, что «обнаруженная метка даёт сигнал о том, что контент был обработан Claude, но не является полностью окончательным». Единственное реальное сообщение, которое передаёт метка, — это «контент мог быть обработан Claude», — заявили в Anthropic, и метка может даже появиться на контенте, который не был создан Claude. Вдобавок к этому есть широкая публика, которая может не понимать разницы между обработанным текстом и полностью сгенерированным. Если система ставит водяной знак на текст, написанный человеком, только потому, что он был отредактирован в рабочем процессе, который затрагивает Claude, внезапно он получает то же обозначение, что и полностью сгенерированный текст. И всё это в системе, где «отсутствие обнаруженной метки не означает, что контент не был создан или обработан ИИ», — заявили в Anthropic.
,
Claude может маркировать больше ИИ-контента, чем требуется
Надо отдать должное Anthropic: компания признаёт, что может маркировать контент, который Закон об ИИ не требует помечать: «люди часто используют Claude для вычитки, перевода, обобщения или преобразования файлов. Результат может содержать метку Claude, даже если исходные идеи, текст или данные получены из другого источника». Таким образом, несмотря на явное освобождение от требований закона, Claude будет маркировать любую редакторскую работу, выполненную над оригинальным текстом.
Если водяные знаки станут универсальным средством для любого использования Claude — от проверки орфографии до полных переписываний, — решение Anthropic, скорее всего, будет раздражать пользователей, заходя дальше необходимого в маркировке контента, что может случайно запутать происхождение. Например, учитель или профессор не должен интерпретировать этот сигнал водяного знака иначе, чем «ИИ коснулся этого», но легко представить, что они будут. В конце концов, какой смысл в водяном знаке, который не может отличить лёгкое редактирование от полностью сгенерированного текста?
Вопрос становится ещё более запутанным, если обратиться к другому разделу Закона ЕС об ИИ, 50(4), который определяет, как публикующие такой текст должны явно маркировать контент. Согласно их режиму маркировки, полностью сгенерированный ИИ текст не требует маркировки в большинстве случаев. Написанный ИИ роман? Без маркировки. Маркетинговые тексты, созданные ИИ? Нет. Но если текст предназначен для «информирования общественности по вопросам, представляющим общественный интерес», его необходимо маркировать если только человек не проверил его редакторски (то есть редактор известен и несёт ответственность). Итак, мы имеем странную ситуацию: на уровне модели — «водяные знаки на всё», а на уровне публичного раскрытия — «вы не обязаны маркировать этот ИИ-текст, если его посмотрел Джо».
,
Ars обратилась к Anthropic с вопросом, есть ли сроки публикации подробностей об обнаружении или результаты тестирования, которыми компания может поделиться, оценивающие вероятность ложных срабатываний или пропусков. Мы также спросили, может ли Anthropic пояснить, как её водяные знаки могут конфликтовать со стандартным редактированием и другими исключениями из Закона об ИИ, но Anthropic пока не ответила.
Веселье только начинается
В ЕС требования прозрачности призваны гарантировать, что такие инструменты ИИ, как Claude, не нарушат «целостность и доверие к информационной экосистеме, создавая новые риски дезинформации и манипуляций в масштабе, мошенничества, выдачи себя за других и обмана потребителей». В одной статье поддержки ЕС прогнозировалось, что эти обязательства станут «основной проблемой соблюдения требований» для многих компаний, работающих в сфере ИИ.
«Люди должны знать, когда они взаимодействуют с ИИ или подвергаются воздействию контента, созданного ИИ», — говорится в руководстве Европейской комиссии. «Это поможет им принимать обоснованные решения, корректировать своё доверие и полагаться на ИИ, а также избегать дезинформации или обмана». Тем не менее это трудно согласовать с тем фактом, что полностью сгенерированная статья по общественно значимому вопросу получает водяной знак, но не метку для читателя, если редактор должным образом её проверил.
Ожидается, что такие компании, как Anthropic, лучше всего подходят для разработки решений по нанесению водяных знаков, поскольку ИИ быстро развивается, и существует «необходимость в новых методах и техниках для отслеживания происхождения информации».
Но это в значительной степени оставляет общественную ценность таких меток на усмотрение технологических компаний, при этом ЕС лишь оговаривает, что «техники и методы должны быть достаточно надёжными, совместимыми, эффективными и устойчивыми, насколько это технически возможно».
В своей публикации Anthropic заявила, что планирует продолжать работу над своими водяными знаками и методами обнаружения, соответствующими требованиям ЕС. Если метки Claude окажутся неэффективными, Закон об ИИ предусматривает серьёзные штрафы за нарушения, включая штрафы до 15 миллионов евро или 3% от годового мирового дохода компании.
Главный редактор Ars Кен Фишер внёс свой вклад в этот отчёт.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Ashley Belanger




