Законно ли обучать модели ИИ на книгах, защищённых авторским правом? Всё не так однозначно

ии авторское право Fair Use судебные решения Anthropic обучение ии techcrunch.com

Суды пытаются применить закон 1976 года к ИИ. Штраф Anthropic в $1,5 млрд за пиратство — не приговор обучению, а сигнал. Узнайте, как доктрина fair use решает, чьи тексты можно использовать, и почему будущее генеративных моделей зависит от толкования «трансформативности».

Реальность не так проста. 

«Мне кажется, одна из проблем всей этой области права и всей этой области технологий в том, что происходит очень много всего, – рассказала TechCrunch Кэти Геллис, юрист, специализирующаяся на интеллектуальной собственности, авторском праве и технологиях. – Всё очень сложно, и вокруг происходящего бурлит много эмоций – как за, так и против».

В прошлом году в одном из первых решений подобного рода судья Уильям Алсуп обязал компанию Anthropic выплатить огромную компенсацию по авторским правам в размере 1,5 млрд долларов группе писателей, чьи произведения использовались для обучения ИИ-моделей компании. На первый взгляд это казалось моральной победой авторов, но на самом деле судья Алсуп постановил, что обучение ИИ Anthropic было законным. За что же Алсуп наказал Anthropic – так это за пиратство этих книг из нелегальных онлайн-теневых библиотек.

«Подобно любому читателю, стремящемуся стать писателем, LLM Anthropic обучались на произведениях не для того, чтобы опередить их и скопировать или заменить, – а чтобы свернуть за крутой поворот и создать нечто иное», – написал судья, сравнив способ, которым LLM поглощает триллионы слов, с изучением литературы писателем.

Геллис считает, что это решение более выгодно для ИИ-компаний. Что такое штраф в 1,5 млрд долларов для компании, прогнозирующей около 200 млрд долларов годовой выручки к 2028 году?

«Думаю, в целом это хорошая новость для обучения ИИ: он посмотрел на происходящее и фактически посчитал это аналогичным чтению охраняемого авторским правом произведения, а не его копированию, – отметила Геллис. – Закон об авторском праве строится на копировании, но не на использовании произведения, его просмотре, потреблении или чтении».

Закон об авторском праве не обновлялся с 1976 года, а значит, судьям приходится самостоятельно разбираться, как толковать нормы полувековой давности, сталкиваясь с юридическими вопросами, способными определить будущее ИИ-индустрии.

«Сейчас все очень обеспокоены, потому что закон противоречив, и причина в этом самом вопросе, – рассказал TechCrunch Джейсон Хендерсон, старший юрист и основатель практики IP и медиа в JWL International. – Все знают, что ИИ-модель обучалась на огромном количестве материалов, а законодательство за этим вопросом попросту не поспело».

Эти вопросы часто упираются в доктрину добросовестного использования (fair use) – а именно, является ли использование охраняемого авторским правом произведения достаточно «трансформативным», чтобы считаться юридически допустимым.

Добросовестное использование – это исключение из закона об авторском праве, которое позволяет использовать охраняемые материалы без явного разрешения, защищая возможность комментировать и развивать охраняемые произведения через критику, пародию, образование и другими способами. При решении вопроса о добросовестности использования судьи учитывают конкретные факторы, включая цель и характер произведения, объём использования и его влияние на рынок.

«Авторское право всегда направлено на защиту и рост рынка, – отметил Хендерсон. – Суды в своих аргументах [в делах об ИИ] во многом расходятся. Обычно побеждает следующее: если вы обучаетесь на чужой собственности с целью прямой конкуренции, то суды это не одобрят… Если же ваше использование не ведёт к конкуренции, суды скорее найдут способы признать его допустимым».

Хендерсон ссылается на дело, в котором медиа- и технологическая компания Thomson Reuters подала в суд на исследовательскую фирму Ross Intelligence за копирование своего контента с целью создания конкурирующей юридической платформы на базе ИИ.

«Использование Ross не является трансформативным, поскольку у него нет “дальнейшей цели или иного характера” по сравнению с Thomson Reuters», – написал судья Стефанос Бибас в прошлом году.

В том деле судья Бибас постановил, что обучение на контенте Reuters для создания новой платформы, которая напрямую конкурировала бы с ней, не является добросовестным использованием. Хотя авторы потенциально могут утверждать, что чат-боты конкурируют с ними, используя их произведения для генерации новых синтетических книг, этот аргумент пока не одержал победу в суде.

Когда речь заходит о взаимосвязи ИИ и авторского права, Геллис считает полезным сузить предмет обсуждения – то, как мы мыслим авторское право применительно к обучению ИИ, сильно отличается от того, как мы мыслим авторское право на контент, созданный ИИ.

В одном деле, Thaler v. Perlmutter, суд постановил, что если произведение создано ИИ на 100%, оно не подлежит авторскому праву, что открывает целый ящик Пандоры – как мы можем окончательно доказать, было ли произведение создано с помощью ИИ, и если да, то как узнать, какой процент был создан или при помощи ИИ?

«Если вы пишете свой роман в [Microsoft] Word и запускаете проверку орфографии, мы как-то спокойно воспринимаем мысль, что Word не владеет вашим романом, – сказала Геллис. – [ИИ] заставляет нас взглянуть на множество решений, которые мы некоторое время игнорировали».

Большинство ИИ-компаний всё ещё находятся в подвешенном состоянии из-за текущих судебных разбирательств по этим вопросам, а это значит, что окончательного решения этих проблем в ближайшее время не будет.

«Вы видите, что первые залпы оказываются влиятельными, и это влияние может быть сведено на нет, если другие суды примут иные решения, и для выяснения того, какое из них возобладает, потребуются более поздние стадии судебных процессов, – пояснила Геллис. – Но тем временем все эти решения формируют всё происходящее. ИИ-компаниям было бы довольно глупо их игнорировать».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: