«Google и Reddit не владеют интернетом», — заявил “web scraper” после победы в суде.

Google Reddit Dmca веб-скрапинг ии суд arstechnica.com

Google и Reddit используют DMCA для борьбы с веб-скрапингом, несмотря на проигрыш в суде. Узнайте, почему эксперты называют эту тактику ошибочной и чем это грозит открытому интернету.

После крупного судебного поражения на прошлой неделе Google подтвердил, что не намерен прекращать борьбу с ботами ИИ, собирающими данные из его результатов поиска. И Reddit, как ни странно, в этом участвует.

Любопытным образом ссылаясь на Закон об авторском праве в цифровую эпоху (DMCA), Google подал в суд на SerpApi в декабре прошлого года. Поисковый гигант обвинил сервис веб-скрапинга в обходе его антискрапинговой технологии и последующей продаже контента, извлеченного из результатов поиска Google, через неавторизованный программный сервис «Google Search API».

По словам Google, антискрапинговая технология была установлена для защиты авторских прав на контент в результатах поиска. Якобы обход технологии SerpApi угрожал нарушить отношения Google с правообладателями, в том числе с теми, кто лицензирует контент для показа в так называемых «панелях знаний», которые отображаются в некоторых результатах поиска для известных людей или организаций.

Это было странное применение DMCA, поскольку результаты поиска Google не могут быть защищены авторским правом. Но Google, очевидно, осмелел, решив опробовать эту юридическую теорию после того, как Reddit в октябре подал очень похожий иск, обвинив SerpApi и конкурента Google — Perplexity в сборе контента Reddit, отображаемого в результатах Google.

В блоге Google сослался на иск Reddit, объявляя о собственном иске, который, по его словам, был подан как «крайняя мера» для блокировки «вредоносного скрапинга», нарушающего права правообладателей выбирать, кто может иметь доступ к их контенту.

В частности, Google утверждал, что обход технологии SerpApi нарушил его условия и сделал невозможным извлечение прибыли — или компенсацию затрат — на «миллиарды» бот-запросов. А до этого Reddit заявлял, что SerpApi обходит два уровня защиты: собственные средства Reddit, блокирующие скрапинг на его платформе, и средства Google, блокирующие скрапинг контента Reddit в результатах поиска.

Мередит Роуз, старший советник по политике, специализирующаяся на DMCA в некоммерческой организации общественных интересов Public Knowledge, рассказала Ars, что Google и Reddit, похоже, «хватаются за любой доступный инструмент» перед лицом внезапного и непрерывного роста ИИ-скрапинга за последние три года. И хотя то, как они используют DMCA, «странно» — и «не совсем то, что закон предполагал в качестве сценария использования», — по ее словам, это не «удивительно». Исторически DMCA был эффективным инструментом для быстрого пресечения нежелательного использования контента и принуждения к переговорам о лицензировании, поэтому обращение к нему могло быть очевидной отправной точкой, учитывая цели Google.

,

Но необычные аргументы Google и Reddit по DMCA, похоже, не выигрышные. На прошлой неделе суд предпринял довольно редкий шаг, удовлетворив ходатайство SerpApi о прекращении дела на очень ранней стадии иска Google. В этом деле судья постановил, что у Google нет права подавать иск по DMCA против SerpApi, поскольку он не владеет никаким контентом в результатах поиска и не доказал, что действует от имени каких-либо правообладателей.

«Это происходит не так уж часто», — сказала Роуз Ars. «По сути, все свелось к тому, что Google недостаточно подробно описал, что именно он защищает, что является объектом авторского права».

Вероятно, время принятия этого решения было не лучшим для Reddit, который в прошлый четверг столкнулся с заседанием по ходатайству SerpApi о прекращении его иска. Неясно, в чью пользу суд вынесет решение в этом деле, но Роуз сказала Ars, что решение по делу Google не сулит Reddit ничего хорошего, поскольку Reddit не может утверждать, что является владельцем контента или исключительным лицензиатом контента в результатах поиска.

«Судья по делу Google сказал: „Чтобы иметь право подавать иск по DMCA, вы должны быть владельцем авторских прав, или исключительным лицензиатом, или лицом, которое развертывает и производит рассматриваемую меру технологической защиты“», — сказала Роуз Ars. «Reddit не является ни одним из этих лиц».

SerpApi надеется, что борьба скоро закончится, заявив Ars, что дорогостоящая судебная тяжба стоит того, чтобы отстаивать открытый веб.

«Суть в том, что и Google, и Reddit, похоже, пытаются использовать DMCA, чтобы отгородить открытый интернет, задним числом заявляя права на контент, который они не создавали и которым не владеют», — сообщил SerpApi Ars.

,

Последний шанс Google сохранить борьбу

Хотя Роуз согласилась с SerpApi в том, что, удовлетворив ходатайство о прекращении дела, суд одержал для SerpApi большую победу, борьба еще не окончена, поскольку у Google есть узкий путь для продолжения войны против веб-скрапинга.

Google признал, что результаты поиска не могут быть защищены авторским правом, но утверждал, что «панели знаний» иногда включают контент, защищенный авторским правом, который Google лицензирует у правообладателей. Если Google сможет внести изменения в свою жалобу, утверждая, что правообладатели напрямую уполномочили Google использовать его антискрапинговую технологию для предотвращения несанкционированного доступа к контенту, то Google, возможно, сможет заблокировать очень ограниченный объем скрапинга SerpApi.

Представитель Google Хосе Кастаньеда сообщил Ars, что Google планирует внести изменения в жалобу и «рад видеть, что Суд отклонил почти все юридические аргументы SerpApi», которые в противном случае пытались оспорить право Google на подачу иска.

«Мы с нетерпением ждем возможности подать уточненную жалобу, как нас пригласил суд, и мы по-прежнему стремимся защищать наши сервисы и партнеров от несанкционированного доступа», — сказал Кастаньеда.

Однако Роуз сказала Ars, что Google «загнал себя в некоторый угол в этом деле, как в этом судебном процессе, так и исторически».

Для Google может быть «очень опасно» утверждать, что «панель знаний» «набита защищенным авторским правом материалом», предположила Роуз. Поскольку поисковый гигант не лицензирует весь контент в панели знаний, Google может столкнуться с будущими исками, если действие алгоритмического создания панели знаний без лицензий внезапно будет сочтено нарушением, сказала Роуз.

«Им нужно как-то аргументировать, что есть части, которые являются воспроизведением материалов, защищенных авторским правом, но единственные части, которые являются воспроизведением таких материалов, — это те, которые они явно лицензировали», — предположила Роуз. «В противном случае они признают, что воспроизводили материалы без лицензии, и это втягивает их в другую борьбу за добросовестное использование, которую они, вероятно, не хотят вести».

,

Google дали 21 день на внесение изменений в жалобу, после чего станет яснее, как он планирует пройти по лезвию ножа, чтобы продолжить свою борьбу по DMCA.

SerpApi называет борьбу «ошибочной»

Reddit не ответил на запросы Ars о комментариях, но в заявлении, поданном перед слушанием на прошлой неделе, утверждал, что готов обсудить, как проигрыш Google в суде повлиял на его дело.

Возможно, показательно, что SerpApi сообщил, что Reddit не присутствовал в зале суда. SerpApi не стал много комментировать аргументы Reddit на слушании, но сказал, что судья, похоже, сосредоточился на нюансах правовых вопросов. В частности, судья, казалось, интересовался, действительно ли соглашение Reddit с Google уполномочивало Google защищать его контент, защищенный авторским правом.

Таким образом, оба суда, похоже, несколько сузили борьбу до этого ключевого вопроса, но SerpApi, похоже, уверен, что ни Google, ни Reddit не смогут предоставить доказательства того, что сбор данных из общедоступных результатов поиска наносит вред правообладателям.

Отвечая на вопрос о планах Google внести изменения в жалобу, SerpApi сообщил Ars, что, возможно, нет особого смысла продолжать спорить о «фрагментах текста, которые появляются в панелях знаний Google» после того, как Google начал атаку якобы для защиты «сотен тысяч издателей», которые появляются в результатах поиска.

«Мы надеемся, что Google откажется от этой ошибочной атаки на открытый интернет, но при необходимости мы готовы защищать SerpApi, наших клиентов и наши принципы», — заявил SerpApi.

SerpApi сообщил Ars, что его бизнес продолжал расти, пока он вел судебные процессы по DMCA, но его клиенты, включая таких технологических гигантов, как Nvidia, Uber и Adobe, столкнулись с неопределенностью, пока оба дела тянутся.

,

Они «полагаются на SerpApi каждый день для получения структурированного доступа к поисковым данным, что является и всегда было законным и легитимным бизнесом», — заявил SerpApi.

Эксперт: право SerpApi защищать открытый веб

Помимо собственных клиентов, люди, заинтересованные в открытом вебе, также задумались о том, каким может быть влияние победы Google, предположил SerpApi.

«Конечно, судебные разбирательства невероятно дороги и разрушительны», — сказал SerpApi. «Однако мы твердо уверены, что такие платформы, как Google и Reddit, не владеют интернетом, и их попытки использовать DMCA в качестве оружия угрожают всем пользователям открытого веба».

Роуз сказала Ars, что, хотя SerpApi, возможно, не «снискал симпатии многих людей», она считает, что «с точки зрения политики они правы».

Начиная с лета 2023 года, когда началась своего рода «API-апокалипсис», издатели стали отрезать доступ к открытому вебу, пытаясь найти способы быстро остановить массовый ИИ-скрапинг, подобный тому, что делает SerpApi, сказала Роуз.

«Эта массовая реакция на скрапинг» привела к «повторному закрытию значительной части веба», — сказала Роуз. И, что вызывает беспокойство, это не только затрудняет обучение ИИ, но и наносит вред исследованиям, архивированию, журналистике, отчетам о здоровье населения и другой важной работе, которая зависит от анонимного обхода и автоматического сбора данных в больших масштабах, сказала Роуз.

SerpApi сообщил Ars, что получил «огромное количество положительных отзывов» от своих клиентов, исследователей и SEO-специалистов в поддержку своих усилий по защите от исков Google и Reddit. Сервис веб-скрапинга оптимистично настроен на то, что суд удовлетворит его ходатайство о прекращении дела против Reddit, и на прошлой неделе праздновал то, что иск Google может продолжаться только по очень ограниченным требованиям.

,

В качестве победы SerpApi предупредил, что Reddit намеревается действовать как «сборщик платы», требуя платежей за скрапинг, хотя он даже не владеет контентом.

«Reddit стремится консолидировать свой контроль над контентом пользователей, чтобы получить лучшую позицию для налогообложения этого контента. Reddit не действует, чтобы защитить своих пользователей; Reddit расчищает путь для их эксплуатации», — предупредил SerpApi.

Аналогичным образом SerpApi обвинил Google в том, что он просит суд игнорировать тот факт, что он является «крупнейшим скрапером на планете», одновременно соглашаясь отрезать другие веб-скраперы от информации, которая является «100% публичной».

Для Роуз нет победителей для онлайн-пользователей, если в конце борьбы публичный доступ к данным будет отрезан.

«Это очень тревожное время», — сказала Роуз, признавая, что не только Reddit и Google, но и многие издатели по всему вебу в настоящее время испытывают искушение использовать «любой доступный инструмент, чтобы подавить» ИИ-скрапинг.

Некоторые издатели могут быть финансово мотивированы, как Google и Reddit, в то время как другие могут защищать свою инфраструктуру или занимать моральную позицию, сказала Роуз. Какова бы ни была мотивация, «это приводит к таким более широким последствиям для всей экосистемы — повторному закрытию», — предупредила она.

И хотя SerpApi ожидает победы, проблема с делами по DMCA, по ее словам, заключается в том, что результат может быть трудно предсказать.

«Мне очень любопытно, как это будет развиваться с Reddit», — сказала Роуз. «Я всегда немного цинична, потому что в какой-то мере, когда вы попадаете в сферу авторского права, многие судьи просто решают, что это все „вибрации“».

Advance Publications, которая владеет Condé Nast, материнской компанией Ars Technica, является крупнейшим акционером Reddit.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: