Согласно иску, высокопоставленный руководитель Microsoft в частном порядке назвал методы обучения ИИ компаний «воровством», а руководство OpenAI заявило, что их модели ИИ представляют «экзистенциальную угрозу» для издателей и журналистов, чьи работы использовались для их обучения.
В раскрытых материалах также подробно описывается, как компании предположительно получили и использовали этот контент, незаметно обходя платные стены, создавая наборы данных для обучения путем массового скрапинга и намеренно удаляя уведомления об авторских правах из данных для обучения.
Стоит отметить, что большая часть новой информации поступает из собственной краткой записи The Times, а не из основных экспонатов, которые остаются закрытыми. Приведенные ниже цитаты представлены без оригинального контекста.
Неотредактированное заявление является последней эскалацией в трехлетнем судебном процессе, в котором The New York Times первоначально утверждала, что фирмы нарушили закон об авторском праве, обучая генеративные модели ИИ на ее контенте.
Вопрос о том, могут ли ИИ-компании законно использовать материалы, защищенные авторским правом, для обучения ИИ, не имеет однозначного ответа, но судьи в основном благосклонно относились к аргументам ИИ-компаний о том, что обучение является «добросовестным использованием». Это правовое правило позволяет людям использовать материалы, защищенные авторским правом, без разрешения в определенных случаях, таких как пародия, освещение новостей или критика. Ранее в этом месяце администрация Трампа представила краткую запись в защиту нелицензионного использования OpenAI материалов, защищенных авторским правом, для обучения своих LLM.
Однако несколько новых признаний противоречат защите добросовестного использования OpenAI, особенно требованию правила о том, что использование не заменяет и не наносит ущерб рынку оригинальной работы.
Например, собственные данные Microsoft показывают, что ее «движок ответов» Copilot привел к снижению коэффициента кликабельности домена The New York Times до 93% по сравнению с традиционным поиском Bing. Во внутренней презентации Microsoft, написанной директором по прикладным наукам Microsoft Брентом Хектом в январе 2024 года, это снижение описывается как «петля гибели», которая «одновременно повредит производительности наших моделей и всего Интернета».
«Крайне необычно, что конечный продукт угрожает экономическим основам своих основных поставщиков, но именно такую ситуацию мы создали для нашего бизнеса LLM в отношении его «цепочки поставок контента», — говорится в документе Microsoft, цитируемом в заявлении.
Генеральный директор Microsoft Сатья Наделла также засвидетельствовал на допросе ранее в этом году, что «все, что находится за платным доступом, должно быть лицензировано всеми, кто хочет его использовать… для обоснования или обучения», и дал понять, что, если бы ему «сообщили, что OpenAI скрапила и обучилась на информации, которая была за платным доступом», он бы «воспользовался [правом Microsoft] потребовать от OpenAI переобучить свои модели».
Другие признания противоречат различным аспектам теста на добросовестное использование: руководитель ChatGPT OpenAI Ник Турли написал во внутреннем сообщении, что издатели сталкиваются с «экзистенциальной угрозой» со стороны таких продуктов, как чат-бот, которые «в значительной степени являются заменой» и «будут становиться все более заменой по мере их улучшения».
Президент OpenAI Грег Брокман описал модели как «отличные в новостях». Наделла согласился под присягой ранее в этом году, что общение с чат-ботами «заменило… предоставление вам информации прямо на веб-сайте на платформе ИИ вместо необходимости обращаться к исходному источнику».
Такой язык говорит о том, как технология может напрямую конкурировать с оригинальной работой, а не трансформировать ее.
Документ Microsoft гласит, что существует «реальный риск» того, что генеративный ИИ может «существенно нарушить занятость тех самых людей, которые создали данные, на которых был обучен фундаментальная модель».
Поражает сам масштаб копирования. Документы впервые раскрывают, что только наборы данных OpenAI для промежуточного обучения содержат более 91 692 копий работ, опубликованных NYT, Daily News и Center for Investigative Reporting. Набор данных, полученный из Common Crawl, включал более 2 миллионов документов только с nytimes.com.
В служебной записке от января 2023 года Хект назвал это «поразительным воровством беспрецедентных масштабов» и «крупнейшим воровством труда в истории человечества».
В заявлении подробно излагается, как OpenAI и Microsoft приобретали контент истцов, в том числе путем скрапинга из Bing Index.
«OpenAI предоставила весь набор данных для обучения GPT-3 Microsoft, который Microsoft использовала для оценки того, как внедрить модели OpenAI в свои собственные коммерческие продукты», — говорится в заявлении. «Microsoft аналогично предоставила данные для обучения OpenAI в рамках инициатив под названием Project Taxi и Project Mango».
Компании предположительно собрали данные Project Mango в набор данных для обучения, который содержит копии по крайней мере 160 903 уникальных работ от новостных издателей.
Чтобы получить максимальную отдачу от своего скрапинга, сотрудники OpenAI якобы разработали план по незаметному обходу платных стен. Заявления показывают, что когда исследователь OpenAI Ник Райдер сообщил Брокману о «хаке для обхода платного доступа nytimes», Брокман ответил: «а, хорошо».
Сотрудники OpenAI также предположительно создали наборы данных для обучения, такие как WebText и WebText2, которые непропорционально опирались на скрапленный новостной контент. Они также предположительно извлекли миллионы статей из Common Crawl, бесплатного открытого репозитория данных веб-сканирования. Выводы также описывают преднамеренные усилия по удалению уведомлений об авторских правах из данных для обучения до того, как они достигли модели, поскольку исследователи «не хотели бы, чтобы модель выводила» «уведомления об авторских правах» пользователям.
OpenAI и Microsoft не ответили на запросы о комментариях.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Rebecca Bellan




