AI-компании, как сообщается, уничтожают миллионы книг после обучения на них ИИ-моделей

ии книги обучение уничтожение Isbndb датасеты tomshardware.com

Узнайте, как ИИ-компании скупают и уничтожают миллионы книг для обучения своих моделей. Расследование раскрывает масштабные закупки через посредников, игнорирование цен и этические проблемы. Читайте, чтобы понять последствия для сохранности знаний.

Внося вклад в растущий дефицитпамяти и накопителей, компании, занимающиеся ИИ, похоже, нашли новую цель: литературную историю человечества. Недавнее расследование 404 Media показывает, что эти компании, как сообщается, скупают миллионы подержанных книг через посредников, чтобы получить высококачественные обучающие данные для своих моделей ИИ, избегая общественного неодобрения.
ИИ полагается на огромные объёмы данных для развития, но не просто любых данных. Это должны быть высококачественные данные. Проблема в том, что посредственный контент, созданный ИИ, часто называемый «AI slop», распространился по всему Интернету. Такой контент загрязняет массив данных и контрпродуктивен для обучения ИИ. В результате ведущие ИИ-компании обратились к источникам знаний, написанным человеком, в частности к печатным источникам, изданным до 2022 года, которые с большей вероятностью содержат оригинальный, незагрязнённый контент.
Существует прецедент, когда ИИ-компании обращались к физическим книгам для обучения ИИ. Например, Anthropic, одна из ведущих ИИ-компаний, участвующая в судебном процессе, по сообщениям, вложила миллионы долларов в извлечение информации из бесчисленных печатных книг для создания своих моделей ИИ Claude, а затем уничтожала их. Компания покупала книги у Better World Books. Хотя судебное решение подтвердило, что использование книг для обучения ИИ подпадает под добросовестное использование в рамках авторского права, Anthropic столкнулась с ошеломляющим штрафом в 1,5 миллиарда долларов за хранение репозитория из семи миллионов пиратских книг, нарушавшего авторские права писателей и издателей. Аналогичным образом, коалиция издателей недавно подала иск против Google, обвиняя технологического гиганта в якобы незаконном использовании миллионов книг, защищённых авторским правом, для разработки своих моделей ИИ Gemini.
ISBNdb — онлайн-база данных, в которой, как сообщается, каталогизировано более 111 миллионов книг, долгое время была излюбленной платформой для книготорговцев, библиотек и дистрибьюторов для продажи книг. С ростом индустрии ИИ компания ISBNdb переориентировала свой бизнес на предоставление специализированных услуг по оптовой закупке книг для ИИ-компаний. Согласно 404 Media, заказы варьируются от 1 000 экземпляров до целого миллиона книг в одной сделке.
Один профессиональный книготорговец, пожелавший остаться анонимным, якобы рассказал 404 Media о беспрецедентном всплеске продаж книг, который начался в апреле этого года. Ранее продавец продавал около 20 книг за хорошую неделю, но за последние месяцы недельные продажи взлетели до нескольких сотен книг. Это представляет собой пятикратное увеличение по сравнению с обычным объёмом. Другие книготорговцы на таких платформах, как Alibris и Biblio, сообщили о подобных скачках оптовых закупок.
Хотя нет конкретных доказательств того, что закупки делает ISBNdb или какая-то другая ИИ-компания, есть некоторые тревожные сигналы. В частности, масштабные закупки включали только книги с Международным стандартным книжным номером (ISBN) — уникальным 13-значным кодом, используемым во всём мире для идентификации книг. Не было никаких закономерностей в отношении тематики, жанра или автора. Также казалось, что покупатели игнорировали цены на книги и скупали издания по любой цене, даже если они были завышены.
Во время судебного процесса Anthropic Том Харви, который ранее участвовал в создании Google Books, а затем возглавлял проект цифровизации Anthropic «Project Panama», подтвердил, что ИИ-компания наняла несколько компаний по сканированию документов. Одной из них была Datamation Information Services, которая предлагает услуги по высокообъёмному, неразрушающему и разрушающему сканированию книг. Первый метод использует различные инструменты, такие как сканеры с верхней подачей, планшетные сканеры или V-образные системы визуализации. Второй метод, напротив, предполагает, что персонал вырезает содержимое книг и подаёт отдельные страницы в высокоскоростной промышленный сканер. Логично, что ИИ-компании выбирают разрушающий путь, так как он более эффективен и дёшев. Результатом становится уничтожение миллионов книг.
Очевидно, что печатные книги представляют собой сокровищницу информации для ИИ. Однако многие спорят об этичности изъятия книг из обращения, поскольку неизвестно, отфильтровывают ли ИИ-компании редкие или даже распроданные книги от обычных изданий в процессе цифровизации. Другая серьёзная проблема заключается в том, что отсканированные книги напрямую попадают в частную базу данных для обучения ИИ, к которой широкая публика не имеет доступа. Да, мы получим более умный ИИ, но ценой того, что информация станет недоступна для будущих поколений.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: