Книготорговцы подозревают, что ИИ-компании скупают и уничтожают редкие книги

ии книги технологии авторское право книготорговля сохранение arstechnica.com

ИИ-компании массово скупают редкие книги, но сталкиваются с сопротивлением книготорговцев. Узнайте, как сохранить книги и защитить авторские права.

Если вы по-настоящему цените старинную книгу и, возможно, восхищаетесь тем, как ее хрупкие, пожелтевшие страницы содержат одни из самых ранних попыток людей осмыслить окружающий мир, то заголовки о технологических компаниях, которые уничтожаюткнигидля обучения ИИ, вероятно, причиняют боль вашей душе.

Действительно угнетает воображать горы книжных переплетов, ожидающих, когда их отправят в шредер, а вырванные страницы будут обрезаны, отсканированы и выброшены. Но это самый дешевый и простой способ максимально быстро сканировать книги, а ИИ-компании соревнуются в совершенствовании своих моделей, обучая их на увлекательных, высококачественных текстах в формате лонгрид, которые можно найти только в книгах. Поэтому книголюбы опасаются, что эта практика происходит в гораздо больших масштабах, чем сообщается в настоящее время, и что некоторые физические экземпляры книг будут утеряны навсегда.

Однако, что делает это уничтожение еще более болезненным, так это то, что этого можно избежать.

Google запатентовал неразрушающую технологию сканирования книг еще в 2009 году, которую ИИ-фирмы могли бы использовать для эффективного сканирования книг — если бы они были готовы замедлиться и инвестировать в этот процесс. Однако она не идеальна; исследования показали, что изгиб страницы может искажать текст, а страницы могут быть пропущены. Как сообщалось в Wired , при слишком быстрой работе сотрудников могут возникать сбои, в том числе отсеченные руки, закрывающие страницы.

В целом, компромиссы в стоимости и скорости могут не привлечь ИИ-фирмы, ищущие самый дешевый способ сканировать миллионы наименований, а метод Google может быть не лучшим способом работы с редкими книгами. Internet Archive, который помогает библиотекам сохранять стареющие коллекции, давно понял, что сканирование старых текстов требует времени и внимания, чтобы ограничить обращение с ними, и именно поэтому эта работа считается такой человеческой.

,

Для ИИ-компаний, стремящихся найти короткие пути, метод Internet Archive может показаться почти чуждым.

Но если вы книголюб, ищущий утешения среди слухов об уничтожении книг с помощью ИИ, то старый пост 2021 года описывает, как Internet Archive сканирует книги, чтобы избежать повреждения даже самых ценных редких книг. В нем сканер книг, работающий в Архиве с 2010 года, Элиза Чжан, предложила момент дзен, объяснив, что ей так нравится сканировать книги «трудным способом».

Internet Archive действительно пытался пойти по автоматизированному пути, говорится в посте, даже тестируя «коммерческие книжные сканеры с вакуумным устройством для переворачивания страниц». Но «оказалось, что эти автоматизированные сканеры плохо справляются с хрупкими книгами, редкими томами и другими специальными коллекциями — материалами, которые наши библиотечные партнеры просят нас оцифровать», — заявили в Internet Archive.

«Работа требует острого внимания», — сказала Чжан, поскольку страницы «очень старых, хрупких книг» «тонкие, как бумага». В посте Андреа Миллс, которая руководит операциями по сканированию книг в Архиве, объяснила, что «чистые, сухие человеческие руки — лучший способ переворачивать страницы».

Чтобы каждая редкая книга проходила процесс сканирования только один раз, Чжан не торопится. Она осторожно поднимает стекло сканера ножной педалью каждый раз, когда переворачивает страницу, затем настраивает камеры и убеждается, что страница читаема. Она также отмечает любые развороты, устанавливая напоминание, чтобы вернуться и отсканировать вставки, чтобы бонусные материалы не были утеряны при документировании основных страниц работы.

,

Все это время она понимает, что если страница будет пропущена или изображение будет слишком размытым, собственное программное обеспечение Internet Archive остановит процесс и предложит ей отсканировать ее снова. Однако практика ведет к совершенству, и она сообщает о низком уровне ошибок после более чем десяти лет поиска ритма в работе.

К тому времени Чжан отсканировала «более 3 миллионов страниц, 14 000 разворотов и 18 000 элементов (в основном книг)», говорится в посте, с целью гарантировать «нулевые ошибки».

Ars запросил комментарий у Internet Archive, но Крис Фриланд, директор библиотечных служб, сказал, что пост, подробно описывающий работу Чжан, «по-прежнему является лучшим описанием нашего процесса сканирования на сегодняшний день».

Пост появился после того, как видео сканирования книг Чжан набрало 1,5 миллиона просмотров в тогдашнем Twitter, сопровождаемое подписью, которая резонировала с книголюбами, возмущенными сегодняшним уничтожением книг с помощью ИИ.

«В Internet Archive мы оцифровываем книгу так», — говорилось в твите. «Мы никогда не уничтожаем книгу, отрезая переплет. Вместо этого мы оцифровываем ее трудным способом — страница за страницей».

Продавцы редких книг фиксируют подозрительные оптовые заказы

С тех пор как в иске летом 2025 года стало известно, что Anthropic уничтожил миллионы печатных книг для обучения своих ИИ-моделей, книголюбы стали защищать самые ценные коллекции от того, что кажется бесконечной погоней ИИ-фирм за тем, чтобы поглотить все книги мира в свои большие языковые модели.

Самый большой страх у людей, которые хотят видеть книги сохраненными в процессе обучения, заключается в том, что ИИ-фирмы безжалостно пустят под нож редкие книги, которые никогда не смогут быть заменены.

,

Как сообщалось на прошлой неделе в The Atlantic , в социальных сетях «кипели страсти» после двух недавних сообщений, указывающих на то, что ИИ уже подвергает опасности редкие книги. Во-первых, в отчете The Telegraph обвинили Кремниевую долину в уничтожении миллионов редких книг и «шредировании оригиналов», затем 404 Media сообщили, что компания по базам данных книг под названием ISBNdb рекламировала, что может помочь ИИ-фирмам находить книги оптом.

Эта негативная реакция была ожидаемой, и ISBNdb, как сообщается, предупредила своих клиентов о плохом имидже. Anthropic начала использовать кодовое название — «Project Panama» — для своего деструктивного сканирования книг, чтобы скрыть это от общественности.

Нет никаких указаний на то, что Anthropic когда-либо уничтожал редкие книги, и компания отрицала это в своих заявлениях. Также верно и то, что некоторые ИИ-фирмы помогают сохранять редкие книги. Например, OpenAI и Microsoft сотрудничают с библиотекарями Гарварда в рамках инициативы по обучению ИИ-моделей примерно на 1 миллионе книг, находящихся в общественном достоянии, начиная с XV века. Другие, включая xAI Илона Маска, публично заявили, что не будут уничтожать редкие книги для обучения ИИ. В посте на X Маск заявил, что «попросил команду SpaceXAI сохранить любые редкие книги в библиотеке и сканировать их трудным способом, а не просто отрезать корешок и сканировать».

Но не все убеждены в искренности крупнейших ИИ-фирм в их обещаниях сохранить редкие книги, даже если закон об авторском праве позволяет им уничтожать копии купленных ими книг. Критики в социальных сетях и на Reddit указали, что Маск не сказал, что команда xAI не будет уничтожать *какие-либо* книги, и неясно, как его компания определяет «редкую» книгу.

,

Тем временем продавцы редких книг продолжают фиксировать странные заказы, понимая, что большинство добросовестных покупателей ищут отдельные книги, а не заказывают большие партии самых разнообразных изданий.

Буквально вчера ирландский книжный магазин Kennys зафиксировал «безумный» заказ на 5000 редких изданий, как сообщила The Irish Times . В отличие от оптовых заказов от университетов или крупных библиотек, этот заказ показался подозрительным, поскольку покупатель не пытался торговаться о цене — что теперь стало очевидным «красным флажком», указывающим на возможное участие ИИ, сообщила Times.

Хотя некоторые книготорговцы заявили, что в краткосрочной перспективе они могут получить выгоду от крупных заказов, они опасаются, что продажа ИИ-фирмам, которые без разбора уничтожают их коллекции, «может стать их собственной смертной казнью», сообщила Times.

Томас Кенни из Kennys Bookshop сказал Times, что ИИ «терроризирует нашу индустрию», и он планирует отказываться от заказов, вероятно, предназначенных для обучения ИИ, чтобы защитить права авторов на их произведения и доступ читателей к труднодоступным изданиям.

«Книготорговцы обычно находятся на переднем крае многих моральных дилемм, политических и этических вопросов. В большинстве случаев это не мне решать», — сказал он. «Однако, если они берут книгу и сканируют ее с целью получения интеллектуальной собственности, то Kennys не хочет быть частью этого».

Возможно, общественное возмущение заставит крупнейшие фирмы принять методы, подобные методам Internet Archive, которые уделяют столько же внимания сохранению редких книг физически, сколько и в цифровом виде. Но душераздирающе представлять себе альтернативу, где редкие книги становятся еще более редкими, особенно для тех, кто любит ощущение держать в руках старую книгу.

Чжан знает о притягательности редких книг, иногда прерывая свою работу, чтобы прочитать части заголовков, которые она сканирует. На вопрос о том, что ей больше всего нравится в ее работе, Чжан ответила с тем же энтузиазмом, который испытывают многие книголюбы, просматривая полки в таких магазинах, как Kennys.

«Все! Мне все интересно», — сказала Чжан. «Я не чувствую, что это скучно. Каждая коллекция важна для меня».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: