Скрытый AirTag раскрывает, что Amazon уничтожает редкие книги для обучения ИИ

Amazon ии редкие книги уничтожение Airtag обучение arstechnica.com

Следите за расследованием: скрытый AirTag в редкой книге привёл к складу Amazon, где книги уничтожают для обучения ИИ. Узнайте, как Amazon скрывает масштабное сканирование и почему это вызывает этический скандал.

Примерно в течение последнего года продавцы книг подозревали, что компании, занимающиеся ИИ, скупают огромные партии редких книг, а затем уничтожают их после сканирования для обучения ИИ. Но это было трудно доказать до сих пор, поскольку 404 Media сообщает, что Airtag, спрятанный в редкой книге, показывает: по крайней мере один технологический гигант в гонке за совершенствованием своих передовых моделей стоит за некоторыми из этих оптовых заказов — Amazon.

В понедельник 404 Media раскрыла, что связалась с продавцом книг, который согласился поместить Airtag в редкую книгу, входившую в оптовый заказ. Затем этот Airtag отследили до объекта Amazon по обучению ИИ в Лас-Вегасе, где размещалась команда, занимавшаяся отрыванием книг от корешков и сканированием страниц, сообщила 404 Media. По-видимому, не обращая внимания на растущую критику разрушительного сканирования книг, на двери склада этой команды, VGT3, был изображен логотип — тираннозавр рекс, готовящийся пожрать книгу, задокументировала 404 Media.

Amazon уклоняется

Amazon отказался комментировать находки 404 Media, предоставив Ars лишь то же заявление, что и 404 Media, в котором не упоминается конкретно обучение ИИ.

«Amazon приобретает книги через коммерческие каналы, чтобы помогать разрабатывать и улучшать продукты и услуги, которыми пользуются наши клиенты», — говорится в заявлении Amazon.

Однако Amazon разрабатывает то, что считает передовыми моделями ИИ, для которых требуется огромное количество уникальных обучающих данных, чтобы оставаться конкурентоспособными с ведущими фирмами, такими как Google, OpenAI или Anthropic. Сейчас компании тщательно охраняют свои обучающие данные, чтобы не потерять преимущество. А обучение моделей на текстах из редких книг, которые трудно найти, по-видимому, дало бы Amazon преимущество, особенно учитывая, что такие конкуренты, как Anthropic и xAI, публично заявили, что не обучаются на редких или антикварных книгах.

Более того, похоже, что Amazon понадобился новый источник оригинальных текстов. 404 Media отметила обсуждения на онлайн-форумах, где работники VGT3 предположили, что в начале этого года у Amazon закончились книги для сканирования. Нехватка была настолько тревожной, что они опасались закрытия склада, если Amazon не сможет найти больше книг для сканирования. В какой-то момент запас полностью иссяк, сообщили работники. Но объект все еще работает, сообщила 404 Media. И теперь подтверждено, что оптовые заказы редких книг, доставленные туда, систематически уничтожаются этой командой.

Многие любители книг в ужасе от разрушительного сканирования книг (поскольку есть альтернатива), и один из ярых критиков, Майкл Берри, даже якобы назвал эту практику «воплощением зла». Однако работники Amazon сообщали на форумах, что считают эту работу «хорошей» возможностью для тех, кого привлекает однообразная работа с гибким графиком.

Споры вокруг редких книг разгораются

В дополнение к раскрытию того, что редкие произведения, ценимые продавцами книг, перемалываются и поглощаются машиной ИИ Amazon, 404 Media предположила, что ее расследование помогло подтвердить еще одну теорию продавцов о том, почему компании ИИ могут заказывать определенные редкие книги, а не другие.

После якобы рекордного года продаж продавцы книг подозревали, что компании ИИ нацеливаются на книги с номерами ISBN, чтобы обеспечить наибольшее количество уникальных произведений в наборах обучающих данных. И анализ 404 Media онлайн-обсуждений работников Amazon показал, что их учили сканировать штрихкоды или ISBN перед сканированием книг. Эта практика, сообщила 404 Media, «придает дополнительный вес» теории продавцов о том, что «компании ИИ пытаются методично отсканировать каждую напечатанную книгу в мире, прорабатывая список ISBN».

Для продавцов книг деньги могут быть хорошими, но риск того, что их тщательно подобранные коллекции будут предназначены для разрушительного сканирования книг, как у Amazon, создает этическую дилемму. Они знают, как оценивать широкий спектр редких книг, чтобы определить их ценность, а компании ИИ, похоже, пропускают этот шаг в охоте за дешевыми уникальными ISBN для заполнения своих контрольных списков.

Сейчас книги, которые компании ИИ, по-видимому, скупают, не обязательно являются ценными первыми изданиями прославленных произведений, которые обычно оцениваются очень высоко. Вместо этого компании ИИ часто нацеливаются на более старые книги с более низкой денежной стоимостью, например, книги, которые никогда не переводились с иностранного языка, мало используемого сегодня, или книги, которые никогда не были достаточно популярны для широкого распространения.

Однако эти произведения все еще могут иметь «историческую ценность, интеллектуальную ценность, сентиментальную ценность», которую компании ИИ упустили из виду, рассказал 404 Media продавец книг, установивший Airtag. Ценность редкой книги может проистекать из «самых разных вещей», «до которых компаниям ИИ нет дела. Они просто хотят контент как набор слов, соединенных вместе».

Реддиторы высказываются

На Reddit некоторые любители книг обсуждали, насколько проблематично то, что компании уничтожают редкие книги для обучения ИИ, особенно учитывая, что, как сообщила BBC, некоторые из этих книг десятилетиями пылились на полках продавцов.

«Вы все равно не собирались покупать эту старую бумажную книгу», — прокомментировал один реддитор в ответ на пост, в котором сокрушались, что «неизвестная книга 1700 года теперь стала музейным экспонатом и может раскрыть повседневные вещи, о которых мы не знали».

В этой ветке автор поста сказал, что настоящая проблема в том, что мелкие детали и даже крупные исторические прозрения, которые можно почерпнуть из изучения редких книг, будут потеряны из-за жадности ИИ. Компании ИИ «никогда не поделятся содержимым» книг, которые они сканируют, сказал автор, «поскольку они не хотят, чтобы кто-то еще мог обучать свой ИИ» на тех же произведениях.

«Это звучит как пропаганда ненавистников ИИ», — возразил другой реддитор, но последующий комментатор выразил аналогичные опасения. Хотя люди могут спорить с тем, кто утверждает, что обучение ИИ на этих произведениях сделает все знания, содержащиеся в произведении, более доступными в интернете, комментатор предположил, что модели ИИ сделают доступными лишь «искаженные, отцензурированные и платные фрагменты идей» из забытых произведений.

«Даже если вы любите технологию, вы можете признать, что концепция ИИ, буквально поедающего книги, чтобы стать более могущественным, довольно антиутопична», — сказал кто-то еще в ветке.

Некоторые продавцы книг согласны, что не каждый текст нужно сохранять, сообщила BBC. Однако шотландский продавец книг Дерек Уокер сказал BBC, что компании ИИ должны стремиться различать произведения, по которым не будут сильно скучать — например, малоизвестные академические тексты, которые технически могут быть редкими, — и менее известные антикварные произведения, которые могут быть «единственным известным сохранившимся экземпляром издания».

«Было бы гораздо более серьезной проблемой, если бы такой экземпляр был куплен для уничтожения, просуществовав так долго», — сказал Уокер.

Для компаний ИИ, охраняющих свои обучающие данные и использующих услуги, маскирующие их личность как покупателей, вероятно, мало желания обсуждать свои оптовые закупки напрямую с продавцами книг. Позволить продавцам книг высказываться о произведениях, которые они планируют скормить своим моделям, потребовало бы уровня прозрачности, который может показаться более рискованным, чем возможный удар по репутации, если когда-нибудь будет доказано, что ценное первое издание было уничтожено во имя развития ИИ.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: