Иногда эти иллюстрации откровенно фальшивы, как буррито с настолько пузырящимся и тягучим сыром, что оно больше похоже на авангардное искусство, чем на обед. Чаще они выглядят настолько обыденно, что вы замечаете, что что-то не так, только присмотревшись.
«Это почти как инопланетянин, пытающийся приготовить пиццу, не понимая ее основных принципов», — сказал TechCrunch технический директор Reality Defender Алекс Лайл. (Сама Reality Defender является частью растущей категории стартапов, продающих инструменты для обнаружения ИИ и проверки контента — бизнес, который существует отчасти из-за подобных проблем.)
Лайл говорит, что способ создания этих моделей может объяснить, почему иллюстрации имеют такую специфическую эстетику — где каждый шарик мороженого идеально круглый, а креветки, кажется, были генетически модифицированы, чтобы поедать собственный хвост, создавая новые «пищевые ужасы Лавкрафта».
Большие языковые модели (LLM) и диффузионные модели — типы моделей ИИ, которые делают возможными кажущиеся всеведущими чат-боты и генераторы изображений, такие как ChatGPT и Midjourney — обучаются на огромных объемах данных. Затем модели идентифицируют закономерности в наборах данных, чтобы предсказать, что ищет пользователь, когда он просит, например: «Создай мне меню для бургерной».
«Многое из этого похоже на меню Chili’s 2015 года, и этому есть причина», — сказал Лайл. «Это был корпус работ, из которого [модели] черпали свою функцию».

Новые обучающие данные бесценны для компаний, создающих модели ИИ — Amazon даже находили редкие книги для сканирования и добавления в свои обучающие данные, только чтобы уничтожить эти книги после их загрузки. Неизбежно, что некоторый контент, сгенерированный ИИ, просочится в эти непостижимо большие наборы данных. Но когда модели ИИ обучаются на собственном контенте, сгенерированном ИИ, они рискуют «коллапсом модели».
«Коллапс модели — это почти как коровье бешенство… когда вы скармливаете выходные данные одной модели обратно ей самой, в конечном итоге инбридинг становится слишком сильным, и все рушится», — объяснил Лайл. «То, что мы видим здесь, — это конвергенция, которая не обязательно является коллапсом модели».
Конвергенция — это нечто менее экстремальное, ухудшающее качество выходных данных ИИ, но не делающее его совершенно бесполезным.
Если кто-то попросит модель ИИ сгенерировать меню для ресторана быстрого питания, модель, вероятно, будет ссылаться на меню Wendy’s, Burger King, McDonald’s или другой популярной сети. Эти меню уже имеют схожий стиль, что означает, что сгенерированные ИИ результаты будут имитировать тот же стиль, только для его дальнейшего усиления, если сгенерированное ИИ меню в конечном итоге попадет обратно в обучающие данные.
Но меню и реклама еды всегда будут выглядеть лучше, чем реальная вещь, как Биг Мак в рекламе McDonald’s, где каждый слой сэндвича расположен дизайнером реквизита так, чтобы выглядеть максимально аппетитно. Этот эффект может стать еще более выраженным в выходных данных ИИ.
«Оптимизация наборов данных направлена на приятность или, знаете ли, на неоскорбительность, и поэтому это превращается в гомогенизацию», — сказал TechCrunch Ли Рейни, директор Центра изучения цифрового будущего Университета Илона. «То, что ИИ умеет делать как в изображениях, так и в языке, — это сглаживать края».
В более локальном масштабе это сглаживание изображений, кажется, происходит, когда вы используете генератор изображений ИИ для создания меню и вносите в него правки. На X пользователь под ником Labtec показал, что происходит, когда вы создаете меню в ChatGPT, а затем редактируете его 100 раз, чтобы увидеть, как еда продолжает выглядеть все менее и менее похожей на то, чем должна быть. (Мы повторили эксперимент и получили схожие результаты.)
«Конечный результат на самом деле вызывает у меня дискомфорт», — написал Labtec.
Рестораны, вероятно, становятся жертвами этой проблемы, пересматривая свои меню, сгенерированные ИИ, чтобы постоянно изменять мелкие детали, такие как цены или названия блюд. Кажется, что с каждым изменением изображения еды становятся немного более круглыми и гладкими.
«У людей есть почти необъяснимое чувство, когда они смотрят на что-то, сгенерированное ИИ, по сравнению с чем-то, что было реальным изначально», — сказал Рейни. «Есть просто чувствительность, которую людям иногда трудно сформулировать, но они как бы знают это, когда видят, и я думаю, что это одна из причин, почему некоторые из первых историй о негативной реакции [на рестораны, использующие меню ИИ] так заметны».
За нашим отвращением к этим меню ИИ стоит наука. Исследователи из Университета Дуйсбург-Эссен в Германии обнаружили, что сгенерированные ИИ изображения еды демонстрируют эффект «зловещей долины», когда изображения еды, выглядящие почти реально, вызывали больше отвращения и беспокойства, чем изображения, которые были явно поддельными. Эта брезгливость только усиливается в свете культурного контекста вокруг ИИ.
Если люди так негативно реагируют на эти изображения, то, вероятно, этого достаточно, чтобы рестораны перестали пытаться заставить меню ИИ работать. Но проблемы, которые приводят к появлению идеально поджаренных булочек для гамбургеров, выходят за рамки обеденного стола.
«Видеть и слышать всегда означало верить, до такой степени, что даже наши судебные системы полностью настроены на идею о том, что золотым стандартом доказательств являются записанные на пленку признания и видеодоказательства», — сказал Лайл. «Это больше не так. Мир фундаментально изменился, к лучшему или к худшему».
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Amanda Silberling




