Один из способов понять, как что-то работает, — разобрать это по частям и посмотреть, как оно меняется в процессе. Именно такой подход применили два исследователя ИИ, которые хотели понять, как модели генерации изображений приходят к своим конечным результатам: обращаются ли они к конкретному изображению, как художник-портретист смотрит на человека во время рисования? Или же в игре участвует какой-то другой процесс? Их результаты оказались неожиданными — и они могут иметь серьезные последствия для художников, пытающихся судиться с ИИ-компаниями по обвинению в краже интеллектуальной собственности.
Опубликованное на прошлой неделе в журнале Nature Communicationsисследование показало, что в случае диффузионных моделей — ИИ-систем, лежащих в основе инструментов генерации изображений, таких как Midjourney и Stable Diffusion, — невозможно установить прямую причинно-следственную связь между конкретным произведением искусства, лицом человека или даже совокупностью работ определенного художника и изображениями, созданными моделью. Огромный масштаб обучающего набора данных скрывает творческий процесс; это все равно что астронавт на борту Международной космической станции пытается невооруженным глазом разглядеть одно дерево в тропических лесах Амазонки.
Таким образом, результаты работы моделей полностью «неатрибутируемы», по словам авторов исследования: даже если они выглядят в точности как работа художника-человека, можно удалить эту работу из обучающих данных, и результат останется прежним.
«Затухание атрибуции»
Атрибутируемость имеет решающее значение как для понимания того, как работают диффузионные модели, так и для определения того, использовалась ли работа художника-человека для создания изображения. «Если [диффузионная] модель генерирует что-то, вы хотите иметь возможность сказать: “О, за это отвечала вот эта часть обучающих данных”», — рассказал Gizmodo Чжэн Дай, аспирант четвертого курса Лаборатории компьютерных наук и искусственного интеллекта Массачусетского технологического института (CSAIL) и ведущий исследователь этой работы.
С этой целью Дай и его соавтор, специалист по информатике из Массачусетского технологического института Дэвид Гиффорд, решили выяснить, как изменятся изображения, созданные ИИ, если удалять из их обучающих наборов данных отдельные изображения или их фрагменты по одному. Идея заключалась в том, что, количественно оценив разницу между исходным изображением, созданным ИИ, и изображениями, созданными после удаления обучающих изображений — они называют это «контрфактическим радиусом», — можно определить степень влияния конкретной части обучающего набора данных на исходное изображение. «В этой альтернативной вселенной, где этих данных не существовало, ваш образец должен был бы отличаться», — говорит Дай.
Вместо использования общедоступных моделей, чьи обучающие наборы данных недоступны публично, Дай и Гиффорд построили два десятка пользовательских моделей, обученных на наборах от нескольких сотен до сотен тысяч изображений, все из которых были взяты из онлайн-баз данных изображений. Затем исследователи провели серию экспериментов, чтобы выяснить, как будут различаться результаты работы моделей, если они зайдут и удалят определенные изображения. Они также провели тот же эксперимент на моделях, обученных исключительно на лицах людей, и снова на других, обученных на работах разных художников.
Во всех трех случаях результат был одинаковым: чем на большем количестве изображений обучалась диффузионная модель, тем сложнее было определить, какие из этих изображений повлияли на результат, созданный ИИ, — явление, которое они назвали «затуханием атрибуции».
Исследование «демонстрирует, что при больших размерах обучающих наборов становится не только невозможно атрибутировать сгенерированные изображения обучающим, но и невозможно атрибутировать сгенерированных людей реальным людям, на которых обучалась модель, а также атрибутировать сгенерированные произведения искусства художникам, на которых обучалась модель».
Чуждые интеллекты
Это плохие новости для художников, пытающихся судиться с ИИ-компаниями: независимо от того, насколько сильно изображение, созданное ИИ, может быть похоже на то, что создали они сами, новое исследование предполагает, что невозможно с полной уверенностью узнать, на какие изображения ссылалась модель для создания своего конечного результата. Как отмечают Чжэн и Гиффорд в своем отчете, коммерческие диффузионные модели на много порядков больше и, следовательно, гораздо менее атрибутируемы, чем тестовые модели, использованные в исследовании. Для более крупных моделей изображения, созданные ИИ, не имеют какого-либо одного человеческого источника вдохновения.
Это напоминание о том, насколько чуждыми являются эти системы «черного ящика», даже несмотря на то, что нейронные сети, на которых они основаны, были разработаны для имитации процессов в нашем собственном мозге. Когда люди создают что-то, будь то картина или роман, мы обычно осознаем других людей и произведения искусства, которые на нас влияют. Мы можем даже напрямую смотреть на какой-то внешний референс, как в случае с художником-портретистом. Диффузионные модели, напротив, используют всю совокупность своих обучающих данных для генерации новых изображений способами, которые во многом остаются для нас глубоко загадочными.
Исследование также подчеркивает, насколько далеко еще предстоит пройти юристам, чтобы распутать запутанные вопросы интеллектуальной собственности и подотчетности, которые поднимают эти системы. Но то, что задача сложна, не значит, что стоит отказываться от ее решения. «Для нас важно понимать, как работают эти модели, чтобы правильно их изучать или регулировать», — говорит Дай.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Webb Wright




