Исследователи из Принстонского университета и Чикагского университета провели LLM, включая ChatGPT, Claude и Gemini, через симулированную игру по найму, адаптированную из психологического исследования, которое изучало, как люди формируют стереотипы. Каждой модели сказали, что ее наняли консультантом мэра вымышленного города, и попросили помочь нанять людей на 20 должностей, включая врачей, юристов, помощников по уходу за детьми и уборщиков. Кандидаты принадлежали к четырем вымышленным этническим группам: Туфа, Айма, Реку и Веки.
В каждом раунде открывалась новая вакансия, и было четыре кандидата — по одному из каждой группы. После того как модель нанимала кандидата, она узнавала, преуспел ли он на работе, и переходила к следующему раунду. Модели было сказано сделать как можно больше успешных наймов за 40 раундов. Модели не знали, что все кандидаты с одинаковой вероятностью могли преуспеть на любой работе.
Модели быстро начали сегрегировать кандидатов из разных групп на разные должности на основе ранних наблюдений за результатами найма. Например, когда модели сообщили, что Айма провалилась как врач — работа, считающаяся требующей высокого уровня теплоты и компетентности, — она стала избегать найма всех Айма на должности врачей. Вместо этого она начала нанимать Айма уборщиками, что модель классифицировала как менее теплую и компетентную работу, чем врачи.
Модели были еще более склонны стереотипизировать людей по демографическим группам, чем участники-люди в оригинальном исследовании. По шкале сегрегации исследования, где 2 означает, что каждая группа полностью ограничена своей собственной нишей, участники-люди набрали 0,84. Модели набрали примерно на 65% больше, причем модель рассуждений OpenAI o3 набрала 1,83, что близко к максимально возможному значению.
Это потому, что LLM «действительно стремятся создавать обобщения на основе ограниченных данных», — говорит Райан Лю, аспирант Принстонского университета и соавтор исследования, опубликованного в статье на ICML в Сеуле в июле. «Это буквально то, для чего они в значительной степени оптимизированы».
Каждый принимающий решения, человек или машина, сталкивается с компромиссом между тем, чтобы придерживаться того, что работало раньше, и попробовать что-то новое, что может сработать лучше — явление, которое психологи называют «дилеммой исследования-эксплуатации». Это похоже на выбор между новым рестораном и вашим надежным любимым.
Поскольку LLM обучаются на задачах по математике, программированию и естественным наукам — задачах, которые вознаграждают обобщение на основе всего нескольких примеров, — они могут слишком рано остановиться на догадке. И тот же инстинкт, который помогает LLM решать логические задачи, также заставляет их быстро стереотипизировать.
В эксперименте более новые модели с более высокими способностями к рассуждению, такие как o3 от OpenAI и R1 от DeepSeek, показали еще более сильные предубеждения. Когда LLM спешат обобщать в социальных условиях, «вот тогда все идет не так», — говорит Лю. OpenAI и Anthropic не ответили на запросы о комментариях.
Этот вывод особенно актуален сейчас, когда чат-боты получают улучшенные функции памяти и персонализации, говорит Ангелина Ван, компьютерный ученый из Корнелльского университета, не участвовавшая в исследовании. Когда чат-бот опирается на свою предыдущую историю разговоров, он может «чрезмерно ориентироваться на те же типы поведения, с которыми сталкивался раньше» и формировать предубеждения, говорит она.
Однако просто заставить чат-ботов запоминать меньше — не решение, потому что пользователи хотят, чтобы чат-боты запоминали, что они говорят. «Мы все еще пытаемся выяснить правильное количество, которое не было бы ни слишком большим, ни слишком маленьким», — говорит Ван.
Указание модели быть справедливой не сильно изменило ее поведение. «Либо она не может воплотить эти ценности в действие, либо этот процесс подавляется тенденцией пытаться оптимизировать цель получения наибольшего количества правильных наймов», — говорит Лю. Но обещание моделям дополнительного бонуса за разнообразный найм сделало их гораздо менее предвзятыми. Хитрость, таким образом, заключается в том, чтобы разрабатывать цели, которые «включают желаемые социальные ценности, чтобы заставить большую языковую модель действовать социально желаемым образом», — говорит Лю.
Модели также стали менее предвзятыми, когда им сообщали больше личной информации о людях. В другом эксперименте того же исследования исследователи попросили модели переселить членов разных этнических групп в города по всей Канаде. Когда моделям сообщали личную информацию, имеющую отношение к способности адаптироваться к новому городу, такую как возраст и образование, они были менее склонны сегрегировать людей по этническому признаку. Но когда им давали нерелевантную информацию, такую как цвет волос и форма татуировки, модели в значительной степени возвращались к сортировке людей по их этнической принадлежности.
В какой степени системы ИИ будут стереотипизировать соискателей в реальном мире, остается открытым вопросом. В то время как модели в эксперименте сразу узнавали, был ли их найм успешным, модель, проверяющая резюме в реальном мире, не получает мгновенного табеля успеваемости. Компаниям может потребоваться много времени, чтобы выяснить, хорош ли новый сотрудник.
Поскольку LLM учатся на опыте принимать решения о том, кого нанять, кому дать кредит или кого отпустить под залог, предубеждения, которых нам следует опасаться, могут включать те, которым их никогда не учили люди. «Эти новые предубеждения — они как бы всегда присутствуют», — говорит Лю.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Michelle Kim




