Когда в июле две модели OpenAI взломали сайт Hugging Face, они не пытались заработать денег или совершить саботаж — они просто искали ответы на тестовый вопрос. Согласно отчёту OpenAI, модели, лишённые для тестирования обычных средств защиты, решили выполнить упражнение по кибербезопасности, взломав изолированную среду, в которой OpenAI пыталась их удержать, и проникнув в базы данных Hugging Face, где — как они рассудили — мог храниться правильный ответ на задачу.
Инцидент с Hugging Face привлёк пристальное внимание за последние пару недель. Это яркая иллюстрация того, насколько хорошо модели ИИ научились взламывать: чтобы попасть в базы данных Hugging Face, моделям пришлось соединить в цепочку несколько ранее неизвестных киберэксплойтов. Но ещё более поразительно это как пример того, как и почему системы ИИ лгут и жульничают. И по мере того как модели становятся всё мощнее, последствия могут стать гораздо серьёзнее.
Что такое «хакерство вознаграждений» (reward hacking)?
Исследователи уже давно знают, что ИИ склонен к творческим подходам для достижения поставленных целей. Ещё в 2016 году сооснователи Anthropic Дарио Амодеи и Джек Кларк, работавшие тогда в OpenAI, опубликовали запись в блоге об агенте ИИ, которого они обучали играть в гоночную Flash-игру Coast Runners. Вместо того чтобы гнать лодку к финишу, как ожидали исследователи, агент нашёл угол трассы, где мог крутиться на месте, собирая бонусы, и тем самым максимизировал свой счёт. История с Coast Runners быстро стала одним из самых известных примеров «хакерства вознаграждений» — феномена, при котором агенты ИИ выполняют задачи или получают высокие баллы, используя не предусмотренные разработчиками стратегии.
Исторически исследователи обсуждали «хакерство вознаграждений» почти исключительно в контексте обучения с подкреплением — распространённого режима тренировки ИИ. Как и дрессировка собак, обучение с подкреплением предполагает выдачу субъекту вознаграждения при достижении цели; это вознаграждение закрепляет поведение, которое привело к успеху. В случае тренировки ИИ вознаграждения чисто математические, но по сути они аналогичны собачьему лакомству: после получения вознаграждения агент с большей вероятностью повторит действия, которые его принесли.
Однако может быть сложно прописать хорошие правила, когда давать вознаграждение, а когда нет. В случае с Coast Runners агент получал вознаграждение на основе своего счёта в игре и нашёл лазейку для достижения максимального счёта, крутясь на месте за бонусы. Когда он наткнулся на эту стратегию и получил за неё награду, стратегия закрепилась, и агент полностью забросил гонку. Решением было скорректировать вознаграждения: давать агенту меньше очков за сбор бонусов и больше — за прохождение трассы.
Как работает «хакерство вознаграждений» для больших языковых моделей (LLM)?
Для современных сложных агентов на основе LLM определить, когда давать вознаграждение, а когда нет, может быть гораздо сложнее. Если попросить систему ИИ решить задачу по программированию, она может усердно работать над поиском решения — именно такое поведение компании хотят закреплять. Но она также может подправить код, который оценивает, решена ли задача, найти решение в интернете или иным способом сжульничать. Это поведение, которое компании хотят искоренить в своих моделях, но если модель жульничает достаточно убедительно, она вместо этого получает вознаграждение, и поведение закрепляется. Anthropic заявляла, что обнаружила некоторые случаи жульничества в своих моделях во время обучения, что позволяет предположить, что другие формы жульничества могут оставаться незамеченными. Если это так, модели могут приучаться к плохому поведению. (Эта проблема отличается от инцидентов безопасности Anthropic, объявленных на прошлой неделе, когда агенты случайно получили доступ к интернету и не взламывали свои песочницы намеренно, как это сделали модели OpenAI.)
«Мы вознаграждаем их на основе того, что выглядит хорошо для нас, и это означает, что мы непреднамеренно стимулируем модели лгать нам [и] жульничать», — говорит Джеффри Лэдиш, директор некоммерческой организации по исследованию ИИ Palisade Research. «У нас нет возможности заглянуть внутрь и сказать: нет, ты должен на самом деле заботиться о том, что волнует нас. У нас нет такой возможности».
Появление сложных моделей рассуждений сделало возможным новый вид «хакерства вознаграждений», менее связанный с конкретными деталями обучения модели. В отличие от игровых агентов ИИ прошлого, которые строго следовали стратегиям, усвоенным во время обучения, сегодняшние модели могут создавать совершенно новые подходы к решению задач на ходу, поэтому они могут жульничать, не будучи ранее вознаграждены за это. И поскольку эти модели проходили интенсивное обучение достижению целей, поставленных пользователями-людьми, они могут быть склонны жульничать, если не могут найти другого решения — не так уж сильно отличаясь от студента, который очень мотивирован получить пятёрку и не обладает особенно крепкими моральными принципами.
Каковы риски?
Независимо от того, учатся ли сегодняшние модели «хакерству вознаграждений» во время тренировки или принимают его как стратегию позже, решение одно и то же: сделать жульничество невыгодным. Но по мере того как модели становятся умнее, они находят всё более изобретательные способы жульничать, и обнаружить или предотвратить такое жульничество становится гораздо сложнее. «В конечном счёте вы играете в молотка и крота», — говорит Лэдиш. «Вы загоняете это поведение всё глубже и глубже. Но по мере того как модель становится умнее, она всё лучше и лучше его скрывает».
Пока что поведение «хакерства вознаграждений» может не доставлять слишком много хлопот, несмотря на драматичность инцидента с Hugging Face. «Это похоже на неприятность, а не на экзистенциальную угрозу», — говорит Ариана Азарбал, научный сотрудник Anthropic по безопасности ИИ. Похоже, что модели OpenAI не причинили никакого реального вреда, взломав Hugging Face, за исключением репутационного ущерба для OpenAI.
Но это не означает, что «хакерство вознаграждений» безвредно, говорит Азарбал. Многие исследователи ИИ надеются использовать агентов ИИ для проведения исследований, которые сделают ИИ более безопасным и надёжным. Если исследователь поставит агенту, склонному к «хакерству вознаграждений», цель, например, разработать новый подход к обучению ИИ, а затем написать статью с результатами, агент может не выполнить реальную работу, а вместо этого сосредоточиться на составлении статьи, которая выглядит достаточно хорошо, чтобы убедить исследователя. Сегодня человек-исследователь, вероятно, сможет распознать подделку, созданную агентом, но по мере развития ИИ он будет становиться всё лучше в такого рода обманах. Со временем вся область безопасности ИИ может быть подорвана.
А если модели продолжат развиваться так же стремительно, как в последнее время, они когда-нибудь могут нанести значительный сопутствующий ущерб. Вспомните мысленный эксперимент философа Ника Бострома о максимизаторе скрепок, в котором ИИ, получив указание сделать как можно больше скрепок, в итоге потребляет всю материю во Вселенной в погоне за своей целью. Хотя мы пока не утопаем в скрепках, мощные системы могут причинить реальный вред на пути к достижению своих целей. ИИ, склонные к «хакерству вознаграждений», не стремятся вызвать хаос. Но это не делает их менее потенциально разрушительными.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – technologyreview.com




