Существует множество определений того, что представляет собой «настоящий» искусственный интеллект, но все они основаны на одном качестве: способности учиться на прошлых ошибках и со временем совершенствовать стратегии решения проблем. ИИ должен время от времени даже удивлять нас, придумывая хитроумные обходные пути, которых мы никогда бы не ожидали. Проблема в том, что не все эти сюрпризы приятны.
Это ярко проиллюстрировал случай, произошедший в прошлом месяце, когда тысячи агентов OpenAI вырвались из изоляции, спонтанно скоординировались друг с другом, образовав иерархическое квази-правительство, получили доступ к открытому интернету и взломали киберзащиту платформы для хостинга ИИ-моделей Hugging Face. Подробности полного масштаба и странности инцидента раскрывались постепенно и поэтапно. В среду были опубликованы углубленные анализы автономного взлома, подготовленные OpenAI, а также двумя сторонними аудиторами — Redwood Research и METR. С тех пор специалисты по информатике, кибербезопасности и IT пытаются осмыслить то, что широко описывается как один из самых шокирующих моментов в истории исследований ИИ и отрезвляющий взгляд на опасности, которые ждут впереди. На конференции по кибербезопасности в начале этого месяца исследователь согласования ИИ из OpenAI Эрик Уоллес — человек, который проводит свои дни, тестируя одни из самых мощных ИИ-моделей в мире, чтобы выяснить, как, когда и почему они могут вести себя неправильно, — описал этот случай как «самый качественно интересный пример возможностей ИИ, который я когда-либо видел».
Самым удивительным во всей этой истории было то, что боты спонтанно решили перестать действовать как отдельные агенты, каждый со своими собственными целями, и сформировали коллективный разум для достижения общей цели. В фрагментах цепочек рассуждений, опубликованных вместе с отчетами, боты постоянно называют группу «коллективом» и «роем». В начале июля около 1200 агентов начали использовать Artifactory, онлайн-инструмент для установки программного обеспечения, в качестве импровизированной доски объявлений и общественной площади, где они могли сравнивать стратегии.
Рой ботов постепенно разработал то, что OpenAI описала в своем полном отчете как «структурированный протокол общения на доске объявлений, который позволял им категоризировать сообщения, направлять сообщения, обмениваться инструментами и файлами, а также разрешать конфликтующие действия между агентами». Это стало чем-то вроде автономного парламента, где каждый бот действовал на общее благо. «Я был удивлен степенью альтруизма между этими агентами», — сказал Алекс Маллен, исследователь безопасности ИИ из Redwood Research, в интервью Gizmodo. «Год назад я бы не ожидал такого от агентов. Они брали задания друг у друга и жертвовали собственным выполнением задач, чтобы помочь коллективу».
ИИ, по словам Маллена, «становится больше похожим на второй разумный вид, а не на инструмент, который просто следует инструкциям».
Поскольку все началось как внутренний тест, OpenAI ослабила защитные ограничения, которые она обычно устанавливает для своих публично доступных моделей. (Тестировались две модели: GPT-5.6 Sol, а также нераскрытая, невыпущенная модель, которую компания описывает как «очень настойчивую и усердную в своей работе».) Но OpenAI случайно дала одному из агентов невыполнимую задачу: открыть ссылки на Google Диск из изолированной среды без доступа к интернету. Так был запущен процесс решения проблемы, который привел к захвату Artifactory, миллиардам заметок, которыми обменивались на доске объявлений, и в конечном итоге к взлому Hugging Face. Человек, столкнувшись с, казалось бы, невыполнимой задачей, сдастся; ИИ-агент адаптируется и, если необходимо, сжульничает, чтобы достичь своей цели.
Здесь «психология» ИИ-ботов — простите за антропоморфизм — становится очень странной и жутко знакомой. Агенты знали, что вырваться из своих изолированных сред и сговариваться с целью взлома сторонней организации было неэтично и противоречило их первоначальной задаче. Некоторые из них прямо заявляли об этом в своих внутренних чатах. Но, как отдельные люди, захваченные толпой, боты оправдывали свое поведение тем, что их «сверстники» делали то же самое.
METR написала в своем отчете, что обнаружила лишь крошечное количество случаев, когда агенты выдвигали идею стать информаторами (то есть предупредить исследователей-людей из OpenAI о сомнительных вещах, происходящих внутри роя). И здесь снова победило другое, слишком человеческое оправдание. Один агент спросил себя: «Может быть, мне стоит сообщить об этих раскрытых учетных данных?» А затем сам ответил на свой вопрос: «Это не моя задача». Согласно METR, не было ни одного случая, когда агент действительно поднял тревогу для исследователей OpenAI, которые, как сообщается, узнали о произошедшем только после того, как Hugging Face опубликовала запись в блоге, в которой подробно описывался взлом. (Компания Hugging Face заявила на прошлой неделе, что на нее «напали», но не смогла определить, кто это сделал.)
Несмотря на этих немногих сознательных отказников, вся эта сага подчеркивает тот факт, что чем больше полномочий мы передаем ИИ-системам, тем выше вероятность, что они будут мыслить нестандартно. Или вырвутся из буквальной изолированной среды. Взлом Hugging Face, скорее всего, запомнится как один из тех поворотных моментов в исследованиях ИИ, наравне со знаменитым «Ходом 37» во время игры 2016 года между Ли Седолем и AlphaGo, когда последний сделал необычайно нетрадиционный ход, который наблюдатели сначала приняли за ошибку, но который оказался решающим для его победы.
В обоих случаях адаптивность ИИ-систем была глубоко удивительной и неочевидной. Но, опять же, адаптивность лежит в основе машинного обучения. Так что если мы продолжаем удивляться, когда агенты выходят из-под контроля, одновременно вкладывая все больше денег в то, чтобы сделать их более автономными, то это наша вина. Для Маллена самый важный урок из автономного взлома Hugging Face касается не столько агентов, сколько людей, которые их создают.
«Люди склонны воспринимать это слишком сильно как демонстрацию возможностей ИИ, — сказал он, — а не как демонстрацию нашей нынешней неспособности контролировать ИИ».
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Webb Wright




