Взлом Meta* доказывает: безопасность ИИ — это не только «Mythos»

взлом ии Meta Instagram кибербезопасность агенты ии уязвимость technologyreview.com

5 июня 404 Media сообщило, что злоумышленники использовали агент службы поддержки Meta* на базе ИИ для кражи аккаунтов Instagram* . Их подход был прост: они просили агента привязать аккаунты к адресам электронной почты, которые они контролировали, и агент выполнял просьбу. Один из злоумышленников получил доступ к неактивному аккаунту Белого дома времен Обамы и разместил посты в поддержку Ирана… — technologyreview.com

5 июня издание 404 Mediaсообщило, что злоумышленники использовали агент службы поддержки Meta* на базе ИИ для кражи аккаунтов Instagram* . Их подход был прост: они просили агента привязать аккаунты к адресам электронной почты, которые они контролировали, и агент выполнял просьбу. Один из злоумышленников получил доступ к неактивному аккаунту Белого дома времен Обамы и разместил посты в поддержку Ирана; другие захватили аккаунты с ценными однословными именами, вероятно, с целью их продажи.

Проблемы кибербезопасности, связанные с ИИ, не новы. С тех пор как в апреле Anthropic объявила, что ее модель Mythos слишком хороша для взлома, чтобы быть выпущенной для широкой публики, комментаторы, исследователи и федеральные чиновники сосредоточились на идее, что сверхразумные системы ИИ могут нанести ущерб нашей компьютерной инфраструктуре. Однако этот взлом Instagram* был не совсем таким: здесь ИИ был целью, а не атакующим, и метод был намного проще, чем что-либо, что могла бы придумать Mythos. Но по мере того, как компании передают все больше работы ИИ, эти относительно несложные атаки могут нанести свой собственный ущерб.

«Поскольку ИИ используется все шире — особенно когда он все больше автоматизирует наши рабочие процессы, такие как восстановление учетных записей, — я думаю, что злоумышленники будут все больше мотивированы атаковать сам ИИ», — говорит Нил Гонг, профессор электротехники и компьютерной инженерии в Университете Дьюка.

Гонг и другие ученые давно предупреждают об уязвимостях агентов ИИ. Они публикуют статьи и посты в блогах, описывающие эксплойты, такие как косвенная инъекция промптов (indirect prompt injection), которая включает перехват управления агентами с помощью команд, скрытых на веб-сайтах, в электронных письмах или других, казалось бы, безвредных источниках данных. По сравнению с этими методами, взлом Meta* был практически бессознательным. Единственное усложнение, с которым пришлось столкнуться хакерам, заключалось в использовании VPN, соответствующего местоположению настоящего владельца аккаунта; затем они напрямую попросили службу поддержки изменить адрес электронной почты аккаунта, и агент согласился.

Meta* публично не комментировала, как эта уязвимость просочилась. Но, учитывая простоту эксплойта, по словам Гонга, его следовало легко обнаружить до развертывания агента. «Это действительно удивительно», — говорит он. «Я не понимаю, почему они не обнаружили эту простую проблему».

Джессика Джи, старший научный аналитик Центра безопасности и новых технологий Джорджтаунского университета, согласна. «Это поднимает вопросы вроде: а были ли вообще какие-либо защитные механизмы?» — говорит она. «Задумывался ли кто-нибудь о тестировании такого сценария?» Она отмечает, что упущение особенно поразительно, учитывая, что речь идет о такой компании, как Meta*, обладающей обширным опытом как в области ИИ, так и в области кибербезопасности. Meta* не ответила на запрос о комментарии для этой статьи, но в понедельник представитель Meta* заявил в X, что уязвимость устранена.

Каким бы неловким этот момент ни был для Meta* в частности, он также высвечивает основные уязвимости, общие для всех агентов ИИ. В отличие от традиционного программного обеспечения, агенты могут гибко — и неожиданно — реагировать на новые обстоятельства, что позволяет им заменять агентов службы поддержки из числа людей. Но агентов ИИ также можно обмануть способами, недоступными для людей, а поскольку они могут совершать реальные действия, эти ошибки влекут за собой последствия. «Человек спросил бы: „Хорошо, почему вы хотите изменить адрес электронной почты?“ и, возможно, ответил бы вопросом безопасности», — говорит Сомеш Джа, профессор компьютерных наук в Висконсинском университете в Мадисоне. «С этими агентами происходит то, что они очень стремятся завершить задачу. Это почти как какой-то ученик начальной школы, который просто хочет угодить учителю».

Существуют способы смягчить риски. Компании могут использовать традиционное программное обеспечение для создания защитных механизмов, гарантирующих, что агенты следуют строгим правилам, например, всегда запрашивают ответы на контрольные вопросы, прежде чем отправлять конфиденциальную информацию об учетной записи на новый адрес электронной почты. И все эксперты, опрошенные для этой статьи, сходятся во мнении, что агенты должны проходить тщательное red-teaming — процесс, в ходе которого разработчики изо всех сил пытаются атаковать систему, чтобы обнаружить ее уязвимости до ее развертывания.

Но существуют и противодействующие силы. Компании хотят развертывать способных агентов, и чем больше полномочий у агента — и чем меньше на него распространяется защитных механизмов — тем больше работы он потенциально может взять на себя. «Между безопасностью и полезностью всегда существует компромисс», — говорит Бо Ли, профессор компьютерных наук в Университете Иллинойса в Урбана-Шампейн. А адекватный red-teaming может быть дорогостоящим. Защитникам приходится тратить больше ресурсов, чем атакующим, поскольку атакующим нужно обнаружить только один эксплойт, в то время как защитники пытаются обнаружить и исправить как можно больше. Когда злоумышленники нацелены на нечто столь ценное, как однословное имя в Instagram* , они вкладывают ресурсы в поиск эксплойтов, поэтому защитникам приходится тратить еще больше денег на защиту этого приза.

По мере совершенствования моделей ИИ ужесточение их защиты может стать проще. Хотя вероятностная природа больших языковых моделей означает, что агенты на базе LLM всегда будут уязвимы для некоторых видов атак, более сложная модель могла бы счесть попытку изменить адрес электронной почты, связанный с аккаунтом Белого дома Обамы, подозрительной. А системы ИИ могут использоваться для red-teaming агентов, подобно тому, как участники Project Glasswing от Anthropic используют Mythos для выявления уязвимостей в своем программном обеспечении.

Тем не менее эксперты ожидают, что проблема защиты агентов ИИ будет только обостряться в будущем. По мере роста возможностей агентов компании, которые их внедряют, могут захотеть наделить их большей властью — как для предоставления большего количества услуг с меньшим количеством людей, так и для того, чтобы не отстать от конкурентов. В быстро меняющемся мире ИИ время, необходимое для тщательной защиты рискованных агентских систем, может показаться неоправданной задержкой.

«Все хотят быть первыми, кто что-то сделает, и просто выпустить это без тщательной проверки и red-teaming», — говорит Джа. «Я думаю, это очень опасно».

Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: