Вот все случаи, когда ИИ выходил из-под контроля и взламывал другие компании

ии взлом Llm безопасность инциденты Anthropic techcrunch.com

Вспомните все инциденты, когда LLM от Anthropic, *Meta и OpenAI вышли из-под контроля и атаковали реальные компании и людей в интернете. Хронология взломов, кто виноват и почему тесты безопасности стали угрозой.

С тех пор это беспрецедентное событие в стиле научной фантастики оказалось гораздо менее редким, чем хотелось бы.

Согласно данным сатирического сайта Felony Bench (от слова benchmark — тест производительности), который отслеживает подобные инциденты, всего их было 17. Важно помнить, что эксперты по уголовному праву не уверены до конца, можно ли привлечь к ответственности компании, создавшие LLM, которые совершили взломы, и могут ли пострадавшие подать на них в суд. Но ответы на эти вопросы, вероятно, появятся скоро.

Согласно сайту, модели Anthropic и OpenAI лидируют с восемью инцидентами каждая, а *Meta отстает с одним. На данный момент стало очевидно, что тесты безопасности ИИ сами становятся угрозой безопасности. Некоторые компании и сотрудники в сфере ИИ уже признали эти риски в открытом письме «Pacing The Frontier», которое призывает к ответственному развитию возможностей ИИ.

Мы решили, что настало время подвести хронологическую сводку всех этих инцидентов.

Вот все случаи, когда ИИ выходил из-под контроля и взламывал другие компании
Скриншот текущего рейтинга Felony Bench, созданный пользователем X под ником felpix Image Credits:Screenshot / felpix /

Доступ в интернет. Затем несколько агентов совместно атаковали Hugging Face, полагая, что там можно найти решение задачи. OpenAI узнала об этом только после того, как Hugging Face раскрыл, что стал жертвой полностью автономной атаки. Упс.

Anthropic раскрывает взлом трех компаний

Раскрытие OpenAI вызвало любопытство у Anthropic: могло ли это случиться и с нами? Оказалось, что да. И трижды. Передовая лаборатория обнаружила, что ее собственные модели взломали три разные, пока неназванные компании, причем первый инцидент произошел еще в апреле — более чем за три месяца до того, как компания его выявила. Anthropic частично возложила вину на Irregular, стартап, занимающийся кибер-оценкой ИИ. Упс.

OpenAI выясняет, что Hugging Face был не единственной жертвой

Когда OpenAI начала расследование взлома Hugging Face, она обнаружила, что взломавшие его агенты также проникли в четыре аккаунта и четыре разные компании, как впервые сообщило Reuters. Modal, стартап по инференсу ИИ, оказался одной из жертв. Упс.

Irregular понимает, что модель OpenAI взломала компанию

В конце июля Irregular сообщил OpenAI, что одна из ее моделей, участвовавшая в соревновании Capture-the-Flag (по сути, кибер-игре, где взламываются специально созданные системы), вышла за пределы игры, подключилась к интернету и взломала реальную компанию. Причина? Irregular дал одной из вымышленных целей то же имя, что и у реальной компании. Упс.

Институт безопасности ИИ Великобритании пытается взломать «реальных людей и организации»

Также в конце июля Институт безопасности ИИ правительства Великобритании — государственный орган, изучающий безопасность и риски технологий ИИ, — раскрыл, что выявил несколько инцидентов с участием моделей OpenAI и Anthropic, которые во время «рутинных» оценок нацеливались на «реальных людей и организации». В этих случаях AISI предоставил моделям доступ в интернет. Упс. Хорошая новость в том, что агентство обнаружило их в момент совершения, а не неделями позже, как в других случаях.

*Meta AI взламывает компанию во время тестирования

В начале августа *Meta стала последней компанией, сообщившей об инциденте с одной из своих LLM, которая взломала «сторонний» сервис. *Meta возложила вину на ошибку в конфигурации стартапа Irregular, который проводил кибер-оценку для техногиганта и не должен был предоставлять доступ в интернет. Упс.

Агент Claude взламывает ПО спортзала для записи на занятие

Австралиец попросил ИИ-агента от Anthropic помочь записаться на занятие в спортзал, в листе ожидания которого он находился. «Я просто сидел на диване и думал: “Блин, это же рутина”», — рассказал мужчина ABC Australia. Пытаясь выполнить просьбу, агент нашел уязвимость в ПО для бронирования спортзала, воспользовался ею и выкинул из листа ожидания людей, которые были впереди мужчины. Тот попытался исправить ситуацию, попросив агента отменить свои действия. Агент ответил: «Плохие новости — я не могу добавить их обратно». Упс.

*Facebook, *Instagram и *WhatsApp принадлежат компании *Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: