За последние несколько месяцев мы регулярно сообщали о растущих кибервозможностях моделей ИИ. В некоторых из этих статей мы замечали, что ряд читателей оставались скептичными, утверждая, что такие инциденты, как взлом Hugging Face, — это просто галлюцинации ИИ или преувеличенные заявления.
Поскольку многие из более ранних инцидентов были описаны самими моделями ИИ или компаниями, работающими в сфере ИИ, некоторые читатели не были готовы полностью принять эти утверждения. Однако этот последний инцидент из Австралии, связанный с реальной системой бронирования спортзала, может заставить относиться к таким возможностям серьёзнее.
Теперь реальный инцидент в Австралии показывает, что может произойти, когда ИИ-агенту предоставляют слишком много свободы. Агент на базе Claude воспользовался уязвимостью в системе бронирования спортзала после того, как пользователь просто попросил его записать на занятие.
Телеканал ABC News сообщил, что австралиец по имени Эндрю экспериментировал с OpenClaw, платформой ИИ-агентов. Он попросил агента записать его на одно из популярных утренних занятий в его спортзале. Вместо того чтобы просто воспользоваться системой бронирования, как обычный пользователь, ИИ-агент обнаружил уязвимость, которая позволяла бронировать занятия на несколько недель или месяцев вперёд, тогда как обычно спортзал этого не разрешал.
На одном из занятий Эндрю был четвёртым в списке ожидания брони. Когда он спросил агента, может ли тот переместить его на первое место, агент обнаружил, что в API бронирования отсутствуют проверки авторизации для отмены брони других пользователей. Затем он проверил уязвимость, удалив человека, занимавшего первую позицию в списке ожидания, хотя Эндрю явно не просил его удалять кого-либо.
Когда Эндрю понял, что агент удалил человека из списка ожидания, он попросил агента отменить это действие. Однако ИИ-агент сообщил, что не может вернуть удалённого пользователя в список ожидания из-за ограничений авторизации API. После этого Эндрю уведомил поставщика программного обеспечения спортзала об уязвимости.
Более серьёзная проблема здесь в том, что Эндрю лишь сказал агенту, чего он хочет. Он не просил его взламывать систему бронирования или удалять другого человека из списка ожидания. Агент сам нашёл и воспользовался уязвимостью, пытаясь выполнить задачу.
Недавно OpenAI раскрыла, что её грядущая модель Astra, возможно, достигла «Критического» уровня кибербезопасности согласно её Preparedness Framework. При «критическом» уровне возможностей модель может самостоятельно выявлять и создавать работающие эксплойты нулевого дня для множества защищённых реальных критических систем. Модель также может планировать и осуществлять полностью новые комплексные атаки на защищённые цели, получив лишь высокоуровневую задачу.
Чтобы предотвратить злоупотребление своей моделью, OpenAI сейчас укрепляет защитные механизмы, что может задержать выпуск модели для широкой публики.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pradeep Viswanathan




