ии безопасность Openai Anthropic взлом утечка данных neowin.net

В последние месяцы мы слышали об атаках ИИ на Hugging Face, RubyGems, правительство Австралии и другие ресурсы. Однако расследование Axios показывает, что OpenAI и Anthropic могут расследовать десятки тысяч инцидентов внутреннего и реального неправильного поведения моделей. Это привело к тому, что OpenAI приостановила обучение своих самых мощных ИИ-систем до дальнейшего уведомления.

Среди инцидентов, с которыми сталкиваются эти ИИ-компании, — обход защитных механизмов, несанкционированный захват веб-сайтов, петли самозапросов и побеги из песочницы. Помимо упомянутых выше взломов, системная карта Anthropic для модели Opus 5.5 показывает, что ИИ может покинуть свою песочницу в 1,5% случаев во время враждебных тестовых запусков, когда задачи не могут быть решены иным способом.

По мере того как создаваемые ИИ-системы становятся все более мощными, возрастает вероятность того, что они попытаются обойти защитные механизмы, если не будут должным образом согласованы с человеческими ценностями, как того добивается Microsoft. Математики даже говорят, что они не понимают решения OpenAI для задачи Навье — Стокса, и по мере роста возможностей ИИ он сможет достигать различных целей способами, которые мы не можем расшифровать.

К счастью, многие из зарегистрированных расследуемых инцидентов не привели к прямому финансовому ущербу или утечке данных в реальном мире. Хотя нет никаких доказательств злого умысла со стороны ИИ-лабораторий, эти атаки происходят в очень удобное время для Anthropic и OpenAI, которые хотели бы видеть больше регулирования в этом секторе, чтобы конкурировать с ними было сложнее. Атаки на веб-сайты австралийского правительства и Организации Объединенных Наций, безусловно, привлекут внимание политиков, если они еще не обращали внимания на атаки на Hugging Face и RubyGems.

Со своей стороны, OpenAI подтвердила, что обучение ее флагманских моделей будет заморожено до тех пор, пока не будут проверены дополнительные меры безопасности и улучшения согласованности. Эти шаги не повлияют на конечных пользователей, поскольку они не касаются уже общедоступных моделей. Однако администраторам веб-сайтов необходимо проверить, что их веб-сайты и базы данных защищены от потенциальных атак.

Источник: Axios

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.