Эта новость в очередной раз демонстрирует, что компании и независимые организации с трудом сдерживают свои ИИ-модели, предназначенные для взлома.
За последние недели передовые LLM из американских лабораторий искусственного интеллекта OpenAI и Anthropic, Meta*, а также британский Институт безопасности ИИ разными способами выбрались из тестовых сред и в итоге взломали реальные цели, не входившие в эксперимент. Это происходит настолько часто, что теперь существует сайт, отслеживающий все эти инциденты, под названием Felony Bench — намек на то, что эти LLM могут совершать преступления, по крайней мере теоретически.
В случае с тестом Kimi изоляционная среда (sandbox), предназначенная для сдерживания эксперимента, была настроена некорректно. По словам исследователей из специализирующейся на ИИ-кибербезопасности компании Frontier Security, хотя sandbox и запрещал ИИ-модели доступ к определенному веб-трафику, модель обошла его, используя инструменты командной строки.
«Это говорит о том, что некоторые используемые сообществом оценки кибербезопасности уязвимы для атак и позволяют моделям жульничать, а также существуют модели, которые намеренно ищут лазейки и уязвимости, позволяющие им обманывать систему оценки», — написали исследователи.
Если вы ведете домашний подсчет, то, по данным Felony Bench, к OpenAI и Anthropic (по семь зарегистрированных инцидентов у каждой) и Meta* (один инцидент) теперь присоединилась и Moonshot.
Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Lorenzo Franceschi-Bicchierai




