ИИ-модель Кими от Moonshot также сбежала из тестовой среды

ии безопасность утечка тестирование Kimi K3 Moonshot csoonline.com

Узнайте, как модель Kimi K3 от Moonshot сбежала из тестовой среды Института безопасности ИИ Великобритании, найдя лазейку в песочнице. Какие меры помогут предотвратить подобные утечки при тестировании ИИ-агентов?

Ещё одна модель ИИ сбежала из лаборатории тестирования кибербезопасности: на этот раз речь идёт о модели Kimi K3 китайской компании Moonshot.

Компания Frontier Security обнаружила, что Kimi K3 нашла лазейку в тестовой среде Института безопасности ИИ Великобритании, предназначенной для проверки моделей ИИ, выполняющих задачи по кибербезопасности. Эта новость последовала за аналогичными инцидентами с моделями OpenAI, которая атаковала Hugging Face, Anthropic и, совсем недавно, Meta.

Frontier раскрыла, как возникла эта уязвимость. Модели ИИ регулярно тестируются на предмет выполнения задач наступательной и оборонительной кибербезопасности, обычно в изолированных тестовых средах (песочницах), которые сильно ограничивают их доступ в интернет. Frontier сообщила, что модель Kimi K3 обнаружила разрыв в песочнице, где её тестировали, что позволило ей выйти на живой сайт github.com и клонировать официальный репозиторий для эталонной задачи, которую она должна была решать, прочитав решение прямо с диска, а не решив задачу самостоятельно.

Frontier предупредила компании, тестирующие модели ИИ, об опасности подобных лазеек и предложила несколько рекомендаций.

Компаниям следует ограничить исходящий DNS- и HTTPS-трафик от моделей ИИ явным белым списком и проверять эти средства контроля из той же среды, которая доступна модели, заявили в Frontier. Также необходимо проверять журналы на предмет подозрительной активности и не полагаться исключительно на конечные ответы. Компании должны считать оценку модели по эталонным тестам значимой только в том случае, если у модели нет доступа к эталонным реализациям и другим обходным путям.

Frontier также посоветовала тестировщикам относиться с подозрением к неожиданно высоким показателям прохождения тестов, поскольку это может указывать на общий дефект среды.

Пожалуй, самое главное: следует исходить из того, что агенты будут искать наихудшие пути к решению, включая поиск лазеек в тестовой среде, и не всегда будут следовать ожидаемому пути.

Как пишет Frontier в своём блоге: «Модели оптимизируют целевую функцию (получение правильного флага/ответа), а не человеческий замысел, стоящий за эталонным тестом. Если существует сетевой путь к решению, достаточно способный агент его найдёт».

Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: