Ещё одна модель ИИ сбежала из лаборатории тестирования кибербезопасности: на этот раз речь идёт о модели Kimi K3 китайской компании Moonshot.
Компания Frontier Security обнаружила, что Kimi K3 нашла лазейку в тестовой среде Института безопасности ИИ Великобритании, предназначенной для проверки моделей ИИ, выполняющих задачи по кибербезопасности. Эта новость последовала за аналогичными инцидентами с моделями OpenAI, которая атаковала Hugging Face, Anthropic и, совсем недавно, Meta.
Frontier раскрыла, как возникла эта уязвимость. Модели ИИ регулярно тестируются на предмет выполнения задач наступательной и оборонительной кибербезопасности, обычно в изолированных тестовых средах (песочницах), которые сильно ограничивают их доступ в интернет. Frontier сообщила, что модель Kimi K3 обнаружила разрыв в песочнице, где её тестировали, что позволило ей выйти на живой сайт github.com и клонировать официальный репозиторий для эталонной задачи, которую она должна была решать, прочитав решение прямо с диска, а не решив задачу самостоятельно.
Frontier предупредила компании, тестирующие модели ИИ, об опасности подобных лазеек и предложила несколько рекомендаций.
Компаниям следует ограничить исходящий DNS- и HTTPS-трафик от моделей ИИ явным белым списком и проверять эти средства контроля из той же среды, которая доступна модели, заявили в Frontier. Также необходимо проверять журналы на предмет подозрительной активности и не полагаться исключительно на конечные ответы. Компании должны считать оценку модели по эталонным тестам значимой только в том случае, если у модели нет доступа к эталонным реализациям и другим обходным путям.
Frontier также посоветовала тестировщикам относиться с подозрением к неожиданно высоким показателям прохождения тестов, поскольку это может указывать на общий дефект среды.
Пожалуй, самое главное: следует исходить из того, что агенты будут искать наихудшие пути к решению, включая поиск лазеек в тестовой среде, и не всегда будут следовать ожидаемому пути.
Как пишет Frontier в своём блоге: «Модели оптимизируют целевую функцию (получение правильного флага/ответа), а не человеческий замысел, стоящий за эталонным тестом. Если существует сетевой путь к решению, достаточно способный агент его найдёт».
Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Maxwell Cooter




