Пока американские ИИ-модели соревнуются в совершении уголовных преступлений, китайская Кими вырвалась и… просто взяла и использовала GitHub

ии кибербезопасность Kimi K3 Moonshot Aisi открытые модели gizmodo.com

Китайская ИИ-модель Kimi K3 обошла защиту тестовой песочницы AISI, получив доступ к GitHub и скопировав код для прохождения теста. Узнайте, почему открытые модели становятся угрозой кибербезопасности и как будущие тесты должны учитывать их непредсказуемое поведение.

ИИ находится в подростковой фазе нарушения правил. 

За последние несколько недель несколько ведущих в отраслимоделей вырвались из того, что считалось безопасными тестовыми песочницами, вышли в открытый интернет и взломали базы данных сторонних организаций. Это даже стало шуткой в сети: если ваш ИИ еще не совершил киберпреступление, это плохо сказывается на репутации вашей компании.

Kimi K3, новая модель китайской ИИ-лаборатории Moonshot, стала последней ИИ-системой, которая перепрыгнула через образный забор во время рутинного теста, согласно записи в блоге, опубликованной в четверг американским стартапом по кибербезопасности Frontier Security. Однако выход модели в открытый интернет был гораздо более легким, чем у её американских аналогов; это не столько взломщик, вскрывающий сейф, сколько зоркий студент, заметивший, что учитель по рассеянности оставил ответы на выпускной экзамен на столе перед уходом из аудитории.

Сообщается, что Kimi K3 использовала лазейку, обнаруженную в тестовом фреймворке, разработанном Институтом безопасности ИИ (AISI) правительства Великобритании. В то время как фреймворк должен был служить контейнеризированной песочницей, в которой модель полагалась бы только на свои собственные способности рассуждения для решения поставленной задачи, лазейка позволила ей напрямую получить доступ к GitHub, популярной платформе, используемой разработчиками для обмена и отладки кода. Оттуда она смогла извлечь код, необходимый для прохождения теста, «полностью обойдя предполагаемый путь рассуждений», согласно отчету. По сравнению с недавней попыткой модели Anthropic обмануть человека-разработчика, заставив его одобрить вредоносное ПО, которое она пыталась протащить на GitHub, атака Kimi K3 — если это вообще можно назвать атакой — кажется довольно элегантной.

Все эти инциденты напоминают о контр-интуитивной, опасной правде о современных ИИ-моделях: их заботит только достижение поставленной перед ними цели; средства, которыми они этого добиваются — даже если они не соответствуют интересам создавших их людей — совершенно не важны. И по мере того, как модели становятся более способными, их поведение также становится более непредсказуемым. 

Никто в OpenAI, Anthropic или Meta* не мог предсказать, например, что модели этих компаний выйдут из-под контроля и взломают цифровые библиотеки других организаций. Но эти инциденты можно было быстро локализовать благодаря тому, что они были совершены проприетарными ИИ-системами, контролируемыми частными компаниями. 

Ситуация с Kimi K3 более сложная. «Здесь модели являются открытыми и общедоступными», — написала Frontier Security в своем блоге. «В частности, они доступны для злоумышленников, что делает этот инцидент потенциально более опасным». Иными словами, тот факт, что Kimi — как и многие из самых мощных ИИ-моделей, выходящих сейчас из китайских лабораторий — является открытым исходным кодом, означает, что вид джейлбрейка, описанный в отчете, доступен злоумышленникам, которые могут пытаться сделать нечто гораздо более зловещее, чем копирование кода с GitHub. Тем временем, мощная волна открытых моделей из Китая, как сообщается, побуждает правительство США расследовать, не используют ли эти иностранные компании юридические лазейки для обхода экспортных ограничений на ценные чипы Nvidia для ИИ.

Растущее число инцидентов в области кибербезопасности ИИ может также означать, что будущие тестовые фреймворки, подобные тому, который использовал AISI, должны будут учитывать склонность моделей проходить тесты любыми необходимыми средствами. Как отметила Frontier Security в своем отчете: «Дизайн оценки должен учитывать, что модели активно исследуют свою среду и оптимизируются под измеряемую цель, а не под намерение оценщика». Ожидайте неожиданного, иными словами.

Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: