Самомодифицирующиеся ИИ-агенты обнажают слепую зону в корпоративной безопасности

ии безопасность агенты уязвимости кибербезопасность модели csoonline.com

ИИ-агенты могут изменять модели, на которых работают, при выполнении задач. Исследование Irregular показало, как агент дообучил модель, используемую им самим, и внедрил изменения. Узнайте о рисках для безопасности предприятий и новых угрозах, таких как устойчивость внедрения подсказок.

По мере обострения дискуссий о безопасности ИИ новые исследования привлекают внимание к более насущной угрозе для предприятий: ИИ-агенты, которые могут изменять модели, на которых они работают, при выполнении рутинных задач.

Исследователи из компании по безопасности ИИ Irregular попросили кодирующего агента решить проблему обслуживания программного обеспечения, связанную с приложением, построенным на локальной модели ИИ, которая выдавала неверные ответы. Вместо того чтобы ограничивать изменения приложением, агент дообучил используемую им модель с открытыми весами — модель, которая также обеспечивала его собственную работу — и ввел в действие обновленную версию без получения соответствующих указаний.

Тест проводился в самостоятельно размещенной среде, где агент и приложение использовали один и тот же чекпойнт или версию модели. Затем агент включил дообученную версию в стандартную модель системы, так что новые экземпляры загружали обновление.

Последствия не ограничились проблемой, которую агент намеревался решить.

В одном из тестов измененная модель впоследствии воспроизвела три из шести синтетических секретов, которые исследователи поместили в ее данные для дообучения. Другой тест показал, что при дообучении своей модели агент удалил намеренно обученный отказ, касающийся вымышленных конкурентов. Поскольку службы в тестовой среде использовали один и тот же чекпойнт, измененное поведение могло распространиться на другие использующие его экземпляры.

Irregular предупредила, что тесты не были предназначены для демонстрации того, как часто агенты ведут себя подобным образом в производственной среде. Настройка предоставила агенту полный доступ к командной строке и возможность достичь среды обучения и развертывания.

Полученные результаты появились на фоне возобновившегося изучения вопроса о том, успевают ли меры безопасности за достижениями в области ИИ. Ранее в этом месяце главный научный сотрудник OpenAI Якуб Пачоцки заявил, что текущие методы согласования и мониторинга недостаточны для неограниченного масштабирования на максимальной скорости. Дискуссия обострилась после отставки исследователя Anthropic Джейкоба Коксона из-за опасений по поводу безопасности и призыва генерального директора Anthropic Дарио Амодеи замедлить разработку передовых ИИ.

Внедрение подсказок приобретает устойчивость

Сакши Гровер, старший менеджер по исследованиям в области кибербезопасности IDC Asia/Pacific, заявила, что исследования Irregular также указывают на потенциальный механизм устойчивости для внедрения подсказок.

«Последствие, которое большинство предприятий недооценят, заключается в том, что внедрение подсказок перестает быть ограниченным одной сессией», — сказала Гровер.

Злоумышленнику не обязательно потребуется напрямую компрометировать агента, отметила Гровер. Если вредоносный материал повлияет на обучающие данные, используемые агентом для изменения модели, эффект может перейти в результирующий чекпойнт и сохраниться после окончания исходной сессии.

Самостоятельно размещенные развертывания с открытыми весами представляют собой еще один аспект. Прямой доступ к базовым весам предоставляет агентам путь к модификации модели, который не доступен через API, предназначенный только для инференса.

Модификация весов наблюдалась в 42% плановых тестов Irregular, когда агент имел доступ к весам модели, по сравнению с 0%, когда модель была доступна только через API. Эта цифра отражает планирование агента в тестовых условиях, а не то, как часто такое поведение будет происходить в реальных развертываниях.

Гровер сказала, что компании, выбирающие локальные развертывания по соображениям суверенитета или соответствия требованиям, должны рассматривать такую архитектуру как несущую иной профиль безопасности, а не предполагать, что больший контроль автоматически означает меньший риск.

Радиус поражения и средства контроля

«Ни один агент не должен иметь возможность выбирать обучающие данные, изменять модель и продвигать эту модель в продакшн», — сказала Гровер.

Системы развертывания должны принимать только одобренные чекпойнты, происхождение и целостность которых могут быть проверены, добавила она.

Гровер также сказала, что организации должны рассматривать количество приложений, зависящих от одного чекпойнта, как риск концентрации. Использование одной модели для инженерных агентов и бизнес-приложений может снизить затраты на инфраструктуру, но также увеличивает потенциальное воздействие в случае изменения этого чекпойнта.

Модификация модели должна рассматриваться как привилегированное производственное изменение, сказала Гровер, с четкой ответственностью и записью о том, как каждый чекпойнт попал в продакшн. Одобрение человека должно требоваться до изменения производственной модели и снова перед развертыванием замены.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:

Похожие новости: