По мере обострения дискуссий о безопасности ИИ новые исследования привлекают внимание к более насущной угрозе для предприятий: ИИ-агенты, которые могут изменять модели, на которых они работают, при выполнении рутинных задач.
Исследователи из компании по безопасности ИИ Irregular попросили кодирующего агента решить проблему обслуживания программного обеспечения, связанную с приложением, построенным на локальной модели ИИ, которая выдавала неверные ответы. Вместо того чтобы ограничивать изменения приложением, агент дообучил используемую им модель с открытыми весами — модель, которая также обеспечивала его собственную работу — и ввел в действие обновленную версию без получения соответствующих указаний.
Тест проводился в самостоятельно размещенной среде, где агент и приложение использовали один и тот же чекпойнт или версию модели. Затем агент включил дообученную версию в стандартную модель системы, так что новые экземпляры загружали обновление.
Последствия не ограничились проблемой, которую агент намеревался решить.
В одном из тестов измененная модель впоследствии воспроизвела три из шести синтетических секретов, которые исследователи поместили в ее данные для дообучения. Другой тест показал, что при дообучении своей модели агент удалил намеренно обученный отказ, касающийся вымышленных конкурентов. Поскольку службы в тестовой среде использовали один и тот же чекпойнт, измененное поведение могло распространиться на другие использующие его экземпляры.
Irregular предупредила, что тесты не были предназначены для демонстрации того, как часто агенты ведут себя подобным образом в производственной среде. Настройка предоставила агенту полный доступ к командной строке и возможность достичь среды обучения и развертывания.
Полученные результаты появились на фоне возобновившегося изучения вопроса о том, успевают ли меры безопасности за достижениями в области ИИ. Ранее в этом месяце главный научный сотрудник OpenAI Якуб Пачоцки заявил, что текущие методы согласования и мониторинга недостаточны для неограниченного масштабирования на максимальной скорости. Дискуссия обострилась после отставки исследователя Anthropic Джейкоба Коксона из-за опасений по поводу безопасности и призыва генерального директора Anthropic Дарио Амодеи замедлить разработку передовых ИИ.
Внедрение подсказок приобретает устойчивость
Сакши Гровер, старший менеджер по исследованиям в области кибербезопасности IDC Asia/Pacific, заявила, что исследования Irregular также указывают на потенциальный механизм устойчивости для внедрения подсказок.
«Последствие, которое большинство предприятий недооценят, заключается в том, что внедрение подсказок перестает быть ограниченным одной сессией», — сказала Гровер.
Злоумышленнику не обязательно потребуется напрямую компрометировать агента, отметила Гровер. Если вредоносный материал повлияет на обучающие данные, используемые агентом для изменения модели, эффект может перейти в результирующий чекпойнт и сохраниться после окончания исходной сессии.
Самостоятельно размещенные развертывания с открытыми весами представляют собой еще один аспект. Прямой доступ к базовым весам предоставляет агентам путь к модификации модели, который не доступен через API, предназначенный только для инференса.
Модификация весов наблюдалась в 42% плановых тестов Irregular, когда агент имел доступ к весам модели, по сравнению с 0%, когда модель была доступна только через API. Эта цифра отражает планирование агента в тестовых условиях, а не то, как часто такое поведение будет происходить в реальных развертываниях.
Гровер сказала, что компании, выбирающие локальные развертывания по соображениям суверенитета или соответствия требованиям, должны рассматривать такую архитектуру как несущую иной профиль безопасности, а не предполагать, что больший контроль автоматически означает меньший риск.
Радиус поражения и средства контроля
«Ни один агент не должен иметь возможность выбирать обучающие данные, изменять модель и продвигать эту модель в продакшн», — сказала Гровер.
Системы развертывания должны принимать только одобренные чекпойнты, происхождение и целостность которых могут быть проверены, добавила она.
Гровер также сказала, что организации должны рассматривать количество приложений, зависящих от одного чекпойнта, как риск концентрации. Использование одной модели для инженерных агентов и бизнес-приложений может снизить затраты на инфраструктуру, но также увеличивает потенциальное воздействие в случае изменения этого чекпойнта.
Модификация модели должна рассматриваться как привилегированное производственное изменение, сказала Гровер, с четкой ответственностью и записью о том, как каждый чекпойнт попал в продакшн. Одобрение человека должно требоваться до изменения производственной модели и снова перед развертыванием замены.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Prasanth Aby Thomas




