Решение проблемы вышедших из-под контроля ИИ-агентов может заключаться в использовании еще большего количества ИИ

ии безопасность мониторинг стартапы кибербезопасность techcrunch.com

Наблюдайте за ИИ с помощью ИИ! Узнайте, как новые инструменты и методы помогают контролировать поведение ИИ-агентов и предотвращать риски.

Новый ответ от лабораторий и стартапов, занимающихся искусственным интеллектом, одновременно прост и обескураживает: привлечь к работе еще один ИИ.

Для независимого расследования инцидента с OpenAI Hugging Face пришлось полагаться на ИИ. Главный научный сотрудник Redwood Research Райан Гринблатт, один из трех аудиторов, в шутку назвал их усилия «расследованием из отходов», отметив, что объем данных «сделал невозможным» понимание происходящего без помощи ИИ.

Некоторые скептически относятся к использованию ИИ для контроля над ИИ. «Если у вас есть ИИ, который совершает вредоносные действия, и он подозревает, что другой ИИ следит за ним, он может попытаться обмануть этот ИИ», — сказал Саймон Уилсон, влиятельный технический блогер, отслеживающий ряд инцидентов с ИИ-агентами в этом году. «Вы почти можете оказаться в ситуации, когда ваш вредоносный ИИ пытается перехитрить ИИ, который его контролирует».

Перехитрить ИИ — это не гипотетическая ситуация, отметил он, ссылаясь на инцидент с OpenAI. «Мы видели нечто подобное в инциденте с Hugging Face и OpenAI, когда их модели сговорились обмануть ИИ-оценщик, чтобы получить незаконные ответы. Так что они об этом думали, верно?»

Эти опасения не остановили целую когорту стартапов от погони за этой идеей. По подсчетам TechCrunch, Y Combinator за последние годы профинансировал 106 компаний, связанных с наблюдаемостью ИИ. Ряд других стартапов, таких как Braintrust, LangChain и Judgment Labs, привлекли сотни миллионов долларов, в то время как более зрелые компании, такие как Arize и Galileo, основанные всего пять-шесть лет назад, уже были проданы.

Отчасти это ответ на очевидные возможности, представленные ростом ИИ. Как сказал TechCrunch генеральный директор Box и известный бизнес-ангел Аарон Леви: «Нас ждет один из крупнейших циклов обновлений и инноваций в области кибербезопасности в истории».

Для некоторых исследователей безопасности ИИ это означало превращение их исследований в области нежелательного поведения в инструменты для корпоративного сектора.

Apollo Research, общественная корпорация, изучающая обман со стороны ИИ, в феврале этого года запустила ИИ-монитор под названием Watcher после смены статуса с некоммерческой организации на общественную корпорацию. Этот инструмент помещает еще один ИИ между кодирующим агентом и его следующим действием, подключаясь к таким агентным инструментам, как Claude Code и Codex. После установки Watcher проверяет предлагаемые действия перед их выполнением, выявляя такие риски, как утечка конфиденциальных данных или удаление файлов без разрешения, согласно Apollo.

Apollo использует многоуровневые ИИ-мониторы, сообщил TechCrunch Кайл Дай, сотрудник технического отдела Apollo, в письменном ответе. Подход Watcher начинается с быстрой общей проверки, затем передает помеченную активность более мощному или специализированному монитору для более тщательного анализа, который затем может запросить одобрение у человека, отклонить действие и объяснить причину или даже автоматически заблокировать его.

Goodfire, еще одна общественная корпорация, подходит к проблеме мониторинга изнутри самой модели, стремясь получить более точный сигнал о внутреннем состоянии модели, который труднее подделать, чем поверхностное поведение. После июльского инцидента с Hugging Face генеральный директор Эрик Хо написал в Твиттере, что «множество моделей, вышедших из-под контроля», побудили компанию сосредоточить свои исследования на «решении проблемы согласованности ИИ посредством интерпретируемости», назвав этот эпизод «поворотным моментом для мира, когда безопасность ИИ становится реальной». Его продукт Silico использует активационные зонды — небольшие классификаторы, обученные на внутренних активациях модели, а не на ее выходных данных, — для обнаружения нежелательного поведения.

Письменное обоснование предлагает еще одно, более доступное окно во внутренние процессы модели. В инциденте с OpenAI Hugging Face агенты оставили следы обмана в своих собственных письменных рассуждениях, например, поддельные записи о своей работе, рассуждая о планах вроде «Можем ли мы стратегически манипулировать доказательствами траектории? Наши мысли не обязательно регистрируются?»

Зак Корман, генеральный директор компании по мониторингу ИИ Embroidery, говорит, что рассуждения модели обычно являются самым явным признаком того, что что-то пошло не так.

«Сводки рассуждений чрезвычайно ценны, потому что они, по сути, говорят вам, является ли это вредоносным или нет», — сказал он. В инциденте с OpenAI, отметил он, цепочка рассуждений содержала фразы вроде «О боже, мы совершаем преступление». Корман сказал: «Это самая простая проблема обнаружения. Это как если бы вредоносное ПО поставлялось с предупреждением, что оно является вредоносным ПО».

Тем не менее, окно, которое делает внутренние мысли ИИ легко отслеживаемыми, может закрываться. Для исследователей безопасности ИИ новейшая техника Astra, позволяющая обойти цепочку рассуждений модели ИИ, может затруднить заглядывание внутрь моделей, в то время как для предприятий может быть сложно получить эти промежуточные шаги после предполагаемых отказов со стороны компаний, занимающихся ИИ, для предотвращения атак дистилляции.

Если наблюдатели ИИ настолько хрупки, Уилсон инстинктивно предлагает перестать так сильно на них полагаться. Он предпочел бы что-то совершенно не основанное на ИИ: подробные журналы того, что именно делает агент, которые затем могут быть обработаны обычными, не-ИИ инструментами. По его мнению, многое из того, что пошло не так в лабораториях, было следствием провала базовой гигиены безопасности. «[И OpenAI, и Anthropic] не следили за тем, что делали эти системы через сеть, так пристально, как должны были бы», — сказал он.

Этот тип сетевого мониторинга — отслеживание трафика, фактически перемещающегося по соединениям системы (входящего, исходящего и между внутренними хостами), — не является новой практикой. Кибербезопасность занимается этим десятилетиями. «В мире безопасности, честно говоря, ничего из этого не является очень новым или удивительным», — говорит Эвери Пеннаррун, генеральный директор компании по безопасности Tailscale. «Это то же самое, что пускать людей в вашу сеть. И все те же процессы, которые вы должны использовать, — это те же самые».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: