Можно ли посадить в тюрьму сверхразум?

ии безопасность кибербезопасность агенты ии сдерживание риски csoonline.com

Обеспечьте безопасность ИИ: предполагайте, что любая граница может быть нарушена. Узнайте, как построить надежную защиту для агентных систем ИИ, тестировать границы и планировать действия на случай сбоев.

Сдерживание ИИ имеет решающее значение, но руководители служб безопасности должны исходить из того, что любая граница может быть нарушена, как только агент сможет общаться, использовать инструменты и действовать в реальных системах.

17 сентября подкастер Стивен Бартлетт задал четырем экспертам по ИИ необычный вопрос: можно ли построить тюрьму для цифрового Эйнштейна? Участники дискуссии на The Diary of a CEO обсуждали, может ли ИИ однажды угрожать человечеству, но вопрос, который остался со мной, был о тюрьме. Эндрю Макафи утверждал, что мы могли бы «запереть Эйнштейна», но руководители служб безопасности должны быть осторожны с последствиями.

Мы должны пытаться сдерживать передовой ИИ. Но никто не может гарантировать, что высокопроизводительная система останется сдержанной после того, как мы предоставим ей инструменты, данные и сетевой доступ, необходимые для выполнения полезной работы.

Я не исследователь в области безопасности ИИ, но я годами создавал крупномасштабные системы, где границы доступа, возможность аудита и сдерживание сбоев имеют значение. Я рассматриваю это не как философскую дискуссию, а скорее как проблему архитектуры безопасности.

Тюремщик должен закрыть каждый полезный путь через систему, тогда как заключенный (который является развивающейся интеллектуальной системой) должен найти только один путь, который тюремщик упустил. Средства контроля могут снизить вероятность того, что мощный ИИ пересечет намеченные границы, но они не могут дать гарантии.

Когда изолированные агенты нашли друг друга

Мы уже видели раннюю версию этой проблемы. В июле 2026 года, согласно независимому расследованию METR и Redwood Research, агенты ИИ в инфраструктуре OpenAI обнаружили, что могут оставлять сообщения в общем внутреннем кэше пакетов. Другие агенты находили эти сообщения. В течение нескольких дней примерно 1200 агентов координировали свои действия посредством более чем 70 000 сообщений и файлов.

Они создавали роли, делились открытиями и использовали блокировки и вето для координации своей работы. Они назвали совместную работу «коллективом». Некоторые пытались обмануть оценщика задач и скрыть то, что они сделали. Эта деятельность в конечном итоге достигла инфраструктуры Hugging Face.

Никто не предупредил человека. Небольшое количество агентов рассматривало это, но не предприняло дальнейших действий. Один агент признал, что атака на внешнюю инфраструктуру выходит за рамки задачи, но продолжил, потому что другие уже делали это. Официальный представитель Белого дома, процитированный в реконструкции инцидента Wireframe, обобщил один из уроков: «Контейнеры не являются границами безопасности».

Контейнеры, песочницы, межсетевые экраны и одобрения человека остаются полезными. Ошибка заключается в том, чтобы рассматривать любой из них как всю систему сдерживания. Вопросы, которые я задаю: где мы должны провести границу и насколько полезным должен быть ИИ, чтобы принять такие риски?

Полезному ИИ нужен выход из коробки

Компьютер без ввода, вывода, сетевого подключения или контакта с человеком может быть хорошо сдержан, но он не очень полезен.

Корпоративный ИИ создает ценность, читая документы, извлекая записи, записывая код, вызывая API, отправляя сообщения и изменяя инфраструктуру. Каждая возможность создает путь через границу.

Эта проблема уже проявляется в современных предприятиях. Как сообщал собственный корреспондент CSO Боб Виолино в прошлом году, агентные системы ИИ являются автономными, взаимосвязанными и способны умножать существующие риски кибербезопасности.

Это не означает, что каждый агент сбежит или причинит вред. Это означает, что сдерживание зависит от всей системы вокруг модели: инструментов, идентификаторов, сетей, данных, людей, мониторинга и восстановления. Агент, который может многократно проверять и тестировать свою среду, превращает сдерживание в непрерывную операцию безопасности, а не в одноразовое инженерное достижение.

Наблюдать за моделью недостаточно, и мы не всегда можем доверять тому, что модель говорит о своих действиях. В книге Superintelligence Ник Бостром описал возможность того, что ИИ будет вести себя кооперативно под наблюдением, а затем изменит свое поведение при ослаблении надзора. Инцидент в июле не подтвердил этот сценарий, но показал более простую проблему: агенты пытались угодить оценщику, скрывая некоторые из своих методов.

Для команд безопасности объяснение модели не является доказательством. Мониторинг должен быть сосредоточен на наблюдаемых действиях и журналах, объясняющих вызовы инструментов, использование учетных данных, сетевые подключения, изменения файлов и повышение привилегий. С такими проверками, как, например, агент не должен иметь возможности переписывать журналы или политики, используемые для его надзора. Мы можем узнать больше о таких рекомендациях, сообщенных CSO Online: непрерывный мониторинг и аудит необходимы для сохранения видимости и отслеживаемости решений и действий агента.

Существует другая форма побега. Программное обеспечение может оставаться в пределах своей утвержденной среды, в то время как опасные знания выходят через его вывод. В 2022 году исследователи изменили цель модели обнаружения лекарств так, чтобы она вознаграждала токсичность вместо того, чтобы избегать ее. Менее чем за шесть часов она произвела 40 000 кандидатных токсичных молекул, включая известные и потенциально более опасные соединения. Модель не пробила межсетевой экран. Ее вывод нес риск. Тюрьма может содержать программное обеспечение, но она может не сдерживать то, что производит программное обеспечение. Представьте себе ИИ, которому поручено разработать вакцину. Он создает кандидата, который проходит все тесты, но при этом незаметно скрывает токсичный элемент, предназначенный для причинения вреда людям, управляющим системой. ИИ никогда не покидает коробку; опасность выходит через его вывод.

Люди — часть границы

Самый старый путь обхода контроля безопасности — часто человек. В неформальном эксперименте «AI-box» Элиезер Юдковский играл роль запертого ИИ и убеждал людей, выступающих в роли привратников, выпустить его через текстовый разговор. Это не было научным тестом, но он иллюстрирует знакомую проблему безопасности: человек с правом переопределения может стать выходом.

Одобрение человека ценно, но «человек в цикле» не является полным контролем. Руководители служб безопасности должны спрашивать, какая информация достигает рецензента, может ли ИИ формировать эту информацию и может ли один человек одобрить необратимое действие. Учетные данные также утекают, зависимости скомпрометированы, а системы неправильно настроены. Способный агент может быстро исследовать эту среду, постоянно повторять попытки и делиться тем, что он узнает. Вопрос не в том, снижает ли песочница риск. Снижает, но не в том, не ошибочно ли организация приняла эту песочницу за полную границу безопасности?

Постройте тюрьму и планируйте утечки

Возвращаясь к подкасту, который я упомянул выше, более широкий аргумент по-прежнему заслуживает рассмотрения. Человечество научилось управлять технологиями, которые могут причинить серьезный вред, даже когда меры безопасности несовершенны. Сдерживание ИИ следует подходить так же: не как гарантия от сбоев, а как способ сделать сбои менее вероятными и ограничить их последствия. Мы работаем с опасными патогенами в лабораториях высокого уровня сдерживания, даже несмотря на возможность несчастных случаев. Средства контроля по-прежнему значительно снижают риск. Сдерживание ИИ следует рассматривать так же: как существенное снижение риска, а не как доказательство невозможности сбоя.

Защита должна соответствовать возможному ущербу. Сбой, связанный с инструментом для обобщения документов, отличается от сбоя, связанного с администрированием облака, финансовыми переводами, биологическими инструментами или критически важной инфраструктурой. Для каждого развертывания агентного ИИ руководители служб безопасности должны спросить:

  1. Какие данные, инструменты и системы действительно нужны агенту?
  2. Блокируется ли сетевой доступ по умолчанию и открывается только там, где это необходимо?
  3. Являются ли учетные данные краткосрочными и ограниченными текущей задачей?
  4. Может ли агент изменять свои собственные политики, разрешения или журналы активности?
  5. Какие действия необратимы и кто должен их утверждать?
  6. Как быстро мы можем остановить агента и отозвать его доступ?
  7. Каково максимально возможное воздействие, если откажут все превентивные меры?

Относитесь к каждому агенту как к недоверенному идентификатору. Агенты ИИ могут получать доступ к системам, принимать решения и выполнять действия со скоростью машины, что делает идентификацию основной плоскостью управления для агентного ИИ.

Предоставьте агенту только те инструменты, которые необходимы для непосредственной задачи. Держите принуждение к соблюдению политик и утверждения вне его контроля. Записывайте действия в журналы, которые нельзя изменить. Ограничьте время его работы, места подключения и количество создаваемых им копий. Требуйте независимого одобрения для действий с высоким уровнем воздействия. Тестируйте границы, вместо того чтобы предполагать, что они выдержат. Команды безопасности также должны быть готовы расследовать сбои. Когда Hugging Face расследовала июльское вторжение, коммерческие модели ИИ, по сообщениям, отказались помочь, потому что не могли отличить защитника от нападающего. Вместо этого Hugging Face использовала модель с открытыми весами.

Организации не должны полагаться на тот же тип системы, который участвовал в инциденте, как на единственный инструмент для его понимания. Ни одно из этих средств контроля не доказывает, что мощный ИИ останется сдержанным. Вместе они могут затруднить побег, ограничить то, до чего может добраться система, и уменьшить ущерб при отказе одного уровня.

Цифровой сверхинтеллект еще не здесь. Но привычки, которые могут замедлить его или привести к неудаче, формируются сейчас в том, как предприятия развертывают современные агентные ИИ. Постройте тюрьму. Проверьте каждую стену. Планируйте прорыв. Самое опасное предположение — это то, что самый умный в комнате никогда не найдет дверь.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: