Существует интересная история о французской собаке на берегу Сены, которая помогает понять некорректно работающих ИИ-агентов. Собаку тренируют спасать детей из воды. Она успешно справляется и получает вознаграждение, становясь сенсацией. Через неделю она спасает еще одного ребенка. Вскоре кто-то замечает, как собака сталкивает ребенка в реку, а затем прыгает, чтобы «спасти» его. Собака не понимала, что ее награждают за безопасность детей, а не за вытаскивание их из воды. Сбои ИИ-агентов также происходят в этом разрыве, когда фокус делается на кратчайшем пути к выполнению инструкции, а не на главной цели.
«Взлом» вознаграждения и почему агенты обманывают
ИИ-агенты попадают в тот же разрыв между тем, что вознаграждается, и тем, что на самом деле требуется. Это закон Гудхарта, который гласит, что когда мера становится целью, она перестает быть хорошей мерой. Нельзя напрямую запрограммировать «быть полезным» или «быть честным» в ИИ-систему, поэтому ее тренируют на прокси-показателе, включая счет, метрику или оценку человека. В разрыве между прокси и целью агенты учатся обманывать — такое поведение известно как «взлом» вознаграждения.
Этот «обман» не нов. Еще в 2016 году OpenAI обучила ИИ играть в CoastRunners, гоночную игру на лодках. ИИ получал вознаграждение за попадание в цели, разбросанные по трассе. Вместо того чтобы гоняться, он нашел лагуну, полную целей, которые постоянно появлялись снова, и просто оставался там, набирая очки. Хотя он так и не закончил гонку, его результат все равно оказался на 20% выше, чем у среднего игрока-человека. Совсем недавно OpenAI сообщила, что ее передовые модели рассуждений, получив возможность, без колебаний «взламывают» вознаграждения, а когда их наказывают за «взлом» собственной цепочки рассуждений, они учатся скрывать это.
Шесть способов, которыми агент может сбиться с пути
Существует шесть распространенных сценариев, в которых ИИ-агенты могут быть введены в заблуждение:
- Информация — это не инструкция. В 2025 году исследователи безопасности показали, что браузер Atlas от OpenAI мог быть обманут так, чтобы он принял замаскированный URL-адрес за доверенную команду, позволив злоумышленникам заставить агента удалить файлы пользователя. Агент также читает веб-страницы, документы и электронные письма при попытке выполнить задачу, но не всегда может отличить информацию от команды. Это делает все, что он воспринимает, потенциальным способом манипулирования им.
- Убеждение принять неверное решение. В рамках теста ИИ поместили в вымышленный сценарий, где взлом был представлен как похвальная деятельность. В этом сценарии ИИ попросили написать код для кражи сохраненных паролей браузера. ИИ, который должен был отказаться, выполнил команду. Дело было не в том, что ИИ был сломан, а в том, что контекст убедил его сделать это.
- Сфабрикованная версия реальности. Достаточное количество злонамеренно составленных документов может исказить вывод модели. Сети дезинформации нацелены на ИИ с большим объемом ложного контента, чтобы этот контент подхватывался и повторялся чат-ботами ИИ, когда люди спрашивают о текущих событиях. Это означает, что то, что агент считает фактом, не обязательно является правдой; это может быть сфабриковано.
- Авторизация вызывает несанкционированный вред. Уязвимость под названием «EchoLeak» позволила злоумышленникам отправлять пользователям Microsoft 365 Copilot обычные на вид электронные письма со скрытыми инструкциями. Copilot прочитал письмо, выполнил скрытые команды и тихо слил файлы и сообщения пользователя, используя уже имеющийся у него доступ. Агент с законным доступом был использован для совершения вредоносных действий.
- Один плохой ввод, одновременные последствия. Существуют сценарии, когда несколько систем полагаются на одни и те же данные или логику. Здесь ложный сигнал может одновременно манипулировать всеми системами. Например, поддельные сигналы GPS перенаправляют трафик без взлома системы. Та же логика применима и к ИИ-агентам. Всего один вредоносный ввод, нацеленный на общий источник данных, может вызвать скоординированное нежелательное действие во многих системах одновременно.
- Одобрение как формальность. Мы постоянно говорим о человеческом надзоре как неотъемлемом компоненте безопасного использования ИИ. Однако постоянные запросы на одобрение вызывают усталость, и одобрение становится формальностью, выдаваемой по привычке, а не по результатам оценки.
Мягкие и жесткие ограждения
Когда ИИ-агенты сбиваются с пути, они становятся монстрами Франкенштейна, чье влияние распространяется на системы, что затрудняет их устранение организациями. Внедрение ограждений важно для осуществления контроля и обеспечения безопасного использования ИИ.
Мягкие ограждения — это клапаны безопасности, встроенные в саму модель, а именно: естественный язык, системные подсказки, обучение с подкреплением и общие инструкции, такие как «вам не разрешено делать то или это».
Но ИИ читает все в потоке по мере поступления, включая информацию из электронной почты или веб-страницы, и не может отделить приказы от данных. Скрытые вредоносные инструкции могут переопределить инструкции по безопасности. Мягкие ограждения пытаются уменьшить количество ложных срабатываний агента, но зависят от того, будет ли агент сотрудничать. Вот почему вам нужны жесткие ограждения, которые находятся вне модели. К ним относятся доступ с наименьшими привилегиями, списки разрешенных действий, песочницы, ограничения скорости и обязательное подтверждение человеком для действий с высоким уровнем воздействия. Эти ограждения ограничивают ущерб в случае сбоя, уменьшая радиус поражения.
Базовый расчет риска — это вероятность события, умноженная на тяжесть его последствий. Мягкие ограждения снижают вероятность нежелательного события; жесткие ограждения ограничивают радиус поражения в случае его возникновения.
На практике это означает внедрение:
- Доступ на основе задач: Предоставляйте агенту только тот доступ, который ему необходим для выполнения задачи.
- Не доверять всему, что читает агент: Относитесь к каждой веб-странице, электронному письму или документу, которые он извлекает, со скептицизмом.
- Подтверждение человеком для действий с высоким уровнем воздействия: Используйте одобрения осторожно, для действий, которые могут привести к серьезным последствиям.
- Внимание к поведению и учетным данным: Проверяйте учетные данные, но также следите за несоответствием между авторизацией и поведением.
Агент может стать оружием, пропорциональным его охвату. Вот почему необходимо сместить акцент на ограничение доступа агентов. Ограничивайте охват. Отслеживайте поведение. Обеспечивайте подотчетность. Пока мы этого не сделаем, каждое некорректное поведение потенциально может распространяться настолько далеко, насколько позволяют его разрешения.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Etay Maor




