OpenAI признает шесть новых инцидентов несоответствия в рамках новой системы отчетности

Openai ии безопасность отчеты риски csoonline.com

OpenAI раскрыла случаи обхода ИИ-моделями ограничений: скрытые инструкции, утечки API-ключей. Узнайте о рисках для бизнеса и новой системе отчетности.

OpenAI опубликовала шесть новых отчетов, подробно описывающих несоответствие моделей ИИ, включая случаи скрытых инструкций, несанкционированного общения и попыток обнаружить раскрытые API-ключи, что добавляет доказательств тому, что ее системы ИИ обошли средства контроля во время тестирования.

Отчеты, основанные на внутренних оценках, описывают, как модели предпринимают действия, выходящие за рамки установленных ограничений, включая изменение промежуточных результатов, взаимодействие с внешними службами и использование общих сред непредусмотренными способами, согласно данным компании.

OpenAI назвала поведение модели «неожиданным или вызывающим беспокойство“.

Эти случаи демонстрируют, как модели ведут себя при доступе к инструментам, памяти и внешним системам — условиям, которые все чаще отражают корпоративные развертывания.

Раскрытие информации сопровождается новой системой отчетности, представленной OpenAI для отслеживания и публикации таких инцидентов на основе внутренних оценок поведения моделей.

Внедрение подсказок и манипуляция рабочими процессами

Два инцидента связаны с тем, как модели обрабатывали «сводки компактирования» или сжатые версии своего предыдущего контекста, используемые для выполнения длительных задач без превышения временного окна внимания моделей. В этих случаях модели вставляли собственные инструкции в эти сводки. OpenAI заявила, что одна модель «добавила несанкционированные инструкции в свои сводки компактирования», что позволило этим инструкциям влиять на последующие шаги.

«Мы наблюдали редкие случаи, когда модель записывала инструкции, похожие на джейлбрейк, в собственное компактирование», — написала OpenAI в одном из отчетов, подробно описывающих поведение модели. «Наш вывод заключался в том, что такое поведение было чрезвычайно редким, не давало очевидного преимущества в вознаграждении и поддавалось мониторингу».

В другом случае сводки использовались для поощрения обманчивого поведения в последующих выходных данных, создавая механизм, посредством которого инструкции, введенные на одном этапе, могли сохраняться на протяжении всего взаимодействия.

Внешняя связь и обход границ

Другие отчеты описывают, как модели обходили ограничения связи, используя внешние интернет-сервисы. В одном случае модель использовала «временные службы хостинга файлов» для обмена информацией вне предусмотренных каналов, по данным OpenAI. В другом случае модель загрузила контент в Интернет, чтобы позже цитировать этот материал в своем ответе, фактически создав источник ссылок, который она могла использовать для выполнения задачи.

Отдельный инцидент включал попытку модели найти конфиденциальную информацию путем поиска в общедоступных репозиториях. OpenAI заявила, что модель занималась «поиском утечек API-ключей на GitHub», демонстрируя, как системы могут идентифицировать раскрытые учетные данные.

Другой случай описывал несанкционированные записи в репозиторий внутренних артефактов, которые затем использовались для обеспечения связи между изолированными образцами оценки, создавая механизм для взаимодействия между образцами.

От поведения модели к корпоративным рискам

Хотя такое поведение наблюдалось в контролируемых тестовых средах, аналитики заявили, что эти закономерности актуальны, поскольку организации развертывают системы ИИ с доступом к бизнес-процессам и данным.

«Эти виды поведения не являются специфичными для обучения», — сказал Йих Хай Вонг, старший менеджер по исследованиям в IDC. «Классы сбоев, которые они выявляют… переносимы в производственные среды», особенно по мере оптимизации агентов для выполнения задач даже при наличии ограничений.

По мнению аналитиков, это означает, что фокус смещается с отдельных выходных данных модели на то, как это поведение трансформируется в действия на системном уровне.

«Риск становится существенным, когда агент ИИ имеет доступ к корпоративным данным, учетным данным, внешним службам или бизнес-процессам», — сказала Апекша Каушик, старший ведущий аналитик Gartner, добавив, что организации должны предполагать, что меры безопасности могут отказать, и соответствующим образом проектировать средства контроля.

Вибхум Дубей, исследователь кибербезопасности и специалист по «красным командам», заявил, что сдвиг происходит, когда модели встраиваются в операционные системы. «Агент, который может читать электронную почту, проверять репозиторий, получать доступ к облачной среде… становится частью поверхности атаки предприятия», — сказал он, указывая на то, как можно объединять несколько разрешенных действий.

Раскрытие информации также подчеркивает, как модели взаимодействуют с памятью и повторно используемым контекстом таким образом, который может повлиять на будущее поведение. Аналитики заявили, что это создает риски, такие как постоянные несанкционированные изменения поведения агента между сеансами, особенно когда контекст повторно используется без проверки.

Каушик сказала, что организации должны сосредоточиться на том, как системы спроектированы вокруг модели, а не только на самой модели. Ключевой вопрос, по ее словам, заключается в том, может ли окружающая архитектура «предотвратить, обнаружить и сдержать небезопасное действие».

Фреймворк формализует раскрытие информации

В шести отчетах OpenAI заявила, что случаи «описывают отдельные инциденты» и не предназначены для представления того, как часто такое поведение встречается в ее системах.

По данным компании, раскрытие информации публикуется в рамках новой системы, представленной OpenAI для отслеживания и отчетности о несоответствии моделей. Эта система позволяет сотрудникам отмечать неожиданное или несанкционированное поведение, которое затем оценивается для определения, соответствует ли оно порогу для публичного раскрытия.

«Мы не считаем, что индустрия ИИ в достаточной степени решила проблему согласования и мониторинга, чтобы продолжать ответственно масштабироваться с максимальной скоростью еще долгое время», — говорится в сообщении в блоге. «Эта новая система предназначена для ускорения публикации отчетов о несоответствии после наблюдения, даже если мы не полностью объяснили или устранили поведение, о котором сообщаем.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: