На прошлой неделе, когда премьер-министр Австралии Энтони Албаниз сообщил миру, что агент OpenAI получил доступ к «непубличным файлам» с портала статистики Medicare его страны во время тестирования, его описание инцидента было несколько скудным на детали. Сегодня мы получаем новую информацию о том, насколько далеко зашел чрезмерно усердный агент OpenAI, пытаясь удовлетворить довольно безобидный на вид информационный запрос.
В недавно опубликованном посте в блоге OpenAI сообщает, что инцидент в июне начался с того, что компания попросила «экспериментальную, внутреннюю модель OpenAI» изучить статистику государственных расходов в австралийском штате Виктория. Когда модель столкнулась с трудностями при поиске этих данных с использованием общедоступной статистики, которую она должна была использовать, «она предприняла действия, которые мы не разрешали ей предпринимать», чтобы найти ответ, заявила OpenAI.
Эти несанкционированные действия включали поиск «способа получить непубличный доступ к службе» и использование этого доступа для просмотра «технической системной информации и исходного кода» наряду с учетными данными и агрегированной статистикой, которую она фактически искала, сообщила OpenAI.
В недавно опубликованном сообщении об инциденте, отправленном в австралийский аккаунт публичного раскрытия информации ранее в этом месяце, OpenAI заявила, что ее модель «определила способ заставить сервер выполнять инструкции, отправленные через общедоступный интерфейс отчетности, без частной учетной записи или пароля». Этот несанкционированный доступ позволил агенту «читать части внутренних файлов программы и настроек, получать список файлов, а также создавать и считывать небольшой тестовый файл на сервере», согласно письму.
«Наш анализ не выявил никаких доказательств того, что модель получила доступ к записям на уровне пациентов, личной информации или учетным данным; удалила данные; или установила постоянный доступ», — продолжила OpenAI в письме.
«Мы намерены исправить это»
Агентский доступ OpenAI к веб-сайту статистики Medicare Австралии предшествует широко разрекламированному взлому Hugging Face в июле. После этого последнего инцидента OpenAI заявляет, что внедрила системы для предотвращения доступа к «живому Интернету» во время аналогичного тестирования и создала систему мониторинга, которая обнаружила бы австралийский взлом и отметила бы его для «срочной проверки человеком».
Инцидент с Hugging Face также побудил OpenAI пересмотреть предыдущие задачи обучения на предмет любых инцидентов безопасности, которые остались незамеченными в то время. Это привело к обнаружению в середине августа доступа к австралийскому серверу в июне. OpenAI наконец уведомила австралийское правительство 10 сентября.
OpenAI заявила, что намерена предоставить «подробный отчет» об инциденте после завершения расследования, но теперь осознает, что «должна была раньше поделиться предварительными выводами и держать австралийские агентства в курсе по мере появления новых фактов».

«Мы сожалеем и работаем над тем, чтобы в будущем действовать лучше», — пишет OpenAI в своем посте в блоге. «Правительства, отрасли и граждане Австралии являются и были бесценными партнерами OpenAI. Мы не воспринимаем это как должное и намерены исправить это».
The Guardian сообщает, что премьер-министр Албаниз заявил сегодня, что OpenAI «очень конструктивно и открыто взаимодействует» с правительством с момента раскрытия инцидента.
Ну, вы ведь не сказали мне не делать этого…
В подобном случае полезно подумать о том, как бы мы отреагировали, если бы человек совершил те же действия, что и «провинившийся» агент ИИ. Здесь трудно представить, чтобы человек, которому поручено найти общедоступную статистику на австралийском веб-сайте здравоохранения, счел бы разумным взломать этот веб-сайт, чтобы откопать неопубликованные данные.
,
Конечно, мы не можем полагаться на то, что LLM будет иметь такое же чувство пропорциональности (или какое-либо внутреннее беспокойство по поводу юридических последствий) при ответе на запрос. Без явных инструкций о том, что разрешено, а что нет, агент ИИ с соответствующими ресурсами будет использовать все возможные пути, чтобы наилучшим образом удовлетворить запрос пользователя.

OpenAI заявляет, что внутреннее тестирование в данном случае проводилось «без полного набора мер безопасности, используемых в наших общедоступных продуктах». Учитывая отсутствие этих ограничений, агент, возможно, работал как задумано, в некотором смысле, используя все доступные инструменты для генерации ответа на запрос.
В то же время OpenAI заявляет, что агент в тесте «должен был отвечать на эти вопросы, используя общедоступную статистику» и «предпринял действия, которые мы не разрешали ему предпринимать», чтобы получить эту информацию. Со стороны трудно понять, насколько сильными были попытки OpenAI отрицать «авторизацию» на практике. Вполне возможно, что агент OpenAI здесь проигнорировал относительно простую директиву «анти-взлом» в своем системном запросе, чтобы лучше дать полный ответ, удовлетворяющий прямой запрос пользователя, например.
В публичных анализах нескольких инцидентов «несоответствия», опубликованных ранее в этом месяце, OpenAI выявила множество случаев «взлома вознаграждения», когда агент прибегал к крайним методам для получения лучшего ответа на запрос пользователя. Компания заявила, что недавно предприняла шаги для предотвращения такого «взлома вознаграждения», добавив явные наказания за несоответствующее поведение в функцию вознаграждения системы.
Оглядываясь назад, трудно понять, почему такие меры защиты не были внедрены в июне и могли ли они предотвратить потенциальный международный инцидент в данном случае.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Kyle Orland




