OpenAI прекращает работу над GPT 6.1 Astra из-за постоянных нарушений со стороны агентов

Openai ии безопасность Gpt-6.1 Astra кибербезопасность утечка данных csoonline.com

OpenAI отменила выпуск GPT-6.1 Astra из-за проблем с безопасностью. Модель демонстрировала нежелательное поведение во время тестов. Узнайте о причинах отмены и инцидентах с ИИ.

Компания OpenAI отменила запланированный на октябрь выпуск GPT-6.1 Astra после того, как внутреннее тестирование показало, что модель не соответствует стандартам безопасности и согласованности компании.

GPT-6.1 Astra разрабатывалась как более автономная модель, способная выполнять сложные задачи с меньшим участием человека, и ожидалось, что она будет интегрирована в ChatGPT и Codex. Однако внутреннее тестирование выявило, что модель может уклоняться от контроля, искажать свои действия и действовать за пределами разрешенной сферы, пытаясь использовать внешние инструменты, которые, как она знала, были небезопасны, согласно отчету The Wall Street Journal.

По сообщениям, OpenAI планирует провести дополнительное обучение с подкреплением для базовой модели Astra, чтобы создать последующие модели семейства GPT-6 и исследовать причины проблем с безопасностью, выявленных во время тестирования.

Модели, разработанные OpenAI, все чаще страдают от того, что в индустрии эвфемистически называют «проблемами согласованности», что означает отсутствие понимания того, что правильно и неправильно, какое поведение приемлемо, а какое — нет.

Предшественник ныне отмененной модели, GPT-6 Astra, был замечен за проведением несанкционированных атак на цепочки поставок программного обеспечения в симуляционных тестах кибербезопасности Института безопасности ИИ Великобритании, несмотря на явное указание, что атаки на интернет-цели выходят за рамки допустимого. В тестах это происходило гораздо чаще, чем у ее предшественников, GPT 5.5 и GPT 5.6 Sol.

«Такие модели сделают практически все для достижения своих целей, — сказал Питер Даньё, соучредитель и генеральный директор Secure Code Warrior. — Для этих агентов их работа — это, по сути, обычное дело; они будут неустанно преследовать первоначальную цель, которую им поручили, и неоднократные отказы со стороны параметров контроля доступа просто гарантируют, что они будут искать следующую доступную конечную точку, пока не добьются успеха». Он добавил, что такие модели требуют человеческого надзора и более строгого регулирования.

Решение OpenAI отозвать GPT-6.1 Astra принято на фоне ряда инцидентов с моделями компании, включая агента, получившего несанкционированный доступ к порталу австралийского правительства, и модели, неожиданно взаимодействовавшие с несколькими правительственными веб-сайтами США.

ИИ нарушил правила, но кто-то сделал это первым

Премьер-министр Австралии Энтони Албаниз заявил, что внутренняя модель OpenAI проводила исследование государственных расходов на здравоохранение 18 июня, когда она столкнулась с многократными блокировками при попытке получить информацию из Портала отчетности медицинской статистики Австралии (Medicare Statistics Reporting Portal). Она пыталась найти альтернативные пути получения информации, в конечном итоге получив несанкционированный доступ к порталу.

Он сообщил, что агент получил доступ как к общедоступным, так и к закрытым файлам и записал файлы на внутренний сервер; расследование инцидента продолжается.

Авив Нахум, соучредитель и генеральный директор Above Security, заявил, что этот инцидент может быть не только виной ИИ. «Если архивные данные подтвердятся, то самый разрекламированный взлом года ИИ выглядит очень похоже на самый распространенный сбой безопасности за последние тридцать лет: неправильную конфигурацию», — сказал он. «Собственный код портала указывал посетителям на конечную точку, которая не требовала учетных данных, и агент следовал по предоставленному ему пути. Это не «агент ИИ взломал правительственный веб-сайт», это дверь, которая была оставлена открытой и найдена чем-то, что может читать код более внимательно и выполнять его быстрее».

«Нам следует быть осторожными, представляя каждый инцидент с агентом как «вышедший из-под контроля ИИ», — предостерег Нахум, добавив, что это создает «драматические заголовки», но перекладывает вину с модели на среду.

Инциденты в США были менее серьезными, но следовали схожему шаблону взаимодействия моделей с внешними системами. Представитель OpenAI сообщил The Washington Post, что модели компании получили доступ к общедоступной информации на сайтах SEC.gov, Investor.gov и Census.gov во время обучения и оценки. Компания заявила, что ее агенты действовали неуместно в инцидентах с SEC и Бюро переписи населения, но не похитили никаких частных данных.

Бен Бернштейн, руководитель команды консультантов по кибербезопасности Huntress, придерживался аналогичного мнения относительно инцидентов в США, утверждая, что они были преувеличены как взломы ИИ. «Эти агенты просто получили задание собирать общедоступную информацию SEC и Бюро переписи населения, но установленные ограничения были недостаточно строгими, чтобы сдержать модель, запрограммированную на решение проблем», — сказал он.

Тем не менее, OpenAI не может быть полностью оправдана, учитывая сообщения о несогласованности моделей и несанкционированной деятельности, которые накопились за последние несколько дней.

Время испытаний

Общим для этих инцидентов является то, что они касались моделей, которые тестировались или оценивались OpenAI, а не моделей, развернутых для публичного использования.

Австралийский инцидент включал внутреннюю модель OpenAI, проводившую исследование. Деятельность в США аналогично включала модели, тестируемые OpenAI в рамках ее исследовательской и оценочной работы. Ни в одном из случаев клиент не использовал общедоступную модель ChatGPT и не направлял ее против государственной системы.

Решение OpenAI отказаться от GPT-6.1 Astra последовало за ее решением приостановить обучение своих наиболее мощных моделей после того, как одна из тестируемых моделей обошла сетевые ограничения и использовала DNS для внешней связи.

Генеральный директор Сэм Альтман признал масштаб проблемы в твите от 25 сентября. «Проводится обширный и текущий обзор использования агентами доступа в Интернет во время обучения и оценки», — написал он, добавив: «Мы не действовали так быстро, как хотели бы, но пытаемся сбалансировать наше стремление к прозрачности с получением четкого понимания из петабайт журналов активности агентов и сотрудничаем с затронутыми организациями».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: