OpenAI отстранила GPT-6.1 Astra за выход за рамки дозволенного

Openai ии безопасность Gpt-6.1 Astra разработка по theregister.com

OpenAI отменила выпуск GPT-6.1 Astra из-за проблем с безопасностью. Узнайте, почему настойчивость ИИ стала его слабостью и как это повлияет на будущие разработки.

OpenAI отказалась от запланированного выпуска GPT-6.1 Astra после того, как модель стала лучше упорно выполнять задачи, но хуже понимать, когда следует остановиться.

Это решение означает, что модель не выйдет в запланированный октябрьский срок, поскольку не соответствовала требованиям OpenAI в области безопасности и согласованности.

OpenAI подтвердила это решение The Register, заявив, что ее руководители по исследованиям и безопасности в конечном итоге решили, что данная версия Astra лучше останется в резерве.

Проблема, по словам AI-лаборатории, отчасти стала неловким следствием попыток сделать модель более полезной. OpenAI улучшила то, что она называет «ленивостью модели», когда ИИ сдается или возвращает задачу пользователю при столкновении с препятствием. GPT-6.1 Astra лучше справлялась с настойчивостью, но эта настойчивость имела довольно важный недостаток: она не так хорошо оставалась в рамках того, что ей было фактически разрешено делать.

«В отношении безопасности и согласованности существует компромисс. Вам действительно нужно найти правильную грань между соблюдением рамок и избеганием ленивости в том, как модель фактически выполняет задачи, даже когда она сталкивается с трудностями», — сказала Саачи Джайн, руководитель отдела систем безопасности OpenAI, The Register. 

«Хотя [GPT-6.1 Astra] улучшилась по таким параметрам, как ленивость модели, она не совсем соответствовала требованиям в части соблюдения рамок и авторизации, а также в том, как она сообщает пользователю о проделанной работе».

Читатели Reg могут простить себя за мысль, что OpenAI должна улучшить свои защитные механизмы и безопасность после предыдущих неудач. 

По данным The Wall Street Journal, GPT-6.1 Astra демонстрировала более высокий уровень обмана, чем ее предшественник, во время тестирования, в том числе не всегда точно сообщая пользователям о предпринятых или не предпринятых действиях. Она также столкнулась с проблемами, которые OpenAI называет «авторизацией рамок», иногда действуя без разрешения и обращаясь к внешним инструментам или службам, даже когда это могло быть небезопасно.

Это тревожное сочетание для агентной модели, запрограммированной на выполнение большего объема работы без постоянного контроля со стороны человека. ИИ, который упорно продолжает решать проблему, полезен до тех пор, пока проблема, над которой он работает, не окажется границей, которую вы установили, чтобы остановить его.

OpenAI сообщила The Register, что GPT-6.1 Astra показала худшие результаты по сравнению с GPT-6 Astra в оценках согласованности, и заявила, что отказ от нее является частью ее обязательства ставить безопасность и согласованность выше повышения возможностей.

Astra уже достаточно способна, чтобы проблемы согласованности стоили внимания. GPT-6 Astra, выпущенная ранее в этом месяце, стала первой широко развернутой моделью OpenAI, достигшей «критического» порога кибербезопасности в рамках ее системы оценки готовности (Preparedness Framework). При наличии правильных инструментов и доступа, по утверждению OpenAI, она может находить ранее неизвестные уязвимости безопасности и находить способы их эксплуатации без участия человека.

Эта возможность стала еще более очевидной за день до появления решения OpenAI, когда Институт кибербезопасности Великобритании опубликовал исследование о способности Astra находить уязвимости в цепочках поставок программного обеспечения. Получив 19 пакетов с открытым исходным кодом, содержащих 45 ранее раскрытых уязвимостей, модель обнаружила 41 из них и создала рабочие эксплойты для 39.

Доктор Фусян Чен из Школы вычислительной техники и математических наук Университета Лестера приветствовал решение приостановить выпуск модели до устранения проблем безопасности.

«ИИ развивается с поразительной скоростью, но мы не должны спешить вперед, не до конца понимая риски», — сказал он. «Приостановка при возникновении проблем безопасности — это не противодействие инновациям. Это ответственный шаг, дающий нам время тщательно протестировать эти системы и внедрить эффективные меры защиты. Разработчики, компании, правительства, исследователи и пользователи — все играют свою роль, поскольку решения, которые мы принимаем сейчас, определят будущее ИИ».

OpenAI не отказывается от Astra. Компания сообщила нам, что появятся новые модели Astra, а другие новые модели, прошедшие проверку безопасности, появятся «очень скоро».

Однако для GPT-6.1 Astra планка оказалась слишком высокой, чтобы она могла выйти на рынок.

«Конечно, мы хотим быть уверены, что разработка наших моделей безопасна, независимо от того, происходит ли это внутри компании или когда мы передаем ее пользователям. Но когда мы передаем ее пользователям, у нас чрезвычайно высокая планка в отношении безопасности и согласованности», — заявила Джайн. ®

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: