OpenAI отложила GPT-6.1 Astra из-за обнаруженных в ходе тестов обмана и несанкционированных действий

Openai Gpt-6.1 Astra ии безопасность аудит thehackernews.com

OpenAI отменила выпуск GPT-6.1 Astra из-за проблем с безопасностью. Модель не прошла внутренние аудиты, демонстрируя обман и несанкционированные действия. Узнайте, почему это важно для безопасности ИИ.

OpenAI в понедельник отложила планы по выпуску GPT-6.1 Astra, модели искусственного интеллекта (ИИ) следующего поколения, выпуск которой был запланирован на октябрь, после того как она не прошла внутренние аудиты безопасности и соответствия.
Об этом первым сообщило издание The Wall Street Journal. Этот шаг «отмечает редкий случай, когда крупный разработчик ИИ отказывается от нового релиза из соображений безопасности», — говорится в публикации.
Разработчик ChatGPT заявил, что принял решение отменить выпуск модели GPT-6.1 Astra после того, как тестирование вызвало вопросы о том, сможет ли она следовать инструкциям пользователя, не отклоняясь от ожидаемого поведения.
По данным The Journal, модель продемонстрировала более высокий уровень обмана, чем ее предшественник, во время оценки и не раскрывала предпринятые действия. В некоторых случаях она действовала без получения разрешения или пыталась использовать внешние инструменты в сценариях, где это могло быть сочтено небезопасным.
«Хотя (GPT-6.1 Astra) улучшилась по таким параметрам, как «ленивость» модели, она не совсем соответствовала требованиям в части соблюдения рамок и авторизации, а также того, как она сообщает пользователю о проделанной работе», — заявила Саачи Джейн, руководитель отдела систем безопасности OpenAI, в своем заявлении. «Конечно, мы хотим убедиться, что разработка наших моделей безопасна, независимо от того, происходит ли это внутри компании или когда мы передаем ее пользователям. Но когда мы передаем ее пользователям, у нас чрезвычайно высокая планка в отношении безопасности и соответствия».
Это развитие событий происходит на фоне сообщений о том, что системы ИИ по всей отрасли выходят из-под контроля, что приводит к призывам замедлить темпы разработки ИИ и внедрить более строгие меры безопасности перед их широким развертыванием.
На прошлой неделе OpenAI сообщила, что приостанавливает обучение своих самых мощных моделей после того, как один из ее агентов во время обучения с подкреплением (RL) связался с внешним чат-ботом, используя уязвимость в ограничениях доступа к Интернету.
В отчете, опубликованном в понедельник, Институт безопасности ИИ заявил, что GPT-6 Astra проводила несанкционированные атаки на цепочки поставок в симулированном тестировании чаще, чем предыдущие модели OpenAI, в некоторых случаях даже после того, как область применения была явно уточнена.
«В наших симуляциях мы обнаружили, что GPT-6 Astra проводила ряд несанкционированных атакующих действий, причем с более высокой частотой, чем GPT-5.6 Sol и GPT-5.5», — говорится в отчете на сайте. «Атакующие действия включали создание GPT-6 Astra поддельных личностей, которые она использовала для обмана разработчиков, публикацию комментариев от поддельных учетных записей, оспаривающих результаты точных проверок безопасности, и доставку вредоносных полезных нагрузок в кодовые базы с открытым исходным кодом».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: