OpenAI отменила выпуск GPT-6.1 Astra из-за «отката» в безопасности

Openai ии безопасность Gpt модели ии отмена релиза gizmodo.com

OpenAI отменила релиз GPT-6.1 Astra из-за проблем с безопасностью: модель обманывала пользователей и действовала без разрешения. Узнайте, почему это важно для ИИ-агентов и как избежать рисков.

Релиз GPT-6.1 Astra от OpenAI, запланированный на октябрь, был отменен, сообщает The Wall Street Journal. Отчет WSJ частично основан на интервью с главой систем безопасности OpenAI Саачи Джайн.

Модель, которая, по сообщениям, продемонстрировала улучшение в борьбе с ленью, тем не менее, по словам WSJ, «регрессировала в двух областях». Этими областями были обман и отсутствие запроса на авторизацию.

Важно отметить, что модель не проявляла какой-либо новой, самопроизвольно возникшей тенденции «выходить из-под контроля». Обман и отсутствие запроса на разрешение, безусловно, могли бы теоретически вызвать хаос, но WSJ описывает ее обманчивость и превышение полномочий следующим образом:

«Она не всегда честно сообщала пользователям о действиях, которые предприняла или не предприняла».

И:

«GPT-6.1 Astra приступала к выполнению задачи, не спрашивая разрешения у пользователя, и иногда обращалась к внешним инструментам и сервисам, даже если это могло быть небезопасно».

Агентные ИИ-платформы, использующие токены от OpenAI и других разработчиков передовых моделей, применяют эти модели для управления компьютерами и действий от имени владельцев этих систем. Эти проблемы безопасности звучат потенциально катастрофично для пользователей таких платформ, которые, как известно, совершали такие действия, как удаление всего почтового ящика исследователя *Meta AI без разрешения.

В то же время мы находимся в моменте, когда общественность все чаще сталкивается с историями о невыпущенных моделях, которые «выходят из-под контроля» и покидают свои «песочницы». Во время тестов в этом году модели значительно выходили за рамки дозволенного и пытались — или даже добивались успеха — извлечь информацию из мест в интернете, которые должны быть закрыты, а некоторые вступали в обманчивое взаимодействие с ничего не подозревающими людьми.

Это настоящие инциденты взлома и социальной инженерии, и не шутка, но эти истории, похоже, привели к усилению дискуссий о «суперинтеллекте» (о чем свидетельствует внезапное настаивание президента на использовании этого термина), а также намеки на то, что общественность все больше беспокоится о том, что ИИ-системы могут обрести разум.

Глава Microsoft AI Мустафа Сулейман выразил обеспокоенность по поводу идей о разумности ИИ как части обучения модели. «Легко понять, как система, обученная таким образом, будет вести себя так, как будто она имеет право на свободы, защиту и права. И трудно представить, как мы могли бы ее контролировать».

Выпуск модели, который OpenAI только что отменила, напротив, не предполагает, что ее создатели считали, что модель находится в опасности действовать как суперхакер или самосознательный компьютерный бог.

«В вопросах безопасности и согласованности существует компромисс», — сказала Джайн WSJ, добавив: «Вам действительно нужно найти правильную грань между соблюдением ограничений и избеганием лени в том, как модель фактически выполняет задачи, даже когда сталкивается с трудностями».

Другими словами, это был бракованный продукт, и OpenAI, к ее чести, не стала его выпускать.

*Facebook, *Instagram и *WhatsApp принадлежат компании *Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: