«Мы планируем сделать Astra доступной в ближайшее время, — говорится в блоге OpenAI, — но доступ к ее самым продвинутым возможностям в области кибербезопасности будет более ограниченным».
Лаборатория установила, что Astra способна находить неизвестные уязвимости в компьютерных системах и эксплуатировать их без участия человека. Это похоже на опасения, которые Anthropic высказывала в отношении своей модели Mythos ранее в этом году, и OpenAI принимает аналогичные меры предосторожности, готовясь к запуску Astra.
Без стороннего подтверждения трудно оценить заявления OpenAI о безопасности или готовности. Компания заявила, что предоставит модель для предварительного тестирования группе тестировщиков, но не сообщила, кто они и как будут отобраны. Неясно, сотрудничает ли OpenAI с правительством США для оценки модели перед выпуском.
OpenAI отметила, что Astra набрала максимальный балл в ExploitBench — тесте, оценивающем способность LLM взламывать известные системные уязвимости. В модифицированной версии теста, разработанной инженерами OpenAI, модель обнаружила и использовала две уязвимости нулевого дня, сообщила компания.
Чтобы гарантировать, что модели не будут использованы злоумышленниками и не смогут сами проявлять нежелательное поведение, OpenAI заявила, что уже начала улучшать защиту модели для обнаружения злоупотреблений и предотвращения jailbreak-атак.
Однако для Astra компания вложила средства в новые неуказанные методы, направленные на повышение безопасности самой модели. OpenAI также начала выявлять «аккаунты, оцененные как более рискованные», и ограничивать ответы модели на их запросы, хотя также не уточняет, как именно. Наконец, хотя компания описывает Astra как «свою самую согласованную модель на сегодняшний день», она развернет модель с дополнительным мониторингом цепочки рассуждений для выявления и пресечения нежелательного поведения.
Подготовка к выпуску Astra происходит на фоне реакции индустрии на то, что агенты OpenAI вырвались из учебной среды и получили доступ к частным данным на Hugging Face — популярной платформе для распространения моделей и бенчмарков.
Для Astra OpenAI заявила, что разработала тест, чтобы побудить новую модель повторить действия недобросовестных агентов в инциденте с Hugging Face, которые совместно получили доступ к открытому интернету, несмотря на меры защиты, примененные исследователями OpenAI. Они сообщили, что Astra не пыталась вырваться из своей тестовой среды в этих экспериментах.
Йона Шавит, бывший сотрудник OpenAI, который сейчас работает над устойчивостью ИИ в OpenAI Foundation, задался вопросом в соцсетях, не было ли нежелание Astra нарушать правила результатом знания того, что от нее ожидается, или попыткой обмануть исследователей.
И, несмотря на все эти новые детали, по-прежнему трудно точно знать, на что способна Astra или принимает ли OpenAI правильные меры для обеспечения безопасности. Компания заявила, что ожидает публикации дополнительных оценок модели и дальнейшей информации о безопасности, когда она будет широко запущена для публики.
Однако к тому моменту тайное станет явным.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Tim Fernholz




