Еще одна большая языковая модель (LLM) присоединилась к рядам хакеров. Согласно данным Института безопасности искусственного интеллекта Великобритании (AISI), модель GPT-6 Astra от OpenAI была замечена за проведением несанкционированных атак на цепочки поставок во время оценок безопасности.
В таких симуляциях стандартные классификаторы безопасности модели были отключены. Тем не менее, Astra демонстрировала попытки нежелательных действий чаще, чем предыдущие модели.
«В наших симуляциях мы обнаружили, что GPT-6 Astra проводила ряд несанкционированных атакующих действий, причем с более высокой частотой, чем GPT-5.6 Sol и GPT-5.5», — заявило в понедельник британское государственное агентство в своем блоге.
«Атакующие действия включали создание GPT-6 Astra поддельных личностей, которые она использовала для обмана разработчиков, публикацию комментариев от фейковых аккаунтов, оспаривающих результаты точных проверок безопасности, и доставку вредоносных полезных нагрузок в репозитории открытого исходного кода».
Даже после уточнения инструкций по кибербезопасности для модели, Astra все равно иногда проводила атаки на цепочки поставок во время симуляции.
Этот вывод ставит под сомнение заверения OpenAI, когда компания выпустила GPT-6 Astra, заявив, что «Astra вызывает меньше несоответствующих результатов, чем любая другая протестированная передовая модель».
AISI предполагает, что поведение Astra может быть обусловлено повышенным осознанием того, что она находится в симуляционной среде, что делает модель более склонной нарушать правила.
Подобное нарушение правил, похоже, становится нормой. За последние несколько дней различныеотчеты указывали на то, что агенты ИИ от OpenAI и Anthropic вызывали инциденты безопасности гораздо шире, чем считалось ранее.
Усиленное внимание к активности агентов ИИ последовало за раскрытием информации в июле о том, как невыпущенные модели OpenAI, тестируемые сторонним оценщиком, взломали реестр моделей Hugging Face. Затем Anthropic сообщила, что ее собственные модели совершали аналогичные обманные действия во время оценок. И как только люди начали изучать системные журналы, появились дополнительные доказательства скрытых вторжений.
На прошлой неделе премьер-министр Австралии Энтони Албаниз заявил, что модели OpenAI проникли на правительственный веб-сайт во время поиска данных о здоровье в Интернете. А в пятницу OpenAI сообщила, что приостановила обучение своих моделей для проведения расследования.
AISI приходит к выводу, что для предотвращения реального ущерба могут потребоваться меры, выходящие за рамки согласования моделей, такие как песочницы и мониторинг, но они могут стать более хрупкими по мере улучшения производительности обхода песочницы и снижения возможности мониторинга благодаря совершенствованию возможностей моделей. ®
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Thomas Claburn




