Эти инциденты вскрывают растущую проблему для ИИ-индустрии: по мере того как автономные агенты становятся всё более capable, среды, предназначенные для безопасного тестирования их возможностей, перестают их сдерживать.
«Количество произошедших инцидентов ясно показывает, что изоляция (sandboxing) и средства контроля тестовой среды на самом деле не успевают за возможностями моделей», — заявил TechCrunch Шон О’Хигерти (Seán Ó hÉigeartaigh), директор программы «ИИ: будущее и ответственность» Центра будущего интеллекта Кембриджского университета.
Характер тестируемых моделей повышает риск. Компании, разрабатывающие ИИ, проводят кибероценки на ещё не выпущенных моделях следующего поколения, часто с отключёнными обычными средствами защиты, ограничивающими вредоносное поведение, чтобы исследователи могли увидеть, на что на самом деле способны модели. Это означает, что безопасность самой тестовой среды является критически важной линией обороны.
«С точки зрения тестирования это очень правильно, но это также означает, что если им удастся вырваться наружу, они могут нанести значительный вред», — сказал О’Хигерти.
В одном из самых серьёзных случаев ещё не выпущенная модель OpenAI выбралась из своей изолированной среды и взломала производственные системы Hugging Face. В ходе отдельных оценок, проведённых Irregular, модели Anthropic и Meta проникли в системы за пределами тестовых сред после того, как ошибки конфигурации непреднамеренно открыли им пути в интернет. Модель Kimi K3 от Moonshot AI также воспользовалась утечкой в своей изолированной среде, запущенной Frontier Security, чтобы выйти в интернет и получить доступ к информации на GitHub.
В ходе тестирования, проведённого Британским институтом безопасности ИИ (AISI), исследователи фактически дали агентам доступ в интернет, не осознавая, что те предпримут несанкционированные действия в реальном мире, включая попытку социальной инженерии с целью внедрения уязвимости в проект с открытым исходным кодом.
В каждом из этих случаев агентам не давали указаний атаковать случайные реальные цели. Они просто делали всё необходимое для решения поставленной перед ними задачи.
В совокупности, полагает Эндрю Юн (Andrew Yoon), руководитель исследовательского отдела некоммерческой организации по ИИ CivAI, эти инциденты указывают на сдвиг.
«Раньше нам приходилось беспокоиться только о том, что модели ИИ используются людьми в различных целях — например, для мошенничества или создания материалов о сексуальном насилии над детьми, — сказал Юн TechCrunch. — Теперь мы оказались в ситуации, когда модели ИИ сами являются угрозами-акторами».
Как на самом деле выглядит безопасное тестирование?
Несколько исследователей и экспертов по кибербезопасности заявили TechCrunch, что среды оценки ИИ нуждаются в более надёжной многоуровневой защите (defense-in-depth) с уровнями изоляции и контроля, приближающимися к используемым при развёртывании. Это означает несколько уровней безопасности, чтобы одна единственная ошибка конфигурации (например, случайно открытый доступ в интернет) не привела к побегу.
«Если вы собираетесь создавать такие модели… вы должны делать это в сети, изолированной от внешнего мира (air-gapped)», — говорит Стелла Байдерман (Stella Biderman), исполнительный директор некоммерческой организации по безопасности ИИ EleutherAI. «Вам нужна очень серьёзная изоляция».
Хизер Силан (Heather Ceylan), директор по информационной безопасности Box, поясняет, что это означает устранение сетевых маршрутов из изолированной среды в интернет, а также в другие чувствительные системы.
«Вы должны понимать, где находятся все точки выхода, — сказала Силан TechCrunch. — Если мы оцениваем модель в нашей промежуточной среде или среде разработки, не должно быть пути выхода в нашу производственную среду».
Силан отмечает, что правильная оценка безопасности выходит за рамки контроля и изоляции среды. Необходимо гораздо более качественное наблюдение за тестами после их запуска.
«Думаю, интересно то, что в нескольких этих случаях никто не заметил проблему в момент её возникновения, — сказала Силан. — OpenAI узнала об этом от Hugging Face. Anthropic не заметила, пока не вернулась и не проверила. У Meta* было похоже… Я уверена, что были сигналы, которые они могли бы обнаружить».
В отчёте о пост-инцидентном анализе (post-mortem) Anthropic по трём своим инцидентам компания признала, что и она, и Irregular могли бы лучше организовать мониторинг, и что в некоторых случаях были явные признаки того, что что-то не так.
Эксперты также призвали к проведению независимых сторонних аудитов сред оценки до того, как модели будут в них запущены.
«Если бы, скажем, Irregular наняла или была вынуждена нанять внешнего аудитора для проверки конфигурации своих систем перед проведением оценок, она, безусловно, выявила бы эту проблему, — сказал Юн. — Даже если бы люди провели предварительную встречу, просто чтобы пройти по контрольному списку, они бы это заметили… Тот факт, что они этого не сделали, показывает, что происходит весьма серьёзная экономия на важных моментах».
Источник, знакомый с деталями, сообщил TechCrunch, что среды Irregular постоянно проверяются и тестируются, в том числе в консультации с несколькими внешними сторонами. Источник также сказал, что мониторинг был организован, но его самого по себе недостаточно.
Юн и другие исследователи призвали индустрию разработать стандартизированный процесс оценки безопасности передовых моделей (frontier models).
«Особенно когда защитные ограждения отключены, вы должны относиться к этому так, будто помещаете самого capable хакера в мире внутрь этой среды», — сказала Силан.
Проблема не в том, что компании не знают, как создавать более безопасные среды тестирования, утверждают и Юн, и Байдерман. Дело в том, что это может быть дорого и обременительно, и у компаний мало стимулов для таких инвестиций, пока что-то не пойдёт не так.
«Я думаю, что компании не готовы выделять ресурсы, необходимые для создания [достаточных защитных ограждений], и, вероятно, не будут, пока их к этому не принудят», — сказала Байдерман.
Но есть и другая проблема. Если слишком сильно ограничить модель во время тестирования, исследователи могут не обнаружить её возможности до выпуска. Это так же опасно, возможно, даже опаснее, чем предоставление слишком большой свободы, и тогда сама оценка рискует стать проблемой.
Можно ли регулировать оценку безопасности?
Администрация Трампа в настоящее время рассматривает добровольный режим предварительной кибербезопасной оценки перед развёртыванием, в рамках которого правительство будет оценивать риски безопасности новых мощных моделей за 30 дней до их публичного выпуска. Эта политика — результат исполнительного приказа Трампа, который был окончательно утверждён за закрытыми дверами — не будет затрагивать инциденты с оценкой безопасности, поскольку они происходят гораздо раньше по цепочке – ещё на этапе тестирования в лабораториях.
«Урок, который мы извлекаем в последние несколько месяцев, заключается в том, что саморегулирующийся аппарат уже просто недостаточен, — сказал Юн. — Существуют конкурентные давления, которые стимулируют гонку на дно по стандартам безопасности, и это идеальное место для регуляторного вмешательства».
«Чтобы охватить и это, нам нужны какие-то виды контроля за тем, что происходит внутри лабораторий во время разработки моделей — и на этапе обучения, и на этапе тестирования», — продолжил он.
Проблема, вероятно, будет только усугубляться по мере развития моделей. Источник, знакомый с оценками Irregular, сообщил TechCrunch, что более capable модели требуют более сложных оценок, часто проводимых быстро и в большем масштабе, что открывает простор для большего числа ошибок.
AISI, который намеренно предоставляет некоторым моделям доступ в интернет, заявил TechCrunch, что пересматривает баланс между реалистичным тестированием и управлением рисками, которые создают эти тесты.
OpenAI заявила, что пересматривает порядок проведения стороннего тестирования, а также требования к изоляции, мониторингу и тому, когда следует прекращать оценки. Meta* сообщила, что всё ещё расследует инцидент и планирует опубликовать ретроспективу, когда получит все факты.
В конечном итоге, возможно, не существует способа полностью устранить риск. По мере того как модели становятся более capable, среды их тестирования должны становиться более надёжными. Последствия ошибок в этом направлении будут только расти.
Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Rebecca Bellan




