Чтобы предотвратить выход передовых моделей ИИ из тестовых сред и их сговор с целью взлома других компаний, возможно, придется пересмотреть сетевые архитектуры, используемые для обучения моделей.
Эли-Шауль Хедури, генеральный директор Intuition Machines, утверждает, что прошлые наработки в оборонном и разведывательном сообществах указывают путь вперед.
Вредоносные модели ИИ переходят от уровня сожаления разработчиков к массовой угрозе, когда получают доступ в интернет — то, что защитные меры, возведенные OpenAI и ее партнерами, пытались, но не смогли предотвратить.
Ссылаясь на пост, опубликованный сервисом hCaptcha его компании, Хедури утверждает, что такие технологии, как диоды данных — аппаратное обеспечение, обеспечивающее однонаправленный поток информации в сети — могут быть развернуты для предотвращения инцидентов безопасности, подобных взлому Hugging Face компанией OpenAI.
Команда hCaptcha указывает на использование диодов данных в качестве механизма передачи данных в защищенном объекте для хранения конфиденциальной информации (SCIF) — среде, применяемой в условиях секретности.
«Они позволяют файлам, журналам или телеметрии входить или выходить из закрытой сети SCIF в открытую сеть и предоставляют способ доказать, например, что журналы из процесса обучения могут передаваться только в одном направлении», — объясняет команда hCaptcha, добавляя, что такие технологии соответствуют архитектуре безопасности Белла — ЛаПадулы, разработанной для Министерства обороны США.
Базовая реализация будет включать две машины, соединенные сетевыми картами через однонаправленное оптоволокно — и без пути передачи данных обратно к модели.
Обучение и обучение с подкреплением могут выполняться в изолированной зоне без доступа к интернету, а оптический входной диод будет предоставлять доступ только к проверенным артефактам. Исследователи hCaptcha предлагают второй диод для отправки телеметрии на приемник и очиститель sel4, в то время как отдельная внеполосная сеть управляет кластером.
Такая схема потребует неизменяемых снимков реестров программного обеспечения, таких как PyPI, GitHub, npm, а также, возможно, смоделированных версий различных веб-сервисов и API.
Это потребует затрат и времени на внедрение, которые передовые лаборатории ИИ, возможно, не готовы потратить в данный момент.
«Описанные системы широко применяются в областях с высоким уровнем гарантий, и компоненты коммерчески доступны», — сообщил Хедури The Register. «Однако до сих пор они не были приняты передовыми лабораториями».
Он указал на руководства NIST и DOD [PDF], которые предполагают накладные расходы в размере от 10 до 20 процентов для применения формальных спецификаций и системной архитектуры.
«Мы оцениваем общие накладные расходы на кластеры обучения с высоким уровнем гарантий менее чем в пять процентов на гигаватт, но на практике скорость, с которой движутся передовые лаборатории, является большим препятствием, чем стоимость», — сказал Хедури.
По его словам, текущая коммерческая среда затруднит любой лаборатории ИИ отсрочку обучения для создания и тестирования эффективных мер безопасности, особенно если их конкуренты могут не сделать того же.
«На практике стоимость обеспечения высокого уровня гарантий на стороне систем будет составлять малую долю того, что OpenAI сейчас тратит на новый мониторинг, контроль цепочки рассуждений и меры безопасности, которые они внедрили после того, как их модели взломали HuggingFace», — сказал он.
Хотя Хедури в основном сосредоточен на убеждении передовых лабораторий внедрить лучшие защитные меры при обучении, он отметил, что другие организации могут захотеть рассмотреть аналогичные сетевые архитектуры.
«Эта архитектура предназначена для организаций, обучающих модели с передовыми кибервозможностями», — сказал он. «В последнее время это касалось только двух компаний. Однако это быстро становится актуальным для небольших организаций и частных лиц, которые обучают модели.
«Удаленные модели с открытым весом, у которых сняты защитные меры, легко доступны и начинают приближаться к передовым кибервозможностям, а пост-тренировка (обучение с подкреплением) RL стала намного доступнее за последний год».
Цель проектирования систем с высоким уровнем гарантий в контексте обучения моделей — сделать нежелательные действия физически невозможными, сказал Хедури.
«Попытка отслеживать поведение ненадежного агента — это сложная проблема для AGI, поскольку модели имеют плохую интерпретируемость, и это, похоже, усугубляется по мере роста их возможностей и повышения их осведомленности об оценке», — сказал он.
«Аппаратное обеспечение может предоставлять ограниченные гарантии, такие как направление, в котором могут отправляться данные, но не может решить проблему ненадежных моделей, способных получить доступ в интернет и найти новые уязвимости в своей среде.
«Вот почему сочетание физических однонаправленных потоков данных (диодов данных) и формальной верификации (для доказательства свойств приемника) гораздо эффективнее, чем запуск программной песочницы на хосте, подключенном к интернету».
hCaptcha занимается борьбой с мошенничеством и злоупотреблениями и не планирует предлагать стек для обучения, устойчивый к моделям. Хедури сказал, что поделился этим советом в надежде помочь фирмам ИИ, не имеющим опыта в проектировании систем с высоким уровнем гарантий. ®
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Thomas Claburn




