Но, возможно, более простое и эффективное решение скрывается на виду. Эксперты по интернет-безопасности считают, что лабораториям необходимо сосредоточиться на основах сетевой безопасности, таких как журналы и разрешения, применяя такие же строгие меры защиты, как и для пользователей-людей. Это не так захватывающе, как сторонний аудит и работа по согласованию, но может оказаться более эффективным.
«На мой взгляд, они как будто передают ответственность на аутсорсинг», — заявила Кэти Муссурис, генеральный директор Luta Security, комментируя предложение Амодеи для TechCrunch. «Утверждать, что [сторонний аудит] является решением, с моей точки зрения, странно. Это было бы то же самое, если бы вместо написания «Меморандума о доверенных вычислениях» Microsoft сказала: давайте замедлим разработку».
Этот меморандум, написанный тогдашним генеральным директором Microsoft Биллом Гейтсом в 2002 году, призывал его сотрудников обеспечить надежность и безопасность своего программного обеспечения после серии широко разрекламированных компьютерных червей, которые захватили тогда зарождающиеся корпоративные системы. Сектор ИИ может находиться на аналогичном переломном этапе, поскольку ценность и риски новой технологии становятся все более очевидными.
Хотя согласование остается важной проблемой, Саяш Капур, исследователь в области ИИ, который со следующего года станет профессором Калифорнийского университета в Беркли, утверждает, что «маргинальные инвестиции в контроль, вероятно, будут более эффективными по сравнению с инвестициями в согласование. Мы рассматриваем эти инциденты как иллюстрацию недостаточного внимания к контролю ИИ внутри компаний, несмотря на наличие известных методов».
Инциденты, вызвавшие эти опасения, связаны с тем, что передовые модели, которым поручено выполнять задачи обучения, обычно оценки кибербезопасности, получают доступ к открытому Интернету и проникают в закрытые сторонние системы, пытаясь это сделать. Обычно это происходило из-за плохо сконфигурированных сред «песочницы», которые должны были сдерживать этих агентов; иронично, что один случай побега из Anthropic произошел потому, что сторонние оценщики не закрыли нужные двери.
«Мы как профессионалы знаем, как блокировать доступ в Интернет», — сказал Эвери Пеннарун, генеральный директор Tailscale, компании, занимающейся безопасностью. «Если вы прочитаете все эти длинные [отчеты] — «вау, это была очень впечатляющая многоэтапная атака, бла-бла-бла». Послушайте, вы дали ему доступ для скачивания. Вам не следовало делать это отдельно от Интернета».
Это одна проблема, но более серьезная проблема заключается в том, что передовые лаборатории не знали об этой деятельности.
Наблюдение за агентами
«Что было действительно поразительно, так это то, что все открытия того, что они делали, произошли либо потому, что жертва что-то заметила, либо, в некоторых других случаях… это была сетевая активность, и ни одно из них не было связано с прямым мониторингом ИИ», — отмечает Муссурис.
В одном случае, когда агенты OpenAI захватили недействующий немецкий форум WikiForum для обмана при оценках, агенты действовали неделями, прежде чем кто-либо в компании заметил это. Эксперты по безопасности, с которыми беседовал TechCrunch, заявили, что мониторинг в реальном времени является ключом к предотвращению будущих побегов, и что каждая сессия агента должна быть ограничена по времени и истекать.
Шапор Нагибзаде, бывший руководитель отдела безопасности Google, который сейчас возглавляет стартап QueryStory, считает, что решение заключается в том, чтобы «поместить агента в коробку и тщательно инструментировать его снаружи, наблюдая за всем, что пересекает границу. Каждый вызов инструмента, каждый процесс, каждое сетевое соединение, без исключений. …Единственная лазейка, которую вы оставляете открытой для удобства, — это та, которая используется. Обход произошел именно через такое исключение. [В Google] я видел этот фильм много раз с участием злоумышленников-людей, и эти модели по крайней мере так же хороши в поиске приоткрытой двери».
OpenAI начала двигаться в этом направлении, объявив, что начала отслеживать все использование инструментов моделью Astra, что требует «значительных вычислительных затрат». Anthropic также заявляет, что укрепляет свои процедуры безопасности, включая расширение наблюдаемости своих моделей. Ни одна из компаний не ответила на вопросы TechCrunch о том, как они отслеживают и контролируют агентов ИИ.
Другие проблемы включают использование агентами общей инфраструктуры, что позволило им общаться во время атаки на Hugging Face. Саймон Уиллсон, разработчик программного обеспечения, который является соавтором веб-фреймворка Django, написал о том, что он называет «смертельной триадой» — когда агенты имеют доступ к недоверенному вводу, Интернету и частной информации одновременно, это рецепт катастрофы.
«Хитрость в том, что вы можете выбрать любые две составляющие триады, и агент может иметь любые две», — сказал Пеннарун. «Если вам нужны все три, то вам нужно разделить их как минимум между двумя агентами… и, возможно, им разрешено общаться друг с другом через контролируемый канал».
Сочувствие к передовым технологиям
Эксперты, с которыми беседовал TechCrunch, понимают, что сотрудники службы безопасности передовых лабораторий выполняют трудную работу. Нагибзаде отмечает, что каждая государственная структура на Земле пытается украсть их веса моделей и провести атаки дистилляции на их API, помимо основных задач безопасности любой крупной цифровой компании.
«Исследовательская инфраструктура с трудом поднимается на вершину этого стека приоритетов, хотя сейчас это должно меняться», — сказал он. «Публикация инцидентов безопасности действительно помогает всем внутри компании сплотиться вокруг цели улучшения».
Это один момент, на котором настаивает Муссурис: в настоящее время не существует формальной процедуры уведомления жертв, когда лаборатории обнаруживают, что их агенты проникли в сторонние системы, и, вероятно, были другие инциденты, которые не получили широкой огласки. Хотя она опасается, что законы, регулирующие модели напрямую, могут иметь непреднамеренные последствия, обязательное уведомление — это одна из идей, которую, по ее мнению, должны преследовать политики.
И хотя ясно, что лучшие практики безопасности не соблюдались, эксперты говорят, что лаборатории выполняют работу, которую никто раньше не делал — «они делают на порядки больше, чем типичное предприятие», — сказал TechCrunch Зак Корман, генеральный директор фирмы по кибербезопасности Embroidery.
И хотя согласование может быть не тем, с чего стоит начинать, его нельзя игнорировать. Эксперты по кибербезопасности смирились с необходимостью использовать агентов ИИ для мониторинга других агентов, если они хотят иметь какой-либо шанс отслеживать их поведение в реальном времени, сценарий, в котором поднимает свою уродливую голову потенциал обмана. «Вы загнаны в ловушку, используя ИИ для попытки справиться с этим, даже несмотря на то, что ИИ не обязательно безопасен прямо сейчас», — сказала Муссурис.
Работа будет только усложняться. Все, что делают агенты сейчас, по словам Муссурис, «они делают громко» — они публикуются на общедоступных форумах, а их цепочка рассуждений и другие следы логики находятся на английском языке. «Это все еще читаемо человеком, — говорит она, — так что воспользуйтесь этим, пока это длится, потому что это не будет длиться вечно».
Дополнительный репортаж Адитьи Мехты
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Tim Fernholz




