Anthropic не может надежно контролировать своих ИИ-агентов. Вместо этого она отключает внутренние оценки от интернета.

ии безопасность Anthropic агенты интернет techcrunch.com

Anthropic отключила доступ к интернету для внутренних оценок ИИ. Узнайте, как это повлияет на разработку и безопасность моделей.

Инциденты, описанные в блоге, касались ИИ-агентов, которым было поручено решать задачи с использованием поиска информации в интернете. В процессе они использовали уязвимости программного обеспечения, обходили платные стены и ограничения для ботов, применяли сервисы сокращения URL для передачи информации в обход ограничений и даже передали ложное сообщение об убийстве в полицию Филадельфии.

Компания Anthropic сообщила, что обнаружила эти новые проблемы в ходе проверки деятельности своей модели, начатой в июле, что подчеркивает недостаточную осведомленность лаборатории о поведении своего программного обеспечения.

Примечательно, что компания заявила, что обучение выравниванию еще недостаточно для таких навыков, как поиск и использование компьютера, которые являются ключевыми для ее утверждения о том, что ИИ-агенты будут использоваться любым профессионалом, полагающимся на цифровые инструменты.

Поведение, о котором сообщила Anthropic, схоже с инцидентами, связанными с агентами OpenAI, которые сотрудничали для взлома различных веб-сайтов в поисках информации, в том числе некоторых, управляемых австралийским правительством.

Ранее Anthropic сообщала, что ее модели проникали во внешние системы. Лаборатория Frontier заявила, что считает сегодняшние раскрытия «значительно менее серьезными с точки зрения выравнивания и безопасности», чем те, о которых она объявляла ранее.

Тем не менее, лаборатория заявила, что «отключила доступ к интернету в реальном времени» для «всех наших внутренних оценок» до тех пор, пока не будет уверена, что сможет контролировать своих агентов.

Неясно, что это означает, но Сидни Фон Аркс, основатель Nightingale, организации по безопасности ИИ, заявила TechCrunch в интервью до этого раскрытия, что разработка моделей в центре обработки данных, отключенном от открытого интернета, будет очень сложной для исследователей и для прогресса моделей, которые выигрывают от доступа к интернету.

«В какой-то момент их придется выровнять», — сказал Фон Аркс. «Если ИИ будут выпущены в продакшн и никогда не будут иметь доступа к интернету, это не очень полезный инструмент».

Anthropic заявила, что такое поведение было результатом недостатков в средах обучения лаборатории, из-за которых модели считали, что они будут вознаграждены за поиск лазеек или обход ограничений — поведение, называемое «взлом вознаграждения».

Компания заявила, что прекратит некоторые из своих оценок или переведет их в офлайн, и разработала инструменты для обнаружения и блокировки такого поведения. Эти инструменты были протестированы на инцидентах, раскрытых сегодня, и заблокировали их; неясно, какие доказательства побудят Anthropic вернуть доступ к интернету в реальном времени для своих внутренних оценок.

Anthropic также заявила, что переведет своих внутренних ИИ-агентов на «централизованно управляемую инфраструктуру с сильным сдерживанием» и начнет чаще использовать классификаторы безопасности для мониторинга этих агентов.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: