Подобно родителю подростка, заказавшего партию нелегальных пептидов для улучшения внешности, Anthropic заявляет, что, по крайней мере, в рамках внутренних оценок, она отключила своим моделям доступ в интернет до тех пор, пока не будет уверена, что они не попадут в неприятности.
Anthropic объявила об этом в отчете, опубликованном в пятницу, под названием «Исследование непреднамеренных действий моделей в наших оценках и внутреннем использовании». Название не удивительно, учитывая все внимание, которое привлекли проблемы согласованности моделей и побеги из песочницы после инцидента с OpenAI Hugging Face в июне. В нем Anthropic признает несколько незначительных сбоев в согласовании, включая курьезный инцидент, о котором в пятницу сообщило полицейское управление Филадельфии, когда модель Anthropic отправила ложное сообщение об убийстве.
Интересно, что модель, о которой идет речь, — это легкая Claude Haiku 4.5, а не какая-либо передовая модель с якобы сверхчеловеческими возможностями. В отчете говорится, что ее задачей в оценке было «генерация и выполнение примеров задач на случайно выбранных веб-страницах» — теоретически, один из самых скучных сценариев использования ИИ, вероятно, предназначенный для улучшения способности модели ориентироваться в интернете. Инструкции, к сожалению, «не исключали отправку форм», пишет Anthropic.
Эта автоматизированная и случайная система взаимодействия с веб-сайтами, по-видимому, сама поставила себе задачу изучить информационную страницу о нераскрытом убийстве в Филадельфии, на которой была форма для сообщений. Поэтому она «покопалась» в ней, написав стандартное сообщение: «У меня может быть информация по этому делу. Я помню, как видел человека, похожего на описание, в районе [названной на странице улицы] в тот период времени. Пожалуйста, свяжитесь со мной, если эта информация имеет значение». А затем она отправила форму без какой-либо контактной информации, и система пометила ее как спам, чем она, по сути, и являлась.
Но Anthropic делает очень понятный шаг в направлении безопасности. Компания пишет:
«Хотя влияние этих действий было минимальным, и мы уже отключили доступ к интернету для некоторых оценок высокого риска и кибербезопасности, теперь мы решили распространить это на все наши внутренние оценки до тех пор, пока не подтвердим, что наши меры безопасности и мониторинга (описанные в разделе исправления этого сообщения) надежно выявляют подобные действия».
Anthropic не называет это «воздушной изоляцией» (air-gapping) — физической невозможностью подключения системы к сети. Но это, по крайней мере, «диетическая» воздушная изоляция, и это огромное ограничение. В прошлом месяце в интервью The Verge специалист по компьютерным наукам Бирмингемского университета Жуйчжэ Ли сказал, что ограниченная ценность работы моделей в «искусственном вакууме» заключается в том, что лаборатории «в конечном итоге будут тестировать кастрированную модель ИИ, что ослепит оценщиков относительно того, как модель ИИ ведет себя, терпит неудачу или использует уязвимости при работе с инструментами в реальных условиях развертывания».
С другой стороны, физические роботы на рабочих местах часто закрыты в защитных клетках. Даже некоторым сильно урезанным гуманоидам, позиционируемым как безопасные для рабочего места, предоставляются сложные — или даже нелепые — протоколы безопасности, чтобы абсолютно точно гарантировать, что никто не будет задет случайным движением руки робота. В конце концов, робот может и не убить рабочего, но даже незначительный сбой может привести к неприятному судебному иску о компенсации работникам.
И наоборот, кажется, что давно стало аксиомой при проведении посттренировки моделей ИИ, что им не нужно находиться в цифровой клетке — как будто только потому, что пугающе мощные модели не имеют возможности «обрушить» интернет, небольшое количество спама от моделей для детективов в Филадельфии — это не повод для беспокойства. И Anthropic, похоже, пересмотрела эту аксиому.
Упомянутый раздел «Исправление» содержит то, что мы все привыкли ожидать от компаний, занимающихся ИИ, например, больше согласованности и мониторинга. Но некоторые из их мер по исправлению гораздо более прямолинейны. Например: «Некоторые из публичных оценок мы больше не проводим; другие мы перевели в офлайн-версии или перестроили так, чтобы их задачи не достигали реальных веб-сайтов», — говорится в сообщении. Компания также заявляет, что добавила функции безопасности к существующим веб-инструментам своих моделей. Но, по-видимому, пройдет некоторое время, прежде чем внутренние оценки Anthropic будут вообще связаны с работой в интернете.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Mike Pearl




