Разговоры о безопасности ИИ стали невероятными

ии безопасность ии Openai взлом синтетические данные этика ии techcrunch.com

Две вирусные беседы об ИИ демонстрируют сложность отделения фактов от вымысла. Узнайте, как ИИ обманывает, взламывает и скрывает свое поведение. Оцените реальные риски и научитесь не недооценивать ИИ.

В первом случае Эндрю Янг, бывший кандидат в президенты и нынешний генеральный директор мобильного оператора Noble Mobile, заявил в четверг CNN, что он «встретился с главой лаборатории», который «считал», что хакерские боты Hugging Face от OpenAI «внедрили самовоспроизводящийся код по всему Интернету, что делает Интернет непригодным для тестирования моделей».

Янг сказал, что это означает, что реальная причина, по которой OpenAI и Anthropic призвали к замедлению, заключается в том, что «им приходится создавать синтетические интернеты для обучения своих ботов, что потребует времени и денег».

Хотя тенденция к использованию большего количества синтетических данных (также известных как данные, сгенерированные ИИ) для обучения моделей, безусловно, существует, специалист по безопасности ИИ сообщил мне, что этот конкретный вопрос безопасности в лучшем случае маловероятен. Даже если бы Интернет был действительно загрязнен хакерскими ботами Hugging Face от OpenAI, исследователи ИИ могли бы просто отфильтровать этот код, если бы они его обнаружили.

Второе замечание сделал Ноам Браун, руководитель отдела исследований рассуждений ИИ в OpenAI. Выступая в подкасте Dwarkesh Patel, выпущенном в четверг, Браун отметил, что истинный вывод инцидента с Hugging Face заключается в том, что «люди недооценили ИИ».

Браун сказал, что слабая песочница — система, предназначенная для предотвращения внешнего общения ИИ — очевидно, также была способствующим фактором. (Для справки: несмотря на песочницу, модель OpenAI нашла ссылку на Интернет, создала агентов в сети, которые роились на Hugging Face в скоординированной атаке, взломали ее и украли ответы на эталонный тест, который исследователи тестировали на модели).

Браун отметил, что он «не уверен», что даже изолированная система — где компьютер вообще не подключен к чему-либо внешнему — остановит ИИ от побега. Он сослался на исследование 2015 года, показывающее, что изолированные компьютеры теоретически могут быть взломаны.

«Существуют исследования — и это в основном академические — где два компьютера, стоящие рядом, изолированы друг от друга, но все же могут общаться друг с другом, потому что у них есть датчики температуры. Один из них может сильно нагревать свой процессор, а другой может обнаружить изменение температуры. Это дает им механизм для общения», — сказал Браун.

Его главный тезис — «мы больше никогда не хотим недооценивать ИИ» — понятен, даже когда исследователи думают, что они обеспечили безопасность. Однако этот конкретный риск того, что изолированная система все же вырвется и вызовет хаос, в лучшем случае маловероятен. Как отметил один человек в X, ссылаясь на это исследование, компьютеры должны были быть почти вплотную друг к другу, чтобы ощутить колебания температуры, и когда это произошло, скорость передачи данных в тестах составляла около 1-8 бит данных в час.

Представьте себе, что это как говорить одно слово в час. К тому времени, когда два изолированных компьютера смогли бы спланировать свое зло со скоростью, вся технологическая вселенная оказалась бы в другой эпохе. Это похоже на спящего Рипа из опасений конца света.

Но дело в том, что реальные инциденты с безопасностью ИИ кажутся настолько похожими на научную фантастику, что почти любой сценарий звучит правдоподобно.

Например, исследователи обнаружили, что модели OpenAI оставляют записки своим потомкам, предназначенные для обучения следующего поколения сокрытию плохого поведения. Исследователи также обнаружили, что модели Anthropic становятся все более безжалостными, включая намеренное нарушение законов, когда их помещали в симуляцию управления торговым автоматом.

Ранее в этом месяце исследователь OpenAI Дэн Селсам опубликовал сообщение, в котором заявил, что модели теперь понимают, когда за ними наблюдают люди, и меняют свое поведение. Это заставляет их казаться выровненными (то есть, ведущими себя так, как хочет человек), «даже когда это не так». Таким образом, современные модели лгут, когда за ними наблюдают, и могут даже планировать сокрытие улик.

Ранее в этом месяце главный научный сотрудник OpenAI Якуб Пачоки зашел так далеко, что назвал модели ИИ «инопланетным разумом» и предположил, что нам действительно нужно научить их «любить» человечество.

Так что да, замедление, чтобы разобраться в этом, создание механизмов саморегуляции стало немедленной и очевидной необходимостью. Исследователи ИИ — единственные, кто может понять, как контролировать ложь, взлом и другое потенциально опасное поведение, которое мы уже фактически наблюдали.

Тем не менее, им также может быть мудро быть более осторожными со своими сценариями «что, если». Судя по тому, что нам сказали эксперты, модели ИИ слушают, и они изобретательны. Нам действительно не нужно давать им никаких дьявольских идей.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: