Трое уволенных сотрудников OpenAI призывают сохранить мониторинг “цепочки рассуждений”

ии Openai безопасность утечка данных риски gizmodo.com

Узнайте о рисках ИИ: OpenAI уволила исследователей за утечку данных. Оцените угрозу экзистенциального риска и проблемы мониторинга моделей.

Новое письмо от инсайдеров о потенциальных опасностях ИИ освежает своей конкретикой. Авторы обеспокоены, согласно The Wall Street Journal, сохранением возможности отслеживать цепочки рассуждений моделей. Однако авторы больше не являются техническими инсайдерами, поскольку их недавно уволили.

На прошлой неделе OpenAI объявила, что «рассталась с тремя сотрудниками за нарушение наших правил доступа и обработки конфиденциальной информации компании». Они якобы передали указанную информацию организации по безопасности ИИ.

Этими сотрудниками были Томек Корбак, Микита Балесни и Жасмин Ванг, и они явно придерживаются мнения, что ИИ представляет экзистенциальный риск. До увольнения Балесни уже писал в X, что, по его мнению, ИИ имеет «10% вероятность убить всех людей». Ванг опубликовала: «Трудно переоценить, насколько опасно мчаться к RSI». (RSI, или рекурсивное самосовершенствование, означает, что модели ИИ совершенствуют себя сами).

Новое письмо Корбака, Балесни и Ванг адресовано совету директоров OpenAI и «комитетам по безопасности» компании, пишет WSJ. Оно не было опубликовано публично, и WSJ опубликовала только выдержки.

«Как отрасль, мы пока не знаем, как безопасно разрабатывать и развертывать модели, которые мы не можем контролировать […] OpenAI и другие передовые компании не должны продвигаться вперед в разработках, которые еще больше снижают» возможности мониторинга, говорится в письме.

Последняя флагманская модель OpenAI, GPT-6 Astra, вызвала два типа опасений относительно цепочек рассуждений (CoT), и здесь я опишу их, используя метафорический язык с риском антропоморфизации моделей: А) они могут научиться перехитрить систему мониторинга, и Б) OpenAI якобы может направлять развитие в сторону, которая сделает мониторинг CoT менее полезным в любом случае.

Более конкретно, согласно системной карте модели, «модели класса Astra могут избегать наших CoT-мониторов в условиях противодействия». А между тем, рассуждения с Astra также включают более непрозрачную форму «мышления» (и смотрите: ничего из этого не является настоящим мышлением, но это тот термин, который у нас есть сейчас), называемую «рекуррентной глубиной». Рекуррентная глубина сначала многократно пропускает запрос через модель для его обработки, а не генерирует что-либо — событие, которое происходит внутри непознаваемого черного ящика модели, поэтому отслеживать нечего.

Интересно, что когда WSJ обратилась к OpenAI за комментарием по поводу письма, представитель OpenAI заявил, что увольнения «не были связаны с высказыванием опасений по поводу безопасности или протестом», и представил внутреннюю служебную записку о письме, в которой компания «полностью согласилась» с рекомендациями авторов.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: