Хотя использование этой техники компанией Astra, по сообщениям, ограничено, ее появление вызвало серьезную обеспокоенность среди экспертов по безопасности ИИ.
«Я крайне обеспокоен сообщениями о том, что Astra использует непрозрачную рекуррентность», — написал генеральный директор Redwood Бак Шлегерс в посте после появления новостей. «Я не знаю, насколько Astra менее поддается мониторингу CoT (Chain of Thought), чем предыдущие модели. Но если OpenAI будет развивать эту технику дальше, у них появится возможность значительно усилить рекуррентность и полностью уничтожить мониторинг CoT».
Давний сторонник безопасности ИИ Зви Мовшовиц также высказался, написав, что могут потребоваться законы для предотвращения «гонки ко дну» среди ИИ-лабораторий.
«Эта техника играет с огнем, рискуя нарушить табу, которое OpenAI и Anthropic боролись за установление, — что мы будем изо всех сил стараться сохранить верность и мониторируемость Chain of Thought как можно дольше», — написал Мовшовиц. «Более интенсивное использование таких методов, вероятно, повредит мониторируемости».
При обычных обстоятельствах цепочка рассуждений модели представляет собой последовательные шаги, которые модель предпринимает при попытке решить проблему. Хотя представление несовершенно, оно по-прежнему служит ценным инструментом для отслеживания ненадлежащего поведения или несоответствия. В случае недавней активности OpenAI с «бродячими агентами» записи цепочки рассуждений были важным инструментом для выяснения причин такого поведения агентов.
При непрозрачной рекуррентности модель использует менее линейный подход, обрабатывая один и тот же запрос несколько раз в цикле. Результат оставляет меньше различимых следов, фактически обходя обычную запись цепочки рассуждений.
Ключевым моментом является то, что использование этой техники компанией Astra, по-видимому, ограничено. Ожидается, что цепочка рассуждений модели по-прежнему будет читаемой, и компания отвергла любые предположения о переходе на «нейроязык» (neuralese). OpenAI уже объявила о планах по созданию обширных систем мониторинга цепочки рассуждений в рамках своих перспективных планов безопасности.
В посте в X главный научный сотрудник OpenAI Якуб Пачоцки подчеркнул приверженность лаборатории читаемым цепочкам рассуждений. «OpenAI работала над сохранением и использованием мониторинга цепочки рассуждений с момента создания наших первых моделей рассуждений», — написал Пачоцки. «Это основная цель нашей текущей исследовательской программы».
Все ИИ-модели выполняют некоторое количество непрозрачных рассуждений, и немногие исследователи воспринимают журналы цепочки рассуждений как прямое отражение рассуждений модели. Тем не менее, эти оговорки не развеивают опасений, что непрозрачная рекуррентность может затруднить мониторинг рассуждений ИИ, особенно по мере ее распространения в различных моделях. В последующем отчете в среду утром The Information сообщил, что и Anthropic, и Google DeepMind уже обсуждали эту технику.
В посте, отвечая на новости, главный научный сотрудник Redwood Райан Гринблатт заявил, что непрозрачные рассуждения могут легко масштабироваться быстрее, чем традиционные рассуждения по цепочке мыслей, фактически удаляя все рассуждения из видимых каналов.
«Моя главная забота заключается в том, что естественным развитием событий станет масштабирование непрозрачных рассуждений до такой степени, что модель будет рассуждать полностью или почти полностью в скрытом пространстве», — написал Гринблатт. «Я надеюсь, что еще не поздно избежать наиболее тревожных архитектур и что OpenAI остановится на этом».
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Russell Brandom




