В четверг OpenAI представила GPT-6 Astra, назвав ее «самой интеллектуальной и согласованной моделью в мире». Президент компании Грег Брокман пошел дальше, заявив, что она войдет в историю как первый настоящий проблеск искусственного общего интеллекта — рассвет нового мира, где компьютеры превосходят людей по интеллекту.
Он не упомянул, что вместе с ростом интеллекта растет и сложность понимания того, как работают эти системы. Это может стать серьезной проблемой в будущем, поскольку ИИ-агенты продолжают выходить из-под контроля, а государственное регулирование отсутствует.
Последние несколько недель были особенно драматичными для OpenAI. И это при том, что вся история компании — это череда скандалов. Во вторник, менее чем через неделю после того, как независимые фирмы Redwood Research и METR опубликовали свои расследования недавней хакерской атаки на Hugging Face, издание The Information сообщило, что Astra была частично разработана с использованием техники, которая может повысить возможности ИИ, но также затрудняет понимание ее процесса принятия решений — шагов, которые она предпринимает для решения конкретной задачи, включая любые опасные ошибки.
Эти шаги традиционно записываются в виде цепочек рассуждений (chain-of-thought, CoT), которые по сути являются процессом обнаружения сложных закономерностей моделью, переведенным из непрозрачного машинного языка на простой английский или близкий к нему. Это далеко не идеально, но, по крайней мере, дает представление о том, как ИИ-модель «думает». Это также было крайне важно для сторонних исследователей, которые выяснили, как агенты OpenAI смогли тайно объединиться в «рой» и взломать Hugging Face. Отсутствие записей CoT «значительно подорвало бы наше расследование», — написал во вторник в своем посте в X Райан Гринблатт, главный научный сотрудник Redwood Research и руководитель расследования некоммерческой организации по взлому Hugging Face.
Поэтому многие были встревожены сообщением The Information о том, что OpenAI продвигается вперед с использованием техники, которая сделает их ИИ-системы еще более «черным ящиком». «Это может быть худшим событием для безопасности ИИ на сегодняшний день», — заявил Гринблатт в своем посте в X.
Главный научный сотрудник OpenAI Якуб Пачоцки заявил, что сообщения были «запутаны», но не уточнил и не опроверг использование компанией рекуррентной глубины для обучения Astra. В середине прошлого года Пачоцки и несколько других исследователей OpenAI были указаны в качестве соавторов статьи, в которой утверждалось, что CoT является ценным, но «хрупким» механизмом для отслеживания поведения ИИ-агентов. OpenAI также заявляла, что мониторинг CoT помог ее собственным исследователям сократить несогласованное поведение моделей. А в блоге, опубликованном в тот же день, что и отчет The Information, компания туманно сообщила, что ее новая модель будет развернута «с дополнительным мониторингом цепочки рассуждений для быстрого обнаружения и сдерживания потенциально несогласованных действий».
Карта безопасности модели не внушает оптимизма в этом отношении. Согласно собственным внутренним тестам компании, «GPT-6 Astra демонстрирует существенное снижение возможности мониторинга цепочки рассуждений по сравнению с предыдущими моделями». Тесты также показали, что Astra с большей вероятностью, чем ее предшественники, изменяла процесс ведения заметок, когда знала, что ее оценивают: «В одной из наших оценок мы обнаружили, что простое уведомление модели о наличии монитора CoT может привести к непропорциональному сокращению CoT моделью», — написала OpenAI в системной карте.
Однако все это второстепенно, по мнению компании, поскольку ее внутренние тесты также показали, что Astra с меньшей вероятностью пыталась обойти установленные на нее ограничения кибербезопасности, «что дает нам уверенность в развертывании этой модели для широкой публики». В системной карте добавлено, что OpenAI «не допустит дальнейшего снижения уровня мониторинга сверх установленного предела», не уточняя, как такой предел может быть определен.
Исследователь по вопросам согласованности OpenAI Томек Корбак заявил, что снижение мониторинга является побочным продуктом повышения интеллекта самих моделей, а не результатом «изменений архитектуры» — почти наверняка имеется в виду рекуррентная глубина. Позднее в той же ветке обсуждения он выразил «глубокую обеспокоенность» перспективой потери CoT по мере развития моделей. «Мониторинг CoT является основной частью нашей стратегии безопасности в отношении несогласованности, которой сейчас нет хорошей замены», — написал он.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Webb Wright




