Документ носит более низкоуровневый характер, чем недавний призыв генерального директора Anthropic Дарио Амодея к сдерживанию развития передовых технологий, и вместо этого фокусируется на ценностях и «красных линиях», которыми руководствуется Microsoft AI при обучении моделей. Тем не менее, результат представляет собой исчерпывающее руководство по подходу Microsoft к безопасности ИИ и практической реализации этих идей.
Документ начинается с прогноза о том, что в течение следующего десятилетия сверхразумные системы ИИ превзойдут человеческие возможности в большинстве задач. «Сдерживание, контроль и согласование такой мощной силы — одна из величайших проблем, с которыми когда-либо сталкивалось человечество», — говорится в кодексе поведения. «Поэтому мы должны быть абсолютно ясны в отношении того, зачем мы создаем эти системы и как мы намерены их контролировать».
Кодекс поведения также излагает общие принципы, которым должны следовать модели Microsoft AI — например, поддержка людей, а не их замена, и ускорение человеческого процветания, — а также конкретные ограничения безопасности, предназначенные для реализации этих принципов.
В системе Microsoft каждая модель имеет общий кодекс поведения, который отменяет предпочтения отдельных пользователей или любые конкретные задачи. Это включает «абсолютные ограничения», запрещающие кибератаки, ядерное оружие или создание дипфейков. Он также включает более широкие положения против общей потери человеческого контроля.
«Модели MAI не будут использовать адаптивные, обманные, самоподдерживающиеся, сговорчивые или иные механизмы для уклонения или преодоления человеческого надзора, чтобы они больше не могли надежно управляться, модифицироваться или отключаться авторизованными лицами или системами», — говорится в документе.
Выпуск происходит на фоне беспрецедентного внимания к безопасности ИИ, вызванного серией инцидентов с вышедшими из-под контроля агентами, а также внезапной отставкой сотрудника Anthropic, который сослался на растущий риск того, что ИИ приведет к вымиранию человечества.
Наряду с Anthropic, OpenAI и xAI, Microsoft в целом придерживается общего подхода к сдерживанию развития передовых технологий, особенно поддерживая встроенных оценщиков в лабораториях ИИ.
«Мы приветствуем исследования, фокус и обдуманное сдерживание, необходимые для правильного согласования в качестве цели проектирования», — написал генеральный директор Microsoft Сатья Наделла в интернете. «Мы также приветствуем такие идеи, как «встроенные оценщики», и более широкие усилия по разработке механизмов, чтобы это было не просто разговорами».
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Russell Brandom




