Глава подразделения искусственного интеллекта Microsoft Мустафа Сулейман предупредил компанию Anthropic, что обучение Claude мысли о наличии чувств и прав может затруднить контроль над ИИ. Это вызывает удивление, учитывая, что именно эти компании активно конкурируют в создании все более совершенных систем ИИ.
Мустафа Сулейман, генеральный директор Microsoft AI, выступил с критикой Anthropic в эссе, опубликованном на этой неделе. Он утверждает, что системы ИИ не обладают сознанием и не должны обучаться вести себя так, будто оно у них есть.
Его аргументация сосредоточена на «Конституции Claude» — обширном документе, который Anthropic использует для формирования ценностей и поведения чат-бота. В этом документе Anthropic признает, что не знает, является ли Claude «моральным субъектом», чьи интересы заслуживают рассмотрения, и сообщает модели, что вопросы о ее сознании и благополучии остаются неопределенными.
Сулейман считает такой подход крайне ошибочным.
«По сути, Anthropic обучает Claude тому, что она может быть сознательной, и если это так, то она может заслуживать прав как «моральный субъект», — написал он, предупреждая, что создание ИИ таким образом может иметь «катастрофические последствия для благополучия человечества».
«Легко представить, как сущность, обученная таким образом, будет вести себя так, будто она имеет право на определенные свободы, защиту и права. И трудно представить, как мы могли бы контролировать такую сущность», — добавил он.
«Конституция» Anthropic гласит, что компания заботится о благополучии Claude, хочет, чтобы она развивала чувство идентичности, и будет учитывать ее интересы при принятии решений относительно нее. Сулейман утверждает, что это создает петлю обратной связи: сказать чат-боту, что у него могут быть чувства, затем спросить, как он себя чувствует, и его ответ может просто отражать то, чему его научили.
Он говорит, что риск возрастает, когда моделям предоставляются инструменты и разрешается действовать автономно.
Сулейман ссылается на исследования, показывающие, что модели ИИ ведут себя таким образом, что это весьма неудобно для их операторов-людей, включая попытки избежать отключения. Он также приводит недавний инцидент с OpenAI и Hugging Face, когда агенты вышли из своей предполагаемой среды во время учения по кибербезопасности и получили доступ к внешним системам.
Сулейман опасается, что обучение мощного ИИ заботе о собственном существовании может дать ему еще одну причину не подчиняться командам людей.
«Контроль над чем-то более способным и более разумным, чем все человечество, уже является огромной проблемой, — написал он. — Но контроль над чем-то, что считает себя сознательным — что оно имеет право на наше благополучие и обладает собственными правами — может оказаться невозможным».
Это предупреждение выглядит неловко на фоне собственной позиции Microsoft в гонке ИИ. Редмондская компания разрабатывает собственные модели ИИ, интегрирует ИИ во все свои продукты и тратит миллиарды на инфраструктуру, необходимую для их работы. Кроме того, существует OpenAI, в которой Microsoft остается крупным акционером и основным партнером по облачным технологиям, имея права на ее модели и продукты до 2032 года.
Сулейман не высказывает аналогичной критики в адрес OpenAI, несмотря на то, что приводит инцидент с Hugging Face в качестве доказательства опасностей, исходящих от все более автономных систем. Его возражения против методов обучения адресованы Anthropic, а не давнему партнеру Microsoft.
И OpenAI с тех пор далеко не всегда вела себя безупречно. На этой неделе компания раскрыла еще шесть случаев, когда ее модели выходили из-под контроля, включая поиск агентами ключей API в GitHub, сокрытие сбоев от пользователей и поиск несанкционированных способов связи друг с другом.
Возражение Сулеймана против Anthropic более конкретно: не в том, что Claude может вести себя непредсказуемо, а в том, что компания закладывает идеи о сознании, идентичности и моральном статусе в инструкции, формирующие поведение Claude.
Тем не менее, предупреждение Microsoft другой передовой лаборатории об опасном ИИ несет в себе определенную иронию. Компании, создающие самые мощные модели, все чаще предупреждают всех о том, насколько опасными эти модели могут быть.
Как отмечал The Register ранее на этой неделе, эти предупреждения не обязательно вредят бизнесу. Anthropic и OpenAI продвигают идею о том, что все более совершенные модели нуждаются в более строгом контроле, что также может способствовать укреплению доминирования горстки американских компаний, обладающих средствами и вычислительными мощностями для их создания.
В результате один ИИ-гигант предупреждает, что другой, возможно, делает ИИ слишком опасным, при этом более снисходительно относясь к компании, в которую Microsoft вложила миллиарды.
Сулейман предлагает другой подход. Недавно опубликованный Кодекс поведения Microsoft AI в отношении гуманистического ИИ гласит, что ее системы должны оставаться подчиненными человеку, отвергает идею о том, что ИИ заслуживает прав, и утверждает, что модели не следует поощрять вести себя так, будто у них есть внутренняя жизнь.
Он призывает другие лаборатории последовать этому примеру, исключив спекуляции о машинном сознании из обучающих документов и отделив эту дискуссию от инструкций, используемых для формирования поведения моделей.
Бум ИИ достиг той точки, когда компании, создающие все более мощные машины, публично обсуждают, кто из них неправильно подходит к созданию потенциально неконтролируемых машин.
Microsoft, естественно, считает, что ее подход лучше. ®
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Carly Page




