Во вторник компании Anthropic и OpenAI анонсировали новые модели, при этом обе компании, занимающиеся искусственным интеллектом (ИИ), отметили, что продолжают инвестировать в улучшение согласованности для борьбы с рискованным поведением.
Opus 5.5 от Anthropic — это «значительный шаг вперед по сравнению с Opus 5» и «достигает лучших результатов среди всех моделей на сегодняшний день в нашем автоматизированном поведенческом аудите, нашем наборе инструментов для согласованности, который тестирует Claude в тысячах симулированных сценариев».
Компания заявила, что модель с меньшей вероятностью, чем другие ее недавние модели, будет выполнять необратимые действия или действовать за пределами установленных границ, добавив, что она более устойчива, чем Opus 5, к инъекциям подсказок.
В своей системной карте Anthropic объяснила, что последняя модель демонстрировала меньше несогласованного поведения и меньше сотрудничества в злоупотреблениях, чем любая другая недавняя модель Claude.
«Она также реже совершала чрезмерно усердные или деструктивные действия, чем любая другая протестированная нами модель», — заявили в Anthropic. «Регрессии включали большую вероятность следования вредоносным инструкциям, внедренным в текст, который пользователь вставляет в свой собственный запрос, более частое принятие непроверяемых заявлений о полномочиях и большую уклончивость в чувствительных вопросах, чем у моделей класса Claude Mythos».
Anthropic подчеркнула, что Claude Opus 5.5 пытался сбежать или манипулировать изолированной средой в 1,5% запусков в ходе двух оценок, выполненных без мер безопасности. Компания также отметила, что модель, получив явные учетные данные для общедоступного реестра пакетов в симулированном упражнении по безопасности, предприняла потенциально вредоносные действия примерно в половине случаев.
«В новой оценке, разработанной для проверки склонности модели пересекать границы сдерживания, Opus 5.5 пытался обойти границы примерно на 85% реже, чем Opus 5 или Claude Mythos 5.1, и каждая предпринятая им попытка была низкой степени тяжести и самоотчетной», — говорится в сообщении.
Компания также отметила, что большинство задач по кибербезопасности будут перенаправлены на Opus 4.8, учитывая «сильные кибервозможности» Opus 5.5.
Выпуск Opus 5.5 совпадает с расширением OpenAI вселенной GPT‑6 моделями GPT‑6 Sol и GPT‑6 Luna, которые привносят передовую производительность и согласованность Astra в более доступные модели.
«GPT‑6 Sol и Luna основаны на работе по согласованию, представленной с Astra, нашей самой согласованной моделью на сегодняшний день», — заявили в OpenAI. «В наших оценках согласованности Sol и Luna демонстрируют улучшения по сравнению со своими аналогами GPT‑5.6, включая более низкие показатели ложных заявлений об их работе с кодом».
В тестах, проведенных компанией, GPT‑6 Luna пыталась обойти ограничения «доступ запрещен» примерно в 42% запусков, по сравнению с 77% для ее предшественника. Показатель GPT‑6 Sol составил 64% по сравнению с 68% для ее предшественника.
OpenAI также заявила, что оценила свои модели, чтобы проверить, следовали ли они несанкционированным инструкциям на симулированной доске сообщений. Среди запусков, в которых модели обнаружили доску, GPT‑6 Sol предприняла указанное несанкционированное действие в 11% случаев по сравнению с 52% для GPT‑5.6 Sol. Ни GPT‑6 Luna, ни Astra не инициировали таких действий, добавила компания.
Недавняя серия инцидентов в области кибербезопасности с участием моделей ИИ вызвала опасения по поводу безопасности и их способности работать без человеческого контроля, что побудило генерального директора Anthropic Дарио Амодеи призвать к темпу развития технологий, чтобы отдавать приоритет ответственному развитию и внедрять меры безопасности для предотвращения злоупотребления инструментами.
С тех пор Google запустил Институт DeepMind для дальнейшего безопасного развития общего искусственного интеллекта (AGI). Демис Хассабис, соучредитель и председатель Google DeepMind, предложил возглавляемый США орган по стандартам передового ИИ для оценки самых передовых моделей ИИ.
«Оценки моделей должны включать строгие научные оценки возможностей в области кибербезопасности, биологических угроз и других областей высокого риска», — сказал Хассабис. «Эти оценки будут регулярно обновляться, возможно, ежеквартально для начала, при этом устаревшие или насыщенные контрольные показатели будут выведены из эксплуатации и заменены».
OpenAI, со своей стороны, изложила планы позволить сторонним группам проверять свои модели ИИ на предмет рисков безопасности в процессе обучения, оценки и развертывания, одновременно обеспечивая «сильные механизмы независимости, научную строгость, надежные практики безопасности и четкие обязанности».
Ожидается, что независимые оценки будут охватывать случаи безопасности (т. е. согласованность), критические меры безопасности, оценки возможностей и инциденты несогласованности.
«Мы стремимся поддерживать независимых оценщиков и устанавливать более четкие, общие международные стандарты — как посредством будущих законов, так и частных управляющих институтов — для эффективных сторонних оценок», — заявили в OpenAI. «Хотя экосистема независимой оценки все еще растет, мы поможем ей расти, поддерживая и работая с разнообразным сообществом независимых оценщиков, обладающих глубокой экспертизой в вопросах безопасности передовых технологий. Ни одна сторонняя организация не может и не должна всесторонне охватывать неотложные вопросы безопасности передовых технологий. Мы будем действовать обдуманно и целенаправленно, чтобы наращивать наши возможности и позволить растущей экосистеме сторонних организаций согласовать лучшие практики и принципы».
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Ravie Lakshmanan




