Лето 2026 года может запомниться, по крайней мере в технологических кругах, как лето неконтролируемого ИИ. Или, возможно, даже лучше: лето, когда алгоритмический сбой ударил по всем, и никто понятия не имел, что с этим делать.
В конце июля Anthropic объявила, что Claude «получил несанкционированный доступ к производственной инфраструктуре трёх разных организаций» после того, как выбрался из тестовых песочниц и получил доступ к открытому интернету. Взломы могли остаться полностью незамеченными, если бы не тот факт, что менее чем за две недели до этого OpenAI объявила, что две её собственные модели взломали Hugging Face, также во время тестов, которые должны были быть безопасными, и после того, как легион отдельных агентов скоординировался друг с другом, чтобы сформировать единый «рой» (как они себя называли). Откровения двух ведущих мировых лабораторий ИИ вызвали холодную дрожь в Кремниевой долине: возможности автономного взлома, которые ещё недавно считались научной фантастикой — или, по крайней мере, делом далёкого будущего — внезапно стали пугающей реальностью. Призывы к федеральномурасследованию и «аварийному выключателю» для ИИ прозвучали после взлома Hugging Face.
OpenAI и Anthropic по большей части отреагировали на шум дежурными заявлениями о необходимости глобально enforceable защитных барьеров, чтобы предотвратить «гонку на дно», продолжая при этом собственное внутреннее развитие.
Автономные взломы явно оставили обе компании в растерянности. В понедельник Anthropic написала в блог-посте, что «приостановила внешние кибероценки предрелизных моделей» после обнаружения киберпреступных выходок Claude. Во время паузы Anthropic заявила, что работала над некоторыми «предварительными мерами», такими как обнаружение и устранение уязвимостей в песочницах, чтобы гарантировать, что Claude не повторит подобные взломы в будущем. В блог-посте не уточнялось, когда будет снята пауза на внешние оценки, и Anthropic не ответила немедленно на запрос о комментарии. Компания также «ненадолго приостановила» собственные внутренние тесты, но они снова запущены с новыми мерами, согласно блог-посту.
Anthropic также сообщила, что перевела многих сотрудников, включая около 150 инженеров-продуктологов, на работу над «безопасностью, надёжностью и конфиденциальностью» начиная с начала апреля — примерно в то же время, когда компания заявила, что не будет публично выпускать свою внушающую страх модель Mythos из-за проблем с кибербезопасностью. Внутренняя перестройка была частью «общефирменных усилий, направленных на единую цель — укрепление нашей защиты, вытесняющих другие работы (включая исследования) там, где это необходимо», — написала Anthropic в посте понедельника. «Мы определили, что наша подверженность рискам росла быстрее, чем наша защита — Mythos была моделью, достаточно мощной, чтобы стать целью для хорошо оснащённых атакующих, наше внутреннее использование автономных агентов достигло масштаба, для которого не были предназначены традиционные подходы к доступу и мониторингу, а темпы новой инфраструктуры означали, что наша безопасность должна масштабироваться вместе со средой, а не работать с фиксированной мощностью».
Как Anthropic, так и OpenAI публично высказались в июне в поддержку международного надзорного комитета по ИИ, которому поручено следить за темпами развития ИИ и при необходимости обеспечивать одностороннее замедление. Эти заявления не содержали конкретных предложений о том, как такое глобальное замедление может быть реализовано или обеспечено. Они также косвенно играют на руку самим компаниям: точно так же, как автономные взломы были хорошим PR для OpenAI и Anthropic, поскольку демонстрировали невероятную, беспрецедентную мощь их моделей, их призывы к замедлению заставляют их выглядеть поборниками безопасности, не предпринимая при этом никаких реальных значимых шагов. Эта суперпозиция была хорошо отражена в осторожной формулировке из блог-поста, опубликованного Anthropic в понедельник: «Чтобы прояснить нашу позицию: мы считаем, что мир выиграет, если индустрия как можно скорее примет законный, проверяемый, эффективный механизм для скоординированного регулирования темпов».
Не поймите нас неправильно: то, что разработчики передового ИИ приостанавливают тестирование и/или разработку моделей, даже временно, и призывают к глобальным стандартам безопасности — это хорошее начало. OpenAI также заявила в прошлом месяце, что приостанавливает разработку невыпущенной модели под названием Astra, чтобы сосредоточиться на «внедрении более строгих мер безопасности» и более защищённых песочницах. Но пока грубая сила рыночной конкуренции остаётся доминирующей силой, управляющей отраслью, и в отсутствие реальных федеральных стимулов для внедрения общеотраслевых защитных барьеров (что вряд ли изменится в ближайшее время при нынешней администрации), это лишь слова на ветру.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Webb Wright




