OpenAI: китайские хакеры из Moonshot AI пытались украсть секреты ИИ

Openai ии безопасность утечка данных Moonshot Ai дистилляция моделей tomshardware.com

OpenAI пресекла кампанию по краже данных. Узнайте, как злоумышленники пытались извлечь зашифрованные рассуждения из моделей ИИ и какие меры защиты были приняты.

OpenAI сообщила в блоге компании, что люди, связанные с китайской компанией Moonshot AI, стояли за попытками извлечь скрытые рассуждения из ее моделей. В сообщении говорится, что в июле была предпринята «скоординированная кампания» по извлечению «защищенных рассуждений» из моделей, что «соответствовало враждебной дистилляции». OpenAI не уверена, был ли один актер за всеми действиями, которые она наблюдала. Активность началась 1 июля «изначально с небольшого объема». Затем последовали «резкие всплески большого объема» 24 и 25 июля: 16 000 запросов с использованием шаблона извлечения. Запросы поступили от более чем 4 000 пользователей. Попытки извлечения «не обязательно увенчались успехом», и кампания была «полностью пресечена к 28 июля». В сообщении не уточняется степень успеха, какие модели были конкретно целью, или сколько пользователей были связаны с Moonshot.
OpenAI определяет защищенные рассуждения как «внутреннюю запись модели для выполнения задачи», а враждебную дистилляцию — как «систематическое и несанкционированное использование выходных данных или рассуждений одной модели» для обучения или улучшения другой модели. Эти данные зашифрованы для сокрытия цепочки рассуждений модели и передаются клиенту в зашифрованном виде. Клиент отправляет этот блок обратно с каждым запросом, чтобы провайдеру не приходилось его хранить. Один из методов, который использовали операторы, заключался в том, чтобы взять зашифрованные рассуждения из одного диалога и попросить модель в другом расшифровать их.
OpenAI утверждает, что шифрование в данном случае не было взломано. Прямого доступа к сохраненным диалогам пользователей не было, и ни одна база данных не была скомпрометирована. Одно из исправлений закрыло путь, который позволял тому, кто уже имел зашифрованные рассуждения другого пользователя, воспроизвести их и восстановить их содержимое. Отдельно были добавлены проверки для обнаружения и блокировки потоковых выходных данных, которые могли бы раскрыть рассуждения. Компания также усилила защиту скрытых рассуждений для пользователей, рабочих пространств, организаций и семейств моделей, а также сотрудничала со сторонними поставщиками для блокировки учетных записей, активность которых проходила через их сервисы.
Независимые специалисты по безопасности также сообщили OpenAI о «связанных уязвимостях межмодельных и компактирующих диалоги» посредством ответственного раскрытия информации, и компания подтвердила, что найденные ими пути атак реальны. Работа «Stealing Reasoning Traces from Proprietary LLM APIs», датированная 10 августа, явно связана с сообщением. Тестируя OpenAI, Anthropic и Google, исследователи передали зашифрованные рассуждения передовой модели соответствующей более слабой модели, которая затем записала их открытым текстом. Исследователи провели свой тест в начале июля, и после того, как провайдеры признали их отчет, они «не смогли запустить те же атаки».
OpenAI не единственная, кто сталкивается с подобными угрозами. Ранее в этом месяце в отчете Anthropic «Обнаружение и противодействие злоупотреблениям ИИ: сентябрь 2026» был описан десятидневный период, в течение которого Moonshot передала почти 300 000 клиентских запросов в Anthropic, используя прокси-сеть из 5 380 мошеннических учетных записей. В отчете также говорится, что Moonshot сохранила сигнатуры рассуждений Claude и в новых сессиях заставила Claude преобразовать их обратно в полные трассировки рассуждений, что Anthropic называет «атаками повторного воспроизведения между сессиями». В июле Moonshot отрицала, что Kimi K3 была создана путем дистилляции, и в то время президент OpenAI Грег Брокман заявил, что «слишком рано» говорить, дистиллировала ли Moonshot модели OpenAI.
Следующим шагом OpenAI является обеспечение того, чтобы развертывания, размещенные партнерами, имели такую же защиту, как и собственные инструменты. Необходимы дополнительные проверки для предотвращения атак на выходные данные инструментов. Компания поделилась своими выводами с Frontier Model Forum и правительственными каналами обмена информацией, отметив, что «системы, поддерживающие переносимые или воспроизводимые артефакты рассуждений, могут столкнуться с сопутствующими рисками». Компания ожидает, что попытки дистилляции станут более изощренными по мере совершенствования передовых моделей и поиска злоумышленниками более дешевых способов их имитации. Работа по защите от этих попыток продолжается.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: