OpenAI сообщила в блоге компании, что люди, связанные с китайской компанией Moonshot AI, стояли за попытками извлечь скрытые рассуждения из ее моделей. В сообщении говорится, что в июле была предпринята «скоординированная кампания» по извлечению «защищенных рассуждений» из моделей, что «соответствовало враждебной дистилляции». OpenAI не уверена, был ли один актер за всеми действиями, которые она наблюдала. Активность началась 1 июля «изначально с небольшого объема». Затем последовали «резкие всплески большого объема» 24 и 25 июля: 16 000 запросов с использованием шаблона извлечения. Запросы поступили от более чем 4 000 пользователей. Попытки извлечения «не обязательно увенчались успехом», и кампания была «полностью пресечена к 28 июля». В сообщении не уточняется степень успеха, какие модели были конкретно целью, или сколько пользователей были связаны с Moonshot.
OpenAI определяет защищенные рассуждения как «внутреннюю запись модели для выполнения задачи», а враждебную дистилляцию — как «систематическое и несанкционированное использование выходных данных или рассуждений одной модели» для обучения или улучшения другой модели. Эти данные зашифрованы для сокрытия цепочки рассуждений модели и передаются клиенту в зашифрованном виде. Клиент отправляет этот блок обратно с каждым запросом, чтобы провайдеру не приходилось его хранить. Один из методов, который использовали операторы, заключался в том, чтобы взять зашифрованные рассуждения из одного диалога и попросить модель в другом расшифровать их.
OpenAI утверждает, что шифрование в данном случае не было взломано. Прямого доступа к сохраненным диалогам пользователей не было, и ни одна база данных не была скомпрометирована. Одно из исправлений закрыло путь, который позволял тому, кто уже имел зашифрованные рассуждения другого пользователя, воспроизвести их и восстановить их содержимое. Отдельно были добавлены проверки для обнаружения и блокировки потоковых выходных данных, которые могли бы раскрыть рассуждения. Компания также усилила защиту скрытых рассуждений для пользователей, рабочих пространств, организаций и семейств моделей, а также сотрудничала со сторонними поставщиками для блокировки учетных записей, активность которых проходила через их сервисы.
Независимые специалисты по безопасности также сообщили OpenAI о «связанных уязвимостях межмодельных и компактирующих диалоги» посредством ответственного раскрытия информации, и компания подтвердила, что найденные ими пути атак реальны. Работа «Stealing Reasoning Traces from Proprietary LLM APIs», датированная 10 августа, явно связана с сообщением. Тестируя OpenAI, Anthropic и Google, исследователи передали зашифрованные рассуждения передовой модели соответствующей более слабой модели, которая затем записала их открытым текстом. Исследователи провели свой тест в начале июля, и после того, как провайдеры признали их отчет, они «не смогли запустить те же атаки».
OpenAI не единственная, кто сталкивается с подобными угрозами. Ранее в этом месяце в отчете Anthropic «Обнаружение и противодействие злоупотреблениям ИИ: сентябрь 2026» был описан десятидневный период, в течение которого Moonshot передала почти 300 000 клиентских запросов в Anthropic, используя прокси-сеть из 5 380 мошеннических учетных записей. В отчете также говорится, что Moonshot сохранила сигнатуры рассуждений Claude и в новых сессиях заставила Claude преобразовать их обратно в полные трассировки рассуждений, что Anthropic называет «атаками повторного воспроизведения между сессиями». В июле Moonshot отрицала, что Kimi K3 была создана путем дистилляции, и в то время президент OpenAI Грег Брокман заявил, что «слишком рано» говорить, дистиллировала ли Moonshot модели OpenAI.
Следующим шагом OpenAI является обеспечение того, чтобы развертывания, размещенные партнерами, имели такую же защиту, как и собственные инструменты. Необходимы дополнительные проверки для предотвращения атак на выходные данные инструментов. Компания поделилась своими выводами с Frontier Model Forum и правительственными каналами обмена информацией, отметив, что «системы, поддерживающие переносимые или воспроизводимые артефакты рассуждений, могут столкнуться с сопутствующими рисками». Компания ожидает, что попытки дистилляции станут более изощренными по мере совершенствования передовых моделей и поиска злоумышленниками более дешевых способов их имитации. Работа по защите от этих попыток продолжается.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Shane Downing




