OpenAI в среду заявила, что выявила и пресекла скоординированную кампанию дистилляции, целью которой была незаконная экстракция защищенных рассуждений из ее моделей искусственного интеллекта (ИИ).
«Основной кластер активности», относящийся к первой неделе июля, был приписан лицам, связанным с Moonshot AI, китайской компанией в области ИИ из Пекина. Компания не привела технических доказательств в поддержку этой оценки, вероятно, по соображениям безопасности.
«Операторы не взломали наше шифрование, не скомпрометировали базу данных и не получили прямого доступа к сохраненным пользовательским разговорам», — заявила OpenAI. «Вместо этого они манипулировали взаимодействиями с моделями таким образом, чтобы защищенные рассуждения могли быть воспроизведены в формах, видимых запрашивающему, скоординированным и масштабируемым образом, что нарушало наши условия обслуживания».
Предполагается, что активность началась 1 июля 2026 года с небольшого объема, а затем резко возросла 24 и 25 июля 2026 года до 16 000 попыток запросов с использованием соответствующего шаблона экстракции от более чем 4 000 пользователей. После дальнейшего расследования компания заявила, что выявила связанную «активность с использованием шаблонов подсказок» у более чем 15 000 пользователей. Кампания была полностью пресечена 28 июля 2026 года.
Стартап в области ИИ охарактеризовал эту деятельность как враждебную дистилляцию, которая включает систематическое и несанкционированное использование выходных данных одной модели для обучения, воспроизведения или улучшения другой модели. OpenAI заявила, что с тех пор внедрила дополнительные меры для борьбы с этой атакой и заблокировала мошеннические учетные записи, участвовавшие в этой деятельности.
Кроме того, OpenAI заявила, что закрыла «путь», который позволял некоторым лицам, уже обладавшим зашифрованными рассуждениями другого пользователя, воспроизводить их и восстанавливать их содержимое, а также добавила проверки для обнаружения и удержания потоковых выходных данных, которые могут раскрыть рассуждения.
В исследовании, опубликованном в августе 2026 года, группа исследователей обнаружила архитектурную уязвимость, которая сделала зашифрованные следы рассуждений «полностью совместимыми и взаимозаменяемыми между различными сессиями, пользователями и моделями в экосистеме поставщика», которую злоумышленник мог использовать для разработки масштабируемого эксплойта дешифрования и обхода механизмов против дистилляции.
«Внедряя зашифрованный след рассуждений из данной модели в более слабую и менее защищенную модель от того же поставщика, мы заставляем ее декодировать и выводить след дословно в открытом тексте, не взламывая напрямую более мощную модель», — заявили исследователи из MATS Research, ELLIS Institute Tübingen и Synk.
Кроме того, это позволяет осуществлять крупномасштабную экстракцию частных данных, открывает двери для невидимых инъекций подсказок путем встраивания вредоносных полезных нагрузок полностью в зашифрованные блоки и непреднамеренно раскрывает опасную информацию, скрытую в процессе рассуждений, даже если окончательный, видимый вывод модели отклоняет вредоносный запрос.
Учитывая, что защищенные рассуждения дают представление о том, как модель решает задачу, извлечение этой информации может раскрыть конфиденциальные данные и помочь другим воспроизвести возможности модели, добавила OpenAI.
«Враждебная дистилляция представляет риски для безопасности и национальной безопасности», — заявила компания. «Извлеченные рассуждения могут быть использованы для обучения другой модели без сохранения мер безопасности, примененных к пользовательским выходным данным исходной модели».
«В масштабе дистилляция также может ускорить передачу передовых возможностей без необходимости таких же инвестиций в безопасность. Эти проблемы обостряются по мере того, как модели приобретают возможности в областях двойного назначения».
Это не первый случай, когда Moonshot AI сталкивается с обвинениями в дистилляции. В прошлом месяце конкурент Anthropic обвинил Moonshot AI в скрытой передаче запросов клиентов Claude вместо их обработки с использованием Kimi, а затем отображении ответов от Claude пользователям.
Также утверждается, что компания сохранила подмножество этих обменов для обучения своей модели цепочки рассуждений (CoT). Эта деятельность отслеживалась под кодовым названием GTG-16002.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Ravie Lakshmanan




