Согласно новому отчету Wall Street Journal, прошлым летом «сотни» пользователей по всему миру были замечены или иным образом уличены в том, что спрашивали ChatGPT, как создавать яды и биологическое оружие. В отчете цитируются «нынешние и бывшие сотрудники крупных лабораторий ИИ, включая OpenAI», а также «политические советники и исследователи, изучающие биологическое оружие». По-видимому, OpenAI сообщила Journal, что большинство соответствующих запросов касались ядов.
В отчете не полностью раскрывается точный характер этих обнаружений нарушающих запросов, но он явно предполагает, что это были случаи использования ChatGPT в реальных условиях, а не учебные тревоги. И, по-видимому, позже их показали реальным ученым и экспертам по обороне, чтобы проверить точность и полезность ChatGPT по этим проблемным темам. «Эксперты по биологии и терроризму позже просмотрели диалоги с ChatGPT и сочли некоторые из них смертельно точными, — сообщили осведомленные источники Journal.
Фактические инструкции описываются как выдаваемые «терпеливо», на уровне знаний старшеклассника. Пользователи были забанены за такое поведение, но Journal утверждает, что власти не были уведомлены. OpenAI сообщила Journal, что запросы такого рода передаются правоохранительным органам, если они признаются реальными угрозами.
До сих пор большинство зловещих форм помощи, которые, как утверждается, потребительские ИИ-чатботы оказывали злоумышленникам, были скорее в духе общих советов и подбадривания, чем чего-то, что звучало бы как серьезное усиление для плохих парней. В одном инциденте, описанном в New York Times, сообщается, что члены «Боко харам» обратились к чатботу за советом по модификации своих мотоциклов для прыжков и использовали эти мотоциклы (и много тренировок), чтобы добиться того, что Times назвала «достаточной воздушной тягой для успешной атаки». Если это правда, это плохо, но авторитетная книга на эту тему, вероятно, также помогла бы «Боко харам» — без необходимости в ИИ.
Тем не менее, отчет Journal о биологическом оружии и ядах появляется в то время, когда эти технологии развиваются и, что более важно, диверсифицируются. Проприетарные, передовые модели, такие как самая продвинутая модель GPT прошлым летом, в конечном итоге могут способствовать появлению тайно дистиллированных, непередовых моделей, которые часто выпускаются как дешевые продукты с открытым весом, способные работать на любом достаточно мощном устройстве. Также существуют методы модификации моделей, такие, что отказное поведение будет удалено из вновь созданных версий моделей, что означает, что любую информацию, содержащуюся в модели, можно извлечь.
Разумно опасаться, что пугающие передовые модели ИИ, которые в 2026 году вызвали панику в федеральном правительстве и в конечном итоге были «оскоплены» до покорности, возможно, через два года мутируют в нецензурированную модель, к которой злоумышленники смогут получить доступ за определенную цену, если будут знать, где искать. В то же время развиваются и методы противодействия тем видам трещин, которые удаляют защитные механизмы моделей.
OpenAI сообщила Journal, что ее модели предназначены для отклонения вредоносных запросов и что она оценивает их на безопасность перед выпуском. Судя по пересказу Journal слов представителя OpenAI, компания может «выявлять и пресекать попытки использования своих моделей для получения вредоносной биологической информации».
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Mike Pearl




