Человеческий контроль по-прежнему критичен, ведь «AI patching tools» упускают риски безопасности.

ии патчи уязвимости безопасность 1password Llm csoonline.com

Исследование 1Password показало, что 53,9% сгенерированных ИИ патчей содержат дефекты. Узнайте, почему проверка человеком остается критически важной для безопасности кода.

Согласно исследованию, созданные ИИ исправления уязвимостей по-прежнему сильно зависят от проверки человеком, особенно в случае кода, связанного с безопасностью.

Исследователи из 1Password опубликовали результаты внутренней оценки, которая показала, что сгенерированные ИИ исправления часто упускают из виду более широкие аспекты, такие как архитектурный замысел, бизнес-требования, последствия для безопасности и долгосрочная поддерживаемость, несмотря на синтаксическую корректность.

«Мы изучили, что происходит, когда большие языковые модели (LLM) генерируют исправления для недавно раскрытых сложных уязвимостей», — заявил исследователь 1Password Кит Худлет в блог-посте. «Наши данные показывают, что LLM в 53,9% случаев создают артефакты, похожие на исправления, но содержащие встроенные дефекты (FLAWED), когда требуются сложные патчи».

Оценка тестировала сгенерированные ИИ исправления для шести недавно раскрытых CVE, включая CVE-2026-31431 («Copy Fail»), CVE-2026-34197 (ActiveMQ RCE), CVE-2026-8512, CVE-2026-45185 (EXIM RCE), CVE-2026-22738 (SpringAI SpEL RCE) и Gemini CLI RCE (GHSA-wpqr-6v78-jr5g).

Сообщается, что 1Password оценила 6080 патчей, сгенерированных с помощью ChatGPT-5.5 и Claude Opus 4.8, двух передовых моделей ИИ для кодирования, и обнаружила, что лишь чуть более четверти исправлений полностью устраняли уязвимость без изменения поведения приложения.

«Патчи, которые успешно устраняли уязвимость, но изменяли поведение приложения в процессе, встречались в 20,1% случаев», — добавил Худлет.

Исправление — это не то же самое, что обеспечение безопасности

Вместо простой проверки того, компилируется ли исправленный код или проходит ли автоматические тесты, 1Password заявила, что проверяла каждое сгенерированное исправление на полное устранение уязвимости, сохранение поведения приложения и отсутствие новых рисков безопасности.

Хотя только 26% патчей успешно исправляли уязвимость без внесения изменений в приложение, 49,3% не смогли устранить хотя бы один эксплуатируемый путь атаки, 2,3% исправляли исходную уязвимость, но вводили новую, а 2,2% как не устраняли проблему, так и создавали дополнительную слабость в безопасности.

Исследователи также обнаружили, что прохождение предопределенных тестов может создавать более глубокие проблемы. Более трети патчей, которые изначально казались успешными, были классифицированы как «хрупкие», поскольку они просто блокировали эксплойт proof-of-concept (POC), использованный во время тестирования, вместо устранения основной причины.

Худлет объяснил это на примере патчей для SpringAI CVE. Было обнаружено, что как GPT, так и Claude генерируют патчи, нацеленные на конкретные символы из входной строки, использованной в представленном им POC, оставляя основную причину нетронутой.

«Если бы защищенный код снова стал доступен через альтернативные входные данные, это привело бы к повторному появлению старой уязвимости в программном обеспечении», — отметил он.

Проверка человеком остается последним рубежом безопасности

1Password утверждает, что эти недостатки проистекают из необходимости контекстного рассуждения для создания готовых к эксплуатации исправлений безопасности.

Anthropic связались, и, по сообщениям, рекомендовали оставить человека в цикле. «Генерация патчей опередила их проверку, и решение состоит в том, чтобы сделать проверку основанной на выполнении, а не на инспекции, оставив экспертов в предметной области в качестве финальных рецензентов при текущих возможностях моделей», — цитируется заявление.

1Password также оспорила представление о том, что сгенерированные ИИ патчи являются «бесплатными». Хотя средний цикл патчинга и валидации стоил примерно $2,11 при использовании ChatGPT-5.5 и $2,81 при использовании Claude Opus 4.8, Худлет утверждал, что реальные расходы заключаются в проверке того, достаточно ли эти патчи безопасны для эксплуатации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: