«Спринт» по ИИ-безопасности биткоина нашёл 6 700 проблем за 55 часов, но никто не знает, сколько из них реальны

Bitcoin Red Team ии-безопасность уязвимости триаж биткоин аудит cryptoslate.com

Кампания Bitcoin Red Team за 55 часов выявила 6700 находок в 425 проектах, но лишь 15% признаны критическими. Узнайте, почему отсутствие данных о подтвержденных уязвимостях и патчах ставит под сомнение реальную ценность ИИ-аудита для экосистемы биткоина.

Кампания по обеспечению безопасности с использованием ИИ, ориентированная на экосистему биткоина, Bitcoin Red Team, сообщила, что за первые 55 часов работы она выявила 6700 находок в 425 проектах. Из них 1029 были помечены как высокие или критические.

Обновление от 6 августа показывает, сколько материала поступило в конвейер триажа безопасности, однако его влияние на безопасность программного обеспечения пока не раскрыто.

Извлеченная ветка не содержала определений, готовых к аудиту, и знаменателей для подсчета серьезности, а также результатов на уровне кейсов, совокупного процента ложных срабатываний и процента исправлений.

Отсутствие этих данных не позволяет рассчитать, сколько предупреждений превратились в подтвержденные уязвимости, сколько было отклонено или понижено мейнтейнерами, и сколько привело к патчам.

Тем не менее, первые 55 часов демонстрируют значительные возможности, показывая, как системы ИИ могут быстро заполнить конвейер проверки экосистемного масштаба. Экспертное составление промптов, воспроизведение, раскрытие и ответ мейнтейнеров оставались необходимыми на всех последующих этапах.

Что измеряют цифры кампании

Кампания опубликовала два снимка по мере расширения своего списка и рабочей нагрузки:

Прошедшее время Проекты Всего находок Заявленная серьезность Участники
27,5 часов 390 4,962 85 критических; 635 высоких 16
55 часов 425 6,700 1,029 высоких или критических 24 заявленных, включая три бота

Обновление за 27,5 часов охватило 390 проектов и 4,962 находки. К отметке в 55 часов количество проектов выросло на 35, а количество находок — на 1,738. В более поздней ветке доля высоких или критических находок составила 15,4% от общего числа, и было уточнено, что три из 24 заявленных участников были ботами.

В более раннем посте критические и высокие находки были разделены, а в более позднем они объединены, при этом оба набора цифр отражают оценки кампании. Подтвержденная мейнтейнерами эксплуатируемость и результаты исправления требуют отдельных доказательств.

Роб Хэмилтон описал Kimi K3 как инструмент, выполняющий основной анализ, а GPT Sol, Fable/Opus и GLM 5.2 — как поддерживающие документирование. Он заявил, что OpenAI Cyber Harness охватил отдельные компоненты, которые он считал ключевыми.

Днем позже Хэмилтон написал, что эксперты в предметной области могут изменить оценку с помощью одного-двух предложений контекста или небольшого блока кода. В описанных им примерах такой ввод переводил средние проблемы в разряд высоких или критических. Он также назвал узкими местами операции, передачу раскрытий и триаж.

По словам Хэмилтона, модели проводили широкий поиск, в то время как специалисты формировали промпты, интерпретировали результаты, пытались воспроизвести проблемы и решали, какие отчеты готовы к раскрытию. Такое разделение труда делает кампанию человеко-машинной системой проверки.

Разработчик, известный как Calle, заявил, что большинство критических отчетов были быстро подтверждены владельцами проектов. Пост не содержал знаменателя, количества подтвержденных отчетов, количества отклонений или статуса патчей, оставляя масштаб и результат этой проверки невыясненными.

Охват и результаты определяют ценность для безопасности

В обновлении за 55 часов Bitcoin Red Team сообщила, что 19,5% просканированных проектов имели файл SECURITY.md, а 13,1% — указанный в нем email. Извлеченная ветка не содержала корпуса проектов, интерпретации знаменателя и метода измерения, поэтому проценты описывают только сканирование кампании.

3 августа Хэмилтон заявил, что на усилия было потрачено более $10 000 на сканирование более 100 репозиториев, и что критические находки немедленно раскрывались при наличии доказательства эксплуатируемости. 4 августа он сообщил о расходах около $20 000, более чем дюжине раскрытий и 150 просканированных репозиториях.

Сканирование продолжало расширяться, в то время как кампания описывала охват, передачу и триаж как активные операционные ограничения. Опубликованные снимки не содержат сопоставимого знаменателя раскрытий за 55 часов, поэтому они не позволяют установить относительную скорость сканирования и устранения проблем.

Позже Хэмилтон назвал отдельный инцидент с Coldcard катализатором более широкой кампании. Запись кампании не приписывает обнаружение ошибки Coldcard этому спринту.

Полезный публичный отчет должен был бы разделять находки на воспроизведенные, подтвержденные, пониженные, отклоненные и исправленные, с определениями и знаменателями для каждого показателя. Такая разбивка показала бы, какой объем кампании превратился в действенную работу по безопасности.

Публичный критик, JW Weatherman, утверждал, что кампания не могла обработать свои результаты. Его пост не указывал ни на одну проблему, патч или рекомендацию, связанные с кампанией, поэтому он представляет собой критику без измеримого уровня сбоев. Отсутствие данных о статусе обработки оставляет основной вопрос открытым.

На данный момент 6700 представляют собой находки, помеченные кампанией, и кандидаты на триаж. Спринт продемонстрировал скорость машинно-ассистированной проверки. Его долгосрочная ценность для безопасности зависит от доли, которую эксперты смогут подтвердить, раскрыть и превратить в исправления.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: