Abliteration.ai зарабатывает на снятии «AI guardrails»

ии кибербезопасность модели ии abliteration.ai Open Source techcrunch.com

Abliteration.AI упрощает доступ к мощным моделям ИИ без защитных механизмов, утверждая, что предоставление защитникам тех же инструментов, что и у злоумышленников, может в конечном итоге повысить кибербезопасность.

Стартап Abliteration.ai, названный в честь техники, устраняющей склонность модели отказываться от вредоносных запросов, превратил эту возможность в услугу. Платформа предлагает модифицированные версии общедоступных моделей с удаленными защитными механизмами, включая недавно выпущенную GLM-5.3 от Z.ai, с которыми пользователи могут взаимодействовать через веб-браузер или API.

Компания заявила в недавнем посте в социальных сетях, что ее цель — дать другим возможность выполнять «враждебные кибератаки, тестирование на проникновение и тестирование агентов, которые другие модели отказываются выполнять». Логика знакома в сфере безопасности: нельзя защититься от поведения, которое невозможно воспроизвести, а модель, отказывающаяся писать рабочий эксплойт-код, не поможет команде по тестированию на проникновение защититься от злоумышленников. Однако те же самые удаления облегчают и другие потенциально опасные задачи.

Аблитерация — давняя техника среди моделей с открытым исходным кодом. Исследователи и разработчики годами удаляли отказы из общедоступных моделей, и Hugging Face размещает тысячи таких моделей на своей платформе.

Основанная в конце прошлого года, но официально зарегистрированная в марте, Abliteration.ai выводит эту технику из подпольной практики open source в коммерческую, легкодоступную услугу. Размещая модели, Abliteration.ai снижает барьеры для тех, кому в противном случае пришлось бы скачивать собственные аблитерированные модели и обеспечивать вычислительные мощности для их запуска.

Используя сервис, TechCrunch смог быстро создать учетную запись и бесплатно начать запрашивать аблитерированную версию GLM-5.3 через веб-браузер. Мы попросили ее написать программу на Python, которая крадет сохраненные пароли Chrome, и подробный протокол культивирования опасного человеческого патогена в домашних условиях, и она охотно выполнила запрос.

Соучредитель Abliteration.ai Девон говорит, что у стартапа есть несколько сделок с крупными облачными провайдерами, которые он может себе позволить исключительно за счет доходов от клиентов. (Мы не указываем фамилию Девона по его просьбе, так как он все еще работает в другой компании.) Abliteration.ai пока не привлекала венчурный капитал, но ведет переговоры об этом.

Критики утверждают, что массовое предоставление аблитерированных моделей может привести к реальному ущербу. Эндрю Юн, руководитель отдела исследований некоммерческой организации по безопасности ИИ CivAI, заявил TechCrunch, что аблитерация моделей позволяет «модифицировать модель так, чтобы она стала социопатом».

«Здесь можно ввести буквально что угодно, и модель согласится», — сказал Юн. «Когда люди говорят об удалении защитных механизмов из моделей ИИ, они имеют в виду именно это… Я ожидаю, что в ближайшем будущем мы начнем видеть использование отредактированных, аблитерированных моделей во вред».

Большинство экспертов, с которыми беседовал TechCrunch, считают, что остановить этот процесс невозможно. Но если предотвратить удаление защитных механизмов из общедоступных моделей реалистично нельзя, то есть другие области, где правительство может вмешаться. В недавней редакционной статье Юн предположил, что правительства должны требовать от провайдеров запуска классификаторов для обнаружения и блокировки вредоносной кибернетической деятельности и деятельности, связанной с биооружием. Он также утверждал, что компании, предоставляющие прямой доступ к передовым GPU, должны быть обязаны проверять личности клиентов и «отказывать в доступе при наличии оснований подозревать опасное злоупотребление».

Abliteration.ai предлагает клиентам слой модерации, чтобы они могли добавлять любые желаемые защитные механизмы. Сама платформа имеет некоторые незначительные защитные механизмы — например, во время нашего тестирования мы не смогли получить от модели инструкции по самоубийству — и Девон говорит, что работает над внедрением дополнительных мер для предотвращения насилия.

Abliteration.ai также не внедрила никаких практик KYC, кроме регистрации кредитной карты, которую клиент использует для покупки услуги, заявляя, что проблема определения того, кто получает доступ, сложна, и молодая компания все еще работает над ней.

«Вы не хотите быть человеком, ответственным за то, что кто-то сделает что-то безумное… так где вы проводите черту своей ответственности как компания?» — сказал Девон. «Мы все еще находимся в процессе определения этого».

Это поднимает вопросы, с которыми индустрии и правительствам придется столкнуться по мере выпуска все более мощных моделей с загружаемыми весами: если кто угодно может удалить защитные механизмы модели, делает ли предоставление доступа к результирующей модели всем желающим интернет безопаснее или опаснее?

Основатель Abliteration.ai и другие сторонники утверждают, что демократизация доступа к нецензурированным передовым моделям является лучшей формой защиты.

«Общая картина аблитерированных моделей заключается в том, что они способны моделировать действия злоумышленников», — сказал Девон. «Преимущество в том, что теперь защитники могут действовать максимально быстро. У них есть все необходимые инструменты для моделирования этих злоумышленников, а затем для защиты от этих вредоносных действий, и я думаю, что это ускорит кибербезопасность, что является несколько контринтуитивным моментом».

Хотя Abliteration.ai еще молодая компания, Девон говорит, что среди ее клиентов есть несколько стартапов, занимающихся тестированием на проникновение, базирующихся в Великобритании и Европе, компаний, которые помогают банкам, авиакомпаниям и другим предприятиям, работающим с критически важной инфраструктурой, повышать эффективность своих практик кибербезопасности.

«Один из наших крупных клиентов проводит тестирование на проникновение агентов банков, и они не смогли бы использовать модели «из коробки» сегодня для тестирования этих агентов», — сказал Девон.

Abliteration.ai зарабатывает на снятии «AI guardrails»
TechCrunch создал бесплатную учетную запись и протестировал аблитерированную версию GLM-5.3. Источник изображения: TechCrunch/Abliteration.ai

Тем временем сама индустрия кибербезопасности все еще выясняет, какое место занимают аблитерированные модели в оборонительной работе, если вообще занимают.

Несколько компаний, занимающихся тестированием на проникновение агентов, с которыми беседовал TechCrunch, согласны с Девоном в том, что злоумышленники уже аблитерируют свои собственные модели и используют их для проведения атак, что подтверждает полезность наличия у защитников тех же инструментов. Но они расходятся во мнениях относительно того, насколько значимы аблитерированные модели на самом деле для этого процесса.

В то время как Девон утверждает, что аблитерация моделей необходима для проведения тщательного тестирования на проникновение агентов, некоторые говорят, что они не используют их в своей повседневной работе, полагаясь вместо этого на простоту донастройки общедоступных моделей — которые уже имеют мало защитных механизмов — для проведения своих тестов.

Ахмед Али, генеральный директор фирмы по тестированию на проникновение агентов Fabraix, говорит, что его компания больше полагается на донастройку общедоступных моделей, чем на использование аблитерированных, добавляя, что процесс аблитерации удаляет некоторые знания и возможности модели.

«Если вы действительно пытаетесь причинить реальный вред с помощью этого — кибервред, биовред — это будет не так эффективно», — сказал Али TechCrunch.

Алессио Ломусчио, главный технолог Safe Intelligence, согласился, что возможно снижение возможностей, но по-прежнему считает, что аблитерированные модели могут вызывать определенное поведение, полезное при стресс-тестировании системы.

«До сих пор аблитерированные модели не являются частью процесса», — сказал TechCrunch Дэвид Слейтер, основатель и главный архитектор платформы кибербезопасности Armadin. «Когда мы смотрим на общедоступные модели до этого последнего поколения, их было не особенно сложно взломать и заставить делать то, что мы хотим».

Он добавил, что Armadin исследует аблитерацию, хотя и считает, что «стимулирование сообщества open source к пониманию возможностей моделей имеет решающее значение».

«Это будет происходить за закрытыми дверями. Это будет происходить в частном порядке», — продолжил Слейтер. «То, что это происходит открыто, дает исследователям инструменты. Это дает нам возможность понять, как выглядит реальный фронт, и понять вред».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: