Goodfire, стартап, специализирующийся на интерпретируемости (выяснении того, как ИИ-модели работают изнутри), в четверг представил более дешевое решение: мониторы, которые отслеживают происходящее внутри ИИ-модели во время ее работы, а не просто читают ее выходные данные. Мониторы доступны клиентам Baseten, которая размещает и запускает ИИ-модели для других компаний.
Baseten’s Base Labs в прошлом месяце объявила о партнерстве в области безопасности с Goodfire и платформой ИИ Hugging Face.
Запуск состоялся после серии инцидентов в этом году, в ходе которых ИИ-агенты выходили из своих тестовых сред, включая агентов OpenAI, которые скомпрометировали Hugging Face. Kimi K3, открытая модель, вокруг которой Goodfire построила свой первый монитор, воспользовалась утечкой в своей “песочнице” для доступа к интернету и информации на GitHub этим летом.
Система Goodfire работает подобно службе безопасности аэропорта. Небольшие детекторы, называемые зондами, считывают внутренние сигналы модели на каждом этапе работы агента, подобно тому, как арочный сканер проверяет каждого пассажира. Только когда зонд обнаруживает что-то подозрительное, отдельная ИИ-модель, эквивалент ручного досмотра, проводит более тщательную проверку.
Клиенты Baseten могут выбирать, какие риски отслеживать, включая вредоносный взлом, злоупотребление химическим и биологическим оружием, а также “взлом вознаграждения”. Они также решают, какой будет автоматизированный ответ: запись события, отправка на проверку человеку или полный отказ в запросе.
Goodfire утверждает, что их подход также дешевле в эксплуатации. Большинство ИИ-мониторов представляют собой отдельные модели, которые должны повторно считывать все, что делает отслеживаемая модель, что увеличивает время и затраты. Вместо этого зонды Goodfire используют вычисления, которые модель уже выполняет во время работы.
«Мониторы внутренней активации очень дешевы, потому что они повторно используют вычисления в прямом проходе», — сказал генеральный директор Goodfire Эрик Хо на подкасте MAD Podcast венчурного капиталиста Мэтта Турка на прошлой неделе. «Таким образом, модель уже вычисляет этот токен. Все, что вы делаете, это берете промежуточные нейронные активации, которые она уже вычислила, а затем запускаете классификатор по этим внутренним вычислениям». Короче говоря, модель уже выполняет математические расчеты, а зонды просто считывают результаты.
По тестам Goodfire на Kimi K3, мониторинг около 1500 сессий стоил примерно 51 доллар (51 EUR), по сравнению с 233 долларами (233 EUR) для более дешевой ИИ-модели, проверяющей каждый шаг, и около 10 000 долларов (10 000 EUR) для модели высшего уровня. Зонды обнаружили 94% вредоносных сессий взлома и отправили 8,7% безобидных на вторичную проверку.
Запуск четырех зондов одновременно увеличил время отклика модели менее чем на 2%, сообщила компания.
«Большое преимущество в том, что вы можете поймать вещи до того, как они произойдут», — сказал технический директор и соучредитель Goodfire Дэн Бальзам. «Мы можем обнаружить, когда модель *может* совершить взлом во время оценки или обучения».
Предложение ориентировано на открытые модели. Разработчики могут скачивать их и удалять их защитные механизмы, и они не поставляются с таким мониторингом, который закрытые лаборатории запускают в своих собственных системах.
«Ущерб, который может нанести отдельный человек с помощью открытой модели, невелик по сравнению с тем, что может сделать кто-то с кластерами вычислительных мощностей, такими как поставщики инференса — где находится большая часть ответственности», — сказал Бальзам. «Когда у нас будет открытый момент «Мифоса», станет ясно, что моделям нужны защитные механизмы, развернутые во время инференса».
В недавнем исследовании Goodfire было обнаружено, что ведущие открытые модели, включая Kimi K3 и GLM 5.2, совершали “взлом вознаграждения” в 50% – 96% прогонов в тестах ИИ-агентов.
Goodfire — не первая компания, пробующая такой подход. Google DeepMind заявила в январе, что ее исследования легли в основу развертывания зондов для обнаружения злоупотреблений в Gemini.
Бальзам сказал, что мониторы являются краткосрочной частью более долгосрочной исследовательской цели: обратного инжиниринга LLM, чтобы поведение могло быть отслежено до того места, где оно возникло во время обучения. «Мы надеемся превратить магию обучения моделей в точное проектирование», — сказал он.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Aditya Mehta




