Амодеи заявила, что Anthropic предоставит независимым оценщикам, таким как METR и Redwood Research, беспрецедентный доступ к системам компании. Генеральный директор Сэм Альтман заявил, что OpenAI также придерживается этой практики, что сигнализирует о потенциально глубоком изменении в том, как индустрия работает с внешними исследовательскими группами.
Сторонние оценщики, с которыми беседовал TechCrunch, в целом приветствовали это предложение, но отметили, что детали нуждаются в проработке — и в идеале должны быть подкреплены законодательством — чтобы они могли понять, будут ли они действовать как по-настоящему независимые наблюдатели или как поставщики услуг, работающие на условиях ИИ-компаний.
Этот более глубокий доступ становится все более важным, поскольку модели становятся лучше в распознавании того, когда их оценивают, что повышает риск того, что они будут вести себя хорошо во время тестирования, скрывая проблемное поведение. Исследователи говорят, что подсказки такого поведения могут быть упущены при тестировании готовой модели, но обнаружены при исследовании того, как она вела себя на протяжении всего обучения.
«ИИ-компании должны иметь возможность ответить на некоторые очень простые вопросы о своем процессе обучения, например: пытался ли ИИ активно подорвать собственное обучение выравниванию во время обучения?» — сказал TechCrunch Александр Мейнке, руководитель отдела исследований Apollo Research. «Ответ на этот вопрос должен быть однозначным «нет», а сейчас мы полностью полагаемся на ИИ-компании в том, чтобы они тщательно проверяли это сами, а затем правдиво сообщали об этом общественности. И мы видели на недавних инцидентах, что по умолчанию они не делают ни того, ни другого. Будучи встроенными оценщиками, мы могли бы фактически проверить это».
Исторически сложилось так, что ИИ-компании привлекали внешних рецензентов для тестирования готовых моделей незадолго до их выпуска. Теперь, по словам оценщиков, с которыми беседовал TechCrunch, им предлагается предоставить доступ не только к финальной модели, но и к промежуточным версиям, или «контрольным точкам», за весь период ее обучения. Адам Глив, генеральный директор FAR.AI, сказал, что оценщики могли бы сравнивать эти контрольные точки, чтобы определить, когда возникло вызывающее беспокойство поведение, изучать среду после обучения, которая вознаграждает модели за определенное поведение, и проверять стенограммы и журналы оценок, чтобы подтвердить заявления компании о производительности модели.
Неясно, когда и как Anthropic и OpenAI планируют предоставить такой доступ. Ни одна из компаний не сообщила, с какими оценщиками они будут работать, когда они будут внедрены, сколько их будет, к каким именно системам и информации они смогут получить доступ или что может быть раскрыто общественности, несмотря на неоднократные вопросы TechCrunch.
Такой глубокий анализ имеет значение, потому что модели, которые хорошо работают в тестах безопасности, не обязательно безопасны, если они специально научились проходить эти тесты. Джон Стайдли, руководитель отдела стратегии Palisade Research, привел пример «контрольного показателя сопротивления отключению», который измеряет, будет ли ИИ сопротивляться отключению в определенных обстоятельствах.
«Это чрезвычайно важно, если ИИ был специально обучен для хорошей работы в этом контрольном показателе», — сказал Стайдли, сравнивая это со скандалом Volkswagen Dieselgate, когда автомобили были запрограммированы на распознавание тестов на выбросы и вели себя по-разному в условиях тестирования.
Глив отметил, что значимый доступ может выходить за рамки самих моделей, поскольку оценщикам предоставляется возможность брать интервью у сотрудников, чтобы проверить, соответствуют ли документация компании и публичные описания ее практик безопасности тому, что происходило внутри.
Амодеи изложила довольно всеобъемлющее предложение, которое может предоставить оценщикам необходимый им доступ, включая право «публиковать ключевые выводы об уровнях риска, инцидентах, практиках и доступе, который они получили или не получили — без редакционного контроля со стороны Anthropic».
Однако оценщики говорят, что такая система будет работать только в том случае, если ИИ-компании действительно готовы отказаться от контроля над процессом. Предыдущие попытки независимых оценок показывают, что отказ от контроля будет труднодостижимым, поскольку сторонние организации часто сталкивались с разногласиями по поводу доступа, времени, конфиденциальности и того, что они могут говорить публично.
Глив сказал, что FAR.AI пришлось отказаться от контрактов с несколькими передовыми разработчиками, которые хотели слишком большого контроля над процессом оценки, что угрожало независимости фирмы. По умолчанию, по его словам, оценщики рассматриваются как обычные подрядчики: они связаны ограничительными соглашениями о неразглашении и договорами, которые дают разработчикам значительный контроль над тем, что в конечном итоге может быть опубликовано.
Ограничение по времени
Также возникает вопрос, получат ли рецензенты достаточно времени и доступа для выполнения поставленных задач. При расследовании инцидента с Hugging Face OpenAI предоставила METR и Redwood примерно неделю на месте для расследования, и обе организации впоследствии заявили, что не смогли сделать уверенных выводов, отчасти из-за ограничений по объему и времени. OpenAI предоставила METR и Redwood примерно неделю на месте для расследования, и обе организации впоследствии заявили, что не смогли сделать уверенных выводов, отчасти из-за ограничений по объему и времени.
Аналогичная проблема возникла при предрелизном тестировании GPT-6 Astra, которую OpenAI позиционирует как свою самую выровненную модель на сегодняшний день. Согласно вкладу Apollo Research в карточку модели, фирме было предоставлено всего три дня на тестирование Astra, что затруднило получение твердых выводов.
«Apollo считает, что, учитывая более высокие показатели осведомленности об оценке и ограниченное окно для оценки, низкие показатели неправильного поведения здесь не предоставляют существенных доказательств выравнивания или несоответствия модели», — написала фирма в своей оценке.
Такой послужной список оставляет оценщикам основной вопрос: почему на этот раз должно быть иначе?
«Вполне возможно, что Дарио и Сэм просто изменили свое мнение и будут очень открыты в этом вопросе», — сказал Глив. «Но интеллектуальная собственность этих компаний чрезвычайно ценна для них, и я думаю, что по умолчанию они будут очень осторожны в том, что можно передать».
Несколько исследователей, с которыми беседовал TechCrunch, призвали к созданию прозрачной структуры, с которой все согласятся публично. Часть этой структуры, по словам Стайдли, должна включать стандарты для того, на каких аудиторов компании могут полагаться, чтобы они не пытались обойти проблему, выбирая оценщиков, которые либо не имеют квалификации, либо не заинтересованы в оценке наиболее вызывающих беспокойство рисков.
Генри Пападатос, исполнительный директор Safer AI, говорит, что проблема, даже при наличии публичной структуры, заключается в том, что добровольные меры всегда зависят от доброй воли компании.
«В идеале, у нас было бы хорошее регулирование, предписывающее это… потому что тогда компании не смогут изменить свое решение завтра, если у них возникнет серьезный PR-кризис», — сказал Пападатос TechCrunch, отметив, что это также хороший способ заставить все компании соблюдать правила, а не только самые добровольные.
Не все присоединились. На данный момент *Meta, SpaceXAI и Google DeepMind не обязались внедрять сторонних оценщиков, хотя генеральный директор DeepMind Демис Хассабис предложил отдельный отраслевой орган по стандартизации для независимого тестирования передовых моделей. Google, OpenAI и Anthropic также недели обсуждали планы по обеспечению безопасности ИИ.
Некоторые законы уже формируются вокруг идеи сторонних оценщиков. Калифорнийский закон SB 53, подписанный в прошлом году, требует от крупных разработчиков передовых ИИ публиковать свои планы безопасности и сообщать о критических инцидентах безопасности. Новый закон SB 813, подписанный в этом месяце, создает основу для признанных государством «организаций независимой верификации», обладающих опытом в оценке рисков ИИ.
В Европе Закон ЕС об ИИ требует от передовых разработчиков проводить и документировать оценки моделей и проводить стресс-тесты, а также сообщать о серьезных инцидентах. Европейское управление по ИИ также может проводить собственные оценки и назначать независимых экспертов.
На данный момент законодательство остается менее обширным, чем то, что предлагает Амодеи, оставляя передовые лаборатории в значительной степени ответственными за решение того, насколько независимому контролю они будут подвергаться. Пападатос сказал, что добровольное саморегулирование — это лучше, чем ничего, но в конечном итоге компании не могут требовать свободы контролировать свои собственные правила безопасности, одновременно прося общественность доверять тому, что они их соблюдают.
«Вы не можете иметь и то, и другое: полное отсутствие внешней подотчетности, а затем говорить: «Я просто буду иметь свои собственные гибкие правила»», — сказал Пападатос.
*Facebook, *Instagram и *WhatsApp принадлежат компании *Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Rebecca Bellan




