Coinbase сообщила 7 октября, что более новые версии трех основных семейств моделей ИИ обнаружили меньше мошеннических платежей и меньшую долю мошеннической стоимости в историческом тестировании проверки платежей для своего сервиса Onramp, несмотря на неизменную политику принятия решений. Результаты ставят под сомнение предположение, что обновление модели улучшает существующий инструмент проверки платежей.
В оценке компании были воспроизведены 16 140 транзакций от 7 293 пользователей, включая 813 подтвержденных мошеннических транзакций. Выборка охватывала девять недель до развертывания ее риск-агента, сохраняя все завершенные случаи мошенничества при одновременной выборке легитимного трафика.
Каждый кандидат анализировал недавнее поведение транзакций в соответствии с фиксированными инструкциями и той же политикой преобразования классификаций рисков в решения. Это изолировало поведение модели принятия решений в данной конфигурации, а не сравнивало переработанные системы проверки.
Результаты фиксированного исторического воспроизведения
Coinbase сравнила Opus 4.5 с Opus 5, Sonnet 4.6 с Sonnet 5 и GPT-5.4 с GPT-5.6 (sol). Каждая новая версия имела более низкую полноту (recall), более низкий комбинированный показатель полноты и точности (F1) и более низкую взвешенную по стоимости полноту. Полнота измеряет долю случаев мошенничества, которые обнаруживает модель; взвешенная по стоимости полнота измеряет, какую часть общей стоимости мошенничества она обнаруживает.
Полнота Sonnet снизилась на 22,2 процентных пункта, а взвешенная по стоимости полнота — на 22,9 пункта. Полнота Opus снизилась на 0,8 пункта. Обе новые модели также имели более низкую точность (precision), что означает, что меньшая доля транзакций, классифицированных ими как мошеннические, действительно являлась таковой.
GPT показал, почему один улучшающийся показатель может вводить в заблуждение. Его точность повысилась на 11,5 процентных пункта, но полнота снизилась на 20,7 пункта, а взвешенная по стоимости полнота — на 21,8 пункта. Его флаги мошенничества были более точными, в то время как больше случаев мошенничества и стоимости ускользнули от обнаружения при воспроизведении.

Воспроизведение не устанавливает убытки клиентов от развертывания этих версий. Coinbase также заявила, что может выявить регрессии без установления их причины.
В своем более раннем онлайн-эксперименте Coinbase сравнила добавление выборочного обзора LLM с существующими моделями и правилами. Этот поток с использованием агента зафиксировал на 30% меньше мошеннических транзакций и на 22% меньше мошеннической стоимости; он не сравнивал новые версии моделей.
В своих ограничениях исследователи SR-Fraud заявляют, что проприетарный набор данных не может быть опубликован, что ограничивает независимое воспроизведение и обобщение. Их связанное исследование мошенничества с платежами впервые появилось 23 сентября и было пересмотрено 30 сентября, до октябрьских блогов.
Отдельный случай для пользовательской модели
В своем сообщении от 8 октября Coinbase сообщила, что дообученная модель Qwen3.5-9B превзошла Opus 4.5 по четырем метрикам обнаружения мошенничества. F1 улучшился на 9,6 процентных пункта, а взвешенная по стоимости полнота выросла на 35,4 пункта. Компания специализировала ее, используя исторические результаты мошенничества и детерминированные вознаграждения, сбалансировав мошеннические и легитимные примеры.
Отдельно производственные измерения показали медианную задержку запросов LLM от начала до конца в 0,683 секунды по сравнению с 1,515 секунды для Opus 4.5, что составляет относительное снижение на 55%. Более быстрая инференция и более сильное обнаружение на бенчмарках были получены в результате различных оценок.
Для поставщиков платежей вопрос обновления заключается в том, улучшает ли кандидат охват мошенничества в их фактической конфигурации принятия решений. Coinbase рекомендует сначала протестировать эту конфигурацию, а затем отдельно оценить измененные запросы или пороги, учитывая задержку, надежность и стоимость наряду с качеством обнаружения.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Liam 'Akiba' Wright




