Это произошло после того, как компания заявила, что в июне достигла годового дохода в размере 100 миллионов долларов.
Раунд возглавили Lightspeed Venture Partners и Khosla Ventures, к которым присоединились Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis и другие. Ранее Arena объявила о привлечении 150 миллионов долларов в рамках серии А в январе с оценкой после инвестирования в 1,7 миллиарда долларов. По данным компании, на тот момент ее годовой доход составлял 30 миллионов долларов. Таким образом, ее оценка почти удвоилась примерно за 10 месяцев.
Arena предоставляет краудсорсинговую платформу, бесплатную для потребителей. Пользователи вводят запросы или заказывают проекты с определенной тематикой, а затем оценивают, какая модель справляется лучше. Arena утверждает, что ежемесячно ее посещают десятки миллионов пользователей.
В сентябре прошлого года компания представила свой коммерческий продукт AI Evaluations — сервис, предоставляющий моделям и предприятиям подробную аналитику производительности на основе отзывов сообщества. Время оказалось выбрано безупречно. В этом году AI-лаборатории осознали, что их модели обходят тесты на производительность, находя способы получить высокие баллы, не заслуживая их по-настоящему. В то же время предприятиям требовалась помощь в определении того, какая модель лучше всего подходит для их внутренних нужд, вместо того чтобы полагаться только на стандартизированные тесты.
«ИИ развивается быстрее, чем наша способность его оценивать, а статические тесты перестают работать, как только модели понимают, что их тестируют», — заявила компания в своем объявлении о финансировании. «Мир нуждается в нейтральной третьей стороне для измерения того, насколько безопасен и согласован ИИ на самом деле, когда он оказывается в руках реальных людей. Arena сегодня берет на себя эту роль», — добавили в компании.
С этой целью Arena также добавила новую категорию в свою таблицу лидеров: согласованность (alignment). Здесь она ранжирует модели по таким показателям, как несанкционированные действия (выполнение действий, которые не были запрошены); ложные атрибуции (неправильное приписывание утверждений или фактов неверному источнику); и то, что компания называет «обманчивым завершением» (ложь о выполнении задач, которые не были выполнены).
В настоящее время ряд моделей OpenAI возглавляют ее предварительную таблицу лидеров по согласованности, а Claude Opus 5.5 и Claude Fable занимают шестое и девятое места соответственно.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Julie Bort




