К сожалению, компании также нашли способ обойти устаревшие системы тестирования — многие из которых устарели и не были созданы для измерения возможностей современных моделей.
Vals, стартап, основанный в 2024 году, заявляет, что его миссия — исправить эту несовершенную систему. Менее чем за два года компания зарекомендовала себя как заметный игрок в технологической индустрии, а в прошлом году ей удалось привлечь посевной раунд под руководством 8VC и Bloomberg Beta. Затем, в прошлом месяце, после периода быстрого роста, компания привлекла 40 миллионов долларов в рамках раунда А под руководством Andreessen Horowitz.
Райан Кришнан, 25-летний соучредитель компании, ранее проходил стажировку в Palantir, а будучи студентом Стэнфорда, работал в Microsoft и в известной лаборатории искусственного интеллекта университета. Кришнан говорит, что Vals родился из его собственных наблюдений о том, как тестирование отстает от достижений отрасли, которую оно призвано измерять.
«Мы видели, как на рынок быстро выходило множество новых, очень способных моделей, а академические тесты не успевали за этим передовым развитием», — делится Кришнан. Поскольку ИИ интегрируется во все сферы общества, тесты должны действительно существовать для проверки того, что модели могут делать то, что компании рекламируют, сказал Кришнан.
На прошлой неделе молодой основатель показал мне двухэтажный офис своей компании на Фолсом-стрит в Сан-Франциско — старое кирпичное здание, которое столетие назад служило местом расположения крупной пивоварни. Вместо промышленного производства пива в историческом здании сейчас размещаются различные стартапы, стремящиеся продвигать будущее технологической индустрии.
«Исторически, я думаю, оценка проводилась очень абстрактно, — говорит мне Кришнан. — Например, знают ли модели достаточно информации, чтобы сдать тест типа экзамена на адвоката?»
Здесь Vals стремится отличаться. В то время как многие системы тестирования предлагают общедоступные тесты (что может позволить компании обучать свою модель на этих тестах, тем самым, возможно, обманывая на экзамене), Vals не раскрывает свои конкретные тестовые материалы. Вместо измерения общих знаний модели ИИ, Vals также оценивает модели по их способности выполнять сложные задачи, связанные с конкретными отраслями, такими как юриспруденция, финансы и программирование.
«Мы на самом деле смотрим на реальное воздействие моделей, — сказал Кришнан. — Могут ли они выполнять работу, которая производит продукт такого же качества, как и человек, в каждой области?»
Идея состоит в том, чтобы проверять не только положительные, но и отрицательные результаты, говорит он. Надежда состоит в том, чтобы проанализировать, «каковы были бы негативные последствия, если бы эти модели вышли из-под контроля в мире».
Возможности, которые измеряет Vals, растут. Помимо более традиционных отраслей, стартап продолжает осваивать более уникальные области. «У нас есть тест на рекурсивное самосовершенствование. Мы работаем над вопросами психического здоровья, кибербезопасности, биобезопасности и даже над применением Женевской конвенции моделями для понимания того, как ее применять», — делится Кришнан.
Компании платят Vals за тестирование своих моделей, что может показаться странной концепцией. Зачем компании платить за то, чтобы узнать, что ее модель работает плохо? Но эффективное измерение помогает компаниям устранять неполадки и совершенствоваться со временем. Кришнан сравнивает их модель дохода с тем, как студент может заплатить College Board за сдачу SAT.
В свою очередь, эти оценки становятся ключевыми факторами принятия решений для компаний, стремящихся приобрести новые модели ИИ.
Стартап недавно сообщил, что его выручка в настоящее время в восемь раз превышает прошлогоднюю. Его штат также растет. Vals, который начал год всего с восемью сотрудниками, уже утроился до команды из 25 человек. Кришнан сказал, что по мере роста стартапа планируется переезд в значительно больший офис, а также найм еще 10-15 человек. Компания также недавно запустила программу, направленную на предоставление оценок моделей федеральным агентствам.
Кришнан рассматривает систему тестирования своей компании как будущее того, как ИИ-компании думают о развитии своего бизнеса и установлении общественного доверия.
«ИИ-компании начинают выходить на биржу. SpaceX стала публичной. Anthropic планируется к концу этого года. Я подозреваю, что OpenAI скоро станет публичной. Я думаю, что по мере того, как модели ИИ становятся основной частью экономики и получают более широкое распространение, типы тестов и оценок, которые мы проводим, будут стимулировать их использование и станут центральной частью того, как эти компании подают публичные отчеты или говорят о будущих инвестициях, которые они собираются сделать в ИИ», — сказал он.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Lucas Ropek




