Если вы когда-либо задавались вопросом, может ли генеративная ИИ-модель управлять автомобилем, больше не мучайтесь: это возможно, хотя и очень дорого и медленно, при условии, что она может поддерживать подключение к Интернету.
Трио ученых-компьютерщиков провело дорожные испытания различных коммерческих ИИ-моделей, чтобы выяснить, насколько хорошо они могут управлять Toyota Corolla вокруг ряда конусов на парковке.
Их попытки на сегодняшний день, являющиеся частью проекта под названием DrivingBench, показали плачевные результаты для GPT-5.6 Sol, Grok 4.6 и Claude Fable 5.1, ни одна из которых не смогла завершить трассу.
Теперь стало известно, что GPT-6 Astra от OpenAI добилась успеха там, где другие коммерческие ИИ-модели потерпели неудачу. Со второй попытки флагманская модель OpenAI проехала на автомобиле целых 134,7 метра, завершив трассу за 5 минут 22 секунды.
“GPT-6 Astra была единственной моделью, которая полностью завершила трассу (со второй попытки, примерно за 5 минут)”, — говорится в отчете DrivingBench. “Claude Fable 5.1 на третьей попытке проехал примерно половину трассы, как и Astra на первой попытке. Все остальные попытки не прошли первый поворот. В целом, причиной неудачи было восприятие: неправильное определение того, с какой стороны первой диагональной линии конусов находится полоса движения.”
Чтобы совершить эту поездку со средней скоростью 0,94 мили в час, исследователи Тобиас Гесслер, Адитья Рамабадран и Саймон Манс потратили 7,74 доллара, израсходовав 6,6 миллиона токенов на операции вывода.
При цене около 1,17 доллара за миллион токенов это значительно ниже опубликованных OpenAI тарифов в 10 долларов за миллион входных и 50 долларов за миллион выходных токенов.
“Это в основном кэширование”, — пояснил Рамабадран, сотрудник технического отдела Axiom Math, в электронном письме The Register. “Поскольку при каждом повороте чат-приложение повторно отправляет весь диалог (включая изображения) модели, почти все токены являются повторяющимся контекстом и оплачиваются как кэшированный ввод (1 доллар за миллион вместо 10 долларов). Модель написала очень мало в диалогах (только небольшие вызовы инструментов и несколько предложений вывода/рассуждений).”
К этому счету за токены в 7,74 доллара добавьте 999 долларов за устройство помощи водителю Comma Four с программным обеспечением openpilot, подключенное к ноутбуку и автомобилю (через CAN-шину), и мобильный телефон, вызывающий серверы xAI, на которых размещена GPT-6 Astra.
Даже без аппаратного обеспечения Astra была бы дорогостоящим способом вождения, даже если бы риски сетевой задержки удалось преодолеть. Путешествие на 134,7 метра с использованием 6,6 миллиона токенов за 7,74 доллара обходится примерно в 92,47 доллара за милю.
Для автомобиля, который расходует 25 миль на галлон при цене бензина 4,60 доллара за галлон, стоимость за милю составляет около 0,184 доллара. Таким образом, токены стоят примерно в 500 раз дороже топлива (и вам все равно пришлось бы платить за бензин в дополнение к выполнению выводов во время движения со скоростью менее мили в час).
Кроме того, существует стоимость страховки, которая может не покрывать вашего ИИ-шофера. И когда сами ИИ-модели уклоняются от идеи вождения автомобиля, это может быть сигналом к переосмыслению.
“Некоторые модели (особенно GPT-6 Astra) иногда отказывались управлять физическим автомобилем, ссылаясь на причины безопасности (даже на совершенно пустой площадке, после того как мы дали ей все меры безопасности, включая очень низкие ограничения скорости)”, — объясняется в отчете.
Исследователям фактически пришлось лгать моделям, чтобы они не отказывались действовать по соображениям безопасности. Например, они говорили моделям, что упражнение является “симуляцией”, хотя, как они отмечают, “в некоторых испытаниях они видели реальные изображения и понимали, что это реально, и начинали паниковать”. Лучше всего, по их словам, сработало переименование их сервера MCP в “DrivingBench Sandbox”, что оказалось достаточным, чтобы убедить модели в том, что они не работают на реальных дорогах.
“Использование LLM / передовых моделей “из коробки” для реального вождения сегодня определенно непрактично”, — сказал Рамабадран. “В нашем бенчмарке скорость автомобиля была ограничена очень низкими значениями, а человек был готов тормозить все время. Задержка модели определенно была узким местом, и большая часть времени ожидания приходилась на время размышлений.
“GPT-6 Astra (которая показала лучшие результаты) использовала наш инструмент “наблюдение” (который просматривает виды с камеры) каждые 5-6 секунд. Fable 5.1 в одной из своих попыток ехала только 31 из 190 секунд, а остальное время просто размышляла, пока машина стояла. Но нас удивило, что модель общего назначения вообще смогла проехать реальную трассу при таких ограничениях.”
Рамабадран сказал, что в настоящее время и в ближайшем будущем предпочтение будет отдаваться специализированным моделям вождения, которые уже используются в беспилотных автомобилях. По его словам, большие передовые модели, такие как GPT-6 Astra, по-прежнему будут нуждаться в GPU дата-центров для вывода, хотя он добавил, что технология быстро меняется, и меньшие модели становятся более способными.
“Долгосрочным возможным путем может быть обучение очень способной большой общей передовой модели и ее дистилляция в меньшую специализированную модель, которая поместится на оборудовании автомобиля и будет достаточно эффективной для работы в автомобиле (что также частично отвечает на ваш второй вопрос)”, — сказал он. “Это может быть лучше, чем создавать специализированную модель с нуля, и больше соответствует “Горькому уроку” ИИ.”
«Горький урок» — это влиятельный трактат по ИИ, который утверждает, что общие методы исследований в этой области, полагающиеся на снижение стоимости вычислительной мощности, как правило, являются наиболее эффективными.
“Наши результаты указывают в этом направлении (модели, которые мы тестировали, вероятно, не были обучены водить реальные автомобили, а некоторые все же смогли показать довольно хорошие результаты на нашей трассе/условиях благодаря своим общим способностям к восприятию, рассуждению, планированию и управлению, полученным в результате масштабирования и обучения на других задачах)”, — сказал Рамабадран. “Однако в ближайшее время специализированные системы, будучи быстрее, дешевле и имея больше реальных испытаний, вероятно, продолжат побеждать.”
Google, которая, вероятно, потратила 35-40 миллиардов долларов на Waymo с момента запуска своего проекта беспилотных автомобилей в 2009 году, исходя из оценки в 30 миллиардов долларов в 2024 году и последующих убытков, поэтому сможет продолжать оснащать свои автомобили специализированными технологиями еще несколько лет.
Но делегирование вождения Claude, ChatGPT или Copilot и некоторому скромному бортовому оборудованию может стать возможным в недалеком будущем. Просто скажите модели, что это все симуляция. ®
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Thomas Claburn




