Компания арендует четыре Nvidia H200 для проверки заявления DeepSeek об «экономии в 80 раз»

Deepseek Claude Ai Gpu Api токены tomshardware.com

Консультант по колл-центрам арендовал четыре Nvidia H200 для DeepSeek V4.1 Flash и обнаружил, что API DeepSeek дешевле. Узнайте, почему аренда GPU не всегда выгодна.

Компания The Call Center Doctors, специализирующаяся на консалтинге колл-центров и создании для них операционных площадок, 27 сентября арендовала четыре сервера H200 для обслуживания модели DeepSeek V4.1 Flash, которая должна была заменить Opus 5.5 в работе с агентами Claude Code. Об этом говорится в отчете компании о тестировании. Отчет предназначен для тех, кто слышал, что DeepSeek «в 80 раз дешевле» Claude. При использовании реального рабочего кода производительность всей арендованной системы составила около 213 токенов в секунду при стоимости 440,88 доллара в день по запросу. Для сравнения, выполнение той же задачи через API DeepSeek обошлось бы в 184–223 доллара в день. В итоге колл-центр вернулся к Opus 5.5, поскольку это оказалось дешевле, чем аренда сервера по запросу.
API DeepSeek стоит 0,15 доллара за 1 миллион новых входных токенов вне пиковых часов, 0,003 доллара за кэшированные входные токены и 0,60 доллара за 1 миллион выходных токенов. В пиковые часы стоимость удваивается. Для сравнения, Claude Opus 5.5 от Anthropic стоит 4 доллара за 1 миллион входных токенов и 20 долларов за 1 миллион выходных токенов, а чтение из кэша — 0,20 доллара. Консультант использовал его по подписке, а не через API.
Производительность сервера была достаточной для выполнения одного типа задач за минуту в ходе тестов при полной нагрузке. Однако, согласно журналам консультанта, кодовые агенты в основном работают, повторно отправляя историю переписки, и 96% данных, которые агенты передавали модели, были устаревшим текстом. На каждый новый токен приходится около 1000 старых токенов; повторное чтение дешево, но настолько многочисленно, что сервер был занят им, оставляя мало времени для генерации новых токенов.
Стабильная работа модели потребовала пяти попыток загрузки, каждая из которых занимала от 10 до 15 минут. Сервер оплачивается независимо от того, работает он или нет, что неоптимально. По нашим расчетам, стандартный месячный срок работы по запросу (18,37 доллара в час) обойдется примерно в 13 200 долларов. Это более чем вдвое превышает счет за сентябрь, выставленный Claude. Кроме того, по расчетам консультанта, один сервер может обрабатывать около 20 миллиардов токенов в день, большая часть из которых — повторное чтение, тогда как в самый загруженный день агенты консультанта использовали 51 миллиард токенов.
Тестирование было нацелено на тех, кто слышал, что DeepSeek «в 80 раз дешевле» Claude. Один сервер, работавший с 1 по 27 сентября, выполнил 2,03 миллиона вызовов модели, обработал 388,5 миллиарда токенов (374,2 миллиарда из них были кэшированы) и сгенерировал 393 миллиона токенов, внеся 5 610 изменений. Подписки Claude Code от консультанта в сентябре обошлись примерно в 5 500 долларов. Те же 27 дней обработки токенов через API DeepSeek стоили бы от 3 500 до 7 000 долларов, в зависимости от пиковых тарифов, со средней оценкой около 4 200 долларов при равномерном распределении нагрузки в течение недели.
По сравнению со списочными ценами Claude Opus 5.5, обработка того же объема токенов обошлась бы примерно в 140 000 долларов, что более чем в 25 раз превышает стоимость подписки. Именно в этой фиксированной скидке кроется причина заявления о 80-кратной экономии. Консультант также оценил стоимость каждого измененного блока кода: около 1 доллара на Claude и около 0,63 доллара через API DeepSeek, если бы DeepSeek выполнил ту же работу с теми же токенами. Оценка в 1,15–4,90 доллара для DeepSeek основана на предположениях, что модели потребуется больше токенов, она будет менее успешной и потребует проверки работы со стороны Claude.
DeepSeek так и не приступил к написанию реального кода в ходе тестирования. Рецензенты консультанта постоянно находили способы, позволяющие коду агента выйти из песочницы, например, через файл конфигурации в общей временной папке, который мог бы позволить запустить код агента с правами администратора. Это означало, что агенты, пишущие код, должны были оставаться в автономном режиме. Вместо этого DeepSeek работал только как 48–64 агента-рецензента в режиме только для чтения, просматривая 2 377 папок и составляя 32 отчет об ошибках. Сервер, арендованный по спотовой ставке 9,19 доллара в час, был возвращен поставщику в течение нескольких минут после окончания последнего теста.
Основываясь на поколении V4, где Pro превзошел Flash, можно ожидать лучшей производительности от семейства моделей с DeepSeek V4.1-Pro, точная дата выпуска которого пока не определена. Это может изменить расчеты в будущем, но на данный момент существуют лучшие способы потратить средства на токены, чем аренда GPU для запуска открытой модели.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: