AMD и Cerebras объединяются для ИИ-инференса с низкой задержкой и высокой пропускной способностью

Amd Cerebras Epyc Wse инференс ии tomshardware.com

Когда AMD Helios встречается с гигантскими пластинами Cerebras, это не встреча Одиссея с лестригонами, а коллаборация для создания дата-центра будущего. Узнайте, как новая платформа объединяет EPYC и WSE для ускорения инференса ИИ в 5 раз.

AMD и Cerebras Systems в четверг объявили о планах по созданию платформы, которая объединит процессоры AMD EPYC в стоечной инфраструктуре Helios с решениями на основе кремниевых пластин Wafer-Scale Engine (WSE) от Cerebras. Вместе новые системы обещают объединить низкую задержку процессоров AMD CPU и ускорителей Instinct GPU с высокой пропускной способностью процессоров Wafer Scale Engine (WSE) от Cerebras.
AMD и Cerebras ожидают, что новая межстоечная платформа — основанная на стойке AMD Helios с процессорами EPYC и ускорителями Instinct серии MI400 — будет отвечать за быструю обработку запросов и работу с большими контекстными окнами, тогда как Cerebras WSE возьмет на себя этап генерации токенов, требующий высокой пропускной способности памяти.
AMD и Cerebras ожидают, что их разобщенная платформа для инференса обеспечит до 5 раз больше токенов в секунду на ватт (Т/с/Вт), распределяя различные части рабочей нагрузки инференса между архитектурами, оптимизированными под них. Таким образом, AMD Helios обеспечивает вычислительную мощность на уровне стоек и обработку больших объемов сложных запросов, а Cerebras WSE управляет чувствительной к задержкам генерацией токенов. Две вычислительные платформы будут работать в рамках единого рабочего процесса инференса, хотя компании не раскрыли дополнительные данные о производительности или способе соединения систем.
Основная идея платформы AMD + Cerebras по сути та же, что и концепция CPX от Nvidia, но AMD и Cerebras назначают специализированное оборудование на противоположный этап инференса.
Разобщенная архитектура Nvidia разделяет инференс на этапы контекста/префилла и генерации/декодирования. Отмененный ускоритель Rubin CPX с памятью GDDR7 был оптимизирован специально для вычислительно насыщенного этапа контекста/префилла, в то время как обычные ускорители Rubin с памятью HBM обрабатывают этап генерации, ограниченный пропускной способностью памяти.
Напротив, платформа AMD и Cerebras следует тому же принципу разобщения, но специализация инвертирована: платформа AMD Helios с ускорителями Instinct обрабатывает этап префилла, обрабатывая запросы и большие контекстные окна, в то время как Cerebras WSE берет на себя этап декодирования и управляет чувствительной к задержкам генерацией токенов.
Cerebras планирует установить системы AMD Helios в своих собственных центрах обработки данных и интегрировать их со своими стойками WSE. Комбинированное предложение станет первоначально доступно через Cerebras Cloud во второй половине 2026 года, согласно заявлению компаний.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: