Китайская компания Dongfang Suanxin (DFSX) стремится доказать, что пропускная способность памяти, а не бесконечная одержимость миниатюризацией техпроцесса, является ключом к достижению значительного эффекта масштаба для AI-нагрузок. Это демонстрируют её чипы DF1000 и грядущие DF2000, которые обычно объединяются в суперузлы TY64, чтобы составить конкуренцию системе NVIDIA GB200 NVL72.
Суперузел TY64 от DFSX, состоящий из чипов DF2000 на 14 нм, обеспечит пропускную способность памяти 960 ТБ/с против всего 576 ТБ/с у систем NVIDIA GB200 NVL72
Для тех, кто не в курсе: чип DFSX DF1000 изготавливается по зрелому 14-нм техпроцессу, но использует новую 3D-архитектуру вычислений с памятью рядом, где память размещается непосредственно поверх вычислительного слоя и соединяется с ним с помощью 3D-гибридного соединения на уровне пластины. Это объединяет медные дорожки двух слоёв, полностью устраняя микроконтакты или провода, и работает как десятки миллионов сверхбыстрых вертикальных лифтов вместо одной горизонтальной магистрали.
Напротив, чип DF2000, который ожидается в четвёртом квартале 2026 года на 14-нм техпроцессе, идёт ещё дальше. Вместо того чтобы размещать только один слой памяти поверх вычислительного слоя, DF2000 объединяет несколько многослойных вычислительно-памятных башен рядом друг с другом на общем основании — метод, который DFSX называет компоновкой 3.5D Infinity Chiplet. По сути, чип заменяет базовые слои хранения данных на специально разработанную 3D-динамическую память с произвольным доступом (3D DRAM), что значительно увеличивает объём временных данных, которые могут храниться непосредственно внутри его структуры.
По сути, DFSX пытается решить постоянную проблему AI-нагрузок, когда GPU большую часть времени простаивают в ожидании данных из слоёв памяти. DFSX утверждает, что главным узким местом здесь является «стена памяти», а не миниатюризация техпроцесса.
И теперь у нас есть цифры, подтверждающие эти заявления. Например, каждый чип DF2000 обеспечивает пропускную способность 15 ТБ/с. При объединении в формат суперузла TY64 общая пропускная способность памяти возрастает до 960 ТБ/с. Для сравнения: система NVIDIA GB200 NVL72 предлагает общую пропускную способность памяти всего 576 ТБ/с!
Разумеется, разница между чипом на 4 нм и чипом на 14 нм становится очевидной при взгляде на их показатели BF16: суперузел TY64 на базе DF2000 обеспечивает 64 PFLOPS вычислений BF16 против 360 PFLOPS у системы GB200 NVL72. Но DFSX делает ставку на свою двукратную пропускную способность памяти, чтобы компенсировать любые недостатки в сырой вычислительной мощности суперузла TY на базе DF2000.
По сути, DFSX считает, что FLOPS — это неправильный показатель для AI-нагрузок, а наиболее важной метрикой является пропускная способность памяти. Обратите внимание: ожидается, что чип DF3000 обеспечит пропускную способность памяти 20 ТБ/с, или 1 280 ТБ/с при размещении в суперузле TY64. Между тем, система NVIDIA Vera Rubin NVL72 предлагает общую пропускную способность памяти 1 580 ТБ/с, что лишь на 23% больше, чем у суперузла TY64 на базе DF3000.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Rohail Saleem




