Изучаем производительность локального ИИ на Apple Silicon с Mac Studio и M4 Max

Mac Studio M4 Max Llm локальный ии пропускная способность Nvidia Gb10 tomshardware.com

Сравните производительность Mac Studio на M4 Max (546 ГБ/с) с платформами Nvidia GB10 и AMD Strix Halo в тестах локального LLM. Узнайте, почему Apple Silicon остается лучшим вариантом для задач ИИ благодаря высокой пропускной способности памяти.

Наши локальные исследования ИИ в 2026 году пока сосредоточены на двух основных платформах: Nvidia GB10, представленной в DGX Spark и Dell Pro Max с GB10, и AMD Ryzen AI Max+ 395, также известном как Strix Halo, представленном в Corsair AI Workstation 300 и Ryzen AI Halo. Мы в целом отдавали предпочтение системам на GB10 для такого рода локальных песочниц разработки ИИ. Их уверенная общая производительность и широкая совместимость с программным обеспечением для ИИ делают их легко любимыми, даже если сырая пропускная способность инференса LLM не так высока.
Но Mac Studio от Apple — еще один привлекательный вариант для пионеров локального ИИ, которым нужны системы с большими пулами единой памяти, мощными GPU и высокой пропускной способностью памяти, чтобы обеспечить более высокую скорость генерации токенов в секунду, чем может обеспечить GB10 или Strix Halo. И пока кто-то не создаст другой SoC с единой памятью и такой же широкой шиной памяти, как у Apple для чипов Max и Ultra, Apple Silicon, по сути, остается единственным игроком на рынке для достижения большей пропускной способности памяти от чипа такой конструкции.
Почему вообще так много внимания уделяется пропускной способности памяти для локальной производительности LLM? Если коротко, фаза декодирования инференса LLM практически всегда последовательна. Каждый выходной токен (начиная с первого, сгенерированного в рамках процесса предварительного заполнения) должен пройти через каждый слой модели, чтобы сгенерировать следующий токен, и поэтому все активные веса модели в слое должны передаваться в GPU из его памяти, пока токен проходит через каждый из них.
Поскольку объем вычислений, требуемый для каждого отдельного токена на каждом слое, невелик, скорость всего процесса декодирования в основном зависит от того, насколько быстро эти веса модели могут быть переданы из памяти GPU. Это делает привлекательными системы с большими пулами памяти (для хранения больших моделей) и высокой пропускной способностью памяти (для передачи этих весов модели в GPU), и Apple Silicon — единственная платформа, которая позволяет иметь обе характеристики по (относительно) разумной цене.
Последнее обновление Mac Studio от Apple состоялось в марте 2025 года и ознаменовало появление двух версий системы. Старшая версия использует SoC M3 Ultra с пропускной способностью памяти 819 ГБ/с как в конфигурации с 28 ядрами CPU и 60 ядрами GPU, так и с 32 ядрами CPU и 80 ядрами GPU.
Версия Mac Studio на M4 Max включает две версии с большими различиями в характеристиках, чем просто количество ядер. Базовая M4 Max включает 14-ядерный CPU (10 производительных ядер и 4 энергоэффективных) с пропускной способностью памяти 410 ГБ/с, и ее можно обновить до 16-ядерного CPU (12 производительных ядер и 4 энергоэффективных) с пропускной способностью памяти 546 ГБ/с.
Мы протестировали обе эти системы при запуске, но Apple любезно предоставила нам еще один M4 Max с 16-ядерным CPU, 40-ядерным GPU и 128 ГБ памяти для тестов, специфичных для LLM. На тот момент цена этой системы составляла около 3 699 долларов, что близко к рекомендованной цене DGX Spark в 3 999 долларов.
Но по мере разворачивания рампокалипсиса Mac Studio стал более ограниченным в вариантах конфигурации и его стало сложнее найти в наличии. Версия M4 Max, которую мы тестировали, теперь доступна максимум с 64 ГБ ОЗУ, а сроки поставки этой системы превышают два месяца. Тем не менее, это самая сопоставимая система от Apple для платформы DGX Spark и GB10 в целом, по крайней мере, когда соотношение цены и производительности еще что-то значило на этом рынке.
Прежде чем перейти к результатам производительности, мы хотели углубиться в детали 40-ядерного GPU M4 Max, но Apple не делится подробной (если вообще делится) архитектурной информацией о своих GPU, включая количество шейдерных ALU, составляющих каждое ядро GPU, поэтому сложно напрямую сравнить M4 Max с GB10 или Radeon 8060S в Ryzen AI Max+ 395.
Radeon 8060S на борту Strix Halo имеет 40 вычислительных блоков RDNA 3.5, каждый с 64 шейдерными ALU, всего 2 560. AMD разгоняет 8060S до высоких 2900 МГц, чтобы достичь примерно 14,8 TFLOPS пиковой векторной производительности FP32.
Между тем, GB10 имеет 48 потоковых мультипроцессоров Blackwell с 128 шейдерными ALU каждый, что дает 6 144 ядер CUDA, и он также работает на относительно высокой частоте 2450 МГц в наших тестах. Он предлагает огромные теоретические 30 TFLOPS векторных вычислений FP32.
Давным-давно, когда Apple впервые представила GPU M1, компания раскрыла, что каждое ядро содержит 128 исполнительных блоков. Предполагая, что та же организация сохранилась в современных GPU Apple, 40-ядерный GPU M4 Max будет иметь 5 120 исполнительных блоков или шейдерных ALU. Это дает представление о масштабе GPU, по крайней мере, хотя, не зная тактовых частот, мы не решаемся строить догадки о пиковых FLOPS или других теоретических показателях производительности.
Apple также предоставляет только сырые цифры пропускной способности памяти для M4 Max, но мы можем сделать приблизительные расчеты, чтобы предположить, что чип, вероятно, использует LPDDR5X-8533 на 512-битной шине, чтобы достичь номинальной пропускной способности памяти 546 ГБ/с, что вдвое шире, чем у GB10 и Strix Halo. Младшая версия M4 Max, вероятно, использует LPDDR5X-6400. В свою очередь, M3 Ultra, вероятно, использует 768-битную шину с LPDDR5X-8533 в обоих вариантах.
Мы подробно описали дизайн Mac Studio в нашем первоначальном обзоре, но стоит быстро пробежаться, чтобы освежить в памяти. Верх и боковые стороны системы в значительной степени лишены особенностей, за исключением вставного черного логотипа Apple сверху. На передней панели расположены два порта USB Type-C на 10 Гбит/с и кардридер SD UHS-II.
Термодизайн Studio использует умную систему забора воздуха, которая втягивает воздух через вентиляционные отверстия вокруг круглого основания системы, прежде чем выдувать его через вентиляционное отверстие сзади корпуса.
Протестированный нами M4 Max Studio имеет целых четыре порта Thunderbolt 5 на задней панели с поддержкой скорости передачи данных до 120 Гбит/с. Хотя мы не тестируем это сегодня, вы можете включить RDMA через Thunderbolt 5 для кластеризации Mac Studios с низкой задержкой с помощью утилит, таких как Exo. Эти порты также поддерживают дисплеи Thunderbolt или DisplayPort 2.1 Alt Mode.
Эта система также имеет два порта USB 3 со скоростью 5 Гбит/с, 10-гигабитный Ethernet, порт HDMI 2.1 и разъем для наушников, так что у нее есть все возможности подключения, которые можно практически пожелать от компактного настольного компьютера в 2026 году.
С этими основами разобрались, давайте перейдем к тестированию.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: