iPhone 17 Pro Max и MacBook Pro M4 Pro с кастомным ПО ускорили работу ИИ-модели на 27B до 44%

ии Mac Iphone ускорение по wccftech.com

Ускорьте ИИ-модели на Mac с помощью iPhone 17 Pro Max! Получите до 44 % прироста скорости предварительного заполнения, распределяя нагрузку между устройствами. Узнайте, как обойти ограничения памяти и контекста.

Модель Qwen3.8-27B является мощным ИИ-инструментом, если у вас достаточно VRAM и системной ОЗУ. На MacBook Pro с M4 Pro 24 ГБ унифицированной памяти могут ограничивать скорость предварительного заполнения при работе с ИИ-моделью. К счастью, один пользователь подключил iPhone 17 Pro Max к портативному Mac через порт USB-C и с помощью пользовательского ПО смог добиться ускорения предварительного заполнения той же ИИ-модели до 44 %.

Даже при увеличении памяти до 20 480 МБ MacBook Pro с M4 Pro ограничен окном контекста 64K, что делает iPhone 17 Pro Max необходимостью

Чтобы обойти ограничение Mac в 24 ГБ унифицированной памяти, пользователь Reddit «u/StayLameBro» распределяет нагрузку между машиной и iPhone 17 Pro Max двумя способами. Для ускорения предварительного заполнения MacBook Pro обрабатывает слои с 1 по 40 каждого пакета из 256 токенов и передает активации на телефон. Что касается iPhone, он обрабатывает слои с 41 по 64 на GPU своего A19 Pro, в то время как Mac начинает следующий пакет. Графические процессоры обеспечивают примерно в 2,4 раза более высокую производительность телефона по сравнению с работой без них.

Neural Engine также не простаивает: каждые 16K старого контекста компилируются в модель Neural Engine, что сокращает время записи на токен при контексте 140k с 279 мс до 176 мс по сравнению только с GPU A19 Pro. Что касается производительности при предварительном заполнении файла объемом 2000 токенов в сохраненную сессию: при контексте 8K Mac самостоятельно обрабатывал 132 токена/сек по сравнению со 177 токенами/сек с iPhone, что составляет прирост на 35 %. При 16K этот показатель вырос со 109 токенов/сек до 157 токенов/сек, что привело к впечатляющему увеличению на 44 %.

При окне контекста 32K скорость предварительного заполнения увеличилась со 101 токена/сек до 130 токенов/сек, обеспечив улучшение на 29 %. Подключив iPhone 17 Pro Max к MacBook Pro с M4 Pro, можно было бы ожидать получения невероятной скорости предварительного заполнения с помощью пользовательского ПО. К сожалению, это сценарий «слишком хорошо, чтобы быть правдой», поскольку пользователь Reddit указывает на несколько ограничений. Например, телефон не ускоряет генерацию текста ниже 64K, что остается задачей Mac.

Также стоит отметить, что A20 Pro, питающий iPhone 18 Pro и iPhone 18 Pro Max, может предложить больший запас производительности не только благодаря превосходной производительности, но и благодаря своему двухъядерному Neural Engine с 16 ядрами, который, как говорят, обеспечивает более высокую пропускную способность, чем 7-ядерный GPU SoC, для задач, специально предназначенных для NPU. Пользовательское ПО в настоящее время имеет открытый исходный код и может быть загружено с GitHub под названием «backburner».

Даже в качестве эксперимента уже видно, что увеличенная скорость предварительного заполнения дает существенный прирост. Естественно, его возможности могут быть исследованы дальше, хотя это также может означать, что такие устройства, как iPhone, могут вступить в ту же эру дефицита, что и DRAM и SSD.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: