Бесплатное ПО PAIR от NVIDIA превращает домашние сети в кластеры для AI-инференса на базе нескольких GPU

Nvidia Pair Ai Gpu Ollama Lm Studio techtimes.com

Ускорьте ИИ-задачи: PAIR от NVIDIA бесплатно распределяет нагрузку между GPU RTX и Mac M4 в вашей сети. Сократите время выполнения задачи с 18 до 9 минут. Загрузите бета-версию прямо сейчас!

Бесплатное ПО PAIR от NVIDIA превращает домашние сети в кластеры для AI-инференса на базе нескольких GPU
Nvidia.com

NVIDIA выпустила PAIR в бесплатной бета-версии в среду. Это бесплатное программное обеспечение с открытым исходным кодом, которое обнаруживает все совместимые графические процессоры в домашней сети и автоматически распределяет рабочие нагрузки ИИ-агентов между ними, устраняя ситуацию, когда одна машина обрабатывает десятки запросов на вывод, в то время как игровой компьютер, рабочая станция и ноутбук простаивают в трех футах от нее.

Программное обеспечение под названием Personal AI Router (PAIR) было анонсировано на выставке IFA 2026 в Берлине и доступно немедленно в виде бесплатной публичной бета-версии. Оно работает с Ollama и LM Studio — двумя самыми популярными инструментами локального вывода — без необходимости изменять способ подключения агентов или приложений к ним. Домашняя установка, которая уже направляет запросы на локальный конечный узел, может вместо этого направить их на PAIR и немедленно получить доступ ко всем другим подходящим машинам в сети.

Узкое место многоагентных систем, которое призвано устранить PAIR

Проблема, которую решает PAIR, является прямым следствием работы современных фреймворков ИИ-агентов. Ведущий агент, получающий сложную задачу — исследование, проверка кода, сортировка почты — обычно разбивает эту задачу на несколько специализированных субагентов и запускает их одновременно. Каждый субагент требует вызова модели. На одной машине эти вызовы ставятся в очередь друг за другом, загружая графический процессор, в то время как другие машины простаивают.

Это проблема утилизации оборудования, замаскированная под проблему программного обеспечения. Графический процессор машины, выполняющей работу, не обязательно недостаточен — он просто получает больше одновременных запросов, чем может выполнить сразу, в то время как эквивалентное оборудование в другом месте сети простаивает. PAIR устраняет это несоответствие на уровне вывода без необходимости перепроектировать архитектуру агентов.

В демонстрации с пятью субагентами NVIDIA запустила Hermes Desktop — фреймворк агентов с открытым исходным кодом, разработанный Nous Research, который в настоящее время является самым используемым агентом на OpenRouter с более чем 140 000 звезд на GitHub — против имитируемого домашнего почтового ящика, поручив пяти специализированным субагентам проанализировать отдельные части данных и предоставить сводный план действий. На одном ноутбуке RTX Spark, работающем с Qwen 3.6 35B A3B через Ollama, задача заняла в среднем 18 минут. Кластер PAIR из трех устройств — тот же ноутбук RTX Spark, DGX Spark и настольный компьютер RTX 5090 — выполнил идентичную рабочую нагрузку в среднем за 8 минут 48 секунд.

NVIDIA явно указывает, что это неофициальная демонстрация, специфичная для конфигурации, а не общий бенчмарк. Результаты зависят от параллелизма рабочей нагрузки, модели, настроек движка, оборудования, сетевых условий и доступности узлов. Тем не менее, ускорение примерно в два раза при реалистичной параллельной задаче агентов иллюстрирует потенциал, который может раскрыть маршрутизация между несколькими узлами, когда рабочая нагрузка разлагается на действительно независимые вызовы.

Как работает архитектура маршрутизации

Понимание того, что PAIR фактически делает — и не делает — требует отличать его от двух внешне похожих концепций: объединения графических процессоров (GPU pooling) и разделения моделей (model sharding).

PAIR не объединяет VRAM. Он не объединяет память двух или более графических процессоров в один более крупный логический ускоритель. PAIR не разделяет модели. Один запрос на вывод не разбивается между машинами. Каждый запрос, полученный PAIR, назначается ровно одному подходящему узлу и остается на этом узле в течение всего своего жизненного цикла. Прирост производительности достигается за счет одновременной маршрутизации независимых запросов на независимые узлы, а не за счет какого-либо параллелизма между графическими процессорами в рамках одного запроса.

Что PAIR фактически делает, так это перехватывает трафик вывода на уровне прокси и перенаправляет его на основе сигналов о готовности в реальном времени. Вот пошаговый механизм.

После установки PAIR использует Multicast DNS (mDNS) — тот же протокол нулевой конфигурации, который позволяет устройствам находить принтеры и сетевые динамики без ручного ввода IP-адреса — для обнаружения других машин с поддержкой PAIR в локальной сети. Узлы также можно добавлять напрямую по IP-адресу. Затем пользователь утверждает запрос на безопасное сопряжение, создавая доверенный кластер.

Все взаимодействие между узлами блокируется до установления этого сопряжения. После этого PAIR обеспечивает безопасность трафика между узлами с помощью mTLS и автоматически сгенерированных сертификатов, что означает, что данные вывода, передаваемые между машинами в домашней сети, шифруются при передаче, а оба конечных узла аутентифицируются. Посторонний в локальной сети не сможет прочитать маршрутизируемый трафик вывода после первоначального сопряжения.

Затем PAIR берет на себя управление стандартными портами, которые Ollama и LM Studio используют для своих API-сервисов. Когда агент отправляет запрос на завершение к тому, что он считает локальным конечным узлом Ollama, прокси PAIR перехватывает его первым. PAIR считывает требования к движку и модели запроса, передает их своему планировщику, а планировщик выбирает один подходящий узел. Движок вывода этого узла выполняет запрос, и PAIR передает ответ обратно через тот же локальный интерфейс в исходное приложение. С точки зрения агента, он сделал один вызов и получил один ответ — маршрутизация произошла невидимо.

Что делает узел подходящим

Настоящая ценность планировщика заключается в том, что он рассматривает домашнее оборудование как то, чем оно является на самом деле: динамичным, непоследовательным и совместно используемым с другими рабочими нагрузками. Для каждого входящего запроса PAIR оценивает пять сигналов в реальном времени перед выбором узла.

Онлайн и готовность сопряженного узла; включен ли поддерживаемый движок вывода (Ollama или LM Studio) на этом узле; присутствует ли точная запрошенная модель и доступна ли она на этом узле; текущая рабочая нагрузка узла, включая количество активных заданий вывода, которые он уже обрабатывает; и существующая утилизация графического процессора — в частности, запущено ли приложение, интенсивно использующее графику, такое как игра, и потребляет ли оно графический процессор.

Игровой ПК в середине сеанса не подходит для маршрутизации. Ноутбук, который был закрыт, не подходит. Машина, на которой запущен Ollama, но не загружена запрошенная модель, не подходит. PAIR планирует работу с учетом этих меняющихся условий, не требуя, чтобы дом стал выделенной, всегда включенной установкой для вывода.

Действительно ли PAIR вам поможет? Руководство по рабочим нагрузкам

PAIR обеспечивает измеримую выгоду, когда рабочая нагрузка одновременно генерирует несколько независимых запросов на вывод. Многоагентные конвейеры — Hermes, CrewAI, LangGraph и аналогичные фреймворки — являются явными бенефициарами, поскольку они регулярно запускают несколько вызовов субагентов одновременно. Работа двух или более локальных ИИ-приложений параллельно, каждое из которых делает свои собственные вызовы моделей, также приносит пользу.

PAIR приносит мало или никакой пользы в трех конкретных конфигурациях, которые стоит понять перед установкой: задачи, которые являются строго последовательными (один вызов модели, затем следующий, причем каждый зависит от предыдущего); рабочие нагрузки, доминируемые одним длинным вызовом модели (генерация контекста, глубокий анализ документов); и кластеры, где только один узел имеет загруженную запрошенную модель — в этом случае PAIR маршрутизирует на этот единственный подходящий узел, что идентично прямому вызову.

Что PAIR не говорит вам: ограничение по хранилищу

Требование наличия модели в планировщике PAIR создает затраты, которые не освещаются в анонсе. Поскольку PAIR маршрутизирует запрос только на узел, который уже имеет загруженную и доступную точную запрошенную модель, достижение истинной многоузловой маршрутизации для любой данной модели требует одновременного хранения этой модели на нескольких машинах.

Модель Qwen 3.6 35B, работающая в квантовании Q4, требует примерно 20 ГБ хранилища на машину. Трехузловой кластер, маршрутизирующий вызовы Qwen через все три узла, требует 60 ГБ хранилища моделей, распределенного по кластеру. Более крупные модели или кластеры с большим количеством узлов умножают эту цифру. Пользователи, которые хотят реплицировать несколько моделей на нескольких машинах, сталкиваются с нетривиальными обязательствами по хранилищу и пропускной способности, которые демонстрация с ее предварительно сконфигурированным кластерным оборудованием не делает видимыми.

Это не критика дизайна PAIR — маршрутизация полного запроса на один узел вместо попытки разделения модели является правильным архитектурным выбором для домашнего оборудования на данном этапе. Но это реальное ограничение, которое пользователи должны учитывать, прежде чем ожидать, что их вторая и третья машины будут вносить значимый вклад в маршрутизацию вывода.

Чем это отличается от того, что уже существует?

LM Studio и Ollama уже предоставляют вывод на нескольких устройствах в ограниченных формах. LM Link от LM Studio маршрутизирует рабочие нагрузки между устройствами для команд, совместно использующих инфраструктуру моделей. Ollama можно направить на удаленный хост. PAIR добавляет уровень поверх этих движков: планировщик в реальном времени, который одновременно оценивает несколько узлов, выбирает лучший для каждого запроса на основе условий в реальном времени и представляет единый конечный узел вызывающему приложению, независимо от того, где фактически выполняется работа. Агенту не нужно обнаруживать узлы, договариваться с ними или обрабатывать сбои — уровень абстракции PAIR обрабатывает это.

Совместимое оборудование

Бета-версия PAIR поддерживает четыре класса оборудования: графические процессоры NVIDIA GeForce RTX серии 20 и новее, рабочие графические процессоры NVIDIA RTX PRO с архитектурой Turing или новее, настольные ИИ-компьютеры NVIDIA DGX Spark и чипы Apple M4+.

Включение Apple M4+ является примечательным. Кластер PAIR намеренно гетерогенен по дизайну — домашняя сеть, использующая игровые настольные компьютеры под управлением Windows вместе с MacBook Pro, может маршрутизировать вывод через все из них. Программное обеспечение работает на Windows, macOS и Linux как через графический, так и через интерфейс командной строки.

Время выпуска PAIR не случайно. ПК RTX Spark — новая платформа NVIDIA компактного форм-фактора, сочетающая графический процессор Blackwell с 20-ядерным процессором ARM и до 128 ГБ унифицированной памяти, способная запускать модели с 120 миллиардами параметров локально — ожидаются от OEM-партнеров, включая ASUS, Dell, HP, Lenovo и Microsoft Surface, осенью 2026 года. PAIR дает этим машинам роль многоустройственного устройства с первого дня, независимо от того, служат ли они основным оркестрирующим узлом или вносят дополнительную емкость маршрутизации в кластер, уже основанный настольным компьютером RTX 5090 или DGX Spark.

PAIR позиционирует экосистему домашнего оборудования NVIDIA — каждую карту RTX с поддержкой Ollama, проданную с 2018 года — как часть распределенной архитектуры вывода, а не просто как изолированные ИИ-боксы для одного компьютера.

Начало работы

Бета-версия PAIR доступна на странице NVIDIA AI-on-RTX. Последовательность настройки: установите PAIR на каждую машину, которую вы хотите включить, утвердите безопасные рукопожатия сопряжения в локальной сети, включите Ollama или LM Studio на каждом узле и загрузите необходимые модели, затем направьте совместимый фреймворк агентов на его обычный локальный конечный узел. Исходный код находится на GitHub под лицензией Apache License 2.0. Разработчики могут просматривать, форкать и вносить вклад в обнаружение, сопряжение, маршрутизацию, интеграцию движков и пользовательский опыт.


Что такое NVIDIA PAIR и чем он отличается от запуска Ollama на удаленной машине?

NVIDIA Personal AI Router — это бесплатный виртуальный маршрутизатор вывода, который находится между вашими приложениями ИИ-агентов и вашими локальными движками вывода (Ollama, LM Studio). Когда агент запускает вызов модели, PAIR перехватывает его, оценивает каждую подходящую машину в вашей домашней сети в реальном времени и направляет запрос на узел, который наиболее готов. Это отличается от направления Ollama на удаленный хост, поскольку PAIR одновременно управляет пулом узлов, выбирает среди них для каждого запроса на основе сигналов о рабочей нагрузке и утилизации графического процессора в реальном времени и представляет единый конечный узел для всех ваших приложений — без изменений в настройке этих приложений.

Объединяет ли NVIDIA PAIR VRAM, чтобы я мог запускать более крупные модели, чем помещается на одном GPU?

Нет. PAIR не объединяет память графического процессора и не разделяет модели между машинами. Каждый запрос на вывод обрабатывается полностью одним узлом, поэтому модель по-прежнему должна помещаться в VRAM или унифицированную память этой машины. Преимущество, которое дает PAIR, заключается в параллелизме независимых запросов — несколько субагентов могут работать на нескольких машинах одновременно — а не в расширенной емкости памяти для любого отдельного запроса. Чтобы запустить модель, превышающую VRAM вашего самого большого отдельного графического процессора, вам по-прежнему нужна машина с достаточной памятью (например, DGX Spark или RTX Spark с 128 ГБ унифицированной памяти).

Нужно ли мне копировать одну и ту же модель на каждую машину в моем кластере?

Да, если вы хотите, чтобы несколько машин были доступны для маршрутизации. Планировщик PAIR выбирает узел только в том случае, если точная запрошенная модель уже присутствует и загружена в движок вывода этого узла. Трехустройный кластер, в котором модель находится только на одном устройстве, будет маршрутизировать все запросы на это одно устройство — идентично прямому вызову. Чтобы разблокировать распределение на несколько узлов для данной модели, эта модель должна быть загружена и доступна на каждой машине, которую вы хотите использовать для маршрутизации. Для большой модели, такой как Qwen 3.6 35B (примерно 20 ГБ в квантовании Q4), это означает умножение вашего объема хранилища на количество участвующих узлов.

Какие типы рабочих нагрузок ИИ получают наибольшее ускорение от PAIR?

Наибольшую выгоду получают многоагентные конвейеры, которые одновременно запускают несколько вызовов субагентов — Hermes Desktop, CrewAI, LangGraph и аналогичные фреймворки, поскольку PAIR может маршрутизировать каждый параллельный вызов на другой готовый узел. Параллельный запуск нескольких независимых ИИ-приложений также приносит пользу. Рабочие нагрузки, которые являются строго последовательными (каждый шаг зависит от предыдущего) или состоят из одного длинного вызова модели, получают небольшую выгоду, поскольку нет одновременных независимых запросов для распределения.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:

Похожие новости: