developer.nvidia.com détecté sur le web

Nvidia lance PAIR en bêta, routeur d'inférence pour LAN domestique

6 médias qui couvrent ce sujet
NVIDIA Inference Edge AI ai-business

TL;DR

  • PAIR dispatches independent inference requests to devices holding complete model copies; it cannot shard a single oversized model across multiple GPUs with insufficient VRAM.
  • A three-device PAIR cluster completed a five-subagent task in 8m48s versus 18 minutes on a single RTX Spark laptop, a roughly 2x throughput gain.
  • Apple M4+ Macs are listed as supported nodes alongside RTX 20-series and newer, expanding the addressable device pool beyond Nvidia GPU owners.

Sur une tâche à cinq sous-agents avec Qwen 3.6 35B A3B, un PC portable RTX Spark seul met 18 minutes en moyenne ; un cluster à trois machines — RTX Spark, DGX Spark et RTX 5090 — descend à 8 minutes et 48 secondes. C'est le repère que met en avant Nvidia dans un billet publié le 3 septembre sur son blog développeur, signé du senior product manager Seth Schneider, pour la bêta ouverte de PAIR, Personal AI Router.

« NVIDIA Personal AI Router (PAIR) routes independent inference requests across compatible systems on a local network to relieve multi-agent bottlenecks », résume le texte. Concrètement, PAIR se pose devant les runtimes d'inférence locaux et distribue les requêtes indépendantes entre plusieurs machines du même réseau. Il proxifie Ollama et LM Studio de sorte que « no agent harness changes are necessary » : les harnais d'agents en amont ne voient rien changer.

Le périmètre matériel couvre les GeForce RTX 20 Series et plus récents, les RTX PRO station de travail (Turing et suivantes), les DGX Spark et le silicium Apple M4+. La bêta tourne sur Windows, macOS et Linux, en interfaces graphique comme terminal. Découverte des nœuds en mDNS, échanges chiffrés en MTLS avec certificats générés.

Ce que PAIR n'est pas : un pool de VRAM ni un sharding de requêtes. Chaque prompt reste sur une machine ; le routeur en aiguille plusieurs en parallèle. C'est la troisième brique d'inférence locale à passer par notre veille en peu de temps, après Anker MindBase et le Portable Computer de Perplexity, lui aussi calé sur DGX Spark et RTX. Le dépôt est publié sur github.com/NVIDIA/Personal-AI-Router ; le billet indique que « The NVIDIA PAIR project is open source » sans nommer la licence.

Ce qu'en disent les autres médias

Couverture consolidée 24h après publication

  1. Tom's Hardware Lire →

    Hardware-focused coverage framing PAIR as a solution to agent swarms bottlenecking a single GPU, aimed at the RTX enthusiast audience.

  2. Nvidia Blog Lire →

    First-party post connecting PAIR to the broader IFA local-AI stack: RTX Spark Windows PCs arriving October, partnerships with Perplexity, OpenClaw, and Hermes.

    PAIR automatically discovers compatible PCs on a local network and routes independent inference requests to whichever system has capacity.
  3. Progressive Robot Lire →

    Provides the five-filter eligibility routing system and quantifies household economics: ~$1,200/month cloud API equivalent versus ~$120 in electricity at 60% utilization.

    It's truly a treasure trove of free tokens just sitting in homes today. - Seth Schneider, Senior Product Manager, Nvidia
  4. Data Studios Lire →

    Clearest technical distinction: PAIR schedules independent jobs; per-device VRAM constraints and model-loading overhead remain unchanged.

    PAIR automatically discovers compatible devices on the local network, tracks capacity, and sends independent inference requests to an appropriate machine.
  5. ExplainX.ai Lire →

    Compares PAIR against Petals and Mesh LLM; connects the launch to Nvidia's Hugging Face acquisition as a compute-as-asset consumer play.

    It finds every compatible PC and Mac on your home network and routes AI inference requests to whichever one has spare GPU capacity.