Cloud · 24. September 2026

NVIDIA stellt Personal AI Router für lokale Rechenaufgaben vor

a close up of a flower with lots of blurry lights
Monisha Selvakumar / Unsplash

NVIDIA hat den Personal AI Router (PAIR) als Testversion veröffentlicht, der die Rechenleistung mehrerer Computer in einem lokalen Netzwerk kombiniert und KI-Anfragen automatisch verteilt. Die Technologie richtet sich an mehragentige KI-Arbeitslasten, bei denen mehrere unabhängige Modellaufrufe die Kapazität einer einzelnen GPU überfordern können. NVIDIA nutzt dafür eine Breadth-First-Strategie, bei der ein zentraler Agent Teilaufgaben an weitere Agenten weitergibt oder mehrere Agenten gemeinsam komplexere Aufgaben lösen. Wenn die Anfragen die lokalen GPUs überlasten, kann dies zu Engpässen führen. PAIR löst das Problem, indem es einzelne Anfragen auf verfügbare Systeme verteilt und so die vorhandenen lokalen KI-Ressourcen optimal nutzt. Die Lösung lässt sich nahtlos in Dienste wie Ollama und LM Studio integrieren, ohne dass Änderungen an der zugrundeliegenden Architektur oder an Agentenframeworks nötig sind. Agenten senden Anfragen über ihre vertrauten lokalen Schnittstellen an PAIR, der den Engine- und Modellanforderungen entspricht und einen geeigneten Knoten auswählt.

Der ausgewählte Knoten führt die Anfrage vollständig aus und gibt das Ergebnis über PAIR zurück. Der Agent sieht dabei nur eine Verbindung, während PAIR im Hintergrund die Aufgabenverteilung übernimmt. In einer Demonstration kombinierten NVIDIA Hermes Desktop, Ollama und PAIR, um Arbeitslasten auf drei Systemen, RTX Spark, DGX Spark und RTX 5090, auszuführen. Die Laufzeit wurde im Vergleich zu einer einzelnen RTX Spark-Notebook um etwa 50 Prozent verkürzt. Die Aufteilung erfolgte in fünf Teilaufgaben, die jeweils einem passenden Knoten zugewiesen wurden, wobei das Ergebnis anschließend synthetisiert wurde. NVIDIA betont, dass das Ergebnis keine Leistungsgarantie darstellt, da es von Faktoren wie Arbeitslastparallelität, Modellwahl, Engine-Konfiguration, Hardware, Netzwerk und Knotenverfügbarkeit abhängt. PAIR ist für Windows 11, Linux und macOS verfügbar und unterstützt sowohl x64 als auch arm64-Systeme. Zudem können Knoten mit unterschiedlichen Betriebssystemen kombiniert werden, sofern die jeweiligen Modelle oder Engines mit dem Zielknoten kompatibel sind. NVIDIA weist ausdrücklich darauf hin, dass PAIR keine GPUs zusammenführt oder den VRAM zu einem größeren Beschleuniger zusammenfasst, sondern einzelne Anfragen auf verfügbare Systeme verteilt.

Trotz dieser Klarstellungen kam es in sozialen Medien zu Missverständnissen, bei denen einige Nutzer PAIR als Lösung zur gemeinsamen Nutzung von Rechenressourcen mit Drittanbietern oder zur Ausführung komplexer Modelle auf schwächeren Systemen interpretierten. Reddit-Nutzer Vegetable-Warthog81 berichtete von positiven Erfahrungen, als PAIR Aufgaben auf drei mit Qwen 3.8 27B-Modellen ausgestattete RTX 5090-Grafikkarten verteilte. Dabei legte er Wert auf Stabilität und kontinuierliche Auslastung der GPUs statt auf maximaler Token-Generierungsrate pro Sekunde. PAIR kann über GitHub heruntergeladen werden; Anleitungen zur Nutzung sind im dazugehörigen Leitfaden dokumentiert. Für Nutzer, die eine Plattform suchen, um Rechenleistung mehrerer Parteien zu teilen, werden Alternativen wie Petals oder Mesh LLM genannt, wobei Mesh LLM zusätzlich die Aufteilung großer Modelle mittels Skippy unterstützt.