In de meeste kantoren staat meer rekenkracht dan er wordt gebruikt. De ontwerpwerkplek die na vijven uit staat, de laptop van de collega die op vrijdag vrij is, de oude machine die alleen nog facturen draait. Nvidia bracht begin september gratis software uit die precies dat aanspreekt: Personal AI Router, kortweg PAIR, verdeelt lokale AI-verzoeken over de computers in je eigen netwerk.
Wat PAIR wel en niet is
PAIR is geen kastje en geen nieuwe AI-engine. Je blijft Ollama of LM Studio gebruiken om modellen te draaien; PAIR gaat ervoor zitten als verkeersregelaar. Hij ontdekt welke machines in je netwerk meedoen, houdt bij welke vrij zijn, en stuurt elk binnenkomend verzoek naar een geschikte machine (Bron: NVIDIA).
Het aardige is dat je applicatie er niets van merkt. PAIR neemt de standaardpoort over die Ollama of LM Studio gebruikt en doet zich voor als die dienst. De tool die je al hebt draaien blijft dus naar hetzelfde adres praten.
Beginner-tip:Draai je nog geen lokale modellen? Begin daar dan eerst mee, want PAIR heeft alleen zin als je er al meerdere machines mee wilt laten werken. Onze gidsen overlokale AI op een MacenOllama op Windowszijn het startpunt.
Wat het níet doet, is minstens zo belangrijk voor je verwachtingen. PAIR voegt geen videogeheugen samen en knipt geen enkel verzoek op over meerdere machines. Elk verzoek gaat naar één machine en blijft daar tot het antwoord er is. Een model dat niet in je videokaart past, past er ook met vijf collega-pc’s niet in.
Wanneer het tijd oplevert, en wanneer niet
De winst zit bij werk dat uiteenvalt in veel losse verzoeken die tegelijk kunnen lopen. Dat is precies wat AI-agents doen: een hoofdtaak opknippen in deeltaken en die parallel uitzetten. Draai je dat op één machine, dan staan al die deeltaken in de rij voor dezelfde videokaart.
Nvidia laat het zien met een demo: vijf subagents via Hermes Desktop met Ollama en het model Qwen 3.6 35B A3B. Op één RTX Spark-laptop duurde dat gemiddeld 18 minuten, op een cluster van drie apparaten 8 minuten en 48 seconden. Nvidia noemt het er zelf bij een niet-officiële demonstratie die aan één specifieke opstelling hangt, geen benchmark en geen belofte over hoe het bij jou schaalt (Bron: NVIDIA). Die kanttekening is terecht en weegt zwaarder dan het getal zelf.
Bij werk dat uit één lange modelaanroep bestaat, levert PAIR niets op. Idem als maar één machine het gevraagde model heeft staan: dan is er niets te verdelen.
Gevorderden:De planner kijkt per verzoek naar vier dingen: staat de machine aan en klaar, draait er een ondersteunde engine, staat het exact gevraagde model erop, en hoe druk is de kaart op dit moment. Die laatste factor is prettig in een klein kantoor: de werkplek waarop iemand zit te renderen wordt vanzelf overgeslagen.
Wat je nodig hebt
De hardware-eisen zijn de grootste drempel. Nvidia ondersteunt GeForce RTX-kaarten vanaf de 20-serie, RTX PRO-workstationkaarten vanaf Turing, DGX Spark-systemen en Macs met M4-silicium of nieuwer. Een kantoor met vier kantoorlaptops zonder losse videokaart valt daarbuiten.
Op elke deelnemende machine installeer je PAIR plus Ollama of LM Studio, en zorg je dat het gevraagde model er staat. PAIR kan bij dat laatste helpen: hij kan een engine installeren en modeldownloads starten op gekoppelde machines, wat het klaarzetten van vier werkplekken een stuk minder saai maakt.
De koppeling loopt via mDNS-ontdekking op je eigen netwerk, met een handmatige goedkeuring per machine. Verkeer tussen machines is versleuteld met mTLS en blijft geblokkeerd tot de koppeling er is. Bedoeld effect: prompts en data verlaten je netwerk niet.
Wat dit betekent voor je AI-begroting
De rekensom die dit interessant maakt voor een klein bedrijf is simpel. Cloud-AI kost per gebruiker per maand en blijft kosten. Hardware die er al staat is betaald. Voor gevoelig werk, waarbij je liever geen klantdossiers naar een Amerikaanse server stuurt, is lokaal draaien sowieso al vaker een overweging; zie ook wat er gebeurt bij Nederlandse bedrijven die op een eigen model overstappen.
Tegelijk: onderschat de beheerlast niet. Bètasoftware op vier machines, modellen synchroon houden, en iemand die het uitzoekt als een machine er ineens uitvalt. Reken die uren mee als je het naast een abonnement legt, net zoals in onze begroting voor AI-kosten in het MKB.
Wil je het proberen, dan is de nuchtere aanpak: twee geschikte machines koppelen, één agent-workflow die je vaak draait erdoorheen halen, en de doorlooptijd vergelijken met wat je nu hebt. De code staat open op GitHub, dus je beheerder kan meekijken wat er precies gebeurt voordat het je netwerk in gaat.
Twijfel je of dit bij jouw opstelling past? In onze review van Nvidia PAIR zetten we de voorwaarden, de alternatieven (waaronder exo, dat modellen wél opsplitst) en de datakant op een rij.
