Nvidia bracht op 3 september de bèta uit van Personal AI Router, kortweg PAIR: gratis open source software die lokale AI-verzoeken verdeelt over de computers in je eigen netwerk. De lancering zelf staat in ons nieuwsbericht Lokale AI op je eigen pc’s. Hier gaat het om de vraag die daar niet in past: hoort dit bij jouw bedrijf thuis?
Wat je krijgt
PAIR gaat tussen je applicatie en je modellen zitten. Hij neemt de standaardpoort over van Ollama of LM Studio, doet zich voor als die dienst, en stuurt elk binnenkomend verzoek door naar een machine in je netwerk die op dat moment vrij is en het gevraagde model heeft staan (Bron: NVIDIA). Je agent of tool merkt daar niets van; die blijft naar hetzelfde adres praten.
De planner weegt per verzoek vier dingen: staat de machine aan en klaar, draait er een ondersteunde engine, staat het gevraagde model erop, en hoe druk is de videokaart nu. Dat laatste is in een klein kantoor prettiger dan het klinkt: de werkplek waarop iemand zit te renderen wordt vanzelf overgeslagen.
Voor wie dit werkt
De doelgroep is smaller dan “iedereen met lokale AI”. Drie voorwaarden moeten tegelijk gelden.
Je hebt minstens twee geschikte machines. Nvidia ondersteunt GeForce RTX vanaf de 20-serie, RTX PRO-workstationkaarten vanaf Turing, DGX Spark en Macs met M4-silicium of nieuwer. Een kantoor met vier zakelijke laptops zonder losse videokaart valt af.
Je draait werk dat uiteenvalt in losse verzoeken. Dat is precies wat agents doen. Nvidia’s eigen demo gebruikt vijf subagents via Hermes Desktop met Ollama en het model Qwen 3.6 35B A3B: 18 minuten op één RTX Spark-laptop, 8 minuten en 48 seconden op een cluster van drie apparaten. Let op de voetnoot die Nvidia er zelf bij zet, want die telt: een niet-officiële demonstratie aan één specifieke opstelling, geen benchmark en geen belofte dat het lineair schaalt.
En er is iemand die het beheert. Bètasoftware op vier machines, modellen die op de juiste plek moeten staan, en een collega die belt als het niet werkt.
Beginner-tip:Draai je nog helemaal geen lokale modellen, dan is PAIR de verkeerde eerste stap. Begin met één machine via onze gidsen overlokale AI op een MacofOllama op Windows, en kijk pas daarna of je het wilt uitbreiden.
Wanneer je hem beter overslaat
Bij één geschikte machine verandert PAIR niets: er is niets te verdelen. Bij werk dat uit één lange modelaanroep bestaat evenmin, want een enkel verzoek wordt nooit over machines gesplitst.
De grootste verwachting die je moet bijstellen: PAIR bundelt geen videogeheugen. Nvidia is daar expliciet over. Een model dat niet in je videokaart past, past er met vijf collega-pc’s nog steeds niet in. Wie op zoek is naar “samen één groot model draaien” kijkt naar het verkeerde gereedschap.
Gevorderden:Elk verzoek wordt aan één geschikte machine toegewezen en blijft daar tot het antwoord er is. Dat is workload-concurrency, geen model-parallellisme. De praktische consequentie: je wint doorlooptijd op een brede werkstroom en niets op een diepe.
De alternatieven op een rij
Ollama of LM Studio zonder router is het eerlijke vertrekpunt bij één machine. Geen extra laag, geen extra beheer.
Exo lost het probleem op dat PAIR expliciet laat liggen. Die software knipt een model in lagen en verdeelt die over je apparaten, zodat je een model kunt draaien dat op geen enkele machine los past, en mengt daarbij Apple Silicon, Nvidia en AMD in één cluster (Bron: Exo Labs). Dat is dus de keuze: PAIR voor veel verzoeken tegelijk, exo voor één model dat te groot is.
Een DGX Spark is de hardware-oplossing voor hetzelfde probleem. Eén machine die het aankan, in plaats van drie die samenwerken. Duurder in aanschaf, goedkoper in beheeruren.
Een cloud-API blijft het alternatief als je geen zin hebt in dit alles. Je betaalt per gebruiker of per token en je data gaat het pand uit; die afweging maakten we eerder in de begroting voor AI-kosten in het MKB.
Wat het met je data doet
Dit is waar PAIR sterk staat, en het is de belangrijkste reden dat een ondernemer met klantgegevens ernaar kijkt. De opzet is dat prompts, data en inferentieverkeer je bestaande lokale netwerk niet verlaten. Machines vinden elkaar via mDNS, jij keurt elke koppeling met de hand goed, en het verkeer tussen machines is versleuteld met mTLS en gegenereerde certificaten. Tot een koppeling er ligt, is het verkeer tussen machines geblokkeerd.
Twee kanttekeningen houden dat eerlijk. Het is bètasoftware, dus de veiligheidsclaims zijn nog niet door de tijd getest. En de code staat open op GitHub, wat betekent dat je beheerder kan controleren wat er gebeurt — maar alleen als iemand daar daadwerkelijk naar kijkt.
Het oordeel
PAIR verdient een proef als je al lokale agents draait op twee of meer geschikte machines en merkt dat je op je eigen videokaart staat te wachten. Zet dan twee machines op, laat één workflow die je vaak draait erdoorheen lopen, en vergelijk de doorlooptijd met wat je nu hebt. Valt dat tegen, dan ben je een middag kwijt en verder niets.
Staat er één machine, of is het wachten niet je probleem, dan verandert deze tool niets aan je dag.
