AI Tools6 minGevorderd

Nvidia PAIR review: voor wie is deze gratis AI-router geschikt?

PAIR verdeelt lokale AI-verzoeken over de computers in je netwerk. Wanneer dat tijd oplevert, wanneer een alternatief beter past, en wat het met je data doet.

Miniatuur diorama-illustratie bij artikel 'Nvidia PAIR review: voor wie is deze gratis AI-router geschikt?'
Inhoudsopgave6 secties
  1. Wat je krijgt
  2. Voor wie dit werkt
  3. Wanneer je hem beter overslaat
  4. De alternatieven op een rij
  5. Wat het met je data doet
  6. Het oordeel

Nvidia bracht op 3 september de bèta uit van Personal AI Router, kortweg PAIR: gratis open source software die lokale AI-verzoeken verdeelt over de computers in je eigen netwerk. De lancering zelf staat in ons nieuwsbericht Lokale AI op je eigen pc’s. Hier gaat het om de vraag die daar niet in past: hoort dit bij jouw bedrijf thuis?

Wat je krijgt

PAIR gaat tussen je applicatie en je modellen zitten. Hij neemt de standaardpoort over van Ollama of LM Studio, doet zich voor als die dienst, en stuurt elk binnenkomend verzoek door naar een machine in je netwerk die op dat moment vrij is en het gevraagde model heeft staan (Bron: NVIDIA). Je agent of tool merkt daar niets van; die blijft naar hetzelfde adres praten.

De planner weegt per verzoek vier dingen: staat de machine aan en klaar, draait er een ondersteunde engine, staat het gevraagde model erop, en hoe druk is de videokaart nu. Dat laatste is in een klein kantoor prettiger dan het klinkt: de werkplek waarop iemand zit te renderen wordt vanzelf overgeslagen.

Voor wie dit werkt

De doelgroep is smaller dan “iedereen met lokale AI”. Drie voorwaarden moeten tegelijk gelden.

Je hebt minstens twee geschikte machines. Nvidia ondersteunt GeForce RTX vanaf de 20-serie, RTX PRO-workstationkaarten vanaf Turing, DGX Spark en Macs met M4-silicium of nieuwer. Een kantoor met vier zakelijke laptops zonder losse videokaart valt af.

Je draait werk dat uiteenvalt in losse verzoeken. Dat is precies wat agents doen. Nvidia’s eigen demo gebruikt vijf subagents via Hermes Desktop met Ollama en het model Qwen 3.6 35B A3B: 18 minuten op één RTX Spark-laptop, 8 minuten en 48 seconden op een cluster van drie apparaten. Let op de voetnoot die Nvidia er zelf bij zet, want die telt: een niet-officiële demonstratie aan één specifieke opstelling, geen benchmark en geen belofte dat het lineair schaalt.

En er is iemand die het beheert. Bètasoftware op vier machines, modellen die op de juiste plek moeten staan, en een collega die belt als het niet werkt.

Beginner-tip:Draai je nog helemaal geen lokale modellen, dan is PAIR de verkeerde eerste stap. Begin met één machine via onze gidsen overlokale AI op een MacofOllama op Windows, en kijk pas daarna of je het wilt uitbreiden.

Wanneer je hem beter overslaat

Bij één geschikte machine verandert PAIR niets: er is niets te verdelen. Bij werk dat uit één lange modelaanroep bestaat evenmin, want een enkel verzoek wordt nooit over machines gesplitst.

De grootste verwachting die je moet bijstellen: PAIR bundelt geen videogeheugen. Nvidia is daar expliciet over. Een model dat niet in je videokaart past, past er met vijf collega-pc’s nog steeds niet in. Wie op zoek is naar “samen één groot model draaien” kijkt naar het verkeerde gereedschap.

Gevorderden:Elk verzoek wordt aan één geschikte machine toegewezen en blijft daar tot het antwoord er is. Dat is workload-concurrency, geen model-parallellisme. De praktische consequentie: je wint doorlooptijd op een brede werkstroom en niets op een diepe.

De alternatieven op een rij

Ollama of LM Studio zonder router is het eerlijke vertrekpunt bij één machine. Geen extra laag, geen extra beheer.

Exo lost het probleem op dat PAIR expliciet laat liggen. Die software knipt een model in lagen en verdeelt die over je apparaten, zodat je een model kunt draaien dat op geen enkele machine los past, en mengt daarbij Apple Silicon, Nvidia en AMD in één cluster (Bron: Exo Labs). Dat is dus de keuze: PAIR voor veel verzoeken tegelijk, exo voor één model dat te groot is.

Een DGX Spark is de hardware-oplossing voor hetzelfde probleem. Eén machine die het aankan, in plaats van drie die samenwerken. Duurder in aanschaf, goedkoper in beheeruren.

Een cloud-API blijft het alternatief als je geen zin hebt in dit alles. Je betaalt per gebruiker of per token en je data gaat het pand uit; die afweging maakten we eerder in de begroting voor AI-kosten in het MKB.

Wat het met je data doet

Dit is waar PAIR sterk staat, en het is de belangrijkste reden dat een ondernemer met klantgegevens ernaar kijkt. De opzet is dat prompts, data en inferentieverkeer je bestaande lokale netwerk niet verlaten. Machines vinden elkaar via mDNS, jij keurt elke koppeling met de hand goed, en het verkeer tussen machines is versleuteld met mTLS en gegenereerde certificaten. Tot een koppeling er ligt, is het verkeer tussen machines geblokkeerd.

Twee kanttekeningen houden dat eerlijk. Het is bètasoftware, dus de veiligheidsclaims zijn nog niet door de tijd getest. En de code staat open op GitHub, wat betekent dat je beheerder kan controleren wat er gebeurt — maar alleen als iemand daar daadwerkelijk naar kijkt.

Het oordeel

PAIR verdient een proef als je al lokale agents draait op twee of meer geschikte machines en merkt dat je op je eigen videokaart staat te wachten. Zet dan twee machines op, laat één workflow die je vaak draait erdoorheen lopen, en vergelijk de doorlooptijd met wat je nu hebt. Valt dat tegen, dan ben je een middag kwijt en verder niets.

Staat er één machine, of is het wachten niet je probleem, dan verandert deze tool niets aan je dag.

Veelgestelde vragen

Wat kost Nvidia PAIR?

Niets. PAIR is gratis en de broncode staat open op GitHub onder de organisatie NVIDIA. Er is geen abonnement, geen accountverplichting en geen betaalde variant aangekondigd. De kosten zitten elders: in de hardware die je al moet hebben, en in de tijd die het beheer van bètasoftware op meerdere machines kost. Peildatum 17 september 2026; de software staat nog als bèta gemarkeerd.

Voor wie is Nvidia PAIR geschikt?

Voor het kleine bedrijf of de ZZP'er die al lokale modellen draait via Ollama of LM Studio, minstens twee geschikte machines heeft staan, en werk doet dat uiteenvalt in veel losse modelaanroepen tegelijk. Dat laatste is de harde voorwaarde. Denk aan een agent die een onderzoeksvraag opknipt in deeltaken, of aan meerdere AI-tools die tegelijk staan te wachten. De winst zit in wachttijd, niet in kwaliteit van de antwoorden.

Wanneer kun je PAIR beter niet nemen?

Als je maar één geschikte machine hebt, want dan valt er niets te verdelen. Als je werk uit één lange modelaanroep bestaat, zoals een document samenvatten: PAIR splitst een enkel verzoek nooit over machines. Als je hoopt zo een groter model te kunnen draaien, want videogeheugen wordt niet gebundeld. En als niemand in je bedrijf bètasoftware op vier werkplekken wil bijhouden, is de beheerlast groter dan de tijdwinst.

Welke hardware ondersteunt PAIR?

Nvidia noemt GeForce RTX-kaarten uit de 20-serie en nieuwer, RTX PRO-workstationkaarten vanaf de Turing-architectuur, DGX Spark-systemen en Macs met Apple M4-silicium of hoger. Het draait op Windows, macOS en Linux, via een grafische schil of de terminal. Kantoorlaptops zonder losse videokaart vallen buiten de boot. Elke deelnemende machine draait Ollama of LM Studio en moet het gevraagde model lokaal hebben staan; identieke modellen op alle machines is niet verplicht.

Wat zijn de alternatieven voor Nvidia PAIR?

Ollama of LM Studio zonder router, als je maar één machine hebt: dan verandert PAIR niets. Exo is het alternatief met een ander doel — die software knipt een model in lagen en verdeelt die over apparaten, zodat een model draait dat op geen enkele machine los past, en mengt Apple Silicon, Nvidia en AMD in één cluster. Een Nvidia DGX Spark is de hardware-route: één sterke machine in plaats van vier gekoppelde. En voor wie de beheerlast wil vermijden blijft een cloud-API het alternatief, met de privacyafweging die daarbij hoort.

Bronnen

Waar deze informatie vandaan komt.