AI Nieuws6 minGevorderd

Lokale AI op je eigen pc's: Nvidia's gratis PAIR verdeelt het werk

Nvidia's Personal AI Router bundelt de computers in je kantoornetwerk voor lokale AI. Wat het wel doet, wat het niet doet, en wanneer het iets oplevert.

Miniatuur diorama-illustratie bij artikel 'Lokale AI op je eigen pc's: Nvidia's gratis PAIR verdeelt het werk'

In de meeste kantoren staat meer rekenkracht dan er wordt gebruikt. De ontwerpwerkplek die na vijven uit staat, de laptop van de collega die op vrijdag vrij is, de oude machine die alleen nog facturen draait. Nvidia bracht begin september gratis software uit die precies dat aanspreekt: Personal AI Router, kortweg PAIR, verdeelt lokale AI-verzoeken over de computers in je eigen netwerk.

Wat PAIR wel en niet is

PAIR is geen kastje en geen nieuwe AI-engine. Je blijft Ollama of LM Studio gebruiken om modellen te draaien; PAIR gaat ervoor zitten als verkeersregelaar. Hij ontdekt welke machines in je netwerk meedoen, houdt bij welke vrij zijn, en stuurt elk binnenkomend verzoek naar een geschikte machine (Bron: NVIDIA).

Het aardige is dat je applicatie er niets van merkt. PAIR neemt de standaardpoort over die Ollama of LM Studio gebruikt en doet zich voor als die dienst. De tool die je al hebt draaien blijft dus naar hetzelfde adres praten.

Beginner-tip:Draai je nog geen lokale modellen? Begin daar dan eerst mee, want PAIR heeft alleen zin als je er al meerdere machines mee wilt laten werken. Onze gidsen overlokale AI op een MacenOllama op Windowszijn het startpunt.

Wat het níet doet, is minstens zo belangrijk voor je verwachtingen. PAIR voegt geen videogeheugen samen en knipt geen enkel verzoek op over meerdere machines. Elk verzoek gaat naar één machine en blijft daar tot het antwoord er is. Een model dat niet in je videokaart past, past er ook met vijf collega-pc’s niet in.

Wanneer het tijd oplevert, en wanneer niet

De winst zit bij werk dat uiteenvalt in veel losse verzoeken die tegelijk kunnen lopen. Dat is precies wat AI-agents doen: een hoofdtaak opknippen in deeltaken en die parallel uitzetten. Draai je dat op één machine, dan staan al die deeltaken in de rij voor dezelfde videokaart.

Nvidia laat het zien met een demo: vijf subagents via Hermes Desktop met Ollama en het model Qwen 3.6 35B A3B. Op één RTX Spark-laptop duurde dat gemiddeld 18 minuten, op een cluster van drie apparaten 8 minuten en 48 seconden. Nvidia noemt het er zelf bij een niet-officiële demonstratie die aan één specifieke opstelling hangt, geen benchmark en geen belofte over hoe het bij jou schaalt (Bron: NVIDIA). Die kanttekening is terecht en weegt zwaarder dan het getal zelf.

Bij werk dat uit één lange modelaanroep bestaat, levert PAIR niets op. Idem als maar één machine het gevraagde model heeft staan: dan is er niets te verdelen.

Gevorderden:De planner kijkt per verzoek naar vier dingen: staat de machine aan en klaar, draait er een ondersteunde engine, staat het exact gevraagde model erop, en hoe druk is de kaart op dit moment. Die laatste factor is prettig in een klein kantoor: de werkplek waarop iemand zit te renderen wordt vanzelf overgeslagen.

Wat je nodig hebt

De hardware-eisen zijn de grootste drempel. Nvidia ondersteunt GeForce RTX-kaarten vanaf de 20-serie, RTX PRO-workstationkaarten vanaf Turing, DGX Spark-systemen en Macs met M4-silicium of nieuwer. Een kantoor met vier kantoorlaptops zonder losse videokaart valt daarbuiten.

Op elke deelnemende machine installeer je PAIR plus Ollama of LM Studio, en zorg je dat het gevraagde model er staat. PAIR kan bij dat laatste helpen: hij kan een engine installeren en modeldownloads starten op gekoppelde machines, wat het klaarzetten van vier werkplekken een stuk minder saai maakt.

De koppeling loopt via mDNS-ontdekking op je eigen netwerk, met een handmatige goedkeuring per machine. Verkeer tussen machines is versleuteld met mTLS en blijft geblokkeerd tot de koppeling er is. Bedoeld effect: prompts en data verlaten je netwerk niet.

Wat dit betekent voor je AI-begroting

De rekensom die dit interessant maakt voor een klein bedrijf is simpel. Cloud-AI kost per gebruiker per maand en blijft kosten. Hardware die er al staat is betaald. Voor gevoelig werk, waarbij je liever geen klantdossiers naar een Amerikaanse server stuurt, is lokaal draaien sowieso al vaker een overweging; zie ook wat er gebeurt bij Nederlandse bedrijven die op een eigen model overstappen.

Tegelijk: onderschat de beheerlast niet. Bètasoftware op vier machines, modellen synchroon houden, en iemand die het uitzoekt als een machine er ineens uitvalt. Reken die uren mee als je het naast een abonnement legt, net zoals in onze begroting voor AI-kosten in het MKB.

Wil je het proberen, dan is de nuchtere aanpak: twee geschikte machines koppelen, één agent-workflow die je vaak draait erdoorheen halen, en de doorlooptijd vergelijken met wat je nu hebt. De code staat open op GitHub, dus je beheerder kan meekijken wat er precies gebeurt voordat het je netwerk in gaat.

Twijfel je of dit bij jouw opstelling past? In onze review van Nvidia PAIR zetten we de voorwaarden, de alternatieven (waaronder exo, dat modellen wél opsplitst) en de datakant op een rij.

Veelgestelde vragen

Wat is Nvidia PAIR en wat kost het?

PAIR staat voor Personal AI Router. Het is gratis, open source software die de computers in je lokale netwerk aan elkaar knoopt en losse AI-verzoeken naar de machine stuurt die op dat moment vrij is. Het is geen hardware en geen nieuwe AI-engine: Ollama of LM Studio blijft het model draaien, PAIR bepaalt alleen waar. De bèta draait op Windows, macOS en Linux.

Welke hardware heb ik nodig voor PAIR?

Nvidia noemt GeForce RTX-kaarten uit de 20-serie en nieuwer, RTX PRO-workstationkaarten vanaf de Turing-architectuur, DGX Spark-systemen en Macs met Apple M4-silicium of hoger. Elke deelnemende machine draait Ollama of LM Studio en moet het gevraagde model lokaal beschikbaar hebben. De modellen hoeven niet op alle machines hetzelfde te zijn; PAIR stuurt een verzoek naar een machine die het gevraagde model heeft staan.

Kan ik hiermee een groter AI-model draaien dan mijn videokaart aankan?

Nee. Nvidia is daar expliciet over: PAIR voegt geen videogeheugen samen en splitst één verzoek niet over meerdere machines. Elk verzoek wordt aan één geschikte machine toegewezen en blijft daar. Wat je wint is doorloopsnelheid bij veel verzoeken tegelijk, niet de capaciteit voor een zwaarder model. Voor een groter model heb je nog steeds een machine nodig die dat model in zijn geheugen krijgt.

Blijft mijn bedrijfsdata bij PAIR binnen het eigen netwerk?

Dat is de opzet. PAIR is ontworpen om prompts, data en inferentieverkeer op je bestaande lokale netwerk te houden. Machines vinden elkaar via mDNS, je keurt elke koppeling handmatig goed, en het verkeer tussen machines is versleuteld met mTLS en gegenereerde certificaten. Tot een koppeling tot stand is gebracht, is het verkeer tussen machines geblokkeerd. Beoordeel dit wel zelf of laat je beheerder ernaar kijken voordat je er gevoelige gegevens doorheen stuurt: het is bètasoftware.

Voor welk soort werk levert PAIR echt tijdwinst op?

Voor werk dat uiteenvalt in veel losse modelaanroepen die tegelijk kunnen draaien. Denk aan een agent die een taak opknipt in deeltaken, of aan meerdere AI-tools die tegelijk staan te wachten. Bij werk dat vooral uit één lange modelaanroep bestaat, of waar maar één machine het gevraagde model heeft staan, is de winst klein tot nul. Nvidia adviseert zelf om te meten op je eigen opstelling.

Bronnen

Waar deze informatie vandaan komt.