AI Tools7 minGevorderd

Perplexity Portable Computer: voor wie is een lokale AI-agent iets?

Een AI-agent die op je eigen pc draait en je data binnenboord houdt. Wat het oplevert, wat de 24GB-eis in de praktijk betekent, en wanneer een alternatief beter past.

Miniatuur diorama-illustratie bij artikel 'Perplexity Portable Computer: voor wie is een lokale AI-agent iets?'
Inhoudsopgave6 secties
  1. Wat het is
  2. Voor wie dit geschikt is
  3. Voor wie dit niet geschikt is
  4. Wat het onderscheidt van Ollama
  5. Wat we niet weten
  6. Praktisch advies

Sinds 14 september draait Perplexity’s AI-agent ook lokaal op Windows. Wat de lancering precies inhoudt, staat in ons nieuwsbericht. Hier gaat het om de vraag die daarna komt: is dit iets voor jouw bedrijf, of kijk je beter naar iets anders?

Wat het is

Portable Computer is geen chatvenster. Het is een agent die een opdracht in stappen uitvoert, en die stappen zelf bepaalt: een map openen, documenten doornemen, uitschieters markeren, een overzicht schrijven, het resultaat naar Slack of een Word-bestand sturen. Het verschil met de cloudversie is waar dat gebeurt. Hier draait het model op je eigen videokaart en blijven je bestanden op je eigen schijf.

Dat maakt het een tool met een heel specifiek koopmotief. Je koopt geen slimmere AI. Je koopt een grens om je data heen.

Voor wie dit geschikt is

Drie voorwaarden moeten tegelijk gelden.

Je verwerkt documenten die je liever binnenboord houdt. Klantdossiers, contracten, personeelsstukken, financiële administratie. Werk waarvoor je anders een verwerkersovereenkomst zou moeten regelen en je afvraagt waar de server staat.

Er staat al geschikte hardware. Een GeForce RTX of RTX PRO met minstens 24 GB videogeheugen. In de praktijk: een RTX 3090, 3090 Ti, 4090 of 5090, of een RTX PRO 4000 en hoger. Dat soort kaarten staat meestal al ergens als er wordt gerenderd, gemonteerd, getekend of ontwikkeld.

Het werk herhaalt zich. Een agent verdient zich terug op batches en op taken die elke week terugkomen. De Windows-versie kreeg daar geplande terugkerende taken voor.

Beginner-tip:videogeheugen (VRAM) is niet hetzelfde als het werkgeheugen van je pc. Een computer met 32 GB RAM kan prima een videokaart met 8 GB VRAM hebben, en dan haal je de drempel niet. Kijk in Taakbeheer onder Prestaties bij je GPU naar “toegewezen GPU-geheugen”, of zoek het model van je kaart op.

Voor wie dit niet geschikt is

Werk je op laptops, dan valt het af. De geheugendrempel sluit vrijwel alle mobiele hardware uit, met hooguit een enkele uitzondering aan de allerbovenkant.

Zit je op Apple-hardware, dan ook. Bij de lancering zei Perplexity zich volledig op NVIDIA te richten, en Apple-silicon stond niet in de plannen. Dat is opvallend, want juist daar zit een grote groep mensen die lokale modellen draait.

En stel je vooral losse vragen in plaats van hele mappen te verwerken, dan betaal je voor een laag die je niet gebruikt. Dan is de gewone cloudversie goedkoper en makkelijker.

Wat het onderscheidt van Ollama

Deze vergelijking komt het vaakst langs en berust op een misverstand. Ollama en Portable Computer zitten op verschillende lagen.

Ollama draait een model op je machine. Klaar. Portable Computer levert het model plus alles eromheen: de planning, het aanroepen van tools, de koppelingen met Word, Google Drive, Gmail, Slack en GitHub, en de afscherming waarin dat draait. Onder de motorkap gebruikt het vLLM voor de inference, met een geavanceerde modus waarin je je eigen endpoint kunt aansluiten.

Wie graag zelf sleutelt, komt met Ollama plus een open-source harnas als Pi, Hermes of OpenClaw een heel eind, en betaalt in tijd. Wie wil dat het gewoon werkt, betaalt hier voor het samenstellen. Dat is een legitieme keuze, geen zwakte van een van beide.

Wat we niet weten

De prestatiecijfers die rondgaan komen allemaal van Perplexity zelf. Op de eigen Local Knowledge Work Bench van 53 taken scoorde het systeem met Qwen 3.8 27B 82,6%, tegen 77,6% voor Pi en 74,0% voor Hermes met hetzelfde model. Met Perplexity’s nagetrainde PPLX 27B werd dat 85,4%.

Dat kan kloppen. Het is alleen een fabrikant die zijn eigen product meet tegen concurrenten, en dat is zelden de hele waarheid. Perplexity zegt de benchmark open te willen stellen. Tot dat gebeurt en iemand anders het natrekt, zijn dit indicaties.

Eén ding erkent het bedrijf zelf wel: kleine lokale modellen blijven achter op zware redeneertaken. Op een lastige codeer-benchmark haalde het lokale model 59,6%, met cloudhulp 73,0% en een frontier-model alleen 82,4%. Opschalen naar de cloud dicht het gat deels en niet helemaal.

Praktisch advies

Heb je de hardware al staan, plan dan deze week een uur in. Neem een echte klus die je vaak doet, laat de agent hem draaien en kijk wat er uitkomt. Dat zegt meer dan elke benchmark.

Heb je de hardware niet, wacht dan. NVIDIA kondigde voor oktober RTX Spark Windows-pc’s van Lenovo en Acer aan, en het aanbod op dit niveau wordt sneller breder dan de prijzen suggereren. Een GPU kopen om een tool te proberen is een investering met de verkeerde volgorde.

Veelgestelde vragen

Voor wie is deze tool geschikt?

Voor ondernemers die aan drie voorwaarden tegelijk voldoen. Eén: je verwerkt regelmatig documenten die je liever niet naar een cloudleverancier stuurt, zoals klantdossiers, contracten, offertes of financiële stukken. Twee: er staat al een werkstation met een GeForce RTX of RTX PRO met minstens 24 GB videogeheugen, bijvoorbeeld omdat er wordt ontworpen, gerenderd of ontwikkeld. Drie: het werk komt in batches en herhaalt zich, want daar verdient een agent zich terug. Mis je één van de drie, dan is de investering moeilijk te verdedigen.

Voor wie is het juist niet geschikt?

Werk je op laptops, dan vrijwel zeker niet: de 24GB-drempel sluit bijna alle mobiele hardware uit. Zit je op Apple-silicon, dan ook niet; Perplexity zei bij de lancering zich volledig op NVIDIA-hardware te richten en noemde Apple niet in de plannen. En stel je vooral losse vragen in plaats van hele mappen te verwerken, dan betaal je voor een agent-laag die je niet gebruikt.

Wat is het verschil met Ollama of LM Studio?

Die lossen een andere laag op. Ollama draait een model op je eigen machine en stopt daar. Portable Computer levert het model plús de agent-laag eromheen: de planning, het aanroepen van tools, de koppelingen met je apps en de afscherming waarin dat allemaal draait, als één pakket. Perplexity gebruikt onder de motorkap vLLM voor de inference en biedt een geavanceerde modus waarin je je eigen inference-endpoint kunt aansluiten. Wie zelf graag sleutelt, komt met Ollama een heel eind en bouwt de rest zelf; wie gewoon wil dat het werkt, betaalt hier voor het samenstellen.

Hoe goed presteert het echt?

Dat weten we nog niet onafhankelijk. Perplexity publiceerde een eigen benchmark, de Local Knowledge Work Bench met 53 taken, waarop het systeem met Qwen 3.8 27B op een DGX Spark 82,6% haalde tegen 77,6% voor het open-source Pi-harnas en 74,0% voor Hermes met hetzelfde model. Met Perplexity's eigen nagetrainde PPLX 27B werd dat 85,4%. Dit zijn cijfers van de fabrikant over zijn eigen product; het bedrijf zegt de benchmark open te willen stellen. Behandel ze als een indicatie, niet als bewijs ([Bron: VentureBeat](https://venturebeat.com/infrastructure/perplexity-partners-with-nvidia-to-launch-portable-computer-a-fully-local-ai-agent-with-zero-token-costs)).

Wat kost het in de praktijk?

Drie kostenposten. Een Perplexity Pro- of Max-abonnement. Hardware, als je die nog niet hebt: een tweedehands 24GB-kaart in een bestaande desktop, of NVIDIA's DGX Spark Founders Edition van 4.699 dollar. En eventueel cloudkosten als je het lokale model laat opschalen naar een frontier-model. Perplexity's eigen meting op een lastige codeer-benchmark: lokaal alleen 59,6% tegen vrijwel nul marginale kosten, met cloudhulp 73,0% voor ongeveer 0,415 dollar per taak, en volledig in de cloud 82,4% voor 0,65 dollar per taak. Lokaal werk zelf verbruikt geen credits.

Hoe veilig is het voor mijn bedrijfsgegevens?

De opzet is streng en dat is de belangrijkste verkoopreden. Elke taak start op je apparaat. Gaat er iets naar een cloudmodel, dan gebeurt dat alleen na jouw expliciete toestemming, draait er eerst een classificatie over de uitgaande tekst die persoonsgegevens opspoort en zie je wat er zou vertrekken. Het cloudmodel krijgt alleen tekst terug te sturen en raakt je bestanden en gekoppelde apps niet aan. Code en tools draaien altijd in een afgeschermde omgeving; is die niet beschikbaar, dan schakelt het systeem zichzelf uit. Dat laatste is strenger dan gangbaar bij open-source-harnassen, die vaak met jouw volledige rechten draaien.

Welke alternatieven zijn er?

Wil je lokaal blijven maar zelf samenstellen: Ollama of LM Studio voor het model, met een open-source agent-harnas als Pi, Hermes of OpenClaw eromheen. NVIDIA meldde dat Hermes Agent en OpenClaw dezelfde vereenvoudigde lokale installatie krijgen. Wil je het gemak zonder hardware-investering: de gewone cloudversie van Perplexity Computer, of een vergelijkbare agent van een andere aanbieder, met een verwerkersovereenkomst als juridische borging in plaats van een fysieke grens. Wil je alleen documenten doorzoeken zonder agent: dan is een lokale zoek- of RAG-oplossing goedkoper en simpeler.

Bronnen

Waar deze informatie vandaan komt.