Serieuze AI draaien zonder cloud was tot nu toe iets voor bedrijven met een serverkast en een IT-afdeling. Deze week schoof die grens flink op: het Amerikaanse PrismML bracht Bonsai 27B uit, een AI-model van 27 miljard parameters dat in 3,9 tot 5,9 GB past — klein genoeg voor de laptop waar jij nu op werkt (Bron: PrismML). En Apple praat al met de maker. Wat betekent lokale AI voor jouw bedrijf, en wat kun je er vandaag mee?
Wat is er precies gebeurd?
PrismML, opgericht door onderzoekers van Caltech, comprimeerde het open model Qwen3.6 27B tot twee varianten: een kwaliteitsversie van 5,9 GB voor laptops en een mini-versie van 3,9 GB die zelfs op een recente iPhone past. Ter vergelijking: het origineel heeft ruwweg 54 GB nodig (Bron: PrismML). Volgens de maker gebruiken de gecomprimeerde modellen 10 tot 15 keer minder geheugen, reageren ze 6 tot 8 keer sneller en verbruiken ze 3 tot 6 keer minder energie dan de conventionele versie (Bron: CNBC).
Dat dit geen laboratorium-nieuwtje is, blijkt uit wie er meekijkt: PrismML-topman Babak Hassibi bevestigde tegenover CNBC dat Apple en andere bedrijven de modellen evalueren, in gesprekken die hij “pril” noemt. Het model zelf staat onder de Apache 2.0-licentie op Hugging Face — gratis, ook voor commercieel gebruik.
Beginner-tip:“lokaal draaien” betekent dat het AI-model als programma op je eigen computer staat, zoals Word of Excel. Je typt je vraag en de berekening gebeurt op je eigen apparaat — er gaat niets naar een server van OpenAI, Google of Anthropic.
Waarom zou je als ondernemer lokale AI willen?
Drie redenen, in oplopende volgorde van hoe vaak ze in de praktijk de doorslag geven. Ga je zelf een open model draaien met bedrijfsdata? Doe dat veilig met onze 5 checks voor open modellen.
Het werkt offline en zonder abonnement. Een lokaal model draait in de trein, op een klantlocatie zonder wifi en tijdens een storing bij je cloudprovider. En er is geen teller die meeloopt: als het model eenmaal op je machine staat, kost elke vraag alleen stroom.
Voorspelbare kosten. Wie AI in een werkproces bouwt — offertes samenvatten, binnenkomende mail sorteren, documenten rubriceren — betaalt bij cloudmodellen per verwerkt token. Dat loopt bij duizenden documenten op. Een lokaal model doet hetzelfde werk tegen nul variabele kosten; alleen de (eenmalige) hardware en je eigen tijd tellen. Hoe je die afweging maakt, staat uitgewerkt in ons complete AI-kostenplaatje voor het MKB.
Klantdata blijft binnen. Dit is voor de meeste bedrijven het zwaarstwegende argument. Personeelsdossiers, medische gegevens, juridische stukken, financiële administratie: bij een lokaal model verlaat die data je apparaat niet. Je AVG-verhaal wordt daarmee een stuk korter — geen verwerkersovereenkomst met een Amerikaanse AI-aanbieder nodig voor deze werkstromen, geen discussie over dataretentie. Niet toevallig noemt PrismML zelf privacygevoelige taken als de plek waar lokale modellen het eerst landen.
Wat kun je er in de praktijk mee — en wat nog niet?
Realistisch: een lokaal model van deze klasse is geen vervanging van GPT-5 of Claude voor je moeilijkste denkwerk. PrismML meet zelf dat de kwaliteitsversie 95% van de scores van het origineel behoudt en de mini-versie 90% — maar die gemiddelden verhullen een belangrijke uitschieter. Juist tool-gebruik, de vaardigheid die AI-agents nodig hebben om zelfstandig taken uit te voeren, zakt in de kleinste versie van 80 naar 66 punten (Bron: PrismML). Wil je een agent die zelfstandig je administratie bijwerkt, dan is de cloudroute voorlopig betrouwbaarder — hoe je die keuze maakt lees je in AI-agents betrouwbaar inzetten in je bedrijf.
Waar lokale modellen nu al goed genoeg voor zijn: samenvatten, herschrijven, rubriceren, vragen beantwoorden over aangeleverde documenten, en eerste concepten van teksten. Precies de routinetaken waar veel privacygevoelig materiaal doorheen gaat.
Gevorderden:het hybride model is waar dit naartoe beweegt — routinematige en privacygevoelige taken lokaal, alleen de zwaarste stappen naar een frontier-model in de cloud. PrismML positioneert Bonsai expliciet zo. Wie nu al een agent-werkstroom bouwt, kan die routering zelf inregelen: lokaal als default, cloud als escalatie.
Hoe begin je hier deze maand mee?
Niet door je ChatGPT- of Claude-abonnement op te zeggen. Wel zo:
Inventariseer eerst welke taken in je bedrijf zowel routinematig als privacygevoelig zijn — dat is het natuurlijke startpunt voor lokaal. Experimenteer daarna op één werklaptop met een lokaal model; onze gids Ollama op Windows: lokale AI draaien op je pc is daarvoor het laagdrempeligste startpunt, en wie een Mac heeft kan met LM Studio uit de voeten. Bonsai 27B zelf proberen kan ook, maar reken op dag-1-kinderziektes: gebruikers melden op Hacker News dat de modellen in populaire tools als LM Studio nog niet werken zonder aangepaste software van PrismML zelf (Bron: Hacker News). Geef dat een paar weken.
De richting is intussen helder. Toen de telefoon in je broekzak krachtig genoeg werd voor e-mail, verdween de vraag “moet ik hier iets mee” vanzelf. Lokale AI zit nu in die fase: nog even geduld voor de gereedschapskist volwassen is, maar de bedrijven die nu alvast inventariseren welke taken ze lokaal willen draaien, staan straks vooraan.
