Whisper lokaal transcriberen voor mkb: privacy, WER en de keuze versus cloud

Whisper lokaal transcriberen voor mkb klinkt simpel, maar de keuze hangt af van WER op Nederlands, hardware en wat je écht aan privacy wint.

· 24 juli, 2026 · 7 min lezen
In dit artikel

Whisper lokaal transcriberen voor mkb wordt vaak verkocht als de privacyoplossing, alsof het downloaden van een model je AVG-zorgen wegneemt. Dat klopt niet helemaal. Lokaal draaien kan een serieuze stap zijn, maar alleen als de hele keten klopt: audio-opname, opslag, model en nacontrole.

In dit artikel zet ik op een rij wanneer lokaal logisch is, wat large-v3 op Nederlands echt presteert, welke hardware je nodig hebt en wanneer een cloudtool met een verwerkersovereenkomst gewoon volstaat.

Werkplek voor lokaal transcriberen met Whisper op MacBook met studio-hoofdtelefoon USB-microfoon en SSD voor modellen

Wanneer is Whisper lokaal transcriberen voor mkb logisch?

Niet voor iedere opname. Het kost setup-tijd, hardware en menselijke nacontrole. Drie scenario’s waarin het in mijn ervaring wel verdedigbaar is.

Zorg en mondhygiëne. Patiëntgesprekken vallen onder bijzondere persoonsgegevens. Een cloudtool, ook één met DPA, voegt een extra schakel toe in de keten. Lokaal transcriberen op een versleutelde laptop verkleint dat risico aanzienlijk.

HR en sollicitatiegesprekken. Opnames bevatten persoonsgegevens, soms ook gevoelige informatie over gezondheid of achtergrond. Een lokaal proces met heldere bewaartermijn werkt hier vaak rustiger dan een US-cloudtool met een verwerkersovereenkomst die je elk jaar opnieuw moet nakijken.

Juridische opnames en notulen met onderhandelingen. Tegenpartijen, bedragen, strategie. Niet iets om aan een derde partij toe te vertrouwen.

Drie scenario’s waarin cloud met DPA prima volstaat: een algemene vergadering zonder gevoelige info, een podcast-opname die toch publiek wordt, en een interview voor een blogpost waarbij de gesproken tekst toch openbaar gaat.

De echte WER op Nederlands: wat large-v3 wel en niet doet

WER staat voor Word Error Rate, het percentage woorden dat het model fout transcribeert. Onafhankelijke testers en publieke ASR-benchmarks op GitHub noemen voor Whisper large-v3 op schone Nederlandse audio een nauwkeurigheid van ongeveer 92 tot 96 procent. Dat is geen marketingbelofte, dat zijn cijfers uit publieke vergelijkers.

Wat die cijfers betekenen in de praktijk:

  • Eén spreker, headset, rustige kamer: dicht bij de bovenkant van die range.
  • Twee sprekers door elkaar, telefoonopname, achtergrondgeluid: zakt snel naar 80 tot 85 procent.
  • Dialect (Zeeuws, Limburgs, Vlaams) of vakjargon: nog lager, soms onder 80 procent.

Whisper hallucineert bovendien bij stiltes. Een minuut zonder spraak kan opeens een hele alinea verzonnen tekst opleveren. Dat is een bekend probleem, gedocumenteerd in de OpenAI-repository zelf.

Vaste regel in mijn werk: geen transcript zonder steekproef van 10 procent door een mens. Dat is geen leuk advies, dat is gewoon de werkelijkheid van wat een AI-transcript is.

Whisper, whisper.cpp en Vibe: wat is het verschil

Drie namen die door elkaar gebruikt worden. Kort.

Whisper is het open-source model van OpenAI. Versies: tiny, base, small, medium, large-v2, large-v3. Hoe groter, hoe accurater en hoe meer rekenkracht nodig is.

whisper.cpp is de C++-port van Georgi Gerganov. Hij draait Whisper op CPU en Apple Silicon zonder een dure GPU. Voor de meeste mkb-bedrijven is dit de manier waarop lokaal draaien überhaupt haalbaar wordt.

Vibe is een gratis desktop-app (op basis van whisper.cpp en Tauri) die hetzelfde model achter een nette interface zet. Je kiest een audiobestand, kiest een model, klikt op start. Geen terminal nodig.

Voor wie technisch handig is: whisper.cpp direct geeft je meer controle. Voor wie gewoon een werkende oplossing wil: Vibe is de snelste weg.

Vibe app en whisper.cpp terminal naast elkaar voor lokale audio-transcriptie op macOS in het mkb

Hardware en setup: wat heb je echt nodig

Klanten lopen hier het vaakst vast. Ze proberen large-v3 op een vier jaar oude Windows-laptop met 8 GB RAM en concluderen dat lokaal draaien onwerkbaar is. Het ligt aan de hardware, niet aan Whisper.

Een ruwe richtlijn op basis van publieke benchmarks en eigen tests:

  • Apple Silicon (M1, M2, M3) met 16 GB RAM: large-v3 draait, een uur audio is klaar in ongeveer 3 tot 8 minuten.
  • Recente Intel/AMD laptop, 16 GB RAM, geen GPU: medium model werkt, large-v3 lukt maar duurt langer (20 tot 40 minuten per uur audio).
  • Oudere laptop, 8 GB RAM: tiny of base model, en dan accepteer je een lagere WER.
  • Eigen server met NVIDIA GPU: alles draait snel, maar dat is geen mkb-investering voor incidenteel werk.

De setup zelf is overzichtelijk. Vibe installeren is een paar minuten. whisper.cpp compileren op macOS is een terminalsessie van een kwartier. Op Windows is het iets meer werk, maar er zijn gebouwde releases beschikbaar.

Lokaal versus cloud: de kostenrekening eerlijk gemaakt

Cloud-transcriptie kost ergens tussen de 0,10 en 0,30 euro per minuut audio bij aanbieders als Sonix, TurboScribe en Otter. HappyScribe noemt expliciet EU-hosting en zit in een vergelijkbare range. Op honderd uur audio per jaar ben je dan al snel 600 tot 1.800 euro kwijt.

Lokaal kost je eenmalig setup-tijd (in de praktijk een tot drie uur als je het zelf doet, of een implementatie-sessie bij iemand zoals ik) en daarna alleen stroom en je eigen tijd. Geen abonnement, geen prijsstijgingen, geen “we hebben onze tarieven aangepast”-mail.

Tegenover die besparing staat: jij moet de hardware onderhouden, modelupdates volgen, en de nacontrole zelf organiseren. Voor één uur audio per maand is cloud goedkoper in totale moeite. Vanaf vijf uur audio per maand wint lokaal vaak op zowel kosten als privacy.

Privacy en AVG: wat lokaal oplost en wat niet

Dit is waar het misgaat in marketing. “Lokaal” wordt verkocht als “AVG-compliant”, en dat is een te makkelijke gelijkheid.

Wat lokaal wel oplost: data verlaat je apparaat niet. Geen Amerikaanse cloud, geen sub-processors, geen Cloud Act-risico. Voor patiëntgesprekken en HR-opnames is dat een serieuze stap.

Wat lokaal niet automatisch oplost:

  • Een transcript op een onversleutelde laptop blijft een AVG-risico.
  • Bewaartermijnen voor audio en transcripts moet je zelf vastleggen.
  • Wie toegang heeft tot de gegenereerde transcripts: rolverdeling regel je zelf.
  • Bij een verloren laptop telt encryptie pas als alles versleuteld is, niet alleen je documentenmap.

De Autoriteit Persoonsgegevens publiceert helder over AI en verwerkersovereenkomsten op autoriteitpersoonsgegevens.nl. Bij lokaal werk vervalt de DPA-verplichting voor de transcriptie zelf, maar de rest van je verwerkingen (opslag, doorgifte, bewaring) blijft staan.

Lokaal verkleint risico. Het maakt het niet weg. De rest van je AVG-keten moet ook op orde zijn, anders verschuif je het probleem alleen.

In mijn ervaring: drie valkuilen bij implementatie

Model te zwaar voor de laptop. Klanten kiezen large-v3 omdat de blog dat aanraadt, en wachten vervolgens vier uur op een uur audio. Medium is voor 80 procent van het werk net zo bruikbaar en draait drie keer sneller.

Slechte audio-pipeline. Een ingebouwde laptopmicrofoon op anderhalve meter afstand. Een Bluetooth-headset met compressie. Een gemixte conference-call zonder gesplitste sporen. Wie de invoer slecht regelt, krijgt onbruikbare uitvoer, hoe goed Whisper ook is.

Geen menselijke nacontrole. Het transcript ziet er overtuigend uit, dus belandt het ongelezen in een documentenmap. Drie maanden later blijkt een verzonnen alinea in een patiëntdossier te staan. Steekproef van 10 procent is geen luxe.

Nacontrole van Whisper transcript in text-editor met spell-check en handmatige correcties voor Nederlandse audio

Wat een implementatie-sessie kost

Een implementatie-sessie kost 95 euro per uur. In de praktijk zijn dat twee tot drie uur om Vibe of whisper.cpp werkend, gedocumenteerd en met een nacontrole-protocol op te leveren. Daarna ben je zelfstandig.

Wil je later kleine aanpassingen, of help bij een nieuwere modelversie? Dat valt onder het standaardtarief van 70 euro per uur. Geen abonnement, geen lock-in.

Wie liever cloud houdt en alleen wil weten of dat AVG-technisch verdedigbaar is, kan beter terecht bij een privacy-jurist. Lypii doet de implementatie, niet de juridische beoordeling.

Voor de keuze tussen verschillende modellen in bredere zin lees je verder in ChatGPT, Claude of Mistral kiezen in het mkb. Daar gaat het over de keuze per use-case, niet specifiek over transcriptie.

Stuur me wat je nu opneemt en welke hardware je hebt staan. Ik reageer binnen 4 uur op werkdagen.

Serhii Lypii
Gratis meedenken

Hulp bij Whisper lokaal opzetten

Stuur me wat je nu opneemt en welke laptop of server je hebt staan. Ik kijk of een lokale Whisper-setup verstandig is en wat het concreet vraagt aan tijd en hardware.

Stuur me je vraag
Vond je dit nuttig? Deel het:
FAQ

Vragen die ondernemers stellen

Werkt Whisper goed op Nederlands?
Op schone audio met large-v3 zit je rond 92 tot 96 procent nauwkeurigheid volgens publieke vergelijkers. Bij dialect, jargon of slechte microfoon zakt dat snel.
Heb ik een GPU nodig?
Niet per se. Met whisper.cpp op een recente Apple Silicon-chip of een degelijke Intel-laptop doe je een uur audio in een paar minuten tot een half uur, afhankelijk van het model.
Is lokaal automatisch AVG-conform?
Nee. Lokaal verkleint risico, maar je moet nog steeds opslag, toegangsbeheer en bewaartermijnen regelen. Een onversleutelde laptop blijft een probleem.
Welke modelvariant kiezen?
Voor productie: large-v3 als de hardware het toelaat, anders medium. Tiny en base zijn vooral voor demo's en eenvoudige opnames.
Wat doet Lypii hierbij?
Een implementatie-sessie van twee tot drie uur waarin de tool werkt, het protocol staat en jij zelfstandig verder kunt. Geen abonnement.
Serhii Lypii
Over de auteur

Serhii Lypii

Freelance webmaster · Terneuzen

Sinds 2012 werk ik met websites en leverde ik ruim 210 projecten op. Ik help mkb-ondernemers met onderhoud, snelheid, beveiliging en praktische automatisering. Nuchter, zonder hype.

Ik schreef dit artikel op en werkte het voor het laatst bij op .

Meer over Lypii
Even sparren over je site?

Loop je ergens tegenaan of twijfel je over je site? Ik denk graag mee — kies hieronder hoe je contact opneemt.

Reactie binnen 4 uur op werkdagen
Navigatie
Home Over mij Kennisbank
Contact
+31 6 39 56 93 03 serhii@lypii.nl WhatsApp
Stuur een bericht