Whisper lokaal transcriberen voor mkb wordt vaak verkocht als de privacyoplossing, alsof het downloaden van een model je AVG-zorgen wegneemt. Dat klopt niet helemaal. Lokaal draaien kan een serieuze stap zijn, maar alleen als de hele keten klopt: audio-opname, opslag, model en nacontrole.
In dit artikel zet ik op een rij wanneer lokaal logisch is, wat large-v3 op Nederlands echt presteert, welke hardware je nodig hebt en wanneer een cloudtool met een verwerkersovereenkomst gewoon volstaat.

Wanneer is Whisper lokaal transcriberen voor mkb logisch?
Niet voor iedere opname. Het kost setup-tijd, hardware en menselijke nacontrole. Drie scenario’s waarin het in mijn ervaring wel verdedigbaar is.
Zorg en mondhygiëne. Patiëntgesprekken vallen onder bijzondere persoonsgegevens. Een cloudtool, ook één met DPA, voegt een extra schakel toe in de keten. Lokaal transcriberen op een versleutelde laptop verkleint dat risico aanzienlijk.
HR en sollicitatiegesprekken. Opnames bevatten persoonsgegevens, soms ook gevoelige informatie over gezondheid of achtergrond. Een lokaal proces met heldere bewaartermijn werkt hier vaak rustiger dan een US-cloudtool met een verwerkersovereenkomst die je elk jaar opnieuw moet nakijken.
Juridische opnames en notulen met onderhandelingen. Tegenpartijen, bedragen, strategie. Niet iets om aan een derde partij toe te vertrouwen.
Drie scenario’s waarin cloud met DPA prima volstaat: een algemene vergadering zonder gevoelige info, een podcast-opname die toch publiek wordt, en een interview voor een blogpost waarbij de gesproken tekst toch openbaar gaat.
De echte WER op Nederlands: wat large-v3 wel en niet doet
WER staat voor Word Error Rate, het percentage woorden dat het model fout transcribeert. Onafhankelijke testers en publieke ASR-benchmarks op GitHub noemen voor Whisper large-v3 op schone Nederlandse audio een nauwkeurigheid van ongeveer 92 tot 96 procent. Dat is geen marketingbelofte, dat zijn cijfers uit publieke vergelijkers.
Wat die cijfers betekenen in de praktijk:
- Eén spreker, headset, rustige kamer: dicht bij de bovenkant van die range.
- Twee sprekers door elkaar, telefoonopname, achtergrondgeluid: zakt snel naar 80 tot 85 procent.
- Dialect (Zeeuws, Limburgs, Vlaams) of vakjargon: nog lager, soms onder 80 procent.
Whisper hallucineert bovendien bij stiltes. Een minuut zonder spraak kan opeens een hele alinea verzonnen tekst opleveren. Dat is een bekend probleem, gedocumenteerd in de OpenAI-repository zelf.
Vaste regel in mijn werk: geen transcript zonder steekproef van 10 procent door een mens. Dat is geen leuk advies, dat is gewoon de werkelijkheid van wat een AI-transcript is.
Whisper, whisper.cpp en Vibe: wat is het verschil
Drie namen die door elkaar gebruikt worden. Kort.
Whisper is het open-source model van OpenAI. Versies: tiny, base, small, medium, large-v2, large-v3. Hoe groter, hoe accurater en hoe meer rekenkracht nodig is.
whisper.cpp is de C++-port van Georgi Gerganov. Hij draait Whisper op CPU en Apple Silicon zonder een dure GPU. Voor de meeste mkb-bedrijven is dit de manier waarop lokaal draaien überhaupt haalbaar wordt.
Vibe is een gratis desktop-app (op basis van whisper.cpp en Tauri) die hetzelfde model achter een nette interface zet. Je kiest een audiobestand, kiest een model, klikt op start. Geen terminal nodig.
Voor wie technisch handig is: whisper.cpp direct geeft je meer controle. Voor wie gewoon een werkende oplossing wil: Vibe is de snelste weg.

Hardware en setup: wat heb je echt nodig
Klanten lopen hier het vaakst vast. Ze proberen large-v3 op een vier jaar oude Windows-laptop met 8 GB RAM en concluderen dat lokaal draaien onwerkbaar is. Het ligt aan de hardware, niet aan Whisper.
Een ruwe richtlijn op basis van publieke benchmarks en eigen tests:
- Apple Silicon (M1, M2, M3) met 16 GB RAM: large-v3 draait, een uur audio is klaar in ongeveer 3 tot 8 minuten.
- Recente Intel/AMD laptop, 16 GB RAM, geen GPU: medium model werkt, large-v3 lukt maar duurt langer (20 tot 40 minuten per uur audio).
- Oudere laptop, 8 GB RAM: tiny of base model, en dan accepteer je een lagere WER.
- Eigen server met NVIDIA GPU: alles draait snel, maar dat is geen mkb-investering voor incidenteel werk.
De setup zelf is overzichtelijk. Vibe installeren is een paar minuten. whisper.cpp compileren op macOS is een terminalsessie van een kwartier. Op Windows is het iets meer werk, maar er zijn gebouwde releases beschikbaar.
Lokaal versus cloud: de kostenrekening eerlijk gemaakt
Cloud-transcriptie kost ergens tussen de 0,10 en 0,30 euro per minuut audio bij aanbieders als Sonix, TurboScribe en Otter. HappyScribe noemt expliciet EU-hosting en zit in een vergelijkbare range. Op honderd uur audio per jaar ben je dan al snel 600 tot 1.800 euro kwijt.
Lokaal kost je eenmalig setup-tijd (in de praktijk een tot drie uur als je het zelf doet, of een implementatie-sessie bij iemand zoals ik) en daarna alleen stroom en je eigen tijd. Geen abonnement, geen prijsstijgingen, geen “we hebben onze tarieven aangepast”-mail.
Tegenover die besparing staat: jij moet de hardware onderhouden, modelupdates volgen, en de nacontrole zelf organiseren. Voor één uur audio per maand is cloud goedkoper in totale moeite. Vanaf vijf uur audio per maand wint lokaal vaak op zowel kosten als privacy.
Privacy en AVG: wat lokaal oplost en wat niet
Dit is waar het misgaat in marketing. “Lokaal” wordt verkocht als “AVG-compliant”, en dat is een te makkelijke gelijkheid.
Wat lokaal wel oplost: data verlaat je apparaat niet. Geen Amerikaanse cloud, geen sub-processors, geen Cloud Act-risico. Voor patiëntgesprekken en HR-opnames is dat een serieuze stap.
Wat lokaal niet automatisch oplost:
- Een transcript op een onversleutelde laptop blijft een AVG-risico.
- Bewaartermijnen voor audio en transcripts moet je zelf vastleggen.
- Wie toegang heeft tot de gegenereerde transcripts: rolverdeling regel je zelf.
- Bij een verloren laptop telt encryptie pas als alles versleuteld is, niet alleen je documentenmap.
De Autoriteit Persoonsgegevens publiceert helder over AI en verwerkersovereenkomsten op autoriteitpersoonsgegevens.nl. Bij lokaal werk vervalt de DPA-verplichting voor de transcriptie zelf, maar de rest van je verwerkingen (opslag, doorgifte, bewaring) blijft staan.
Lokaal verkleint risico. Het maakt het niet weg. De rest van je AVG-keten moet ook op orde zijn, anders verschuif je het probleem alleen.
In mijn ervaring: drie valkuilen bij implementatie
Model te zwaar voor de laptop. Klanten kiezen large-v3 omdat de blog dat aanraadt, en wachten vervolgens vier uur op een uur audio. Medium is voor 80 procent van het werk net zo bruikbaar en draait drie keer sneller.
Slechte audio-pipeline. Een ingebouwde laptopmicrofoon op anderhalve meter afstand. Een Bluetooth-headset met compressie. Een gemixte conference-call zonder gesplitste sporen. Wie de invoer slecht regelt, krijgt onbruikbare uitvoer, hoe goed Whisper ook is.
Geen menselijke nacontrole. Het transcript ziet er overtuigend uit, dus belandt het ongelezen in een documentenmap. Drie maanden later blijkt een verzonnen alinea in een patiëntdossier te staan. Steekproef van 10 procent is geen luxe.

Wat een implementatie-sessie kost
Een implementatie-sessie kost 95 euro per uur. In de praktijk zijn dat twee tot drie uur om Vibe of whisper.cpp werkend, gedocumenteerd en met een nacontrole-protocol op te leveren. Daarna ben je zelfstandig.
Wil je later kleine aanpassingen, of help bij een nieuwere modelversie? Dat valt onder het standaardtarief van 70 euro per uur. Geen abonnement, geen lock-in.
Wie liever cloud houdt en alleen wil weten of dat AVG-technisch verdedigbaar is, kan beter terecht bij een privacy-jurist. Lypii doet de implementatie, niet de juridische beoordeling.
Voor de keuze tussen verschillende modellen in bredere zin lees je verder in ChatGPT, Claude of Mistral kiezen in het mkb. Daar gaat het over de keuze per use-case, niet specifiek over transcriptie.
Stuur me wat je nu opneemt en welke hardware je hebt staan. Ik reageer binnen 4 uur op werkdagen.



