
De belangrijkste cijfers
- Spraakinvoer haalde in het Engels 153 woorden per minuut, tegenover 52 WPM op een touchscreentoetsenbord: 2,93× sneller. Ruan et al., arXiv, 2016/2018
- Dicteren was bovendien nauwkeuriger: 5,30% gecorrigeerde fouten bij spraak, tegenover 11,22% bij typen. Ruan et al., 2016/2018
- Zelfs de snelste typisten in een dataset van 136 miljoen toetsaanslagen halen 120 WPM of meer, nog altijd minder dan wat bij spraakinvoer is gemeten. Dhakal et al., CHI 2018
- In het Mandarijn haalde spraak 123 WPM, tegenover 43 WPM getypt: 2,87× sneller. Ruan et al., 2016/2018
- De beste gerapporteerde word error rate (WER, het woordfoutpercentage) op de Switchboard-set uit 2000 is 5,1%. Microsoft, 2017
- Whisper van OpenAI is getraind op 680.000 uur meertalige audio. Radford et al., 2022
- Bij vijf commerciële systemen was de gemiddelde word error rate 0,35 voor zwarte sprekers, tegenover 0,19 voor witte sprekers. Koenecke et al., PNAS, 2020
- Banen voor medisch transcribenten in de VS: 42.000 in 2025, prognose −4% tot 2035. US Bureau of Labor Statistics
- Rechtbankstenografen en live-ondertitelaars verdienen een mediaan loon van $72.420; de werkgelegenheid verandert naar verwachting 0% tot 2035. US Bureau of Labor Statistics
- Het aantal wekelijkse vergaderingen per gebruiker van Microsoft Teams steeg met 153% sinds het begin van de pandemie. Microsoft Work Trend Index, 2022
- 57% van de vergaderingen is een ad-hocgesprek zonder agenda-uitnodiging. Microsoft Work Trend Index, 2025
- Werknemers worden elke 2 minuten onderbroken, ongeveer 275 keer per dag. Microsoft Work Trend Index, 2025
- 60% van de Amerikaanse volwassenen leest de door AI gegenereerde samenvatting boven aan de zoekresultaten. Pew Research Center, juni 2026
- 49% van de Amerikaanse volwassenen gebruikt inmiddels AI-chatbots, tegenover 33% in 2024. Pew Research Center, juni 2026
- 19,95% van de bedrijven in de EU gebruikte AI in 2025; 7,22% gebruikte specifiek spraakherkenning. Eurostat
- Eén model dekt nu 1.107 talen voor spraakherkenning. Pratap et al., 2023
- 430 miljoen mensen hebben nu revalidatie nodig vanwege invaliderend gehoorverlies; in 2050 hebben naar verwachting 2,5 miljard mensen enige vorm van gehoorverlies. World Health Organization
- Met ambient AI-verslaglegging daalde de mediane tijd voor aantekeningen van 7,1 naar 6,1 minuten per consult, gemeten bij 1.547 clinici. JAMA Network Open, 2026
Hoeveel sneller is spreken dan typen?
Spraakinvoer kwam in het Engels uit op 153 woorden per minuut, tegenover 52 woorden per minuut op een touchscreentoetsenbord: 2,93× zo snel. In het Mandarijn mat hetzelfde onderzoek 123 WPM voor spraak tegenover 43 WPM getypt: 2,87× zo snel.
De uitkomst over nauwkeurigheid is wat de meeste mensen verkeerd onthouden. Spraak ging niet ten koste van de juistheid: het percentage gecorrigeerde fouten was 5,30% bij spraak, tegenover 11,22% bij het toetsenbord. Bij de niet-gecorrigeerde fouten was het omgekeerd: 1,30% bij spraak tegenover 0,79% bij typen.
De vergelijking zette Deep Speech 2 van Baidu af tegen het ingebouwde iOS-toetsenbord op een iPhone 6 Plus, onder laboratoriumomstandigheden en met korte berichten.
Ter context bij de typkant van die vergelijking: het grootste onderzoek naar alledaags typen, met 136 miljoen toetsaanslagen van 168.000 vrijwilligers, stelde vast dat de snelste typisten “snelheden halen van zelfs 120 WPM of meer”, terwijl de grootste en langzaamste groep typisten rond 46 WPM zat. Een typecursus maakt nauwelijks verschil: getrainde typisten waren gemiddeld maar 5 WPM sneller dan ongetrainde.
Het plafond doet er dus toe. Spraakinvoer met 153 WPM is niet alleen sneller dan gemiddeld typen; het is sneller dan de snelste typisten in een dataset van die omvang, en dat zonder oefening.
Bron: Vivek Dhakal, Anna Feit, Per Ola Kristensson, Antti Oulasvirta, “Observations on Typing from 136 Million Keystrokes”, CHI 2018, Aalto University.
Bron: Sherry Ruan, Jacob O. Wobbrock, Kenny Liou, Andrew Ng, James Landay, “Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones”, arXiv:1608.07323, ingediend in 2016, herzien in 2018.
Hoe nauwkeurig is spraakherkenning op haar best?
Het laagste veel aangehaalde benchmarkcijfer is een word error rate van 5,1% op de Switchboard-evaluatieset uit 2000, door Microsoft gerapporteerd in 2017. Let op wat dat getal wel en niet is: het gaat om telefoongesprekken onder benchmarkomstandigheden, niet om een garantie voor jouw vergaderruimte. De paper vergelijkt het resultaat wel met mensen en noemt het “gelijkwaardig aan het foutpercentage van meerdere transcribenten dat eerder voor dezelfde taak was gerapporteerd”.
Schaal is de andere helft van het verhaal. Whisper is getraind op 680.000 uur meertalige audio met multitask-supervisie: de overstap van stemtraining per gebruiker naar modellen die generaliseren vanuit zeer grote, rommelige datasets.
Bronnen: W. Xiong, L. Wu, F. Alleva, J. Droppo, X. Huang, A. Stolcke (Microsoft), “The Microsoft 2017 Conversational Speech Recognition System”, arXiv:1708.06073, 2017. A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, I. Sutskever (OpenAI), “Robust Speech Recognition via Large-Scale Weak Supervision”, arXiv:2212.04356, 2022.
Is spraakherkenning voor iedereen even nauwkeurig?
Nee. Bij vijf commerciële systemen van Amazon, Apple, Google, IBM en Microsoft was de gemiddelde word error rate 0,35 voor zwarte sprekers, tegenover 0,19 voor witte sprekers: bijna het dubbele foutpercentage bij dezelfde taak.
Het onderzoek gebruikte gestructureerde interviews met 42 witte sprekers en 73 zwarte sprekers in vijf Amerikaanse steden, samen goed voor 19,8 uur audio. Het verschil bleef bestaan toen beide groepen identieke zinnen uitspraken; de auteurs schrijven het daarom toe aan de onderliggende akoestische modellen en niet aan woordenschat of grammatica.
Voor iedereen die spraaksoftware uitbrengt is dit het belangrijkste cijfer op deze pagina: de nauwkeurigheid op een benchmark en de nauwkeurigheid voor je echte gebruikers zijn twee verschillende grootheden.
Bron: Allison Koenecke, Andrew Nam, Emily Lake, Joe Nudell, Minnie Quartey, Zion Mengesha, Connor Toups, John R. Rickford, Dan Jurafsky, Sharad Goel, “Racial disparities in automated speech recognition”, Proceedings of the National Academy of Sciences 117(14):7684–7689, 7 april 2020. doi:10.1073/pnas.1915768117 (vrij toegankelijke vermelding: PubMed)
Wat doet automatisering met transcriptiewerk?
Het aantal banen waarin alleen wordt getranscribeerd krimpt, terwijl banen waarin iemand certificeert of tolkt grotendeels overeind blijven. De prognoses van het US Bureau of Labor Statistics voor 2025–2035:
| Beroep | Banen (2025) | Mediaan loon (mei 2025) | Prognose 2025–35 |
|---|---|---|---|
| Medisch transcribenten | 42.000 | $40.410 ($19,43/uur) | −4% (−1.900 banen) |
| Rechtbankstenografen en live-ondertitelaars | 19.900 | $72.420 | 0% (geen verandering) |
| Tolken en vertalers | 73.900 | $60.170 | +2% (+1.500 banen) |
Rechtbankstenografie is het leerzame voorbeeld: de werkgelegenheid blijft gelijk, en toch worden er het komende decennium ongeveer 1.800 vacatures per jaar verwacht, vooral om mensen te vervangen die van beroep veranderen of stoppen met werken, en niet door groei.
Bron: US Bureau of Labor Statistics, Occupational Outlook Handbook: Medical Transcriptionists, Court Reporters and Simultaneous Captioners, Interpreters and Translators. Pagina’s voor het laatst gewijzigd op 27 augustus 2026.
Hoeveel van de werkweek gaat op aan vergaderingen?
De vergaderdruk nam eerst sterk toe en veranderde daarna van vorm. Microsoft mat 153% meer wekelijkse vergaderingen per Teams-gebruiker sinds het begin van de pandemie en, jaar op jaar, 46% meer overlappende (dubbel geboekte) vergaderingen per persoon.
De latere telemetrie van Microsoft beschrijft een dag die niet alleen vol is, maar vooral versnipperd:
- 57% van de vergaderingen is een ad-hocgesprek zonder agenda-uitnodiging.
- 50% van alle vergaderingen valt in twee blokken: 9–11 uur en 13–15 uur.
- Dinsdag is de drukste dag met 23% van de vergaderingen; vrijdag de rustigste met 16%.
- 1 op de 10 geplande vergaderingen wordt op het laatste moment ingepland.
- Bijna een derde van de vergaderingen beslaat meerdere tijdzones, 35% meer dan in 2021.
- Het aantal vergaderingen na 20.00 uur is met 16% gestegen ten opzichte van een jaar eerder.
- Grote vergaderingen met 65 of meer deelnemers zijn het snelst groeiende type.
- Werknemers worden elke 2 minuten onderbroken, ruwweg 275 keer per dag.
Dat patroon (ongepland, overlappend, buiten kantooruren) verklaart waarom notuleren niet meer werkt als het ervan afhangt dat iemand tijd heeft om te typen. Lees hoe vergaderingen vastleggen zonder bot werkt.
Bronnen: Microsoft, “Hybrid Work Is Just Work. Are We Doing It Wrong?”, Work Trend Index, 22 september 2022. Microsoft, “Breaking down the infinite workday”, speciaal rapport van de Work Trend Index, 17 juni 2025.
Bespaart notuleren met AI echt meetbaar tijd?
Ja, en het best gemeten bewijs komt uit de klinische verslaglegging. Bij 1.547 clinici en 16.149 observaties daalde de mediane tijd voor aantekeningen van 7,1 minuten naar 6,1 minuten per consult na de invoering van ambient AI-verslaglegging.
De gemodelleerde effecten waren kleiner, maar consistent: 0,26 minuut minder per notitie in de eerste maand, een aanhoudende extra maandelijkse daling van 0,38 minuut in verslaglegging buiten werktijd en een directe stijging van 7,40 relative value units per maand. Het onderzoek vond geen significante verandering in de score op het efficiëntieprofiel van clinici.
Eén kanttekening die herhaling verdient, omdat overzichten haar steevast weglaten: dit onderzoek mat de tijd voor verslaglegging en de productiviteit, niet burn-out. Cijfers die een daling van burn-out aan deze paper toeschrijven, staan er niet in.
Bron: “Ambient Artificial Intelligence Use and Clinician Documentation Burden, Productivity, and Efficiency”, JAMA Network Open, 29 mei 2026. jamanetwork.com (open access: PubMed Central)
Welke regels gelden voor AI bij sollicitatiegesprekken?
In New York City moeten werkgevers die een geautomatiseerde tool voor personeelsbeslissingen (automated employment decision tool) gebruiken, die tool in het voorgaande jaar aan een bias-audit hebben laten onderwerpen, een samenvatting van de auditresultaten publiceren en kandidaten ten minste 10 werkdagen voor gebruik informeren. Het Department of Consumer and Worker Protection handhaaft Local Law 144 of 2021 sinds 5 juli 2023.
Zit je zelf aan de kant van de kandidaat, dan lees je in onze gids over AI-assistenten voor sollicitatiegesprekken wat de tools doen en waar de grenzen liggen.
Bron: New York City Department of Consumer and Worker Protection, Automated Employment Decision Tools, Local Law 144 of 2021.
Hoeveel mensen en bedrijven gebruiken dit echt?
Ongeveer de helft van de volwassen Amerikanen gebruikt inmiddels AI-chatbots: 49% van de Amerikaanse volwassenen begin 2026, tegenover 33% in 2024; ChatGPT alleen stond in 2023 nog op 18%. De aandelen per platform: ChatGPT 44%, Gemini 24%, Copilot 17%, Meta AI 14%, Grok 8%, Claude 6% en Character.ai 3%.
Het cijfer met de grootste gevolgen voor iedereen die online publiceert: 60% van de Amerikaanse volwassenen zegt de door AI gegenereerde samenvattingen boven aan de zoekresultaten te lezen. De bron zijn waaruit die samenvattingen putten is inmiddels een distributiekanaal op zich.
Bron: Pew Research Center, “Americans and AI 2026: Chatbots, Smart Devices and Views on Impact”, 17 juni 2026; enquête onder 5.119 Amerikaanse volwassenen, afgenomen van 17 tot en met 23 februari 2026.
Aan de kant van organisaties gebruikt 88% van de ondervraagde organisaties AI op minstens één manier en gebruikt 70% generatieve AI in minstens één bedrijfsfunctie. Generatieve AI bereikte in drie jaar een adoptie van 53%, sneller dan de pc of het internet.
Bron: Stanford HAI, 2026 AI Index Report, hoofdstuk Economy.
De Europese cijfers komen van een statistiekbureau en niet uit een enquête van een leverancier, en zijn daarom de betere bron om te citeren. In 2025 gebruikte 19,95% van de bedrijven in de EU AI-technologieën, 6,47 procentpunt meer dan in 2024. Per technologie: tekstmining 11,75%, generatieve media 9,55%, natuurlijke-taalgeneratie en spraaksynthese 8,76% en spraakherkenning 7,22%.
De adoptie is zeer ongelijk verdeeld. Denemarken 42,03%, Finland 37,82% en Zweden 35,04% lopen voorop; Roemenië 5,21%, Polen 8,36% en Bulgarije 8,55% sluiten de rij. Naar omvang gebruikt 55,03% van de grote bedrijven AI, tegenover 30,36% van de middelgrote en 17% van de kleine.
Bron: Eurostat, “Use of artificial intelligence in enterprises”, Statistics Explained, referentiejaar 2025.
Hoeveel talen kan spraakherkenning aan?
Eén meertalig model dekt nu 1.107 talen voor spraakherkenning, en biedt spraaksynthese voor hetzelfde aantal. Op de FLEURS-benchmark is het volgens de auteurs goed voor “meer dan een halvering van de word error rate van Whisper op 54 talen”.
Dat is meer dan iets om mee te pronken: voor de meeste talen ter wereld heeft er nooit een bruikbare dicteerfunctie bestaan, en de beperking was altijd gelabelde data, niet het modelontwerp.
Bron: Vineel Pratap et al. (Meta AI), “Scaling Speech Technology to 1,000+ Languages”, arXiv:2305.13516, 2023.
De kant van de open data is kleiner dan mensen denken. Common Voice van Mozilla meldde 2.500 uur verzamelde audio in 38 talen waarvoor werd verzameld (29 in de toenmalige release), afkomstig van meer dan 50.000 bijdragers, en een gemiddelde verbetering van de character error rate van 5,99 ± 5,48 over twaalf doeltalen dankzij transfer learning.
Bron: Rosana Ardila et al. (Mozilla), “Common Voice: A Massively-Multilingual Speech Corpus”, arXiv:1912.06670, 2019, herzien in 2020. De cijfers zijn zoals ze toen zijn gepubliceerd; het corpus is sindsdien gegroeid.
Wie heeft transcriptie en ondertiteling het hardst nodig?
Meer dan 5% van de wereldbevolking (430 miljoen mensen, onder wie 34 miljoen kinderen) heeft op dit moment revalidatie nodig vanwege invaliderend gehoorverlies. Ongeveer 95,1 miljoen kinderen van 5–19 jaar leven met gehoorverlies. In 2050 hebben naar verwachting bijna 2,5 miljard mensen enige mate van gehoorverlies en hebben meer dan 700 miljoen mensen revalidatie nodig. Onbehandeld gehoorverlies brengt wereldwijd jaarlijks bijna 1 biljoen Amerikaanse dollar aan kosten met zich mee.
Bron: World Health Organization, factsheet “Deafness and hearing loss”, voor het laatst bijgewerkt op 3 maart 2026.
Ondertiteling wordt bovendien een wettelijke plicht in plaats van een vriendelijk gebaar. De definitieve regel van het Amerikaanse ministerie van Justitie uit 2024 verplicht websites en mobiele apps van staats- en lokale overheden om te voldoen aan WCAG 2.1 niveau AA, waar ondertiteling van video onder valt. Een tussentijdse regel (interim final rule) die op 20 april 2026 is gepubliceerd, verschoof de deadlines naar 26 april 2027 voor instanties met een verzorgingsgebied van 50.000 inwoners of meer, en naar 26 april 2028 voor kleinere instanties en special districts.
Bron: US Department of Justice, “Fact Sheet: New Rule on the Accessibility of Web Content and Mobile Apps Provided by State and Local Governments”. Definitieve regel onder ADA Title II, gepubliceerd op 24 april 2024; nalevingstermijnen verlengd door de tussentijdse regel (interim final rule) van 20 april 2026.
Zo citeer je deze pagina
Elk cijfer hierboven is van de organisatie die ernaast wordt genoemd: citeer die organisatie, niet ons. Wil je naar de verzameling zelf verwijzen:
ChadFlow, “Voice AI statistics 2026”, bijgewerkt op 6 oktober 2026. https://chadflow.app/nl/spraakherkenning-statistieken
Zie je hier een cijfer dat niet meer overeenkomt met de bron, of een bron die is verhuisd? Laat het ons weten via [email protected], dan corrigeren we het.
Veelgestelde vragen
Hoeveel sneller is spreken dan typen?
In een gecontroleerd onderzoek naar het invoeren van korte berichten op een iPhone haalde spraakinvoer in het Engels 153 woorden per minuut, tegenover 52 woorden per minuut op het touchscreentoetsenbord: 2,93 keer zo snel (Ruan et al., arXiv, 2016/2018).
Wat is de laagste word error rate op de Switchboard-benchmark?
Microsoft rapporteerde een word error rate van 5,1% op de Switchboard-evaluatieset uit 2000, in zijn paper uit 2017 over het systeem voor spraakherkenning in gesprekken.
Is spraakherkenning voor iedereen even nauwkeurig?
Nee. Bij vijf commerciële systemen was de gemiddelde word error rate 0,35 voor zwarte sprekers, tegenover 0,19 voor witte sprekers (Koenecke et al., PNAS, 2020).
Hoeveel banen voor medisch transcribenten zijn er nog in de VS?
42.000 in 2025, met een verwachte daling van 4% (een verlies van 1.900 banen) tussen 2025 en 2035, volgens het Occupational Outlook Handbook van het US Bureau of Labor Statistics.
Bespaart notuleren met AI echt tijd?
In een onderzoek onder 1.547 clinici daalde de mediane tijd voor aantekeningen per consult van 7,1 minuten naar 6,1 minuten na de invoering van ambient AI-verslaglegging (JAMA Network Open, 29 mei 2026).
Zet die 2,93× aan het werk.
ChadFlow doet dicteren, transcriptie van vergaderingen met sprekerlabels en live antwoorden, op Mac, Windows en iPhone.
Download ChadFlowMethode: Elk cijfer is op 12 september 2026 en opnieuw op 6 oktober 2026 gecontroleerd aan de hand van de bronpagina of de paper, en alleen opgenomen als het getal in de bron zelf stond. Prognoses van leveranciers over de marktomvang zijn bewust weggelaten: de gepubliceerde cijfers die we konden inzien, waren niet te verifiëren aan de hand van een primaire methodologie. Stond een veelherhaalde bewering niet in de paper waaraan ze wordt toegeschreven, zoals minder burn-out volgens het JAMA-onderzoek, dan zeggen we dat in plaats van haar te herhalen.