
I punti chiave
- La dettatura vocale ha raggiunto 153 parole al minuto in inglese contro 52 WPM con una tastiera touchscreen: 2,93 volte più veloce. Ruan et al., arXiv, 2016/2018
- La dettatura era anche più accurata: tasso di errori corretti del 5,30% per la voce contro l'11,22% per la tastiera. Ruan et al., 2016/2018
- Anche le persone più veloci alla tastiera, in un dataset da 136 milioni di battute, arrivano a 120 WPM o più: comunque meno della dettatura vocale misurata. Dhakal et al., CHI 2018
- In mandarino la voce ha raggiunto 123 WPM contro 43 WPM alla tastiera: 2,87 volte più veloce. Ruan et al., 2016/2018
- Il miglior tasso di errore sulle parole (WER) riportato sul set Switchboard 2000 è del 5,1%. Microsoft, 2017
- Whisper di OpenAI è stato addestrato su 680.000 ore di audio multilingue. Radford et al., 2022
- In cinque sistemi commerciali, il tasso medio di errore sulle parole è stato di 0,35 per i parlanti neri contro 0,19 per i parlanti bianchi. Koenecke et al., PNAS, 2020
- Posti di lavoro da trascrittore medico negli Stati Uniti: 42.000 nel 2025, con una previsione del −4% entro il 2035. US Bureau of Labor Statistics
- Stenotipisti giudiziari e sottotitolatori in simultanea hanno una retribuzione mediana di $72.420, con una variazione prevista dell'occupazione dello 0% fino al 2035. US Bureau of Labor Statistics
- Le riunioni settimanali per utente di Microsoft Teams sono aumentate del 153% dall'inizio della pandemia. Microsoft Work Trend Index, 2022
- Il 57% delle riunioni è fatto di chiamate improvvisate, senza invito a calendario. Microsoft Work Trend Index, 2025
- I lavoratori vengono interrotti ogni 2 minuti, cioè circa 275 volte al giorno. Microsoft Work Trend Index, 2025
- Il 60% degli adulti statunitensi legge il riepilogo generato dall'AI in cima ai risultati di ricerca. Pew Research Center, giugno 2026
- Il 49% degli adulti statunitensi oggi usa chatbot AI, contro il 33% del 2024. Pew Research Center, giugno 2026
- Il 19,95% delle imprese dell'UE ha usato l'AI nel 2025; il 7,22% ha usato nello specifico il riconoscimento vocale. Eurostat
- Oggi un solo modello copre 1.107 lingue per il riconoscimento vocale. Pratap et al., 2023
- 430 milioni di persone hanno oggi bisogno di riabilitazione per una perdita uditiva invalidante; si prevede che entro il 2050 saranno 2,5 miliardi ad avere una qualche perdita dell'udito. World Health Organization
- Con la documentazione clinica affidata all'AI ambientale, il tempo mediano dedicato alle note è sceso da 7,1 a 6,1 minuti per visita su 1.547 clinici. JAMA Network Open, 2026
Quanto è più veloce parlare che scrivere alla tastiera?
La dettatura vocale è stata misurata a 153 parole al minuto in inglese contro 52 parole al minuto su una tastiera touchscreen: 2,93× più veloce. In mandarino lo stesso studio ha misurato 123 WPM per la voce contro 43 WPM alla tastiera: 2,87× più veloce.
Il risultato sull'accuratezza è quello che quasi tutti riportano male. La voce non ha comportato un compromesso sulla correttezza: il tasso di errori corretti è stato del 5,30% per la voce contro l'11,22% per la tastiera. I tassi di errori non corretti andavano nella direzione opposta: 1,30% per la voce contro 0,79% per la tastiera.
Il confronto ha messo Deep Speech 2 di Baidu contro la tastiera integrata di iOS su un iPhone 6 Plus, in condizioni di laboratorio e per messaggi brevi.
Per inquadrare il lato tastiera di quel confronto: il più grande studio sulla scrittura quotidiana alla tastiera (136 milioni di battute da 168.000 volontari) ha rilevato che le persone più veloci “raggiungono velocità anche di 120 WPM o più”, mentre il gruppo più numeroso e più lento si attestava intorno a 46 WPM. La formazione specifica sposta poco: chi aveva seguito un corso di dattilografia era in media più veloce di soli 5 WPM rispetto a chi non l'aveva fatto.
Quindi il tetto conta. La dettatura vocale a 153 WPM non è solo più veloce della scrittura media alla tastiera: è più veloce delle persone più rapide in un dataset di quelle dimensioni, e senza allenamento.
Fonte: Vivek Dhakal, Anna Feit, Per Ola Kristensson, Antti Oulasvirta, “Observations on Typing from 136 Million Keystrokes”, CHI 2018, Aalto University.
Fonte: Sherry Ruan, Jacob O. Wobbrock, Kenny Liou, Andrew Ng, James Landay, “Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones”, arXiv:1608.07323, inviato nel 2016, rivisto nel 2018.
Quanto è accurato il riconoscimento vocale al suo meglio?
Il valore di benchmark più basso tra quelli ampiamente citati è un tasso di errore sulle parole (WER) del 5,1% sul set di valutazione Switchboard 2000, riportato da Microsoft nel 2017. Attenzione a cosa è e cosa non è quel numero: riguarda parlato telefonico conversazionale in condizioni di benchmark, non è una garanzia per la tua sala riunioni. Un confronto con le persone, però, l'articolo lo fa: definisce il risultato “alla pari con il tasso di errore multi-trascrittore riportato in precedenza per lo stesso compito”.
La scala è l'altra metà della storia. Whisper è stato addestrato su 680.000 ore di supervisione multilingue e multitask: è il passaggio dall'addestramento sulla voce del singolo utente a modelli che generalizzano a partire da dataset enormi e disordinati.
Fonti: W. Xiong, L. Wu, F. Alleva, J. Droppo, X. Huang, A. Stolcke (Microsoft), “The Microsoft 2017 Conversational Speech Recognition System”, arXiv:1708.06073, 2017. A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, I. Sutskever (OpenAI), “Robust Speech Recognition via Large-Scale Weak Supervision”, arXiv:2212.04356, 2022.
Il riconoscimento vocale è accurato allo stesso modo per tutti?
No. In cinque sistemi commerciali di Amazon, Apple, Google, IBM e Microsoft, il tasso medio di errore sulle parole è stato di 0,35 per i parlanti neri contro 0,19 per i parlanti bianchi: quasi il doppio degli errori per lo stesso compito.
Lo studio ha usato interviste strutturate con 42 parlanti bianchi e 73 parlanti neri in cinque città statunitensi, per un totale di 19,8 ore di audio. Il divario è rimasto anche quando i due gruppi pronunciavano frasi identiche, cosa che gli autori attribuiscono ai modelli acustici sottostanti più che al lessico o alla grammatica.
Per chiunque distribuisca software vocale è il numero più importante di questa pagina: l'accuratezza nei benchmark e l'accuratezza per i tuoi utenti reali sono due grandezze diverse.
Fonte: Allison Koenecke, Andrew Nam, Emily Lake, Joe Nudell, Minnie Quartey, Zion Mengesha, Connor Toups, John R. Rickford, Dan Jurafsky, Sharad Goel, “Racial disparities in automated speech recognition”, Proceedings of the National Academy of Sciences 117(14):7684–7689, 7 aprile 2020. doi:10.1073/pnas.1915768117 (scheda ad accesso libero: PubMed)
Che effetto ha l'automazione sul lavoro di trascrizione?
Sta riducendo i lavori che consistono solo nel trascrivere, lasciando in gran parte intatti quelli che certificano o interpretano. Le proiezioni dello US Bureau of Labor Statistics per il 2025–2035:
| Professione | Posti di lavoro (2025) | Retribuzione mediana (maggio 2025) | Previsione 2025–35 |
|---|---|---|---|
| Trascrittori medici | 42.000 | $40.410 ($19,43/ora) | −4% (−1.900 posti) |
| Stenotipisti giudiziari e sottotitolatori in simultanea | 19.900 | $72.420 | 0% (nessuna variazione) |
| Interpreti e traduttori | 73.900 | $60.170 | +2% (+1.500 posti) |
La stenotipia giudiziaria è il caso istruttivo: l'occupazione è stabile, eppure si prevedono circa 1.800 posizioni aperte ogni anno nel decennio, dovute soprattutto alla sostituzione di chi cambia professione o esce dal mercato del lavoro, più che alla crescita.
Fonte: US Bureau of Labor Statistics, Occupational Outlook Handbook: Medical Transcriptionists, Court Reporters and Simultaneous Captioners, Interpreters and Translators. Pagine modificate l'ultima volta il 27 agosto 2026.
Quanta parte della settimana lavorativa finisce in riunione?
Il carico di riunioni è cresciuto bruscamente e poi ha cambiato forma. Microsoft ha misurato un aumento del 153% delle riunioni settimanali per utente di Teams dall'inizio della pandemia, e un aumento del 46% delle riunioni sovrapposte (fissate nello stesso orario) per persona su base annua.
La sua telemetria successiva descrive una giornata frammentata, più che semplicemente piena:
- Il 57% delle riunioni è fatto di chiamate improvvisate, senza invito a calendario.
- Il 50% di tutte le riunioni cade in due fasce orarie: 9–11 e 13–15.
- Il martedì è il giorno più carico, con il 23% delle riunioni; il venerdì il più leggero, con il 16%.
- 1 su 10 tra le riunioni pianificate viene fissata all'ultimo minuto.
- Quasi un terzo delle riunioni coinvolge più fusi orari, in aumento del 35% dal 2021.
- Le riunioni dopo le 20 sono aumentate del 16% su base annua.
- Le grandi riunioni con 65 o più partecipanti sono il tipo che cresce più in fretta.
- I lavoratori vengono interrotti ogni 2 minuti, più o meno 275 volte al giorno.
Questo schema (riunioni non pianificate, sovrapposte, fuori orario) è il motivo per cui prendere appunti contando su qualcuno libero di scrivere non funziona più. Guarda come funziona la trascrizione delle riunioni senza bot.
Fonti: Microsoft, “Hybrid Work Is Just Work. Are We Doing It Wrong?”, Work Trend Index, 22 settembre 2022. Microsoft, “Breaking down the infinite workday”, rapporto speciale del Work Trend Index, 17 giugno 2025.
Prendere appunti con l'AI fa davvero risparmiare tempo in modo misurabile?
Sì, e le prove misurate meglio arrivano dalla documentazione clinica. Su 1.547 clinici e 16.149 osservazioni, il tempo mediano dedicato alle note è sceso da 7,1 minuti a 6,1 minuti per visita dopo l'introduzione della documentazione con AI ambientale.
Gli effetti stimati dal modello erano più piccoli ma coerenti: una riduzione di 0,26 minuti per nota nel primo mese, un'ulteriore riduzione mensile, stabile nel tempo, di 0,38 minuti nella documentazione fuori orario e un aumento immediato di 7,40 unità di valore relativo (relative value units) al mese. Lo studio non ha rilevato variazioni significative nel punteggio del profilo di efficienza dei clinici.
Un'avvertenza che vale la pena ripetere, perché le raccolte di statistiche la omettono regolarmente: questo studio ha misurato tempo di documentazione e produttività, non il burnout. I dati che attribuiscono a questo articolo una riduzione del burnout, nell'articolo non ci sono.
Fonte: “Ambient Artificial Intelligence Use and Clinician Documentation Burden, Productivity, and Efficiency”, JAMA Network Open, 29 maggio 2026. jamanetwork.com (accesso aperto: PubMed Central)
Quali regole valgono per l'AI nei colloqui di selezione?
A New York City, i datori di lavoro che usano uno strumento automatizzato per le decisioni di assunzione (automated employment decision tool) devono averlo sottoposto a un bias audit nell'anno precedente, devono pubblicare una sintesi dei risultati dell'audit e devono avvisare i candidati almeno 10 giorni lavorativi prima dell'uso. Il Department of Consumer and Worker Protection ha iniziato ad applicare la Local Law 144 of 2021 il 5 luglio 2023.
Se sei dal lato del candidato, la nostra guida agli assistenti AI per colloqui di lavoro spiega cosa fanno questi strumenti e dove stanno i limiti.
Fonte: New York City Department of Consumer and Worker Protection, Automated Employment Decision Tools, Local Law 144 of 2021.
Quante persone e quante aziende usano davvero queste tecnologie?
Circa metà della popolazione adulta degli Stati Uniti oggi usa chatbot AI: il 49% degli adulti statunitensi all'inizio del 2026, contro il 33% del 2024, mentre nel 2023 il solo ChatGPT era al 18%. Le quote per piattaforma: ChatGPT 44%, Gemini 24%, Copilot 17%, Meta AI 14%, Grok 8%, Claude 6% e Character.ai 3%.
Il numero con le conseguenze più ampie per chiunque pubblichi online: il 60% degli adulti statunitensi dice di leggere i riepiloghi generati dall'AI in cima ai risultati di ricerca. Essere la fonte da cui quei riepiloghi attingono è ormai un canale di distribuzione a sé.
Fonte: Pew Research Center, “Americans and AI 2026: Chatbots, Smart Devices and Views on Impact”, 17 giugno 2026; sondaggio su 5.119 adulti statunitensi, condotto dal 17 al 23 febbraio 2026.
Sul fronte delle organizzazioni, l'88% di quelle intervistate usa l'AI in almeno un ambito e il 70% usa l'AI generativa in almeno una funzione aziendale. L'AI generativa ha raggiunto il 53% di adozione in tre anni, più in fretta dei personal computer o di internet.
Fonte: Stanford HAI, 2026 AI Index Report, capitolo Economy.
I dati europei arrivano da un istituto di statistica e non da un sondaggio di un produttore, il che li rende la citazione migliore. Nel 2025 il 19,95% delle imprese dell'UE ha usato tecnologie di AI, in aumento di 6,47 punti percentuali rispetto al 2024. Per tecnologia: text mining 11,75%, generazione di contenuti multimediali 9,55%, generazione del linguaggio naturale e sintesi vocale 8,76% e riconoscimento vocale 7,22%.
L'adozione è tutt'altro che uniforme. In testa ci sono Danimarca 42,03%, Finlandia 37,82% e Svezia 35,04%; in coda Romania 5,21%, Polonia 8,36% e Bulgaria 8,55%. Per dimensione, usa l'AI il 55,03% delle grandi imprese contro il 30,36% delle medie e il 17% delle piccole.
Fonte: Eurostat, “Use of artificial intelligence in enterprises”, Statistics Explained, anno di riferimento 2025.
Quante lingue riesce a gestire il riconoscimento vocale?
Oggi un unico modello multilingue copre 1.107 lingue per il riconoscimento vocale, con la sintesi vocale per lo stesso numero di lingue. Sul benchmark FLEURS “riduce di oltre la metà il tasso di errore sulle parole di Whisper su 54 lingue”.
Conta al di là del primato: la maggior parte delle lingue del mondo non ha mai avuto una dettatura utilizzabile, e il vincolo è sempre stato la disponibilità di dati etichettati, più che la progettazione dei modelli.
Fonte: Vineel Pratap et al. (Meta AI), “Scaling Speech Technology to 1,000+ Languages”, arXiv:2305.13516, 2023.
Il lato open data è più piccolo di quanto si pensi. Common Voice di Mozilla ha riportato 2.500 ore di audio raccolto, con 38 lingue in fase di raccolta (29 nella release allora corrente) e oltre 50.000 contributori, e un miglioramento medio del tasso di errore sui caratteri di 5,99 ± 5,48 su dodici lingue target grazie al transfer learning.
Fonte: Rosana Ardila et al. (Mozilla), “Common Voice: A Massively-Multilingual Speech Corpus”, arXiv:1912.06670, 2019, rivisto nel 2020. I dati sono quelli pubblicati allora; da quel momento il corpus è cresciuto.
Chi ha più bisogno di trascrizione e sottotitoli?
Oggi oltre il 5% della popolazione mondiale, cioè 430 milioni di persone, di cui 34 milioni di bambini, ha bisogno di riabilitazione per una perdita uditiva invalidante. Circa 95,1 milioni di bambini e ragazzi tra i 5 e i 19 anni convivono con una perdita dell'udito. Si prevede che entro il 2050 quasi 2,5 miliardi di persone avranno un qualche grado di perdita uditiva e che più di 700 milioni avranno bisogno di riabilitazione. La perdita uditiva non trattata comporta un costo globale annuo di quasi 1.000 miliardi di dollari USA.
Fonte: World Health Organization, scheda informativa “Deafness and hearing loss”, ultimo aggiornamento 3 marzo 2026.
I sottotitoli stanno inoltre diventando un obbligo di legge, non più una cortesia. La final rule del 2024 dello US Department of Justice impone ai siti web e alle app mobili delle amministrazioni statali e locali di rispettare le WCAG 2.1 livello AA, che comprendono i sottotitoli per i video. Un'interim final rule pubblicata il 20 aprile 2026 ha spostato le scadenze al 26 aprile 2027 per gli enti che servono popolazioni di 50.000 persone o più, e al 26 aprile 2028 per gli enti più piccoli e i distretti speciali.
Fonte: US Department of Justice, “Fact Sheet: New Rule on the Accessibility of Web Content and Mobile Apps Provided by State and Local Governments”. Final rule ADA Title II pubblicata il 24 aprile 2024; termini di adeguamento prorogati dall'interim final rule pubblicata il 20 aprile 2026.
Come citare questa pagina
Ogni statistica qui sopra appartiene all'organizzazione indicata accanto: cita loro, non noi. Se vuoi fare riferimento alla raccolta in sé:
ChadFlow, “Statistiche sul riconoscimento vocale 2026”, aggiornato il 6 ottobre 2026. https://chadflow.app/it/statistiche-riconoscimento-vocale
Se trovi qui un dato che non corrisponde più alla sua fonte, o una fonte che è stata spostata, scrivici a [email protected] e lo correggeremo.
Domande frequenti
Quanto è più veloce parlare che scrivere alla tastiera?
In uno studio controllato sulla scrittura di messaggi brevi su un iPhone, la dettatura vocale ha raggiunto 153 parole al minuto in inglese contro 52 parole al minuto con la tastiera touchscreen: 2,93 volte più veloce (Ruan et al., arXiv, 2016/2018).
Qual è il tasso di errore sulle parole (WER) più basso sul benchmark Switchboard?
Microsoft ha riportato un tasso di errore sulle parole del 5,1% sul set di valutazione Switchboard 2000 nel suo articolo del 2017 sul sistema di riconoscimento del parlato conversazionale.
Il riconoscimento vocale è accurato allo stesso modo per tutti?
No. In cinque sistemi commerciali, il tasso medio di errore sulle parole è stato di 0,35 per i parlanti neri contro 0,19 per i parlanti bianchi (Koenecke et al., PNAS, 2020).
Quanti posti di lavoro da trascrittore medico restano negli Stati Uniti?
42.000 nel 2025, con un calo previsto del 4% (una perdita di 1.900 posti) tra il 2025 e il 2035, secondo l'Occupational Outlook Handbook dello US Bureau of Labor Statistics.
Prendere appunti con l'AI fa davvero risparmiare tempo?
In uno studio su 1.547 clinici, il tempo mediano dedicato alle note per visita è sceso da 7,1 minuti a 6,1 minuti dopo l'introduzione della documentazione con AI ambientale (JAMA Network Open, 29 maggio 2026).
Metti a frutto quel 2,93×.
ChadFlow fa dettatura, trascrizione delle riunioni con etichette dei parlanti e risposte live, su Mac, Windows e iPhone.
Scarica ChadFlowMetodo: ogni dato è stato verificato sulla pagina o sull'articolo di origine il 12 settembre 2026 e di nuovo il 6 ottobre 2026, ed è stato incluso solo se il numero compariva nella fonte stessa. Le proiezioni dei produttori sulle dimensioni del mercato sono state escluse di proposito: i dati pubblicati a cui abbiamo potuto accedere non erano verificabili rispetto a una metodologia primaria. Dove un'affermazione molto ripetuta non era presente nell'articolo a cui viene attribuita, come la riduzione del burnout nello studio JAMA, lo diciamo invece di ripeterla.