
Chiffres clés
- La saisie vocale a atteint 153 mots par minute en anglais, contre 52 mots/min sur un clavier tactile, soit 2,93 fois plus vite. Ruan et al., arXiv, 2016/2018
- La dictée vocale était aussi plus précise : 5,30 % de taux d'erreurs corrigées à la voix, contre 11,22 % au clavier. Ruan et al., 2016/2018
- Même les personnes qui tapent le plus vite, dans un jeu de données de 136 millions de frappes, atteignent 120 mots/min ou plus, ce qui reste en deçà de la saisie vocale mesurée. Dhakal et al., CHI 2018
- En mandarin, la voix a atteint 123 mots/min, contre 43 mots/min au clavier, soit 2,87 fois plus vite. Ruan et al., 2016/2018
- Le meilleur taux d'erreur de mots (WER) publié sur le jeu de test Switchboard 2000 est de 5,1 %. Microsoft, 2017
- Whisper, le modèle d'OpenAI, a été entraîné sur 680 000 heures d'audio multilingue. Radford et al., 2022
- Sur cinq systèmes commerciaux, le taux d'erreur de mots moyen était de 0,35 pour les locuteurs noirs, contre 0,19 pour les locuteurs blancs. Koenecke et al., PNAS, 2020
- Emplois de transcripteurs médicaux aux États-Unis : 42 000 en 2025, évolution prévue de −4 % d'ici 2035. US Bureau of Labor Statistics
- Les sténographes judiciaires et les sous-titreurs en direct gagnent un salaire médian de 72 420 $, pour une évolution prévue de l'emploi de 0 % d'ici 2035. US Bureau of Labor Statistics
- Le nombre de réunions hebdomadaires par utilisateur de Microsoft Teams a augmenté de 153 % depuis le début de la pandémie. Microsoft Work Trend Index, 2022
- 57 % des réunions sont des appels improvisés, sans invitation dans l'agenda. Microsoft Work Trend Index, 2025
- Les salariés sont interrompus toutes les 2 minutes, soit environ 275 fois par jour. Microsoft Work Trend Index, 2025
- 60 % des adultes américains lisent le résumé généré par IA en tête des résultats de recherche. Pew Research Center, juin 2026
- 49 % des adultes américains utilisent désormais des chatbots d'IA, contre 33 % en 2024. Pew Research Center, juin 2026
- 19,95 % des entreprises de l'UE utilisaient l'IA en 2025 ; 7,22 % utilisaient précisément la reconnaissance vocale. Eurostat
- Un seul modèle couvre désormais 1 107 langues en reconnaissance vocale. Pratap et al., 2023
- 430 millions de personnes ont aujourd'hui besoin de services de réadaptation pour une déficience auditive incapacitante ; 2,5 milliards devraient présenter une perte d'audition à des degrés divers d'ici 2050. World Health Organization (OMS)
- Avec la documentation par IA ambiante, le temps médian consacré aux notes est passé de 7,1 à 6,1 minutes par consultation chez 1 547 cliniciens. JAMA Network Open, 2026
De combien la voix est-elle plus rapide que le clavier ?
La saisie vocale a été mesurée à 153 mots par minute en anglais, contre 52 mots par minute sur un clavier tactile, soit une vitesse multipliée par 2,93. En mandarin, la même étude a mesuré 123 mots/min à la voix contre 43 mots/min au clavier, soit une vitesse multipliée par 2,87.
C'est sur la précision que l'on se trompe le plus souvent. La voix ne sacrifiait pas l'exactitude : le taux d'erreurs corrigées était de 5,30 % à la voix, contre 11,22 % au clavier. Les taux d'erreurs non corrigées allaient dans l'autre sens : 1,30 % à la voix contre 0,79 % au clavier.
La comparaison opposait Deep Speech 2, de Baidu, au clavier intégré d'iOS sur un iPhone 6 Plus, en conditions de laboratoire et pour des messages courts.
Pour situer le côté clavier de cette comparaison, la plus vaste étude sur la frappe au quotidien (136 millions de frappes recueillies auprès de 168 000 volontaires) a montré que les personnes les plus rapides « atteignent même 120 mots/min, voire davantage », tandis que le groupe le plus nombreux, qui est aussi le plus lent, tournait autour de 46 mots/min. La formation n'y change presque rien : les personnes formées à la dactylographie n'allaient en moyenne que 5 mots/min plus vite que les autres.
Le plafond compte donc. À 153 mots/min, la saisie vocale ne dépasse pas seulement la frappe moyenne : elle dépasse, sans entraînement, les personnes les plus rapides d'un jeu de données de cette taille.
Source : Vivek Dhakal, Anna Feit, Per Ola Kristensson, Antti Oulasvirta, « Observations on Typing from 136 Million Keystrokes », CHI 2018, Aalto University.
Source : Sherry Ruan, Jacob O. Wobbrock, Kenny Liou, Andrew Ng, James Landay, « Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones », arXiv:1608.07323, soumis en 2016, révisé en 2018.
Quelle précision la reconnaissance vocale atteint-elle au mieux ?
Le chiffre de référence le plus bas, parmi ceux qui sont couramment cités, est un taux d'erreur de mots de 5,1 % sur le jeu d'évaluation Switchboard 2000, publié par Microsoft en 2017. Notez bien ce que ce chiffre mesure et ne mesure pas : de la parole conversationnelle au téléphone, en conditions de benchmark, et non une garantie pour votre salle de réunion. L'article le compare bel et bien aux humains : il juge le résultat « équivalent au taux d'erreur multi-transcripteurs précédemment rapporté pour la même tâche ».
L'échelle est l'autre moitié de l'histoire. Whisper a été entraîné sur 680 000 heures de données supervisées multilingues et multitâches : c'est le passage de l'apprentissage de la voix de chaque utilisateur à des modèles qui généralisent à partir de jeux de données très vastes et hétérogènes.
Sources : W. Xiong, L. Wu, F. Alleva, J. Droppo, X. Huang, A. Stolcke (Microsoft), « The Microsoft 2017 Conversational Speech Recognition System », arXiv:1708.06073, 2017. A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, I. Sutskever (OpenAI), « Robust Speech Recognition via Large-Scale Weak Supervision », arXiv:2212.04356, 2022.
La reconnaissance vocale est-elle aussi précise pour tout le monde ?
Non. Sur cinq systèmes commerciaux (Amazon, Apple, Google, IBM et Microsoft), le taux d'erreur de mots moyen était de 0,35 pour les locuteurs noirs, contre 0,19 pour les locuteurs blancs, soit un taux d'erreur presque deux fois plus élevé pour la même tâche.
L'étude s'appuyait sur des entretiens structurés menés avec 42 locuteurs blancs et 73 locuteurs noirs dans cinq villes américaines, soit 19,8 heures d'audio au total. L'écart persistait lorsque les deux groupes prononçaient des phrases identiques, ce que les auteurs attribuent aux modèles acoustiques sous-jacents plutôt qu'au vocabulaire ou à la grammaire.
C'est le chiffre le plus important de cette page pour quiconque livre un logiciel vocal : la précision mesurée en benchmark et la précision pour vos utilisateurs réels sont deux grandeurs différentes.
Source : Allison Koenecke, Andrew Nam, Emily Lake, Joe Nudell, Minnie Quartey, Zion Mengesha, Connor Toups, John R. Rickford, Dan Jurafsky, Sharad Goel, « Racial disparities in automated speech recognition », Proceedings of the National Academy of Sciences 117(14):7684–7689, 7 avril 2020. doi:10.1073/pnas.1915768117 (notice en accès libre : PubMed)
Quel effet l'automatisation a-t-elle sur les métiers de la transcription ?
Elle réduit les emplois qui se limitent à transcrire et laisse à peu près intacts ceux qui certifient ou interprètent. Projections du Bureau of Labor Statistics américain pour 2025–2035 :
| Métier | Emplois (2025) | Salaire médian (mai 2025) | Projection 2025–2035 |
|---|---|---|---|
| Transcripteurs médicaux | 42 000 | 40 410 $ (19,43 $/h) | −4 % (−1 900 emplois) |
| Sténographes judiciaires et sous-titreurs en direct | 19 900 | 72 420 $ | 0 % (stable) |
| Interprètes et traducteurs | 73 900 | 60 170 $ | +2 % (+1 500 emplois) |
La sténographie judiciaire est le cas le plus parlant : l'emploi y est stable, et pourtant environ 1 800 postes à pourvoir sont prévus chaque année sur la décennie, surtout pour remplacer des personnes qui changent de métier ou quittent la vie active, plutôt que du fait de la croissance.
Source : US Bureau of Labor Statistics, Occupational Outlook Handbook : Medical Transcriptionists, Court Reporters and Simultaneous Captioners, Interpreters and Translators. Pages modifiées pour la dernière fois le 27 août 2026.
Quelle part de la semaine de travail passe en réunions ?
La charge de réunions a fortement augmenté, puis a changé de forme. Microsoft a mesuré une hausse de 153 % des réunions hebdomadaires par utilisateur de Teams depuis le début de la pandémie, et une hausse de 46 % des réunions qui se chevauchent (doubles réservations) par personne d'une année sur l'autre.
Ses données de télémétrie plus récentes décrivent une journée fragmentée, et pas seulement chargée :
- 57 % des réunions sont des appels improvisés, sans invitation dans l'agenda.
- 50 % des réunions se concentrent sur deux créneaux : 9 h–11 h et 13 h–15 h.
- Le mardi est le jour le plus chargé, avec 23 % des réunions ; le vendredi est le plus léger, avec 16 %.
- 1 réunion planifiée sur 10 est réservée à la dernière minute.
- Près d'un tiers des réunions s'étendent sur plusieurs fuseaux horaires, en hausse de 35 % depuis 2021.
- Les réunions après 20 h sont en hausse de 16 % d'une année sur l'autre.
- Les grandes réunions de 65 participants et plus sont le format qui progresse le plus vite.
- Les salariés sont interrompus toutes les 2 minutes, soit à peu près 275 fois par jour.
Ce schéma (réunions non planifiées, qui se chevauchent, hors des heures de bureau) explique pourquoi une prise de notes qui dépend de quelqu'un de disponible pour taper ne fonctionne plus. Découvrez comment fonctionne le compte rendu de réunion IA sans bot.
Sources : Microsoft, « Hybrid Work Is Just Work. Are We Doing It Wrong? », Work Trend Index, 22 septembre 2022. Microsoft, « Breaking down the infinite workday », rapport spécial du Work Trend Index, 17 juin 2025.
La prise de notes par IA fait-elle gagner un temps mesurable ?
Oui, et les preuves les mieux mesurées viennent de la documentation clinique. Sur 1 547 cliniciens et 16 149 observations, le temps médian consacré aux notes est passé de 7,1 minutes à 6,1 minutes par consultation après l'introduction de la documentation par IA ambiante.
Les effets modélisés étaient plus modestes, mais cohérents : une baisse de 0,26 minute par note le premier mois, une baisse mensuelle supplémentaire et durable de 0,38 minute pour la documentation en dehors des heures de travail, et une hausse immédiate de 7,40 unités de valeur relative par mois. L'étude n'a relevé aucun changement significatif du score de profil d'efficacité des cliniciens.
Une réserve mérite d'être répétée, car les compilations l'omettent régulièrement : cette étude a mesuré le temps de documentation et la productivité, pas l'épuisement professionnel. Les chiffres qui attribuent à cet article une baisse du burn-out n'y figurent pas.
Source : « Ambient Artificial Intelligence Use and Clinician Documentation Burden, Productivity, and Efficiency », JAMA Network Open, 29 mai 2026. jamanetwork.com (accès libre : PubMed Central)
Quelles règles encadrent l'IA dans les entretiens d'embauche ?
À New York, les employeurs qui utilisent un outil automatisé de décision en matière d'emploi doivent l'avoir soumis à un audit de biais au cours de l'année précédente, publier un résumé des résultats de l'audit et prévenir les candidats au moins 10 jours ouvrés avant son utilisation. Le service municipal de protection des consommateurs et des travailleurs (Department of Consumer and Worker Protection) applique la Local Law 144 de 2021 depuis le 5 juillet 2023.
Si vous êtes du côté des candidats, notre guide des assistants IA pour entretien d'embauche explique ce que font ces outils et où se situent les limites.
Source : New York City Department of Consumer and Worker Protection, Automated Employment Decision Tools, Local Law 144 of 2021.
Combien de personnes et d'entreprises utilisent réellement l'IA ?
Environ la moitié des adultes américains utilisent désormais des chatbots d'IA : 49 % des adultes américains début 2026, contre 33 % en 2024, ChatGPT à lui seul n'en étant qu'à 18 % en 2023. Par plateforme, les parts s'établissent ainsi : ChatGPT 44 %, Gemini 24 %, Copilot 17 %, Meta AI 14 %, Grok 8 %, Claude 6 % et Character.ai 3 %.
Le chiffre aux conséquences les plus larges pour quiconque publie en ligne : 60 % des adultes américains disent lire les résumés générés par IA en tête des résultats de recherche. Être la source dans laquelle puisent ces résumés est désormais un canal de diffusion à part entière.
Source : Pew Research Center, « Americans and AI 2026: Chatbots, Smart Devices and Views on Impact », 17 juin 2026 ; enquête menée auprès de 5 119 adultes américains du 17 au 23 février 2026.
Côté organisations, 88 % des organisations interrogées utilisent l'IA pour au moins un usage et 70 % utilisent l'IA générative dans au moins une fonction de l'entreprise. L'IA générative a atteint 53 % d'adoption en trois ans, plus vite que l'ordinateur personnel ou Internet.
Source : Stanford HAI, 2026 AI Index Report, chapitre Economy.
Les chiffres européens proviennent d'un institut de statistique et non d'une enquête d'éditeur, ce qui en fait la meilleure source à citer. En 2025, 19,95 % des entreprises de l'UE utilisaient des technologies d'IA, soit 6,47 points de pourcentage de plus qu'en 2024. Par technologie : fouille de textes 11,75 %, génération de contenus multimédias 9,55 %, génération de langage naturel et synthèse vocale 8,76 %, et reconnaissance vocale 7,22 %.
L'adoption est très inégale. Le Danemark (42,03 %), la Finlande (37,82 %) et la Suède (35,04 %) sont en tête ; la Roumanie (5,21 %), la Pologne (8,36 %) et la Bulgarie (8,55 %) ferment la marche. Par taille, 55,03 % des grandes entreprises utilisent l'IA, contre 30,36 % des moyennes et 17 % des petites.
Source : Eurostat, « Use of artificial intelligence in enterprises », Statistics Explained, année de référence 2025.
Combien de langues la reconnaissance vocale sait-elle traiter ?
Un seul modèle multilingue couvre désormais 1 107 langues en reconnaissance vocale, et autant en synthèse vocale. Sur le benchmark FLEURS, il « réduit de plus de moitié le taux d'erreur de mots de Whisper sur 54 langues ».
L'enjeu dépasse la simple course aux records : la plupart des langues du monde n'ont jamais disposé d'une dictée vocale utilisable, et le frein a toujours été les données annotées plutôt que la conception des modèles.
Source : Vineel Pratap et al. (Meta AI), « Scaling Speech Technology to 1,000+ Languages », arXiv:2305.13516, 2023.
Le volet données ouvertes est plus modeste qu'on ne le croit. Common Voice, le projet de Mozilla, faisait état de 2 500 heures d'audio collectées pour 38 langues en cours de collecte (29 dans la version alors en vigueur), auprès de plus de 50 000 contributeurs, et d'une amélioration moyenne du taux d'erreur de caractères de 5,99 ± 5,48 sur douze langues cibles grâce à l'apprentissage par transfert.
Source : Rosana Ardila et al. (Mozilla), « Common Voice: A Massively-Multilingual Speech Corpus », arXiv:1912.06670, 2019, révisé en 2020. Les chiffres sont ceux publiés à l'époque ; le corpus s'est étoffé depuis.
Qui a le plus besoin de transcription et de sous-titres ?
Plus de 5 % de la population mondiale, soit 430 millions de personnes dont 34 millions d'enfants, ont aujourd'hui besoin de services de réadaptation pour une déficience auditive incapacitante. Environ 95,1 millions d'enfants de 5 à 19 ans vivent avec une perte d'audition. D'ici 2050, près de 2,5 milliards de personnes devraient présenter une perte d'audition à des degrés divers et plus de 700 millions auront besoin de réadaptation. Non prise en charge, la déficience auditive représente un coût mondial annuel de près de 1 000 milliards de dollars américains.
Source : World Health Organization (OMS), fiche d'information « Deafness and hearing loss », mise à jour le 3 mars 2026.
Les sous-titres deviennent aussi une obligation légale plutôt qu'une marque d'attention. La règle définitive adoptée en 2024 par le ministère américain de la Justice impose aux sites web et aux applications mobiles des administrations des États et des collectivités locales de respecter les WCAG 2.1 niveau AA, qui incluent le sous-titrage des vidéos. Une règle définitive provisoire (interim final rule), publiée le 20 avril 2026, a reporté les échéances au 26 avril 2027 pour les entités desservant une population de 50 000 habitants ou plus, et au 26 avril 2028 pour les entités plus petites et les districts spéciaux.
Source : US Department of Justice, « Fact Sheet: New Rule on the Accessibility of Web Content and Mobile Apps Provided by State and Local Governments ». Règle définitive relative au titre II de l'ADA, publiée le 24 avril 2024 ; dates de mise en conformité repoussées par la règle définitive provisoire publiée le 20 avril 2026.
Comment citer cette page
Chaque statistique ci-dessus appartient à l'organisme nommé à côté d'elle : citez-le, pas nous. Si vous souhaitez référencer la compilation elle-même :
ChadFlow, « Statistiques IA vocale 2026 », mis à jour le 6 octobre 2026. https://chadflow.app/fr/statistiques-ia-vocale
Si vous repérez ici un chiffre qui s'est écarté de sa source, ou une source qui a changé d'adresse, écrivez-nous à [email protected] et nous corrigerons.
Questions fréquentes
De combien la voix est-elle plus rapide que le clavier ?
Dans une étude contrôlée portant sur la saisie de messages courts sur un iPhone, la saisie vocale a atteint 153 mots par minute en anglais, contre 52 mots par minute pour le clavier tactile, soit 2,93 fois plus vite (Ruan et al., arXiv, 2016/2018).
Quel est le taux d'erreur de mots le plus bas sur le benchmark Switchboard ?
Microsoft a publié un taux d'erreur de mots de 5,1 % sur le jeu d'évaluation Switchboard 2000, dans son article de 2017 consacré à son système de reconnaissance de la parole conversationnelle.
La reconnaissance vocale est-elle aussi précise pour tout le monde ?
Non. Sur cinq systèmes commerciaux, le taux d'erreur de mots moyen était de 0,35 pour les locuteurs noirs, contre 0,19 pour les locuteurs blancs (Koenecke et al., PNAS, 2020).
Combien d'emplois de transcripteur médical reste-t-il aux États-Unis ?
42 000 en 2025, avec une baisse prévue de 4 % (soit 1 900 emplois en moins) entre 2025 et 2035, d'après l'Occupational Outlook Handbook du Bureau of Labor Statistics américain.
La prise de notes par IA fait-elle vraiment gagner du temps ?
Dans une étude portant sur 1 547 cliniciens, le temps médian consacré aux notes par consultation est passé de 7,1 minutes à 6,1 minutes après l'introduction de la documentation par IA ambiante (JAMA Network Open, 29 mai 2026).
2,93 fois plus vite : à vous d'en profiter.
ChadFlow réunit la dictée vocale, la transcription de réunion avec identification des intervenants et les réponses en direct, sur Mac, Windows et iPhone.
Télécharger ChadFlowMéthode : chaque chiffre a été vérifié sur la page ou l'article source le 12 septembre 2026, puis de nouveau le 6 octobre 2026, et n'a été retenu que s'il figurait dans la source elle-même. Les projections de taille de marché publiées par des éditeurs ont été volontairement écartées : les chiffres auxquels nous avons pu accéder n'étaient pas vérifiables au regard d'une méthodologie primaire. Quand une affirmation souvent reprise ne figurait pas dans l'article auquel on l'attribue (par exemple la baisse du burn-out tirée de l'étude du JAMA), nous le signalons au lieu de la répéter.