Eine Reihe hinterleuchteter, unterschiedlich hoher Balken, die zugleich wie ein Balkendiagramm und wie ein Klangspektrum wirkt

Das Wichtigste in Kürze

  • Spracheingabe erreichte auf Englisch 153 Wörter pro Minute, die Touchscreen-Tastatur 52 WPM – 2,93-mal schneller. Ruan et al., arXiv, 2016/2018
  • Diktieren war außerdem genauer: 5,30 % korrigierte Fehlerrate beim Sprechen gegenüber 11,22 % beim Tippen. Ruan et al., 2016/2018
  • Selbst die Schnellsten an der Tastatur erreichen in einem Datensatz mit 136 Millionen Tastenanschlägen 120 WPM oder mehr und bleiben damit unter der gemessenen Spracheingabe. Dhakal et al., CHI 2018
  • Auf Mandarin erreichte Sprache 123 WPM gegenüber 43 WPM beim Tippen – 2,87-mal schneller. Ruan et al., 2016/2018
  • Die beste berichtete Wortfehlerrate (WER) auf dem Switchboard-Set von 2000 liegt bei 5,1 %. Microsoft, 2017
  • Whisper von OpenAI wurde mit 680.000 Stunden mehrsprachigem Audio trainiert. Radford et al., 2022
  • Über fünf kommerzielle Systeme hinweg lag die durchschnittliche Wortfehlerrate bei 0,35 für Schwarze Sprecher gegenüber 0,19 für weiße Sprecher. Koenecke et al., PNAS, 2020
  • Stellen für medizinische Schreibkräfte in den USA: 42.000 im Jahr 2025, Prognose −4 % bis 2035. US Bureau of Labor Statistics
  • Gerichtsstenografen und Live-Untertitler verdienen im Median $72,420; für die Beschäftigung wird bis 2035 eine Veränderung von 0 % prognostiziert. US Bureau of Labor Statistics
  • Die Zahl der wöchentlichen Meetings pro Microsoft-Teams-Nutzer stieg seit Beginn der Pandemie um 153 %. Microsoft Work Trend Index, 2022
  • 57 % der Meetings sind Ad-hoc-Calls ohne Kalendereinladung. Microsoft Work Trend Index, 2025
  • Beschäftigte werden alle 2 Minuten unterbrochen, das sind rund 275-mal am Tag. Microsoft Work Trend Index, 2025
  • 60 % der Erwachsenen in den USA lesen die KI-generierte Zusammenfassung über den Suchergebnissen. Pew Research Center, Juni 2026
  • 49 % der Erwachsenen in den USA nutzen inzwischen KI-Chatbots, 2024 waren es 33 %. Pew Research Center, Juni 2026
  • 19,95 % der Unternehmen in der EU nutzten 2025 KI; 7,22 % nutzten gezielt Spracherkennung. Eurostat
  • Ein einziges Modell deckt bei der Spracherkennung inzwischen 1.107 Sprachen ab. Pratap et al., 2023
  • 430 Millionen Menschen benötigen heute Rehabilitation wegen eines beeinträchtigenden Hörverlusts; bis 2050 werden voraussichtlich 2,5 Milliarden in irgendeinem Ausmaß von Hörverlust betroffen sein. World Health Organization
  • Mit Ambient-KI-Dokumentation sank die mediane Zeit für Notizen von 7,1 auf 6,1 Minuten pro Termin, gemessen bei 1.547 klinisch Tätigen. JAMA Network Open, 2026

Wie viel schneller ist Sprechen als Tippen?

Für Spracheingabe wurden auf Englisch 153 Wörter pro Minute gemessen, auf einer Touchscreen-Tastatur 52 Wörter pro Minute, ein Tempogewinn um den Faktor 2,93. Auf Mandarin maß dieselbe Studie 123 WPM beim Sprechen gegenüber 43 WPM beim Tippen, also Faktor 2,87.

Beim Ergebnis zur Genauigkeit liegen die meisten falsch. Sprache ging nicht auf Kosten der Korrektheit: Die korrigierte Fehlerrate lag bei 5,30 % für Sprache gegenüber 11,22 % für die Tastatur. Bei den unkorrigierten Fehlerraten war es umgekehrt: 1,30 % für Sprache gegenüber 0,79 % beim Tippen.

Verglichen wurde Deep Speech 2 von Baidu mit der integrierten iOS-Tastatur auf einem iPhone 6 Plus, unter Laborbedingungen und für kurze Nachrichten.

Zur Einordnung der Tipp-Seite dieses Vergleichs: Die größte Studie zum alltäglichen Tippen (136 Millionen Tastenanschläge von 168.000 Freiwilligen) ergab, dass die schnellsten Tippenden „Geschwindigkeiten von sogar 120 WPM oder mehr erreichen“, während die größte und zugleich langsamste Gruppe bei rund 46 WPM lag. Formales Training ändert daran kaum etwas: Wer das Tippen gelernt hatte, war im Schnitt nur 5 WPM schneller als Ungeschulte.

Die Obergrenze zählt also. Spracheingabe mit 153 WPM schlägt nicht bloß das durchschnittliche Tippen. Sie ist ohne Übung schneller als die schnellsten Tippenden in einem Datensatz dieser Größe.

Quelle: Vivek Dhakal, Anna Feit, Per Ola Kristensson, Antti Oulasvirta, „Observations on Typing from 136 Million Keystrokes“, CHI 2018, Aalto University.

Quelle: Sherry Ruan, Jacob O. Wobbrock, Kenny Liou, Andrew Ng, James Landay, „Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones“, arXiv:1608.07323, eingereicht 2016, überarbeitet 2018.

Wie genau ist Spracherkennung im besten Fall?

Der niedrigste häufig zitierte Benchmark-Wert ist eine Wortfehlerrate von 5,1 % auf dem Switchboard-Evaluationsset von 2000, 2017 von Microsoft berichtet. Wichtig ist, was diese Zahl aussagt und was nicht: Es geht um Telefongespräche unter Benchmark-Bedingungen, nicht um eine Garantie für deinen Meetingraum. Einen Vergleich mit Menschen zieht das Paper durchaus: Es nennt das Ergebnis „gleichauf mit der Fehlerrate mehrerer Transkribierender, die zuvor für dieselbe Aufgabe berichtet wurde“.

Die andere Hälfte der Geschichte ist die Größenordnung. Whisper wurde mit 680.000 Stunden mehrsprachiger Multitask-Supervision trainiert. Das markiert den Wechsel vom Stimmtraining pro Nutzer hin zu Modellen, die aus sehr großen, unsauberen Datensätzen generalisieren.

Quellen: W. Xiong, L. Wu, F. Alleva, J. Droppo, X. Huang, A. Stolcke (Microsoft), „The Microsoft 2017 Conversational Speech Recognition System“, arXiv:1708.06073, 2017. A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, I. Sutskever (OpenAI), „Robust Speech Recognition via Large-Scale Weak Supervision“, arXiv:2212.04356, 2022.

Ist Spracherkennung für alle gleich genau?

Nein. Über fünf kommerzielle Systeme von Amazon, Apple, Google, IBM und Microsoft hinweg lag die durchschnittliche Wortfehlerrate bei 0,35 für Schwarze Sprecher gegenüber 0,19 für weiße Sprecher, also fast die doppelte Fehlerrate bei derselben Aufgabe.

Die Studie nutzte strukturierte Interviews mit 42 weißen und 73 Schwarzen Sprechern aus fünf US-Städten, insgesamt 19,8 Stunden Audio. Die Lücke blieb bestehen, als beide Gruppen identische Phrasen sprachen. Die Autoren führen das auf die zugrunde liegenden akustischen Modelle zurück, nicht auf Wortschatz oder Grammatik.

Für alle, die Voice-Software ausliefern, ist das die wichtigste Zahl auf dieser Seite: Benchmark-Genauigkeit und die Genauigkeit für deine tatsächlichen Nutzer sind zwei verschiedene Größen.

Quelle: Allison Koenecke, Andrew Nam, Emily Lake, Joe Nudell, Minnie Quartey, Zion Mengesha, Connor Toups, John R. Rickford, Dan Jurafsky, Sharad Goel, „Racial disparities in automated speech recognition“, Proceedings of the National Academy of Sciences 117(14):7684–7689, 7. April 2020. doi:10.1073/pnas.1915768117 (frei zugänglicher Eintrag: PubMed)

Was macht die Automatisierung mit Transkriptionsjobs?

Sie lässt die Jobs schrumpfen, in denen nur transkribiert wird, und lässt die Jobs weitgehend unberührt, in denen beglaubigt oder gedolmetscht wird. Prognosen des US Bureau of Labor Statistics für 2025–2035:

BerufStellen (2025)Medianverdienst (Mai 2025)Prognose 2025–35
Medizinische Schreibkräfte42.000$40,410 ($19.43/Std.)−4 % (−1.900 Stellen)
Gerichtsstenografen und Live-Untertitler19.900$72,4200 % (keine Veränderung)
Dolmetscher und Übersetzer73.900$60,170+2 % (+1.500 Stellen)

Lehrreich ist der Fall der Gerichtsstenografie: Die Beschäftigung stagniert, trotzdem werden über das Jahrzehnt rund 1.800 offene Stellen pro Jahr prognostiziert. Sie entstehen vor allem, weil Menschen den Beruf wechseln oder aus dem Erwerbsleben ausscheiden, und nicht durch Wachstum.

Quelle: US Bureau of Labor Statistics, Occupational Outlook Handbook: Medical Transcriptionists, Court Reporters and Simultaneous Captioners, Interpreters and Translators. Seiten zuletzt geändert am 27. August 2026.

Wie viel der Arbeitswoche geht für Meetings drauf?

Die Meeting-Last ist stark gewachsen und hat dann ihre Form verändert. Microsoft maß pro Teams-Nutzer einen Anstieg der wöchentlichen Meetings um 153 % seit Beginn der Pandemie und pro Person einen Anstieg sich überschneidender (doppelt gebuchter) Meetings um 46 % gegenüber dem Vorjahr.

Die spätere Telemetrie beschreibt einen Tag, der nicht einfach voll ist, sondern zerstückelt:

  • 57 % der Meetings sind Ad-hoc-Calls ohne Kalendereinladung.
  • 50 % aller Meetings fallen in zwei Zeitfenster: 9–11 Uhr und 13–15 Uhr.
  • Dienstag trägt mit 23 % der Meetings die größte Last, Freitag mit 16 % die geringste.
  • 1 von 10 geplanten Meetings wird in letzter Minute angesetzt.
  • Fast ein Drittel der Meetings erstreckt sich über mehrere Zeitzonen, ein Plus von 35 % seit 2021.
  • Meetings nach 20 Uhr haben um 16 % zugenommen, verglichen mit dem Vorjahr.
  • Große Meetings mit 65+ Teilnehmenden sind der am schnellsten wachsende Typ.
  • Beschäftigte werden alle 2 Minuten unterbrochen, rund 275-mal am Tag.

Dieses Muster (ungeplant, überlappend, außerhalb der Arbeitszeit) ist der Grund, warum Mitschreiben nicht mehr funktioniert, wenn es davon abhängt, dass jemand die Hände zum Tippen frei hat. Lies, wie Meeting-Aufzeichnung ohne Bot funktioniert.

Quellen: Microsoft, „Hybrid Work Is Just Work. Are We Doing It Wrong?“, Work Trend Index, 22. September 2022. Microsoft, „Breaking down the infinite workday“, Sonderbericht des Work Trend Index, 17. Juni 2025.

Spart KI beim Mitschreiben wirklich messbar Zeit?

Ja, und die am besten gemessenen Belege stammen aus der klinischen Dokumentation. Über 1.547 klinisch Tätige und 16.149 Beobachtungen hinweg sank die mediane Zeit für Notizen von 7,1 Minuten auf 6,1 Minuten pro Termin, nachdem Ambient-KI-Dokumentation eingeführt worden war.

Die modellierten Effekte waren kleiner, aber konsistent: ein Rückgang um 0,26 Minuten pro Notiz im ersten Monat, ein anhaltender zusätzlicher monatlicher Rückgang um 0,38 Minuten bei der Dokumentation außerhalb der Arbeitszeit und ein sofortiger Anstieg um 7,40 Relative Value Units pro Monat. Eine signifikante Veränderung beim Clinician Efficiency Profile Score fand die Studie nicht.

Eine Einschränkung, die sich zu wiederholen lohnt, weil Statistik-Sammlungen sie regelmäßig weglassen: Diese Studie hat Dokumentationszeit und Produktivität gemessen, nicht Burnout. Zahlen, die diesem Paper einen Rückgang von Burnout zuschreiben, stehen nicht darin.

Quelle: „Ambient Artificial Intelligence Use and Clinician Documentation Burden, Productivity, and Efficiency“, JAMA Network Open, 29. Mai 2026. jamanetwork.com (Open Access: PubMed Central)

Welche Regeln gelten für KI bei Vorstellungsgesprächen?

In New York City müssen Arbeitgeber, die ein automatisiertes Tool für Personalentscheidungen (Automated Employment Decision Tool) einsetzen, dieses innerhalb des vorangegangenen Jahres einem Bias-Audit unterzogen haben, eine Zusammenfassung der Audit-Ergebnisse veröffentlichen und Bewerber mindestens 10 Arbeitstage vor dem Einsatz informieren. Das Department of Consumer and Worker Protection setzt Local Law 144 of 2021 seit dem 5. Juli 2023 durch.

Wenn du dabei auf der Bewerberseite stehst: Unser Ratgeber zu KI-Interview-Assistenten erklärt, was die Tools können und wo die Grenzen verlaufen.

Quelle: New York City Department of Consumer and Worker Protection, Automated Employment Decision Tools, Local Law 144 of 2021.

Wie viele Menschen und Unternehmen nutzen das tatsächlich?

Rund die Hälfte der erwachsenen US-Bevölkerung nutzt inzwischen KI-Chatbots: 49 % der Erwachsenen in den USA Anfang 2026, nach 33 % im Jahr 2024; ChatGPT allein lag 2023 noch bei 18 %. Die Anteile nach Plattform: ChatGPT 44 %, Gemini 24 %, Copilot 17 %, Meta AI 14 %, Grok 8 %, Claude 6 % und Character.ai 3 %.

Die Zahl mit den weitreichendsten Folgen für alle, die online publizieren: 60 % der Erwachsenen in den USA geben an, die KI-generierten Zusammenfassungen über den Suchergebnissen zu lesen. Die Quelle zu sein, aus der diese Zusammenfassungen schöpfen, ist inzwischen ein eigener Vertriebskanal.

Quelle: Pew Research Center, „Americans and AI 2026: Chatbots, Smart Devices and Views on Impact“, 17. Juni 2026; Umfrage unter 5.119 Erwachsenen in den USA, durchgeführt vom 17. bis 23. Februar 2026.

Auf Organisationsseite nutzen 88 % der befragten Organisationen KI in mindestens einer Form und 70 % generative KI in mindestens einem Geschäftsbereich. Generative KI erreichte in drei Jahren eine Verbreitung von 53 %, schneller als der PC oder das Internet.

Quelle: Stanford HAI, 2026 AI Index Report, Kapitel „Economy“.

Die europäischen Zahlen stammen von einem Statistikamt und nicht aus einer Anbieterumfrage, deshalb sind sie die bessere Quelle zum Zitieren. 2025 nutzten 19,95 % der Unternehmen in der EU KI-Technologien, ein Plus von 6,47 Prozentpunkten gegenüber 2024. Nach Technologie: Text Mining 11,75 %, generative Medien 9,55 %, Erzeugung natürlicher Sprache und Sprachsynthese 8,76 % sowie Spracherkennung 7,22 %.

Die Verbreitung ist extrem ungleich. Dänemark 42,03 %, Finnland 37,82 % und Schweden 35,04 % liegen vorn; Rumänien 5,21 %, Polen 8,36 % und Bulgarien 8,55 % bilden das Schlusslicht. Nach Größe: 55,03 % der großen Unternehmen nutzen KI, gegenüber 30,36 % der mittleren und 17 % der kleinen.

Quelle: Eurostat, „Use of artificial intelligence in enterprises“, Statistics Explained, Referenzjahr 2025.

Wie viele Sprachen beherrscht Spracherkennung?

Ein einziges mehrsprachiges Modell deckt bei der Spracherkennung inzwischen 1.107 Sprachen ab, mit Sprachsynthese für ebenso viele. Im FLEURS-Benchmark „senkt es die Wortfehlerrate von Whisper in 54 Sprachen um mehr als die Hälfte“.

Das ist mehr als ein Rekord zum Vorzeigen: Für die meisten Sprachen der Welt gab es noch nie brauchbares Diktieren, und der Engpass waren immer annotierte Daten, nicht das Modelldesign.

Quelle: Vineel Pratap et al. (Meta AI), „Scaling Speech Technology to 1,000+ Languages“, arXiv:2305.13516, 2023.

Die Open-Data-Seite ist kleiner, als viele annehmen. Common Voice von Mozilla meldete 2.500 Stunden gesammeltes Audio in 38 Sprachen, für die gesammelt wurde (29 im damals aktuellen Release), von über 50.000 Mitwirkenden, sowie per Transfer Learning eine durchschnittliche Verbesserung der Zeichenfehlerrate um 5,99 ± 5,48 über zwölf Zielsprachen hinweg.

Quelle: Rosana Ardila et al. (Mozilla), „Common Voice: A Massively-Multilingual Speech Corpus“, arXiv:1912.06670, 2019, überarbeitet 2020. Die Zahlen entsprechen dem damaligen Stand; das Korpus ist seitdem gewachsen.

Wer braucht Transkription und Untertitel am dringendsten?

Heute benötigen über 5 % der Weltbevölkerung – 430 Millionen Menschen, darunter 34 Millionen Kinder – Rehabilitation wegen eines beeinträchtigenden Hörverlusts. Rund 95,1 Millionen Kinder im Alter von 5 bis 19 Jahren leben mit Hörverlust. Bis 2050 werden voraussichtlich fast 2,5 Milliarden Menschen einen Hörverlust in irgendeinem Ausmaß haben, und mehr als 700 Millionen werden Rehabilitation benötigen. Unbehandelter Hörverlust verursacht weltweit jährliche Kosten von fast 1 Billion US-Dollar.

Quelle: World Health Organization, Faktenblatt „Deafness and hearing loss“, zuletzt aktualisiert am 3. März 2026.

Untertitel werden außerdem von der Gefälligkeit zur gesetzlichen Pflicht. Die Final Rule des US Department of Justice von 2024 verlangt, dass Websites und mobile Apps von Bundesstaaten und Kommunen WCAG 2.1 Level AA erfüllen, wozu Untertitel für Videos gehören. Eine am 20. April 2026 veröffentlichte Interim Final Rule hat die Fristen verschoben: auf den 26. April 2027 für Stellen, die 50.000 oder mehr Einwohner versorgen, und auf den 26. April 2028 für kleinere Stellen und Sonderbezirke (Special Districts).

Quelle: US Department of Justice, „Fact Sheet: New Rule on the Accessibility of Web Content and Mobile Apps Provided by State and Local Governments“. Final Rule zu ADA Title II, veröffentlicht am 24. April 2024; Fristen verlängert durch die am 20. April 2026 veröffentlichte Interim Final Rule.

So zitierst du diese Seite

Jede Statistik oben gehört der Organisation, die daneben genannt ist. Zitiere sie, nicht uns. Wenn du auf die Sammlung selbst verweisen willst:

ChadFlow, „Voice-AI-Statistiken 2026“, aktualisiert am 6. Oktober 2026. https://chadflow.app/de/voice-ai-statistiken

Wenn du hier eine Zahl findest, die von ihrer Quelle abweicht, oder eine Quelle, die umgezogen ist, schreib uns an [email protected], und wir korrigieren das.

Häufig gestellte Fragen

Wie viel schneller ist Sprechen als Tippen?

In einer kontrollierten Studie zur Eingabe kurzer Nachrichten auf einem iPhone erreichte Spracheingabe auf Englisch 153 Wörter pro Minute gegenüber 52 Wörtern pro Minute mit der Touchscreen-Tastatur, also 2,93-mal schneller (Ruan et al., arXiv, 2016/2018).

Wie hoch ist die niedrigste Wortfehlerrate im Switchboard-Benchmark?

Microsoft berichtete in seinem Paper von 2017 zum System für die Erkennung von Gesprächssprache eine Wortfehlerrate von 5,1 % auf dem Switchboard-Evaluationsset von 2000.

Ist Spracherkennung für alle gleich genau?

Nein. Über fünf kommerzielle Systeme hinweg lag die durchschnittliche Wortfehlerrate bei 0,35 für Schwarze Sprecher gegenüber 0,19 für weiße Sprecher (Koenecke et al., PNAS, 2020).

Wie viele Stellen für medizinische Schreibkräfte gibt es in den USA noch?

42.000 im Jahr 2025; laut dem Occupational Outlook Handbook des US Bureau of Labor Statistics soll die Zahl zwischen 2025 und 2035 um 4 % sinken (ein Verlust von 1.900 Stellen).

Spart KI beim Mitschreiben wirklich Zeit?

In einer Studie mit 1.547 klinisch Tätigen sank die mediane Zeit für Notizen pro Termin von 7,1 Minuten auf 6,1 Minuten, nachdem Ambient-KI-Dokumentation eingeführt worden war (JAMA Network Open, 29. Mai 2026).

Mach etwas aus dem Faktor 2,93.

ChadFlow kann Diktieren, Meeting-Transkription mit Sprecherzuordnung und Live-Antworten – auf Mac, Windows und iPhone.

ChadFlow laden

Methode: Jede Zahl wurde am 12. September 2026 und erneut am 6. Oktober 2026 mit der Quellseite oder dem Paper abgeglichen und nur aufgenommen, wenn sie in der Quelle selbst stand. Marktgrößen-Prognosen von Anbietern haben wir bewusst ausgeschlossen: Die veröffentlichten Zahlen, an die wir herankamen, ließen sich an keiner primären Methodik überprüfen. Wo eine oft wiederholte Behauptung in dem Paper, dem sie zugeschrieben wird, gar nicht steht, etwa weniger Burnout laut der JAMA-Studie, sagen wir das, statt sie zu wiederholen.