
Najważniejsze wnioski
- Wprowadzanie głosowe osiągnęło w języku angielskim 153 słowa na minutę wobec 52 słów na minutę na klawiaturze ekranowej, czyli było 2,93× szybsze. Ruan et al., arXiv, 2016/2018
- Dyktowanie było też dokładniejsze: współczynnik błędów poprawionych wyniósł 5,30% dla mowy wobec 11,22% dla pisania. Ruan et al., 2016/2018
- Nawet najszybsze osoby w zbiorze danych obejmującym 136 milionów naciśnięć klawiszy osiągają 120 słów na minutę lub więcej, czyli wciąż mniej niż zmierzone wprowadzanie głosowe. Dhakal et al., CHI 2018
- W języku mandaryńskim mowa osiągnęła 123 słowa na minutę wobec 43 słów na minutę przy pisaniu, czyli była 2,87× szybsza. Ruan et al., 2016/2018
- Najlepszy raportowany współczynnik błędów słów (WER) na zbiorze Switchboard z 2000 r. to 5,1%. Microsoft, 2017
- Model Whisper od OpenAI wytrenowano na 680 000 godzin wielojęzycznych nagrań. Radford et al., 2022
- W pięciu komercyjnych systemach średni współczynnik błędów słów wyniósł 0,35 dla czarnoskórych mówców wobec 0,19 dla białych mówców. Koenecke et al., PNAS, 2020
- Miejsca pracy transkrybentów medycznych w USA: 42 000 w 2025 r., prognoza −4% do 2035 r. US Bureau of Labor Statistics
- Mediana zarobków protokolantów sądowych i twórców napisów na żywo wynosi $72,420, a prognozowana zmiana zatrudnienia do 2035 r. to 0%. US Bureau of Labor Statistics
- Liczba spotkań w tygodniu na użytkownika Microsoft Teams wzrosła o 153% od początku pandemii. Microsoft Work Trend Index, 2022
- 57% spotkań to rozmowy ad hoc bez zaproszenia w kalendarzu. Microsoft Work Trend Index, 2025
- Pracownikom coś przerywa pracę co 2 minuty, czyli około 275 razy dziennie. Microsoft Work Trend Index, 2025
- 60% dorosłych Amerykanów czyta generowane przez AI podsumowanie na górze wyników wyszukiwania. Pew Research Center, czerwiec 2026
- 49% dorosłych Amerykanów korzysta już z chatbotów AI, wobec 33% w 2024 r. Pew Research Center, czerwiec 2026
- 19,95% przedsiębiorstw w UE korzystało w 2025 r. z AI, a 7,22% konkretnie z rozpoznawania mowy. Eurostat
- Jeden model obejmuje dziś 1107 języków w rozpoznawaniu mowy. Pratap et al., 2023
- 430 milionów osób wymaga dziś rehabilitacji z powodu niedosłuchu powodującego niepełnosprawność; prognozuje się, że do 2050 r. jakiś ubytek słuchu będzie mieć 2,5 miliarda osób. World Health Organization
- Przy dokumentacji tworzonej przez AI działającą w tle mediana czasu poświęcanego na notatki spadła z 7,1 do 6,1 minuty na wizytę w grupie 1547 klinicystów. JAMA Network Open, 2026
O ile szybsze jest mówienie od pisania?
W języku angielskim wprowadzanie głosowe zmierzono na poziomie 153 słów na minutę wobec 52 słów na minutę na klawiaturze ekranowej, co daje przyspieszenie 2,93×. W języku mandaryńskim to samo badanie wykazało 123 słowa na minutę dla mowy wobec 43 słów na minutę przy pisaniu, czyli przyspieszenie 2,87×.
Wynik dotyczący dokładności to ten, który większość osób przytacza błędnie. Mowa nie oznaczała kompromisu kosztem poprawności: współczynnik błędów poprawionych wyniósł 5,30% dla mowy wobec 11,22% dla klawiatury. Współczynniki błędów niepoprawionych układały się odwrotnie: 1,30% dla mowy wobec 0,79% dla pisania.
W porównaniu wykorzystano Deep Speech 2 firmy Baidu i wbudowaną klawiaturę iOS na iPhonie 6 Plus, w warunkach laboratoryjnych, przy krótkich wiadomościach.
Dla kontekstu po stronie pisania: największe badanie codziennego pisania na klawiaturze, obejmujące 136 milionów naciśnięć klawiszy od 168 000 ochotników, wykazało, że najszybsi piszący „osiągają prędkość nawet 120 słów na minutę lub więcej”, podczas gdy największa i najwolniejsza grupa piszących utrzymywała się w okolicach 46 słów na minutę. Formalne szkolenie niewiele tu zmienia: osoby po kursie pisania były średnio tylko o 5 słów na minutę szybsze od osób bez takiego kursu.
Liczy się więc górna granica. Wprowadzanie głosowe z wynikiem 153 słów na minutę wyprzedza przeciętne pisanie, a do tego najszybszych piszących w zbiorze danych tej wielkości, i to bez treningu.
Źródło: Vivek Dhakal, Anna Feit, Per Ola Kristensson, Antti Oulasvirta, „Observations on Typing from 136 Million Keystrokes”, CHI 2018, Aalto University.
Źródło: Sherry Ruan, Jacob O. Wobbrock, Kenny Liou, Andrew Ng, James Landay, „Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones”, arXiv:1608.07323, zgłoszono w 2016 r., zaktualizowano w 2018 r.
Jak dokładne jest rozpoznawanie mowy w najlepszym wydaniu?
Najniższy powszechnie cytowany wynik benchmarkowy to współczynnik błędów słów (WER) równy 5,1% na zbiorze ewaluacyjnym Switchboard z 2000 r., podany przez Microsoft w 2017 r. Warto wiedzieć, czym ta liczba jest, a czym nie: dotyczy rozmów telefonicznych w warunkach benchmarku i nie jest gwarancją dla twojej sali spotkań. Publikacja porównuje ten wynik z ludźmi: określa go jako „dorównujący współczynnikowi błędów zespołu kilku transkrybentów, podawanemu wcześniej dla tego samego zadania”.
Drugą połową tej historii jest skala. Model Whisper wytrenowano na 680 000 godzin wielojęzycznych, wielozadaniowych danych nadzorowanych. To przejście od trenowania głosu pod konkretnego użytkownika do modeli, które uogólniają na podstawie bardzo dużych, nieuporządkowanych zbiorów danych.
Źródła: W. Xiong, L. Wu, F. Alleva, J. Droppo, X. Huang, A. Stolcke (Microsoft), „The Microsoft 2017 Conversational Speech Recognition System”, arXiv:1708.06073, 2017. A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, I. Sutskever (OpenAI), „Robust Speech Recognition via Large-Scale Weak Supervision”, arXiv:2212.04356, 2022.
Czy rozpoznawanie mowy jest tak samo dokładne dla wszystkich?
Nie. W pięciu komercyjnych systemach firm Amazon, Apple, Google, IBM i Microsoft średni współczynnik błędów słów wyniósł 0,35 dla czarnoskórych mówców wobec 0,19 dla białych mówców, czyli niemal dwukrotnie więcej błędów przy tym samym zadaniu.
W badaniu wykorzystano ustrukturyzowane wywiady z 42 białymi mówcami i 73 czarnoskórymi mówcami z pięciu miast w USA, łącznie 19,8 godziny nagrań. Różnica utrzymywała się, gdy obie grupy wypowiadały identyczne frazy, co autorzy przypisują modelom akustycznym, a nie słownictwu czy gramatyce.
Dla każdego, kto wypuszcza oprogramowanie głosowe, to najważniejsza liczba na tej stronie: dokładność w benchmarku i dokładność dla twoich rzeczywistych użytkowników to dwie różne wielkości.
Źródło: Allison Koenecke, Andrew Nam, Emily Lake, Joe Nudell, Minnie Quartey, Zion Mengesha, Connor Toups, John R. Rickford, Dan Jurafsky, Sharad Goel, „Racial disparities in automated speech recognition”, Proceedings of the National Academy of Sciences 117(14):7684–7689, 7 kwietnia 2020 r. doi:10.1073/pnas.1915768117 (rekord w otwartym dostępie: PubMed)
Co automatyzacja robi z pracą przy transkrypcji?
Ubywa stanowisk, na których tylko się transkrybuje, a te, na których coś się poświadcza lub tłumaczy, pozostają w dużej mierze nietknięte. Prognozy US Bureau of Labor Statistics na lata 2025–2035:
| Zawód | Miejsca pracy (2025) | Mediana płac (maj 2025) | Prognoza 2025–35 |
|---|---|---|---|
| Transkrybenci medyczni | 42 000 | $40,410 ($19.43/godz.) | −4% (−1900 miejsc pracy) |
| Protokolanci sądowi i twórcy napisów na żywo | 19 900 | $72,420 | 0% (bez zmian) |
| Tłumacze ustni i pisemni | 73 900 | $60,170 | +2% (+1500 miejsc pracy) |
Pouczający jest przypadek protokolantów sądowych: zatrudnienie stoi w miejscu, a mimo to w ciągu dekady prognozuje się około 1800 wakatów rocznie, głównie po to, by zastąpić osoby, które zmieniają zawód lub odchodzą z rynku pracy, a nie w wyniku wzrostu.
Źródło: US Bureau of Labor Statistics, Occupational Outlook Handbook: Medical Transcriptionists, Court Reporters and Simultaneous Captioners, Interpreters and Translators. Strony ostatnio zmodyfikowane 27 sierpnia 2026 r.
Jaką część tygodnia pracy zajmują spotkania?
Obciążenie spotkaniami gwałtownie wzrosło, a potem zmieniło charakter. Microsoft odnotował wzrost liczby spotkań w tygodniu o 153% na użytkownika Teams od początku pandemii oraz wzrost liczby nakładających się spotkań (podwójnych rezerwacji) o 46% na osobę rok do roku.
Jego późniejsze dane telemetryczne pokazują dzień, który jest bardziej poszatkowany niż po prostu wypełniony:
- 57% spotkań to rozmowy ad hoc bez zaproszenia w kalendarzu.
- 50% wszystkich spotkań przypada na dwa przedziały: 9:00–11:00 i 13:00–15:00.
- Wtorek jest najbardziej obciążony, z 23% spotkań, a piątek najmniej, z 16%.
- 1 na 10 zaplanowanych spotkań jest umawiane w ostatniej chwili.
- Prawie jedna trzecia spotkań obejmuje kilka stref czasowych, co oznacza wzrost o 35% od 2021 r.
- Liczba spotkań po 20:00 wzrosła o 16% rok do roku.
- Duże spotkania z udziałem 65 i więcej osób to najszybciej rosnący typ.
- Pracownikom coś przerywa pracę co 2 minuty, mniej więcej 275 razy dziennie.
Właśnie ten wzorzec (spotkania nieplanowane, nakładające się, poza godzinami pracy) sprawia, że notowanie zależne od tego, czy ktoś ma wolne ręce do pisania, przestało działać. Zobacz, jak działa nagrywanie spotkań bez bota.
Źródła: Microsoft, „Hybrid Work Is Just Work. Are We Doing It Wrong?”, Work Trend Index, 22 września 2022 r. Microsoft, „Breaking down the infinite workday”, raport specjalny Work Trend Index, 17 czerwca 2025 r.
Czy notatki tworzone przez AI naprawdę oszczędzają mierzalny czas?
Tak, a najlepiej zmierzone dowody pochodzą z dokumentacji klinicznej. W grupie 1547 klinicystów i przy 16 149 obserwacjach mediana czasu poświęcanego na notatki spadła z 7,1 minuty do 6,1 minuty na wizytę po wprowadzeniu dokumentacji tworzonej przez AI działającą w tle (ambient AI).
Efekty w modelu były mniejsze, ale spójne: spadek o 0,26 minuty na notatkę w pierwszym miesiącu, trwały dodatkowy spadek o 0,38 minuty miesięcznie w dokumentacji wypełnianej po godzinach pracy oraz natychmiastowy wzrost o 7,40 jednostki wartości względnej (RVU) miesięcznie. Badanie nie wykazało istotnej zmiany wyniku profilu efektywności klinicystów.
Jedno zastrzeżenie warto powtórzyć, bo zestawienia regularnie je pomijają: to badanie mierzyło czas dokumentowania i produktywność, a nie wypalenie zawodowe. Liczb o spadku wypalenia, które przypisuje się tej publikacji, w niej nie ma.
Źródło: „Ambient Artificial Intelligence Use and Clinician Documentation Burden, Productivity, and Efficiency”, JAMA Network Open, 29 maja 2026 r. jamanetwork.com (otwarty dostęp: PubMed Central)
Jakie przepisy dotyczą AI na rozmowach kwalifikacyjnych?
W Nowym Jorku pracodawcy korzystający z narzędzia do zautomatyzowanego podejmowania decyzji o zatrudnieniu muszą zadbać o to, by w ciągu poprzedniego roku przeszło ono audyt stronniczości, muszą opublikować podsumowanie wyników audytu i muszą powiadomić kandydatów co najmniej 10 dni roboczych przed jego użyciem. Nowojorski Department of Consumer and Worker Protection zaczął egzekwować Local Law 144 of 2021 w dniu 5 lipca 2023 r.
Jeśli jesteś po stronie kandydata, nasz poradnik o asystentach AI do rozmów kwalifikacyjnych opisuje, co te narzędzia robią i gdzie przebiegają granice.
Źródło: New York City Department of Consumer and Worker Protection, Automated Employment Decision Tools, Local Law 144 of 2021.
Ile osób i firm naprawdę z tego korzysta?
Mniej więcej połowa dorosłych mieszkańców USA korzysta już z chatbotów AI: 49% dorosłych Amerykanów na początku 2026 r., wobec 33% w 2024 r., przy czym sam ChatGPT miał w 2023 r. 18%. Udziały platform to: ChatGPT 44%, Gemini 24%, Copilot 17%, Meta AI 14%, Grok 8%, Claude 6% i Character.ai 3%.
Liczba o najszerszych konsekwencjach dla każdego, kto publikuje w sieci: 60% dorosłych Amerykanów deklaruje, że czyta generowane przez AI podsumowania na górze wyników wyszukiwania. Bycie źródłem, z którego te podsumowania czerpią, to dziś samodzielny kanał dystrybucji.
Źródło: Pew Research Center, „Americans and AI 2026: Chatbots, Smart Devices and Views on Impact”, 17 czerwca 2026 r.; badanie ankietowe na próbie 5119 dorosłych Amerykanów, przeprowadzone 17–23 lutego 2026 r.
Po stronie organizacji: 88% badanych organizacji korzysta z AI w co najmniej jednym zastosowaniu, a 70% używa generatywnej AI w co najmniej jednej funkcji biznesowej. Generatywna AI osiągnęła 53% adopcji w trzy lata, szybciej niż komputery osobiste czy internet.
Źródło: Stanford HAI, 2026 AI Index Report, rozdział „Economy”.
Dane europejskie pochodzą z urzędu statystycznego, a nie z ankiety producenta, dlatego lepiej nadają się do cytowania. W 2025 r. 19,95% przedsiębiorstw w UE korzystało z technologii AI, o 6,47 punktu procentowego więcej niż w 2024 r. Według technologii: eksploracja tekstu 11,75%, generowanie mediów 9,55%, generowanie języka naturalnego i synteza mowy 8,76% oraz rozpoznawanie mowy 7,22%.
Adopcja jest skrajnie nierówna. Prowadzą Dania 42,03%, Finlandia 37,82% i Szwecja 35,04%, a stawkę zamykają Rumunia 5,21%, Polska 8,36% i Bułgaria 8,55%. Według wielkości: z AI korzysta 55,03% dużych przedsiębiorstw wobec 30,36% średnich i 17% małych.
Źródło: Eurostat, „Use of artificial intelligence in enterprises”, Statistics Explained, rok referencyjny 2025.
Ile języków obsługuje rozpoznawanie mowy?
Jeden wielojęzyczny model obejmuje dziś 1107 języków w rozpoznawaniu mowy i tyle samo w syntezie mowy. W benchmarku FLEURS „zmniejsza współczynnik błędów słów modelu Whisper o ponad połowę w 54 językach”.
To coś więcej niż powód do chwalenia się: większość języków świata nigdy nie miała używalnego dyktowania, a ograniczeniem zawsze były oznaczone dane, a nie architektura modelu.
Źródło: Vineel Pratap et al. (Meta AI), „Scaling Speech Technology to 1,000+ Languages”, arXiv:2305.13516, 2023.
Otwartych danych jest mniej, niż się zwykle zakłada. Projekt Common Voice Mozilli podawał 2500 godzin zebranych nagrań w 38 językach, dla których trwało zbieranie danych (29 w ówczesnym wydaniu), od ponad 50 000 osób, oraz średnią poprawę współczynnika błędów znaków o 5,99 ± 5,48 w dwunastu językach docelowych dzięki uczeniu transferowemu.
Źródło: Rosana Ardila et al. (Mozilla), „Common Voice: A Massively-Multilingual Speech Corpus”, arXiv:1912.06670, 2019, zaktualizowano w 2020 r. Liczby podano według stanu z publikacji; od tamtej pory korpus się rozrósł.
Kto najbardziej potrzebuje transkrypcji i napisów?
Ponad 5% ludności świata (430 milionów osób, w tym 34 miliony dzieci) wymaga rehabilitacji z powodu niedosłuchu powodującego niepełnosprawność już dziś. Około 95,1 miliona dzieci w wieku 5–19 lat żyje z ubytkiem słuchu. Prognozuje się, że do 2050 r. prawie 2,5 miliarda osób będzie mieć ubytek słuchu w jakimś stopniu, a ponad 700 milionów będzie wymagać rehabilitacji. Nieleczony ubytek słuchu oznacza roczny globalny koszt w wysokości prawie 1 biliona dolarów amerykańskich (US$1 trillion).
Źródło: World Health Organization, „Deafness and hearing loss”, zestawienie faktów (fact sheet), ostatnia aktualizacja 3 marca 2026 r.
Napisy stają się też obowiązkiem prawnym, a nie uprzejmością. Przepisy końcowe Departamentu Sprawiedliwości USA z 2024 r. wymagają, by strony internetowe i aplikacje mobilne władz stanowych i lokalnych spełniały WCAG 2.1 na poziomie AA, co obejmuje napisy do wideo. Tymczasowe przepisy końcowe (interim final rule) opublikowane 20 kwietnia 2026 r. przesunęły terminy na 26 kwietnia 2027 r. w przypadku jednostek obsługujących 50 000 lub więcej mieszkańców oraz na 26 kwietnia 2028 r. w przypadku mniejszych jednostek i okręgów specjalnych.
Źródło: US Department of Justice, „Fact Sheet: New Rule on the Accessibility of Web Content and Mobile Apps Provided by State and Local Governments”. Przepisy końcowe do tytułu II ustawy ADA opublikowano 24 kwietnia 2024 r.; terminy dostosowania wydłużyły tymczasowe przepisy końcowe opublikowane 20 kwietnia 2026 r.
Jak cytować tę stronę
Każda statystyka powyżej należy do organizacji wymienionej obok niej, więc cytuj ją, a nie nas. Jeśli chcesz powołać się na samo zestawienie:
ChadFlow, „Statystyki rozpoznawania mowy i głosowej AI 2026”, aktualizacja 6 października 2026 r. https://chadflow.app/pl/statystyki-rozpoznawania-mowy
Jeśli znajdziesz tu liczbę, która rozjechała się ze źródłem, albo źródło, które zmieniło adres, napisz do nas na [email protected], a poprawimy to.
Najczęściej zadawane pytania
O ile szybsze jest mówienie od pisania?
W kontrolowanym badaniu wpisywania krótkich wiadomości na iPhonie wprowadzanie głosowe osiągnęło w języku angielskim 153 słowa na minutę wobec 52 słów na minutę na klawiaturze ekranowej, czyli było 2,93 raza szybsze (Ruan et al., arXiv, 2016/2018).
Jaki jest najniższy współczynnik błędów słów (WER) w benchmarku Switchboard?
Microsoft podał współczynnik błędów słów równy 5,1% na zbiorze ewaluacyjnym Switchboard z 2000 r. w swojej publikacji z 2017 r. o systemie rozpoznawania mowy konwersacyjnej.
Czy rozpoznawanie mowy jest tak samo dokładne dla wszystkich?
Nie. W pięciu komercyjnych systemach średni współczynnik błędów słów wyniósł 0,35 dla czarnoskórych mówców wobec 0,19 dla białych mówców (Koenecke et al., PNAS, 2020).
Ile miejsc pracy dla transkrybentów medycznych zostało w USA?
42 000 w 2025 r., z prognozowanym spadkiem o 4% (ubytek 1900 miejsc pracy) w latach 2025–2035, według Occupational Outlook Handbook wydawanego przez US Bureau of Labor Statistics.
Czy notatki tworzone przez AI naprawdę oszczędzają czas?
W badaniu obejmującym 1547 klinicystów mediana czasu poświęcanego na notatki podczas jednej wizyty spadła z 7,1 minuty do 6,1 minuty po wprowadzeniu dokumentacji tworzonej przez AI działającą w tle (JAMA Network Open, 29 maja 2026 r.).
Wykorzystaj te 2,93×.
ChadFlow oferuje dyktowanie, transkrypcję spotkań z oznaczeniami mówców i odpowiedzi na żywo: na Macu, w systemie Windows i na iPhonie.
Pobierz ChadFlowMetoda: każdą liczbę sprawdzono 12 września 2026 r. i ponownie 6 października 2026 r. na stronie źródłowej lub w publikacji i uwzględniono tylko wtedy, gdy występowała w samym źródle. Prognozy wielkości rynku publikowane przez producentów celowo pominięto: dostępnych liczb nie dało się zweryfikować na podstawie pierwotnej metodologii. Tam, gdzie powszechnie powtarzanego twierdzenia nie ma w publikacji, której się je przypisuje, jak w przypadku spadku wypalenia w badaniu JAMA, mówimy o tym wprost, zamiast je powtarzać.