Uma fileira de barras retroiluminadas, de alturas diferentes, que lembra tanto um gráfico de barras quanto um espectro sonoro

Pontos principais

  • A entrada por voz atingiu 153 palavras por minuto em inglês, contra 52 PPM em um teclado em tela sensível ao toque: 2,93× mais rápida. Ruan et al., arXiv, 2016/2018
  • O ditado também foi mais preciso: taxa de erros corrigidos de 5,30% para a fala, contra 11,22% para a digitação. Ruan et al., 2016/2018
  • Mesmo os digitadores mais rápidos de um conjunto de dados com 136 milhões de teclas digitadas chegam a 120 PPM ou mais, ainda abaixo da entrada por voz medida. Dhakal et al., CHI 2018
  • Em mandarim, a fala chegou a 123 PPM, contra 43 PPM na digitação: 2,87× mais rápida. Ruan et al., 2016/2018
  • A melhor taxa de erro de palavras (WER) já relatada no conjunto Switchboard de 2000 é de 5,1%. Microsoft, 2017
  • O Whisper, da OpenAI, foi treinado com 680.000 horas de áudio multilíngue. Radford et al., 2022
  • Em cinco sistemas comerciais, a taxa média de erro de palavras foi de 0,35 para falantes negros, contra 0,19 para falantes brancos. Koenecke et al., PNAS, 2020
  • Empregos de transcritor médico nos EUA: 42.000 em 2025, com projeção de −4% até 2035. US Bureau of Labor Statistics
  • Taquígrafos judiciais e legendadores em tempo real têm remuneração mediana de US$ 72.420, com variação projetada de 0% no emprego até 2035. US Bureau of Labor Statistics
  • As reuniões semanais por usuário do Microsoft Teams aumentaram 153% desde o início da pandemia. Microsoft Work Trend Index, 2022
  • 57% das reuniões são chamadas improvisadas, sem convite na agenda. Microsoft Work Trend Index, 2025
  • Os trabalhadores são interrompidos a cada 2 minutos, cerca de 275 vezes por dia. Microsoft Work Trend Index, 2025
  • 60% dos adultos dos EUA leem o resumo gerado por IA no topo dos resultados de busca. Pew Research Center, junho de 2026
  • 49% dos adultos dos EUA já usam chatbots de IA, ante 33% em 2024. Pew Research Center, junho de 2026
  • 19,95% das empresas da UE usaram IA em 2025; 7,22% usaram especificamente reconhecimento de fala. Eurostat
  • Um único modelo já cobre 1.107 idiomas no reconhecimento de fala. Pratap et al., 2023
  • 430 milhões de pessoas precisam hoje de reabilitação por perda auditiva incapacitante; a projeção é de que 2,5 bilhões tenham algum grau de perda auditiva até 2050. Organização Mundial da Saúde (OMS)
  • Com a documentação por IA ambiente, o tempo mediano gasto com notas caiu de 7,1 para 6,1 minutos por consulta entre 1.547 clínicos. JAMA Network Open, 2026

Falar é quanto mais rápido do que digitar?

A entrada por voz foi medida em 153 palavras por minuto em inglês, contra 52 palavras por minuto em um teclado em tela sensível ao toque, um ganho de velocidade de 2,93×. Em mandarim, o mesmo estudo mediu 123 PPM para a fala, contra 43 PPM na digitação, um ganho de 2,87×.

O resultado de precisão é o que a maioria das pessoas entende errado. A velocidade da fala não veio à custa da correção: a taxa de erros corrigidos foi de 5,30% para a fala, contra 11,22% para o teclado. Já as taxas de erros não corrigidos foram no sentido inverso: 1,30% para a fala, contra 0,79% para a digitação.

A comparação usou o Deep Speech 2, da Baidu, contra o teclado nativo do iOS em um iPhone 6 Plus, em condições de laboratório, com mensagens curtas.

Para dar contexto ao lado da digitação nessa comparação: o maior estudo sobre digitação no dia a dia, com 136 milhões de teclas digitadas por 168.000 voluntários, constatou que os digitadores mais rápidos “chegam a velocidades de até 120 PPM ou mais”, enquanto o grupo maior e mais lento de digitadores ficou em torno de 46 PPM. O treinamento formal quase não muda isso: os digitadores com treinamento foram, em média, apenas 5 PPM mais rápidos do que os sem treinamento.

Por isso o teto importa. A entrada por voz a 153 PPM não é apenas mais rápida do que a digitação média: é mais rápida do que os digitadores mais rápidos de um conjunto de dados desse tamanho, e sem prática.

Fonte: Vivek Dhakal, Anna Feit, Per Ola Kristensson, Antti Oulasvirta, “Observations on Typing from 136 Million Keystrokes”, CHI 2018, Aalto University.

Fonte: Sherry Ruan, Jacob O. Wobbrock, Kenny Liou, Andrew Ng, James Landay, “Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones”, arXiv:1608.07323, enviado em 2016, revisado em 2018.

Qual é a precisão do reconhecimento de fala no melhor cenário?

O menor número de benchmark amplamente citado é uma taxa de erro de palavras (WER) de 5,1% no conjunto de avaliação Switchboard de 2000, relatada pela Microsoft em 2017. Repare no que esse número é e no que não é: trata-se de fala conversacional ao telefone em condições de benchmark, não de uma garantia para a sua sala de reunião. O artigo chega a compará-lo com pessoas: diz que o resultado está “no mesmo nível da taxa de erro de múltiplos transcritores relatada anteriormente para a mesma tarefa”.

A escala é a outra metade da história. O Whisper foi treinado com 680.000 horas de supervisão multilíngue e multitarefa: é a passagem do treinamento de voz por usuário para modelos que generalizam a partir de conjuntos de dados muito grandes e desorganizados.

Fontes: W. Xiong, L. Wu, F. Alleva, J. Droppo, X. Huang, A. Stolcke (Microsoft), “The Microsoft 2017 Conversational Speech Recognition System”, arXiv:1708.06073, 2017. A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, I. Sutskever (OpenAI), “Robust Speech Recognition via Large-Scale Weak Supervision”, arXiv:2212.04356, 2022.

O reconhecimento de fala é igualmente preciso para todos?

Não. Em cinco sistemas comerciais, da Amazon, Apple, Google, IBM e Microsoft, a taxa média de erro de palavras foi de 0,35 para falantes negros, contra 0,19 para falantes brancos: quase o dobro de erros na mesma tarefa.

O estudo usou entrevistas estruturadas com 42 falantes brancos e 73 falantes negros em cinco cidades dos EUA, num total de 19,8 horas de áudio. A diferença persistiu quando os dois grupos disseram frases idênticas, o que os autores atribuem aos modelos acústicos subjacentes, e não ao vocabulário ou à gramática.

Este é o número mais importante desta página para quem lança software de voz: a precisão em benchmark e a precisão para os seus usuários reais são grandezas diferentes.

Fonte: Allison Koenecke, Andrew Nam, Emily Lake, Joe Nudell, Minnie Quartey, Zion Mengesha, Connor Toups, John R. Rickford, Dan Jurafsky, Sharad Goel, “Racial disparities in automated speech recognition”, Proceedings of the National Academy of Sciences 117(14):7684–7689, 7 de abril de 2020. doi:10.1073/pnas.1915768117 (registro aberto: PubMed)

O que a automação está fazendo com o trabalho de transcrição?

Está reduzindo os empregos que apenas transcrevem e deixando praticamente intactos os que certificam ou interpretam. Projeções do US Bureau of Labor Statistics para 2025–2035:

OcupaçãoEmpregos (2025)Remuneração mediana (maio de 2025)Projeção 2025–35
Transcritores médicos42.000US$ 40.410 (US$ 19,43/h)−4% (−1.900 empregos)
Taquígrafos judiciais e legendadores em tempo real19.900US$ 72.4200% (sem variação)
Intérpretes e tradutores73.900US$ 60.170+2% (+1.500 empregos)

A taquigrafia judicial é o caso mais instrutivo: o emprego está estável, mas a projeção é de cerca de 1.800 vagas abertas por ano ao longo da década, em sua maioria para repor pessoas que mudam de ocupação ou deixam o mercado de trabalho, e não por crescimento.

Fonte: US Bureau of Labor Statistics, Occupational Outlook Handbook: Medical Transcriptionists, Court Reporters and Simultaneous Captioners, Interpreters and Translators. Páginas modificadas pela última vez em 27 de agosto de 2026.

Quanto da semana de trabalho vai para reuniões?

A carga de reuniões cresceu muito e depois mudou de forma. A Microsoft mediu um aumento de 153% nas reuniões semanais por usuário do Teams desde o início da pandemia e um aumento de 46% nas reuniões sobrepostas (marcadas no mesmo horário) por pessoa, de um ano para o outro.

A telemetria mais recente da empresa descreve um dia fragmentado, e não apenas cheio:

  • 57% das reuniões são chamadas improvisadas, sem convite na agenda.
  • 50% de todas as reuniões caem em duas faixas de horário: das 9h às 11h e das 13h às 15h.
  • A terça-feira tem a maior carga, com 23% das reuniões; a sexta-feira, a menor, com 16%.
  • 1 em cada 10 reuniões agendadas é marcada de última hora.
  • Quase um terço das reuniões abrange vários fusos horários, um aumento de 35% desde 2021.
  • As reuniões depois das 20h aumentaram 16% de um ano para o outro.
  • As reuniões grandes, com 65 ou mais participantes, são o tipo que mais cresce.
  • Os trabalhadores são interrompidos a cada 2 minutos, aproximadamente 275 vezes por dia.

Esse padrão (reuniões não agendadas, sobrepostas e fora do horário) explica por que as anotações que dependem de alguém estar livre para digitar deixaram de funcionar. Veja como funciona a captura de reuniões sem bot.

Fontes: Microsoft, “Hybrid Work Is Just Work. Are We Doing It Wrong?”, Work Trend Index, 22 de setembro de 2022. Microsoft, “Breaking down the infinite workday”, relatório especial do Work Trend Index, 17 de junho de 2025.

As anotações com IA economizam mesmo um tempo mensurável?

Sim, e a evidência mais bem medida vem da documentação clínica. Entre 1.547 clínicos e 16.149 observações, o tempo mediano gasto com notas caiu de 7,1 minutos para 6,1 minutos por consulta depois da adoção da documentação por IA ambiente.

Os efeitos modelados foram menores, mas consistentes: uma redução de 0,26 minuto por nota no primeiro mês, uma redução mensal adicional e sustentada de 0,38 minuto na documentação fora do horário de trabalho e um aumento imediato de 7,40 unidades de valor relativo por mês. O estudo não encontrou mudança significativa na pontuação do perfil de eficiência do clínico.

Uma ressalva que vale repetir, porque as compilações costumam omiti-la: este estudo mediu tempo de documentação e produtividade, não burnout. Os números que atribuem a este artigo reduções de burnout não constam dele.

Fonte: “Ambient Artificial Intelligence Use and Clinician Documentation Burden, Productivity, and Efficiency”, JAMA Network Open, 29 de maio de 2026. jamanetwork.com (acesso aberto: PubMed Central)

Que regras se aplicam à IA em entrevistas de emprego?

Em NYC, os empregadores que usam uma ferramenta automatizada de decisão de emprego precisam tê-la submetido a uma auditoria de viés no ano anterior, publicar um resumo dos resultados da auditoria e avisar os candidatos com pelo menos 10 dias úteis de antecedência. O Department of Consumer and Worker Protection começou a aplicar a Local Law 144 of 2021 em 5 de julho de 2023.

Se você está do lado do candidato, nosso guia de assistentes de entrevista com IA mostra o que as ferramentas fazem e onde estão os limites.

Fonte: New York City Department of Consumer and Worker Protection, Automated Employment Decision Tools, Local Law 144 of 2021.

Quantas pessoas e empresas realmente usam isso?

Cerca de metade da população adulta dos EUA já usa chatbots de IA: 49% dos adultos dos EUA no início de 2026, ante 33% em 2024, sendo que o próprio ChatGPT estava em 18% em 2023. Por plataforma, a distribuição é: ChatGPT 44%, Gemini 24%, Copilot 17%, Meta AI 14%, Grok 8%, Claude 6% e Character.ai 3%.

O número com as consequências mais amplas para quem publica na internet: 60% dos adultos dos EUA dizem ler os resumos gerados por IA no topo dos resultados de busca. Ser a fonte de onde esses resumos tiram informação já é, por si só, um canal de distribuição.

Fonte: Pew Research Center, “Americans and AI 2026: Chatbots, Smart Devices and Views on Impact”, 17 de junho de 2026; pesquisa com 5.119 adultos dos EUA, realizada de 17 a 23 de fevereiro de 2026.

Do lado das organizações, 88% das organizações pesquisadas usam IA em pelo menos uma frente e 70% usam IA generativa em pelo menos uma função de negócio. A IA generativa chegou a 53% de adoção em três anos, mais rápido do que os computadores pessoais ou a internet.

Fonte: Stanford HAI, 2026 AI Index Report, capítulo Economy.

Os números europeus vêm de um órgão de estatística, e não de uma pesquisa de fornecedor, o que os torna a melhor citação. Em 2025, 19,95% das empresas da UE usaram tecnologias de IA, um aumento de 6,47 pontos percentuais em relação a 2024. Por tecnologia: mineração de texto, 11,75%; mídia generativa, 9,55%; geração de linguagem natural e síntese de fala, 8,76%; e reconhecimento de fala, 7,22%.

A adoção é extremamente desigual. Dinamarca (42,03%), Finlândia (37,82%) e Suécia (35,04%) lideram; Romênia (5,21%), Polônia (8,36%) e Bulgária (8,55%) ficam por último. Por porte, 55,03% das grandes empresas usam IA, contra 30,36% das médias e 17% das pequenas.

Fonte: Eurostat, “Use of artificial intelligence in enterprises”, Statistics Explained, ano de referência 2025.

Com quantos idiomas o reconhecimento de fala consegue lidar?

Um único modelo multilíngue já cobre 1.107 idiomas no reconhecimento de fala, com síntese de fala para o mesmo número. No benchmark FLEURS, ele “reduz a taxa de erro de palavras do Whisper para menos da metade em 54 idiomas”.

Isso importa para além do prestígio: a maioria dos idiomas do mundo nunca teve um ditado por voz utilizável, e a limitação sempre foram os dados rotulados, não o projeto do modelo.

Fonte: Vineel Pratap et al. (Meta AI), “Scaling Speech Technology to 1,000+ Languages”, arXiv:2305.13516, 2023.

O lado dos dados abertos é menor do que se imagina. O Common Voice, da Mozilla, relatou 2.500 horas de áudio coletado em 38 idiomas em coleta (29 na versão então vigente), de mais de 50.000 colaboradores, e uma melhora média da taxa de erro de caracteres de 5,99 ± 5,48 em doze idiomas-alvo por meio de aprendizagem por transferência.

Fonte: Rosana Ardila et al. (Mozilla), “Common Voice: A Massively-Multilingual Speech Corpus”, arXiv:1912.06670, 2019, revisado em 2020. Os números são os publicados na época; o corpus cresceu desde então.

Quem mais precisa de transcrição e legendas?

Mais de 5% da população mundial (430 milhões de pessoas, entre elas 34 milhões de crianças) precisa de reabilitação por perda auditiva incapacitante hoje. Cerca de 95,1 milhões de crianças de 5 a 19 anos vivem com perda auditiva. Até 2050, a projeção é de que quase 2,5 bilhões de pessoas tenham algum grau de perda auditiva e de que mais de 700 milhões precisem de reabilitação. A perda auditiva não tratada tem um custo global anual de quase US$ 1 trilhão.

Fonte: Organização Mundial da Saúde (World Health Organization), ficha informativa “Deafness and hearing loss”, atualizada pela última vez em 3 de março de 2026.

As legendas também estão deixando de ser uma cortesia para virar obrigação legal. A regra final de 2024 do Departamento de Justiça dos EUA exige que sites e apps móveis de governos estaduais e locais atendam ao WCAG 2.1 nível AA, que inclui legendas em vídeos. Uma regra final provisória publicada em 20 de abril de 2026 adiou os prazos para 26 de abril de 2027, no caso de entidades que atendem populações de 50.000 pessoas ou mais, e para 26 de abril de 2028, no caso de entidades menores e distritos especiais.

Fonte: US Department of Justice, “Fact Sheet: New Rule on the Accessibility of Web Content and Mobile Apps Provided by State and Local Governments”. Regra final do Título II da ADA, publicada em 24 de abril de 2024; prazos de conformidade prorrogados pela regra final provisória publicada em 20 de abril de 2026.

Como citar esta página

Cada estatística acima pertence à organização indicada ao lado dela: cite essas organizações, não a nós. Se quiser fazer referência à compilação em si:

ChadFlow, “Estatísticas de IA de voz 2026”, atualizado em 6 de outubro de 2026. https://chadflow.app/pt/estatisticas-de-ia-de-voz

Se você encontrar aqui um número que já não bate com a fonte, ou uma fonte que mudou de endereço, avise-nos pelo [email protected] e nós corrigimos.

Perguntas frequentes

Falar é quanto mais rápido do que digitar?

Em um estudo controlado sobre a escrita de mensagens curtas em um iPhone, a entrada por voz chegou a 153 palavras por minuto em inglês, contra 52 palavras por minuto no teclado em tela sensível ao toque: 2,93 vezes mais rápida (Ruan et al., arXiv, 2016/2018).

Qual é a menor taxa de erro de palavras no benchmark Switchboard?

A Microsoft relatou uma taxa de erro de palavras de 5,1% no conjunto de avaliação Switchboard de 2000, no artigo de 2017 sobre o seu sistema de reconhecimento de fala conversacional.

O reconhecimento de fala é igualmente preciso para todos?

Não. Em cinco sistemas comerciais, a taxa média de erro de palavras foi de 0,35 para falantes negros, contra 0,19 para falantes brancos (Koenecke et al., PNAS, 2020).

Quantos empregos de transcritor médico restam nos EUA?

São 42.000 em 2025, com projeção de queda de 4% (perda de 1.900 empregos) entre 2025 e 2035, segundo o Occupational Outlook Handbook do US Bureau of Labor Statistics.

As anotações com IA economizam tempo de verdade?

Em um estudo com 1.547 clínicos, o tempo mediano gasto com notas por consulta caiu de 7,1 minutos para 6,1 minutos depois da adoção da documentação por IA ambiente (JAMA Network Open, 29 de maio de 2026).

Coloque os 2,93× para trabalhar.

O ChadFlow faz ditado, transcrição de reuniões com identificação de falantes e respostas ao vivo, no Mac, no Windows e no iPhone.

Baixar o ChadFlow

Método: cada número foi conferido na página ou no artigo de origem em 12 de setembro de 2026 e novamente em 6 de outubro de 2026 e só foi incluído quando aparecia na própria fonte. As projeções de tamanho de mercado feitas por fornecedores foram excluídas de propósito: os números publicados a que tivemos acesso não puderam ser verificados com base em uma metodologia primária. Quando uma alegação muito repetida não constava do artigo a que é atribuída, como as reduções de burnout no estudo da JAMA, dizemos isso em vez de repeti-la.