Una fila de barras retroiluminadas de distintas alturas que parece a la vez un gráfico de barras y un espectro de sonido

Datos clave

  • El dictado por voz alcanzó 153 palabras por minuto en inglés frente a 52 palabras por minuto con un teclado táctil: 2.93 veces más rápido. Ruan et al., arXiv, 2016/2018
  • El dictado también fue más preciso: una tasa de errores corregidos del 5.30 % con la voz frente al 11.22 % al teclear. Ruan et al., 2016/2018
  • Incluso quienes más rápido teclean en un conjunto de datos de 136 millones de pulsaciones alcanzan 120 palabras por minuto o más, todavía por debajo de lo medido con el dictado por voz. Dhakal et al., CHI 2018
  • En mandarín, la voz llegó a 123 palabras por minuto frente a 43 palabras por minuto al teclear: 2.87 veces más rápido. Ruan et al., 2016/2018
  • La mejor tasa de error de palabras (WER) publicada en el conjunto Switchboard 2000 es del 5.1 %. Microsoft, 2017
  • Whisper, de OpenAI, se entrenó con 680,000 horas de audio multilingüe. Radford et al., 2022
  • En cinco sistemas comerciales, la tasa media de error de palabras fue de 0.35 para hablantes negros frente a 0.19 para hablantes blancos. Koenecke et al., PNAS, 2020
  • Empleos de transcriptor médico en EE. UU.: 42,000 en 2025, con una proyección de −4 % para 2035. US Bureau of Labor Statistics
  • Los taquígrafos judiciales y subtituladores en tiempo real tienen un salario mediano de $72,420 USD, y se prevé que su empleo varíe un 0 % hasta 2035. US Bureau of Labor Statistics
  • Las reuniones semanales por usuario de Microsoft Teams aumentaron un 153 % desde el inicio de la pandemia. Microsoft Work Trend Index, 2022
  • El 57 % de las reuniones son llamadas improvisadas, sin invitación de calendario. Microsoft Work Trend Index, 2025
  • A los trabajadores los interrumpen cada 2 minutos, unas 275 veces al día. Microsoft Work Trend Index, 2025
  • El 60 % de los adultos de EE. UU. lee el resumen generado por IA que aparece al principio de los resultados de búsqueda. Pew Research Center, junio de 2026
  • El 49 % de los adultos de EE. UU. ya usa chatbots de IA, frente al 33 % en 2024. Pew Research Center, junio de 2026
  • El 19.95 % de las empresas de la UE usó IA en 2025; el 7.22 % usó específicamente reconocimiento de voz. Eurostat
  • Un solo modelo cubre ya 1,107 idiomas en reconocimiento de voz. Pratap et al., 2023
  • 430 millones de personas necesitan hoy rehabilitación por una pérdida de audición discapacitante; se prevé que 2.5 mil millones tengan algún grado de pérdida de audición en 2050. World Health Organization
  • Con la documentación mediante IA ambiental, la mediana del tiempo dedicado a las notas bajó de 7.1 a 6.1 minutos por consulta entre 1,547 profesionales clínicos. JAMA Network Open, 2026

¿Cuánto más rápido es hablar que teclear?

El dictado por voz se midió en 153 palabras por minuto en inglés frente a 52 palabras por minuto con un teclado táctil: 2.93 veces más rápido. En mandarín, el mismo estudio midió 123 palabras por minuto con la voz frente a 43 palabras por minuto al teclear: 2.87 veces más rápido.

El resultado de precisión es el que más gente interpreta mal. Hablar no supuso sacrificar corrección: la tasa de errores corregidos fue del 5.30 % con la voz frente al 11.22 % con el teclado. Las tasas de errores sin corregir fueron en sentido contrario: 1.30 % con la voz frente a 0.79 % al teclear.

La comparación enfrentó Deep Speech 2, de Baidu, con el teclado integrado de iOS en un iPhone 6 Plus, en condiciones de laboratorio y con mensajes cortos.

Para poner en contexto el lado del teclado en esa comparación: el mayor estudio sobre la escritura cotidiana con teclado (136 millones de pulsaciones de 168,000 voluntarios) encontró que quienes más rápido teclean “alcanzan velocidades de hasta 120 palabras por minuto o más”, mientras que el grupo más numeroso y más lento rondaba las 46 palabras por minuto. Aprender mecanografía de manera formal apenas lo cambia: quienes lo habían hecho eran, en promedio, solo 5 palabras por minuto más rápidos que el resto.

Por eso importa el techo. A 153 palabras por minuto, el dictado por voz deja atrás la velocidad media al teclear y también a quienes más rápido teclean en un conjunto de datos de ese tamaño, y lo hace sin práctica.

Fuente: Vivek Dhakal, Anna Feit, Per Ola Kristensson, Antti Oulasvirta, “Observations on Typing from 136 Million Keystrokes”, CHI 2018, Aalto University.

Fuente: Sherry Ruan, Jacob O. Wobbrock, Kenny Liou, Andrew Ng, James Landay, “Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones”, arXiv:1608.07323, enviado en 2016, revisado en 2018.

¿Qué precisión alcanza el reconocimiento de voz en el mejor de los casos?

La cifra de referencia más baja que se cita habitualmente es una tasa de error de palabras (WER) del 5.1 % en el conjunto de evaluación Switchboard 2000, publicada por Microsoft en 2017. Conviene tener claro qué es y qué no es ese número: se trata de habla conversacional por teléfono en las condiciones de una prueba de referencia, no de una garantía para tu sala de reuniones. El artículo sí lo compara con las personas: dice que el resultado está “a la par de la tasa de error con varios transcriptores publicada anteriormente para la misma tarea”.

La escala es la otra mitad de la historia. Whisper se entrenó con 680,000 horas de supervisión multilingüe y multitarea: el paso de entrenar la voz usuario por usuario a modelos que generalizan a partir de conjuntos de datos muy grandes y desordenados.

Fuentes: W. Xiong, L. Wu, F. Alleva, J. Droppo, X. Huang, A. Stolcke (Microsoft), “The Microsoft 2017 Conversational Speech Recognition System”, arXiv:1708.06073, 2017. A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, I. Sutskever (OpenAI), “Robust Speech Recognition via Large-Scale Weak Supervision”, arXiv:2212.04356, 2022.

¿El reconocimiento de voz es igual de preciso para todo el mundo?

No. En cinco sistemas comerciales de Amazon, Apple, Google, IBM y Microsoft, la tasa media de error de palabras fue de 0.35 para hablantes negros frente a 0.19 para hablantes blancos: casi el doble de errores en la misma tarea.

El estudio usó entrevistas estructuradas con 42 hablantes blancos y 73 hablantes negros de cinco ciudades de EE. UU., con un total de 19.8 horas de audio. La brecha se mantuvo cuando ambos grupos dijeron frases idénticas, algo que los autores atribuyen a los modelos acústicos subyacentes y no al vocabulario ni a la gramática.

Para cualquiera que lance software de voz, este es el número más importante de la página: la precisión en una prueba de referencia y la precisión con tus usuarios reales son magnitudes distintas.

Fuente: Allison Koenecke, Andrew Nam, Emily Lake, Joe Nudell, Minnie Quartey, Zion Mengesha, Connor Toups, John R. Rickford, Dan Jurafsky, Sharad Goel, “Racial disparities in automated speech recognition”, Proceedings of the National Academy of Sciences 117(14):7684–7689, 7 de abril de 2020. doi:10.1073/pnas.1915768117 (registro abierto: PubMed)

¿Qué le está haciendo la automatización al trabajo de transcripción?

Está reduciendo los empleos que solo transcriben y dejando prácticamente intactos los que certifican o interpretan. Proyecciones de la oficina de estadísticas laborales de EE. UU. (US Bureau of Labor Statistics) para 2025–2035:

OcupaciónEmpleos (2025)Salario mediano (mayo de 2025, USD)Proyección 2025–35
Transcriptores médicos42,000$40,410 ($19.43/hora)−4 % (−1,900 empleos)
Taquígrafos judiciales y subtituladores en tiempo real19,900$72,420 USD0 % (sin cambios)
Intérpretes y traductores73,900$60,170 USD+2 % (+1,500 empleos)

La taquigrafía judicial es el caso más ilustrativo: el empleo no varía y, aun así, se prevén unas 1,800 vacantes al año durante la década, sobre todo para reemplazar a quienes cambian de ocupación o dejan el mercado laboral, y no por el crecimiento.

Fuente: US Bureau of Labor Statistics, Occupational Outlook Handbook: Medical Transcriptionists, Court Reporters and Simultaneous Captioners, Interpreters and Translators. Páginas modificadas por última vez el 27 de agosto de 2026.

¿Cuánto de la semana laboral se va en reuniones?

La carga de reuniones creció con fuerza y después cambió de forma. Microsoft midió un aumento del 153 % en las reuniones semanales por usuario de Teams desde el inicio de la pandemia y un aumento interanual del 46 % en las reuniones superpuestas (con doble reserva) por persona.

Su telemetría posterior describe una jornada que, más que llena, está fragmentada:

  • El 57 % de las reuniones son llamadas improvisadas, sin invitación de calendario.
  • El 50 % de todas las reuniones cae en dos franjas: de 9 a 11 de la mañana y de 1 a 3 de la tarde.
  • El martes soporta la mayor carga, con el 23 % de las reuniones; el viernes, la menor, con el 16 %.
  • 1 de cada 10 reuniones programadas se convoca a última hora.
  • Casi un tercio de las reuniones abarca varias zonas horarias, un 35 % más que en 2021.
  • Las reuniones después de las 8 de la noche aumentaron un 16 % interanual.
  • Las reuniones grandes, de 65 asistentes o más, son el tipo que más rápido crece.
  • A los trabajadores los interrumpen cada 2 minutos, aproximadamente 275 veces al día.

Ese patrón (reuniones sin programar, superpuestas y fuera de horario) es el motivo por el que ha dejado de funcionar tomar notas dependiendo de que alguien tenga las manos libres para teclear. Consulta cómo funciona la captura de reuniones sin bot.

Fuentes: Microsoft, “Hybrid Work Is Just Work. Are We Doing It Wrong?”, Work Trend Index, 22 de septiembre de 2022. Microsoft, “Breaking down the infinite workday”, informe especial del Work Trend Index, 17 de junio de 2025.

¿Tomar notas con IA ahorra de verdad un tiempo medible?

Sí, y la evidencia mejor medida viene de la documentación clínica. Entre 1,547 profesionales clínicos y 16,149 observaciones, la mediana del tiempo dedicado a las notas bajó de 7.1 minutos a 6.1 minutos por consulta tras introducir la documentación con IA ambiental.

Los efectos modelizados fueron menores, pero coherentes: una reducción de 0.26 minutos por nota en el primer mes, una reducción mensual adicional y sostenida de 0.38 minutos en la documentación fuera de horario y un aumento inmediato de 7.40 unidades de valor relativo al mes. El estudio no encontró cambios significativos en la puntuación del perfil de eficiencia de los profesionales clínicos.

Una salvedad que conviene repetir, porque las recopilaciones suelen omitirla: este estudio midió el tiempo de documentación y la productividad, no el desgaste profesional (burnout). Las cifras que atribuyen a este artículo una reducción del burnout no aparecen en él.

Fuente: “Ambient Artificial Intelligence Use and Clinician Documentation Burden, Productivity, and Efficiency”, JAMA Network Open, 29 de mayo de 2026. jamanetwork.com (acceso abierto: PubMed Central)

¿Qué normas se aplican a la IA en las entrevistas de selección?

En la ciudad de Nueva York, las empresas que usan una herramienta automatizada de decisiones de empleo deben haberla sometido a una auditoría de sesgos durante el año anterior, deben publicar un resumen de los resultados de la auditoría y deben avisar a los candidatos con al menos 10 días hábiles de antelación. El Department of Consumer and Worker Protection de la ciudad empezó a aplicar la Local Law 144 of 2021 el 5 de julio de 2023.

Si estás del lado del candidato, nuestra guía de asistentes de entrevistas con IA explica qué hacen las herramientas y dónde están los límites.

Fuente: New York City Department of Consumer and Worker Protection, Automated Employment Decision Tools, Local Law 144 of 2021.

¿Cuántas personas y empresas usan esto de verdad?

Cerca de la mitad de la población adulta de EE. UU. ya usa chatbots de IA: el 49 % de los adultos estadounidenses a principios de 2026, frente al 33 % en 2024, y con ChatGPT por sí solo en el 18 % en 2023. Por plataforma, el reparto es: ChatGPT 44 %, Gemini 24 %, Copilot 17 %, Meta AI 14 %, Grok 8 %, Claude 6 % y Character.ai 3 %.

El número con más consecuencias para cualquiera que publique en internet: el 60 % de los adultos estadounidenses dice que lee los resúmenes generados por IA que aparecen al principio de los resultados de búsqueda. Ser la fuente de la que beben esos resúmenes es ya un canal de distribución por derecho propio.

Fuente: Pew Research Center, “Americans and AI 2026: Chatbots, Smart Devices and Views on Impact”, 17 de junio de 2026; encuesta a 5,119 adultos de EE. UU., realizada del 17 al 23 de febrero de 2026.

En el lado de las organizaciones, el 88 % de las organizaciones encuestadas usa IA en al menos un ámbito y el 70 % usa IA generativa en al menos una función del negocio. La IA generativa alcanzó una adopción del 53 % en tres años, más rápido que la informática personal o internet.

Fuente: Stanford HAI, 2026 AI Index Report, capítulo Economy.

Las cifras europeas proceden de un organismo estadístico y no de la encuesta de un proveedor, por lo que son mejor cita. En 2025, el 19.95 % de las empresas de la UE usó tecnologías de IA, 6.47 puntos porcentuales más que en 2024. Por tecnología: minería de textos, 11.75 %; generación de contenido multimedia, 9.55 %; generación de lenguaje natural y síntesis de voz, 8.76 %; y reconocimiento de voz, 7.22 %.

La adopción es muy desigual. Lideran Dinamarca (42.03 %), Finlandia (37.82 %) y Suecia (35.04 %); a la cola están Rumanía (5.21 %), Polonia (8.36 %) y Bulgaria (8.55 %). Por tamaño, el 55.03 % de las grandes empresas usa IA, frente al 30.36 % de las medianas y el 17 % de las pequeñas.

Fuente: Eurostat, “Use of artificial intelligence in enterprises”, Statistics Explained, año de referencia 2025.

¿Cuántos idiomas puede manejar el reconocimiento de voz?

Un único modelo multilingüe cubre ya 1,107 idiomas en reconocimiento de voz, con síntesis de voz para la misma cantidad. En la prueba de referencia FLEURS “reduce a menos de la mitad la tasa de error de palabras de Whisper en 54 idiomas”.

Eso importa más allá de presumir de cifras: la mayoría de los idiomas del mundo nunca ha tenido un dictado utilizable, y el límite siempre han sido los datos etiquetados, no el diseño de los modelos.

Fuente: Vineel Pratap et al. (Meta AI), “Scaling Speech Technology to 1,000+ Languages”, arXiv:2305.13516, 2023.

El lado de los datos abiertos es más pequeño de lo que se suele suponer. Common Voice, de Mozilla, informó de 2,500 horas de audio recopilado, con 38 idiomas en proceso de recopilación (29 en la versión vigente entonces) y más de 50,000 colaboradores, además de una mejora media de la tasa de error de caracteres de 5.99 ± 5.48 en doce idiomas objetivo gracias al aprendizaje por transferencia.

Fuente: Rosana Ardila et al. (Mozilla), “Common Voice: A Massively-Multilingual Speech Corpus”, arXiv:1912.06670, 2019, revisado en 2020. Las cifras son las publicadas entonces; el corpus ha crecido desde ese momento.

¿Quién necesita más la transcripción y los subtítulos?

Más del 5 % de la población mundial (430 millones de personas, entre ellas 34 millones de niños) necesita rehabilitación por una pérdida de audición discapacitante en la actualidad. Alrededor de 95.1 millones de niños de 5 a 19 años viven con pérdida de audición. Para 2050 se prevé que casi 2.5 mil millones de personas tengan algún grado de pérdida de audición y que más de 700 millones necesiten rehabilitación. La pérdida de audición no atendida le cuesta al mundo casi 1 billón de dólares estadounidenses al año.

Fuente: World Health Organization, nota descriptiva “Deafness and hearing loss”, actualizada por última vez el 3 de marzo de 2026.

Los subtítulos, además, están dejando de ser una cortesía para convertirse en una obligación legal. La norma definitiva de 2024 del Departamento de Justicia de EE. UU. exige que los sitios web y las apps móviles de los gobiernos estatales y locales cumplan las WCAG 2.1, nivel AA, que incluyen subtítulos para los videos. Una norma definitiva provisional (interim final rule) publicada el 20 de abril de 2026 trasladó los plazos al 26 de abril de 2027 para las entidades que atienden a poblaciones de 50,000 habitantes o más, y al 26 de abril de 2028 para las entidades más pequeñas y los distritos especiales.

Fuente: US Department of Justice, “Fact Sheet: New Rule on the Accessibility of Web Content and Mobile Apps Provided by State and Local Governments”. Norma definitiva del Título II de la ADA, publicada el 24 de abril de 2024; plazos de cumplimiento ampliados por la norma definitiva provisional publicada el 20 de abril de 2026.

Cómo citar esta página

Cada estadística de esta página pertenece a la organización que aparece a su lado: cítalas a ellas, no a nosotros. Si quieres hacer referencia a la recopilación en sí:

ChadFlow, “Estadísticas de IA de voz 2026”, actualizado el 6 de octubre de 2026. https://chadflow.app/es/estadisticas-de-ia-de-voz

Si encuentras aquí una cifra que ya no coincide con su fuente, o una fuente que ha cambiado de dirección, escríbenos a [email protected] y la corregiremos.

Preguntas frecuentes

¿Cuánto más rápido es hablar que teclear?

En un estudio controlado sobre la escritura de mensajes cortos en un iPhone, el dictado por voz alcanzó 153 palabras por minuto en inglés frente a 52 palabras por minuto con el teclado táctil: 2.93 veces más rápido (Ruan et al., arXiv, 2016/2018).

¿Cuál es la tasa de error de palabras más baja en la prueba de referencia Switchboard?

Microsoft publicó una tasa de error de palabras del 5.1 % en el conjunto de evaluación Switchboard 2000, en su artículo de 2017 sobre su sistema de reconocimiento de voz conversacional.

¿El reconocimiento de voz es igual de preciso para todo el mundo?

No. En cinco sistemas comerciales, la tasa media de error de palabras fue de 0.35 para hablantes negros frente a 0.19 para hablantes blancos (Koenecke et al., PNAS, 2020).

¿Cuántos empleos de transcriptor médico quedan en EE. UU.?

42,000 en 2025, con una caída prevista del 4 % (1,900 empleos menos) entre 2025 y 2035, según el Occupational Outlook Handbook del US Bureau of Labor Statistics.

¿Tomar notas con IA ahorra tiempo de verdad?

En un estudio con 1,547 profesionales clínicos, la mediana del tiempo dedicado a las notas por consulta bajó de 7.1 minutos a 6.1 minutos tras introducir la documentación con IA ambiental (JAMA Network Open, 29 de mayo de 2026).

Aprovecha esa ventaja de 2.93 veces.

ChadFlow ofrece dictado, transcripción de reuniones con identificación de hablantes y respuestas en tiempo real, en Mac, Windows y iPhone.

Descargar ChadFlow

Método: Cada cifra se comprobó en la página o el artículo de origen el 12 de septiembre de 2026 y de nuevo el 6 de octubre de 2026, y solo se incluyó cuando el número aparecía en la propia fuente. Excluimos deliberadamente las proyecciones de tamaño de mercado de los proveedores: las cifras publicadas a las que pudimos acceder no se podían verificar con una metodología primaria. Cuando una afirmación muy repetida no aparecía en el artículo al que se atribuye, como la reducción del burnout en el estudio de JAMA, lo decimos en lugar de repetirla.