Voz a texto: cómo funciona la tecnología
Autor: Hushscript Publicado: Última revisión:
La voz a texto es un software que convierte el audio hablado en palabras escritas. El término cubre dos trabajos diferentes que se sienten similares pero funcionan de manera diferente: dictado en vivo, donde hablas y el texto aparece a medida que avanzas, y transcripción, donde entregas una grabación y recibes una transcripción terminada. La idea central es la misma en ambos. El flujo de trabajo, la precisión y lo que puedes hacer con el resultado no lo son.
Esta guía explica qué es realmente la conversión de voz a texto, con palabras sencillas, cómo el motor pasa del sonido a las palabras y en qué se diferencian los dos modos. Luego, explica cómo convertir una grabación a texto en Hushscript, con un ejemplo resuelto, los problemas que hacen tropezar a las personas y una breve pregunta frecuente al final.
Qué es realmente la conversión de voz a texto
En su forma más simple, el reconocimiento automático de voz (ASR) toma una onda de sonido y produce una secuencia de palabras. Un micrófono captura el habla como una forma de onda continua, una línea oscilante que representa la presión del aire que cambia con el tiempo. Esa forma de onda lo transporta todo: las palabras, la voz del hablante, la habitación, el zumbido de un aire acondicionado. La tarea del motor es extraer las palabras de esa mezcla y escribirlas.
Para hacerlo, el motor corta el audio en pequeñas porciones, generalmente de 10 a 30 milisegundos cada una, y mide el sonido en cada porción. Esas mediciones alimentan un modelo entrenado que mapea patrones de sonido en las unidades de habla de un idioma, luego en palabras y luego en frases completas. No ves nada de esto. Ves entrar una grabación y salir una transcripción. Pero conocer aproximadamente lo que sucede en el interior explica por qué algunas grabaciones se transcriben limpiamente y otras se reproducen de manera irregular.
Hay dos capas de conocimiento que trabajan juntas. Uno es acústico: cuáles son los sonidos de un idioma y cómo tienden a pronunciarse en diferentes voces y acentos. La otra es lingüística: qué secuencias de palabras son plausibles. La capa lingüística es la razón por la que un buen motor escribe “su auto se averió” en lugar de “su auto se averió”, aunque los dos suenan idénticos. Se trata de utilizar el contexto para elegir la ortografía que usaría un ser humano.
El reconocimiento de voz más antiguo dependía de reglas escritas a mano y pequeños conjuntos de entrenamiento, y era frágil. Los motores modernos son grandes modelos de IA entrenados con miles de horas de discurso grabado de muchos hablantes, acentos y condiciones de grabación. Esa amplitud es la única razón por la que las transcripciones actuales son utilizables. Con un discurso claro en una grabación decente, los modelos actuales obtienen entre un 90 y un 97 por ciento de precisión en las palabras. El pequeño porcentaje restante es donde se mantiene la solución de problemas que se describe más adelante en esta guía.
Discurso grabado versus dictado en vivo
La división que más importa en la práctica es si el audio se procesa en vivo o después del hecho.
El dictado en vivo se ejecuta en tiempo real. Habla por teléfono, por un asistente de voz o por la función de escritura por voz de un procesador de textos y las palabras aparecen casi tan rápido como las dice. Para mantenerse al día, el motor tiene que comprometerse con cada palabra con muy poca oración en la que apoyarse. Esta es una restricción difícil y es la razón por la que el dictado a veces adivina una palabra y luego la reescribe silenciosamente una vez que llegan las siguientes palabras. El dictado en vivo es la herramienta adecuada cuando el objetivo es capturar su propio discurso sobre la marcha: tomando una nota con las manos libres, redactando un correo electrónico con la voz, controlando un dispositivo.
La transcripción funciona en una grabación completa. Le das al motor un archivo de audio o video terminado, lo procesa todo y obtienes a cambio una transcripción completa. Como no tiene que suceder nada en tiempo real, el motor puede leer con anticipación y ver la oración completa antes de decidirse por cualquier palabra, lo que aumenta la precisión. También puede realizar trabajos que el dictado en vivo no puede realizar. Puede separar a los hablantes, atribuyendo cada línea a quien lo dijo, y puede adjuntar marcas de tiempo para que puedas saltar de una línea de texto directamente a ese momento en el audio.
Si se trata de una reunión, una entrevista, una conferencia, un episodio de un podcast o una llamada telefónica que grabó, está haciendo una transcripción de un archivo guardado, no un dictado en vivo. Los dos se confunden porque ambos se comercializan como “voz a texto”, pero la grabación que ya tienes tiene la forma incorrecta para una herramienta de dictado y la forma correcta para un transcriptor. Hushscript está diseñado para grabaciones. No existe un modo de dictado en vivo y ese enfoque es deliberado: trabajar desde el archivo completo es lo que le permite leer con anticipación para mayor precisión y etiquetar a los hablantes en la misma pasada.
Cómo convertir voz grabada en texto
Aquí está el flujo real en Hushscript, en el orden en que lo encuentra. Necesita la grabación como un archivo en su dispositivo, un archivo de audio o video en cualquier formato común y una dirección de correo electrónico para registrarse. Esa es la lista completa. No hay nada que instalar.
- Suelte el archivo y mire la vista previa. Abra la página de audio a texto y suelte el archivo en ella. Hushscript transcribe los primeros 30 segundos inmediatamente y te muestra el resultado con los hablantes ya separados. No se necesita ninguna cuenta para este paso. La vista previa está ahí para que puedas juzgar la precisión de tu propia grabación antes de realizar cualquier acción.
- Regístrate para transcribir el resto. Si la vista previa se ve bien, regístrate con tu correo electrónico. La transcripción del archivo completo está cerrada, por lo que este paso es donde entra en juego una cuenta. Las cuentas nuevas obtienen 30 minutos gratis para probar el servicio correctamente.
- Sube el archivo completo. Una vez que estés dentro, sube la grabación completa. Si es un video, el audio se extrae primero en su navegador y solo se envía el audio, por lo que el video permanece en su dispositivo.
- Leer, volver a etiquetar y exportar. La transcripción regresa con cada turno atribuido a un hablante (Hablante A, Hablante B, etc.) y con marca de tiempo. Haga clic en la etiqueta de cualquier hablante para cambiarle el nombre y el nuevo nombre se actualizará en todos los lugares donde habló esa persona. Cuando se lea como desee, exporte a TXT para texto sin formato, SRT o VTT para subtítulos, CSV o JSON para datos estructurados, Markdown para publicar notas, DOCX para editar o PDF para compartir.
Treinta minutos son suficientes para transcribir una entrevista corta, un clip de una conferencia de 10 minutos o el primer tramo de una grabación más larga si desea verificar la precisión antes de continuar. Los minutos gratis se desbloquean instantáneamente con una verificación rápida de la tarjeta: se autoriza una retención de $1 para verificar la tarjeta, luego se retira de inmediato y nunca se cobra. Utiliza otro método de pago y te llegarán con tu primera compra. No se requiere una tarjeta; es simplemente la ruta más rápida hacia la bonificación. Después de los minutos gratis, pagas sólo por los minutos que transcribes, sin suscripción. La página de precios tiene las tarifas actuales.
Un ejemplo práctico
Supongamos que grabó una entrevista con un cliente de 38 minutos en su teléfono. Se guardó como un M4A, dos voces, el ruido ocasional de una taza de café, grabado en una sala de reuniones normal.
Dejas caer el M4A en la página de audio a texto. La vista previa de 30 segundos aparece como una breve conversación:
Hablante A 00:00 Gracias por dedicar el tiempo. ¿Podrías empezar contándome
¿Qué fue lo primero que te hizo buscar una herramienta como esta?
Hablante B 00:11 Claro. Nos estábamos ahogando en tickets de soporte y el antiguo
sistema simplemente no podía seguir el ritmo, así que comencé a buscar a mi alrededor.
Esa es la vista previa sin editar. Las dos voces están divididas, cada línea tiene una marca de tiempo y la redacción es limpia. Te registras, subes el archivo completo de 38 minutos y, un par de minutos después, la transcripción completa está lista en la misma forma. Hablante A eres tú y Hablante B es tu entrevistado, por lo que haces clic en la etiqueta “Hablante A”, escribes tu nombre y haces clic en “Hablante B” para escribir el de ellos. Ambos cambian el nombre de todo el documento en una sola pasada. Exporta a DOCX, lo abre en su procesador de textos, corrige los dos o tres lugares donde apareció escrito fonéticamente el nombre de un producto y tendrá una transcripción de la entrevista terminada. Los 38 minutos salieron de tu saldo, por lo que los 30 minutos gratuitos son útiles para un primer trabajo real en lugar de solo un clip de prueba.
Problemas comunes y cómo solucionarlos
La mayoría de las transcripciones decepcionantes se remontan a la grabación, no al motor. Estos son los problemas que surgen con más frecuencia y qué hacer al respecto.
La grabación es silenciosa o confusa. Si las voces son débiles o la habitación suena retumbante, el motor tiene menos con qué trabajar y la precisión disminuye. Un micrófono cerca del hablante, un micrófono de solapa o unos auriculares a entre 10 y 20 centímetros de la boca marcan una diferencia mayor que cualquier configuración. Una habitación grande y desnuda añade un eco que borra los límites entre los sonidos; un espacio más pequeño o con muebles suaves registra mejor. No puedes arreglar esto después del hecho, por lo que vale la pena hacerlo bien antes de tocar grabar la próxima vez.
Dos personas hablan a la vez. Cuando las voces se superponen, tanto la redacción como el quién dijo qué se vuelven más difíciles, porque dos conjuntos de sonidos compiten en la misma porción de audio. No existe una solución de software clara para la superposición genuina. En una grabación que tú controlas, dejar un ritmo entre turnos vale la pena más adelante. En uno que no puedas rehacer, espera algunas líneas cruzadas alrededor de las interrupciones y ordénalas a mano.
Un término especializado sale mal. Los modelos de uso general conocen bien el lenguaje cotidiano, pero no necesariamente han visto la jerga de tu industria, un apellido inusual o el nombre de un producto. Estos tienden a transcribirse por cómo suenan más que por cómo se escriben. Buscar y reemplazar en el DOCX exportado borra un término recurrente en segundos, que es una de las razones por las que DOCX es la exportación más fácil de corregir.
Un archivo no se carga. La mayoría de los archivos de audio y video estándar simplemente funcionan. Si uno se niega, suele ser un recipiente inusual o muy antiguo. Convirtiéndolo a un MP3 o WAV simple con las herramientas en el navegador gratuitas, que se ejecutan en su dispositivo y no cargan nada, casi siempre se resuelve. Si un formato aún no se acepta, envíe un correo electrónico a support@hushscript.com y el equipo lo agregará.
Un hablante se divide en dos. Ocasionalmente, la misma persona es etiquetada como dos hablantes, normalmente porque su voz cambió a medio camino: se acercó al micrófono, pasó de los auriculares al altavoz o la calidad de la línea cambió. El motor agrupa según cómo suena una voz, por lo que un gran cambio puede leerse como una nueva persona. Fusionar las dos etiquetas en el editor lo soluciona en un solo paso. La mecánica de esto se encuentra en la guía sobre cómo funciona la diarización del hablante.
Precisión y acentos
La cobertura de acento depende del modelo y el idioma. Para el inglés, los modelos entrenados en conjuntos de datos amplios manejan bien el inglés estadounidense, británico, australiano e indio, y Hushscript ofrece cuatro acentos ingleses distintos. Un dialecto regional intenso o una variedad de acento menos representada necesitarán un poco más de corrección, pero seguirás editando un borrador en lugar de escribir desde cero.
Algunos hábitos aumentan la precisión en cualquier grabación, sea cual sea el acento. Graba con un micrófono cercano. Deje que cada persona termine antes de que comience la siguiente. Evite las salas grandes con eco. Un ritmo de conversación moderado transcribe mejor que una carrera de más de 200 palabras por minuto. Y una tasa de bits razonable es importante: un MP3 de 128 kbps está bien, mientras que el audio de mensajes de voz muy comprimido en banda estrecha pierde los detalles que el motor necesita. Para obtener un recorrido más completo por los formatos y las peculiaridades de cada uno, consulte cómo transcribir cualquier archivo de audio.
Hushscript detecta el idioma automáticamente y transcribe alrededor de 99 idiomas, con una precisión de primer nivel en 18 de ellos. Una grabación que permanece en un idioma se transcribe de manera más limpia; cambiar de idioma a mitad de una frase es difícil para cualquier motor.
Etiquetas de los hablantes, en la misma pasada
Separar a los hablantes, formalmente llamado diarización de hablantes, va junto con el reconocimiento de voz en lugar de ser un segundo trabajo por el que se paga más. Obtienes las palabras y la atribución juntas, gratis en cada transcripción. Para una entrevista de dos personas o una reunión pequeña, esa separación suele ser precisa y ahorra el tedioso trabajo de etiquetar cada línea a mano. No hay límite en cuanto a la cantidad de hablantes que puede contener un archivo, aunque la precisión es mayor cuando las voces son distintas, no se superponen y no suenan igual. El hecho de que la etiqueta del hablante venga con cada transcripción sin costo adicional es el tipo de detalle honesto por defecto en el que se basa todo este enfoque: la parte útil está incluida, no retenida detrás de un nivel superior.
La distinción clara a la que debemos aferrarnos es esta. Si desea capturar el habla mientras habla, escribiendo por voz o dictando, utilice la herramienta en vivo integrada en su dispositivo o procesador de textos. Si ya tiene una grabación que necesita como texto, transcribirla desde la página de audio a texto es más rápido, más preciso y le proporciona etiquetas de hablantes y resultados exportables en un solo paso.
Fuentes y normas independientes
Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.
Fuentes revisadas: