Cómo transcribir cualquier archivo de audio a texto
Autor: Hushscript Publicado: Última revisión:
Un MP3 de un editor de podcasts, un M4A de su iPhone, un WAV de una grabadora de campo, un oscuro CAF de una aplicación de grabación de voz: para transcribir cualquiera de ellos, debe hacer lo mismo. Suelta el archivo, obtén una transcripción con los hablantes ya separados, expórtala en el formato que necesites. El contenedor en el que vino el audio no cambia los pasos.
Lo que sí afecta el formato es un poco más abajo: qué tan grande es el archivo, qué tan limpiamente se transcribe y qué hacer en las raras ocasiones en que un archivo no se carga. Esta guía cubre qué formatos de audio funcionan, el único método que los maneja todos, cómo elegir el mejor formato cuando tenga la opción y cómo arreglar los archivos que salen mal.
Lo que necesita
- Un archivo de audio (o video). Cualquiera de los formatos comunes a continuación. No hay nada que instalar: ni aplicación de escritorio ni extensión. Todo se ejecuta en el navegador y en su cuenta.
- Una cuenta de Hushscript, para ver la transcripción completa. Obtienes 30 minutos gratis para probar. La forma más rápida de desbloquearlos es agregar una tarjeta: una retención de $1 la valida, luego se libera de inmediato y nunca se cobra. Si prefieres no usar una tarjeta, también funciona un método de pago alternativo y los 30 minutos llegan con tu primera compra.
La vista previa de 30 segundos no necesita cuenta. Puede soltar un archivo y ver el estilo etiquetado por el hablante antes de registrarse, que es la forma honesta de verificar que la salida coincida antes de confirmar algo. Más allá de los minutos gratuitos, la transcripción es de pago por uso: compras minutos sólo cuando los necesitas, sin necesidad de suscripción. Los costos se encuentran en la página de precios.
Qué formatos de audio funcionan
Hushscript acepta todos los formatos de audio estándar. Aquí es de donde tiende a venir cada uno, para que puedas reconocer lo que tienes:
Los nombres no son sólo convenciones de nombres de archivos. El registro de tipos de medios de la IANA actual registra tipos estandarizados como audio/aac,audio/mp4,audio/mpeg,audio/ogg y audio/opus, por lo que el contenedor y la codificación de audio que contiene son preguntas separadas.
| Formato | Fuente común |
|---|---|
| MP3 | Podcasts, grabaciones telefónicas, exportaciones desde la mayoría de las aplicaciones de grabación |
| M4A / AAC | Notas de voz de iPhone, notas de voz de WhatsApp, exportaciones de Apple |
| WAV | Grabadoras digitales, exportaciones de DAW, Grabadora de voz de Windows |
| FLAC | Grabaciones de archivo, exportaciones DAW, rips sin pérdidas |
| OGG | Notas de voz de Android, herramientas de grabación de código abierto |
| AIFF / CAF | Audio de Mac e iOS, GarageBand |
Los archivos de vídeo funcionan de la misma manera. Coloque un MP4, MOV, WebM o MKV y la pista de audio se extraerá en su navegador antes de que se cargue algo, por lo que el video nunca sale de su dispositivo; sólo el audio llega al servidor.
La lista anterior no es una valla. La promesa es más simple que una tabla de formatos admitidos: simplemente suelte su archivo y se convertirá y transcribirá. Si tiene algo realmente inusual (un archivo AMR de un Nokia antiguo, un .3gp de un Android de hace una década, un clip de RealAudio), intente cargarlo de todos modos. El navegador puede leer la mayoría de los contenedores estándar y, si no puede, tiene dos opciones: convertirlo a MP3 o WAV con las herramientas gratuitas del navegador en /tools y cargarlo, o enviar un correo electrónico a support@hushscript.com y agregaremos el formato. No es necesario que averigües de antemano si tu archivo califica.
Transscribe un archivo de audio en tres pasos
El flujo es idéntico sin importar con qué formato comiences. El primer paso se realiza antes de tener una cuenta.
- Suelte el archivo para obtener una vista previa. Vaya a /audio-to-text y arrastre el archivo a la zona de colocación, o haga clic para explorar. Los primeros 30 segundos se transcriben allí mismo, en el navegador, con la etiqueta del hablante, sin necesidad de cuenta. Esta es tu comprobación de que el resultado se lee de la manera que deseas antes de registrarte para cualquier cosa.
- Regístrate para transcribir el resto. Introduce tu correo electrónico para crear una cuenta. Tus 30 minutos gratis se desbloquean cuando agregas y validas una tarjeta (la retención de $1 descrita anteriormente) o con tu primera compra si pagas de otra manera. El archivo completo se carga desde aquí. Una grabación puede durar hasta 10 horas, sin límite de tamaño de archivo; incluso un archivo muy grande se prepara directamente en el navegador. También se aplican las salvaguardias de seguridad del servicio y de trabajo activo.
- Obtenga y exporte la transcripción. El motor de voz procesa el archivo y devuelve una transcripción con los hablantes ya separados. Cambie el nombre de los hablantes si lo desea, luego descárguelo en cualquiera de los 21 formatos (TXT, SRT, DOCX y PDF entre ellos, además de formatos de subtítulos y línea de tiempo del editor) o en un archivo .husharchive protegido con contraseña. Cada exportación está incluida: sin muro de pago ni marca de agua.
El procesamiento se ejecuta en segundo plano y escala con la duración del audio (aproximadamente unos pocos minutos por hora de grabación), por lo que no es necesario mantener la pestaña abierta mientras finaliza un archivo largo.
Un ejemplo resuelto: una grabación, dos formatos
Supongamos que grabó un Conversación de 38 minutos y tu grabadora la guardó dos veces: un meeting.wav en máxima calidad y un meeting.m4a que tu teléfono hizo al mismo tiempo. Ambos siguen los mismos tres pasos y la transcripción vuelve segmentada por turno de hablante, con una marca de tiempo en cada uno:
[00:00:06] Hablante A: Antes de comenzar, ¿todos recibieron las cifras que les envié?
[00:00:10] Hablante B: Las recibí esta mañana. El número Q3 es en el que quiero
profundizar.
[00:00:17] Hablante A: Bien, esa es la línea que se movió. Déjame abrirlo.
[00:00:21] Hablante C: Mientras lo haces, ¿podemos volver a contratar después?
Los dos archivos producen esencialmente la misma transcripción. El WAV es una carga mucho más grande y el M4A es pequeña, pero las palabras y las etiquetas del hablante llegan de la misma manera, porque ambas llevan el mismo discurso subyacente. Desde aquí la edición es ligera: haces clic en Hablante A una vez para cambiarle el nombre, y cada línea de ese hablante tiene actualizaciones; buscas un puñado de nombres propios que el motor adivinó (un apellido, un nombre de producto) y los arreglas con buscar y reemplazar, que corrige cada instancia de una sola vez.
Ese es el resultado práctico de un método para cada formato. No tienes una herramienta diferente o una lista de verificación mental diferente para WAV versus M4A versus MP3. Cualquiera que sea su grabadora, su teléfono o la exportación de otra persona, pasa por la misma zona de colocación y sale como el mismo tipo de transcripción.
Elegir el mejor formato para mayor precisión
La mayoría de las veces no puede elegir. Transcribes el archivo que te dieron y está bien. Pero si controlas cómo se graba o exporta el audio, unas cuantas opciones establecen el límite de cuán limpio puede ser el resultado.
La calidad de grabación es lo primero, por un amplio margen. Un MP3 de 128 kbps con un buen micrófono cercano superará en todo momento a un WAV sin pérdidas grabado en toda la habitación con el micrófono incorporado de una computadora portátil. Antes de pensar en el formato, piense en acercar el micrófono a quien esté hablando. El contenedor está en un distante segundo lugar.
Evite MP3 con una tasa de bits muy baja. El MP3 tiene pérdidas: la codificación descarta partes del audio para mantener el archivo pequeño, y cuanto menor es la tasa de bits, más se desecha. El reconocimiento de voz se apoya en los detalles de alta frecuencia de las consonantes, donde se encuentra la brecha entre “quince” y “dieciséis”, o “puede” y “no puedo”. La compresión agresiva devora exactamente ese detalle primero. Por debajo de unos 64 kbps, los errores de palabras aumentan. A 128 kbps y más ya has superado el punto en el que el número importa; una tasa de bits más alta no mejorará la transcripción.
Sin pérdida elimina el formato como variable. WAV, FLAC y AIFF entregan el motor de audio sin comprimir. Para una grabación limpia, la ganancia de precisión con respecto a un buen MP3 es marginal, pero elimina por completo la compresión. La guía de audio digital de MDN explica la compensación subyacente: la tecnología sin pérdidas conserva los detalles en un tamaño mayor, mientras que la codificación con pérdidas puede reducir el audio mucho más al descartar información. Ese es un contexto útil cuando la grabación es valiosa y no quieres preguntarte más tarde si el formato te costó algo.
Mono está bien; no necesitas estéreo. El motor mezcla estéreo a mono internamente para la voz, por lo que un archivo mono se transcribe igual de bien y se carga más rápido en una conexión lenta. El único matiz: si su configuración grabó a cada persona en un canal estéreo separado (un “doble final”), mezclarlo en una sola pista mono antes de cargarlo tiende a ayudar a las etiquetas de los hablantes, porque el motor escucha una conversación combinada en lugar de dos transmisiones aisladas.
La frecuencia de muestreo por encima de 16 kHz no compra nada para la voz. Cualquier cosa entre 16 kHz y 48 kHz funciona, y un WAV de 48 kHz de un El editor de vídeo transcribe lo mismo que un archivo mono de 16 kHz desde una aplicación de teléfono, teniendo en cuenta el mismo discurso subyacente. El modelo está entrenado con voz, no con música, por lo que no se gana precisión con una velocidad más alta.
Sin pérdida versus con pérdida, y cuando la conversión ayuda
Una pregunta común: ¿convertir su MP3 a WAV mejoraría primero la precisión? No lo hará. Una vez que el audio se ha guardado como MP3 de 128 kbps, los detalles descartados desaparecen para siempre. Envolver ese mismo audio en un WAV simplemente crea un archivo más grande sin información adicional. La conversión hacia arriba solo ayuda como solución para un formato que no se carga, nunca como una mejora de la precisión.
La conversión hacia abajo es el caso realmente útil. Un WAV de varias horas puede ser un archivo muy grande; volver a codificarlo en un MP3 de 128 kbps antes de cargarlo lo reduce drásticamente sin un costo de precisión significativo, lo que acelera la carga en un enlace lento. El convertidor en el navegador gratuito hace esto sin que el audio salga de su dispositivo. La regla honesta: si su archivo ya se carga y no tiene una velocidad de bits pequeña, transcríbalo tal cual. Convierta solo para resolver un problema real, como un archivo que no se abre o uno demasiado grande para cargarlo cómodamente.
Etiquetas de los hablantes, incluidas gratis
Cada transcripción de Hushscript viene con separación automática de los hablantes (diarización) sin costo adicional. El motor selecciona distintas voces y las etiqueta como Hablante A,Hablante B, etc., y usted les cambia el nombre a nombres reales en el editor con un clic por hablante. Está activado de forma predeterminada independientemente del formato de origen, sin un nivel separado de etiqueta de hablante.
La limpieza de las etiquetas depende de la grabación, no del tipo de archivo:
- Los turnos distintos son más útiles. Cuando las personas se turnan y no hablan entre sí, las etiquetas son confiables. Una entrevista de dos personas generalmente se separa claramente.
- La superposición es el caso difícil. Cuando dos voces llegan a la vez, el motor asigna las palabras a la más fuerte. Esa es una limitación de la separación de los hablantes en general, no de ninguna herramienta en particular. Dedica un poco de tiempo a editar la conversación cruzada en una animada llamada grupal.
- Las voces similares pueden desdibujarse. Dos personas con registros muy similares (hermanos del mismo sexo, por ejemplo) desafiarán cualquier motor de diarización. Una relación señal-ruido razonable ayuda a la separación en todo momento.
Para la mayoría de las entrevistas, podcasts y reuniones, las etiquetas se pueden utilizar con como máximo un puñado de reasignaciones. Si desea obtener detalles sobre cómo funciona la diarización interna, consulte qué es la diarización del hablante, o la página de identificación del hablante para obtener una descripción general de las funciones.
Corregir archivos que resultan aproximados
La mayoría de las transcripciones preliminares se remontan a la grabación, no al formato o al herramienta. Los culpables habituales y qué hacer al respecto:
Un archivo que no se carga. Es poco común, pero sucede con un contenedor inusual o dañado. Pruebe el convertidor en el navegador gratuito para volver a empaquetarlo primero como MP3 o WAV, lo que soluciona la mayoría de los archivos rebeldes. Si aún así no funciona, envíe un correo electrónico a support@hushscript.com. Agregar soporte de formato es algo que hacemos.
Volumen bajo. Si la grabación es muy silenciosa, el motor tiene menos señal para trabajar y la precisión disminuye. Normalice o amplifique el audio en cualquier editor antes de cargarlo. Aumentar el nivel de una grabación débil es una de las soluciones de mayor rendimiento que existen.
Ruido de fondo. El ruido constante (el aire acondicionado, el zumbido de la carretera) se maneja razonablemente bien. El ruido repentino que se superpone al habla (una puerta, una tos, unos cubiertos) es lo que deja caer las palabras. Una ligera reducción de ruido antes de cargar puede ayudar, pero no se exceda: la eliminación intensa de ruido agrega artefactos que perjudican la precisión más que el ruido.
Acentos fuertes o vocabulario especializado. Los motores modernos manejan bien una amplia gama de acentos. Los errores confiables son términos de dominio que el motor no tiene por qué esperar: nombres de medicamentos, citas legales, marcas de nicho. Planifique un desnatado después de la exportación y apóyese en buscar y reemplazar; si un nombre sale mal de la misma manera cada vez, una corrección barre todo el archivo.
Archivos muy grandes o muy largos. El límite de 10 horas cubre casi cualquier cosa y no hay límite de tamaño de archivo además, por lo que no hay necesidad de dividir una grabación larga en pedazos. Si un archivo sin pérdidas es demasiado grande para prepararlo en el navegador, vuelva a codificarlo primero en MP3 de 128 kbps (sin costo real de precisión) para acelerar el proceso. Para los detalles de sesiones más largas, la guía de grabación larga va más allá.
Qué sucede con su archivo
El audio se elimina del servidor en el momento en que la transcripción está lista. No hay almacenamiento en la nube, no se utiliza para la capacitación de modelos y no hay período de retención. Si soltó un archivo de video, solo el audio extraído llegó al servidor (el video permaneció en su dispositivo) y puede eliminar la transcripción desde su panel de control con un solo clic cuando lo desee.
Exportar su transcripción
Después de la transcripción, elija el formato que se ajuste a lo que está haciendo con el texto. Si no está seguro de qué formato de transcripción necesita realmente, comience con las opciones más comunes a continuación:
| Formato | Qué incluye | Mejor para |
|---|---|---|
| TXT | Etiquetas de hablante, texto sin formato | Notas, búsqueda, alimentación a otra herramienta |
| SRT | Marcas de tiempo por expresión, etiquetas de hablante | Subtítulos de vídeo, navegación por una grabación larga por tiempo |
| VTT | Marcas de tiempo de subtítulos web, etiquetas de hablantes | Reproductores de vídeo HTML5 y publicación web |
| CSV | Filas con campos de hablante, tiempo y texto | Revisión de hoja de cálculo y transferencia ligera de datos |
| Markdown | Transcripción etiquetada por el hablante en Markdown | Notas, documentos, flujos de trabajo de publicación y sitios estáticos |
| DOCX | Formateado para Word o Google Docs | Edición, uso compartido, anotación |
| JSON | { speaker, start, end, text } por elemento | Canalizaciones y herramientas personalizadas |
| Transcripción legible de diseño fijo | Compartir y archivar de solo lectura |
Cada exportación lleva las etiquetas de los hablantes, sin marca de agua en ninguna de ellas, y todos los formatos de exportación están incluidos en cada plan, entre ellos los 30 minutos gratis. Las marcas de tiempo en el SRT se ubican en el nivel de expresión (una entrada por turno del hablante), que es la granularidad adecuada para subtítulos y citas; Si necesita una estructura a nivel de palabra para procesar en el código, JSON le proporciona la hora de inicio y finalización en milisegundos para cada turno.
Idiomas
Hushscript transcribe alrededor de 99 idiomas, detectados automáticamente, no configurados manualmente. La precisión es mayor en 18, incluidas cuatro variantes en inglés (global, británico, australiano, estadounidense), español, francés, alemán, japonés, mandarín, hindi y árabe. La lista completa se encuentra en la página de idiomas.
Si está decidiendo entre una transcripción en el mismo idioma y una transcripción traducida, la guía para “traducir audio a texto” explica la diferencia.
Ese es todo el trabajo (soltar, transcribir, exportar). y se lee igual sea cual sea el formato con el que empezaste. Para notas con formatos específicos, las guías para hermanos cubren los casos más comunes: MP3, WAV y M4A/Apple Voice Memo. La página de audio a texto tiene una descripción general completa de las funciones y todos los formatos llegan allí de la misma manera: simplemente suelte su archivo.
Fuentes y normas independientes
Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.
Fuentes revisadas: