Saltar al contenido principal

Cómo convertir MP3 a texto gratis con etiquetas de hablante

Autor: Publicado: Última revisión:

Convertir un MP3 a texto es uno de los trabajos de transcripción más comunes que existen, y los pasos no cambian según la fuente: un episodio de podcast, una entrevista grabada, una conferencia o una nota de voz de su teléfono, todos siguen el mismo flujo. Sube el archivo, espera la transcripción, expórtalo en el formato que necesites.

Lo que sí cambia es cómo el MP3 afecta el resultado. La mayoría de las guías lo omiten. Un MP3 es un archivo comprimido con pérdida, y la tasa de bits a la que se guardó establece un límite en la cantidad de detalles con los que debe trabajar el motor de voz. Esta guía cubre los tres pasos y luego profundiza: un ejemplo práctico con salida real etiquetada por el hablante, qué significa realmente la tasa de bits para la precisión y cómo corregir las grabaciones que salen irregulares.

Qué necesitas

No hay nada que instalar; sin aplicación de escritorio ni extensión de navegador. Todo se ejecuta en el navegador y en la cuenta.

Más allá de los minutos gratuitos, la transcripción se paga por uso: compras minutos solo cuando los necesitas, sin suscripción. Los costos se encuentran en la página de precios.

Convierta un MP3 a texto en tres pasos

  1. Suba su archivo. Abra /audio-to-text y luego arrastre el MP3 a la zona de colocación o haga clic para explorar. Se aceptan archivos de hasta 10 horas de duración, sin límite de tamaño de archivo. Los primeros 30 segundos obtienen una vista previa directamente en el navegador antes de iniciar sesión, para que pueda ver el estilo etiquetado por el hablante antes de confirmarlo.
  2. Deje que se transcriba. Una vez que haya iniciado sesión y se haya subido el archivo, el motor de voz lo procesa y devuelve una transcripción con los hablantes ya separados. El tiempo de procesamiento varía y el trabajo se ejecuta en segundo plano, por lo que no es necesario mantener la pestaña abierta.
  3. Exportar. Descargue el resultado en cualquiera de los 21 formatos. Esto cubre TXT simple, SRT con marca de tiempo, Word DOCX, PDF y los formatos de subtítulos y línea de tiempo del editor, además de un .husharchive protegido con contraseña. Se incluyen todos los formatos, sin muro de pago en las exportaciones ni marca de agua en ninguno de ellos.

La transcripción terminada se abre en su panel de control. Los hablantes aparecen como Hablante A,Hablante B, etc., y puedes hacer clic en cualquier etiqueta para cambiarle el nombre a un nombre real, lo que actualiza cada línea que tiene el hablante.

Un ejemplo resuelto: una entrevista de dos personas

Digamos que tienes founder-interview.mp3: a Grabación de 42 minutos, 128 kbps, un entrevistador y un invitado, grabado a través de una llamada. Después de cargarlo, la transcripción aparece segmentada por turno de hablante, con una marca de tiempo en cada uno:

[00:00:04] Hablante A: Gracias por dedicar el tiempo. Comencemos por el principio:
           ¿de dónde surgió realmente la idea?
[00:00:11] Hablante B: Honestamente, surgió de un problema que teníamos nosotros mismos. Estábamos
           ahogándonos en llamadas grabadas y ninguna de ellas se podía buscar.
[00:00:23] Hablante A: Así que creaste lo que necesitabas.
[00:00:25] Hablante B: Más o menos. La primera versión se mantuvo unida con cinta adhesiva.

A partir de ahí, la edición es ligera. Cambia el nombre de Hablante A al entrevistador y Hablante B al invitado una vez, y cada línea se actualiza. Busca rápidamente el puñado de nombres propios que el motor adivinó, como el nombre de un producto o el apellido de una persona, y los corrige con buscar y reemplazar, que corrige cada instancia de una sola vez. Para una entrevista limpia de 128 kbps como esta, ese vistazo suele ser toda la limpieza necesaria antes de que se pueda citar la transcripción.

Aquí es donde la transcripción que etiqueta a los hablantes de forma gratuita gana su lugar. Una pared de texto indiviso de una entrevista es casi inútil hasta que la hayas revisado y marcado quién dijo qué; una transcripción que llega ya dividida en turnos es algo que puede citar de inmediato.

Qué significa la tasa de bits para la precisión

MP3 es un formato con pérdida: la codificación descarta partes del audio que se consideran menos audibles para mantener el archivo pequeño. La tasa de bits es cuántos kilobits por segundo gasta el codificador en hacer eso. Cuanto más bajo es, más descarta. La referencia de códec MP3 actual de MDN documenta las tasas de bits y frecuencias de muestreo admitidas por el formato e identifica su compresión como con pérdida.

El reconocimiento de voz se basa en gran medida en los detalles de alta frecuencia en las consonantes. La diferencia entre “quince” y “dieciséis”, o “puedo” y “no puedo”, vive ahí. La compresión agresiva es exactamente donde ese detalle va primero. Por tanto, la tasa de bits no degrada una transcripción de manera uniforme; se come las palabras más difíciles de escuchar en los bordes del habla.

En la práctica:

Un par de aclaraciones que ahorran recodificaciones innecesarias. La tasa de bits variable (VBR) está bien; no tiene penalización de precisión sobre la ** tasa de bits constante (CBR)** para voz, así que no convierta un archivo VBR sólo para “arreglarlo”. Y el ** mono funciona tan bien como el estéreo** para la transcripción, ya que la voz no necesita dos canales. En todo caso, consulte la nota sobre los dobles finales estéreo a continuación.

MP3 frente a sin pérdidas: cuándo volver a grabar

Una pregunta natural es si sería útil convertir primero su MP3 a un formato sin pérdidas como WAV. No lo hará. Una vez que el audio se ha guardado como MP3 de 128 kbps, los detalles que faltan desaparecen; envolver ese mismo audio en un contenedor WAV solo crea un archivo más grande que no contiene información adicional. Si está grabando nuevo y tiene la opción, una fuente sin pérdidas o de alta tasa de bits es el mejor punto de partida (consulte la guía de WAV a texto para ese caso), pero convertir un MP3 existente no compra nada.

La regla de decisión honesta: si su única copia es un MP3 con una tasa de bits razonable, transcríbalo tal como está. Si la grabación es realmente mala (recortada, oculta en ruido o guardada a 32 kbps) y puedes capturarla nuevamente, volver a grabar te ayudará mucho más que cualquier conversión. Cuando grabas algo nuevo, dos hábitos importan más que la tasa de bits: acercar el micrófono a quien esté hablando y, si puedes, darle a cada persona su propio micrófono, ya que una separación clara en la fuente es lo que hace que tanto las palabras como las etiquetas del hablante salgan bien.

Solucionar problemas comunes

La mayoría de las transcripciones preliminares se remontan a la grabación, no a la herramienta. Esto es lo que debe hacer con los culpables habituales.

Volumen bajo. Si la forma de onda parece plana (una grabación muy silenciosa), el motor tiene menos señal con la que trabajar y la precisión disminuye. Primero normalice o amplifique el audio en cualquier editor de audio y luego cargue la versión más alta. Aumentar el nivel es una de las soluciones de mayor rendimiento para una grabación débil.

Ruido de fondo. El ruido constante (el aire acondicionado, el zumbido de la carretera) se maneja razonablemente bien; El ruido repentino que se superpone al habla, como una puerta, una tos o unos cubiertos, es lo que provoca que se pierdan las palabras. Si puede ejecutar una ligera reducción de ruido antes de cargar, hágalo, pero no procese demasiado: una eliminación intensa de ruido introduce artefactos que perjudican la precisión más que el ruido.

Acentos fuertes o vocabulario especializado. Los motores modernos manejan bien una amplia gama de acentos en inglés. Los errores confiables son términos de dominio que el motor no tiene motivos para esperar, como nombres de medicamentos, citas legales o marcas de nicho. Planifique un vistazo después de la exportación para detectarlos y apóyese en buscar y reemplazar: si el nombre de una empresa sale mal de la misma manera cada vez, una corrección barre todo el archivo.

MP3 muy largos. Una grabación de 6 horas no es un problema por sí sola. El límite máximo de 10 horas cubre casi cualquier cosa y no hay límite de tamaño de archivo, por lo que no es necesario cortar primero un archivo largo en pedazos. Lo que realmente degrada un archivo largo es la variación en la calidad de grabación: un hablante que se aleja del micrófono, un nivel que cae después de la primera hora, un lugar que se llena y se vuelve más ruidoso. Siempre que puedas, mantén la fuente estable; donde no puedas, espera que los tramos más difíciles necesiten más edición que los limpios. Las marcas de tiempo hacen que esto sea fácil de administrar: puedes saltar directamente al parche que se lee mal en lugar de volver a escucharlo todo.

hablantes superpuestos. Cuando dos personas hablan a la vez, el motor asigna las palabras a la voz más fuerte, una limitación de la separación de los hablantes en general, no de una sola herramienta. No hay ninguna solución en el lado de carga; presupuesta el tiempo de edición de las secciones de conversaciones cruzadas de una grabación grupal animada.

Mantener los hablantes limpiamente separados

La separación de los hablantes (diarización) se ejecuta en cada transcripción sin costo adicional, y algunas cosas en el nivel MP3 afectan la limpieza que sale. Si desea obtener detalles sobre cómo funciona internamente, consulte qué es la diarización del hablante; Los puntos prácticos aquí:

Exportar tu transcripción

El formato correcto depende de lo que estés haciendo con el texto. La siguiente tabla enumera los que más eligen las personas, de los 21 formatos que se ofrecen; para conocer todas las ventajas y desventajas, consulte qué formato de transcripción necesita realmente:

Formato Mejor para
TXT Notas, copiar y pegar, introducir el texto en otra herramienta
SRT Subtítulos en un vídeo o navegación por marca de tiempo; También es la elección correcta si tu fuente es un archivo de vídeo como MP4
VTT Subtítulos web y reproductores de vídeo nativos del navegador
CSV Revisión de hoja de cálculo y peso ligero. transferencia de datos
Markdown Notas de publicación, archivos de estilo README y borradores editables
JSON Procesamiento programático y herramientas personalizadas
DOCX Compartir con editores o anotadores que trabajan en Word
PDF Compartir y archivar de solo lectura

Cada exportación incluye las etiquetas de los hablantes y las marcas de tiempo, sin marcas de agua en ninguna de ellas.

Marcas de tiempo y edición

El editor muestra cada expresión con su hora de inicio, etiqueta del hablante y texto. Haga clic en cualquier línea para reproducir ese segmento del audio con el texto. Esto es útil para verificar un pasaje complicado sin tener que borrar todo el archivo a mano.

Las marcas de tiempo en la exportación SRT se ubican en el nivel de expresión: una entrada por turno del hablante, no por palabra. Para subtítulos, navegación y citas con marca de tiempo, esa es la granularidad adecuada. Si necesita una estructura a nivel de palabra para procesar en el código, exporte JSON: cada entrada le proporciona la etiqueta del hablante, la hora de inicio y finalización en milisegundos y el texto para ese turno.


Cargar, transcribir, exportar: ese es todo el trabajo, con los detalles específicos de MP3 que deciden qué tan limpio es el resultado. La página de MP3 a texto tiene una descripción general completa de las funciones y, si está trabajando con una grabación en otro contenedor, la página de audio a texto cubre todos los formatos de la misma manera. ¿Hacer un espectáculo completo? La guía de transcripción de podcasts explica cómo convertir la transcripción en notas de programa, y ​​si su archivo es WAV en lugar de MP3, la guía de WAV a texto tiene notas sobre cómo manejar archivos grandes sin pérdidas.

Fuentes y normas independientes

Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.

Fuentes revisadas:

Preguntas frecuentes

¿Cuál es el tamaño máximo de archivo MP3 que puedo cargar?

Hasta 10 horas por archivo, sin límite de tamaño de archivo. Cada archivo se extrae de sus minutos prepagos; También se aplican la seguridad del servicio y las salvaguardas del trabajo activo.

¿La velocidad de bits de MP3 afecta la precisión de la transcripción?

Por debajo de aproximadamente 64 kbps puede hacerlo. La compresión a tasas de bits muy bajas emborrona las consonantes en las que se basa el reconocimiento de voz, por lo que las palabras en los límites del habla se pierden. A 128 kbps o más, ya has superado el punto en el que la tasa de bits importa y un número mayor no mejorará la transcripción.

¿Puedo obtener un archivo de subtítulos SRT desde un MP3 de solo audio?

Sí. Hushscript exporta SRT, TXT, DOCX y JSON desde cualquier fuente. El SRT lleva marcas de tiempo por expresión incluso aunque la entrada sea audio sin video adjunto, por lo que puede colocarlo directamente en un video más tarde.

¿Necesito una tarjeta de crédito para comenzar?

No. Una tarjeta es el camino más rápido hacia los 30 minutos gratis. Una retención de $1 lo valida, luego lo libera de inmediato y nunca se cobra. Si prefieres utilizar otro método de pago disponible en tu país, tus 30 minutos llegan con tu primer paquete de minutos.

¿Qué sucede con mi MP3 después de transcribirlo?

Se elimina del servidor en el momento en que la transcripción está lista. No se guarda nada para almacenamiento o entrenamiento de modelos. También puedes eliminar la transcripción desde tu panel con un solo clic.

¿Qué tan precisa es la separación de los hablantes en un MP3?

Las etiquetas de los hablantes son más confiables cuando las personas se turnan y la grabación es razonablemente limpia. Una entrevista de dos personas suele separarse claramente; una llamada grupal ruidosa con personas hablando entre sí necesita más edición manual después.

¿Funcionará un MP3 de velocidad de bits variable (VBR)?

Sí. VBR está bien. No tiene ninguna desventaja de precisión frente a la tasa de bits constante (CBR) para voz. Mono y estéreo también funcionan; no es necesario volver a codificar nada antes de cargarlo.

¿Puede transcribir un MP3 que no esté en inglés?

Sí. El idioma se detecta automáticamente en alrededor de 99 idiomas. Una grabación limpia en un solo idioma transcribe mejor; El cambio intenso de código a mitad de frase es más difícil para cualquier motor.

Comienza con 30 minutos gratis

Comenzar – 30 minutos gratis