Cómo convertir un vídeo MP4 a texto, de forma privada
Autor: Hushscript Publicado: Última revisión:
Un flujo de trabajo de carga de video primero puede enviar el MP4 completo aunque el reconocimiento de voz solo necesite su pista de audio. Dependiendo de la resolución, el códec y la tasa de bits, una grabación larga puede ocupar muchos gigabytes. Hushscript evita esa transferencia: el navegador prepara primero el audio y el vídeo fuente permanece en su dispositivo.
Hushscript toma un camino diferente. Su navegador extrae el audio del vídeo antes de que comience la carga, por lo que el MP4 original permanece en su dispositivo. Solo se transcribe el audio y se elimina en el momento en que la transcripción esté lista. Esta guía recorre el proceso completo: los pasos, un ejemplo práctico en un seminario web grabado, cómo extraer subtítulos SRT, los otros formatos de video que funcionan de la misma manera y qué hacer cuando algo sale mal.
Por qué no debería ser necesario cargar su video
La pista de video es irrelevante para la transcripción. El motor de voz sólo necesita el audio. Cargar la imagen es una pura pérdida: tiempo de red, almacenamiento en el servidor y una huella de privacidad que no necesita.
Cómo funciona la extracción en el navegador, en lenguaje sencillo
Un MP4 es un contenedor. En su interior se encuentran secuencias separadas: el video (la imagen), el audio (el sonido) y algunos metadatos, una estructura explicada en la guía de procesamiento de video de MDN. La transcripción solo necesita la transmisión de audio.
Hushscript ejecuta un pequeño conjunto de herramientas multimedia nativo del navegador directamente en la página. Cuando sueltas tu MP4, ese kit de herramientas abre el contenedor localmente, copia la secuencia de audio y entrega ese audio para cargarlo, sin que la página envíe el video a ninguna parte. El trabajo se realiza en el mismo lugar donde se reproduce un vídeo: en su propia máquina.
Así que el resultado práctico es:
- El archivo MP4 nunca sale de su dispositivo. La imagen permanece contigo.
- El tamaño de carga es el tamaño del audio, no el video, generalmente entre 10 y 20 veces más pequeño.
- El servidor y el motor de voz detrás de él nunca tienen acceso a tu contenido de video.
Esto es importante para reuniones, entrevistas grabadas, declaraciones legales y cualquier cosa donde el metraje en sí sea confidencial. También es importante cuando tienes una conexión lenta con un archivo de varios gigabytes: extraer primero el audio convierte una carga de media hora en un par de minutos.
Lo que necesitas
Tres cosas y nada que instalar:
- Un MP4 con audio hablado. Una reunión grabada, un seminario web, una entrevista, una conferencia o vídeo con una persona hablando: cualquier cosa en la que la gente esté hablando. Un clip silencioso o un vídeo solo musical no tiene nada que transcribir.
- Un navegador actual. Chrome, Edge, Firefox o Safari, razonablemente actualizados. La extracción de audio se ejecuta en el navegador, por lo que es posible que un navegador antiguo o simplificado no la admita.
- Una cuenta Hushscript. Obtienes 30 minutos gratis después de una verificación de tarjeta de $1 (la retención se autoriza, luego se libera de inmediato y nunca se cobra), o con tu primera compra si utilizas otro método de pago disponible en tu país. No se requiere una tarjeta; es simplemente la ruta más rápida hacia los minutos libres. Después es pago por uso, sin suscripción. Los costos se encuentran en la página de precios.
No necesita un extractor de audio, un convertidor ni ningún software de video por separado. Colocar el MP4 es toda la entrada.
Convierta un MP4 en tres pasos
- Coloque su MP4 en la página /MP4-to-text. Su navegador extrae la pista de audio y carga solo el audio, por lo que el video permanece en su dispositivo. Los primeros 30 segundos aparecen como una vista previa etiquetada por el hablante, no se necesita una cuenta.
- Regístrese para transcribir el resto. Ingrese su correo electrónico para crear una cuenta. ¿Nuevo aquí? Los primeros 30 minutos corren por nuestra cuenta una vez que verifiques un método de pago, ya sea una retención de tarjeta de $1 (autorizada, luego liberada de inmediato, nunca cargada) o tu paquete de primer minuto si pagas de otra manera. No se requiere tarjeta. La transcripción se factura según la duración del audio, no según el tamaño del archivo.
- Exporte la transcripción. Una vez que esté lista, descárguela en cualquiera de los 21 formatos (TXT, SRT y VTT para subtítulos, DOCX y PDF para documentos, JSON y CSV para datos, entre otros), además de un archivo .husharchive protegido con contraseña. Las etiquetas de los hablantes se incluyen de forma gratuita.
La eliminación del audio se produce automáticamente cuando se entrega la transcripción. No hay ningún paso de limpieza que recordar.
Qué significa “facturado según la duración del audio”
Un MP4 de una hora a 1080p podría tener 6 GB. El audio extraído (normalmente AAC a 128-256 kbps) tiene entre 60 y 120 MB. Eso es lo que se carga, y el costo por minuto se basa en la hora de audio, no en el archivo de 6 GB.
El resultado: puedes transcribir un documental 4K de dos horas desde una grabadora de campo y pagar el mismo costo por minuto que un MP3 pequeño, porque ambos contienen la misma cantidad de audio. La resolución, la tasa de bits y el tamaño del archivo son completamente irrelevantes para lo que se le cobra.
Un ejemplo práctico: un seminario web grabado
Supongamos que realizó un seminario web de 52 minutos con dos presentadores y lo grabó en un solo MP4:q3-product-webinar.mp4, aproximadamente 3,4 GB a 1080p. Desea una transcripción limpia para el correo electrónico de resumen, además de subtítulos para adjuntar a la repetición.
Así es como se desarrolla realmente:
- Abre /MP4-to-text y suelta
q3-product-webinar.mp4. La página extrae el audio localmente, de modo que un vídeo de 3,4 GB se convierte en aproximadamente 70 MB de audio. Solo se cargan los 70 MB. - Los primeros 30 segundos aparecen etiquetados, para que pueda verificar la calidad del audio antes de transcribir los 52 minutos completos.
- Cuando la transcripción completa está lista, se divide en expresiones etiquetadas como
Hablante AoHablante B. Haces clic enHablante A, escribes “Priya”, haces clic enHablante B, escribes “Marcus” y ambos vuelven a etiquetar en todas partes a la vez. - Exportas TXT para el correo electrónico de resumen y SRT para la pista de subtítulos de la repetición. El MP4 original del seminario web nunca salió de su computadora portátil y el audio ya se eliminó del servidor.
La parte que sorprende a la gente la primera vez es el paso 1: una carga de varios gigabytes que simplemente no ocurre. La imagen permanece contigo; solo viajan las palabras.
Etiquetas de hablantes para videos de varias personas
Cada transcripción incluye la registro automático del hablante sin costo adicional. Para una entrevista, un panel o la grabación de una reunión, cada hablante tiene la etiqueta Hablante A,Hablante B, etc., y puede cambiarles el nombre a nombres reales en el editor haciendo clic en la etiqueta y escribiendo.
La diarización funciona mejor con una separación limpia. El audio de la cámara en una habitación silenciosa o una videollamada grabada con pistas por participante le dan al motor el máximo con qué trabajar. Una sala llena de gente hablando entre sí es más difícil para cualquier motor de registro. Consulta la sección de solución de problemas a continuación para saber qué te puede ayudar.
Obtener subtítulos (SRT / VTT) del video
Si el motivo por el que estás transcribiendo el video son los subtítulos, exporta la transcripción como SRT. Cada expresión llega con una marca de tiempo de inicio y finalización, formateada según la especificación SRT:
1
00:00:04,210 --> 00:00:07,880
Hablante A: Gracias por acompañarnos hoy.
2
00:00:08,100 --> 00:00:12,340
Hablante B: Feliz de estar aquí.
Cargue el SRT en un reproductor de escritorio (VLC, QuickTime y la mayoría de los editores lo aceptan) o cárguelo como una pista de subtítulos. en una plataforma que lo soporte. La exportación de Hushscript SRT mantiene las etiquetas de los hablantes, lo cual es útil para videos de varias personas. Algunos formatos de subtítulos eliminan los nombres; SRT los conserva.
Para los reproductores web que usan WebVTT (.vtt), la diferencia con SRT es pequeña: una línea de encabezado WEBVTT y un . en lugar de , en las marcas de tiempo. Puede convertir un SRT a VTT en el navegador con la herramienta gratuita en /tools/SRT-to-VTT; la conversión se ejecuta localmente en la página.
Dos guías paralelas profundizan más de lo que hay espacio para aquí: cómo crear subtítulos SRT a partir de un vídeo cubre la edición del tiempo de referencia y la longitud de la línea, y cómo agregar subtítulos a un vídeo cubre cómo adjuntar el SRT o grabarlo. Grabar subtítulos permanentemente en la página. La imagen es un paso de codificación independiente. Una herramienta gratuita como HandBrake maneja el mux una vez que tienes el SRT.
Otros formatos de video (MOV, WebM, MKV)
El mismo proceso de extracción del navegador se aplica mucho más allá de MP4:
- MOV: video de iPhone y exportaciones de Final Cut.
- WebM: grabaciones de pantalla de Chrome y capturas de OBS.
- MKV: el contenedor común para grabadores de pantalla y contenido extraído con una pista de audio estándar.
Estos contenedores llevan los códecs de audio habituales (AAC, MP3, Opus, FLAC) y el paso de extracción. los demultiplexa de la misma manera que lo hace con un MP4. En la práctica, cualquier cosa grabada en un teléfono, una cámara o una grabadora de pantalla funcionará. Simplemente colóquelo.
También puede alimentar archivos de solo audio como MP3, WAV, M4A directamente. Sin una transmisión de video que eliminar, el paso de extracción se omite y el archivo se carga tal cual. Y si solo desea el archivo de audio en lugar de una transcripción, convertir el MP4 a MP3 es un trabajo separado que también se ejecuta completamente en su navegador. La página de video a texto cubre el flujo de trabajo completo para cualquier formato de video, incluidos aquellos con códecs de audio inusuales.
Solución de problemas
Los archivos MP4 comunes generalmente no necesitan preparación manual. Si uno falla o produce texto débil, verifique estas causas primero.
El video de origen es muy grande. La aplicación no tiene límite de tamaño de archivo: prepara el audio incluso de videos muy grandes directamente en su navegador, siempre y cuando la grabación se realice dentro de las 10 horas (su navegador aún necesita suficiente capacidad local para hacer el trabajo). Si la extracción se detiene en un archivo 4K enorme, cierre otras pestañas e inténtelo de nuevo, o extraiga el audio primero. Las herramientas de extracción de audio gratuitas hacen ese trabajo en el navegador y producen un archivo más pequeño que puedes cargar directamente.
Sin pista de audio ni voz. Una grabación de pantalla silenciosa o un clip de solo música no tiene nada que el motor pueda transcribir, por lo que obtendrás un resultado vacío. Confirma que el video realmente tiene audio hablado reproduciéndolo con el volumen alto. Si se trata de una grabación de pantalla, verifique que la grabadora esté configurada para capturar el audio del sistema o del micrófono; muchos tienen como valor predeterminado solo video.
Un códec de audio poco compatible o no compatible. El extractor en el navegador maneja los códecs comunes (AAC, MP3, Opus, FLAC). Es posible que un contenedor que utilice un códec de audio propietario o inusual no se desmultiplexe limpiamente y el audio no se extraiga. La solución es remux o recodificar primero el audio del vídeo en un códec estándar; la mayoría de los convertidores pueden generar un MP4 estándar o un archivo de audio simple. Si encuentra un formato que no funciona, envíe un correo electrónico a support@hushscript.com y consideraremos agregarlo.
Múltiples hablantes, separación desordenada. La diarización necesita voces distinguibles. La superposición de voces, un único micrófono de campo lejano en una sala grande o un fuerte ruido de fondo desdibujan los límites entre los hablantes. Aún obtendrá una transcripción precisa; las etiquetas del hablante son simplemente menos precisas. Si controlas la grabación, una pista por participante (como la mayoría de las herramientas de videollamadas pueden exportar) o un micrófono más cerca de cada hablante proporciona la separación más limpia. De cualquier manera, puedes corregir cualquier línea mal etiquetada en el editor antes de exportar.
La transcripción tiene errores ortográficos constantes. Un nombre propio recurrente o una pieza de jerga que siempre se transcribe de la misma manera incorrecta es una solución única: una única búsqueda y reemplazo en el texto exportado corrige cada instancia. Esto es más rápido que volver a ejecutar cualquier cosa.
Exportar formatos de un vistazo
| Formato | Lo que obtienes |
|---|---|
| TXT | Texto sin formato, etiquetas de hablante, sin marcas de tiempo |
| SRT | Subtítulos con marca de tiempo, listos para descargar en cualquier reproductor de vídeo |
| VTT | Subtítulos web para reproductores de vídeo HTML5 |
| CSV | Filas aptas para hojas de cálculo con hablantes y horarios |
| Markdown | Texto etiquetado por hablantes para notas y publicaciones |
| JSON | Datos estructurados:{ speaker, start, end, text } por expresión |
| DOCX | Transcripción etiquetada por el hablante para Word o Google Docs |
| Transcripción de diseño fijo para compartir o archivo |
Todos los formatos de exportación se incluyen con cada plan, incluidos los 30 minutos gratuitos, y ninguno lleva una marca de agua.
Para cualquier video donde la privacidad importe, ya sea una reunión, una entrevista o una declaración, el punto es válido: su video nunca se carga. Puedes verificarlo tú mismo. Abra la pestaña de red del navegador antes de soltar el archivo y observe lo que se envía; verás que el audio aumenta y la imagen permanece fija.
Fuentes y normas independientes
Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.
Fuentes revisadas: