Cómo transcribir una grabación larga (más de 2 horas)
Autor: Hushscript Publicado: Última revisión:
Una grabación larga hace visibles todos los límites: duración máxima, preparación del navegador, confiabilidad de carga, saldo de minutos y protección de cola. Si tiene que convertir en texto una entrevista de tres horas, un taller de medio día o una reunión de junta directiva, verifique esos límites antes de la carga en lugar de después de un trabajo fallido.
Hushscript tarda cargas de hasta 10 horas cada una, sin límite de tamaño de archivo: los archivos grandes se preparan directamente en su navegador. No existe una asignación diaria basada en el plan; un techo de seguridad alto de 40 horas y 24 horas y salvaguardias activas en el trabajo protegen el servicio. Un expediente largo no es un caso especial aquí; es el mismo flujo de trabajo que un clip de dos minutos, solo que se deja terminar solo.
Lo que necesitas antes de comenzar
Necesitas tres cosas y probablemente ya tengas las tres.
- La grabación en sí, en cualquier formato de audio o vídeo común: MP3, M4A, WAV, FLAC, AAC, MP4, MOV, MKV y el resto. No es necesario convertirlo primero; simplemente suelte el archivo.
- Un navegador moderno. Los primeros 30 segundos se preparan como un clip de vista previa compacto en su navegador y se envían para su transcripción previa; el archivo completo no se carga hasta que inicia sesión. Para los archivos de video, el navegador también prepara el audio sin enviar el video fuente.
- Suficientes minutos en su saldo para cubrir la duración. Este es el número que vale la pena verificar por adelantado. Una entrevista de 2,5 horas equivale a 150 minutos, por lo que un paquete de 5 h (300 min) la cubre con espacio de sobra. Las cuentas nuevas obtienen 30 minutos gratis para probar el flujo completo; consulte la página de precios para saber cuánto cuesta cada paquete.
Una nota rápida sobre los minutos gratis, porque las grabaciones largas los consumen rápidamente: obtienes 30 minutos gratis una vez. La forma más rápida de desbloquearlos es agregar una tarjeta (una retención de $1 la valida y se libera de inmediato, nunca se cobra), y los minutos llegan de inmediato. Si prefieres utilizar otro método de pago disponible en tu país, los 30 minutos llegan con tu primera compra. No se requiere una tarjeta; es simplemente la ruta más rápida. Treinta minutos son suficientes para transcribir un segmento corto y juzgar la precisión antes de enviar un paquete completo a un archivo de tres horas.
Qué verificar antes de una carga larga
Cuatro comprobaciones evitan la mayoría de sorpresas:
- Duración por archivo. Hushscript acepta una grabación de hasta 10 horas. Una fuente más larga debe dividirse en una pausa natural.
- Capacidad del navegador y del dispositivo. No hay límite de tamaño de archivo del producto, pero el navegador aún tiene que leer y preparar la fuente local. Los archivos muy grandes necesitan suficiente memoria, espacio de almacenamiento y tiempo en el dispositivo que los carga.
- Saldo de minutos. La facturación sigue la duración del audio. Una grabación de 150 minutos ocupa 150 minutos base antes de cualquier opción que cambie la duración facturada.
- Protecciones del servicio. No existe una asignación diaria basada en el plan, pero aún se aplican un límite de seguridad de 40 horas continuas de 24 horas y salvaguardias de trabajo activo. Un lote grande puede ponerse en cola en lugar de iniciar todos los archivos a la vez.
Confirme esos límites antes de cargarlos. Hushscript los establece aquí para que se pueda planificar un trabajo largo a partir de la duración de la fuente en lugar de descubrirlo mediante prueba y error.
Transcribe una grabación larga, paso a paso
No hay modo de grabación larga para activar. El proceso es idéntico a un clip corto; simplemente se ejecuta durante más tiempo en segundo plano.
- Abra el convertidor y suelte su archivo. Vaya a audio a texto y arrastre la grabación al área de carga, o haga clic para explorar. Se acepta cualquier formato común de audio o vídeo. Si se trata de un vídeo, el audio se extrae en su navegador en este punto, por lo que el archivo de vídeo pesado nunca sale de su máquina.
- Consulte la vista previa de 30 segundos. Antes de registrarse, Hushscript prepara un clip corto en su navegador, lo envía para su transcripción y le muestra la salida etiquetada por el hablante. La grabación completa permanece local en esta etapa. Lea la vista previa, confirme que los hablantes estén divididos de manera sensata y que las palabras sean correctas, y sabrá si el audio es lo suficientemente limpio para la ejecución completa.
- Inicie sesión para transcribir el resto. Si la vista previa se ve bien, regístrese y se cargará el archivo completo. Aquí es donde importa su saldo de minutos: un archivo de 150 minutos consume 150 minutos. Asegúrese de que el paquete que tiene cubra la duración.
- Deje que el trabajo termine solo. El tiempo de procesamiento varía según la longitud del archivo y la carga del servicio, pero el trabajo se ejecuta sin supervisión. No es necesario que mantengas la pestaña enfocada; regrese cuando haya terminado.
- Vuelva a etiquetar los hablantes. La transcripción llega con etiquetas genéricas como
Hablante AyHablante B. En el editor, cambie el nombre deHablante Aa un nombre real una vez y se actualizará en todas partes del documento, de modo que una entrevista de tres horas se lea con los nombres correctos en todo momento. - Exporte en el formato que necesite. Descargue en cualquiera de los 21 formatos (TXT, SRT, DOCX, PDF y formatos de subtítulos y línea de tiempo del editor, entre ellos) además de un formato protegido con contraseña. .husharchive, sin marca de agua en ninguno de ellos. SRT es el indicado para archivos largos, porque sus marcas de tiempo le permiten saltar directamente a cualquier momento en lugar de desplazarse.
El resultado se encuentra en su panel con etiquetas de hablantes, marcas de tiempo y el menú de exportación completo, y permanece allí para que usted pueda volver a consultarlo.
Un ejemplo resuelto: una entrevista grabada de 2,5 horas
Así es como se ve con una forma de archivo real. Supongamos que grabó una entrevista de 2 horas y 30 minutos como un solo MP3: dos personas, una en voz baja y otra en voz alta, grabadas durante una videollamada.
Dejas caer el MP3 en el área de carga. La vista previa de 30 segundos muestra a dos hablantes ya separados en la muestra de apertura. Usted inicia sesión; el archivo de 150 minutos se carga y comienza el trabajo. Cuando se completa, el resultado es un documento continuo con marcas de tiempo que se ejecutan ininterrumpidamente desde 00:00:00 hasta 02:30:00.
El resultado sin procesar se lee así:
[00:00:04] Hablante A: Gracias por dedicar el tiempo. ¿Podemos comenzar con cómo comenzó el proyecto?
[00:00:11] Hablante B: Por supuesto. Realmente comenzó a principios de 2023, cuando...
Cambias el nombre de Hablante A al entrevistador y Hablante B al sujeto una vez, y cada línea se actualiza. Luego, exporta dos veces: un TXT para pegarlo en un resumen para un resumen de primer paso, y un SRT para que cuando escriba una cita directa pueda hacer clic en la marca de tiempo y escuchar exactamente cómo se dijo. Costo total: 150 minutos de tu saldo, una carga, sin división, sin truncamiento, sin segundo intento.
Mantén a los hablantes etiquetados durante una sesión larga
La diarización en una grabación de 3 horas es realmente más difícil que en un clip de 10 minutos: las voces varían, las pausas se alargan y el ruido de fondo va y viene. Hushscript ejecuta el etiquetado en toda la transcripción a la vez, por lo que las etiquetas se mantienen consistentes de principio a fin, pero la grabación en sí puede ayudar o perjudicar eso.
En el momento de la grabación:
- Si su herramienta puede capturar una pista separada por participante, úsela. La grabación local de Zoom, por ejemplo, puede producir una pista mezclada o audio por canal según la configuración; la pista estéreo mixta suele funcionar mejor para la carga.
- Grabar una habitación física es el caso difícil. Un micrófono direccional, o simplemente colocar los hablantes más separados, elimina la diafonía que hace que dos voces se lean como una sola.
Calidad de audio:
- 44,1 kHz/WAV de 16 bits, o un MP3 de alta tasa de bits a 128 kbps o superior, es suficiente para el motor. No hay ganancia de precisión a partir de 96 kHz; simplemente hace que un archivo largo sea más grande.
- Si la grabación es silenciosa o desigual, normalizar el volumen en un editor de audio antes de cargarla a menudo aumenta la precisión más que cualquier cambio de configuración.
Una vez que la transcripción está de vuelta, volver a etiquetar Hablante A con un nombre real es una edición única que se propaga a través de todo el documento. Para obtener una visión más profunda de cómo funciona el etiquetado en sí, consulte identificación del hablante.
¿Dividir el archivo o cargarlo completo?
La respuesta corta para casi todos: subirlo entero. Dividir una grabación larga en partes es lo que se debe evitar, no lo que se debe hacer, y solo hay dos situaciones en las que es necesario.
Subir como un archivo cuando la grabación sea de 10 horas o menos, lo que cubre la abrumadora mayoría de entrevistas, conferencias, reuniones y paneles; no hay un límite de tamaño de archivo para evitar. Un archivo significa un conjunto continuo de marcas de tiempo y un conjunto consistente de etiquetas de hablantes. La división rompe ambas: cada parte reinicia su reloj en cero, y la misma persona puede obtener una etiqueta diferente en la segunda parte que en la primera, lo que le deja a usted unir y reasignar a mano.
Los sistemas de voz aún pueden dividir el audio largo internamente. Una investigación IWSLT 2026 reciente sobre procesamiento de voz de formato largo comparó varias estrategias de segmentación y descubrió que la elección afectaba la solidez. Esta es una preocupación a nivel del motor, no una razón para cortar la fuente a mano: mantener una carga preserva una transcripción continua de cara al usuario mientras el proceso de procesamiento maneja sus propios límites internos.
Divida solo cuando la grabación dura realmente más de 10 horas, como la grabación de una conferencia de varios días. En ese caso, corte un silencio natural (una pausa en la sesión) en lugar de hacerlo a mitad de la frase, y tome nota del desplazamiento para poder volver a numerar las marcas de tiempo después. Si está cortando un MP3 antes de subirlo, prefiera la velocidad de bits constante (CBR) a la velocidad de bits variable (VBR), ya que VBR puede introducir una desviación de sincronización en algunos editores.
Un archivo de vídeo de varios gigabytes no es un problema. Debido a que Hushscript extrae el audio en su navegador antes de cargarlo, el tamaño del video de origen no es el tamaño de carga y no hay límite en el tamaño que puede tener ese archivo de origen: solo viaja la secuencia de audio mucho más pequeña, siempre y cuando su navegador y dispositivo puedan prepararlo.
Mejores configuraciones para la precisión en audio largo
El factor más importante en la precisión es la claridad del habla, no la muestra tasa o formato de archivo. Específicamente para sesiones largas:
- Utilice un compresor en el lado de grabación(un compresor de audio de hardware o software, no compresión de archivos) para igualar la brecha entre un entrevistador ruidoso y un sujeto tranquilo. Esto importa mucho más en tres horas que en diez minutos, donde una variación en el nivel puede perder intercambios completos.
- FLAC no tiene pérdidas y es aceptado, pero no superará a un buen MP3 en precisión. Su único uso real es eliminar dudas: si desea estar seguro de que la calidad del audio no es el cuello de botella, FLAC resuelve la cuestión a costa de un archivo más grande.
- Evite una gran reducción de ruido antes de cargarlo. La eliminación de ruido agresiva puede devorar las consonantes y, de hecho, reducir la precisión. La normalización ligera ayuda; la limpieza no lo hace.
Solución de problemas comunes de archivos largos
La precisión disminuye en la mitad posterior de la grabación. Esto casi siempre se debe a una caída de los niveles de audio o un aumento del ruido de la habitación al final de una sesión larga, no un límite de duración. Verifique la grabación original alrededor de las marcas de tiempo donde se agrupan los errores; si el nivel bajó, normalícelo y vuelva a ejecutarlo, y use la vista previa de 30 segundos en un segmento posterior para confirmar antes de volver a pasar los minutos.
Dos personas siguen fusionándose en un solo hablante. La causa habitual es la superposición de voz y diafonía. No existe una solución perfecta después del hecho, pero una grabación con más separación entre voces (una pista por canal o micrófonos más separados) se sincronizará mucho más limpiamente la próxima vez. En la transcripción que tienes ahora, puedes corregir alguna etiqueta incorrecta ocasional manualmente en el editor.
Un archivo grande tarda en cargarse. La velocidad de carga depende de tu conexión, no de la herramienta. Para un vídeo de varios gigabytes, recuerde que el audio se extrae localmente primero, por lo que la carga real es mucho más pequeña que el archivo en el disco. Si tienes una conexión débil, un enlace por cable o simplemente dejarlo funcionando llegará allí.
Ruido de fondo durante toda la grabación. El ruido constante (aire acondicionado, tráfico, zumbido de la habitación) reduce la precisión en todo el archivo. Una ligera normalización del volumen suele ayudar más que eliminar el ruido, que tiende a dañar el habla. Si un segmento se ve gravemente afectado, las marcas de tiempo aún le permitirán encontrarlo y escucharlo.
Parece que la transcripción terminó antes de tiempo. En Hushscript, una transcripción cubre el archivo completo; no hay truncamiento silencioso. Si el texto parece corto, compare la marca de tiempo final con la duración real de la grabación. Los períodos prolongados de silencio o música simplemente producen pocas palabras, que pueden leerse como “faltantes”, pero no lo están.
Exporte una transcripción larga: qué formato
Para una sesión de varias horas, el formato que elija cambia la utilidad de la transcripción.
- TXT es el insumo más portátil y adecuado para incorporar en un LLM para resumir o analizar una conversación larga.
- SRT lleva marcas de tiempo a nivel de expresión, por lo que puede saltar a cualquier momento sin tener que desplazarse. Si el motivo de la transcripción es encontrar momentos específicos, este es el formato.
- DOCX mantiene las etiquetas de los hablantes y las marcas de tiempo en un archivo compatible con Word, lo mejor para compartir una transcripción con personas que necesitan comentarla.
- JSON le brinda la estructura sin formato (hablante, inicio, fin, texto) para canalizar otra herramienta.
Cada exportación está incluida en cada plan, sin marca de agua ni tarifa separada para desbloquear subtítulos.
Para grabaciones largas facturadas por minuto, transcripción de pago por uso evita un plan mensual recurrente. Paga por las horas que transcribe, con un techo alto de seguridad y controles de trabajo activos para lotes inusualmente pesados. Los dos trabajos de grabación de larga duración más comunes tienen sus propios tutoriales: cómo transcribir un podcast cubre episodios con varios invitados y notas de programas, y cómo transcribir una conferencia cubre peculiaridades de audio en el aula, como la reverberación y las preguntas de la audiencia desde el otro lado de la sala. Y si su material es una pila de archivos separados en lugar de una grabación larga, transcribir una carpeta de grabaciones abarca ejecutarlas como un lote.
Fuentes y normas independientes
Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.
Fuentes revisadas: