Saltar al contenido principal

Cómo transcribir una grabación larga (más de 2 horas)

Autor: Publicado: Última revisión:

Una grabación larga hace visibles todos los límites: duración máxima, preparación del navegador, confiabilidad de carga, saldo de minutos y protección de cola. Si tiene que convertir en texto una entrevista de tres horas, un taller de medio día o una reunión de junta directiva, verifique esos límites antes de la carga en lugar de después de un trabajo fallido.

Hushscript tarda cargas de hasta 10 horas cada una, sin límite de tamaño de archivo: los archivos grandes se preparan directamente en su navegador. No existe una asignación diaria basada en el plan; un techo de seguridad alto de 40 horas y 24 horas y salvaguardias activas en el trabajo protegen el servicio. Un expediente largo no es un caso especial aquí; es el mismo flujo de trabajo que un clip de dos minutos, solo que se deja terminar solo.

Lo que necesitas antes de comenzar

Necesitas tres cosas y probablemente ya tengas las tres.

Una nota rápida sobre los minutos gratis, porque las grabaciones largas los consumen rápidamente: obtienes 30 minutos gratis una vez. La forma más rápida de desbloquearlos es agregar una tarjeta (una retención de $1 la valida y se libera de inmediato, nunca se cobra), y los minutos llegan de inmediato. Si prefieres utilizar otro método de pago disponible en tu país, los 30 minutos llegan con tu primera compra. No se requiere una tarjeta; es simplemente la ruta más rápida. Treinta minutos son suficientes para transcribir un segmento corto y juzgar la precisión antes de enviar un paquete completo a un archivo de tres horas.

Qué verificar antes de una carga larga

Cuatro comprobaciones evitan la mayoría de sorpresas:

Confirme esos límites antes de cargarlos. Hushscript los establece aquí para que se pueda planificar un trabajo largo a partir de la duración de la fuente en lugar de descubrirlo mediante prueba y error.

Transcribe una grabación larga, paso a paso

No hay modo de grabación larga para activar. El proceso es idéntico a un clip corto; simplemente se ejecuta durante más tiempo en segundo plano.

  1. Abra el convertidor y suelte su archivo. Vaya a audio a texto y arrastre la grabación al área de carga, o haga clic para explorar. Se acepta cualquier formato común de audio o vídeo. Si se trata de un vídeo, el audio se extrae en su navegador en este punto, por lo que el archivo de vídeo pesado nunca sale de su máquina.
  2. Consulte la vista previa de 30 segundos. Antes de registrarse, Hushscript prepara un clip corto en su navegador, lo envía para su transcripción y le muestra la salida etiquetada por el hablante. La grabación completa permanece local en esta etapa. Lea la vista previa, confirme que los hablantes estén divididos de manera sensata y que las palabras sean correctas, y sabrá si el audio es lo suficientemente limpio para la ejecución completa.
  3. Inicie sesión para transcribir el resto. Si la vista previa se ve bien, regístrese y se cargará el archivo completo. Aquí es donde importa su saldo de minutos: un archivo de 150 minutos consume 150 minutos. Asegúrese de que el paquete que tiene cubra la duración.
  4. Deje que el trabajo termine solo. El tiempo de procesamiento varía según la longitud del archivo y la carga del servicio, pero el trabajo se ejecuta sin supervisión. No es necesario que mantengas la pestaña enfocada; regrese cuando haya terminado.
  5. Vuelva a etiquetar los hablantes. La transcripción llega con etiquetas genéricas como Hablante A y Hablante B. En el editor, cambie el nombre de Hablante A a un nombre real una vez y se actualizará en todas partes del documento, de modo que una entrevista de tres horas se lea con los nombres correctos en todo momento.
  6. Exporte en el formato que necesite. Descargue en cualquiera de los 21 formatos (TXT, SRT, DOCX, PDF y formatos de subtítulos y línea de tiempo del editor, entre ellos) además de un formato protegido con contraseña. .husharchive, sin marca de agua en ninguno de ellos. SRT es el indicado para archivos largos, porque sus marcas de tiempo le permiten saltar directamente a cualquier momento en lugar de desplazarse.

El resultado se encuentra en su panel con etiquetas de hablantes, marcas de tiempo y el menú de exportación completo, y permanece allí para que usted pueda volver a consultarlo.

Un ejemplo resuelto: una entrevista grabada de 2,5 horas

Así es como se ve con una forma de archivo real. Supongamos que grabó una entrevista de 2 horas y 30 minutos como un solo MP3: dos personas, una en voz baja y otra en voz alta, grabadas durante una videollamada.

Dejas caer el MP3 en el área de carga. La vista previa de 30 segundos muestra a dos hablantes ya separados en la muestra de apertura. Usted inicia sesión; el archivo de 150 minutos se carga y comienza el trabajo. Cuando se completa, el resultado es un documento continuo con marcas de tiempo que se ejecutan ininterrumpidamente desde 00:00:00 hasta 02:30:00.

El resultado sin procesar se lee así:

[00:00:04] Hablante A: Gracias por dedicar el tiempo. ¿Podemos comenzar con cómo comenzó el proyecto?
[00:00:11] Hablante B: Por supuesto. Realmente comenzó a principios de 2023, cuando...

Cambias el nombre de Hablante A al entrevistador y Hablante B al sujeto una vez, y cada línea se actualiza. Luego, exporta dos veces: un TXT para pegarlo en un resumen para un resumen de primer paso, y un SRT para que cuando escriba una cita directa pueda hacer clic en la marca de tiempo y escuchar exactamente cómo se dijo. Costo total: 150 minutos de tu saldo, una carga, sin división, sin truncamiento, sin segundo intento.

Mantén a los hablantes etiquetados durante una sesión larga

La diarización en una grabación de 3 horas es realmente más difícil que en un clip de 10 minutos: las voces varían, las pausas se alargan y el ruido de fondo va y viene. Hushscript ejecuta el etiquetado en toda la transcripción a la vez, por lo que las etiquetas se mantienen consistentes de principio a fin, pero la grabación en sí puede ayudar o perjudicar eso.

En el momento de la grabación:

Calidad de audio:

Una vez que la transcripción está de vuelta, volver a etiquetar Hablante A con un nombre real es una edición única que se propaga a través de todo el documento. Para obtener una visión más profunda de cómo funciona el etiquetado en sí, consulte identificación del hablante.

¿Dividir el archivo o cargarlo completo?

La respuesta corta para casi todos: subirlo entero. Dividir una grabación larga en partes es lo que se debe evitar, no lo que se debe hacer, y solo hay dos situaciones en las que es necesario.

Subir como un archivo cuando la grabación sea de 10 horas o menos, lo que cubre la abrumadora mayoría de entrevistas, conferencias, reuniones y paneles; no hay un límite de tamaño de archivo para evitar. Un archivo significa un conjunto continuo de marcas de tiempo y un conjunto consistente de etiquetas de hablantes. La división rompe ambas: cada parte reinicia su reloj en cero, y la misma persona puede obtener una etiqueta diferente en la segunda parte que en la primera, lo que le deja a usted unir y reasignar a mano.

Los sistemas de voz aún pueden dividir el audio largo internamente. Una investigación IWSLT 2026 reciente sobre procesamiento de voz de formato largo comparó varias estrategias de segmentación y descubrió que la elección afectaba la solidez. Esta es una preocupación a nivel del motor, no una razón para cortar la fuente a mano: mantener una carga preserva una transcripción continua de cara al usuario mientras el proceso de procesamiento maneja sus propios límites internos.

Divida solo cuando la grabación dura realmente más de 10 horas, como la grabación de una conferencia de varios días. En ese caso, corte un silencio natural (una pausa en la sesión) en lugar de hacerlo a mitad de la frase, y tome nota del desplazamiento para poder volver a numerar las marcas de tiempo después. Si está cortando un MP3 antes de subirlo, prefiera la velocidad de bits constante (CBR) a la velocidad de bits variable (VBR), ya que VBR puede introducir una desviación de sincronización en algunos editores.

Un archivo de vídeo de varios gigabytes no es un problema. Debido a que Hushscript extrae el audio en su navegador antes de cargarlo, el tamaño del video de origen no es el tamaño de carga y no hay límite en el tamaño que puede tener ese archivo de origen: solo viaja la secuencia de audio mucho más pequeña, siempre y cuando su navegador y dispositivo puedan prepararlo.

Mejores configuraciones para la precisión en audio largo

El factor más importante en la precisión es la claridad del habla, no la muestra tasa o formato de archivo. Específicamente para sesiones largas:

Solución de problemas comunes de archivos largos

La precisión disminuye en la mitad posterior de la grabación. Esto casi siempre se debe a una caída de los niveles de audio o un aumento del ruido de la habitación al final de una sesión larga, no un límite de duración. Verifique la grabación original alrededor de las marcas de tiempo donde se agrupan los errores; si el nivel bajó, normalícelo y vuelva a ejecutarlo, y use la vista previa de 30 segundos en un segmento posterior para confirmar antes de volver a pasar los minutos.

Dos personas siguen fusionándose en un solo hablante. La causa habitual es la superposición de voz y diafonía. No existe una solución perfecta después del hecho, pero una grabación con más separación entre voces (una pista por canal o micrófonos más separados) se sincronizará mucho más limpiamente la próxima vez. En la transcripción que tienes ahora, puedes corregir alguna etiqueta incorrecta ocasional manualmente en el editor.

Un archivo grande tarda en cargarse. La velocidad de carga depende de tu conexión, no de la herramienta. Para un vídeo de varios gigabytes, recuerde que el audio se extrae localmente primero, por lo que la carga real es mucho más pequeña que el archivo en el disco. Si tienes una conexión débil, un enlace por cable o simplemente dejarlo funcionando llegará allí.

Ruido de fondo durante toda la grabación. El ruido constante (aire acondicionado, tráfico, zumbido de la habitación) reduce la precisión en todo el archivo. Una ligera normalización del volumen suele ayudar más que eliminar el ruido, que tiende a dañar el habla. Si un segmento se ve gravemente afectado, las marcas de tiempo aún le permitirán encontrarlo y escucharlo.

Parece que la transcripción terminó antes de tiempo. En Hushscript, una transcripción cubre el archivo completo; no hay truncamiento silencioso. Si el texto parece corto, compare la marca de tiempo final con la duración real de la grabación. Los períodos prolongados de silencio o música simplemente producen pocas palabras, que pueden leerse como “faltantes”, pero no lo están.

Exporte una transcripción larga: qué formato

Para una sesión de varias horas, el formato que elija cambia la utilidad de la transcripción.

Cada exportación está incluida en cada plan, sin marca de agua ni tarifa separada para desbloquear subtítulos.


Para grabaciones largas facturadas por minuto, transcripción de pago por uso evita un plan mensual recurrente. Paga por las horas que transcribe, con un techo alto de seguridad y controles de trabajo activos para lotes inusualmente pesados. Los dos trabajos de grabación de larga duración más comunes tienen sus propios tutoriales: cómo transcribir un podcast cubre episodios con varios invitados y notas de programas, y cómo transcribir una conferencia cubre peculiaridades de audio en el aula, como la reverberación y las preguntas de la audiencia desde el otro lado de la sala. Y si su material es una pila de archivos separados en lugar de una grabación larga, transcribir una carpeta de grabaciones abarca ejecutarlas como un lote.

Fuentes y normas independientes

Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.

Fuentes revisadas:

Preguntas frecuentes

¿Existe un límite de tamaño de archivo para grabaciones largas?

No. Las grabaciones pueden durar hasta 10 horas, sin límite de tamaño de archivo: los archivos grandes se preparan directamente en su navegador. No hay una asignación diaria o mensual basada en el plan, pero se aplica un límite de seguridad alto de 40 horas consecutivas las 24 horas y salvaguardias laborales activas.

¿Tengo que dividir una grabación larga en partes?

No. Un archivo de 3 u 8 horas se carga como una sola carga y regresa como una transcripción con marcas de tiempo continuas. Solo necesita dividir si la grabación dura más de 10 horas.

¿Las etiquetas de los hablantes se mantendrán consistentes durante una grabación de 3 horas?

Sí. El diarización de hablantes se ejecuta en toda la transcripción a la vez, no fragmento por fragmento, por lo que cada persona mantiene la misma etiqueta desde el primer minuto hasta el último.

¿Puedo cargar un archivo de vídeo largo en lugar de audio?

Sí. El audio se extrae del vídeo en su navegador antes de enviar cualquier cosa, por lo que solo el audio llega al servidor. El vídeo original nunca se carga, lo que normalmente convierte la captura de una conferencia de varios gigabytes en una carga de audio mucho más pequeña.

¿Cuánto tiempo lleva transcribir un archivo largo?

El tiempo de procesamiento varía según la duración de la grabación y la carga del servicio. Los trabajos largos se ejecutan sin supervisión, por lo que puede salir de la página y regresar cuando la transcripción esté completa.

¿Qué formatos de exportación funcionan mejor para una transcripción larga?

TXT para alimentar otras herramientas, SRT para saltar a una marca de tiempo, DOCX para compartir y realizar anotaciones, y JSON para los datos sin procesar de los hablantes y los tiempos. Todos los formatos de exportación se incluyen sin marca de agua.

¿Mis minutos caducan si solo transcribo ocasionalmente?

Los minutos caducan después de 180 días sin una transcripción completa o una compra de minutos. Cualquiera de las actividades restablece la ventana y le enviamos un correo electrónico antes de que caduque.

Comienza con 30 minutos gratis

Comenzar – 30 minutos gratis