Saltar al contenido principal

Cómo crear subtítulos SRT a partir de un vídeo

Autor: Publicado: Última revisión:

Un archivo SRT es cómo los subtítulos viajan por separado de un video, como un pequeño archivo de texto complementario que el reproductor lee junto con la imagen. Puedes crear uno transcribiendo el audio y exportando el resultado con marcas de tiempo. El trabajo que solía tomar una tarde, sincronizar cada línea con el marco, ahora está hecho para usted; lo que queda es un breve pase de edición para facilitar la lectura. Esta guía explica qué contiene realmente el formato, cómo crear un SRT a partir de un vídeo en el orden real y cómo limpiarlo para que los subtítulos se lean bien.

Qué necesitas antes de comenzar

Necesitas el archivo de vídeo y unos minutos. Cualquier contenedor común sirve: MP4, MOV, MKV, WebM, AVI y el resto. No necesita software de edición para crear el SRT y no necesita convertir el video primero. Un editor de subtítulos es opcional y solo será útil más adelante, si desea una vista de línea de tiempo mientras ajusta el tiempo.

Para la transcripción en sí, te registras, lo que desbloquea 30 minutos gratis para probar. La vista previa de 30 segundos que se procesa primero no necesita cuenta, por lo que puede ver la calidad antes de comprometerse con cualquier cosa.

Qué es un archivo SRT

SRT significa SubRip Text. El formato es deliberadamente simple: una secuencia de bloques numerados, cada uno formado por tres partes apiladas en líneas separadas. Primero un número de índice, luego un start --> end marca de tiempo, luego una o dos líneas de texto de subtítulo. Una línea en blanco separa un bloque del siguiente.

1
00:00:02,340 --> 00:00:05,810
El audio se extrae en su navegador.

2
00:00:06,100 --> 00:00:09,440
Solo el audio llega al servidor, no el vídeo.

Algunos detalles son importantes cuando lee o edita manualmente un archivo. El formato de marca de tiempo es HH:MM:SS,mmm, de horas a milisegundos, y el separador antes de los milisegundos es una coma, no un punto. La flecha entre los dos tiempos tiene exactamente dos guiones y un signo de mayor que. Los números de índice deben ir en orden desde 1 sin espacios. Si se equivoca, algunos jugadores eliminarán silenciosamente la señal afectada, que es la razón más común por la que un SRT editado a mano “deja de funcionar” a la mitad.

La compatibilidad con SRT es amplia en reproductores de escritorio, editores y plataformas de alojamiento, pero no es universal. La descripción del formato de la Biblioteca del Congreso documenta la SRT como una secuencia simple de indicaciones de texto numeradas y cronometradas; cada destino aún decide qué formatos de subtítulos importa. El elemento HTML nativo <track> utiliza WebVTT para texto cronometrado, como se define en el estándar de vida WHATWG, que es una conversión rápida que se explica más adelante.

Crear un SRT a partir de un vídeo en el orden real

El flujo tiene tres etapas, y el orden es la parte que la gente va hacia atrás. Primero suelta el archivo y obtiene una vista previa antes de que exista una cuenta.

  1. Suelta tu vídeo para obtener una vista previa gratuita. Vaya a /video-to-text, o /MP4-to-text si su archivo es MP4, y suelte el vídeo en el área de carga. La pista de audio se extrae en su navegador utilizando una biblioteca de procesamiento local, luego los primeros 30 segundos regresan como una vista previa etiquetada por el hablante. No se necesita una cuenta para este paso y el vídeo en sí nunca sale de su dispositivo.
  2. Regístrese para transcribir el resto. Una vez que la vista previa se vea bien, cree una cuenta para ejecutar el archivo completo. Registrarse desbloquea 30 minutos gratis para probar. La forma más rápida de obtenerlos es validar una tarjeta con una retención de un dólar que se autoriza y luego se libera de inmediato, sin ningún cargo; Si prefieres utilizar otro método de pago disponible en tu país, los 30 minutos llegan con tu primera compra. No se requiere una tarjeta de ninguna manera. La transcripción se paga porque se ejecuta en IA de primer nivel, por lo que se paga por uso sin suscripción. Para ver un vídeo más largo que supere los minutos gratuitos, consulte la página de precios; pagas por minuto de audio, no por archivo.
  3. Obtén la transcripción y exporta SRT. Cuando la transcripción esté lista, ábrela en el editor, haz las correcciones necesarias, luego haz clic en exportar y elige SRT. Cada expresión hablada se convierte en una señal con su marca de tiempo de inicio y fin ya establecida. La descarga es un archivo simple .srt sin marca de agua.

Las etiquetas de los hablantes aparecen en el editor antes de exportar. Si desea nombres en los subtítulos, útiles para entrevistas, debates o paneles, cambie primero el nombre de “Hablante 1” y “Hablante 2” a los nombres reales; luego, la exportación escribe esos nombres al comienzo de las señales coincidentes.

Un ejemplo resuelto

Supongamos que tiene una entrevista grabada de 12 minutos,founder-chat.mp4, con dos personas. Lo sueltas en la página, la vista previa de 30 segundos confirma que ambas voces se captaron limpiamente y te registras. Cuando la transcripción completa esté lista, cambie el nombre de los dos hablantes a “Maya” y “Devin”, corrija el nombre de un producto mal escuchado y luego exporte como SRT. La apertura del archivo se ve así:

1
00:00:01,120 --> 00:00:04,460
Maya: Gracias por dedicar tiempo hoy.

2
00:00:04,800 --> 00:00:08,210
Devin: Por supuesto. Estaba esperando esto con ansias.

3
00:00:08,540 --> 00:00:12,900
Maya: Empecemos por el principio. ¿Cómo surgió la idea?

Vale la pena destacar dos cosas. Cada señal se corresponde con una expresión natural, por lo que el tiempo sigue la conversación en lugar de un reloj fijo. Y los espacios entre las señales, aquí de unos pocos cientos de milisegundos, reflejan las pausas reales entre los hablantes. Por lo general, eso es exactamente lo que desea, con una advertencia que se aborda a continuación.

Editar el tiempo y la longitud de la línea

La mayoría de las exportaciones se pueden utilizar tal como están, pero dos comprobaciones rápidas hacen que los subtítulos sean notablemente más fáciles de leer. Este breve pase es lo que separa los subtítulos generados automáticamente de los que parecen profesionales.

Longitud y número de líneas. Las guías de estilo varían y el formato SRT en sí no impone una longitud ni un recuento de líneas universales. Una señal larga aún puede convertirse en un muro de texto. Seguir la regla vigente del destino cuando la tenga; de lo contrario, mantenga cada señal compacta, divídala en un límite de frase natural y verifique el resultado en el tamaño del cuadro final.

Velocidad de lectura. La longitud en pantalla debe coincidir con la duración de la señal. Si una señal muestra mucho texto durante un tiempo muy corto, divídala en una pausa natural o vuelva a programarla sin cubrir el discurso posterior. Obtenga una vista previa de los subtítulos a velocidad de reproducción normal en lugar de juzgar el tiempo únicamente a partir del archivo de texto.

Intervalos de tiempo y superposición. Un intervalo inferior a aproximadamente 80 milisegundos entre dos pistas puede hacer que algunos jugadores mantengan la línea anterior demasiado tiempo o se salten la siguiente, así que deje un pequeño respiro entre las pistas consecutivas. El problema opuesto es la superposición: cuando dos personas hablan entre sí, el motor asigna a cada hablante una señal separada y esas señales pueden colisionar en el tiempo. Ninguna herramienta automática resuelve la superposición real a la perfección, por lo que para imágenes con muchos diálogos, busque marcas de tiempo superpuestas y mueva una señal antes o después manualmente.

Puede hacer todo esto en cualquier editor de texto sin formato, ya que el formato es legible por humanos. Si prefiere trabajar visualmente, un editor de subtítulos dedicado, como Subtitle Edit en Windows o Aegisub en cualquier plataforma, agrega una línea de tiempo de forma de onda y puede corregir automáticamente problemas comunes de espaciado y velocidad de lectura de forma masiva.

SRT vs VTT: cuál exportar

Los dos formatos son primos cercanos, y la elección correcta depende de dónde se reproducirán los subtítulos. Si desea una comparación completa antes de comprometerse, SRT vs VTT: qué formato de subtítulos usar desglosa las fortalezas de cada formato.

Utilice SRT para reproductores de escritorio, editores de video y la gran mayoría de plataformas de alojamiento, que es la mayor parte de lo que la gente necesita. Utilice WebVTT cuando los subtítulos vayan a una página web personalizada utilizando el elemento HTML5 <video>, porque ese es el único formato que los navegadores leen de forma nativa para el elemento <track>. El contenido es idéntico entre ellos. VTT simplemente agrega una línea WEBVTT en la parte superior del archivo y usa un punto en lugar de una coma antes de los milisegundos en cada marca de tiempo.

Debido a que la diferencia es tan pequeña, no es necesario volver a transcribir para cambiar. Exporte SRT y, si luego necesita VTT, ejecútelo a través del convertidor gratuito en /tools/SRT-to-VTT. Funciona en su navegador sin cuenta y no se carga nada.

Agregue el SRT a un reproductor, editor o plataforma

Una vez que tengas el archivo, adjuntarlo depende de dónde se encuentre el video.

Reproductores de escritorio. VLC, mpv y la mayoría de los reproductores de escritorio cargan automáticamente un SRT sidecar cuando comparte el nombre base y la carpeta del video. Cambie el nombre de su archivo para que interview.mp4 esté emparejado con interview.srt, colóquelos en el mismo directorio y los subtítulos aparecerán en la reproducción. Si un reproductor se lo pierde, su menú de subtítulos tiene una opción manual para “cargar archivo de subtítulos”.

Editores de video. En DaVinci Resolve, Premiere Pro o Final Cut, importe el SRT como una pista de subtítulos o subtítulos. El editor coloca cada señal en la línea de tiempo en el código de tiempo correcto y, desde allí, puede cambiar el estilo de la fuente, cambiar la posición y grabar los subtítulos en la exportación final si desea que estén codificados.

Plataformas de alojamiento y videos sociales. YouTube acepta SRT directamente en su flujo de trabajo de subtítulos. Otras plataformas pueden aceptar un archivo sidecar, requerir su editor de subtítulos integrado o esperar subtítulos grabados en el video. Mantenga el SRT revisado como su fuente de verdad, luego use el flujo de publicación actual del destino en lugar de asumir que un método de carga funciona en todas partes.

Grabar los subtítulos. Si necesita que el texto forme parte permanente de la imagen en lugar de un sidecar conmutable, ese es un paso de codificación separado. HandBrake puede grabar un SRT en un video de forma gratuita: cargue el video, agregue el SRT en la pestaña Subtítulos, marque “Grabado” y codifique. Utilice esto solo cuando el destino no pueda leer un archivo sidecar, ya que un SRT separado permanece editable mientras que un título grabado no. Para obtener un tutorial más completo sobre cómo adjuntar y grabar subtítulos en cada plataforma, consulte cómo agregar subtítulos a un vídeo.

Problemas comunes y cómo solucionarlos

Los subtítulos no están sincronizados desde el principio. Un desplazamiento constante, donde cada línea está adelantada o retrasada en la misma cantidad, generalmente significa que el reproductor está leyendo una velocidad de fotogramas ligeramente diferente a la que suponen los tiempos. La mayoría de los reproductores de escritorio tienen un control de retardo de subtítulos para cambiar toda la pista a la vez; empújalo hasta que aparezca la primera línea y el resto sigue.

La sincronización se aleja más con el tiempo. La desviación que crece a medida que se reproduce el video indica una discrepancia en la velocidad de fotogramas entre la fuente y la copia renderizada, algo común después de convertir un archivo de 23,976 fps a 25 fps o viceversa. Vuelva a exportar el SRT con la versión del video que realmente publicará, en lugar de un corte anterior.

Falta el nombre de un hablante en los subtítulos. Si cambió el nombre de las etiquetas pero una plataforma no muestra nombres, es probable que esa plataforma elimine los prefijos de los hablantes del SRT al importar. No existe ningún entorno de SRT que los obligue; la solución confiable es grabar los subtítulos, donde los nombres son parte de la imagen.

Un video que no estaba en inglés apareció en el idioma equivocado. Hushscript detecta el idioma hablado automáticamente en aproximadamente 99 idiomas, pero un clip muy corto o ruidoso en ocasiones puede ser mal interpretado. Vuelva a ejecutar una sección más limpia o consulte la página de idiomas para confirmar que el idioma está cubierto.

Los tramos largos se leen como una señal gigante. Esto sucede cuando alguien habla durante mucho tiempo sin una pausa clara. Divide la señal manualmente en el límite de una oración para que ningún bloque contenga más de dos líneas de texto legible.

Consejos de precisión que dan resultados en menos ediciones

La mayor parte de la calidad de tus subtítulos se establece antes de abrir el editor, mediante el audio que ingresas. El audio de origen limpio significa menos palabras mal escuchadas y marcas de tiempo más ajustadas, lo que significa un paso de edición más corto.

Grabe o exporte el audio a un nivel de conversación normal sin una gran compresión y, siempre que pueda, evite la música de fondo alta durante el diálogo. Cuando participan varias personas, una grabación en la que cada voz sea razonablemente distinta ayuda a que las etiquetas de los hablantes se mantengan consistentes, lo cual es importante si planeas mantener los nombres en los subtítulos. Si la fuente es un video que ya has publicado, el audio es lo que sea, pero para cualquier cosa que grabes tú mismo, unos minutos de atención a los niveles y la ubicación del micrófono hacen más por la calidad de los subtítulos que cualquier cantidad de edición posterior.

Después del SRT: el resto de la transcripción

La creación del SRT también te brinda la transcripción completa, por lo que no estás limitado a los subtítulos. Desde la misma sesión puedes exportar el texto como TXT o DOCX para notas del episodio, una versión de blog de la charla o una transcripción accesible publicada junto al video. Exportar una transcripción limpia es el mismo producto que subtitular un video a texto; el SRT es solo uno de los formatos que surgen de él.

Para el siguiente paso, poner estos subtítulos en el video y elegir entre un archivo sidecar y una pista grabada, consulte cómo agregar subtítulos a un video.

Fuentes y normas independientes

Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.

Fuentes revisadas:

Preguntas frecuentes

¿Qué es un archivo SRT?

Un SRT (texto SubRip) El archivo es un archivo de texto sin formato que combina pistas numeradas con tiempo y texto. Cada bloque tiene un índice, una marca de tiempo de inicio y fin escrita como HH:MM:SS,mmm y texto de subtítulo. La compatibilidad es amplia, pero verifique los formatos de subtítulos aceptados por el destino antes de publicarlos.

¿Cómo creo un archivo SRT a partir de un video?

Transcriba el audio del video y luego exporte la transcripción como SRT. En Hushscript, sueltas el vídeo para obtener una vista previa gratuita de 30 segundos, te registras para transcribir el resto y luego eliges SRT al exportar. Cada línea hablada se convierte en una señal con su hora de inicio y finalización ya completadas, por lo que nunca debes escribir una marca de tiempo a mano.

¿Cuál es la longitud de línea ideal y la velocidad de lectura para los subtítulos?

No existe un número universal porque las guías de destino difieren. Mantenga las señales compactas, divida las líneas en los límites naturales de las frases y pruébelas con el tamaño de cuadro y la velocidad de reproducción finales. Siga las especificaciones actuales del destino cuando proporcione una.

¿Mi archivo de vídeo se sube a un servidor?

No. Hushscript extrae el audio del vídeo en su navegador antes de enviar cualquier cosa, por lo que el vídeo permanece en su dispositivo y sólo el archivo de audio más pequeño llega al servidor. El audio se elimina una vez que la transcripción está lista.

¿Puedo incluir los nombres de los hablantes en el SRT?

Sí. Cambie el nombre de cada etiqueta de hablante en el editor de transcripciones antes de exportar, y esos nombres aparecerán al comienzo de las pistas relevantes. Tenga en cuenta que algunas plataformas eliminan los prefijos de los hablantes de SRT al importar, por lo que si los nombres deben permanecer visibles, considere grabar los subtítulos en el video.

¿Cuál es la diferencia entre SRT y VTT?

Ambos contienen texto cronometrado. WebVTT agrega una línea de encabezado WebVTT, utiliza un punto en lugar de una coma en las marcas de tiempo y admite configuraciones de señales web. Utilice VTT para pistas HTML5 nativas; utilice SRT cuando el destino lo acepte explícitamente. Puedes convertir sin volver a transcribir.

¿Qué tan grande puedo subtitular un video?

Hasta 10 horas de duración, sin límite de tamaño de archivo; incluso un video muy grande se convierte en el lado del cliente, sujeto a la capacidad del navegador y del dispositivo. Debido a que el audio se extrae antes de subirlo, un video grande envía muchos menos datos que su tamaño de archivo completo.

¿Qué tan precisas son las marcas de tiempo?

Cada señal se genera a partir de los tiempos del motor de voz, pero no se garantiza ningún desplazamiento fijo. Revise el video final, especialmente los diálogos rápidos, la música y los hablantes superpuestos, y ajuste cualquier señal que aparezca temprano o tarde.

Comienza con 30 minutos gratis

Comenzar – 30 minutos gratis