Aller au contenu principal

Comment créer des sous-titres SRT à partir d'une vidéo

Auteur : Publié le : Dernière révision :

Un fichier SRT est la manière dont les sous-titres voyagent séparément d’une vidéo, sous la forme d’un petit fichier texte side-car que le lecteur lit à côté de l’image. Vous en créez un en transcrivant l’audio et en exportant le résultat avec des horodatages. Le travail qui prenait auparavant un après-midi, consistant à synchroniser chaque ligne sur le cadre, est désormais terminé pour vous ; ce qui reste est une courte passe d’édition pour plus de lisibilité. Ce guide explique ce que contient réellement le format, comment créer un SRT à partir d’une vidéo dans l’ordre réel et comment le nettoyer pour que les sous-titres soient bien lisibles.

Ce dont vous avez besoin avant de commencer

Vous avez besoin du fichier vidéo et de quelques minutes. N’importe quel conteneur courant fonctionne : MP4, MOV, MKV, WebM, AVI et le reste. Vous n’avez pas besoin de logiciel de montage pour créer le SRT et vous n’avez pas besoin de convertir la vidéo au préalable. Un éditeur de sous-titres est facultatif et n’est utile que plus tard, si vous souhaitez afficher la chronologie pendant que vous ajustez le timing.

Pour la transcription elle-même, vous vous inscrivez, ce qui débloque 30 minutes gratuites pour essayer. L’aperçu de 30 secondes qui s’affiche en premier ne nécessite aucun compte, vous pouvez donc voir la qualité avant de vous engager dans quoi que ce soit.

Qu’est-ce qu’un fichier SRT

SRT signifie SubRip Text. Le format est volontairement simple : une séquence de blocs numérotés, chacun constitué de trois parties empilées sur des lignes distinctes. D’abord un numéro d’index, puis un start --> end horodatage, puis une ou deux lignes de texte de sous-titre. Une ligne vide sépare un bloc du suivant.

1
00:00:02,340 --> 00:00:05,810
L'audio est extrait dans votre navigateur.

2
00:00:06,100 --> 00:00:09,440
Seul l'audio atteint le serveur, pas la vidéo.

Quelques détails comptent lorsque vous lisez ou modifiez manuellement un fichier. Le format d’horodatage est HH:MM:SS,mmm, des heures aux millisecondes, et le séparateur avant les millisecondes est une virgule, pas un point. La flèche entre les deux heures est constituée exactement de deux traits d’union et d’un signe supérieur à. Les numéros d’index doivent fonctionner dans l’ordre de 1 sans espaces. Si vous vous trompez, certains joueurs abandonneront silencieusement le signal concerné, ce qui est la raison la plus courante pour laquelle un SRT édité manuellement “cesse de fonctionner” en cours de route.

La prise en charge de SRT est large parmi les lecteurs de bureau, les éditeurs et les plates-formes d’hébergement, mais elle n’est pas universelle. La description du format de la Bibliothèque du Congrès documente le SRT comme une simple séquence d’indices textuels numérotés et chronométrés ; chaque destination décide toujours des formats de sous-titres qu’elle importe. L’élément HTML natif <track> utilise WebVTT pour le texte chronométré, tel que défini dans le WHATWG Living Standard, qui est une conversion rapide abordée plus loin.

Créer un SRT à partir d’une vidéo dans l’ordre réel

Le flux a trois étapes, et l’ordre est la partie que les gens reculent. Déposez d’abord le fichier et prévisualisez-le avant qu’un compte n’existe.

  1. Déposez votre vidéo pour obtenir un aperçu gratuit. Accédez à /video-to-text ou /MP4-to-text si votre fichier est un MP4 et déposez la vidéo dans la zone de téléchargement. La piste audio est extraite dans votre navigateur à l’aide d’une bibliothèque de traitement locale, puis les 30 premières secondes reviennent sous forme d’aperçu étiqueté par le locuteur. Aucun compte n’est nécessaire pour cette étape, et la vidéo elle-même ne quitte jamais votre appareil.
  2. Inscrivez-vous pour transcrire le reste. Une fois l’aperçu correct, créez un compte pour exécuter le fichier complet. L’inscription débloque 30 minutes gratuites pour essayer. Le moyen le plus rapide de les obtenir est de valider une carte avec une retenue d’un dollar qui est autorisée puis libérée immédiatement, jamais facturée ; si vous préférez utiliser un autre mode de paiement disponible dans votre pays, les 30 minutes arrivent avec votre premier achat. De toute façon, aucune carte n’est requise. La transcription est payante car elle fonctionne sur une IA de premier plan, elle est donc payante à l’utilisation et sans abonnement. Pour une vidéo plus longue dépassant les minutes gratuites, consultez la page de tarification ; vous payez par minute d’audio, pas par fichier.
  3. Obtenez la transcription et exportez SRT. Lorsque la transcription est prête, ouvrez-la dans l’éditeur, apportez les corrections nécessaires, puis cliquez sur Exporter et choisissez SRT. Chaque énoncé prononcé devient un signal avec son horodatage de début et de fin déjà en place. Le téléchargement est un simple fichier .srt sans filigrane.

Les étiquettes des locuteurs apparaissent dans l’éditeur avant l’exportation. Si vous souhaitez des noms dans les légendes, utiles pour des interviews, des débats ou des panels, renommez d’abord « Locuteur 1 » et « Locuteur 2 » par leurs vrais noms ; l’export écrit ensuite ces noms au début des signaux correspondants.

Un exemple concret

Disons que vous avez une interview enregistrée de 12 minutes,founder-chat.mp4, avec deux personnes. Vous le déposez sur la page, l’aperçu de 30 secondes confirme que les deux voix sont captées proprement et vous vous inscrivez. Lorsque la transcription complète est prête, vous renommez les deux intervenants en « Maya » et « Devin », corrigez un nom de produit mal entendu, puis exportez au format SRT. L’ouverture du fichier ressemble à ceci :

1
00:00:01,120 --> 00:00:04,460
Maya : Merci d'avoir pris le temps aujourd'hui.

2
00:00:04,800 --> 00:00:08,210
Devin : Bien sûr. J'attendais cela avec impatience.

3
00:00:08,540 --> 00:00:12,900
Maya : Commençons par le début. Comment est née l’idée ?

Deux choses méritent d’être notées. Chaque signal correspond à un énoncé naturel, de sorte que le timing suit la conversation plutôt qu’une horloge fixe. Et les écarts entre les signaux, ici de quelques centaines de millisecondes, reflètent les véritables pauses entre les intervenants. C’est généralement exactement ce que vous souhaitez, avec une mise en garde suivante.

Modifier le timing et la longueur de ligne

La plupart des exportations sont utilisables telles quelles, mais deux vérifications rapides rendent les légendes sensiblement plus faciles à lire. Ce passage court est ce qui sépare les sous-titres générés automatiquement de ceux qui semblent professionnels.

Longueur et nombre de lignes. Les guides de style varient et le format SRT lui-même n’impose pas de longueur ou de nombre de lignes universel. Une longue réplique peut toujours devenir un mur de texte. Suivez la règle actuelle de la destination lorsqu’elle en a une ; sinon, gardez chaque réplique compacte, divisée selon une limite naturelle de phrase et vérifiez le résultat sur la taille de l’image finale.

Vitesse de lecture. La longueur à l’écran doit correspondre à la durée d’affichage de la réplique. Si un signal montre beaucoup de texte pendant une très courte période, divisez-le selon une pause naturelle ou resynchronisez-le sans couvrir le discours ultérieur. Prévisualisez les sous-titres à une vitesse de lecture normale au lieu de juger le timing à partir du seul fichier texte.

Écarts de synchronisation et chevauchement. Un intervalle inférieur à environ 80 millisecondes entre deux signaux peut amener certains joueurs à maintenir la ligne précédente trop longtemps ou à sauter la suivante, alors laissez un petit souffle entre les signaux consécutifs. Le problème inverse est celui du chevauchement : lorsque deux personnes se parlent, le moteur attribue à chaque locuteur un signal distinct, et ces signaux peuvent entrer en collision dans le temps. Aucun outil automatique ne résout parfaitement le véritable chevauchement, donc pour les séquences riches en dialogues, recherchez les horodatages qui se chevauchent et déplacez manuellement un signal plus tôt ou plus tard.

Vous pouvez faire tout cela dans n’importe quel éditeur de texte brut, car le format est lisible par l’homme. Si vous préférez travailler visuellement, un éditeur de sous-titres dédié tel que Subtitle Edit sous Windows ou Aegisub sur n’importe quelle plate-forme ajoute une chronologie de forme d’onde et peut résoudre automatiquement et en masse les problèmes courants d’espacement et de vitesse de lecture.

SRT vs VTT : lequel exporter

Les deux formats sont proches cousins, et le bon choix dépend de l’endroit où les sous-titres seront lus. Si vous souhaitez une comparaison complète avant de vous engager, SRT vs VTT : quel format de sous-titres utiliser détaille les atouts de chaque format.

Recherchez SRT pour les lecteurs de bureau, les éditeurs vidéo et la grande majorité des plateformes d’hébergement, ce qui correspond à la plupart de ce dont les gens ont besoin. Accédez à WebVTT lorsque les sous-titres sont affichés sur une page Web personnalisée à l’aide de l’élément HTML5 <video>, car c’est le seul format que les navigateurs lisent de manière native pour l’élément <track>. Le contenu est identique entre eux. VTT ajoute simplement une ligne WEBVTT en haut du fichier et utilise un point au lieu d’une virgule avant les millisecondes dans chaque horodatage.

La différence étant si petite, vous n’avez pas besoin de retranscrire pour changer. Exportez SRT, et si vous avez besoin de VTT plus tard, exécutez-le via le convertisseur gratuit à l’adresse /tools/SRT-to-VTT. Il fonctionne dans votre navigateur sans compte et rien n’est téléchargé.

Ajoutez le SRT à un lecteur, un éditeur ou une plateforme

Une fois que vous avez le fichier, le joindre dépend de l’endroit où se trouve la vidéo.

Lecteurs de bureau. VLC, mpv et la plupart des lecteurs de bureau chargent automatiquement un SRT side-car lorsqu’il partage le nom de base et le dossier de la vidéo. Renommez votre fichier pour que interview.mp4 soit associé à interview.srt, déposez-les dans le même répertoire et les légendes apparaissent à la lecture. Si un lecteur le manque, son menu de sous-titres dispose d’une option manuelle « charger le fichier de sous-titres ».

Éditeurs vidéo. Dans DaVinci Resolve, Premiere Pro ou Final Cut, importez le SRT en tant que piste de sous-titres ou de sous-titres. L’éditeur dépose chaque séquence sur la timeline au bon timecode, et à partir de là, vous pouvez restyler la police, modifier la position et graver les sous-titres dans l’exportation finale si vous souhaitez qu’ils soient codés en dur.

Plateformes d’hébergement et vidéos sociales. YouTube accepte directement le SRT dans son flux de sous-titres. D’autres plates-formes peuvent accepter un fichier side-car, exiger leur éditeur de sous-titres intégré ou s’attendre à ce que des sous-titres soient gravés dans la vidéo. Conservez le SRT révisé comme source de vérité, puis utilisez le flux de publication actuel de la destination plutôt que de supposer qu’une méthode de téléchargement fonctionne partout.

Graver les légendes. Si vous avez besoin que le texte fasse partie intégrante de l’image en permanence plutôt qu’un side-car basculable, il s’agit d’une étape d’encodage distincte. HandBrake peut graver gratuitement un SRT dans une vidéo : chargez la vidéo, ajoutez le SRT sous l’onglet Sous-titres, cochez “Gravé” et encodez. N’utilisez cette option que lorsque la destination ne peut pas lire un fichier side-car, car un SRT distinct reste modifiable, contrairement à une légende gravée. Pour une présentation plus complète de la manière de joindre et de graver des sous-titres sur chaque plate-forme, consultez comment ajouter des sous-titres à une vidéo.

Problèmes courants et comment les résoudre

Les sous-titres sont désynchronisés dès le début. Un décalage constant, où chaque ligne est en avance ou en retard du même montant, signifie généralement le joueur lit une fréquence d’images légèrement différente de celle supposée par les timings. La plupart des lecteurs de bureau disposent d’un contrôle de retard des sous-titres pour décaler toute la piste en même temps ; poussez-le jusqu’à ce que la première ligne atterrisse, et le reste suit.

La synchronisation s’éloigne davantage au fil du temps. La dérive qui augmente à mesure que la vidéo est lue indique une inadéquation de fréquence d’images entre la source et la copie rendue, courante après la conversion d’un fichier à 23,976 ips en 25 ips ou inversement. Réexportez le SRT avec la version de la vidéo que vous allez réellement publier, plutôt qu’avec une coupe antérieure.

Le nom d’un locuteur est absent des sous-titres. Si vous avez renommé les étiquettes mais qu’une plate-forme n’affiche aucun nom, cette plate-forme supprime probablement les préfixes des locuteurs du SRT lors de l’importation. Il n’existe aucun paramètre SRT qui les force ; la solution fiable consiste à graver les sous-titres, là où les noms font partie de l’image.

Une vidéo non anglaise est revenue dans la mauvaise langue. Hushscript détecte automatiquement la langue parlée dans environ 99 langues, mais un clip très court ou bruyant peut parfois être mal lu. Réexécutez une section plus claire ou consultez la page des langues pour confirmer que la langue est couverte.

De longues séquences se lisent comme un signal géant. Cela se produit lorsque quelqu’un parle pendant un long moment sans pause claire. Divisez la réplique manuellement au niveau d’une limite de phrase afin qu’aucun bloc ne contienne plus de deux lignes de texte lisible.

Des conseils de précision qui s’avèrent rentables en moins de modifications

La majeure partie de la qualité de vos sous-titres est définie avant même d’ouvrir l’éditeur, par l’audio que vous introduisez. Un son source propre signifie moins de mots mal entendus et des horodatages plus serrés, ce qui signifie une passe d’édition plus courte.

Enregistrez ou exportez l’audio à un niveau de parole normal sans compression importante, et évitez la musique de fond forte pendant les dialogues lorsque vous le pouvez. Lorsque plusieurs personnes sont impliquées, un enregistrement dans lequel chaque voix est raisonnablement distincte permet aux étiquettes des locuteurs de rester cohérentes, ce qui est important si vous envisagez de conserver les noms dans les sous-titres. Si la source est une vidéo que vous avez déjà publiée, l’audio est quel qu’il soit, mais pour tout ce que vous enregistrez vous-même, quelques minutes d’attention aux niveaux et au placement du microphone font plus pour la qualité des sous-titres que n’importe quelle quantité de montage par la suite.

Après le SRT : le reste de la transcription

La création du SRT vous donne également la transcription complète, vous n’êtes donc pas limité aux sous-titres. À partir de la même session, vous pouvez exporter le texte au format TXT ou DOCX pour les notes de l’épisode, une version blog de la conférence ou une transcription accessible publiée à côté de la vidéo. L’exportation d’une transcription propre revient au même produit que le sous-titrage d’une vidéo en texte ; le SRT n’est qu’un des formats qui en résultent.

Pour l’étape suivante, mettre ces sous-titres sur la vidéo et choisir entre un fichier side-car et une piste gravée, consultez comment ajouter des sous-titres à une vidéo.

Sources et normes indépendantes

Hushscript a consulté ces références indépendantes et non concurrentes. Elles présentent des recherches, des normes ou le fonctionnement de plateformes et ne constituent pas une recommandation de Hushscript.

Sources vérifiées le :

Questions fréquentes

Qu'est-ce qu'un fichier SRT ?

Un SRT (SubRip Text) est un fichier texte brut qui associe des repères numérotés avec le timing et le texte. Chaque bloc a un index, un horodatage de début et de fin écrit sous la forme HH:MM:SS,mmm et un texte de sous-titre. La prise en charge est large, mais vérifiez les formats de sous-titres acceptés par la destination avant de publier.

Comment créer un fichier SRT à partir d'une vidéo ?

Transcrivez l'audio de la vidéo, puis exportez la transcription au format SRT. Dans Hushscript, vous déposez la vidéo pour obtenir un aperçu gratuit de 30 secondes, vous inscrivez pour transcrire le reste, puis choisissez SRT lors de l'exportation. Chaque ligne prononcée devient un signal avec son heure de début et de fin déjà renseignée, vous ne saisissez donc jamais d'horodatage à la main.

Quelle est la longueur de ligne et la vitesse de lecture idéales pour les sous-titres ?

Il n'y a pas de numéro universel car les guides de destination diffèrent. Gardez les signaux compacts, coupez les lignes aux limites naturelles des phrases et testez-les à la taille d'image et à la vitesse de lecture finales. Suivez les spécifications actuelles de la destination lorsqu'elle en fournit une.

Mon fichier vidéo est-il téléchargé sur un serveur ?

Non. Hushscript extrait l'audio de la vidéo dans votre navigateur avant que quoi que ce soit ne soit envoyé, de sorte que la vidéo elle-même reste sur votre appareil et que seul le fichier audio le plus petit atteint le serveur. L'audio est supprimé une fois la transcription prête.

Puis-je inclure les noms des intervenants dans le SRT ?

Oui. Renommez chaque étiquette de locuteur dans l'éditeur de transcription avant d'exporter, et ces noms apparaissent au début des répliques pertinentes. Notez que certaines plates-formes suppriment les préfixes de locuteur de SRT lors de l'importation, donc si les noms doivent rester visibles, envisagez plutôt de graver les sous-titres dans la vidéo.

Quelle est la différence entre SRT et VTT ?

Ils contiennent tous deux du texte chronométré. WebVTT ajoute une ligne d'en-tête WebVTT, utilise un point au lieu d'une virgule dans les horodatages et prend en charge les paramètres de repère Web. Utilisez VTT pour les pistes HTML5 natives ; utilisez SRT lorsque la destination l'accepte explicitement. Vous pouvez convertir sans retranscrire.

Quelle taille de vidéo puis-je sous-titrer ?

Jusqu'à 10 heures, sans limite de taille de fichier : même une vidéo très volumineuse est convertie côté client, en fonction de la capacité du navigateur et de l'appareil. Étant donné que l'audio est extrait avant le téléchargement, une vidéo volumineuse envoie beaucoup moins de données que la taille totale de son fichier.

Quelle est la précision des horodatages ?

Chaque signal est généré à partir des timings du moteur vocal, mais aucun décalage fixe n'est garanti. Examinez la vidéo finale, en particulier les dialogues rapides, la musique et les locuteurs qui se chevauchent, et ajustez tout signal qui apparaît tôt ou tard.

Commencer avec 30 minutes gratuites

Commencer – 30 minutes gratuites