So erstellen Sie SRT-Untertitel aus einem Video
Autor: Hushscript Veröffentlicht: Zuletzt geprüft:
Mit einer SRT-Datei werden Untertitel getrennt von einem Video übertragen, als kleine Sidecar-Textdatei, die der Player neben dem Bild liest. Sie erstellen eine, indem Sie das Audio transkribieren und das Ergebnis mit Zeitstempeln exportieren. Die Arbeit, die früher einen Nachmittag dauerte, um jede Linie auf den Rahmen abzustimmen, ist jetzt für Sie erledigt; Was übrig bleibt, ist ein kurzer Bearbeitungsdurchgang zur besseren Lesbarkeit. In dieser Anleitung wird erklärt, was das Format tatsächlich enthält, wie man aus einem Video in der tatsächlichen Reihenfolge ein SRT erstellt und wie man es bereinigt, damit die Untertitel gut lesbar sind.
Was Sie vor dem Start benötigen
Sie benötigen die Videodatei und ein paar Minuten. Jeder gängige Container funktioniert: MP4, MOV, MKV, WebM, AVI und der Rest. Sie benötigen keine Bearbeitungssoftware, um das SRT zu erstellen, und Sie müssen das Video nicht zuerst konvertieren. Ein Untertitel-Editor ist optional und nur später nützlich, wenn Sie während der Feinabstimmung des Timings eine Zeitleistenansicht wünschen.
Für die Transkription selbst melden Sie sich an, wodurch 30 kostenlose Minuten zum Ausprobieren freigeschaltet werden. Für die 30-Sekunden-Vorschau, die zuerst gerendert wird, ist kein Konto erforderlich, sodass Sie die Qualität sehen können, bevor Sie etwas unternehmen.
Was eine SRT-Datei ist
SRT steht für SubRip Text. Das Format ist bewusst einfach: eine Folge nummerierter Blöcke, die jeweils aus drei Teilen bestehen, die auf separaten Zeilen gestapelt sind. Zuerst eine Indexnummer, dann ein start --> end Zeitstempel, dann eine oder zwei Zeilen Untertiteltext. Eine Leerzeile trennt einen Block vom nächsten.
1
00:00:02,340 --> 00:00:05,810
Das Audio wird in Ihrem Browser extrahiert.
2
00:00:06,100 --> 00:00:09,440
Nur das Audio erreicht den Server, nicht das Video.
Einige Details sind wichtig, wenn Sie eine Datei lesen oder manuell bearbeiten. Das Zeitstempelformat ist „HH:MM:SS,mmm“, Stunden bis Millisekunden, und das Trennzeichen vor den Millisekunden ist ein Komma und kein Punkt. Der Pfeil zwischen den beiden Zeiten besteht aus genau zwei Bindestrichen und einem Größer-als-Zeichen. Die Indexnummern sollten in der Reihenfolge von 1 ohne Lücken laufen. Wenn Sie etwas falsch machen, lassen einige Spieler den betroffenen Cue stillschweigend fallen, was der häufigste Grund dafür ist, dass ein handbearbeitetes SRT mittendrin „nicht mehr funktioniert“.
Die SRT-Unterstützung ist bei Desktop-Playern, Editoren und Hosting-Plattformen umfassend, aber nicht universell. Die Formatbeschreibung der Library of Congress dokumentiert SRT als eine einfache Folge nummerierter, zeitlich festgelegter Texthinweise; Jedes Ziel entscheidet weiterhin, welche Untertitelformate es importiert. Das native HTML-Element „<track>“ verwendet WebVTT für zeitgesteuerten Text, wie im WHATWG-Lebensstandard definiert. Dies ist eine schnelle Konvertierung, die weiter unten behandelt wird.
Erstellen Sie ein SRT aus einem Video in der tatsächlichen Reihenfolge.
Der Ablauf hat Drei Stufen, und die Reihenfolge ist der Teil, den die Leute rückwärts bekommen. Sie legen die Datei zuerst ab und sehen sich eine Vorschau an, bevor ein Konto vorhanden ist.
- Legen Sie Ihr Video ab, um eine kostenlose Vorschau zu erhalten. Gehen Sie zu /video-to-text oder /MP4-to-text, wenn es sich bei Ihrer Datei um eine MP4-Datei handelt, und legen Sie das Video im Upload-Bereich ab. Die Audiospur wird mithilfe einer lokalen Verarbeitungsbibliothek in Ihrem Browser extrahiert. Anschließend werden die ersten 30 Sekunden als mit dem Sprecher gekennzeichnete Vorschau angezeigt. Für diesen Schritt ist kein Konto erforderlich und das Video selbst verlässt nie Ihr Gerät.
- Melden Sie sich an, um den Rest zu transkribieren. Sobald die Vorschau richtig aussieht, erstellen Sie ein Konto, um die vollständige Datei auszuführen. Durch die Anmeldung werden 30 kostenlose Minuten zum Ausprobieren freigeschaltet. Der schnellste Weg, sie zu erhalten, besteht darin, eine Karte mit einem Betrag von einem Dollar zu validieren, der autorisiert und dann sofort freigegeben wird, ohne dass eine Belastung erfolgt. Wenn Sie lieber eine andere in Ihrem Land verfügbare Zahlungsmethode verwenden möchten, gelten die 30 Minuten stattdessen bei Ihrem ersten Einkauf. Eine Karte ist in beiden Fällen nicht erforderlich. Die Transkription ist kostenpflichtig, da sie auf erstklassiger KI läuft, also nutzungsabhängig und ohne Abonnement. Ein längeres Video, das die Freiminuten überschreitet, finden Sie auf der Preisseite; Sie zahlen pro Minute Audio, nicht pro Datei.
- Holen Sie sich das Transkript und exportieren Sie SRT. Wenn das Transkript fertig ist, öffnen Sie es im Editor, nehmen Sie etwaige Korrekturen vor, klicken Sie dann auf „Exportieren“ und wählen Sie „SRT“. Jede gesprochene Äußerung wird zu einem Cue, dessen Start- und Endzeitstempel bereits vorhanden sind. Der Download ist eine einfache
.srt-Datei ohne Wasserzeichen.
Sprecherlabels werden vor dem Export im Editor angezeigt. Wenn Sie Namen in den Bildunterschriften haben möchten, die für Interviews, Debatten oder Podiumsdiskussionen nützlich sind, benennen Sie „Sprecher 1“ und „Sprecher 2“ zuerst in die richtigen Namen um. Der Export schreibt diese Namen dann an den Anfang der passenden Cues.
Ein ausgearbeitetes Beispiel
Angenommen, Sie haben mit founder-chat.mp4 ein 12-minütiges Interview mit zwei Personen aufgezeichnet. Sie legen es auf der Seite ab; die 30-Sekunden-Vorschau bestätigt, dass beide Stimmen klar erfasst werden, und Sie melden sich an. Sobald das vollständige Transkript fertig ist, benennen Sie die Sprecher in „Maya“ und „Devin“ um, korrigieren einen falsch erkannten Produktnamen und exportieren das Ergebnis als SRT. Der Dateianfang sieht so aus:
1
00:00:01,120 --> 00:00:04,460
Maya: Danke, dass Sie sich heute die Zeit genommen haben.
2
00:00:04,800 --> 00:00:08,210
Devin: Natürlich. Ich habe mich darauf gefreut.
3
00:00:08,540 --> 00:00:12,900
Maya: Fangen wir am Anfang an. Wie ist die Idee entstanden?
Zwei Dinge sind erwähnenswert. Jeder Hinweis ist einer natürlichen Äußerung zugeordnet, sodass sich das Timing an der Konversation und nicht an einer festen Uhr orientiert. Und die Lücken zwischen den Hinweisen, hier einige hundert Millisekunden, spiegeln die tatsächlichen Pausen zwischen den Sprechern wider. Das ist normalerweise genau das, was Sie wollen, mit einer Einschränkung, die als nächstes behandelt wird.
Timing und Zeilenlänge bearbeiten
Die meisten Exporte können unverändert verwendet werden, aber zwei schnelle Überprüfungen machen die Beschriftungen deutlich lesbarer. Dieser kurze Schritt unterscheidet automatisch generierte Untertitel von solchen, die sich professionell anfühlen.
Zeilenlänge und Anzahl der Zeilen. Die Stilrichtlinien variieren und das SRT-Format selbst erzwingt keine universelle Zeilenlänge oder Zeilenanzahl. Ein langer Hinweis kann immer noch zu einer Textwand werden. Befolgen Sie die aktuelle Regel des Ziels, wenn es eine gibt. Halten Sie andernfalls jeden Hinweis kompakt, teilen Sie ihn an einer natürlichen Phrasengrenze auf und überprüfen Sie das Ergebnis anhand der endgültigen Bildgröße.
Lesegeschwindigkeit. Die Länge auf dem Bildschirm muss mit der angezeigten Länge des Hinweises übereinstimmen. Wenn in einem Hinweis für eine sehr kurze Zeit viel Text angezeigt wird, teilen Sie ihn in einer natürlichen Pause auf oder ändern Sie den Zeitpunkt, ohne die spätere Sprache zu verdecken. Zeigen Sie eine Vorschau der Untertitel mit normaler Wiedergabegeschwindigkeit an, anstatt das Timing allein anhand der Textdatei zu beurteilen.
Timing-Lücken und Überlappungen. Eine Lücke von weniger als etwa 80 Millisekunden zwischen zwei Cues kann dazu führen, dass einige Spieler die vorherige Zeile zu lange halten oder die nächste überspringen. Lassen Sie daher zwischen aufeinanderfolgenden Cues einen kleinen Atemzug. Das gegenteilige Problem sind Überschneidungen: Wenn zwei Personen übereinander reden, weist die Engine jedem Sprecher einen separaten Hinweis zu, und diese Hinweise können zeitlich kollidieren. Kein automatisches Tool löst echte Überlappungen perfekt auf. Suchen Sie daher bei Filmmaterial mit vielen Dialogen nach überlappenden Zeitstempeln und verschieben Sie manuell einen Hinweis nach vorne oder nach hinten.
Sie können dies alles in jedem einfachen Texteditor tun, da das Format für Menschen lesbar ist. Wenn Sie lieber visuell arbeiten möchten, fügt ein spezieller Untertiteleditor wie Subtitle Edit unter Windows oder Aegisub auf einer beliebigen Plattform eine Wellenform-Timeline hinzu und kann häufig auftretende Probleme mit Abständen und Lesegeschwindigkeit in großen Mengen automatisch beheben.
SRT vs. VTT: Welches soll exportiert werden
Die beiden Formate sind eng miteinander verwandt, und die richtige Wahl hängt davon ab, wo die Untertitel abgespielt werden. Wenn Sie einen vollständigen Vergleich wünschen, bevor Sie sich verpflichten, werden in SRT vs. VTT: Welches Untertitelformat verwendet werden die Stärken der einzelnen Formate aufgeschlüsselt.
Für Desktop-Player, Video-Editoren und die meisten Hosting-Plattformen ist SRT die richtige Wahl. Verwenden Sie WebVTT, wenn die Untertitel auf einer eigenen Webseite im HTML5-Element <video> erscheinen, denn Browser lesen für das Element <track> nur dieses Format nativ. Der Inhalt ist in beiden Formaten identisch. VTT fügt lediglich die Zeile WEBVTT am Dateianfang hinzu und verwendet in jedem Zeitstempel vor den Millisekunden einen Punkt statt eines Kommas.
Da der Unterschied so gering ist, müssen Sie zum Wechseln nicht erneut transkribieren. Exportieren Sie SRT, und wenn Sie später VTT benötigen, führen Sie es über den kostenlosen Konverter unter /tools/SRT-to-VTT aus. Es funktioniert in Ihrem Browser ohne Konto und es wird nichts hochgeladen.
Fügen Sie den SRT zu einem Player, Editor oder einer Plattform hinzu
Sobald Sie die Datei haben, hängt das Anhängen davon ab, wo sich das Video befindet.
Desktop-Player. VLC, mpv und die meisten Desktop-Player laden eine separate SRT-Datei automatisch, wenn sie denselben Basisnamen hat und im selben Ordner liegt wie das Video. Benennen Sie die Dateien so, dass interview.mp4 mit interview.srt zusammenpasst, und legen Sie beide in dasselbe Verzeichnis. Falls ein Player die Datei nicht automatisch erkennt, können Sie sie über die Option „Untertiteldatei laden“ manuell auswählen.
Videoeditoren. Importieren Sie die SRT in DaVinci Resolve, Premiere Pro oder Final Cut als Untertitel- oder Untertitelspur. Der Editor legt jeden Hinweis mit dem richtigen Timecode auf der Timeline ab, und von dort aus können Sie die Schriftart neu gestalten, die Position ändern und die Untertitel in den endgültigen Export einbrennen, wenn Sie sie fest codieren möchten.
Hosting-Plattformen und soziale Videos. YouTube akzeptiert SRT direkt in seinem Untertitel-Workflow. Andere Plattformen akzeptieren möglicherweise eine Sidecar-Datei, erfordern ihren integrierten Untertiteleditor oder erwarten, dass Untertitel in das Video eingebrannt werden. Behalten Sie die überprüfte SRT als Quelle der Wahrheit bei und verwenden Sie dann den aktuellen Veröffentlichungsablauf des Ziels, anstatt davon auszugehen, dass eine Upload-Methode überall funktioniert.
Einbrennen der Untertitel. Wenn Sie den Text dauerhaft als Teil des Bildes und nicht als umschaltbaren Sidecar benötigen, ist das ein separater Codierungsschritt. HandBrake kann eine SRT kostenlos in ein Video brennen: Laden Sie das Video, fügen Sie die SRT unter der Registerkarte „Untertitel“ hinzu, kreuzen Sie „Eingebrannt“ an und kodieren Sie. Greifen Sie dazu nur zu, wenn das Ziel eine Sidecar-Datei nicht lesen kann, da eine separate SRT bearbeitbar bleibt, eine eingebrannte Beschriftung jedoch nicht. Eine ausführlichere Anleitung zum Anhängen und Einbrennen von Untertiteln auf jeder Plattform finden Sie unter Hinzufügen von Untertiteln zu einem Video.
Häufige Probleme und deren Behebung
Untertitel sind von Anfang an nicht synchron. Ein konstanter Versatz, bei dem jede Zeile um den gleichen Betrag zu früh oder zu spät ist, bedeutet normalerweise Der Player liest eine etwas andere Bildrate, als die Timings vermuten lassen. Die meisten Desktop-Player verfügen über eine Untertitelverzögerungssteuerung, um den gesamten Titel auf einmal zu verschieben; Schieben Sie es, bis die erste Linie landet, und der Rest folgt.
Die Synchronisierung weicht mit der Zeit immer weiter voneinander ab. Die Abweichung, die bei der Wiedergabe des Videos zunimmt, weist auf eine Nichtübereinstimmung der Bildrate zwischen der Quelle und der gerenderten Kopie hin, was häufig nach der Konvertierung einer 23,976-fps-Datei in 25 fps oder umgekehrt auftritt. Exportieren Sie die SRT erneut mit der Version des Videos, die Sie tatsächlich veröffentlichen, und nicht mit einem früheren Schnitt.
Der Name eines Sprechers fehlt in den Untertiteln. Wenn Sie Beschriftungen umbenannt haben, eine Plattform jedoch keine Namen anzeigt, entfernt diese Plattform beim Import wahrscheinlich Sprecherpräfixe aus der SRT. Es gibt keine SRT-Einstellung, die sie erzwingt; Die zuverlässige Lösung besteht darin, die Untertitel dort einzubrennen, wo die Namen Teil des Bildes sind.
Ein nicht-englisches Video kam in der falschen Sprache zurück. Hushscript erkennt die gesprochene Sprache automatisch in etwa 99 Sprachen, aber ein sehr kurzer oder verrauschter Clip kann gelegentlich falsch gelesen werden. Führen Sie einen saubereren Abschnitt erneut aus oder überprüfen Sie die Sprachenseite, um sicherzustellen, dass die Sprache abgedeckt ist.
Lange Abschnitte werden als ein riesiger Hinweis gelesen. Dies passiert, wenn jemand lange Zeit ohne klare Pause spricht. Teilen Sie den Hinweis manuell an einer Satzgrenze auf, sodass kein einzelner Block mehr als zwei Zeilen lesbaren Texts enthält.
Präzisionstipps, die sich in weniger Bearbeitungen auszahlen
Der Großteil der Qualität Ihrer Untertitel wird durch die von Ihnen eingegebenen Audiodaten festgelegt, bevor Sie den Editor öffnen. Saubere Audioquellen bedeuten weniger falsch gehörte Wörter und engere Zeitstempel, was eine kürzere Bearbeitung bedeutet bestanden.
Nehmen Sie den Ton mit normaler Sprechlautstärke ohne starke Komprimierung auf oder exportieren Sie ihn. Vermeiden Sie laute Hintergrundmusik bei Dialogen, wo immer Sie können. Wenn mehrere Personen beteiligt sind, hilft eine Aufnahme, bei der jede Stimme einigermaßen unterschiedlich ist, dabei, dass die Sprecherlabels konsistent bleiben, was wichtig ist, wenn Sie vorhaben, Namen in den Bildunterschriften beizubehalten. Wenn es sich bei der Quelle um ein Video handelt, das Sie bereits veröffentlicht haben, ist der Ton unverändert, aber bei allem, was Sie selbst aufnehmen, tragen ein paar Minuten Aufmerksamkeit auf Pegel und Mikrofonplatzierung mehr zur Qualität der Untertitel bei als jede Menge Nachbearbeitung.
Nach dem SRT: der Rest des Transkripts
Durch die Erstellung des SRT erhalten Sie auch das vollständige Transkript, sodass Sie nicht auf Untertitel beschränkt sind. Aus derselben Sitzung können Sie den Text als TXT oder DOCX für Shownotizen, eine Blog-Version des Vortrags oder ein zugängliches Transkript exportieren, das neben dem Video veröffentlicht wird. Das Exportieren eines sauberen Transkripts ist dasselbe wie das Untertiteln eines Videos in Text; Das SRT ist nur eines der daraus resultierenden Formate.
Informationen zum nächsten Schritt, dem Einfügen dieser Untertitel in das Video und der Wahl zwischen einer Sidecar-Datei und einem eingebrannten Track, finden Sie unter So fügen Sie einem Video Untertitel hinzu.
Unabhängige Quellen und Standards
Hushscript hat diese unabhängigen, nicht konkurrierenden Quellen herangezogen. Sie erläutern Forschung, Standards oder Plattformfunktionen und stellen keine Empfehlung durch Hushscript dar.
Quellen geprüft am: