Zum Hauptinhalt springen

So konvertieren Sie ein MP4-Video privat in Text

Autor: Veröffentlicht: Zuletzt geprüft:

Ein Video-Workflow, bei dem zuerst der Upload erfolgt, sendet möglicherweise die gesamte MP4-Datei, obwohl die Spracherkennung nur die Audiospur benötigt. Je nach Auflösung, Codec und Bitrate kann eine lange Aufnahme mehrere Gigabyte groß sein. Hushscript vermeidet diese Übertragung: Der Browser bereitet zuerst das Audio vor und das Quellvideo verbleibt auf Ihrem Gerät.

Hushscript geht einen anderen Weg. Ihr Browser extrahiert den Ton aus dem Video, bevor der Upload beginnt, sodass die ursprüngliche MP4-Datei auf Ihrem Gerät verbleibt. Nur das Audio wird transkribiert und gelöscht, sobald Ihr Transkript fertig ist. Dieser Leitfaden führt Sie durch den gesamten Prozess: die Schritte, ein Beispiel für ein aufgezeichnetes Webinar, wie man SRT-Untertitel herauszieht, die anderen Videoformate, die auf die gleiche Weise funktionieren, und was zu tun ist, wenn etwas schief geht.

Warum Ihr Video nicht hochgeladen werden sollte

Die Videospur ist für die Transkription irrelevant. Die Sprach-Engine benötigt nur den Ton. Das Hochladen des Bildes ist reine Verschwendung: Netzwerkzeit, Serverspeicher und ein Datenschutz-Footprint, den Sie nicht benötigen.

So funktioniert die In-Browser-Extraktion im Klartext

Ein MP4 ist ein Container. Darin befinden sich separate Streams: das Video (das Bild), das Audio (der Ton) und einige Metadaten – eine Struktur, die im MDN-Videoverarbeitungshandbuch erklärt wird. Für die Transkription ist nur der Audiostream erforderlich.

Hushscript führt direkt auf der Seite ein kleines browsernatives Medien-Toolkit aus. Wenn Sie Ihre MP4-Datei ablegen, öffnet dieses Toolkit den Container lokal, kopiert den Audiostream und übergibt dieses Audio an den Upload, ohne dass die Seite das Video jemals irgendwohin sendet. Die Arbeit findet am selben Ort statt, an dem ein Video abgespielt wird: auf Ihrem eigenen Computer.

Das praktische Ergebnis ist also:

Dies ist wichtig für Besprechungen, aufgezeichnete Interviews, gerichtliche Aussagen und alles, wo das Filmmaterial selbst vertraulich ist. Es ist auch wichtig, wenn Sie eine langsame Verbindung mit einer Multi-Gigabyte-Datei haben: Durch das Extrahieren des Audios wird aus einem halbstündigen Upload ein paar Minuten.

Was Sie brauchen

Drei Dinge und nichts zu installieren:

Sie benötigen keinen separaten Audio-Extraktor, Konverter oder Videosoftware. Das Ablegen des MP4 ist die gesamte Eingabe.

Konvertieren Sie ein MP4 in drei Schritten

  1. Legen Sie Ihr MP4 auf der Seite unter /MP4-to-text ab. Ihr Browser extrahiert die Audiospur und lädt nur das Audio hoch, sodass das Video selbst auf Ihrem Gerät verbleibt. Die ersten 30 Sekunden werden als mit dem Sprecher gekennzeichnete Vorschau angezeigt. Es ist kein Konto erforderlich.
  2. Melden Sie sich an, um den Rest zu transkribieren. Geben Sie Ihre E-Mail-Adresse ein, um ein Konto zu erstellen. Neu hier? Die ersten 30 Minuten gehen zu unseren Lasten, sobald Sie eine Zahlungsmethode bestätigt haben, entweder eine Kartenvormerkung im Wert von 1 $ (autorisiert, dann sofort freigegeben, nie belastet) oder Ihr First-Minute-Paket, wenn Sie auf andere Weise bezahlen. Es ist keine Karte erforderlich. Die Transkription wird nach der Audiodauer abgerechnet, nicht nach der Dateigröße.
  3. Exportieren Sie das Transkript. Sobald es fertig ist, laden Sie es in einem von 21 Formaten herunter (TXT, SRT und VTT für Untertitel, DOCX und PDF für Dokumente, JSON und CSV für Daten usw.) sowie ein passwortgeschütztes .husharchive. Sprecherlabels sind kostenlos enthalten.

Die Audiolöschung erfolgt automatisch, wenn das Transkript zugestellt wird. Es ist kein Bereinigungsschritt zu beachten.

Was „gegen Audiodauer abgerechnet“ bedeutet

Eine einstündige MP4-Datei mit 1080p könnte 6 GB groß sein. Das daraus extrahierte Audio (normalerweise AAC mit 128–256 kbps) ist etwa 60–120 MB groß. Das ist es, was hochgeladen wird, und die Minutenkosten basieren auf der Audiostunde von einer Stunde, nicht auf der 6-GB-Datei.

Das Ergebnis: Sie können eine zweistündige 4K-Dokumentation von einem Feldrekorder transkribieren und dafür die gleichen Minutenkosten zahlen wie für eine kleine MP3-Datei, da beide die gleiche Menge an Audio enthalten. Auflösung, Bitrate und Dateigröße spielen dabei völlig keine Rolle, was Ihnen berechnet wird.

Ein funktionierendes Beispiel: ein aufgezeichnetes Webinar

Angenommen, Sie haben ein 52-minütiges Webinar mit zwei Moderatoren durchgeführt und als einzelne MP4-Datei aufgezeichnet: q3-product-webinar.mp4, etwa 3,4 GB bei 1080p. Sie möchten ein übersichtliches Transkript für die Zusammenfassungs-E-Mail und Untertitel für die Aufzeichnung.

So läuft es tatsächlich ab:

  1. Sie öffnen /MP4-to-text und legen q3-product-webinar.mp4 ab. Die Seite extrahiert die Audiospur lokal, sodass aus dem 3,4-GB-Video etwa 70 MB Audio werden. Nur diese 70 MB werden hochgeladen.
  2. Die ersten 30 Sekunden werden beschriftet zurückgegeben, sodass Sie die Audioqualität überprüfen können, bevor Sie die gesamten 52 Minuten transkribieren.
  3. Wenn das vollständige Transkript fertig ist, wird es in Äußerungen mit den Tags „Sprecher A“ oder „Sprecher B“ aufgeteilt. Sie klicken auf „Sprecher A“, geben „Priya“ ein, klicken auf „Sprecher B“, geben „Marcus“ ein und beide beschriften überall gleichzeitig um.
  4. Sie exportieren TXT für die Zusammenfassungs-E-Mail und SRT für die Untertitelspur der Wiederholung. Die ursprüngliche MP4-Datei des Webinars hat Ihren Laptop nie verlassen und die Audiodaten sind bereits vom Server gelöscht.

Der Teil, der die Leute beim ersten Mal überrascht, ist Schritt 1: ein Multi-Gigabyte-Upload, der einfach nicht stattfindet. Das Bild bleibt bei Ihnen; nur die Worte reisen.

Sprecherlabels für Videos mit mehreren Personen

Jedes Transkript beinhaltet eine automatische Sprecherdiarisierung ohne Aufpreis. Bei einem Interview, einer Podiumsdiskussion oder einer Besprechungsaufzeichnung wird jeder Sprecher mit „Sprecher A“, „Sprecher B“ usw. beschriftet. Sie können sie im Editor in echte Namen umbenennen, indem Sie auf die Beschriftung klicken und etwas eingeben.

Diarisierung funktioniert am besten mit sauberer Trennung. Kamera-Audio in einem ruhigen Raum oder ein Videoanruf, der mit Spuren pro Teilnehmer aufgezeichnet wird, geben der Engine das Beste, mit dem sie arbeiten kann. Ein überfüllter Raum mit Leuten, die übereinander reden, ist für jede Diarisierungsmaschine schwieriger. Was hilft, erfahren Sie weiter unten im Abschnitt zur Fehlerbehebung.

Untertitel (SRT/VTT) aus dem Video abrufen

Wenn der Grund für die Transkription des Videos Untertitel sind, exportieren Sie das Transkript als SRT. Jede Äußerung kommt mit einem Start- und Endzeitstempel, der gemäß der SRT-Spezifikation formatiert ist:

1
00:00:04,210 --> 00:00:07,880
Sprecher A: Vielen Dank, dass Sie heute dabei sind.

2
00:00:08,100 --> 00:00:12,340
Sprecher B: Ich freue mich, hier zu sein.

Laden Sie den SRT seitlich in einen Desktop-Player (VLC, QuickTime und die meisten Editoren akzeptieren ihn) oder laden Sie ihn als Untertitelspur hoch auf einer Plattform, die einen unterstützt. Der Hushscript SRT-Export behält die Sprecherlabels bei, was für Videos mit mehreren Personen nützlich ist. Bei einigen Untertitelformaten werden die Namen entfernt. SRT bewahrt sie.

Für Webplayer, die WebVTT (.vtt) verwenden, ist der Unterschied zu SRT winzig: eine WEBVTT-Kopfzeile und ein . anstelle von , in den Zeitstempeln. Sie können eine SRT im Browser mit dem kostenlosen Tool unter /tools/SRT-to-VTT in VTT konvertieren. Die Konvertierung wird lokal auf der Seite ausgeführt.

Zwei Geschwisterleitfäden gehen tiefer, als hier Platz ist: wie man SRT-Untertitel aus einem Video erstellt behandelt das Bearbeiten von Cue-Timing und Zeilenlänge, und wie man Untertitel zu einem Video hinzufügt behandelt das Anhängen des SRT oder das Einbrennen. Untertitel dauerhaft brennen in das Bild ist ein separater Kodierungsschritt. Ein kostenloses Tool wie HandBrake übernimmt den Mux, sobald Sie das SRT haben.

Andere Videoformate (MOV, WebM, MKV)

Der gleiche Browser-Extraktionsprozess gilt weit über MP4 hinaus:

Diese Container enthalten die üblichen Audio-Codecs (AAC, MP3, Opus, FLAC) und den Extraktionsschritt demultiplext sie auf die gleiche Weise wie eine MP4. In der Praxis funktioniert alles, was mit einem Telefon, einer Kamera oder einem Bildschirmrekorder aufgezeichnet wird. Geben Sie es einfach ein.

Sie können auch reine Audiodateien wie MP3, WAV, M4A direkt einspeisen. Da kein Videostream entfernt werden kann, wird der Extraktionsschritt übersprungen und die Datei wird unverändert hochgeladen. Und wenn Sie statt eines Transkripts nur die Audiodatei selbst möchten, ist die Konvertierung der MP4-Datei in eine MP3-Datei ein separater Job, der ebenfalls vollständig in Ihrem Browser ausgeführt wird. Die Video-zu-Text-Seite deckt den gesamten Workflow für jedes Videoformat ab, auch für solche mit ungewöhnlichen Audio-Codecs.

Fehlerbehebung

Gängige MP4-Dateien erfordern normalerweise keine manuelle Vorbereitung. Wenn ein Fehler auftritt oder schwacher Text erzeugt wird, überprüfen Sie zuerst diese Ursachen.

Das Quellvideo ist sehr groß. Die App hat keine Dateigrößenbeschränkung – sie bereitet den Ton selbst von sehr großen Videos direkt in Ihrem Browser vor, solange die Aufnahme innerhalb von 10 Stunden erfolgt (Ihr Browser benötigt immer noch genügend lokale Kapazität, um die Arbeit zu erledigen). Wenn die Extraktion bei einer großen 4K-Datei ins Stocken gerät, schließen Sie andere Registerkarten und versuchen Sie es erneut oder extrahieren Sie zuerst das Audio. Die kostenlosen Extract-Audio-Tools erledigen diese Arbeit im Browser und erzeugen eine kleinere Datei, die Sie direkt hochladen können.

Keine Audiospur oder keine Sprache. Bei einer stillen Bildschirmaufnahme oder einem reinen Musikclip muss die Engine nichts transkribieren, sodass Sie ein leeres Ergebnis erhalten. Bestätigen Sie, dass das Video tatsächlich gesprochenen Ton enthält, indem Sie es mit erhöhter Lautstärke abspielen. Wenn es sich um eine Bildschirmaufnahme handelt, überprüfen Sie, ob der Rekorder auf die Aufnahme von System- oder Mikrofonaudio eingestellt ist. Viele verwenden standardmäßig nur Video.

Ein nicht unterstützter oder unklarer Audio-Codec. Der Browser-Extraktor verarbeitet die gängigen Codecs (AAC, MP3, Opus, FLAC). Ein Container, der einen ungewöhnlichen oder proprietären Audio-Codec verwendet, demuxt möglicherweise nicht sauber und das Audio wird nicht extrahiert. Die Lösung besteht darin, zunächst den Ton des Videos in einen Standard-Codec zu remuxen oder neu zu kodieren; Die meisten Konverter können eine Standard-MP4- oder eine einfache Audiodatei ausgeben. Wenn Sie auf ein Format stoßen, das nicht durchkommt, senden Sie eine E-Mail an support@hushscript.com und wir werden versuchen, es hinzuzufügen.

Mehrere Sprecher, chaotische Trennung. Diarisierung erfordert unterscheidbare Stimmen. Überlappende Sprache, ein einzelnes Fernfeldmikrofon in einem großen Raum oder starke Hintergrundgeräusche verwischen die Grenzen zwischen den Sprechern. Sie erhalten trotzdem ein genaues Transkript; Die Sprecherlabels sind einfach weniger präzise. Wenn Sie die Aufnahme steuern, sorgt eine Spur pro Teilnehmer (wie die meisten Videoanruf-Tools exportieren können) oder ein Mikrofon näher an jedem Sprecher für die sauberste Trennung. In jedem Fall können Sie alle falsch beschrifteten Zeilen im Editor vor dem Exportieren korrigieren.

Das Transkript weist durchweg Rechtschreibfehler auf. Ein wiederkehrender Eigenname oder ein wiederkehrender Fachjargon, der immer auf die gleiche falsche Weise transkribiert wird, ist eine einmalige Korrektur: Ein einziges Suchen und Ersetzen im exportierten Text korrigiert jede Instanz. Das ist schneller, als irgendetwas erneut auszuführen.

Formate auf einen Blick exportieren

Format Was Sie erhalten
TXT Klarer Text, Sprecherlabels, keine Zeitstempel
SRT Untertitel mit Zeitstempel, bereit zum Seitenladen in jeden Videoplayer
VTT Webuntertitel für HTML5-Videoplayer
CSV Tabellenfreundliche Zeilen mit Sprechern und Zeitangaben
Markdown Mit Sprecher gekennzeichneter Text für Notizen und Veröffentlichungen
JSON Strukturierte Daten:{ speaker, start, end, text } pro Äußerung
DOCX Mit dem Sprecher gekennzeichnetes Transkript für Word oder Google Docs
PDF Transkript mit festem Layout zum Teilen oder Archivierung

Alle Exportformate sind in jedem Plan enthalten, einschließlich der 30 Freiminuten, und keines trägt ein Wasserzeichen.


Für jedes Video, bei dem der Datenschutz wichtig ist, sei es ein Meeting, ein Interview oder eine eidesstattliche Aussage, gilt: Ihr Video wird niemals hochgeladen. Sie können es selbst überprüfen. Öffnen Sie die Registerkarte „Netzwerk“ des Browsers, bevor Sie die Datei ablegen, und beobachten Sie, was gesendet wird. Sie werden sehen, wie der Ton lauter wird und das Bild an Ort und Stelle bleibt.

Unabhängige Quellen und Standards

Hushscript hat diese unabhängigen, nicht konkurrierenden Quellen herangezogen. Sie erläutern Forschung, Standards oder Plattformfunktionen und stellen keine Empfehlung durch Hushscript dar.

Quellen geprüft am:

Häufig gestellte Fragen

Wird die MP4-Videodatei auf den Server hochgeladen?

Nein. Ihr Browser extrahiert die Audiospur aus dem Video, bevor etwas Ihr Gerät verlässt. Zur Transkription wird nur der Ton gesendet. Die ursprüngliche MP4-Datei bleibt auf Ihrem Computer. Sie können es selbst im Netzwerk-Tab des Browsers bestätigen: Sie sehen den kleinen Audio-Upload, nicht das Multi-Gigabyte-Video.

Was ist die maximale Videogröße, die ich verwenden kann?

Es gibt keine Beschränkung der Dateigröße – Aufnahmen mit einer Länge von bis zu 10 Stunden werden akzeptiert, egal wie groß das Quellvideo ist. Da nur die Audiodaten hochgeladen werden, sendet ein langes Video in der Regel weit weniger Daten als es auf der Festplatte ist.

Wie viel kostet es, eine MP4 zu transkribieren?

Sie erhalten 30 Freiminuten nach einer Kartenüberprüfung im Wert von 1 $ (die Sperre wird autorisiert, dann sofort aufgehoben und nicht in Rechnung gestellt) oder bei Ihrem ersten Einkauf, wenn Sie auf andere Weise bezahlen. Danach erfolgt die nutzungsbasierte Bezahlung, die Abrechnung erfolgt nach der Audiodauer und nicht nach der Dateigröße des Videos. Die Paketkosten finden Sie auf der Preisseite.

Kann ich SRT-Untertitel von einem MP4 erhalten?

Ja. Nach der Transkription als SRT exportieren. Die SRT-Datei enthält bei jeder Äußerung einen Start- und Endzeitstempel und kann in die meisten Videoplayer seitlich geladen oder als Untertitelspur hochgeladen werden. Es behält Sprecherlabels bei, die bei einigen anderen Untertitelformaten wegfallen.

Welche anderen Videoformate funktionieren auf die gleiche Weise?

MOV, WebM, MKV und die meisten Containerformate, die einen Standard-Audiocodec enthalten (AAC, MP3, Opus, FLAC). Der Extraktionsschritt im Browser übernimmt das Demuxen, daher ist die Methode identisch mit MP4.

Mein Video hat keinen gesprochenen Ton. Kann ich es trotzdem transkribieren?

Nein. Die Transkription erfolgt über die Sprache, sodass bei einem Video ohne Audiospur oder einer stillen Bildschirmaufnahme nichts transkribiert werden muss. Wenn Hintergrundmusik, aber keine Sprache vorhanden ist, ist das Ergebnis leer oder Rauschen, da die Engine nur Wörter zurückgibt.

Wird das Audio nach der Transkription gelöscht?

Ja. Das extrahierte Audio wird vom Server gelöscht, sobald Ihr Transkript fertig ist, und die Sprach-Engine speichert nichts. Das Transkript selbst ist im Ruhezustand verschlüsselt, sodass selbst ein Speicherleck unlesbaren Chiffretext und nicht Ihre Worte preisgeben würde.

Mit 30 kostenlosen Minuten starten

Starten – 30 kostenlose Minuten