Zum Hauptinhalt springen

MP3 in Text umwandeln (kostenlos, mit Sprechererkennung)

Autor: Veröffentlicht: Zuletzt geprüft:

Das Konvertieren einer MP3-Datei in Text ist eine der häufigsten Transkriptionsaufgaben überhaupt, und die Schritte ändern sich nicht mit der Quelle: Eine Podcast-Episode, ein aufgezeichnetes Interview, ein Vortrag oder eine Sprachnotiz von Ihrem Telefon durchlaufen alle denselben Ablauf. Laden Sie die Datei hoch, warten Sie auf das Transkript und exportieren Sie es in das von Ihnen benötigte Format.

Was sich ändert, ist, wie sich die MP3 selbst auf das Ergebnis auswirkt. Die meisten Reiseführer überspringen es. Eine MP3-Datei ist eine verlustbehaftete, komprimierte Datei, und die Bitrate, mit der sie gespeichert wurde, legt eine Obergrenze dafür fest, mit wie vielen Details die Sprach-Engine arbeiten muss. Dieser Leitfaden behandelt die drei Schritte und geht dann tiefer: ein ausgearbeitetes Beispiel mit echter, mit Sprechern gekennzeichneter Ausgabe, was Bitrate tatsächlich für die Genauigkeit bedeutet und wie man die Aufnahmen korrigiert, die schlecht ausfallen.

Was Sie brauchen

Es muss nichts installiert werden; Keine Desktop-App, keine Browsererweiterung. Alles läuft im Browser und im Konto.

Über die kostenlosen Minuten hinaus erfolgt die Transkription nach dem „Pay-as-you-go“-Prinzip: Sie kaufen Minuten nur dann, wenn Sie sie benötigen, ohne Abonnement. Die Kosten finden Sie auf der Preisseite.

Konvertieren Sie eine MP3 in Text in drei Schritten

  1. Laden Sie Ihre Datei hoch. Öffnen Sie /audio-to-text und ziehen Sie die MP3 dann in die Drop-Zone oder klicken Sie zum Durchsuchen. Es werden Dateien mit einer Länge von bis zu 10 Stunden ohne Beschränkung der Dateigröße akzeptiert. Die ersten 30 Sekunden werden direkt im Browser in der Vorschau angezeigt, bevor Sie sich anmelden, damit Sie den mit Sprecher gekennzeichneten Stil sehen können, bevor Sie sich verpflichten.
  2. Lass es transkribieren. Sobald Sie angemeldet sind und die Datei hochgeladen haben, verarbeitet die Sprach-Engine sie und gibt ein Transkript mit bereits getrennten Sprechern zurück. Die Verarbeitungszeit variiert und der Job wird im Hintergrund ausgeführt, sodass Sie die Registerkarte nicht geöffnet lassen müssen.
  3. Exportieren. Laden Sie das Ergebnis in einem von 21 Formaten herunter. Dazu gehören einfaches TXT, zeitgestempeltes SRT, Word DOCX, PDF sowie die Untertitel- und Editor-Timeline-Formate sowie ein passwortgeschütztes .husharchive. Jedes Format ist enthalten, ohne Paywall bei Exporten und ohne Wasserzeichen.

Das fertige Transkript wird in Ihrem Dashboard geöffnet. Sprecher werden als „Sprecher A“, „Sprecher B“ usw. angezeigt, und Sie können auf eine beliebige Beschriftung klicken, um sie in einen echten Namen umzubenennen, wodurch jede Zeile des Sprechers aktualisiert wird.

Ein funktionierendes Beispiel: ein Zwei-Personen-Interview

Angenommen, Sie haben founder-interview.mp3: eine 42-minütige Aufnahme mit 128 kbps, in der ein Interviewer und ein Gast miteinander sprechen. Nach dem Upload wird das Transkript nach Sprecherwechseln gegliedert und jeder Abschnitt erhält einen Zeitstempel:

[00:00:04] Sprecher A: Vielen Dank, dass Sie sich die Zeit genommen haben. Fangen wir am Anfang an –
           Woher kam eigentlich die Idee?
[00:00:11] Sprecher B: Ehrlich gesagt, es entstand aus einem Problem, das wir selbst hatten. Wir waren
           überflutet von aufgezeichneten Anrufen und keiner von ihnen war durchsuchbar.
[00:00:23] Sprecher A: Also haben Sie das Ding gebaut, das Sie brauchten.
[00:00:25] Sprecher B: So ziemlich. Die erste Version wurde mit Klebeband zusammengehalten.

Von da an ist der Schnitt einfach. Sie benennen „Sprecher A“ einmal in „Interviewer“ und „Sprecher B“ in „Gast“ um und jede Zeile wird aktualisiert. Sie überfliegen eine Handvoll Eigennamen, die die Engine erraten hat, etwa einen Produktnamen oder den Nachnamen einer Person, und korrigieren sie mit „Suchen und Ersetzen“, wodurch jede Instanz in einem Durchgang korrigiert wird. Bei einem sauberen 128-kbps-Interview wie diesem ist dieser Überflug normalerweise die einzige erforderliche Bereinigung, bevor das Transkript zitierfähig ist.

Hier verdient die Transkription, die die Sprecher kostenlos kennzeichnet, ihren Platz. Eine Wand mit ungeteiltem Text aus einem Interview ist nahezu nutzlos, bis Sie noch einmal durchgegangen sind und markiert haben, wer was gesagt hat. Aus einem Transkript, das bereits in mehrere Abschnitte aufgeteilt eintrifft, können Sie sofort zitieren.

Was Bitrate für die Genauigkeit bedeutet

MP3 ist ein verlustbehaftetes Format: Bei der Kodierung werden Teile des Audiomaterials weggeworfen, die als am wenigsten hörbar gelten, um die Datei klein zu halten. Die Bitrate gibt an, wie viele Kilobit pro Sekunde der Encoder dafür aufwendet. Je niedriger es ist, desto mehr wird verworfen. MDNs aktuelle MP3-Codec-Referenz dokumentiert die unterstützten Bitraten und Abtastraten des Formats und identifiziert seine Komprimierung als verlustbehaftet.

Die Spracherkennung stützt sich stark auf die hochfrequenten Details in Konsonanten. Der Unterschied zwischen „fünfzehn“ und „sechzehn“ oder „kann“ und „kann nicht“ liegt darin. Bei der aggressiven Komprimierung kommt es genau auf dieses Detail an. Die Bitrate verschlechtert ein Transkript also nicht gleichmäßig; Es frisst die am schwersten zu hörenden Wörter an den Rändern der Sprache.

In der Praxis:

Ein paar Klarstellungen, die eine unnötige Neukodierung ersparen. Variable Bitrate (VBR) ist in Ordnung; Es gibt keine Genauigkeitseinbußen gegenüber der ** konstanten Bitrate (CBR)** für Sprache. Konvertieren Sie eine VBR-Datei also nicht, nur um das Problem zu „reparieren“. Und ** Mono funktioniert für die Transkription genauso gut wie Stereo**, da für die Stimme keine zwei Kanäle erforderlich sind. Wenn überhaupt, lesen Sie den Hinweis zu Stereo-Doppelenden unten.

MP3 vs. verlustfrei: Wann sollten Sie stattdessen neu aufnehmen?

Eine natürliche Frage ist, ob es hilfreich wäre, Ihre MP3 zuerst in ein verlustfreies Format wie WAV zu konvertieren. Das wird es nicht. Sobald das Audio als MP3 mit 128 kbit/s gespeichert wurde, sind die fehlenden Details verschwunden; Wenn Sie dasselbe Audio in einen WAV-Container einpacken, entsteht lediglich eine größere Datei, die keine zusätzlichen Informationen enthält. Wenn Sie neu aufnehmen und die Wahl haben, ist eine verlustfreie Quelle oder eine Quelle mit hoher Bitrate der bessere Ausgangspunkt (siehe WAV-in-Text-Anleitung für diesen Fall), aber die Aufwärtskonvertierung einer vorhandenen MP3-Datei bringt nichts.

Die Regel für eine ehrliche Entscheidung: Wenn Ihre einzige Kopie eine MP3 mit angemessener Bitrate ist, transkribieren Sie sie so, wie sie ist. Wenn die Aufnahme wirklich schlecht ist (beschnitten, verrauscht oder mit 32 kbit/s gespeichert) und Sie sie erneut aufnehmen können, hilft eine erneute Aufnahme weitaus mehr als jede Konvertierung. Wenn Sie frisch aufnehmen, sind zwei Gewohnheiten wichtiger als die Bitrate: Platzieren Sie das Mikrofon in der Nähe des Sprechers und geben Sie jeder Person ihr eigenes Mikrofon, wenn möglich, denn eine saubere Trennung an der Quelle sorgt dafür, dass sowohl die Wörter als auch die Sprecherlabels richtig herauskommen.

Behebung häufiger Probleme

Die meisten groben Transkripte gehen auf die Aufnahme zurück, nicht auf das Werkzeug. Hier erfahren Sie, was Sie gegen die üblichen Übeltäter tun können.

Geringe Lautstärke. Wenn die Wellenform flach aussieht (eine sehr leise Aufnahme), hat die Engine weniger Signal zum Arbeiten und die Genauigkeit lässt nach. Normalisieren oder verstärken Sie den Ton zunächst in einem beliebigen Audio-Editor und laden Sie dann die lautere Version hoch. Das Erhöhen des Pegels ist eine der wirkungsvollsten Lösungen für eine schwache Aufnahme.

Hintergrundgeräusche. Dauergeräusche (Klimaanlage, Straßenbrummen) werden einigermaßen gut bewältigt; Plötzliche Geräusche, die das Sprechen überlagern, wie eine Tür, ein Husten oder Besteck, sind die Ursache für verlorene Wörter. Wenn Sie vor dem Hochladen eine leichte Rauschunterdrückung durchführen können, tun Sie dies, aber verarbeiten Sie es nicht zu stark: Eine starke Rauschunterdrückung führt zu Artefakten, die die Genauigkeit stärker beeinträchtigen als das Rauschen.

Starke Akzente oder Fachvokabular. Moderne Engines kommen gut mit einer Vielzahl englischer Akzente zurecht. Bei den zuverlässigen Fehlern handelt es sich um Domänenbegriffe, mit denen die Suchmaschine keinen Grund zu rechnen hat, etwa Medikamentennamen, Rechtshinweise oder Nischenmarkennamen. Planen Sie ein Überfliegen nach dem Export ein, um diese zu erkennen, und greifen Sie auf Suchen und Ersetzen zurück: Wenn ein Firmenname jedes Mal auf die gleiche Weise falsch landet, wird mit einer Korrektur die gesamte Datei durchsucht.

Sehr lange MP3s. Eine 6-Stunden-Aufnahme allein ist kein Problem. Die 10-Stunden-Obergrenze deckt fast alles ab, und darüber hinaus gibt es keine Dateigrößenbeschränkung, sodass Sie eine lange Datei nicht zuerst in Stücke zerhacken müssen. Was eine lange Datei tatsächlich verschlechtert, ist die Abweichung in der Aufnahmequalität: ein Sprecher, der sich vom Mikrofon entfernt, ein Pegel, der nach der ersten Stunde absinkt, ein Veranstaltungsort, der sich füllt und lauter wird. Halten Sie die Quelle möglichst stabil; Wo dies nicht möglich ist, müssen Sie damit rechnen, dass die raueren Abschnitte mehr Bearbeitung erfordern als die sauberen Abschnitte. Mit den Zeitstempeln ist dies einfach zu verwalten: Sie können direkt zu dem Patch springen, der sich schlecht liest, anstatt sich das Ganze noch einmal anzuhören.

Überlappende Sprecher. Wenn zwei Personen gleichzeitig sprechen, ordnet die Engine die Wörter der lauteren Stimme zu, eine Einschränkung der Sprechertrennung im Allgemeinen und nicht eines Tools. Es gibt keine hochladeseitige Lösung; Budgetieren Sie Bearbeitungszeit für die Übersprechabschnitte einer lebhaften Gruppenaufnahme.

Saubere Trennung der Sprecher

Die Sprechertrennung (Diarisierung) erfolgt bei jedem Transkript ohne zusätzliche Kosten, und ein paar Dinge auf MP3-Ebene beeinflussen, wie sauber es herauskommt. Wenn Sie Einzelheiten darüber erfahren möchten, wie es unter der Haube funktioniert, lesen Sie Was ist Sprecherdiarisierung?; Die praktischen Punkte hier:

Transkript exportieren

Das richtige Format hängt davon ab, was Sie mit dem Text machen. In der folgenden Tabelle sind diejenigen aufgeführt, die von den 21 angebotenen Formaten am häufigsten genutzt werden. Die vollständigen Kompromisse finden Sie unter Welches Transkriptformat Sie tatsächlich benötigen:

Format Am besten für
TXT Notizen, Kopieren und Einfügen, Einspeisen des Textes in ein anderes Tool
SRT Untertitel in einem Video oder Navigieren nach Zeitstempel; Auch die richtige Wahl, wenn Ihre Quelle eine Videodatei wie MP4
VTT Webuntertitel und browsernative Videoplayer
CSV Tabellenüberprüfung und kompakte Daten ist Übergabe
Markdown Veröffentlichungsnotizen, Dateien im README-Stil und bearbeitbare Entwürfe
JSON Programmatische Verarbeitung und benutzerdefinierte Tools
DOCX Teilen mit Redakteuren oder Kommentatoren, die in Word arbeiten
PDF Schreibgeschütztes Teilen und Archivieren

Jeder Export enthält die Sprecherlabels und Zeitstempel, ohne Wasserzeichen darauf.

Zeitstempel und Bearbeitung

Der Editor zeigt jede Äußerung mit Startzeit, Sprecherlabel und Text an. Klicken Sie auf eine beliebige Zeile, um diesen Audioabschnitt zusammen mit dem Text abzuspielen. Das ist praktisch, um eine knifflige Passage zu überprüfen, ohne die gesamte Datei manuell zu bereinigen.

Zeitstempel im SRT-Export liegen auf Äußerungsebene: ein Eintrag pro Sprecherzug, nicht pro Wort. Für Untertitel, Navigation und Zitate mit Zeitstempel ist das die richtige Granularität. Wenn Sie eine Struktur auf Wortebene für die Verarbeitung im Code benötigen, exportieren Sie JSON: Jeder Eintrag gibt Ihnen die Sprecherlabel, die Start- und Endzeit in Millisekunden und den Text für diese Runde.


Hochladen, transkribieren, exportieren: Das ist die ganze Arbeit, wobei die MP3-spezifischen Details darüber entscheiden, wie sauber das Ergebnis ist. Die MP3-zu-Text-Seite bietet die vollständige Funktionsübersicht, und wenn Sie mit einer Aufnahme in einem anderen Container arbeiten, deckt die Audio-zu-Text-Seite jedes Format auf die gleiche Weise ab. Eine ganze Show machen? Der Leitfaden zur Podcast-Transkription führt Sie durch die Umwandlung des Transkripts in Shownotizen. Wenn es sich bei Ihrer Datei um eine WAV-Datei und nicht um eine MP3-Datei handelt, enthält der WAV-to-Text-Leitfaden Hinweise zum Umgang mit großen verlustfreien Dateien.

Unabhängige Quellen und Standards

Hushscript hat diese unabhängigen, nicht konkurrierenden Quellen herangezogen. Sie erläutern Forschung, Standards oder Plattformfunktionen und stellen keine Empfehlung durch Hushscript dar.

Quellen geprüft am:

Häufig gestellte Fragen

Was ist die maximale MP3-Dateigröße, die ich hochladen kann?

Bis zu 10 Stunden pro Datei, ohne Dateigrößenbeschränkung. Jede Datei basiert auf Ihren Prepaid-Minuten. Es gelten auch Dienstsicherheits- und aktive Arbeitsschutzmaßnahmen.

Beeinflusst die MP3-Bitrate die Transkriptionsgenauigkeit?

Unter etwa 64 kbps ist dies möglich. Durch die Komprimierung bei sehr niedrigen Bitraten werden die Konsonanten, auf denen die Spracherkennung basiert, verwischt, sodass Wörter an den Rändern der Sprache verloren gehen. Bei 128 kbit/s oder mehr haben Sie bereits den Punkt überschritten, an dem die Bitrate eine Rolle spielt, und eine höhere Zahl wird das Transkript nicht besser machen.

Kann ich eine SRT-Untertiteldatei von einer reinen Audio-MP3-Datei erhalten?

Ja. Hushscript exportiert SRT, TXT, DOCX und JSON aus jeder Quelle. Das SRT trägt pro Äußerung Zeitstempel, auch wenn es sich bei der Eingabe um Audio ohne angehängtes Video handelte, sodass Sie es später direkt in ein Video einfügen können.

Benötige ich eine Kreditkarte, um zu beginnen?

Nein. Eine Karte ist einfach der schnellste Weg zu den 30 Freiminuten. Durch eine Vormerkung in Höhe von 1 $ wird der Betrag validiert, dann sofort freigegeben und es wird nie etwas in Rechnung gestellt. Wenn Sie lieber eine andere in Ihrem Land verfügbare Zahlungsmethode verwenden möchten, erhalten Sie Ihre 30 Minuten stattdessen mit Ihrem Paket für die ersten Minuten.

Was passiert mit meiner MP3, nachdem sie transkribiert wurde?

Sie wird vom Server gelöscht, sobald das Transkript fertig ist. Es wird nichts zur Aufbewahrung oder zum Modelltraining aufbewahrt. Sie können auch das Transkript selbst mit einem Klick aus Ihrem Dashboard löschen.

Wie genau ist die Sprechertrennung bei einer MP3-Datei?

Sprecherlabels sind am zuverlässigsten, wenn sich die Personen abwechseln und die Aufnahme einigermaßen sauber ist. Ein Zwei-Personen-Interview trennt in der Regel sauber; Ein lauter Gruppenanruf, bei dem die Leute übereinander sprechen, muss anschließend noch mehr von Hand bearbeitet werden.

Funktioniert eine MP3-Datei mit variabler Bitrate (VBR)?

Ja. VBR ist in Ordnung. Es gibt keinen Genauigkeitsnachteil gegenüber der konstanten Bitrate (CBR) für Sprache. Mono und Stereo funktionieren auch; Sie müssen vor dem Hochladen nichts neu kodieren.

Kann es eine MP3-Datei transkribieren, die nicht auf Englisch ist?

Ja. Die Sprache wird in rund 99 Sprachen automatisch erkannt. Eine saubere einsprachige Aufnahme lässt sich am besten transkribieren; Ein starker Codewechsel mitten im Satz ist für jede Engine schwieriger.

Mit 30 kostenlosen Minuten starten

Starten – 30 kostenlose Minuten