MP3 in Text umwandeln (kostenlos, mit Sprechererkennung)
Autor: Hushscript Veröffentlicht: Zuletzt geprüft:
Das Konvertieren einer MP3-Datei in Text ist eine der häufigsten Transkriptionsaufgaben überhaupt, und die Schritte ändern sich nicht mit der Quelle: Eine Podcast-Episode, ein aufgezeichnetes Interview, ein Vortrag oder eine Sprachnotiz von Ihrem Telefon durchlaufen alle denselben Ablauf. Laden Sie die Datei hoch, warten Sie auf das Transkript und exportieren Sie es in das von Ihnen benötigte Format.
Was sich ändert, ist, wie sich die MP3 selbst auf das Ergebnis auswirkt. Die meisten Reiseführer überspringen es. Eine MP3-Datei ist eine verlustbehaftete, komprimierte Datei, und die Bitrate, mit der sie gespeichert wurde, legt eine Obergrenze dafür fest, mit wie vielen Details die Sprach-Engine arbeiten muss. Dieser Leitfaden behandelt die drei Schritte und geht dann tiefer: ein ausgearbeitetes Beispiel mit echter, mit Sprechern gekennzeichneter Ausgabe, was Bitrate tatsächlich für die Genauigkeit bedeutet und wie man die Aufnahmen korrigiert, die schlecht ausfallen.
Was Sie brauchen
- Eine MP3-Datei. Jede Bitrate wird geladen. Aus Gründen der Genauigkeit sind 64 Kbit/s die praktische Untergrenze und 128 Kbit/s liegen weit über dem Punkt, an dem die Zahl zählt (mehr dazu weiter unten).
- Ein Hushscript-Konto. Sie erhalten 30 kostenlose Minuten zum Ausprobieren. Der schnellste Weg, sie zu entsperren, besteht darin, eine Karte hinzuzufügen: Durch eine Vormerkung von 1 $ wird sie validiert, dann sofort freigegeben und nie belastet. Wenn Sie lieber keine Karte verwenden möchten, funktioniert auch eine alternative Zahlungsmethode und die 30 Minuten fallen bei Ihrem ersten Einkauf an. In beiden Fällen ist keine Karte erforderlich.
Es muss nichts installiert werden; Keine Desktop-App, keine Browsererweiterung. Alles läuft im Browser und im Konto.
Über die kostenlosen Minuten hinaus erfolgt die Transkription nach dem „Pay-as-you-go“-Prinzip: Sie kaufen Minuten nur dann, wenn Sie sie benötigen, ohne Abonnement. Die Kosten finden Sie auf der Preisseite.
Konvertieren Sie eine MP3 in Text in drei Schritten
- Laden Sie Ihre Datei hoch. Öffnen Sie /audio-to-text und ziehen Sie die MP3 dann in die Drop-Zone oder klicken Sie zum Durchsuchen. Es werden Dateien mit einer Länge von bis zu 10 Stunden ohne Beschränkung der Dateigröße akzeptiert. Die ersten 30 Sekunden werden direkt im Browser in der Vorschau angezeigt, bevor Sie sich anmelden, damit Sie den mit Sprecher gekennzeichneten Stil sehen können, bevor Sie sich verpflichten.
- Lass es transkribieren. Sobald Sie angemeldet sind und die Datei hochgeladen haben, verarbeitet die Sprach-Engine sie und gibt ein Transkript mit bereits getrennten Sprechern zurück. Die Verarbeitungszeit variiert und der Job wird im Hintergrund ausgeführt, sodass Sie die Registerkarte nicht geöffnet lassen müssen.
- Exportieren. Laden Sie das Ergebnis in einem von 21 Formaten herunter. Dazu gehören einfaches TXT, zeitgestempeltes SRT, Word DOCX, PDF sowie die Untertitel- und Editor-Timeline-Formate sowie ein passwortgeschütztes .husharchive. Jedes Format ist enthalten, ohne Paywall bei Exporten und ohne Wasserzeichen.
Das fertige Transkript wird in Ihrem Dashboard geöffnet. Sprecher werden als „Sprecher A“, „Sprecher B“ usw. angezeigt, und Sie können auf eine beliebige Beschriftung klicken, um sie in einen echten Namen umzubenennen, wodurch jede Zeile des Sprechers aktualisiert wird.
Ein funktionierendes Beispiel: ein Zwei-Personen-Interview
Angenommen, Sie haben founder-interview.mp3: eine 42-minütige Aufnahme mit 128 kbps, in der ein Interviewer und ein Gast miteinander sprechen. Nach dem Upload wird das Transkript nach Sprecherwechseln gegliedert und jeder Abschnitt erhält einen Zeitstempel:
[00:00:04] Sprecher A: Vielen Dank, dass Sie sich die Zeit genommen haben. Fangen wir am Anfang an –
Woher kam eigentlich die Idee?
[00:00:11] Sprecher B: Ehrlich gesagt, es entstand aus einem Problem, das wir selbst hatten. Wir waren
überflutet von aufgezeichneten Anrufen und keiner von ihnen war durchsuchbar.
[00:00:23] Sprecher A: Also haben Sie das Ding gebaut, das Sie brauchten.
[00:00:25] Sprecher B: So ziemlich. Die erste Version wurde mit Klebeband zusammengehalten.
Von da an ist der Schnitt einfach. Sie benennen „Sprecher A“ einmal in „Interviewer“ und „Sprecher B“ in „Gast“ um und jede Zeile wird aktualisiert. Sie überfliegen eine Handvoll Eigennamen, die die Engine erraten hat, etwa einen Produktnamen oder den Nachnamen einer Person, und korrigieren sie mit „Suchen und Ersetzen“, wodurch jede Instanz in einem Durchgang korrigiert wird. Bei einem sauberen 128-kbps-Interview wie diesem ist dieser Überflug normalerweise die einzige erforderliche Bereinigung, bevor das Transkript zitierfähig ist.
Hier verdient die Transkription, die die Sprecher kostenlos kennzeichnet, ihren Platz. Eine Wand mit ungeteiltem Text aus einem Interview ist nahezu nutzlos, bis Sie noch einmal durchgegangen sind und markiert haben, wer was gesagt hat. Aus einem Transkript, das bereits in mehrere Abschnitte aufgeteilt eintrifft, können Sie sofort zitieren.
Was Bitrate für die Genauigkeit bedeutet
MP3 ist ein verlustbehaftetes Format: Bei der Kodierung werden Teile des Audiomaterials weggeworfen, die als am wenigsten hörbar gelten, um die Datei klein zu halten. Die Bitrate gibt an, wie viele Kilobit pro Sekunde der Encoder dafür aufwendet. Je niedriger es ist, desto mehr wird verworfen. MDNs aktuelle MP3-Codec-Referenz dokumentiert die unterstützten Bitraten und Abtastraten des Formats und identifiziert seine Komprimierung als verlustbehaftet.
Die Spracherkennung stützt sich stark auf die hochfrequenten Details in Konsonanten. Der Unterschied zwischen „fünfzehn“ und „sechzehn“ oder „kann“ und „kann nicht“ liegt darin. Bei der aggressiven Komprimierung kommt es genau auf dieses Detail an. Die Bitrate verschlechtert ein Transkript also nicht gleichmäßig; Es frisst die am schwersten zu hörenden Wörter an den Rändern der Sprache.
In der Praxis:
- 32 kbps und darunter: Selbst für das menschliche Ohr deutlich komprimiert, und die Engine reagiert auf die gleiche Weise. Wortfehler nehmen zu. Vermeiden Sie dies bei allem, was Sie transkribieren möchten.
- 64 kbps: der realistische Mindestwert für zuverlässige Sprache-zu-Text. Gut für eine klare Stimme aus der Nähe des Mikrofons.
- 128 kbps und mehr: bequem genug für die Transkription. Eine höhere Stufe verbessert das Transkript nicht. Die Engine verfügt bereits lange über alle Details, die sie nutzen kann.
Ein paar Klarstellungen, die eine unnötige Neukodierung ersparen. Variable Bitrate (VBR) ist in Ordnung; Es gibt keine Genauigkeitseinbußen gegenüber der ** konstanten Bitrate (CBR)** für Sprache. Konvertieren Sie eine VBR-Datei also nicht, nur um das Problem zu „reparieren“. Und ** Mono funktioniert für die Transkription genauso gut wie Stereo**, da für die Stimme keine zwei Kanäle erforderlich sind. Wenn überhaupt, lesen Sie den Hinweis zu Stereo-Doppelenden unten.
MP3 vs. verlustfrei: Wann sollten Sie stattdessen neu aufnehmen?
Eine natürliche Frage ist, ob es hilfreich wäre, Ihre MP3 zuerst in ein verlustfreies Format wie WAV zu konvertieren. Das wird es nicht. Sobald das Audio als MP3 mit 128 kbit/s gespeichert wurde, sind die fehlenden Details verschwunden; Wenn Sie dasselbe Audio in einen WAV-Container einpacken, entsteht lediglich eine größere Datei, die keine zusätzlichen Informationen enthält. Wenn Sie neu aufnehmen und die Wahl haben, ist eine verlustfreie Quelle oder eine Quelle mit hoher Bitrate der bessere Ausgangspunkt (siehe WAV-in-Text-Anleitung für diesen Fall), aber die Aufwärtskonvertierung einer vorhandenen MP3-Datei bringt nichts.
Die Regel für eine ehrliche Entscheidung: Wenn Ihre einzige Kopie eine MP3 mit angemessener Bitrate ist, transkribieren Sie sie so, wie sie ist. Wenn die Aufnahme wirklich schlecht ist (beschnitten, verrauscht oder mit 32 kbit/s gespeichert) und Sie sie erneut aufnehmen können, hilft eine erneute Aufnahme weitaus mehr als jede Konvertierung. Wenn Sie frisch aufnehmen, sind zwei Gewohnheiten wichtiger als die Bitrate: Platzieren Sie das Mikrofon in der Nähe des Sprechers und geben Sie jeder Person ihr eigenes Mikrofon, wenn möglich, denn eine saubere Trennung an der Quelle sorgt dafür, dass sowohl die Wörter als auch die Sprecherlabels richtig herauskommen.
Behebung häufiger Probleme
Die meisten groben Transkripte gehen auf die Aufnahme zurück, nicht auf das Werkzeug. Hier erfahren Sie, was Sie gegen die üblichen Übeltäter tun können.
Geringe Lautstärke. Wenn die Wellenform flach aussieht (eine sehr leise Aufnahme), hat die Engine weniger Signal zum Arbeiten und die Genauigkeit lässt nach. Normalisieren oder verstärken Sie den Ton zunächst in einem beliebigen Audio-Editor und laden Sie dann die lautere Version hoch. Das Erhöhen des Pegels ist eine der wirkungsvollsten Lösungen für eine schwache Aufnahme.
Hintergrundgeräusche. Dauergeräusche (Klimaanlage, Straßenbrummen) werden einigermaßen gut bewältigt; Plötzliche Geräusche, die das Sprechen überlagern, wie eine Tür, ein Husten oder Besteck, sind die Ursache für verlorene Wörter. Wenn Sie vor dem Hochladen eine leichte Rauschunterdrückung durchführen können, tun Sie dies, aber verarbeiten Sie es nicht zu stark: Eine starke Rauschunterdrückung führt zu Artefakten, die die Genauigkeit stärker beeinträchtigen als das Rauschen.
Starke Akzente oder Fachvokabular. Moderne Engines kommen gut mit einer Vielzahl englischer Akzente zurecht. Bei den zuverlässigen Fehlern handelt es sich um Domänenbegriffe, mit denen die Suchmaschine keinen Grund zu rechnen hat, etwa Medikamentennamen, Rechtshinweise oder Nischenmarkennamen. Planen Sie ein Überfliegen nach dem Export ein, um diese zu erkennen, und greifen Sie auf Suchen und Ersetzen zurück: Wenn ein Firmenname jedes Mal auf die gleiche Weise falsch landet, wird mit einer Korrektur die gesamte Datei durchsucht.
Sehr lange MP3s. Eine 6-Stunden-Aufnahme allein ist kein Problem. Die 10-Stunden-Obergrenze deckt fast alles ab, und darüber hinaus gibt es keine Dateigrößenbeschränkung, sodass Sie eine lange Datei nicht zuerst in Stücke zerhacken müssen. Was eine lange Datei tatsächlich verschlechtert, ist die Abweichung in der Aufnahmequalität: ein Sprecher, der sich vom Mikrofon entfernt, ein Pegel, der nach der ersten Stunde absinkt, ein Veranstaltungsort, der sich füllt und lauter wird. Halten Sie die Quelle möglichst stabil; Wo dies nicht möglich ist, müssen Sie damit rechnen, dass die raueren Abschnitte mehr Bearbeitung erfordern als die sauberen Abschnitte. Mit den Zeitstempeln ist dies einfach zu verwalten: Sie können direkt zu dem Patch springen, der sich schlecht liest, anstatt sich das Ganze noch einmal anzuhören.
Überlappende Sprecher. Wenn zwei Personen gleichzeitig sprechen, ordnet die Engine die Wörter der lauteren Stimme zu, eine Einschränkung der Sprechertrennung im Allgemeinen und nicht eines Tools. Es gibt keine hochladeseitige Lösung; Budgetieren Sie Bearbeitungszeit für die Übersprechabschnitte einer lebhaften Gruppenaufnahme.
Saubere Trennung der Sprecher
Die Sprechertrennung (Diarisierung) erfolgt bei jedem Transkript ohne zusätzliche Kosten, und ein paar Dinge auf MP3-Ebene beeinflussen, wie sauber es herauskommt. Wenn Sie Einzelheiten darüber erfahren möchten, wie es unter der Haube funktioniert, lesen Sie Was ist Sprecherdiarisierung?; Die praktischen Punkte hier:
- Stereo-Doppel-Ender. Einige Podcast- und Anruf-Setups zeichnen jeden Sprecher auf einem separaten Stereokanal auf. Entgegen der Intuition hilft es tendenziell, dies vor dem Hochladen auf eine einzige Monospur zu mischen: Die Engine hört eine gemischte Konversation und nicht zwei isolierte Streams. Die meisten Editoren exportieren einen Mono-„Mix-Down“.
- Schnelles Hin- und Her. Sehr kurze Austausche (Wechsel von weniger als zwei Sekunden) können gelegentlich zu einer beschrifteten Äußerung verschmelzen. Die Lesbarkeit wird dadurch selten beeinträchtigt, und Sie können eine Wendung manuell teilen, wenn ein bestimmtes Zitat dies erfordert.
- Saubere Wendungen helfen am meisten. Je sauberer die Übergaben zwischen Sprechern (weniger Unterbrechungen, weniger Übersprechen), desto zuverlässiger sind die Beschriftungen. Es gibt nichts zu konfigurieren; Es ist eine reine Eigenschaft der Aufnahme.
Transkript exportieren
Das richtige Format hängt davon ab, was Sie mit dem Text machen. In der folgenden Tabelle sind diejenigen aufgeführt, die von den 21 angebotenen Formaten am häufigsten genutzt werden. Die vollständigen Kompromisse finden Sie unter Welches Transkriptformat Sie tatsächlich benötigen:
| Format | Am besten für |
|---|---|
| TXT | Notizen, Kopieren und Einfügen, Einspeisen des Textes in ein anderes Tool |
| SRT | Untertitel in einem Video oder Navigieren nach Zeitstempel; Auch die richtige Wahl, wenn Ihre Quelle eine Videodatei wie MP4 |
| VTT | Webuntertitel und browsernative Videoplayer |
| CSV | Tabellenüberprüfung und kompakte Daten ist Übergabe |
| Markdown | Veröffentlichungsnotizen, Dateien im README-Stil und bearbeitbare Entwürfe |
| JSON | Programmatische Verarbeitung und benutzerdefinierte Tools |
| DOCX | Teilen mit Redakteuren oder Kommentatoren, die in Word arbeiten |
| Schreibgeschütztes Teilen und Archivieren |
Jeder Export enthält die Sprecherlabels und Zeitstempel, ohne Wasserzeichen darauf.
Zeitstempel und Bearbeitung
Der Editor zeigt jede Äußerung mit Startzeit, Sprecherlabel und Text an. Klicken Sie auf eine beliebige Zeile, um diesen Audioabschnitt zusammen mit dem Text abzuspielen. Das ist praktisch, um eine knifflige Passage zu überprüfen, ohne die gesamte Datei manuell zu bereinigen.
Zeitstempel im SRT-Export liegen auf Äußerungsebene: ein Eintrag pro Sprecherzug, nicht pro Wort. Für Untertitel, Navigation und Zitate mit Zeitstempel ist das die richtige Granularität. Wenn Sie eine Struktur auf Wortebene für die Verarbeitung im Code benötigen, exportieren Sie JSON: Jeder Eintrag gibt Ihnen die Sprecherlabel, die Start- und Endzeit in Millisekunden und den Text für diese Runde.
Hochladen, transkribieren, exportieren: Das ist die ganze Arbeit, wobei die MP3-spezifischen Details darüber entscheiden, wie sauber das Ergebnis ist. Die MP3-zu-Text-Seite bietet die vollständige Funktionsübersicht, und wenn Sie mit einer Aufnahme in einem anderen Container arbeiten, deckt die Audio-zu-Text-Seite jedes Format auf die gleiche Weise ab. Eine ganze Show machen? Der Leitfaden zur Podcast-Transkription führt Sie durch die Umwandlung des Transkripts in Shownotizen. Wenn es sich bei Ihrer Datei um eine WAV-Datei und nicht um eine MP3-Datei handelt, enthält der WAV-to-Text-Leitfaden Hinweise zum Umgang mit großen verlustfreien Dateien.
Unabhängige Quellen und Standards
Hushscript hat diese unabhängigen, nicht konkurrierenden Quellen herangezogen. Sie erläutern Forschung, Standards oder Plattformfunktionen und stellen keine Empfehlung durch Hushscript dar.
Quellen geprüft am: