Zum Hauptinhalt springen

So transkribieren Sie jede Audiodatei in Text

Autor: Veröffentlicht: Zuletzt geprüft:

Eine MP3 aus einem Podcast-Editor, ein M4A von Ihrem iPhone, eine WAV aus einem Feldrekorder, ein obskures CAF aus einer Diktiergerät-App: Um eines davon zu transkribieren, gehen Sie genauso vor. Löschen Sie die Datei, erhalten Sie ein Transkript mit bereits getrennten Sprechern und exportieren Sie es in das von Ihnen benötigte Format. Der Container, in dem die Audiodatei einging, ändert nichts an den Schritten.

Was das Format beeinflusst, erfahren Sie etwas weiter unten: Wie groß die Datei ist, wie sauber sie transkribiert wird und was zu tun ist, wenn eine Datei in seltenen Fällen nicht geladen werden kann. In diesem Leitfaden erfahren Sie, welche Audioformate funktionieren, welche Methode mit allen zurechtkommt, wie Sie das beste Format auswählen, wenn Sie die Wahl haben, und wie Sie die Dateien reparieren, die schlecht ausfallen.

Was Sie brauchen

Für die 30-Sekunden-Vorschau ist kein Konto erforderlich. Sie können eine Datei ablegen und den mit dem Sprecher gekennzeichneten Stil sehen, bevor Sie sich anmelden. Dies ist die ehrliche Möglichkeit, zu überprüfen, ob die Ausgabe passt, bevor Sie etwas festlegen. Abgesehen von den kostenlosen Minuten erfolgt die Transkription nach dem „Pay-as-you-go“-Prinzip: Sie kaufen Minuten nur dann, wenn Sie sie benötigen, ohne Abonnement. Die Kosten finden Sie auf der Preisseite.

Welche Audioformate funktionieren

Hushscript akzeptiert alle Standard-Audioformate. Hier ist, woher die einzelnen Dateien kommen, damit Sie erkennen können, was Sie haben:

Bei den Namen handelt es sich nicht nur um Konventionen für Dateinamen. Die aktuelle IANA Media Types Registry zeichnet standardisierte Typen wie audio/aac,audio/mp4,audio/mpeg,audio/ogg und audio/opus auf, weshalb der Container und die darin enthaltene Audiokodierung separate Fragen sind.

Gängige Audioformate und woher sie normalerweise kommen
FormatGemeinsame Quelle
MP3Podcasts, Telefonaufnahmen, Exporte aus den meisten Aufnahme-Apps
M4A / AACiPhone-Sprachnotizen, WhatsApp-Sprachnotizen, Apple-Exporte
WAVDigitalrekorder, DAW-Exporte, Windows Voice Recorder
FLACArchivaufnahmen, DAW-Exporte, verlustfreie Rips
OGGAndroid-Sprachnotizen, Open-Source-Aufnahmetools
AIFF / CAFMac- und iOS-Audio, GarageBand

Videodateien funktionieren auf die gleiche Weise. Legen Sie eine MP4-, MOV-, WebM- oder MKV-Datei ab und die Audiospur wird in Ihrem Browser extrahiert, bevor etwas hochgeladen wird, sodass das Video selbst nie Ihr Gerät verlässt; nur der Ton erreicht den Server.

Die obige Liste ist kein Zaun. Das Versprechen ist einfacher als eine Tabelle mit unterstützten Formaten: Legen Sie einfach Ihre Datei ab und sie wird konvertiert und transkribiert. Wenn Sie etwas wirklich Ungewöhnliches haben (eine AMR-Datei von einem alten Nokia, eine .3gp von einem zehn Jahre alten Android-Gerät, einen RealAudio-Clip), versuchen Sie es trotzdem hochzuladen. Der Browser kann die meisten Standardcontainer lesen. Wenn dies nicht möglich ist, haben Sie zwei Möglichkeiten: Konvertieren Sie es mit den kostenlosen Browser-Tools unter /tools in MP3 oder WAV und laden Sie es hoch, oder senden Sie eine E-Mail an support@hushscript.com und wir fügen das Format hinzu. Sie müssen nicht im Voraus herausfinden, ob Ihre Datei geeignet ist.

Transkribieren Sie eine Audiodatei in drei Schritten

Der Ablauf ist identisch, egal mit welchem ​​Format Sie beginnen. Der erste Schritt erfolgt, bevor Sie überhaupt ein Konto haben.

  1. Legen Sie Ihre Datei ab, um eine Vorschau anzuzeigen. Gehen Sie zu /audio-to-text und ziehen Sie die Datei in die Drop-Zone oder klicken Sie zum Durchsuchen. Die ersten 30 Sekunden werden direkt im Browser transkribiert, mit Sprecher beschriftet, ohne dass ein Konto erforderlich ist. Damit überprüfen Sie, ob die Ausgabe Ihren Wünschen entspricht, bevor Sie sich für etwas anmelden.
  2. Melden Sie sich an, um den Rest zu transkribieren. Geben Sie Ihre E-Mail-Adresse ein, um ein Konto zu erstellen. Ihre 30 Freiminuten werden freigeschaltet, wenn Sie eine Karte hinzufügen und validieren (der oben beschriebene Einbehalt von 1 $) oder bei Ihrem ersten Einkauf, wenn Sie auf andere Weise bezahlen. Die vollständige Datei wird hier hochgeladen. Eine Aufnahme kann bis zu 10 Stunden dauern, ohne Beschränkung der Dateigröße – selbst eine sehr große Datei wird direkt im Browser vorbereitet. Es gelten auch Dienstsicherheits- und aktive Arbeitsschutzmaßnahmen.
  3. Transkript abrufen und exportieren. Die Sprach-Engine verarbeitet die Datei und gibt ein Transkript mit bereits getrennten Sprechern zurück. Benennen Sie die Sprecher um, wenn Sie möchten, und laden Sie sie dann in einem von 21 Formaten (darunter TXT, SRT, DOCX und PDF sowie Untertitel- und Editor-Timeline-Formate) oder einem passwortgeschützten .husharchive herunter. Jeder Export ist enthalten: keine Paywall, kein Wasserzeichen.

Die Verarbeitung läuft im Hintergrund und skaliert mit der Länge des Audios (ungefähr ein paar Minuten pro Aufnahmestunde), sodass Sie die Registerkarte nicht geöffnet halten müssen, während eine lange Datei fertig ist.

Ein praktisches Beispiel: eine Aufnahme, zwei Formate

Angenommen, Sie haben eine aufgenommen 38-minütiges Gespräch und Ihr Rekorder hat es zweimal gespeichert: ein meeting.wav in voller Qualität und ein meeting.m4a, das Ihr Telefon gleichzeitig erstellt hat. Beide durchlaufen die identischen drei Schritte, und das Transkript kommt segmentiert nach Sprecherzug zurück, mit jeweils einem Zeitstempel:

[00:00:06] Sprecher A: Bevor wir anfangen, haben alle die Zahlen bekommen, die ich rübergeschickt habe?
[00:00:10] Sprecher B: Habe sie heute Morgen bekommen. Die Q3-Nummer ist die, die ich haben möchte
           hier rein.
[00:00:17] Sprecher A: Richtig, das ist also die Linie, die sich verschoben hat. Lass es mich hochziehen.
[00:00:21] Sprecher C: Während Sie das tun – können wir danach wieder mit der Einstellung fortfahren?

Die beiden Dateien erzeugen im Wesentlichen das gleiche Transkript. Das WAV ist ein viel größerer Upload und das M4A ein kleiner, aber die Wörter und die Sprecherlabels landen auf dem gleichen Weg, da beiden die gleiche zugrundeliegende Sprache zugrunde liegt. Von hier aus ist die Bearbeitung einfach: Sie klicken einmal auf „Sprecher A“, um es umzubenennen, und jede Zeile dieses Sprechers wird aktualisiert; Sie suchen nach einer Handvoll Eigennamen, die die Engine erraten hat (ein Nachname, ein Produktname) und korrigieren sie mit „Suchen und Ersetzen“, wodurch jede Instanz in einem Durchgang korrigiert wird.

Das ist das praktische Ergebnis einer Methode für jedes Format. Sie führen kein anderes Tool oder eine andere mentale Checkliste für WAV vs. M4A vs. MP3. Was auch immer Ihr Rekorder, Ihr Telefon oder der Export einer anderen Person Ihnen übergeben hat, es durchläuft dieselbe Drop-Zone und kommt als dieselbe Art von Transkript heraus.

Auswahl des besten Formats für Genauigkeit

Meistens können Sie sich nicht entscheiden. Sie transkribieren die Datei, die Sie erhalten haben, und das ist in Ordnung. Wenn Sie jedoch steuern, wie der Ton aufgezeichnet oder exportiert wird, legen einige Optionen die Obergrenze dafür fest, wie sauber das Ergebnis sein kann.

Die Aufnahmequalität steht bei weitem an erster Stelle. Eine 128-kbps-MP3-Datei mit einem guten Nahmikrofon schlägt jedes Mal eine verlustfreie WAV-Datei, die quer durch den Raum mit dem eingebauten Mikrofon eines Laptops aufgenommen wurde. Bevor Sie über das Format nachdenken, denken Sie darüber nach, das Mikrofon in die Nähe des Sprechers zu bringen. Der Container ist eine weit entfernte Sekunde.

Vermeiden Sie MP3 mit sehr niedriger Bitrate. MP3 ist verlustbehaftet: Beim Codieren werden Teile des Audios verworfen, um die Datei klein zu halten, und je niedriger die Bitrate, desto mehr wird weggeworfen. Die Spracherkennung basiert auf hochfrequenten Details in Konsonanten, bei denen die Lücke zwischen „fünfzehn“ und „sechzehn“ oder „kann“ und „nicht kann“ besteht. Aggressive Komprimierung frisst zuerst genau dieses Detail. Unterhalb von etwa 64 kbps kommt es zu einem Anstieg der Wortfehler. Bei 128 kbit/s und mehr haben Sie bereits den Punkt überschritten, an dem es auf die Zahl ankommt; Eine höhere Bitrate verbessert das Transkript nicht.

Lossless entfernt das Format als Variable. WAV, FLAC und AIFF übergeben der Engine unkomprimiertes Audio. Für eine saubere Aufnahme ist der Genauigkeitsgewinn im Vergleich zu einer guten MP3-Datei marginal, aber die Komprimierung ist damit völlig überflüssig. MDNs Digital-Audio-Leitfaden erklärt den zugrunde liegenden Kompromiss: Bei der verlustfreien Kodierung bleiben Details in größerer Größe erhalten, während bei der verlustbehafteten Kodierung der Ton durch das Verwerfen von Informationen noch weiter verkleinert werden kann. Das ist ein nützlicher Kontext, wenn die Aufnahme wertvoll ist und Sie sich später nicht fragen möchten, ob das Format Sie etwas kostet.

Mono ist in Ordnung; Sie benötigen kein Stereo. Die Engine mischt Stereo intern für Sprache in Mono um, sodass eine Monodatei genauso gut transkribiert werden kann und bei einer langsamen Verbindung schneller hochgeladen wird. Die einzige Nuance: Wenn Ihr Setup jede Person auf einem separaten Stereokanal (einem „Double-Ender“) aufgezeichnet hat, hilft das Heruntermischen auf eine einzelne Monospur vor dem Hochladen tendenziell den Sprecherlabels, da die Engine ein gemischtes Gespräch statt zwei isolierter Streams hört.

Eine Abtastrate über 16 kHz bringt nichts für Sprache. Alles von 16 kHz bis 48 kHz funktioniert, und ein 48-kHz-WAV von einem Der Videoeditor transkribiert dasselbe wie eine 16-kHz-Monodatei aus einer Telefon-App, sofern die gleiche zugrunde liegende Sprache vorhanden ist. Das Modell ist auf Sprache und nicht auf Musik trainiert, daher gibt es keinen Genauigkeitsgewinn durch eine höhere Rate.

Verlustfrei vs. verlustbehaftet, und wenn die Konvertierung hilfreich ist

Eine häufig gestellte Frage: Würde die Konvertierung Ihrer MP3-Dateien in WAV zunächst die Genauigkeit verbessern? Das wird es nicht. Sobald der Ton als MP3 mit 128 kbit/s gespeichert wurde, sind die verworfenen Details endgültig verschwunden. Wenn Sie dasselbe Audio in eine WAV-Datei einpacken, entsteht lediglich eine größere Datei ohne zusätzliche Informationen. Das Konvertieren nach oben hilft immer nur als Workaround für ein Format, das nicht geladen werden kann, niemals als Genauigkeitssteigerung.

Das Konvertieren nach unten ist der wirklich nützliche Fall. Eine mehrstündige WAV-Datei kann eine sehr große Datei sein; Durch die Neukodierung in eine 128-kbit/s-MP3-Datei vor dem Hochladen wird die Datei drastisch verkleinert, ohne nennenswerte Genauigkeitseinbußen, wodurch der Upload über eine langsame Verbindung beschleunigt wird. Der kostenlose In-Browser-Konverter erledigt dies, ohne dass der Ton jemals Ihr Gerät verlässt. Die ehrliche Regel: Wenn Ihre Datei bereits geladen wird und keine winzige Bitrate aufweist, transkribieren Sie sie so, wie sie ist. Konvertieren Sie nur, um ein echtes Problem zu lösen, etwa eine Datei, die sich nicht öffnen lässt oder die zu groß ist, um bequem hochgeladen zu werden.

Sprecherlabels, kostenlos enthalten

Jedes Hushscript-Transkript verfügt über eine automatische Sprechertrennung (Diarisierung) ohne zusätzliche Kosten. Die Engine wählt unterschiedliche Stimmen aus und beschriftet sie mit „Sprecher A“, „Sprecher B“ usw. Sie benennen sie im Editor mit einem Klick pro Sprecher in echte Namen um. Es ist standardmäßig aktiviert, unabhängig vom Quellformat, ohne separate Sprecher-Label-Ebene.

Wie sauber die Labels ausgegeben werden, hängt von der Aufnahme und nicht vom Dateityp ab:

Bei den meisten Interviews, Podcasts und Meetings sind die Labels mit höchstens ein paar Neuzuweisungen verwendbar. Wenn Sie Einzelheiten darüber erfahren möchten, wie Diarisierung unter der Haube funktioniert, lesen Sie Was ist Diarisierung von Sprechern oder die Seite zur Sprecheridentifizierung für eine Funktionsübersicht.

Reparieren von Dateien, die grob herauskommen

Die meisten groben Transkripte gehen auf die Aufnahme zurück, nicht auf das Format oder das Werkzeug. Die üblichen Übeltäter und was man dagegen tun kann:

Eine Datei, die nicht geladen werden kann. Selten, aber es kommt bei einem ungewöhnlichen oder beschädigten Container vor. Versuchen Sie es mit dem kostenlosen In-Browser-Konverter, um es zunächst in MP3 oder WAV umzuwandeln, was die meisten hartnäckigen Dateien behebt. Wenn es immer noch nicht funktioniert, senden Sie eine E-Mail an support@hushscript.com. Wir fügen Formatunterstützung hinzu.

Geringe Lautstärke. Wenn die Aufnahme sehr leise ist, hat die Engine weniger Signal zum Arbeiten und die Genauigkeit lässt nach. Normalisieren oder verstärken Sie das Audio in einem beliebigen Editor, bevor Sie es hochladen. Das Erhöhen des Pegels einer schwachen Aufnahme ist eine der Lösungen mit dem höchsten Ertrag, die es gibt.

Hintergrundgeräusche. Dauergeräusche (Klimaanlage, Straßenbrummen) werden einigermaßen gut bewältigt. Plötzliche Geräusche, die das Sprechen überlagern (eine Tür, ein Husten, Besteck), sind der Grund dafür, dass Wörter verloren gehen. Eine leichte Rauschunterdrückung vor dem Hochladen kann hilfreich sein, aber übertreiben Sie es nicht: Starke Rauschunterdrückung fügt Artefakte hinzu, die die Genauigkeit stärker beeinträchtigen als das Rauschen.

Starke Akzente oder Fachvokabular. Moderne Engines kommen mit einer Vielzahl von Akzenten gut zurecht. Bei den zuverlässigen Fehlern handelt es sich um Domänenbegriffe, mit denen die Suchmaschine nicht rechnen muss: Medikamentennamen, juristische Zitate, Nischenmarkennamen. Planen Sie ein Überfliegen nach dem Export ein und setzen Sie auf „Suchen und Ersetzen“. Wenn ein Name jedes Mal auf die gleiche Weise falsch landet, wird mit einer Korrektur die gesamte Datei gelöscht.

Sehr große oder sehr lange Dateien. Die 10-Stunden-Obergrenze deckt fast alles ab, und darüber hinaus gibt es keine Dateigrößenbeschränkung, sodass eine lange Aufnahme nicht in Stücke zerlegt werden muss. Wenn die Vorbereitung einer verlustfreien Datei im Browser zu groß ist, kodieren Sie sie zunächst in MP3 mit 128 kbit/s neu (kein wirklicher Genauigkeitsverlust), um die Arbeit zu beschleunigen. Auf die Einzelheiten zu längeren Sitzungen geht der Langaufzeichnungsleitfaden näher ein.

Was passiert mit Ihrer Datei

Das Audio wird vom Server gelöscht, sobald das Transkript fertig ist. Es gibt keinen Cloud-Speicher, keine Verwendung für Modellschulungen und keine Aufbewahrungsfrist. Wenn Sie eine Videodatei abgelegt haben, erreichte nur das extrahierte Audio jemals den Server (das Video blieb auf Ihrem Gerät), und Sie können das Transkript selbst jederzeit mit einem Klick aus Ihrem Dashboard löschen.

Exportieren Ihres Transkripts

Wählen Sie nach der Transkription das Format aus, das zu dem passt, was Sie mit dem Text machen. Wenn Sie sich nicht sicher sind, welches Transkriptformat Sie tatsächlich benötigen, beginnen Sie mit den folgenden allgemeinen Tipps:

Transkript-Exportformate und beste Verwendung
FormatWas ist enthaltenAm besten für
TXTSprecherlabels, KlartextNotizen, Suche, Eingabe in ein anderes Tool
SRTZeitstempel pro Äußerung, SprecherlabelsVideountertitel, Navigieren in einer langen Aufnahme nach Zeit
VTTZeitstempel für Webuntertitel, SprecherlabelsHTML5-Videoplayer und Webveröffentlichung
CSVZeilen mit Sprecher-, Zeit- und TextfeldernTabellenüberprüfung und einfache Datenübergabe
MarkdownTranskript mit Sprecherlabel in MarkdownNotizen, Dokumente, Veröffentlichungsworkflows und statische Websites
DOCXFormatiert für Word oder Google DocsBearbeiten, Teilen, Kommentieren
JSON{ speaker, start, end, text } pro ElementPipelines und benutzerdefinierte Tools
PDFLesbares Transkript mit festem LayoutSchreibgeschütztes Teilen und Archivieren

Jeder Export trägt die Sprecherlabels ohne Wasserzeichen darauf und alle Exportformate sind in jedem Plan enthalten, darunter auch die 30 Freiminuten. Zeitstempel im SRT befinden sich auf der Äußerungsebene (ein Eintrag pro Sprecherzug), was die richtige Granularität für Untertitel und Zitate darstellt; Wenn Sie für die Verarbeitung im Code eine Struktur auf Wortebene benötigen, gibt Ihnen JSON die Start- und Endzeit in Millisekunden für jede Runde an.

Sprachen

Hushscript transkribiert ungefähr 99 Sprachen, automatisch erkannt, nicht manuell festgelegt. Die Genauigkeit ist in 18 Ländern am höchsten, darunter vier englische Varianten (global, britisch, australisch, US), Spanisch, Französisch, Deutsch, Japanisch, Mandarin, Hindi und Arabisch. Die vollständige Liste finden Sie auf der Seite „Sprachen“.

Wenn Sie sich zwischen einem Transkript in derselben Sprache und einem übersetzten Transkript entscheiden, erklärt der Leitfaden zum „Übersetzen von Audio in Text“ den Unterschied.


Das ist die ganze Aufgabe (drop, transkribieren, exportieren) und es liest sich immer gleich, egal mit welchem Format Sie begonnen haben. Für formatspezifische Notizen decken die Geschwisterhandbücher die häufigsten Fälle ab: MP3, WAV und M4A/Apple Voice Memo. Die Audio-to-Text-Seite bietet eine vollständige Funktionsübersicht, und jedes Format landet dort auf die gleiche Weise: Legen Sie einfach Ihre Datei ab.

Unabhängige Quellen und Standards

Hushscript hat diese unabhängigen, nicht konkurrierenden Quellen herangezogen. Sie erläutern Forschung, Standards oder Plattformfunktionen und stellen keine Empfehlung durch Hushscript dar.

Quellen geprüft am:

Häufig gestellte Fragen

Welche Audioformate akzeptiert Hushscript?

MP3, M4A, WAV, FLAC, AAC, OGG, CAF, AIFF und die anderen gängigen Audioformate. Videodateien (MP4, MOV, WebM, MKV) funktionieren ebenfalls. Der Ton wird vor dem Hochladen im Browser extrahiert, sodass das Video auf Ihrem Gerät verbleibt. Wenn eine Datei, die Sie haben, nicht unterstützt wird, senden Sie eine E-Mail an support@hushscript.com und wir fügen sie hinzu.

Gibt es ein Format, das die beste Genauigkeit bietet?

Verlustfreie Formate (WAV, FLAC, AIFF) liefern der Engine das sauberste Signal, aber eine MP3-Datei mit 128 kbps oder höher der gleichen Aufnahme transkribiert ungefähr das Gleiche. Die Aufnahme selbst (Mikrofonabstand, Lärm, wie deutlich die Leute sprechen) ist weitaus wichtiger als das Containerformat.

Was ist, wenn ich ein Format habe, das nicht in der Liste ist?

Versuchen Sie zuerst, es hochzuladen. Der Browser kann die meisten Standardcontainer lesen, auch alte oder ungewöhnliche. Wenn es nicht geladen werden kann, konvertieren Sie es mit dem kostenlosen Browser-Konverter unter /tools in MP3 oder WAV und laden Sie es dann hoch. Als Alternative senden Sie eine E-Mail an support@hushscript.com und wir fügen das Format hinzu.

Benötige ich eine Kreditkarte, um zu beginnen?

Nein. Eine Karte ist einfach der schnellste Weg zu den 30 Freiminuten: Durch eine Vormerkung von 1 $ wird sie validiert, dann sofort freigegeben und nie belastet. Wenn Sie lieber eine andere in Ihrem Land verfügbare Zahlungsmethode verwenden möchten, erhalten Sie die 30 Minuten stattdessen bei Ihrem ersten Einkauf.

Sind Sprecherlabels für jedes Format enthalten?

Ja. Die Sprechertrennung erfolgt für jedes Transkript, unabhängig vom Format oder der Dateigröße, ohne zusätzliche Kosten. Bezeichnungen werden als Sprecher A, Sprecher B usw. zurückgegeben und Sie können sie umbenennen.

Wie werden Minuten formatübergreifend gezählt?

Anhand der Audiodauer, nicht der Dateigröße. Eine 45-minütige FLAC-Datei und eine 45-minütige MP3-Datei derselben Aufnahme kosten die gleiche Anzahl an Minuten, obwohl die FLAC-Datei eine viel größere Datei ist.

Kann eine Datei transkribiert werden, die nicht auf Englisch ist?

Ja. Die Sprache wird in rund 99 Sprachen automatisch erkannt, sodass Sie sie nicht manuell einstellen müssen. Eine saubere einsprachige Aufnahme lässt sich am besten transkribieren; Ein starker Wechsel zwischen Sprachen mitten im Satz ist für jede Engine schwieriger.

Was passiert mit meiner Datei, nachdem sie transkribiert wurde?

Sie wird vom Server gelöscht, sobald das Transkript fertig ist: keine Speicherung, kein Modelltraining. Wenn es sich bei Ihrer Datei um ein Video handelt, erreicht nur das extrahierte Audio jemals den Server, und Sie können das Transkript selbst mit einem Klick aus Ihrem Dashboard löschen.

Mit 30 kostenlosen Minuten starten

Starten – 30 kostenlose Minuten