Sprache zu Text: So funktioniert die Technik
Autor: Hushscript Veröffentlicht: Zuletzt geprüft:
Speech to Text ist eine Software, die gesprochene Audioinhalte in geschriebene Wörter umwandelt. Der Begriff umfasst zwei verschiedene Aufgaben, die sich ähnlich anfühlen, aber unterschiedlich funktionieren: Live-Diktieren, bei dem Sie sprechen und Text währenddessen angezeigt wird, und Transkription, bei der Sie eine Aufnahme abgeben und ein fertiges Transkript zurückerhalten. Der Kerngedanke ist bei beiden gleich. Der Arbeitsablauf, die Genauigkeit und was Sie mit dem Ergebnis machen können, sind es nicht.
Diese Anleitung erklärt im Klartext, was „Speech-to-Text“ eigentlich ist, wie die Engine von Ton zu Wörtern gelangt und wie sich die beiden Modi unterscheiden. Dann geht es durch die Konvertierung einer Aufnahme in Text auf Hushscript, mit einem praktischen Beispiel, den Problemen, die Menschen zum Stolpern bringen, und einer kurzen FAQ am Ende.
Was Sprache in Text eigentlich ist
Im einfachsten Fall nimmt die automatische Spracherkennung (Automatic Speech Recognition, ASR) eine Schallwelle und erzeugt eine Folge von Wörtern. Ein Mikrofon erfasst Sprache als kontinuierliche Wellenform, eine wackelnde Linie, die den sich im Laufe der Zeit ändernden Luftdruck darstellt. Diese Wellenform trägt alles: die Worte, die Stimme des Sprechers, den Raum, das Summen einer Klimaanlage. Die Aufgabe der Engine besteht darin, die Wörter aus dieser Mischung herauszuziehen und aufzuschreiben.
Dazu zerhackt die Engine den Ton in winzige Abschnitte, normalerweise jeweils 10 bis 30 Millisekunden, und misst den Ton in jedem Abschnitt. Diese Messungen speisen ein trainiertes Modell ein, das Klangmuster auf die Spracheinheiten einer Sprache, dann auf Wörter und schließlich auf ganze Phrasen abbildet. Davon sieht man nichts. Sie sehen, wie eine Aufnahme eingeht und ein Transkript herauskommt. Aber wenn man ungefähr weiß, was im Inneren passiert, erklärt sich, warum manche Aufnahmen sauber transkribiert werden und andere rau zurückkommen.
Es gibt zwei Wissensebenen, die zusammenarbeiten. Eine davon ist akustisch: Was sind die Laute einer Sprache und wie werden sie tendenziell bei verschiedenen Stimmen und Akzenten ausgesprochen? Die andere ist sprachlicher Natur: Welche Wortfolgen sind plausibel? Die sprachliche Ebene ist der Grund, warum ein guter Motor schreibt: „Ihr Auto ist kaputt“ statt „Das Auto ist kaputt“, obwohl beides identisch klingt. Es verwendet den Kontext, um die Schreibweise eines Menschen auszuwählen.
Ältere Spracherkennung basierte auf handgeschriebenen Regeln und kleinen Trainingssätzen und war fragil. Moderne Engines sind große KI-Modelle, die auf Tausenden Stunden aufgezeichneter Sprache von vielen Sprechern, Akzenten und Aufnahmebedingungen trainiert wurden. Diese Breite ist der Grund dafür, dass die heutigen Transkripte verwendbar sind. Bei klarer Sprache und einer anständigen Aufnahme erreichen aktuelle Modelle eine Wortgenauigkeit von etwa 90 bis 97 Prozent. Die restlichen paar Prozent sind es, wo sich die Fehlerbehebung weiter unten in diesem Handbuch lohnt.
Aufgezeichnete Sprache vs. Live-Diktat
In der Praxis kommt es vor allem darauf an, ob der Ton live oder nachträglich verarbeitet wird.
Live-Diktat läuft in Echtzeit. Sie sprechen in ein Telefon, einen Sprachassistenten oder die Spracheingabefunktion eines Textverarbeitungsprogramms, und Wörter erscheinen fast so schnell, wie Sie sie sagen. Um mithalten zu können, muss sich die Engine auf jedes einzelne Wort festlegen, ohne dass sie sich auf einen sehr kleinen Teil des Satzes stützen kann. Das ist eine harte Einschränkung, und das ist der Grund, warum das Diktat manchmal ein Wort errät und es dann stillschweigend umschreibt, sobald die nächsten paar Wörter eintreffen. Das Live-Diktieren ist das richtige Werkzeug, wenn es darum geht, Ihre eigene Sprache unterwegs festzuhalten: Freihändig eine Notiz machen, eine E-Mail per Spracheingabe verfassen, ein Gerät steuern.
Die Transkription funktioniert bei einer vollständigen Aufnahme. Sie geben der Engine eine fertige Audio- oder Videodatei, sie verarbeitet das Ganze und Sie erhalten im Gegenzug ein vollständiges Transkript. Da nichts in Echtzeit passieren muss, kann die Engine vorauslesen und den gesamten Satz sehen, bevor sie sich für ein Wort entscheidet, was die Genauigkeit erhöht. Es kann auch Aufgaben erledigen, die beim Live-Diktieren nicht möglich sind. Es kann die Sprecher trennen und jede Zeile demjenigen zuordnen, der es gesagt hat, und es kann Zeitstempel anhängen, sodass Sie von einer Textzeile direkt zu diesem Moment im Audio springen können.
Wenn Sie sich mit einem Meeting, einem Interview, einem Vortrag, einer Podcast-Folge oder einem von Ihnen aufgezeichneten Telefongespräch befassen, führen Sie eine Transkription aus einer gespeicherten Datei durch, kein Live-Diktat. Die beiden geraten durcheinander, weil beide als „Speech-to-Text“ vermarktet werden, die Aufnahme, die Sie bereits haben, aber die falsche Form für ein Diktiergerät und die richtige Form für einen Transkriptor hat. Hushscript ist für Aufnahmen konzipiert. Es gibt keinen Live-Diktiermodus, und dieser Fokus ist bewusst: Die Arbeit mit der vollständigen Datei ermöglicht das Vorlesen auf Genauigkeit und die Kennzeichnung von Sprechern im selben Durchgang.
So konvertieren Sie aufgezeichnete Sprache in Text
Hier ist der tatsächliche Ablauf in Hushscript, in der Reihenfolge, in der Sie ihn kennen. Für die Anmeldung benötigen Sie die Aufnahme als Datei auf Ihrem Gerät, eine Audio- oder Videodatei in einem beliebigen gängigen Format und eine E-Mail-Adresse. Das ist die ganze Liste. Es muss nichts installiert werden.
- Legen Sie die Datei ab und sehen Sie sich die Vorschau an. Öffnen Sie die Audio-to-Text-Seite und legen Sie Ihre Datei darauf ab. Hushscript transkribiert die ersten 30 Sekunden direkt und zeigt Ihnen das Ergebnis mit bereits getrennten Sprechern an. Für diesen Schritt ist kein Konto erforderlich. Mithilfe der Vorschau können Sie die Genauigkeit Ihrer eigenen Aufnahme beurteilen, bevor Sie etwas unternehmen.
- Melden Sie sich an, um den Rest zu transkribieren. Wenn die Vorschau richtig aussieht, melden Sie sich mit Ihrer E-Mail-Adresse an. Das Transkribieren der gesamten Datei ist gesperrt, daher kommt in diesem Schritt ein Konto ins Spiel. Neue Konten erhalten 30 kostenlose Minuten, um den Dienst ordnungsgemäß auszuprobieren.
- Laden Sie die vollständige Datei hoch. Sobald Sie dabei sind, laden Sie die gesamte Aufzeichnung hoch. Wenn es sich um ein Video handelt, wird das Audio zuerst in Ihrem Browser extrahiert und nur das Audio gesendet, sodass das Video selbst auf Ihrem Gerät verbleibt.
- Lesen, neu kennzeichnen und exportieren. Das Transkript wird mit jeder Runde zurückgegeben, die einem Sprecher (Sprecher A, Sprecher B usw.) zugeordnet und mit einem Zeitstempel versehen ist. Klicken Sie auf die Bezeichnung eines Sprechers, um ihn umzubenennen. Der neue Name wird überall dort aktualisiert, wo die Person gesprochen hat. Wenn es Ihren Wünschen entspricht, exportieren Sie es nach TXT für einfachen Text, SRT oder VTT für Untertitel, CSV oder JSON für strukturierte Daten, Markdown zum Veröffentlichen von Notizen, DOCX zum Bearbeiten oder PDF zum Teilen.
Dreißig Minuten reichen aus, um ein kurzes Interview, einen 10-minütigen Vorlesungsclip oder den ersten Abschnitt einer längeren Aufnahme zu transkribieren, wenn Sie die Genauigkeit überprüfen möchten, bevor Sie fortfahren. Die Freiminuten werden sofort durch eine schnelle Kartenprüfung freigeschaltet: Zur Überprüfung der Karte wird eine Vormerkung in Höhe von 1 $ vorgenommen, die dann sofort aufgehoben und nie belastet wird. Wenn Sie eine andere Zahlungsmethode verwenden, erhalten Sie diese stattdessen bei Ihrem ersten Einkauf. Eine Karte ist nicht erforderlich; Es ist einfach der schnellste Weg zum Bonus. Nach den Freiminuten zahlen Sie nur für die Minuten, die Sie transkribieren, ohne Abonnement. Auf der Preisseite finden Sie die aktuellen Tarife.
Ein praktisches Beispiel
Angenommen, Sie haben ein 38-minütiges Kundeninterview auf Ihrem Telefon aufgezeichnet. Es wurde als M4A gespeichert, zwei Stimmen, das gelegentliche Klappern einer Kaffeetasse, aufgenommen in einem normalen Besprechungsraum.
Sie legen das M4A auf der Audio-zu-Text-Seite ab. Die 30-sekündige Vorschau erscheint als kurzes Gespräch:
Sprecher A 00:00 Vielen Dank, dass Sie sich die Zeit genommen haben. Könnten Sie mir zunächst sagen
was Sie zuerst nach einem Werkzeug wie diesem gesucht hat?
Sprecher B 00:11 Klar. Wir ertranken in Support-Tickets und das alte
System konnte einfach nicht mithalten, also begann ich, mich umzusehen.
Das ist die unbearbeitete Vorschau. Die beiden Stimmen sind getrennt, jede Zeile ist mit einem Zeitstempel versehen und der Wortlaut ist klar. Sie melden sich an, laden die vollständige 38-Minuten-Datei hoch und ein paar Minuten später ist das vollständige Transkript in derselben Form fertig. Sprecher A sind Sie und Sprecher B Ihr Interviewpartner. Sie klicken also auf die Bezeichnung „Sprecher A“, geben Ihren Namen ein und klicken auf „Sprecher B“, um seinen Namen einzugeben. Beide benennen das gesamte Dokument in einem Durchgang um. Sie exportieren nach DOCX, öffnen es in Ihrem Textverarbeitungsprogramm, korrigieren die zwei oder drei Stellen, an denen ein Produktname phonetisch buchstabiert wurde, und schon haben Sie ein fertiges Interviewtranskript. Die 38 Minuten gingen zu Ende, weshalb die kostenlosen 30 Minuten praktisch für einen ersten echten Job und nicht nur für einen Testclip sind.
Häufige Probleme und wie man sie behebt
Die meisten enttäuschenden Transkripte gehen auf die Aufnahme zurück, nicht auf die Engine. Dies sind die Probleme, die am häufigsten auftreten, und was man dagegen tun kann.
Die Aufnahme ist leise oder matschig. Wenn die Stimmen leise sind oder der Raum dröhnt, hat die Engine weniger Arbeit und die Genauigkeit nimmt ab. Ein Mikrofon in der Nähe des Sprechers, ein Ansteckmikrofon oder ein Headset innerhalb von 10 bis 20 Zentimetern Entfernung zum Mund machen einen größeren Unterschied als jede andere Einstellung. Ein großer, kahler Raum fügt Echo hinzu, das die Grenzen zwischen den Klängen verwischt; ein kleinerer oder weich eingerichteter Raum zeichnet sich besser aus. Sie können dies nicht im Nachhinein beheben, daher lohnt es sich, gleich zu beginnen, bevor Sie das nächste Mal auf „Aufnahme“ klicken.
Zwei Personen sprechen gleichzeitig. Wenn sich Stimmen überschneiden, werden sowohl der Wortlaut als auch die Frage, wer was gesagt hat, schwieriger, da zwei Sätze von Lauten im selben Audioausschnitt konkurrieren. Es gibt keine saubere Softwarelösung für echte Überlappungen. Bei einer Aufnahme, die Sie steuern, zahlt es sich später aus, zwischen den Runden einen Takt zu lassen. In einem Fall, den Sie nicht wiederholen können, erwarten Sie ein paar überkreuzte Zeilen um die Unterbrechungen und ordnen Sie sie von Hand.
Ein Fachbegriff ist falsch. Allzweckmodelle kennen die Alltagssprache gut, haben aber nicht unbedingt den Jargon Ihrer Branche, einen ungewöhnlichen Nachnamen oder einen Produktnamen gesehen. Diese werden eher anhand ihres Klangs als anhand ihrer Schreibweise transkribiert. Durch Suchen und Ersetzen im exportierten DOCX wird ein wiederkehrender Begriff in Sekundenschnelle gelöscht, was einer der Gründe dafür ist, dass DOCX der am einfachsten zu korrigierende Export ist.
Eine Datei wird nicht geladen. Die meisten Standard-Audio- und Videodateien funktionieren einfach. Lehnt man ab, handelt es sich meist um einen ungewöhnlichen oder sehr alten Behälter. Die Konvertierung in eine einfache MP3- oder WAV-Datei mit den kostenlosen in-Browser-Tools, die auf Ihrem Gerät ausgeführt werden und nichts hochladen, löst das Problem fast immer. Wenn ein Format immer noch nicht funktioniert, senden Sie eine E-Mail an support@hushscript.com und das Team wird es hinzufügen.
Ein Sprecher wird in zwei geteilt. Gelegentlich wird dieselbe Person als zwei Sprecher bezeichnet, normalerweise weil sich ihre Stimme im Laufe der Zeit geändert hat: Sie sind näher an das Mikrofon herangetreten, haben von einem Headset auf eine Freisprecheinrichtung umgestellt oder die Leitungsqualität hat sich geändert. Die Engine gruppiert nach dem Klang einer Stimme, sodass eine große Veränderung als neue Person wahrgenommen werden kann. Das Zusammenführen der beiden Beschriftungen im Editor behebt das Problem in einem Schritt. Die Mechanismen hierzu finden Sie in der Anleitung zur Funktionsweise der Sprecherdiarisierung.
Genauigkeit und Akzente
Die Akzentabdeckung hängt vom Modell und der Sprache ab. Für Englisch beherrschen Modelle, die auf breiten Datensätzen trainiert wurden, US-amerikanisches, britisches, australisches und indisches Englisch gut, und Hushscript bietet vier verschiedene englische Akzente. Ein starker regionaler Dialekt oder eine weniger vertretene Akzentvariante muss etwas stärker korrigiert werden, aber Sie bearbeiten immer noch einen Entwurf, anstatt aus dem Nichts zu tippen.
Ein paar Gewohnheiten erhöhen die Genauigkeit jeder Aufnahme, unabhängig vom Akzent. Nehmen Sie mit einem nahegelegenen Mikrofon auf. Lassen Sie jede Person ausreden, bevor die nächste beginnt. Vermeiden Sie große, hallende Räume. Ein mäßiges Sprechtempo lässt sich besser transkribieren als ein Sprint mit mehr als 200 Wörtern pro Minute. Und eine angemessene Bitrate ist wichtig: Eine 128-kbit/s-MP3-Datei ist in Ordnung, während stark komprimierte Sprachnachrichten im Schmalbandformat an Details verlieren, die die Engine benötigt. Einen ausführlicheren Überblick über die Formate und deren Besonderheiten finden Sie unter So transkribieren Sie jede Audiodatei.
Hushscript erkennt die Sprache automatisch und transkribiert ungefähr 99 Sprachen, in 18 davon mit höchster Genauigkeit. Eine Aufnahme, die in einer Sprache bleibt, lässt sich am saubersten transkribieren; Das Wechseln der Sprache mitten im Satz ist für jede Engine schwierig.
Sprecherlabels im selben Durchgang
Das Trennen der Sprecher, offiziell Sprecherdiarisierung genannt, läuft parallel zur Spracherkennung und ist kein zweiter Job, für den Sie extra bezahlen. Sie erhalten die Wörter und die Namensnennung zusammen, kostenlos für jedes Transkript. Bei einem Zwei-Personen-Interview oder einer kleinen Besprechung ist diese Trennung in der Regel korrekt und erspart Ihnen die mühsame Arbeit, jede Zeile von Hand mit Tags zu versehen. Es gibt keine Obergrenze für die Anzahl der Sprecher, die eine Datei aufnehmen kann. Die Genauigkeit ist jedoch am höchsten, wenn die Stimmen unterschiedlich sind, sich nicht überschneiden und nicht gleich klingen. Die Tatsache, dass jedem Transkript ohne zusätzliche Kosten eine Sprecherlabel beiliegt, ist die Art von ehrlichem Detail, auf dem dieser ganze Ansatz basiert: Der nützliche Teil ist enthalten und wird nicht hinter einer höheren Ebene zurückgehalten.
Der einfache Unterschied, an dem man festhalten sollte, ist dieser. Wenn Sie Sprache während des Sprechens, der Spracheingabe oder des Diktats erfassen möchten, greifen Sie zum Live-Tool, das in Ihr Gerät oder Textverarbeitungsprogramm integriert ist. Wenn Sie bereits über eine Aufnahme verfügen, die Sie als Text benötigen, ist das Transkribieren von der Audio-in-Text-Seite schneller und genauer und liefert Ihnen Sprecherlabels und eine exportierbare Ausgabe in einem einzigen Schritt.
Unabhängige Quellen und Standards
Hushscript hat diese unabhängigen, nicht konkurrierenden Quellen herangezogen. Sie erläutern Forschung, Standards oder Plattformfunktionen und stellen keine Empfehlung durch Hushscript dar.
Quellen geprüft am: