Zum Hauptinhalt springen

Sprecherdiarisierung: So funktionieren Sprecherlabels

Autor: Veröffentlicht: Zuletzt geprüft:

Sprecherdiarisierung ist der automatische Prozess, bei dem eine Aufnahme nach Sprecher in Segmente unterteilt wird und die Frage „Wer hat wann gesprochen?“ beantwortet wird. bevor irgendein Mensch das Transkript liest. Die aktuelle Sprecherdiarisierungsforschung in der ACL Anthology beschreibt dieselbe Aufgabe für Gespräche mit mehreren Teilnehmern. Es ist der Unterschied zwischen einer Wortwand und einem strukturierten Gespräch, und es ist der Grund, warum ein Transkript eines Zwei-Personen-Interviews als lesbarer Dialog und nicht als ein langer Absatz zurückkommt.

Im Klartext: Sie laden eine Aufnahme hoch, die Diarisierungs-Engine findet die Stellen, an denen sich die Stimme ändert, gruppiert die Segmente, die wie dieselbe Person klingen, und gibt ein Transkript zurück, das sich wie ein Skript liest: eine Zeile pro Runde, beschriftet mit der Stimme. In diesem Beitrag wird erklärt, wie das funktioniert, warum Diarisierung nicht dasselbe ist wie das Erkennen einer Stimme und wie man die generischen Bezeichnungen in echte Namen umwandelt.

Sprecherdiarisierung im Klartext

Bild der handschriftlichen Transkription eines 90-minütigen Interviews. Nachdem Sie die Rede in Text umgewandelt haben, fügen Sie als Nächstes die Zuschreibungen hinzu: „Interviewer:“, „Betreff:“, hin und her, jedes Mal, wenn sich die Stimme ändert. Diese Attributionsarbeit, bei der entschieden wird, wer zu einem bestimmten Zeitpunkt spricht, ist genau das, was die Diarisierung für Sie leistet.

Die Ausgabe ist ein Transkript im Dialogformat:

Sprecher A [00:00:12]: Das erste, was Sie verstehen müssen, ist, dass die Daten nur für einen Moment existieren.
Sprecher B [00:00:27]: Richtig, und das ist der Teil, den die meisten Leute erst erkennen, wenn es zu spät ist.
Sprecher A [00:00:34]: Genau. Die eigentliche Frage ist also, was Sie in diesem Fenster tun.

Jede Äußerung ist an einen Sprecher und einen Zeitstempel gebunden. Anschließend können Sie „Sprecher A“ und „Sprecher B“ in echte Namen umbenennen; Eine Bearbeitung pro Sprecher, und die Beschriftung wird überall dort aktualisiert, wo sie erscheint.

Die Alternative, ein einfaches Transkript ohne Tagebuchführung, ist ein fortlaufender Textblock, bei dem Sie den Ton erneut abspielen müssen, um herauszufinden, wer was gesagt hat. Für alles, was länger als ein paar Minuten mit zwei oder mehr Stimmen dauert, ist das echte manuelle Arbeit, und das ist die Arbeit, die durch den Diarisierungsdurchlauf entfällt.

Was Sie vor dem Start benötigen

Es müssen keine Einstellungen konfiguriert und nichts installiert werden. Die Diarisierung erfolgt auf der Aufnahme selbst, daher ist die einzige wirkliche Voraussetzung Audio, bei dem die Sprecher einigermaßen unterschiedlich sind:

Das ist alles. Keine Mikrofonregistrierung, keine Sprachproben, keine Einrichtung pro Sprecher.

So funktioniert die automatische Sprecheridentifizierung

Die Diarisierung gliedert sich in einige verschiedene Phasen. Wenn man sie kennt, ist die Ausgabe leichter zu lesen und einfacher zu beheben, wenn etwas nicht stimmt.

Feature-Extraktion. Das Audio wird in kurze Frames aufgeteilt, typischerweise jeweils 10 bis 40 Millisekunden, und die Engine misst akustische Features in jedem Frame. Die für die Unterscheidung von Sprechern wichtigen Merkmale liegen im Frequenzbereich: Tonhöhe, Formanten und Spektralmuster, die innerhalb der Stimme einer Person tendenziell konsistent bleiben und sich zwischen Menschen unterscheiden.

Segmentierung. Die Engine sucht nach Sprecherwechselpunkten: Momenten, in denen sich diese Stimmeigenschaften verschieben. Das ist der schwierige Teil. Eine Änderung kann mitten im Satz erfolgen, wenn jemand unterbricht, und Lärm oder überlappende Sprache können eine echte Grenze verbergen oder eine falsche erfinden.

Clustering. Segmente, die wie dieselbe Stimme klingen, werden gruppiert. Dem Motor wird nicht mitgeteilt, wie viele Personen sich im Raum befinden; Es leitet die Anzahl der Sprecher aus dem Audio ab. Wenn Sie die Anzahl im Voraus kennen, können Sie sie bei einigen Setups angeben. Wenn nicht, schätzt die Engine dies, wodurch die meisten Fehler wie „eine Person in zwei aufteilen“ und „zwei Personen in eine zusammenführen“ entstehen.

Beschriftung. Jeder Cluster erhält eine Beschriftung:Sprecher A,Sprecher B,Sprecher C oder Sprecher 0.Sprecher 1. Die Beschriftungen sind beliebige Platzhalter. Dahinter steckt keine Identität, sondern nur ein stabiler Griff für eine Stimme während der gesamten Aufnahme.

Die gesamte Pipeline läuft als automatisierter Durchgang neben der Transkription, sodass Sie keinen separaten Job zur Sprecherlabel ausführen müssen.

Diarisierung vs. Spracherkennung

Diese beiden werden ständig miteinander vermischt, beantworten aber unterschiedliche Fragen.

Diarization fragt: Wer spricht in diesem Moment im Vergleich zu den anderen Stimmen in dieser Datei? Es trennt die Stimmen, hat aber keine Ahnung, zu wem sie gehören. Es erfordert keine Vorkenntnisse und zeichnet keine Stimme auf, nachdem die Arbeit erledigt ist.

Die Spracherkennung, auch Sprecheridentifikation genannt, fragt: Ist dies dieselbe Person wie in einer bekannten Referenzaufnahme? Zum Vergleich ist eine registrierte Stimmprobe erforderlich, und es handelt sich um die Technologie, die hinter Systemen zur „Verifizierung Ihrer Identität per Stimme“ steht.

Hushscript verwendet Diarisierung, keine Spracherkennung. Es gibt keine Datenbank der registrierten Stimmen und Ihre Aufnahme wird niemals mit der anderer verglichen. Die Sprecherlabels werden ausschließlich aus den Stimmmerkmalen in dieser einen Datei abgeleitet.

Diese Unterscheidung ist der Grund dafür, dass Diarization keine Personen für Sie benennen kann. Es kann mit Sicherheit sagen: „Die gleiche Person hat diese 200 Wendungen im Laufe der Stunde gesprochen“, aber es kann nicht sagen, wer diese Person ist. Dieser Schritt liegt bei Ihnen und erfordert einen Klick pro Sprecher. Wenn Sie einen tieferen Einblick in die Art und Weise erhalten möchten, wie Hushscript Aufzeichnungen mit mehreren Sprechern durchgängig verarbeitet, finden Sie auf der Seite Sprecheridentifizierung weitere Informationen.

Ein praktisches Beispiel: ein Treffen mit drei Personen

Angenommen, Sie zeichnen ein 40-minütiges Projekttreffen mit drei Personen in einem Raum auf, die sich ein einzelnes Laptop-Mikrofon teilen, und werden als einzelnes gespeichert .m4a-Datei. Sie geben es ein und nach der Transkription sieht die Ausgabe so aus:

Sprecher A [00:00:04]: Okay, beginnen wir mit dem Startdatum. Wo sind wir?
Sprecher B [00:00:09]: Design ist fertig. Die endgültigen Bildschirme haben wir am Montag übergeben.
Sprecher C [00:00:14]: Das Engineering benötigt noch etwa zwei Wochen für den Zahlungsfluss.
Sprecher A [00:00:21]: Mit zwei Wochen haben wir das versprochene Marketingdatum überschritten.
Sprecher B [00:00:27]: Können wir ohne den neuen Zahlungsfluss und die Nachverfolgung versenden?
Sprecher C [00:00:33]: Nicht sauber. Der alte Ablauf bricht bei der neuen Preisgestaltung ab.

Drei Stimmen, getrennt und beschriftet, mit Zeitstempeln bei jeder Runde. Jetzt benennen Sie um: „Sprecher A“ wird zu „Priya“ (sie leitet das Meeting), „Sprecher B“ wird zu „Tom“, „Sprecher C“ wird zu „Dana“. Nach drei Klicks trägt jede Zeile einen echten Namen, und das Transkript kann mit durchgehend korrekter Zuordnung in die Besprechungsnotizen eingefügt werden.

Dasselbe gilt für ein Zwei-Personen-Interview, einen Vier-Personen-Podcast oder einen zweiseitigen Telefonanruf: Die Engine trennt, was sie hört, und Sie geben die Namen an.

So kennzeichnen Sie Sprecher in Hushscript um

Die Beschriftungen sind absichtlich generisch; Sie zu benennen ist ein schneller Editor-Schritt. Der Ablauf, bevor Sie dort ankommen, ist: Legen Sie Ihre Datei ab und eine 30-sekündige, mit dem Sprecher gekennzeichnete Vorschau wird gerendert, ohne dass ein Konto erforderlich ist. Melden Sie sich an, um den Rest zu transkribieren, und öffnen Sie dann das fertige Transkript. Von dort aus:

  1. Klicken Sie im Transkripteditor auf eine beliebige Sprecherlabel, z. B. „Sprecher B“.
  2. Geben Sie den richtigen Namen ein, z. B. „Tom“.
  3. Jede Instanz dieses Sprechers wird auf einmal aktualisiert, von der ersten bis zur letzten Zeile.

Die Umbenennung erfolgt global, sodass Sie nie dasselbe Etikett zweimal bearbeiten. Bei einem 90-minütigen Interview mit zwei Rednern dauert die vollständige Umbenennung weniger als eine Minute, und am Ende erhalten Sie ein zitatfertiges Transkript, das jede Zeile korrekt zuordnet. Sie können es dann mit den eingebrannten Namen in einem von 21 Formaten wie TXT, SRT, DOCX, PDF und JSON sowie einem passwortgeschützten .husharchive exportieren.

Fehlerbehebung bei häufigen Diarisierungsproblemen

Die Diarisierung ist bei sauberen Aufnahmen zuverlässig und wird schwieriger, je unordentlicher der Ton wird. Die häufigsten Probleme und was man dagegen tun kann:

Überlappende Sprache. Wenn zwei Personen gleichzeitig sprechen, muss die Engine überlappenden Ton einem einzelnen Sprecher zuweisen und kann die Überschneidung falsch kennzeichnen oder ein paar Wörter weglassen. Es gibt keine Lösung in der Software; Der Ton enthält tatsächlich zwei Stimmen im selben Moment. Prävention ist der Hebel: Eine Aufnahme, bei der sich die Leute abwechseln, lässt sich weitaus sauberer protokollieren als eine Aufnahme voller Unterbrechungen. Wo es zu Überschneidungen kommt, erkennt man durch schnelles Ablesen des Audiosignals die wenigen betroffenen Zeilen.

Ähnlich klingende Stimmen. Zwei Sprecher mit ähnlicher Tonhöhe und ähnlichem Akzent (z. B. zwei Männer gleichen Alters oder Geschwister) sind schwerer zu trennen als ein kontrastierendes Paar, da sich ihre Stimmeigenschaften tatsächlich überschneiden. Der Motor kann gelegentlich eine Umdrehung zwischen ihnen wechseln. Durchsuchen Sie das Transkript nach Zeilen, die für den zugewiesenen Sprecher seltsam lesbar sind. Diese müssen manuell neu zugewiesen werden.

Eine Person wird in zwei Labels aufgeteilt. Wenn sich der Ton einer Person während der Aufnahme ändert (sie nähert sich dem Mikrofon, wechselt von einem Headset zur Freisprecheinrichtung oder die Verbindung wird schlechter), kann die Engine die zweite Hälfte als neue Stimme lesen und ein zusätzliches Label erstellen. Führen Sie die beiden zusammen, indem Sie beide mit demselben Namen versehen. Die Duplikate werden in einem Sprecher zusammengefasst.

Zwei Personen werden zu einem Label zusammengefasst. Das Umgekehrte geschieht, wenn zwei leise oder entfernte Stimmen zu ähnlich klingen, als dass die Engine sie aufteilen könnte. Das lässt sich im Nachhinein am schwersten beheben, daher lohnt es sich, es zu verhindern: Platzieren Sie das Mikrofon näher an den Sprechern und vermeiden Sie Aufnahmen von der anderen Seite eines großen Raums.

Fernfeld oder lauter Ton. Ein Laptop-Mikrofon am Ende eines Konferenztisches, ein Telefon auf dem Tisch während eines Gruppenchats oder starkes Raumecho verwischen die Grenzen zwischen den Stimmen. Eine nähere Mikrofonplatzierung hilft jedem Sprecher, und die Reduzierung von Hintergrundgeräuschen (Ventilatoren, Verkehr, Musik) sorgt für eine schärfere Trennung. Die Diarisierungsqualität folgt genau der Audioqualität.

Telefonanrufe werden als zwei separate Dateien aufgezeichnet. Wenn Ihr Rekorder jede Seite eines Anrufs als eigene Monodatei gespeichert hat, sieht die Diarisierung in jeder Datei allein nur eine Stimme. Kombinieren Sie die beiden zuerst zu einer einzigen gemischten Aufnahme, sodass beide Stimmen in einer Datei vorhanden sind, und transkribieren Sie diese dann.

Genauigkeitstipps, die tatsächlich die Nadel bewegen

Ein paar Gewohnheiten machen die Diarisierung merklich besser, und die meisten davon betreffen die Aufnahme, nicht die Software:

Nichts davon muss perfekt sein. Klare Wendungen und eine vernünftige Mikrofonposition sorgen dafür, dass die meisten Aufnahmen saubere Labels erhalten, und der Redakteur kümmert sich um den Rest.

Warum es für Interviews und Besprechungen wichtig ist

Ohne Diarisierung ist ein Transkript eines Gesprächs mit mehreren Personen für seine häufigsten Aufgaben nahezu unbrauchbar:

Mit der Diarisierung ist alles unkompliziert und das Transkript wird zu einem Dokument und nicht zu Rohtext. Für alles, was veröffentlicht oder zitiert wird, sei es Journalismus, Recherche oder Podcast-Show-Notizen, ist eine genaue Zuordnung nicht optional, und es spart Zeit, wenn man es aus dem Transkript herausholt, anstatt es aus dem Audio zu rekonstruieren. Für interne Arbeiten wie Besprechungsnotizen, Interviewrecherche oder HR-Aufzeichnungen ist die beschriftete Struktur ebenso wertvoll: Das Scannen eines Dialogs geht viel schneller als das Lesen einer Textwand.

Eine vollständige Anleitung zum Kontext finden Sie unter Wie man ein Interview transkribiert, das die Aufzeichnung, Transkription und Umbenennung für Journalismus und Forschung behandelt, und Anleitung Transkribieren Sie einen Podcast, um Moderatoren und Gäste in einer Episode zu kennzeichnen.

Sprecherlabels sind in jedem Hushscript-Transkript kostenlos

Die Sprecherlabel ist in jedem Hushscript-Transkript ohne zusätzliche Kosten enthalten. Es gibt kein Tagebuch-Add-on, keine separate Tarifstufe dafür und keine Obergrenze dafür, wie viele Sprecher eine Aufnahme haben kann. Hushscript selbst ist eine nutzungsbasierte Bezahlung ohne Abonnement. Zum Ausprobieren stehen Ihnen 30 Freiminuten zur Verfügung. Sie zahlen nur für die Minuten, die Sie danach nutzen. Weitere Informationen finden Sie auf der Preisseite.

Die Sprechertrennung ist kostenlos, da eine Abschrift einer Konversation ohne sie nur eine halbe Abschrift ist: lesbarer Text, ohne dass man weiß, wer ihn gesagt hat. Fügen Sie eine Aufnahme ein, rufen Sie die Beschriftungen automatisch ab, benennen Sie sie mit einem Klick um und exportieren Sie das Ergebnis. Mehr darüber, wie alles zusammenpasst, finden Sie auf der Seite Audio zu Text.

Unabhängige Quellen und Standards

Hushscript hat diese unabhängigen, nicht konkurrierenden Quellen herangezogen. Sie erläutern Forschung, Standards oder Plattformfunktionen und stellen keine Empfehlung durch Hushscript dar.

Quellen geprüft am:

Häufig gestellte Fragen

Was ist Sprecherdiarisierung?

Sprecherdiarisierung ist der Prozess der Segmentierung einer Audioaufnahme in Teile, die verschiedenen Sprechern entsprechen. Das Ergebnis ist ein Transkript, bei dem jede Zeile dem Sprecher zugeordnet ist, der sie gesagt hat („Sprecher A hat dies gesagt, Sprecher B hat das gesagt“), und nicht einem undifferenzierten Textblock. Es beantwortet die Frage „Wer hat wann gesprochen?“ automatisch, bevor jemand das Transkript liest.

Ist die Sprecherdiarisierung dasselbe wie die Spracherkennung?

Nein. Die Diarisierung trennt die Stimmen innerhalb einer Aufnahme und teilt Ihnen mit, dass dieselbe Person diese Abschnitte gesagt hat, weiß aber nicht, wer diese Person ist. Bei der Spracherkennung (Sprechererkennung) wird eine Stimme mit einem bekannten Referenzbeispiel verglichen, um ihr einen Namen zu geben. Diarisierung benötigt keine Referenz und erstellt kein Stimmprofil; Aus diesem Grund werden Sprecher mit „Sprecher A“ und „Sprecher B“ und nicht mit Namen gekennzeichnet.

Wie viele Sprecher kann die Diarisierung verarbeiten?

Hushscript hat keine bezahlte Obergrenze für die Sprecherzahl, aber es gibt keine universelle Zahl, bei der die Diarisierung gleich genau bleibt. Überlappungen, ähnlich klingende Stimmen, Mikrofonabstand und Raumgeräusche spielen eine Rolle. Ein sauberes Panel kann besser trennen als ein lautes Zwei-Personen-Gespräch. Überprüfen Sie daher die Beschriftungen, wann immer es auf die Zuordnung ankommt.

Warum wurde im Transkript eine Person in zwei Sprecher aufgeteilt?

Normalerweise änderte sich zwischendurch die Art und Weise, wie diese Person klingt: Sie rückte näher an das Mikrofon heran oder weiter davon weg, wechselte von einem Headset zur Freisprecheinrichtung oder die Leitungsqualität änderte sich. Die Engine gruppiert nach Stimmmerkmalen, sodass eine große Verschiebung dieser Merkmale als neue Stimme gelesen werden kann. Das Zusammenführen der beiden Bezeichnungen im Editor behebt das Problem in einem Durchgang.

Kann mir die Diarisierung anhand des Namens sagen, wer ein Sprecher ist?

Nein. Diarisierung trennt Sprecher, identifiziert sie jedoch nicht namentlich. Es bezeichnet sie als „Sprecher A“, „Sprecher B“ usw. Sie vergeben im Editor selbst echte Namen, nachdem das Transkript erstellt wurde, und jede Umbenennung gilt für jede Zeile, die der Sprecher gesagt hat.

Funktioniert die Diarisierung des Sprechers bei Telefonanrufaufzeichnungen?

Ja, wenn beide Seiten des Anrufs erfasst werden. Wenn es sich bei der Aufnahme um eine einzelne gemischte Spur mit beiden Stimmen handelt, werden sie durch die Diarisierung wie jede andere Datei mit zwei Sprechern getrennt. Wenn jede Seite als eigene separate Monodatei gespeichert wurde, kombinieren Sie sie zuerst zu einem Mix, damit beide Stimmen in derselben Aufnahme vorhanden sind.

Ist die Sprecheraufzeichnung in jedem Hushscript-Transkript enthalten?

Ja. Jedes Transkript enthält Sprecherlabels ohne zusätzliche Kosten, ohne dass ein separates Add-on erforderlich ist und für die keine höhere Stufe erforderlich ist. Sie können die Beschriftungen nach der Transkription mit einem Klick in echte Namen umbenennen, und der neue Name wird im gesamten Transkript aktualisiert.

Mit 30 kostenlosen Minuten starten

Starten – 30 kostenlose Minuten