Podcast transkribieren und Shownotizen erstellen
Autor: Hushscript Veröffentlicht: Zuletzt geprüft:
Ein Podcast-Transkript verdient seinen Unterhalt doppelt. Es macht die Episode durchsuchbar und zugänglich für Hörer, die lesen statt zuhören, und es liefert Ihnen Rohmaterial für Shownotizen, Zitate und Bildunterschriften, ohne die gesamte Aufnahme erneut abzuspielen. Die Plattformunterstützung ist konkret und nicht theoretisch: Apple Podcasts dokumentiert Transkripte und Kapitelnavigation für Ersteller. Dieser Leitfaden führt Sie Schritt für Schritt durch die Transkription einer Episode, die Kennzeichnung jedes Moderators und Gastes und die Umwandlung der Ausgabe in ein verwendbares Dokument mit Shownotizen.
Der Teil, der am meisten Zeit spart, ist die Sprechertrennung. Ein Transkript, das sich wie ein ungeteilter Textblock liest, ist fast genauso aufwändig wie das Audio selbst. Hushscript beschriftet jede Stimme automatisch und fügt diese kostenlos in jedes Transkript ein, sodass das Gespräch als Gespräch zurückkommt.
Was Sie vor dem Start benötigen
Eine Aufzeichnung der Episode in einem beliebigen gängigen Audio- oder Videoformat. Wenn Sie eine einfache Audiodatei aus Ihrem Editor exportiert haben (MP3, WAV, M4A), funktioniert das direkt. Wenn Ihre einzige Kopie die Videoaufzeichnung von Zoom, Riverside oder Ecamm ist, funktioniert das auch, und der Ton wird daraus in Ihrem Browser abgerufen, sodass das Video nie hochgeladen wird.
Sauberes Quellaudio hilft mehr als alles andere. Sprecherlabels funktionieren am besten, wenn jede Stimme unterschiedlich ist und die Leute nicht ständig übereinander reden. Wenn Sie jeden Teilnehmer auf einer separaten Spur aufgenommen haben, haben Sie bereits einen möglichst sauberen Input. Ein einzelner gemischter Track funktioniert immer noch; Es stützt sich nur stärker auf die Diarisierung, um Stimmen auseinanderzuhalten. Wenn Sie können, nehmen Sie die Stimmen trocken auf und fügen Sie das Musikbett anschließend in Ihrem Editor ein, da ein Jingle, der unter kontinuierlicher Sprache läuft, die Genauigkeit zuverlässig senkt.
Sie benötigen ein Konto, um eine vollständige Episode zu transkribieren. Die 30-Sekunden-Vorschau ist der Schritt ohne Konto, sodass Sie die Sprecherlabels und die Textqualität in Ihrer eigentlichen Datei überprüfen können, bevor Sie sich für irgendetwas anmelden.
Transkribieren Sie die Episode
Der Ablauf folgt der tatsächlichen Trichterreihenfolge: Zuerst Vorschau ansehen, dann anmelden, dann den Rest transkribieren.
- Legen Sie die Datei unter /podcast-transcription. Hushscript schneidet die ersten 30 Sekunden in Ihrem Browser ab und gibt eine mit dem Sprecher gekennzeichnete Vorschau zurück. Für diesen Schritt ist kein Konto erforderlich. Sie sehen genau, wie Moderator und Gast getrennt werden und wie sauber sich der Text in Ihrem eigenen Audio liest.
- Melden Sie sich an, um den Rest zu transkribieren. Sobald Sie Ihre E-Mail-Adresse eingegeben und sich angemeldet haben, laden Sie die vollständige Episode hoch. Neue Konten erhalten einmalig 30 Freiminuten zum Ausprobieren. Der schnellste Weg, sie einzufordern, ist ein Kartenscheck über 1 $, der autorisiert und dann sofort freigegeben wird, ohne dass eine Gebühr erhoben wird. Wenn Sie eine in Ihrem Land verfügbare alternative Zahlungsmethode bevorzugen, gelten die 30 Minuten stattdessen bei Ihrem ersten Einkauf. Eine Karte ist nicht erforderlich.
- Lassen Sie die Transkription laufen und exportieren Sie sie dann. Das Transkript wird mit einer Beschriftung und einem Zeitstempel für jede Äußerung zurückgegeben. Exportieren Sie DOCX für ein Dokument, das Sie in Shownotizen bearbeiten, TXT für einen sauberen Block zum Einfügen in Ihr CMS, SRT für Untertitel in einer Videoversion oder JSON, wenn Ihr Podcast-Host Transkript-Uploads auf Äußerungsebene akzeptiert.
Die 30 Gratisminuten können eine kurze Episode oder einen repräsentativen Abschnitt einer längeren Episode abdecken. Eine 60-minütige Episode verbraucht 60 Minuten von Ihrem Guthaben, sodass nach Ablauf der Probezeit eine Aufladung erforderlich ist.
Beschriften Sie jeden Moderator und Gast
Die Sprecherdiarisierung erfolgt automatisch, sodass Sie nichts einschalten müssen. Bei einer Zwei-Personen-Episode (ein Moderator, ein Gast) wird das Transkript sauber aufgeteilt zurückgegeben, wobei jede Zeile einem von zwei Labels zugeordnet ist. Für ein Panel trennt Hushscript so viele verschiedene Stimmen, wie es hört, ohne Sprecherobergrenze.
So ersetzen Sie die allgemeinen Bezeichnungen durch echte Namen:
- Klicken Sie im Editor auf eine beliebige Instanz von „
Sprecher A“. - Geben Sie den Namen ein, z. B. „Alex“ oder „Host“.
- Jede Instanz dieser Bezeichnung wird im gesamten Transkript auf einmal aktualisiert.
Sie beschriften jede Stimme einmal neu, nicht Zeile für Zeile. Eine Episode für zwei Personen dauert etwa eine Minute; Ein vierköpfiges Gremium braucht ein paar. Nach der Umbenennung lautet ein Teil des Transkripts wie folgt:
Alex [00:03:12]: Zu diesem Zeitpunkt leiteten Sie also das Unternehmen. Was waren die ersten Anzeichen?
Jamie [00:03:19]: Ehrlich gesagt waren es die Zahlen. Wir hatten in einem Quartal einen Rückgang um 40 %.
Alex [00:03:27]: Und Sie konnten es damals nicht erklären?
Jamie [00:03:35]: Seit Wochen nicht. Das war der Teil, der mich auf dem Laufenden gehalten hat.
Das ist die Struktur, die Sie zum Ziehen von Zitaten und zum Schreiben von Kapiteln mit Zeitstempel benötigen. Da sich die Beschriftungen durch die gesamte Datei ziehen, wird eine lange Episode genau einmal beschriftet. Informationen zu den Mechanismen hinter der Stimmtrennung finden Sie unter Funktionsweise der Sprecherdiarisierung.
Wenn die Beschriftungen korrigiert werden müssen
Die Diarisierung ist bei sauberen Aufnahmen korrekt, aber nicht unfehlbar, und es lohnt sich, einige Muster zu kennen, damit Sie sie schnell korrigieren können.
Wenn zwei Gäste sehr ähnliches haben Bei Stimmen kann es vorkommen, dass eine Leitung beim falschen Sprecher landet. Scannen Sie das Transkript mit geöffnetem Audio und ordnen Sie die wenigen falsch zugeordneten Zeilen manuell neu zu. Das ist weitaus schneller, als Sprechernamen von Grund auf einzugeben, da Sie nur Ausnahmen beheben.
Wenn ein ruhiger Co-Moderator, der kaum spricht, in eine andere Bezeichnung aufgenommen wird, geben Sie den Hauptrednern zuerst ihre richtigen Namen und suchen Sie dann nach den wenigen Zeilen, die zur ruhigen Stimme gehören sollten. Bei einer gut getrennten Aufnahme treffen Sie selten auf einen der beiden Fälle, weshalb sich ein separater Track pro Person für die kleine zusätzliche Einrichtung zur Aufnahmezeit lohnt.
Häufige Probleme und was sie tatsächlich verursacht
Die meisten Transkriptionsprobleme sind auf die Aufnahme zurückzuführen, nicht auf das Werkzeug. Es lohnt sich, einige davon zu planen, bevor Sie eine Sendung veröffentlichen.
Übersprechen und Übersprechen von Personen. Dies ist das Schwierigste für jedes System zur Sprechertrennung, da zwei Stimmen gleichzeitig nicht sauber getrennt werden können. Der Text bleibt normalerweise lesbar, aber ein Moment starker Überlappung kann bei einem Sprecher landen oder an der Nahtstelle verschwimmen. Hier hilft bereits eine gute Podcast-Hygiene: Ein Moderator, der Gäste ausreden lässt, produziert als Nebeneffekt ein saubereres Transkript. Wo es doch passiert, korrigieren Sie diese wenigen Zeilen manuell mit dem Audio.
Remote-Gäste wurden auf einer Spur aufgezeichnet. Ein als einzelne gemischte Datei aufgezeichneter Anruf ist schwieriger zu trennen als derselbe Anruf, der als Spur pro Teilnehmer aufgezeichnet wurde. Wenn Ihr Tool die lokale Aufzeichnung pro Teilnehmer unterstützt, verwenden Sie es. Wenn Sie nur die gemischte Datei haben, kommt das Transkript immer noch durch, es ist nur mehr auf die Tagebuchführung angewiesen. In beiden Fällen handelt es sich bei der Audiodatei um den gleichen Upload, sodass zum Zeitpunkt der Transkription nichts anderes zu tun ist.
Starke Akzente und Codewechsel. Hushscript erkennt die Sprache automatisch und transkribiert etwa 99 Sprachen, mit höchster Genauigkeit in achtzehn davon, sodass ein Gast mit einem ausgeprägten Akzent in einer unterstützten Sprache gut behandelt wird. Ein Gast, der mitten im Satz zwischen zwei Sprachen wechselt, ist der wirklich schwierige Fall; Erwarten Sie, dass Sie die vertauschten Phrasen manuell bereinigen. Die vollständige Liste der unterstützten Sprachen finden Sie auf der Sprachenseite.
Intro-Musik und Stingers. Ein Musikbett zwischen den Segmenten wird im Allgemeinen übersprungen und nicht als Unsinn transkribiert. Probleme treten erst dann auf, wenn die Musik über längere Zeit hinweg ununterbrochen läuft. Die saubere Lösung ist redaktionell: Nehmen Sie die Stimmen trocken auf und fügen Sie anschließend die Musik ein, sodass die Transkription immer nur Sprache sieht.
Namen, Fachjargon und Markenschreibweisen. Ein Fachgast wird Begriffe und Produktnamen verwenden, die das Modell möglicherweise phonetisch wiedergibt. Diese lassen sich schnell beheben, da sie sich wiederholen, und ein Suchen-und-Ersetzen-Vorgang im exportierten Dokument behebt einen wiederkehrenden Rechtschreibfehler in einem Durchgang.
Ein paar Tipps zur Genauigkeit
Der größte Hebel ist die Aufnahmequalität, sodass sich der Aufwand für Mikrofone und einen ruhigen Raum bei der Transkription auszahlt. Darüber hinaus liefert eine Spur pro Sprecher sowohl den saubersten Text als auch die saubersten Sprecherlabels, da das System nie zwei Stimmen aus einer Wellenform entwirren muss. Halten Sie das Mikrofon eines Gastes in der Nähe und konsistent, anstatt zu driften, und Sie werden Ihre Bearbeitungszeit mit Substanz statt mit Reparaturen verbringen.
Wenn Sie Korrekturlesen, lesen Sie mit geöffnetem Audio und korrigieren Sie es in Durchgängen: zuerst die Sprecherlabels, dann falsch gehörte Namen und Fachjargon, dann die gelegentlichen Überschneidungen. Das Arbeiten nach Kategorien ist schneller als das Lesen von oben nach unten und Sie erhalten ein Dokument, das sauber genug ist, um es zu veröffentlichen.
Vom Transkript zu Notizen anzeigen
Notizen anzeigen sind keine Zusammenfassung von allem, was gesagt wurde. Sie sind eine Navigationshilfe für Zuhörer und eine Suchoberfläche für Leute, die noch nicht auf Play gedrückt haben. Eine Struktur, die für die meisten Interviews und Gespräche funktioniert, zeigt:
Episodenzusammenfassung, zwei bis vier Sätze. Ziehen Sie das Kernthema aus dem Transkript. Was ist das zentrale Argument, die Geschichte oder die Erkenntnis? Schreiben Sie es für jemanden, der entscheidet, ob er zuhören möchte.
Kapitel mit Zeitstempel. Scannen Sie das Transkript auf Themenwechsel. Jedes Mal, wenn sich das Gespräch einem neuen Thema zuwendet, notieren Sie sich den Zeitstempel und schreiben Sie eine einzeilige Beschreibung. Die Zeitstempel stammen direkt aus dem Transkript, sodass Sie sie nie wieder anhören müssen, um sie zu finden.
[00:02:15] Gründung des Unternehmens ohne Marketingbudget
[00:14:30] Der Umsatzrückgang um 40 % und was ihn verursacht hat
[00:28:44] Neuaufbau: Was sich intern geändert hat
[00:51:00] Ratschläge für Gründer in der gleichen Position
Wichtige Zitate. Ziehen Sie zwei oder drei Zeilen, die die Hauptaussagen der Episode oder ihre zitierfähigsten Momente festhalten. Zitieren Sie wörtlich aus dem Transkript und nennen Sie die einzelnen Texte namentlich dem Sprecher. Ob ein Zitat genau so wiedergegeben werden soll, wie es gesprochen wurde, oder ob Füllmaterial und Fehlstarts gekürzt werden sollen, um klarere Shownotizen zu erhalten, ist eine bewusste Entscheidung, und clean wörtlich vs. wörtlich geht durch beides. Da der Text durchsuchbar ist, dauert es Sekunden, den genauen Wortlaut einer Zeile zu finden, an die Sie sich halb erinnern.
Gastlinks und Ressourcen. Fügen Sie alles hinzu, was der Gast erwähnt hat. Um gesprochene URLs schnell zu finden, durchsuchen Sie das Transkript nach Fragmenten wie „dot com“ oder „slash“; Menschen sagen Webadressen häufiger laut, als Sie erwarten würden, und ein wörtliches Transkript erfasst sie.
Vollständiges Transkript, optional, aber wertvoll. Fügen Sie den vollständigen Text unter den Notizen ein oder verlinken Sie auf eine separate Transkriptseite. Hier lebt der Suchwert, denn der gesprochene Inhalt wird indexierbar. Wenn Ihre Hostplattform das Hochladen von Transkripten akzeptiert, überträgt der JSON-Export Daten auf Äußerungsebene. Ansonsten reicht der Klartext.
Ein funktionierendes Beispiel
Angenommen, Sie haben ein 58-minütiges Gründerinterview in zwei Tracks aufgenommen und diese zu einer MP3 zusammengemischt. Sie legen die MP3-Datei unter /podcast-transcription ab, schauen sich die 30-sekündige Vorschau an, bei der Moderator und Gast korrekt aufgeteilt werden, melden sich an und laden die vollständige Datei hoch. Das Transkript kehrt mit Sprecher A und Sprecher B zurück; Sie benennen sie mit zwei Klicks in „Alex“ und „Jamie“ um. Von dort stammt die Zusammenfassung aus den ersten zwei Minuten, die vier obigen Kapitel stammen aus der Suche nach Themenwechseln und die beiden Zitate stammen aus der Suche im Text nach den Momenten, an die Sie sich erinnern. Von Anfang bis Ende dauern die Notizen zur Show etwa fünfzehn Minuten. Der Großteil davon wird von Ihnen selbst bearbeitet, anstatt zu warten oder zu transkribieren.
Bildunterschriften oder Untertitel hinzufügen
Wenn Sie eine Videoversion der Episode auf einer Plattform wie einem Video-Host, Spotify-Video oder LinkedIn veröffentlichen, ist der SRT-Export eine zeitgesteuerte Untertiteldatei, die zum Hochladen bereit ist. Es ist kein zusätzlicher Schritt erforderlich, da das von Ihnen bereits erstellte Transkript die Zeitdaten enthält. Informationen zum umfassenderen Arbeitsablauf zum Einfügen von Untertiteln in einen Clip, einschließlich eingebrannter Dateien und Sidecar-Dateien, finden Sie unter So fügen Sie Untertitel zu einem Video hinzu.
Wenn Ihr Ausgangspunkt eher eine Videoaufzeichnung als ein Audioexport ist, ist der Vorgang identisch; Das Audio wird zunächst in Ihrem Browser extrahiert. Die Seite Video zu Text deckt diesen Weg vollständig ab.
Lange und mehrteilige Episoden
Für eine Episode in Spielfilmlänge oder eine Live-Aufnahme nimmt Hushscript Uploads mit einer Länge von bis zu 10 Stunden vor, ohne Beschränkung der Dateigröße. Ein vierstündiges Panel oder eine Episode im Dokumentarformat wird als eine Datei durchlaufen und nicht in Teile aufgeteilt, was aus zwei Gründen wichtig ist. Die Sprecherlabels bleiben in der gesamten Datei konsistent, sodass Sie sie einmal neu beschriften müssen. Und die Zeitstempel sind fortlaufend, sodass ein Kapitel nach der Drei-Stunden-Marke „[03:12:40]“ lautet, anstatt im zweiten Teil von Null neu zu beginnen.
Wenn Sie eine mehrteilige Serie in einer Sitzung aufzeichnen, transkribieren Sie die gesamte Sitzung als eine einzelne Datei und teilen Sie die Shownotizen anschließend nach Teilen auf. Das Ausschneiden des Audios zuerst vervielfacht nur den Neuetikettierungsaufwand.
Warum das schnell geht
Bei einem regelmäßigen Veröffentlichungsrhythmus, wöchentlich oder zweimal wöchentlich, wird die Routine „Transkribieren zum Anzeigen von Notizen“ auf Minuten pro Episode komprimiert, wenn Sie dies ein paar Mal getan haben: Datei ablegen, Sprecher neu beschriften, nach Kapiteln suchen, Zitate ziehen, exportieren. Der mühsame Teil entfällt dadurch, dass die Redner-Labels die Namensnennung kostenlos übernehmen. Sie verbringen Ihre Zeit mit der redaktionellen Beurteilung, die Shownotizen tatsächlich benötigen, und nicht damit, herauszufinden, wer was gesagt hat.
Unabhängige Quellen und Standards
Hushscript hat diese unabhängigen, nicht konkurrierenden Quellen herangezogen. Sie erläutern Forschung, Standards oder Plattformfunktionen und stellen keine Empfehlung durch Hushscript dar.
Quellen geprüft am: