So transkribieren Sie ein Interview (privat)
Autor: Hushscript Veröffentlicht: Zuletzt geprüft:
Ein Interview gut zu transkribieren bedeutet zwei Dinge gleichzeitig: korrekter Text und klare Zuordnung. Eine Wand aus Wörtern, bei der man nicht sagen kann, wer was gesagt hat, ist fast so aufwändig wie die Rohaufnahme. Und wenn es sich um ein sensibles Gespräch, eine rechtliche Angelegenheit, eine vertrauliche Quelle oder eine Personalsituation handelt, ist die Art und Weise, wie mit dem Ton umgegangen wird, genauso wichtig wie das Transkript selbst. Dieser Leitfaden deckt den gesamten Bogen ab: sauberen Ton vor der Aufnahme, die Transkription durchführen, Interviewer und Betreff getrennt halten, mit Zeitstempeln genau zitieren und das Ganze privat halten.
Was Sie brauchen, bevor Sie beginnen
Die Liste ist kurz. Sie benötigen eine Aufzeichnung des Interviews als Audio- oder Videodatei. Hushscript akzeptiert jedes gängige Format, sodass eine Telefon-Sprachnotiz, eine Zoom-Aufnahme, das WAV eines speziellen Rekorders oder eine MP4-Bildschirmaufnahme ohne Konvertierung funktionieren. Sie benötigen die Zustimmung aller erfassten Personen, die im Folgenden behandelt wird und nicht optional ist. Und Sie benötigen eine Möglichkeit, das Transkript anzuzeigen und zu bearbeiten, nämlich die Hushscript-App in Ihrem Browser. Keine Installationen, keine Plugins.
Sie müssen keine Sprache auswählen. Hushscript erkennt es automatisch in rund 99 Sprachen, sodass ein zweisprachiges Interview oder ein Betreff, der mitten im Satz wechselt, gehandhabt wird, ohne dass Sie etwas einstellen müssen. Wenn Sie die vollständige Liste sehen möchten, finden Sie sie auf der Sprachenseite.
Vor der Aufnahme
Die Audioqualität zum Zeitpunkt der Aufnahme ist der wichtigste Faktor für die Transkriptgenauigkeit. Keine Transkriptionsmaschine, weder automatisch noch menschlich, kann ein Wort wiederherstellen, das das Mikrofon nie klar erfasst hat. Ein paar Besonderheiten zahlen sich mehr aus als alles, was Sie später tun.
Mikrofonplatzierung. Bei einem persönlichen Interview ist ein kleiner Rekorder, der auf dem Tisch mit gleichem Abstand zu beiden Sprechern platziert wird, besser als ein Telefon, das Sie in Ihrer Tasche gelassen haben. Wenn Sie jeder Person ein eigenes Mikrofon geben können, tun Sie es: Zwei saubere Eingänge lassen sich leichter trennen als ein gemischter Raum. Nehmen Sie bei Remote-Interviews in einem Videoanruf jede Seite als eigene Spur auf, wenn die Plattform dies zulässt, da sich zwei Spuren sauberer trennen als ein einzelner heruntergemischter Stream.
Eine ruhige Umgebung. HVAC-Brummen, Verkehr durch ein Fenster, Hintergrundgeräusche eines Cafés und der Hall eines kahlen Raums beeinträchtigen die Genauigkeit. Ein kleiner, mit Teppich ausgelegter Raum oder sogar ein Schrank mit hängenden Kleidungsstücken klingt besser als ein Großraumbüro. Im Feld hilft ein auf Ihr Motiv gerichtetes Richtmikrofon dabei, seine Stimme über die Umgebung hinauszuheben.
Zustimmung, vor allem anderen. Das Aufnehmen einer Person ohne deren Wissen ist vielerorts illegal und überall inakzeptabel. Sagen Sie Ihrem Motiv, dass Sie aufnehmen, bevor Sie beginnen. In einigen Gerichtsbarkeiten ist die Zustimmung einer Partei erforderlich, aber in einigen, darunter einigen US-Bundesstaaten und vielen Ländern, ist die Zustimmung aller Anwesenden erforderlich. Lassen Sie sich im Zweifelsfall gleich nach Beginn der Aufnahme ein ausdrückliches Ja aussprechen, damit die Vereinbarung Teil der Datei ist.
Sinnvolle Formateinstellungen. Sie benötigen keine Studioqualität. WAV oder MP3 mit 128 kbps oder höher ist ausreichend, und eine Abtastrate von 16 kHz oder mehr ist komfortabel. Das Einzige, was Sie vermeiden sollten, ist die Komprimierung auf Telefonqualität, etwa 8 kHz, wo Konsonanten ineinander verschmieren und die Genauigkeit merklich abnimmt.
Transkribieren Sie das Interview Schritt für Schritt
Der Ablauf ist so aufgebaut, dass Sie die Qualität sehen können, bevor Sie sich verpflichten. Hier ist die tatsächliche Reihenfolge.
- Legen Sie Ihre Aufnahme unter /audio-to-text ab. Wenn es sich um ein Video handelt, wird der Ton zuerst in Ihrem Browser extrahiert, sodass die Videodatei selbst Ihr Gerät nie verlässt. Von hier aus ist nur der Ton beteiligt.
- Lesen Sie die 30-Sekunden-Vorschau. Hushscript transkribiert die erste halbe Minute und zeigt sie Ihnen mit bereits angewendeten Sprecherlabels an, bevor Sie ein Konto erstellen. Dies ist der Schritt ohne Konto: Sie können die Sprechertrennung und den Wortlaut anhand Ihrer tatsächlichen Datei beurteilen, nicht anhand einer Demo.
- Melden Sie sich an, um den Rest zu transkribieren. Durch die Erstellung eines Kontos wird die vollständige Transkription freigeschaltet. Neue Konten erhalten 30 kostenlose Minuten zum Ausprobieren, genug für ein kurzes Interview oder einen Teil eines langen Interviews. Danach ist Hushscript nutzungsabhängig und ohne Abonnement erhältlich, sodass Sie Minuten nur dann kaufen, wenn Sie sie benötigen.
- Umbenennen und exportieren. Das fertige Transkript wird als eine Zeile pro Äußerung zurückgegeben, jede mit einer Sprecherlabel und einem Zeitstempel versehen. Benennen Sie die Beschriftungen in echte Namen um und exportieren Sie sie dann.
Ein Hinweis zu den kostenlosen Minuten, da die Leute fragen, wie der „kostenlose“ Teil funktioniert. Die 30 Minuten werden einmalig gewährt. Der schnellste Weg, sie zu entsperren, ist eine schnelle Kartenprüfung: Zur Bestätigung der Karte wird eine Vormerkung in Höhe von 1 $ vorgenommen und dann sofort freigegeben, ohne dass eine Belastung erfolgt. Wenn Sie lieber anders bezahlen möchten, funktioniert auch eine in Ihrem Land verfügbare alternative Methode, und die 30 Minuten kommen bei Ihrem ersten Einkauf zum Tragen. Eine Karte ist in beiden Fällen nicht erforderlich.
Halten Sie den Interviewer und den Betreff getrennt
Hier wird ein Interviewtranskript nutzbar und nicht ein Transkript, das Sie sich ohnehin noch einmal anhören müssen. Die Funktion Sprechererkennung weist jeder einzelnen Stimme eine eigene Bezeichnung zu, ohne dass eine Einrichtung oder zusätzliche Kosten erforderlich sind. Für ein Zwei-Personen-Interview bedeutet das einen Dialog wie diesen:
Sprecher A [00:00:07]: Können Sie mich auf die Zeit zurückversetzen, als Ihnen zum ersten Mal klar wurde, dass das Projekt in Schwierigkeiten steckte?
Sprecher B [00:00:13]: Es war Anfang 2019. Ich leitete den Rollout und die Zahlen summierten sich einfach nicht mehr.
Sprecher A [00:00:28]: Und was hast du dagegen gemacht?
Sprecher B [00:00:31]: Ehrlich gesagt, zunächst nichts. Das ist der Teil, den ich bereue.
Um echte Namen hinzuzufügen:
- Klicken Sie im Transkript auf eine beliebige Instanz von „
Sprecher A“. - Geben Sie den gewünschten Namen ein, zum Beispiel „Interviewer“ oder den Namen Ihres Probanden.
- Jede Zeile dieses Sprechers Aktualisierungen auf einmal.
Sie tun dies einmal pro Sprecher. Bei einem 90-minütigen Zwei-Personen-Interview dauert der gesamte Durchgang weniger als eine Minute und am Ende erhalten Sie ein angebotsfertiges Dokument, in dem jede Zeile einer namentlich genannten Person zugeordnet ist. Wenn Sie im Detail wissen möchten, wie diese Trennung tatsächlich unter der Haube funktioniert, führen wir Sie wie die Sprecherdiarisierung funktioniert im Klartext durch.
Ein praktisches Beispiel: ein einstündiges Forschungsinterview
Angenommen, Sie haben ein 58-minütiges Forschungsinterview auf Ihrem Telefon als .m4a-Datei aufgezeichnet. Im Raum war es ruhig, Sie befanden sich beide in der Nähe des Telefons und es gab die üblichen kleinen Überschneidungen, wenn Ihr Motiv animiert wurde.
Sie legen die Datei unter /audio-to-text ab. Die 30-sekündige Vorschau zeigt Ihre Eröffnungsfrage als Sprecher A und die erste Antwort Ihres Probanden als Sprecher B, was Ihnen sagt, dass die Trennung sauber ist. Sie melden sich an und lassen die vollständige Datei transkribieren. Ein 58-minütiges Vorstellungsgespräch verbraucht 58 Minuten Ihres Guthabens, sodass die 30 Freiminuten etwas mehr als die Hälfte abdecken und Sie den Rest aufstocken.
Das Transkript liest sich wie ein klares Hin und Her. Sie klicken auf den ersten „Sprecher A“, geben Ihren eigenen Namen ein, klicken auf den ersten „Sprecher B“, geben den Namen Ihres Betreffs ein und das gesamte Dokument wird aktualisiert. Beim Durchblättern bemerken Sie drei kurze Abschnitte, in denen die Engine Ihr Motiv in ein zweites Etikett aufteilte, weil es vom Telefon weggebeugt war, sodass Sie diese wieder zusammenfügen. Sie exportieren Ihre Notizen nach DOCX und nach JSON, damit Ihr Analyseskript jede Äußerung mit Startzeit, Endzeit und Sprecher abrufen kann. Gesamte praktische Zeit nach dem Hochladen: ein paar Minuten.
Genaues Zitieren mit Zeitstempeln
Jede Äußerung im Transkript trägt einen Zeitstempel, der das Zitieren aus der Ausgabe sicher macht. Wenn Sie ein Angebot für einen Artikel, einen Bericht oder eine Arbeit einholen, achten Sie auf den Zeitstempel daneben. Das gibt Ihnen einen genauen Punkt, auf den Sie während der Faktenprüfung zurückgreifen können, gibt einem Redakteur die Möglichkeit, das Zitat zu überprüfen, und gibt Ihnen einen Hinweis darauf, wenn eine Quelle später ihre Aussage bestreitet. Wie sehr ein Zitat aufgeräumt werden muss, wenn man es einmal hat, ob man jeden Fehlanfang beibehält oder den Wortlaut in saubere Prosa glättet, ist eine Stilwahl, die es wert ist, absichtlich getroffen zu werden, und sauberes wörtliches Wort versus wahres wörtliches Wort legt beide Konventionen fest.
Der DOCX-Export behält die Zeitstempel inline. Wenn Sie die Rohstruktur benötigen, liefert Ihnen der JSON-Export Daten auf Äußerungsebene, wobei jeder Eintrag eine Startzeit, eine Endzeit, einen Sprecher und einen Text enthält, die Sie programmgesteuert verarbeiten können. Der TXT-Export ist die saubere Lesekopie, und SRT bietet Ihnen zeitgesteuerte Untertitelzeilen, wenn das Interview unter einem Video stehen soll.
Eine wissenswerte Einschränkung: Zeitstempel beziehen sich auf die Äußerungsebene, nicht auf das einzelne Wort. Bei den meisten Vorstellungsgesprächen ist das genau das, was Sie wollen, da Sie einen Satz und keine Silbe zitieren. Wenn Sie zum Brennen von Untertiteln auf Filmmaterial speziell ein Timing auf Wortebene benötigen, ist das SRT-Zeilentiming für fast jeden Zweck nah genug.
Häufige Probleme und wie man sie behebt
Die meisten Interviewaufzeichnungen lassen sich sauber transkribieren. Wenn etwas nicht stimmt, ist es fast immer eines von wenigen Problemen, und für jedes lässt sich eine einfache Lösung finden.
Ein Sprecher ist in zwei Etiketten aufgeteilt. Das ist das häufigste unerwartete Ergebnis. Dies bedeutet in der Regel, dass sich der Ton der Person im Laufe des Gesprächs verändert hat: Sie hat sich dem Mikrofon angenähert oder entfernt, von einem Headset auf die Freisprecheinrichtung umgeschaltet oder die Leitungsqualität hat sich während eines Anrufs verändert. Die Engine gruppiert sich nach dem Klang einer Stimme, sodass eine große Verschiebung als neue Stimme gelesen werden kann. Führen Sie die beiden Beschriftungen im Editor zusammen und das Problem wird in einem Durchgang behoben, wie im obigen Beispiel.
Zwei Personen wurden zu einer Beschriftung zusammengeführt. Das Gegenteil. Dies geschieht, wenn zwei Stimmen wirklich ähnlich sind oder wenn die Aufnahme leise ist und die Unterschiede kaum zu hören sind. Es ist schwieriger, das Problem im Nachhinein sauber zu beheben, weshalb zwei separate Eingaben zur Aufnahmezeit, eine pro Person, die beste Versicherung dagegen sind.
Übersprechen und Übersprechen von Personen. Wenn beide gleichzeitig sprechen, hat jeder Transkribierer, ob automatisch oder menschlich, Probleme, weil sich die Wörter im Audio physisch überlappen. Erwarten Sie, dass die hektischsten Momente eines hitzigen Interviews ein manuelles Zuhören erfordern. Mit den Zeitstempeln können Sie diese Momente schnell finden.
Starke Akzente oder Fachbegriffe. Die Genauigkeit bleibt bei allen Akzenten gut erhalten, aber bei unbekannten Eigennamen, Fachjargon und Namen gerät die automatische Transkription am wahrscheinlichsten ins Wanken. Führen Sie einen Such- und Ersetzungsdurchlauf für die wenigen Namen und Begriffe durch, die für Ihr Vorstellungsgespräch spezifisch sind, und bestätigen Sie alle, die Sie zitieren möchten. Wenn es sich bei dem Interview um ein klinisches oder wissenschaftliches Gespräch mit viel Fachvokabular handelt, erfahren Sie in der medizinischen Transkription für Diktate und Interviews, wie mit diesen Begriffen umzugehen ist.
Eine ruhige oder entfernte Aufnahme. Wenn das Motiv weit vom Mikrofon entfernt war oder leise sprach, nimmt die Genauigkeit allgemein ab und es gibt keine nachträgliche Software-Korrektur. Um dies zu verhindern, gibt es den Abschnitt „Bevor Sie aufnehmen“. Wenn Sie bei einer schwachen Aufnahme nicht weiterkommen, transkribieren Sie sie trotzdem als Entwurf und korrigieren Sie sie dann anhand der Audiodaten.
Eine sehr lange oder große Datei. Eine Aufnahme kann bis zu 10 Stunden dauern, ohne Beschränkung der Dateigröße – selbst eine sehr große Aufnahme wird direkt im Browser vorbereitet. Teilen Sie nur Aufnahmen, die das 10-Stunden-Limit überschreiten, mit einer natürlichen Pause auf und transkribieren Sie dann jeden Teil.
Audioquelle oder Videoquelle: welche hochzuladen ist
Wenn Sie sowohl eine Audiodatei als auch ein Video desselben Interviews haben, laden Sie eine davon hoch. Das Transkript ist identisch, da Hushscript in beiden Fällen mit dem Ton arbeitet. Der praktische Unterschied liegt in der Privatsphäre. Wenn Sie ihm ein Video geben, wird der Ton in Ihrem Browser extrahiert und nur dieser Ton wird gesendet, sodass das Video, oft das identifizierendere und sensiblere Artefakt, Ihren Computer nie verlässt. Für ein sensibles Interview ist das die bessere Vorgabe. Wenn Sie bereits über eine reine Audiodatei verfügen, ist das Hochladen diese am einfachsten.
Sensible Interviews privat halten
Bei Interviews, die rechtliche Angelegenheiten, vertrauliche Quellen, HR-Fälle oder persönliche Offenlegungen betreffen, ist die Art und Weise, wie mit dem Audio umgegangen wird, über die Transkriptqualität hinaus von Bedeutung. Hushscript wurde genau dafür entwickelt.
Das Audio wird vom Server gelöscht, sobald das Transkript fertig ist. Es gibt kein Aufbewahrungsfenster und keine Sicherungskopie der Aufzeichnung, die danach irgendwo verbleibt. Wenn Sie ein Video hochgeladen haben, wurde immer nur der extrahierte Ton gesendet, und auch dieser ist weg. Die Sprach-Engine trainiert Ihre Aufzeichnungen nicht, sodass nichts, was Sie einreichen, einem Modell zugeführt wird.
Die Transkripte selbst werden im Ruhezustand verschlüsselt. Im Klartext: Sollte es jemals zu einem Angriff auf den Speicher kommen, würde ein Angreifer unlesbaren Chiffretext vorfinden, nicht die Worte Ihres Opfers. Dabei handelt es sich um einen Leckschutz und nicht um die Behauptung, dass wir Ihre Transkripte nicht lesen können: Der Schlüssel liegt auf unserer Seite, damit das Produkt Ihnen Ihre eigene Arbeit zeigen kann. Dies bedeutet jedoch, dass ein Datenleck, die realistische Bedrohung für jedes Cloud-Tool, keine lesbaren Interviewinhalte weitergibt.
Treffen Sie in den schlimmsten Fällen, Quellenschutz im Journalismus, privilegiertes Rechtsmaterial, die übliche Vorsichtsmaßnahme: Bewahren Sie Ihre eigene Offline-Kopie des Audios und des fertigen Transkripts auf einem von Ihnen kontrollierten Gerät auf und behandeln Sie keinen Cloud-Dienst, einschließlich dieses, als einzige Kopie. Wenn Sie sich einen vollständigen Überblick über die Datenverarbeitung verschaffen möchten, finden Sie auf der Seite Private Transkription weitere Informationen.
Wenn es sich bei Ihrer Aufzeichnung um einen Multi-Host-Podcast und nicht um ein Einzelinterview handelt, ist der Arbeitsablauf derselbe und Wie man einen Podcast transkribiert behandelt die Besonderheiten bei mehreren Stimmen.
Unabhängige Quellen und Standards
Hushscript hat diese unabhängigen, nicht konkurrierenden Quellen herangezogen. Sie erläutern Forschung, Standards oder Plattformfunktionen und stellen keine Empfehlung durch Hushscript dar.
Quellen geprüft am: