Come trascrivere un podcast e creare note dell’episodio
Autore: Hushscript Pubblicato: Ultima revisione:
La trascrizione di un podcast guadagna due volte il suo mantenimento. Rende l’episodio ricercabile e accessibile agli ascoltatori che leggono anziché ascoltare e fornisce materiale grezzo per note dell’episodio, citazioni e didascalie senza riprodurre l’intera registrazione. Il supporto della piattaforma è concreto, non teorico: Apple Podcasts documenta le trascrizioni e la navigazione dei capitoli per gli autori. Questa guida illustra la trascrizione di un episodio, l’etichettatura di ogni conduttore e ospite e la trasformazione del risultato in un documento utilizzabile con note dell’episodio.
La parte che fa risparmiare più tempo è la separazione dei parlanti. Una trascrizione che si legge come un blocco di testo indiviso richiede tanto lavoro da utilizzare quanto l’audio stesso. Hushscript etichetta automaticamente ogni voce e la include gratuitamente in ogni trascrizione, in modo che la conversazione venga restituita come conversazione.
Cosa ti serve prima di iniziare
Una registrazione dell’episodio, in qualsiasi formato audio o video comune. Se hai esportato un semplice file audio dal tuo editor (MP3, WAV, M4A), funziona direttamente. Se la tua unica copia è la registrazione video di Zoom, Riverside o Ecamm, funziona anche questo e l’audio viene estratto da essa nel tuo browser in modo che il video non venga mai caricato.
L’audio sorgente pulito aiuta più di ogni altra cosa. Le etichette dei parlanti funzionano meglio quando ogni voce è distinta e le persone non parlano costantemente tra loro. Se registri ogni partecipante su una traccia separata, hai già l’input più pulito possibile. Una singola traccia mixata funziona ancora; si appoggia maggiormente alla diarizzazione per distinguere le voci. Se puoi, registra le voci asciutte e aggiungi successivamente il letto musicale nel tuo editor, poiché un jingle che suona ininterrotto è l’unica cosa che riduce in modo affidabile la precisione.
Avrai bisogno di un account per trascrivere un episodio completo. L’anteprima di 30 secondi è il passaggio senza account, quindi puoi controllare le etichette dei parlanti e la qualità del testo sul tuo file prima di registrarti per qualsiasi cosa.
Trascrivi l’episodio
Il flusso segue l’ordine reale della canalizzazione: prima l’anteprima, poi registrati, quindi trascrivi il resto.
- Rilascia il file in /podcast-transcription. Hushscript ritaglia i primi 30 secondi nel tuo browser e restituisce un’anteprima con l’etichetta dell’oratore. Non è necessario alcun account per questo passaggio. Puoi vedere esattamente come vengono divisi l’ospite e l’ospite e quanto pulito viene letto il testo sul tuo audio.
- Registrati per trascrivere il resto. Dopo aver inserito la tua email e effettuato l’accesso, caricherai l’episodio completo. I nuovi account ricevono 30 minuti gratuiti di prova, concessi una volta. Il modo più rapido per richiederli è un assegno su carta da $ 1 che viene autorizzato e quindi rilasciato immediatamente, senza mai essere addebitato. Se preferisci un metodo di pagamento alternativo disponibile nel tuo Paese, i 30 minuti arrivano invece con il tuo primo acquisto; non è richiesta una scheda.
- Lascia eseguire la trascrizione, quindi esporta. La trascrizione ritorna con un’etichetta e un timestamp su ogni espressione. Esporta DOCX per un documento che modificherai in note dell’episodio, TXT per un blocco pulito da incollare nel tuo CMS, SRT per i sottotitoli su una versione video o JSON se l’host del tuo podcast accetta caricamenti di trascrizioni a livello di espressione.
I 30 minuti gratuiti possono coprire un breve episodio o una sezione rappresentativa di uno più lungo. Un episodio di 60 minuti utilizza 60 minuti del tuo saldo, quindi è necessario ricaricarlo dopo il periodo di prova.
Etichetta ogni host e ospite
La diarizzazione dei parlanti viene eseguita automaticamente, quindi non devi attivare nulla. Per un episodio a due persone (un conduttore, un ospite), la trascrizione ritorna divisa in modo netto, con ogni riga attribuita a una delle due etichette. Per un pannello, Hushscript separa tutte le voci distinte che sente, senza limiti di parlante.
Per sostituire le etichette generiche con nomi reali:
- Fare clic su qualsiasi istanza di
Parlante Anell’editor. - Digitare il nome, ad esempio “Alex” o “Host”.
- Ogni istanza di quell’etichetta si aggiorna contemporaneamente in tutta la trascrizione.
Rietichetta ogni voce una volta, non riga per riga. Un episodio per due persone dura circa un minuto; un pannello di quattro persone ne richiede alcuni. Dopo la rietichettatura, un tratto della trascrizione si legge così:
Alex [00:03:12]: Quindi a quel punto eri tu a gestire l'azienda. Quali sono stati i primi segnali?
Jamie [00:03:19]: Onestamente, sono stati i numeri. Abbiamo avuto un calo del 40% in un trimestre.
Alex [00:03:27]: E non potevi spiegarlo in quel momento?
Jamie [00:03:35]: Non per settimane. Questa è stata la parte che mi ha tenuto sveglio.
Questa è la struttura di cui hai bisogno per inserire citazioni e scrivere capitoli con timestamp. Poiché le etichette riguardano l’intero file, un episodio lungo viene etichettato esattamente una volta. Per i meccanismi alla base della separazione vocale, vedi come funziona la diarizzazione dei parlanti.
Quando le etichette hanno bisogno di una correzione
La diarizzazione è accurata su registrazioni pulite ma non infallibile e vale la pena conoscere un paio di schemi in modo da poterli correggere rapidamente.
Se due ospiti hanno voci molto simili, una linea occasionale può arrivare all’interlocutore sbagliato. Scansiona la trascrizione con l’audio aperto e riassegna manualmente le poche righe attribuite erroneamente. Questo è molto più veloce che digitare i nomi degli oratori da zero, perché stai solo correggendo le eccezioni.
Se un co-conduttore silenzioso che parla a malapena viene incorporato in un’altra etichetta, dai prima agli oratori principali i loro veri nomi, quindi cerca la manciata di righe che dovrebbero appartenere alla voce calma. In una registrazione ben separata raramente si verifica uno dei due casi, motivo per cui una traccia separata per persona vale la piccola configurazione extra a tempo di record.
Problemi comuni e cosa li causa effettivamente
La maggior parte dei problemi di trascrizione risalgono alla registrazione, non allo strumento. Vale la pena pianificarne alcuni prima di pubblicare uno spettacolo.
Diafonia e persone che parlano tra loro. Questa è la cosa più difficile per qualsiasi sistema di separazione degli interlocutori, perché due voci nello stesso istante non possono essere divise in modo netto. Il testo di solito rimane leggibile, ma un momento di forte sovrapposizione può colpire un parlante o creare confusione. Una buona igiene del podcast aiuta già qui: un host che lascia che gli ospiti finiscano produce una trascrizione più pulita come effetto collaterale. Se ciò accade, correggi manualmente quelle poche righe rispetto all’audio.
Ospiti remoti registrati su un’unica traccia. Una chiamata registrata come singolo file misto è più difficile da separare rispetto alla stessa chiamata catturata come traccia per partecipante. Se il tuo strumento supporta la registrazione locale per partecipante, usalo; se hai solo il file misto, la trascrizione arriva comunque, si basa solo di più sulla diarizzazione. In ogni caso, l’audio è lo stesso caricato, quindi non c’è niente di diverso da fare al momento della trascrizione.
Accenti forti e cambio di codice. Hushscript rileva automaticamente la lingua e trascrive circa 99 lingue, con una precisione di massimo livello in diciotto di esse, quindi un ospite con un accento pronunciato in una lingua supportata viene gestito bene. Un ospite che passa da una lingua all’altra a metà frase è il caso veramente difficile; aspettatevi di ripulire manualmente le frasi scambiate. Per l’elenco completo delle lingue supportate, consulta la pagina delle lingue.
Musica introduttiva e stinger. Un letto musicale tra i segmenti viene generalmente saltato anziché trascritto come senza senso. I problemi iniziano solo quando la musica viene riprodotta ininterrottamente per un lungo periodo. La soluzione pulita è editoriale: registra le voci asciutte e inserisci la musica in seguito, in modo che la trascrizione veda sempre e solo il parlato.
Nomi, gergo e ortografia del marchio. Un ospite specializzato utilizzerà termini e nomi di prodotti che il modello può rendere foneticamente. Questi problemi si risolvono rapidamente perché si ripetono e la funzione di ricerca e sostituzione sul documento esportato gestisce un errore di ortografia ricorrente in un solo passaggio.
Alcuni suggerimenti per la precisione
La leva più importante è la qualità della registrazione, quindi lo sforzo speso per i microfoni e una stanza silenziosa viene ripagato al momento della trascrizione. Oltre a ciò, una traccia per parlante fornisce sia il testo più pulito che le etichette dei parlanti più pulite, poiché il sistema non deve mai districare due voci da una forma d’onda. Mantieni il microfono dell’ospite vicino e coerente anziché andare alla deriva, e dedicherai il tuo tempo di editing alla sostanza invece che alle riparazioni.
Quando esegui la correzione di bozze, leggi con l’audio aperto e correggi i passaggi: prima le etichette dei parlanti, poi i nomi e il gergo frainteso, quindi la sovrapposizione occasionale. Lavorare per categoria è più veloce che leggere dall’alto verso il basso e ti lascia con un documento sufficientemente pulito da poter essere pubblicato.
Dalla trascrizione alla note dell’episodio
note dell’episodio non è un riepilogo di tutto ciò che è stato detto. Sono un aiuto alla navigazione per gli ascoltatori e una superficie di ricerca per le persone che non hanno ancora premuto Play. Una struttura che funziona per la maggior parte dei programmi di interviste e conversazioni:
Riepilogo dell’episodio, da due a quattro frasi. Estrai l’argomento principale dalla trascrizione. Qual è l’argomento, la storia o il takeaway centrale? Scrivilo per qualcuno che decide se ascoltarlo.
Capitoli con timestamp. Scansiona la trascrizione per eventuali cambiamenti di argomento. Ogni volta che la conversazione passa a un nuovo argomento, prendi nota del timestamp e scrivi una descrizione di una riga. I timestamp provengono direttamente dalla trascrizione, quindi non dovrai mai riascoltarli per trovarli.
[00:02:15] Lancio dell'azienda senza budget di marketing
[00:14:30] Il calo delle entrate del 40% e cosa lo ha causato
[00:28:44] Ricostruire: cosa è cambiato internamente
[00:51:00] Consigli per i fondatori nella stessa posizione
Citazioni chiave. Inserisci due o tre righe che catturino le affermazioni principali dell’episodio o i suoi momenti più citabili. Cita testualmente la trascrizione e attribuisci ciascuna al relatore per nome. Se eseguire una citazione esattamente come viene pronunciata o tagliare il riempitivo e le false partenze per mostrare note più pulite è una decisione che vale la pena fare apposta e trascrizione ripulita rispetto alla parola per parola li esamina entrambi. Poiché il testo è ricercabile, trovare il testo esatto di una riga che ricordi a malapena richiede pochi secondi.
Link e risorse per gli ospiti. Aggiungi tutto ciò che l’ospite ha menzionato. Per trovare rapidamente gli URL parlati, cerca nella trascrizione frammenti come “punto com” o “barra”; le persone dicono gli indirizzi web ad alta voce più spesso di quanto ci si aspetterebbe e li cattura una trascrizione letterale.
Trascrizione completa, facoltativa ma preziosa. Incolla il testo completo sotto le note o collega a una pagina di trascrizione separata. È qui che risiede il valore della ricerca, perché il contenuto parlato diventa indicizzabile. Se la tua piattaforma host accetta caricamenti di trascrizioni, l’esportazione JSON trasporta dati a livello di espressione; altrimenti il testo semplice è sufficiente.
Un esempio funzionante
Supponiamo che tu abbia registrato un’intervista di 58 minuti al fondatore come due tracce e le abbia mixate in un unico MP3. Trascina l’MP3 in /podcast-transcription, guarda l’anteprima di 30 secondi dividere correttamente host e ospite, iscriviti e carica il file completo. La trascrizione ritorna con Parlante A e Parlante B; li rinomini in “Alex” e “Jamie” in due clic. Da lì, il riassunto proviene dai due minuti iniziali, i quattro capitoli precedenti provengono dalla scansione dei cambiamenti di argomento e le due citazioni provengono dalla ricerca nel testo dei momenti che ricordi. Le note dall’inizio alla fine dello spettacolo durano circa quindici minuti, la maggior parte delle quali sono modifiche personali anziché attendere o trascrivere.
Aggiungi didascalie o sottotitoli
Se pubblichi una versione video dell’episodio su una piattaforma come un host video, video Spotify o LinkedIn, l’esportazione SRT è un file di sottotitoli temporizzati pronto per essere caricato. Non è previsto alcun passaggio aggiuntivo, poiché la trascrizione già generata contiene i dati temporali. Per un flusso di lavoro più ampio per l’inserimento di sottotitoli in una clip, inclusi file masterizzati e file collaterali, consulta come aggiungere sottotitoli a un video.
Se il punto di partenza è una registrazione video anziché un’esportazione audio, il processo è identico; l’audio viene prima estratto nel tuo browser. La pagina da video a testo copre interamente questo percorso.
Episodi lunghi e composti da più parti
Per un lungometraggio o una registrazione dal vivo, Hushscript richiede caricamenti fino a 10 ore, senza limiti di dimensione del file. Un panel di quattro ore o un episodio in formato documentario viene presentato come un unico file anziché essere suddiviso in blocchi, il che è importante per due motivi. Le etichette dei parlanti rimangono coerenti in tutto il file, quindi puoi rietichettarle una volta. E i timestamp sono continui, quindi un capitolo al limite delle tre ore recita [03:12:40] anziché ricominciare da zero nella seconda parte.
Se registri una serie composta da più parti in una sessione, trascrivi l’intera sessione come un singolo file e successivamente dividi le note dell’episodio per parti. Tagliare prima l’audio non fa altro che moltiplicare il lavoro di rietichettatura.
Perché diventa veloce
Per una cadenza di pubblicazione regolare, settimanale o due volte alla settimana, la routine di trascrizione per note dell’episodio si comprime in minuti per episodio dopo averla eseguita alcune volte: rilascia il file, rietichetta i parlanti, cerca i capitoli, inserisci le citazioni, esporta. Le etichetta del parlante che eseguono l’attribuzione gratuitamente sono ciò che rimuove la parte noiosa. Trascorri il tuo tempo sul giudizio editoriale di cui le note effettivamente hanno bisogno, non su chi ha detto cosa.
Fonti e standard indipendenti
Hushscript ha consultato queste fonti indipendenti e non concorrenti. Illustrano ricerche, standard o il funzionamento delle piattaforme e non implicano un sostegno a Hushscript.
Fonti verificate il: