Come trascrivere qualsiasi file audio in testo
Autore: Hushscript Pubblicato: Ultima revisione:
Un MP3 da un editor di podcast, un M4A dal tuo iPhone, un WAV da un registratore sul campo, un oscuro CAF da un’app di registrazione vocale: per trascriverne uno qualsiasi, fai la stessa cosa. Rilascia il file, ottieni una trascrizione con i relatori già separati, esportala nel formato che ti serve. Il contenitore in cui è arrivato l’audio non modifica i passaggi.
Ciò che influisce il formato è un po’ più in basso: quanto è grande il file, quanto è pulito trascritto e cosa fare nelle rare occasioni in cui un file non viene caricato. Questa guida spiega quali formati audio funzionano, qual è il metodo che li gestisce tutti, come scegliere il formato migliore quando puoi e come correggere i file che risultano difficili.
Cosa ti serve
- Un file audio (o video). Uno qualsiasi dei formati comuni riportati di seguito. Non c’è niente da installare: nessuna app desktop, nessuna estensione. Tutto viene eseguito nel browser e nel tuo account.
- Un account Hushscript, per la trascrizione completa. Hai 30 minuti gratuiti per provare. Il modo più rapido per sbloccarli è aggiungere una carta: una trattenuta di $ 1 la convalida, poi si sblocca immediatamente e non viene mai addebitata. Se preferisci non utilizzare una carta, funziona anche un metodo di pagamento alternativo e i 30 minuti arrivano con il tuo primo acquisto.
L’anteprima di 30 secondi non necessita di account. Puoi rilasciare un file e vedere lo stile con l’etichetta del relatore prima di registrarti, che è il modo onesto per verificare che l’output sia adatto prima di impegnarti in qualsiasi cosa. Oltre ai minuti gratuiti, la trascrizione è a consumo: acquisti minuti solo quando ti servono, senza abbonamento. I costi sono riportati nella pagina dei prezzi.
Quali formati audio funzionano
Hushscript accetta tutti i formati audio standard. Ecco da dove tendono a provenire ciascuno, così puoi riconoscere ciò che hai:
I nomi non sono solo convenzioni sui nomi dei file. L’attuale registro dei tipi di media IANA registra tipi standardizzati come audio/aac,audio/mp4,audio/mpeg,audio/ogg e audio/opus, motivo per cui il contenitore e la codifica audio al suo interno sono domande separate.
| Formato | Fonte comune |
|---|---|
| MP3 | Podcast, registrazioni telefoniche, esportazioni dalla maggior parte delle app di registrazione |
| M4A / AAC | Memo vocali iPhone, note vocali WhatsApp, esportazioni Apple |
| WAV | Registratori digitali, esportazioni DAW, registratore vocale Windows |
| FLAC | Registrazioni di archivio, esportazioni DAW, rip senza perdita di dati |
| OGG | Note vocali Android, strumenti di registrazione open source |
| AIFF / CAF | Audio Mac e iOS, GarageBand |
I file video funzionano allo stesso modo. Rilascia un MP4, MOV, WebM o MKV e la traccia audio verrà estratta nel tuo browser prima che venga caricato qualsiasi cosa, in modo che il video stesso non lasci mai il tuo dispositivo; solo l’audio raggiunge il server.
L’elenco sopra non è una recinzione. La promessa è più semplice di una tabella dei formati supportati: basta rilasciare il file e verrà convertito e trascritto. Se hai qualcosa di veramente insolito (un file AMR di un vecchio Nokia, un .3gp di un Android vecchio di dieci anni, una clip RealAudio), prova a caricarlo comunque. Il browser può leggere la maggior parte dei contenitori standard e, in caso contrario, hai due soluzioni alternative: convertirlo in MP3 o WAV con gli strumenti gratuiti nel browser su /tools e caricarlo oppure inviare un’e-mail a support@hushscript.com e noi aggiungeremo il formato. Non devi capire in anticipo se il tuo file è idoneo.
Trascrivi un file audio in tre passaggi
Il flusso è identico indipendentemente dal formato con cui inizi. Il primo passaggio avviene prima ancora di avere un account.
- Rilascia il file per visualizzarne l’anteprima. Vai a /audio-to-text e trascina il file nella zona di rilascio o fai clic per sfogliare. I primi 30 secondi vengono trascritti direttamente nel browser, etichettati con l’etichetta del relatore, senza bisogno di un account. Questo è il tuo controllo che l’output sia letto nel modo desiderato prima di registrarti.
- Registrati per trascrivere il resto. Inserisci la tua email per creare un account. I tuoi 30 minuti gratuiti si sbloccano quando aggiungi e convalidi una carta (la trattenuta di $ 1 descritta sopra) o con il tuo primo acquisto se paghi in un altro modo. Il file completo viene caricato da qui. Una registrazione può durare fino a 10 ore, senza limiti di dimensione del file: anche un file molto grande viene preparato direttamente nel browser. Si applicano anche le tutele relative alla sicurezza del servizio e al lavoro attivo.
- Ottieni ed esporta la trascrizione. Il motore vocale elabora il file e restituisce una trascrizione con i relatori già separati. Rinomina i parlanti se lo desideri, quindi scaricalo in uno qualsiasi dei 21 formati (TXT, SRT, DOCX e PDF tra questi, oltre ai formati sottotitoli e timeline dell’editor) o in un file .husharchive protetto da password. Ogni esportazione è inclusa: nessun paywall, nessuna filigrana.
L’elaborazione viene eseguita in background e si adatta alla durata dell’audio (circa pochi minuti all’ora di registrazione), quindi non devi tenere la scheda aperta mentre un file lungo termina.
Un esempio funzionante: una registrazione, due formati
Dillo tu hai registrato una conversazione di 38 minuti e il tuo registratore l’ha salvata due volte: un meeting.wav alla massima qualità e un meeting.m4a creato contemporaneamente dal tuo telefono. Entrambi seguono gli stessi tre passaggi e la trascrizione ritorna segmentata per turno dell’oratore, con un timestamp su ciascuno:
[00:00:06] Parlante A: Prima di iniziare, hanno ricevuto tutti i dati che ho inviato?
[00:00:10] Parlante B: Li ho ricevuti stamattina. Il numero Q3 è quello su cui voglio
approfondire.
[00:00:17] Parlante A: Giusto, quindi quella è la linea che si è spostata. Fammi riprendere.
[00:00:21] Parlante C: Mentre lo fai, possiamo tornare alle assunzioni dopo?
I due file producono essenzialmente la stessa trascrizione. Il WAV è un caricamento molto più grande e l’M4A è piccolo, ma le parole e le etichette dei parlanti arrivano allo stesso modo, perché entrambi portano lo stesso discorso di fondo. Da qui la modifica è leggera: fai clic una volta su Parlante A per rinominarlo, e ogni riga in cui è presente l’oratore si aggiorna; cerchi la manciata di nomi propri che il motore ha indovinato (un cognome, il nome di un prodotto) e li correggi con trova e sostituisci, che corregge ogni istanza in un unico passaggio.
Questo è il risultato pratico di un metodo per ogni formato. Non mantieni uno strumento diverso o una lista di controllo mentale diversa per WAV rispetto a M4A rispetto a MP3. Qualunque cosa ti sia stata consegnata dal tuo registratore, dal tuo telefono o dall’esportazione di qualcun altro, passa attraverso la stessa zona di rilascio e ne esce come lo stesso tipo di trascrizione.
Scegliere il formato migliore per la precisione
La maggior parte delle volte non puoi scegliere. Trascrivi il file che ti è stato dato e va bene. Ma se controlli il modo in cui l’audio viene registrato o esportato, alcune scelte stabiliscono il livello di pulizia del risultato.
La qualità della registrazione viene prima di tutto, con un ampio margine. Un MP3 a 128 kbps da un buon microfono vicino batterà ogni volta un WAV senza perdite registrato dall’altra parte della stanza sul microfono integrato di un laptop. Prima di pensare al formato, pensa ad avvicinare il microfono a chi sta parlando. Il contenitore è un secondo distante.
Evita MP3 con bitrate molto basso. MP3 è con perdita di dati: la codifica scarta parti dell’audio per mantenere il file piccolo e più basso è il bitrate, più ne vengono scartate. Il riconoscimento vocale si basa sui dettagli ad alta frequenza delle consonanti, dove esiste il divario tra “quindici” e “sedici” o “può” e “non può”. La compressione aggressiva mangia prima esattamente quel dettaglio. Al di sotto di circa 64 kbps, gli errori di parola aumentano. A 128 kbps e oltre hai già superato il punto in cui il numero conta; un bitrate più alto non migliorerà la trascrizione.
Lossless rimuove il formato come variabile. WAV, FLAC e AIFF forniscono al motore audio non compresso. Per una registrazione pulita il guadagno in precisione rispetto a un buon MP3 è marginale, ma elimina completamente la compressione. La guida audio digitale di MDN spiega il compromesso sottostante: il sistema senza perdita preserva i dettagli a dimensioni maggiori, mentre la codifica con perdita può ridurre ulteriormente l’audio scartando le informazioni. Questo è un contesto utile quando la registrazione è preziosa e non vuoi chiederti in seguito se il formato ti costa qualcosa.
Mono va bene; non è necessario lo stereo. Il motore mixa internamente lo stereo in mono per la voce, quindi un file mono viene trascritto altrettanto bene e caricato più velocemente con una connessione lenta. L’unica sfumatura: se la tua configurazione ha registrato ogni persona su un canale stereo separato (un “double-ender”), mixarla su una singola traccia mono prima del caricamento tende ad aiutare le etichette dei parlanti, perché il motore sente una conversazione mista piuttosto che due flussi isolati.
Una frequenza di campionamento superiore a 16 kHz non compra nulla per il parlato. Qualsiasi cosa da 16 kHz a 48 kHz funziona, e un WAV a 48 kHz da un editor video trascrive lo stesso di un file mono a 16 kHz da un’app del telefono, dato lo stesso discorso di fondo. Il modello è addestrato sulla voce, non sulla musica, quindi non c’è alcun guadagno di precisione da una velocità più alta.
Lossless vs lossy e quando la conversione aiuta
Una domanda comune: convertire prima il tuo MP3 in WAV migliorerebbe la precisione? Non lo farà. Una volta salvato l’audio come MP3 a 128 kbps, i dettagli scartati scompaiono per sempre. Avvolgendo lo stesso audio in un WAV si crea semplicemente un file più grande senza informazioni aggiuntive. La conversione verso l’alto aiuta sempre e solo come soluzione alternativa per un formato che non si carica, mai come miglioramento della precisione.
La conversione verso il basso è il caso veramente utile. Un WAV di più ore può essere un file molto grande; ricodificarlo in un MP3 a 128 kbps prima del caricamento lo riduce drasticamente senza alcun costo significativo in termini di precisione, il che accelera il caricamento su un collegamento lento. Il convertitore nel browser gratuito fa tutto questo senza che l’audio lasci mai il tuo dispositivo. La regola onesta: se il tuo file viene già caricato e non ha un bitrate minuscolo, trascrivilo così com’è. Converti solo per risolvere un problema reale, come un file che non si apre o uno troppo grande per essere caricato comodamente.
Etichette dei parlanti, incluse gratuitamente
Ogni trascrizione di Hushscript viene fornita con la separazione automatica dei parlanti (diarizzazione) senza costi aggiuntivi. Il motore seleziona voci distinte e le etichetta Parlante A,Parlante B e così via, e tu le rinomini con nomi reali nell’editor con un clic per parlante. È attivo per impostazione predefinita, indipendentemente dal formato sorgente, senza un livello separato di etichette per chi parla.
La pulizia delle etichette dipende dalla registrazione, non dal tipo di file:
- I turni distinti aiutano di più. Quando le persone si alternano e non parlano tra loro, le etichette sono affidabili. Un’intervista a due persone di solito è nettamente separata.
- La sovrapposizione è il caso difficile. Quando due voci arrivano contemporaneamente, il motore assegna le parole a quella più forte. Questa è una limitazione della separazione dei parlanti in generale, non di un singolo strumento. Prevedi un po’ di tempo per l’editing per il crosstalk in una vivace chiamata di gruppo.
- Voci simili possono confondersi. Due persone con registri molto simili (fratelli dello stesso sesso, ad esempio) metteranno alla prova qualsiasi motore di diarizzazione. Un ragionevole rapporto segnale-rumore aiuta la separazione ovunque.
Per la maggior parte delle interviste, podcast e riunioni le etichette risultano utilizzabili con al massimo una manciata di riassegnazioni. Se desideri i dettagli su come funziona la diarizzazione dietro le quinte, vedi cos’è la diarizzazione dell’oratore o la pagina di identificazione dell’oratore per una panoramica delle funzionalità.
Correzione di file che risultano approssimativi
La maggior parte delle trascrizioni approssimative risalgono al registrazione, non il formato o lo strumento. I soliti colpevoli e cosa fare al riguardo:
Un file che non si carica. Raro, ma succede con un contenitore insolito o danneggiato. Prova il convertitore nel browser gratuito per riorganizzarlo prima come MP3 o WAV, che risolve i file più ostinati. Se il problema persiste, inviare un’e-mail a support@hushscript.com. Aggiungere il supporto del formato è qualcosa che facciamo.
Volume basso. Se la registrazione è molto silenziosa, il motore ha meno segnale con cui lavorare e la precisione diminuisce. Normalizza o amplifica l’audio in qualsiasi editor prima del caricamento. Aumentare il livello di una registrazione debole è una delle soluzioni con il rendimento più alto che esista.
Rumore di fondo. Il rumore costante (un condizionatore d’aria, il ronzio della strada) viene gestito abbastanza bene. Il rumore improvviso che si sovrappone alla parola (una porta, un colpo di tosse, una posata) è ciò che fa cadere le parole. Una leggera riduzione del rumore prima del caricamento può aiutare, ma non esagerare: una riduzione pesante del rumore aggiunge artefatti che compromettono la precisione più del rumore.
Accenti pesanti o vocabolario specialistico. I motori moderni gestiscono bene un’ampia gamma di accenti. Gli errori attendibili sono termini di dominio che il motore non ha motivo di aspettarsi: nomi di farmaci, citazioni legali, nomi di marchi di nicchia. Pianifica una scrematura dopo l’esportazione e appoggiati alla ricerca e sostituzione; se un nome risulta sbagliato ogni volta allo stesso modo, una correzione spazza l’intero file.
File molto grandi o molto lunghi. Il limite di 10 ore copre quasi tutto e non esiste alcun limite di dimensione del file, quindi non è necessario suddividere in parti una lunga registrazione. Se un file senza perdita di dati è troppo grande da preparare nel browser, ricodificalo prima in MP3 a 128 kbps (nessun costo reale in termini di precisione) per accelerare le cose. Per i dettagli specifici sulle sessioni più lunghe, la guida alla registrazione lunga va più in profondità.
Cosa succede al tuo file
L’audio viene eliminato dal server nel momento in cui la trascrizione è pronta. Non è previsto l’archiviazione nel cloud, l’utilizzo per l’addestramento del modello e nessun periodo di conservazione. Se hai rilasciato un file video, solo l’audio estratto ha raggiunto il server (il video è rimasto sul tuo dispositivo) e puoi eliminare la trascrizione stessa dalla tua dashboard con un clic quando vuoi.
Esportazione della trascrizione
Dopo la trascrizione, scegli il formato che si adatta a ciò che stai facendo con il testo. Se non sei sicuro di quale formato di trascrizione hai effettivamente bisogno, inizia con le scelte comuni di seguito:
| Formato | Cosa è incluso | Migliore per |
|---|---|---|
| TXT | Etichette parlanti, testo semplice | Note, ricerca, inserimento in un altro strumento |
| SRT | Per-espressione timestamp, etichette dei parlanti | Sottotitoli video, navigazione in una lunga registrazione in base all’ora |
| VTT | Timestamp didascalie web, etichette dei parlanti | Lettore video HTML5 e pubblicazione sul web |
| CSV | Righe con parlante, tempistica e campi di testo | Revisione del foglio di calcolo e trasferimento leggero dei dati |
| Markdown | Trascrizione con etichetta del relatore in Markdown | Note, documenti, flussi di lavoro di pubblicazione e siti statici |
| DOCX | Formattato per Word o Google Documenti | Modifica, condivisione, annotazione |
| JSON | { speaker, start, end, text } per elemento | Pipeline e strumenti personalizzati |
| Trascrizione leggibile a layout fisso | Condivisione di sola lettura e archiviazione |
Ogni esportazione riporta le etichette dei parlanti, senza filigrana su nessuna di esse, e tutti i formati di esportazione sono inclusi in ogni piano, compresi i 30 minuti gratuiti. I timestamp nell’SRT si trovano a livello di enunciazione (una voce per turno di parlante), che è la giusta granularità per sottotitoli e citazioni; se hai bisogno che la struttura a livello di parola venga elaborata nel codice, JSON ti fornisce l’ora di inizio e di fine in millisecondi per ogni turno.
Lingue
Hushscript trascrive circa 99 lingue, rilevate automaticamente, non impostate manualmente. La precisione è più elevata in 18, comprese quattro varianti inglesi (globale, britannica, australiana, statunitense), spagnola, francese, tedesca, giapponese, mandarino, hindi e araba. L’elenco completo si trova nella pagina delle lingue.
Se stai decidendo tra una trascrizione nella stessa lingua e una trascrizione tradotta, la guida a “tradurre l’audio in testo” spiega la differenza.
Questo è tutto il lavoro (rilascia, trascrivi, esporta) e legge lo stesso qualunque sia il formato con cui hai iniziato. Per le note specifiche sul formato, le guide dei fratelli coprono i casi più comuni: MP3, WAV e M4A/Apple Voice Memo. La pagina da audio a testo offre la panoramica completa delle funzionalità e ogni formato arriva lì allo stesso modo: basta rilasciare il file.
Fonti e standard indipendenti
Hushscript ha consultato queste fonti indipendenti e non concorrenti. Illustrano ricerche, standard o il funzionamento delle piattaforme e non implicano un sostegno a Hushscript.
Fonti verificate il: