Vai al contenuto principale

Da voce a testo: come funziona

Autore: Pubblicato: Ultima revisione:

Speech to text è un software che trasforma l’audio parlato in parole scritte. Il termine copre due diversi lavori che sembrano simili ma funzionano in modo diverso: dettatura dal vivo, in cui parli e il testo appare mentre procedi, e trascrizione, in cui consegni una registrazione e ricevi indietro una trascrizione finita. L’idea centrale è la stessa in entrambi. Il flusso di lavoro, la precisione e ciò che puoi fare con il risultato non lo sono.

Questa guida spiega cos’è effettivamente la sintesi vocale, in modo semplice, come il motore passa dal suono alle parole e come differiscono le due modalità. Quindi illustra la conversione di una registrazione in testo su Hushscript, con un esempio pratico, i problemi che inciampano le persone e una breve domanda frequente alla fine.

Che cos’è effettivamente la conversione del parlato in testo

Nella sua forma più semplice, il riconoscimento vocale automatico (ASR) prende un’onda sonora e produce una sequenza di parole. Un microfono cattura il parlato come una forma d’onda continua, una linea ondulata che rappresenta la variazione della pressione dell’aria nel tempo. Quella forma d’onda trasporta tutto: le parole, la voce di chi parla, la stanza, il ronzio di un condizionatore d’aria. Il compito del motore è quello di estrarre le parole da quel mix e scriverle.

Per farlo, il motore taglia l’audio in piccole porzioni, solitamente da 10 a 30 millisecondi ciascuna, e misura il suono in ogni fetta. Queste misurazioni alimentano un modello addestrato che mappa i modelli del suono sulle unità vocali di una lingua, poi sulle parole, quindi su intere frasi. Non vedi niente di tutto questo. Vedi una registrazione entrare e una trascrizione uscire. Ma sapere approssimativamente cosa succede all’interno spiega perché alcune registrazioni vengono trascritte in modo pulito e altre risultano grezze.

Ci sono due livelli di conoscenza che lavorano insieme. Uno è acustico: quali sono i suoni di una lingua e come tendono a essere pronunciati attraverso voci e accenti diversi. L’altro è linguistico: quali sequenze di parole sono plausibili. Lo strato linguistico è il motivo per cui un buon motore scrive “la loro macchina si è rotta” anziché “la macchina si è rotta”, anche se i due suoni sembrano identici. Utilizza il contesto per scegliere l’ortografia che farebbe un essere umano.

Il riconoscimento vocale più vecchio si basava su regole scritte a mano e piccoli set di addestramento, ed era fragile. I motori moderni sono grandi modelli di intelligenza artificiale addestrati su migliaia di ore di parlato registrato da molti parlanti, accenti e condizioni di registrazione. Questa ampiezza è l’intera ragione per cui le trascrizioni di oggi sono utilizzabili. Con un parlato chiaro in una registrazione decente, i modelli attuali raggiungono una precisione delle parole compresa tra il 90 e il 97%. La restante percentuale è quella in cui la risoluzione dei problemi più avanti in questa guida guadagna terreno.

Discorso registrato e dettatura dal vivo

La differenza che conta di più nella pratica è se l’audio viene elaborato dal vivo o dopo il fatto.

La dettatura dal vivo viene eseguita in tempo reale. Parli al telefono, a un assistente vocale o alla funzione di digitazione vocale di un elaboratore di testi e le parole appaiono quasi con la stessa velocità con cui le dici. Per tenere il passo, il motore deve impegnarsi in ogni parola con pochissima frase su cui appoggiarsi. Questo è un vincolo difficile, ed è il motivo per cui la dettatura a volte indovina una parola, quindi la riscrive silenziosamente una volta arrivate le parole successive. La dettatura dal vivo è lo strumento giusto quando l’obiettivo è catturare il tuo discorso mentre procedi: annotare una nota a mani libere, scrivere un’e-mail con la voce, controllare un dispositivo.

La trascrizione funziona su una registrazione completa. Dai al motore un file audio o video finito, elabora il tutto e in cambio ottieni una trascrizione completa. Poiché nulla deve accadere in tempo reale, il motore può leggere in anticipo e vedere l’intera frase prima di decidere su qualsiasi parola, il che aumenta la precisione. Può anche svolgere il lavoro che la dettatura dal vivo non può fare. Può separare gli interlocutori, attribuendo ogni riga a chiunque l’abbia detta, e può allegare timestamp in modo da poter passare da una riga di testo direttamente a quel momento nell’audio.

Se hai a che fare con una riunione, un’intervista, una conferenza, un episodio di podcast o una telefonata che hai registrato, stai eseguendo la trascrizione da un file salvato, non da una dettatura dal vivo. I due si confondono perché entrambi sono commercializzati come “discorso in testo”, ma la registrazione che hai già ha la forma sbagliata per uno strumento di dettatura e la forma giusta per un trascrittore. Hushscript è creato per le registrazioni. Non esiste una modalità di dettatura dal vivo e l’attenzione è intenzionale: lavorare dal file completo è ciò che gli consente di leggere in anticipo con precisione ed etichettare i parlanti nello stesso passaggio.

Come convertire il parlato registrato in testo

Ecco il flusso effettivo su Hushscript, nell’ordine in cui lo incontri. Hai bisogno della registrazione come file sul tuo dispositivo, un file audio o video in qualsiasi formato comune e un indirizzo email per registrarti. Questa è l’intera lista. Non c’è nulla da installare.

  1. Rilascia il file e guarda l’anteprima. Apri la pagina da audio a testo e rilascia il file su di essa. Hushscript trascrive subito i primi 30 secondi e ti mostra il risultato con gli interlocutori già separati. Non è necessario alcun account per questo passaggio. L’anteprima è lì in modo che tu possa giudicare l’accuratezza della tua registrazione prima di impegnarti in qualsiasi cosa.
  2. Iscriviti per trascrivere il resto. Se l’anteprima sembra corretta, registrati con la tua email. La trascrizione del file completo è riservata, quindi è in questo passaggio che entra in gioco un account. I nuovi account ricevono 30 minuti gratuiti per provare correttamente il servizio.
  3. Carica il file completo. Una volta entrato, carica l’intera registrazione. Se si tratta di un video, l’audio viene prima estratto nel browser e viene inviato solo l’audio, quindi il video stesso rimane sul tuo dispositivo.
  4. Leggi, rietichetta ed esporta. La trascrizione ritorna con ogni turno attribuito a un oratore (Parlante A, Parlante B e così via) e con timestamp. Fai clic sull’etichetta di un oratore per rinominarlo e il nuovo nome verrà aggiornato ovunque abbia parlato quella persona. Quando viene letto nel modo desiderato, esporta in TXT per testo semplice, SRT o VTT per i sottotitoli, CSV o JSON per dati strutturati, Markdown per la pubblicazione di note, DOCX per la modifica o PDF per la condivisione.

Trenta minuti sono sufficienti per trascrivere una breve intervista, una clip di lezione di 10 minuti o il primo tratto di una registrazione più lunga se desideri verificarne la precisione prima di andare oltre. I minuti gratuiti si sbloccano istantaneamente con un rapido controllo della carta: viene autorizzato un trattenuto di $ 1 per controllare la carta, poi prelevato subito e mai addebitato. Utilizza un altro metodo di pagamento e arriveranno invece con il tuo primo acquisto. Non è necessaria una carta; è solo il percorso più veloce per ottenere il bonus. Dopo i minuti gratuiti, paghi solo i minuti trascritti, senza abbonamento. La pagina dei prezzi riporta le tariffe attuali.

Un esempio pratico

Supponiamo che tu abbia registrato un colloquio con un cliente di 38 minuti sul tuo telefono. È stato salvato come M4A, due voci, il tintinnio occasionale di una tazza di caffè, registrato in una normale sala riunioni.

Trascina l’M4A nella pagina da audio a testo. L’anteprima di 30 secondi appare come una breve conversazione:

Parlante A 00:00 Grazie per il tempo dedicato. Potresti iniziare dicendomi
                    cosa ti ha spinto a cercare uno strumento come questo?
Parlante B 00:11 Certo. Eravamo sommersi dai ticket di supporto e il vecchio
                    sistema non riusciva a tenere il passo, quindi ho iniziato a guardarmi intorno.

Questa è l’anteprima non modificata. Le due voci sono divise, ogni riga ha un timestamp e il testo è pulito. Ti iscrivi, carichi il file completo di 38 minuti e un paio di minuti dopo la trascrizione completa è pronta nella stessa forma. Parlante A sei tu e Parlante B è il tuo intervistato, quindi fai clic sull’etichetta “Parlante A”, digita il tuo nome e fai clic su “Parlante B” per digitare il suo. Entrambi rinominano l’intero documento in un unico passaggio. Esporti in DOCX, lo apri nel tuo elaboratore di testi, correggi i due o tre punti in cui il nome di un prodotto è uscito scritto foneticamente e hai una trascrizione dell’intervista finita. I 38 minuti sono usciti dal tuo saldo, motivo per cui i 30 minuti gratuiti sono utili per un primo vero lavoro piuttosto che solo per una clip di prova.

Problemi comuni e come risolverli

Le trascrizioni più deludenti risalgono alla registrazione, non al motore. Questi sono i problemi che emergono di più e cosa fare per ciascuno di essi.

La registrazione è silenziosa o confusa. Se le voci sono deboli o la stanza rimbomba, il motore ha meno con cui lavorare e la precisione diminuisce. Un microfono vicino a chi parla, un microfono da bavero o una cuffia entro 10-20 centimetri dalla bocca fanno una differenza più grande di qualsiasi altra impostazione. Una stanza ampia e spoglia aggiunge un’eco che cancella i confini tra i suoni; uno spazio più piccolo o arredato in modo morbido registra meglio. Non è possibile risolvere questo problema a fatto avvenuto, quindi vale la pena farlo prima di registrare la prossima volta.

Due persone parlano contemporaneamente. Quando le voci si sovrappongono, sia le parole che il “chi ha detto cosa” diventano più difficili, perché due serie di suoni competono nella stessa porzione di audio. Non esiste una soluzione software pulita per una vera sovrapposizione. In una registrazione che controlli, lasciare una battuta tra un turno e l’altro ripaga in seguito. In uno che non puoi rifare, aspettati qualche linea incrociata attorno alle interruzioni e riordinale a mano.

Un termine specialistico risulta sbagliato. I modelli per uso generale conoscono bene il linguaggio quotidiano ma non hanno necessariamente visto il gergo del tuo settore, un cognome insolito o il nome di un prodotto. Quelli tendono ad essere trascritti in base a come suonano piuttosto che a come sono scritti. La funzione di ricerca e sostituzione nel DOCX esportato cancella un termine ricorrente in pochi secondi, motivo per cui DOCX è l’esportazione più semplice da correggere.

Un file non verrà caricato. La maggior parte dei file audio e video standard funziona e basta. Se si rifiuta, di solito si tratta di un contenitore insolito o molto vecchio. Convertendolo in un semplice MP3 o WAV con gli strumenti nel browser gratuiti, che vengono eseguiti sul tuo dispositivo e non caricano nulla, quasi sempre risolve il problema. Se un formato continua a non funzionare, invia un’e-mail a support@hushscript.com e il team lo aggiungerà.

Un oratore viene diviso in due. Occasionalmente la stessa persona viene etichettata come due oratori, normalmente perché la sua voce è cambiata durante il processo: si è avvicinato al microfono, è passato dalle cuffie al vivavoce o la qualità della linea è cambiata. Il motore raggruppa le voci in base alle loro caratteristiche sonore, quindi un grande cambiamento può essere letto come una nuova persona. L’unione delle due etichette nell’editor risolve il problema in un solo passaggio. I meccanismi di tutto ciò sono descritti nella guida su come funziona la diarizzazione dei parlanti.

Precisione e accenti

La copertura degli accenti dipende dal modello e dalla lingua. Per l’inglese, i modelli addestrati su ampi set di dati gestiscono bene l’inglese statunitense, britannico, australiano e indiano e Hushscript offre quattro accenti inglesi distinti. Un dialetto regionale pesante o una varietà di accento meno rappresentata avranno bisogno di qualche correzione in più, ma stai comunque modificando una bozza anziché digitando dal nulla.

Alcune abitudini aumentano la precisione di qualsiasi registrazione, qualunque sia l’accento. Registra con un microfono vicino. Lascia che ogni persona finisca prima che inizi quella successiva. Evita le grandi stanze echeggianti. Un ritmo moderato nel parlare trascrive meglio di uno sprint che supera le 200 parole al minuto. E un bitrate ragionevole è importante: un MP3 a 128 kbps va bene, mentre l’audio dei messaggi vocali fortemente compresso in banda stretta perde i dettagli di cui il motore ha bisogno. Per una panoramica più completa sui formati e sulle peculiarità di ciascuno, vedi come trascrivere qualsiasi file audio.

Hushscript rileva automaticamente la lingua e trascrive circa 99 lingue, con una precisione di massimo livello in 18 di esse. Una registrazione che rimane in una lingua viene trascritta in modo più pulito; cambiare lingua a metà frase è difficile per qualsiasi motore.

Etichette dei parlanti, nello stesso passaggio

La separazione dei parlanti, formalmente chiamata diarizzazione dei parlanti, va di pari passo con il riconoscimento vocale anziché come un secondo lavoro per il quale si paga un extra. Ottieni le parole e l’attribuzione insieme, gratuitamente su ogni trascrizione. Per un’intervista a due persone o una piccola riunione, questa separazione è solitamente accurata ed evita il noioso lavoro di etichettare manualmente ogni riga. Non vi è alcun limite al numero di parlanti che un file può contenere, anche se la precisione è massima quando le voci sono distinte, non si sovrappongono e non suonano simili. Il fatto che l’etichettatura del relatore sia accompagnata da ogni trascrizione senza costi aggiuntivi è il tipo di dettaglio onesto per impostazione predefinita su cui si basa l’intero approccio: la parte utile è inclusa, non trattenuta dietro un livello superiore.

La semplice distinzione a cui attenersi è questa. Se desideri acquisire il parlato mentre parli, durante la digitazione vocale o la dettatura, utilizza lo strumento live integrato nel tuo dispositivo o elaboratore di testi. Se hai già una registrazione che ti serve come testo, trascriverla dalla pagina da audio a testo è più veloce, più precisa e ti fornisce le etichette dei parlanti e l’output esportabile in un unico passaggio.

Fonti e standard indipendenti

Hushscript ha consultato queste fonti indipendenti e non concorrenti. Illustrano ricerche, standard o il funzionamento delle piattaforme e non implicano un sostegno a Hushscript.

Fonti verificate il:

Domande frequenti

Che cos'è la sintesi vocale?

La sintesi vocale, chiamata anche riconoscimento vocale automatico o ASR, è un software che trasforma l'audio parlato in parole scritte. Ascolta il suono del parlato, capisce quali parole sono state dette e produce una trascrizione del testo. Le versioni moderne funzionano su modelli di intelligenza artificiale addestrati su migliaia di ore di voci registrate, motivo per cui gestiscono gli accenti e il rumore di fondo molto meglio degli strumenti di dettatura di dieci anni fa.

Qual ​​è la differenza tra dettatura dal vivo e trascrizione di una registrazione?

La dettatura dal vivo trasforma il parlato in testo in tempo reale mentre parli, come fa la digitazione vocale in un telefono o in un elaboratore di testi. La trascrizione di una registrazione funziona su un file audio o video salvato a posteriori. Le registrazioni di solito risultano più accurate perché il motore può vedere l'intera frase prima di impegnarsi nelle parole e può etichettare chi ha parlato e quando. Hushscript gestisce le registrazioni, non la dettatura dal vivo.

Quanto è accurata la sintesi vocale automatica?

Per un parlato chiaro in una stanza tranquilla, gli attuali modelli di intelligenza artificiale raggiungono circa il 90-97% di precisione delle parole nelle lingue ben supportate. La precisione diminuisce con un forte rumore di fondo, due persone che parlano tra loro, accenti forti di cui il modello non ha sentito parlare molto o vocabolario specialistico come nomi di farmaci o latino legale. La pulizia della registrazione fa più precisione di qualsiasi singola impostazione.

La sintesi vocale funziona con gli accenti?

Sì, e molto meglio dei sistemi precedenti. I modelli addestrati su set di dati ampi e diversi gestiscono comodamente l'inglese statunitense, britannico, australiano e indiano e Hushscript offre quattro accenti inglesi distinti. Un dialetto regionale forte o un accento meno rappresentato avranno bisogno di un po' più di correzione in seguito, ma la trascrizione è comunque una prima bozza utilizzabile piuttosto che qualcosa da riscrivere da zero.

Come faccio a convertire il discorso registrato in testo su Hushscript?

Rilascia il tuo file audio o video sulla pagina da audio a testo e verrà visualizzata un'anteprima di 30 secondi con l'etichetta dell'oratore con nessun account necessario. Iscriviti con la tua email per trascrivere il resto, quindi carica il file completo. La trascrizione finale ritorna con le etichette dei parlanti e i timestamp e puoi rinominare gli oratori ed esportarla in 21 formati, da TXT, SRT e DOCX a PDF, o come un file .husharchive protetto da password.

La sintesi vocale è gratuita?

Hushscript non è gratuito, perché l'intelligenza artificiale che sta dietro ad esso costa denaro reale da gestire, quindi lo è pagamento a consumo senza abbonamento. Hai 30 minuti gratuiti per provarlo. Si sbloccano istantaneamente quando convalidi una carta con una trattenuta di $ 1 che viene rilasciata immediatamente e mai addebitata, o con il tuo primo acquisto se paghi in un altro modo. L'anteprima di 30 secondi e gli strumenti nel browser sono veramente gratuiti senza account.

Quali lingue può trascrivere Hushscript?

Rileva automaticamente la lingua e trascrive circa 99 lingue, con la massima precisione in 18 di esse, tra cui inglese globale, britannico, australiano e americano, spagnolo, francese, tedesco, giapponese, mandarino, Hindi e arabo. La pagina Lingue le elenca tutte. Una registrazione che rimane in una sola lingua viene trascritta meglio.

Inizia con 30 minuti gratuiti

Inizia – 30 minuti gratuiti