Vocabolario personalizzato per trascrizioni accurate
Autore: Hushscript Pubblicato: Ultima revisione:
Un motore vocale generico ha meno contesto per un nome in codice di prodotto, un cognome regionale o un acronimo interno il tuo team utilizza dieci volte per riunione. La ricerca definisce la tecnica per orientare il riconoscimento verso i termini attesi come distorsione contestuale e una sessione W3C Web Speech del 2025 l’ha descritta come una funzionalità disponibile in Chrome. Hushscript trasforma questa idea in quattro controlli del vocabolario, che vanno da un’aggiunta una tantum per un file a una configurazione permanente che puoi riutilizzare.
Dove il vocabolario personalizzato aiuta di più
Tre categorie fanno sì che la maggior parte del riconoscimento mancato sia ottenuto da un modello generico. I nomi delle persone sono i primi, soprattutto l’ortografia che non è la variante più comune. Un modello non ha modo di indovinare se l’audio diceva “Nguyen” o un quasi omofono a meno che qualcosa non gli dica che il nome è in gioco. I nomi dei prodotti e dei marchi sono i secondi: un nome come “FlowBridge” viene sentito come le due parole ordinarie a cui suona, non come il nome proprio scelto da un’azienda specifica. Il gergo interno e gli acronimi sono il terzo: termini che significano solo qualcosa all’interno di un team o di un settore, che nessun vocabolario generale sarebbe mai stato in grado di contenere. I nomi dei farmaci e delle procedure di una pratica clinica rappresentano lo stesso problema su scala più ampia, che la trascrizione medica gestisce con una modalità dedicata insieme a questi strumenti di vocabolario. Un acronimo ripetuto dieci volte in una riunione o si trascrive dieci volte sbagliando o dieci volte giusto; non c’è credito parziale, quindi correggerlo una volta in un elenco di termini chiave o in un dizionario risolve automaticamente ogni occorrenza in quel file.
Per un singolo file: termini chiave e un prompt personalizzato
Se stai trascrivendo una registrazione insolita e non hai bisogno di una configurazione permanente, aggiungi i termini chiave direttamente a quel lavoro. Fino a 1.000 termini chiave (nomi, marchi, acronimi) influenzano il riconoscimento delle parole effettivamente pronunciate, solo per quel file. Accanto a loro, un messaggio personalizzato fino a 2.000 caratteri fornisce al motore un contesto che il solo audio non può fornire: chi sta parlando, cosa copre la registrazione, termini specifici della situazione. Entrambi scompaiono dopo il lavoro; nulla viene trasferito al file successivo a meno che non lo aggiungi di nuovo.
Per lavori ricorrenti: dizionari salvati e preimpostazioni dei prompt
Se gli stessi nomi e termini compaiono file dopo file, un elenco una tantum non vale più la pena di essere riscritto. Un dizionario salvato risolve questo problema: importa termini in blocco da un file CSV o TSV, organizzali in categorie e allega varianti ortografiche a ciascun termine canonico in modo che “McAllister” venga riconosciuto se l’audio sorgente lo fa sembrare “MacAlister” o “McAllaster”. Le preimpostazioni dei prompt funzionano allo stesso modo per il contesto, salvando lo sfondo che altrimenti dovresti riscrivere ogni volta. Contrassegna un dizionario o un’impostazione predefinita come predefinita e verrà preselezionata automaticamente la prossima volta che trascrivi, quindi non è necessario riselezionare un’impostazione permanente su ogni file.
Si combinano, non si sostituiscono a vicenda
Un dizionario permanente e un’aggiunta una tantum non sono una scelta tra due opzioni; si candidano insieme per lo stesso lavoro. Mantieni un dizionario predefinito dei nomi dei prodotti del tuo team e una richiesta predefinita che descriva quali sono solitamente le tue registrazioni, quindi aggiungi un termine chiave una tantum per il nome di un ospite che sia rilevante solo per il file di questa settimana. La disposizione in piedi copre il vocabolario ricorrente; l’aggiunta una tantum copre ciò che è specifico di questa registrazione. Nessuno dei due deve tenere conto di ciò che l’altro già gestisce.
Ciò che non tocca
Il vocabolario personalizzato in una qualsiasi delle sue quattro forme modella ciò che il motore sente mentre sta trascrivendo e non configura il successivo lavoro Insights. Gli Insights vengono eseguiti rispetto alla trascrizione risultante. Imparare il vocabolario in anticipo può quindi migliorare il testo originale letto da Insights, senza modificare ciò che Insights genera.
Un esempio pratico
Un podcast settimanale intervista un ospite diverso in ogni episodio ma copre sempre le stesse tre linee di prodotti per nome. L’host crea una volta un dizionario salvato, importato da un foglio di calcolo dei nomi dei prodotti e dei nomi del team, scritto nel modo in cui li dice effettivamente lo spettacolo e lo contrassegna come predefinito. L’episodio di ogni settimana beneficia automaticamente. Per l’ospite di quella settimana, un nome che il dizionario permanente non ha motivo di conoscere, l’host aggiunge un termine chiave prima del caricamento, specifico per quel file. Il dizionario permanente e il termine chiave una tantum si applicano entrambi alla stessa trascrizione e non richiedono di toccare l’altro.
Dove configurarlo
Le opzioni del vocabolario si trovano accanto alle altre impostazioni per file su da audio a testo, sia che tu stia aggiungendo un termine chiave una tantum a un singolo caricamento o gestendo un dizionario salvato per lavoro ricorrente. Funzionano allo stesso modo indipendentemente da quale delle circa 99 lingue Hushscript rileva automaticamente nella registrazione e la pagina delle lingue contiene l’elenco completo, insieme a quelle che ottengono la massima precisione. Per ulteriori informazioni su come ottenere la trascrizione stessa prima di preoccuparti del vocabolario, vedi come trascrivere un podcast per il flusso di lavoro con ospite ricorrente seguito da questo esempio.
Fonti e standard indipendenti
Hushscript ha consultato queste fonti indipendenti e non concorrenti. Illustrano ricerche, standard o il funzionamento delle piattaforme e non implicano un sostegno a Hushscript.
Fonti verificate il: