Come convertire un video MP4 in testo, in privato
Autore: Hushscript Pubblicato: Ultima revisione:
Un flusso di lavoro video caricato per primo può inviare l’intero MP4 anche se il riconoscimento vocale necessita solo della traccia audio. A seconda della risoluzione, del codec e del bitrate, una lunga registrazione può occupare molti gigabyte. Hushscript evita questo trasferimento: il browser prepara prima l’audio e il video sorgente rimane sul tuo dispositivo.
Hushscript prende un percorso diverso. Il tuo browser estrae l’audio dal video prima che inizi il caricamento, quindi l’MP4 originale rimane sul tuo dispositivo. Viene trascritto solo l’audio e viene eliminato nel momento in cui la trascrizione è pronta. Questa guida illustra l’intero processo: i passaggi, un esempio pratico su un webinar registrato, come estrarre i sottotitoli SRT, gli altri formati video che funzionano allo stesso modo e cosa fare quando qualcosa va storto.
Perché non dovrebbe essere necessario caricare il tuo video
La traccia video è irrilevante per la trascrizione. Il motore vocale necessita solo dell’audio. Caricare l’immagine è puro spreco: tempo di rete, spazio di archiviazione sul server e un’impronta sulla privacy di cui non hai bisogno.
Come funziona l’estrazione nel browser, in modo semplice
Un MP4 è un contenitore. Al suo interno si trovano flussi separati: il video (l’immagine), l’audio (il suono) e alcuni metadati, una struttura spiegata nella guida all’elaborazione video di MDN. La trascrizione richiede solo il flusso audio.
Hushscript esegue un piccolo toolkit multimediale nativo del browser direttamente sulla pagina. Quando rilasci il tuo MP4, quel toolkit apre il contenitore localmente, copia il flusso audio e consegna l’audio al caricamento, senza che la pagina invii mai il video da nessuna parte. Il lavoro avviene nello stesso posto in cui viene riprodotto un video: sul tuo computer.
Quindi il risultato pratico è:
- Il file MP4 non lascia mai il tuo dispositivo. L’immagine resta con te.
- La dimensione di caricamento è la dimensione dell’audio, non del video, solitamente 10-20 volte più piccola.
- Il server e il motore vocale dietro di esso non hanno mai accesso ai tuoi contenuti video.
Questo è importante per riunioni, interviste registrate, deposizioni legali e qualsiasi cosa in cui si trovi il filmato stesso. sensibile. È importante anche quando la connessione è lenta con un file da più gigabyte: estraendo prima l’audio, un caricamento di mezz’ora si trasforma in un paio di minuti.
Cosa ti serve
Tre cose e niente da installare:
- Un MP4 con audio parlato. Una riunione registrata, webinar, interviste, conferenze o video con una persona parlante: qualsiasi cosa in cui le persone parlano. Una clip silenziosa o un video di sola musica non hanno nulla da trascrivere.
- Un browser attuale. Chrome, Edge, Firefox o Safari, ragionevolmente aggiornati. L’estrazione audio viene eseguita nel browser, quindi un browser vecchio o ridotto potrebbe non supportarla.
- Un account Hushscript. Ottieni 30 minuti gratuiti dopo un controllo con carta di $ 1 (la trattenuta viene autorizzata, quindi rilasciata immediatamente, mai addebitata) o con il tuo primo acquisto se utilizzi un altro metodo di pagamento disponibile nel tuo Paese. Non è necessaria una carta; è solo il percorso più veloce per ottenere minuti gratuiti. Dopodiché è a consumo, senza abbonamento. I costi sono riportati nella pagina dei prezzi.
Non è necessario un estrattore audio separato, un convertitore o alcun software video. L’eliminazione dell’MP4 è l’intero input.
Converti un MP4 in tre passaggi
- Trascina il tuo MP4 sulla pagina in /MP4-to-text. Il tuo browser estrae la traccia audio e carica solo l’audio, in modo che il video stesso rimanga sul tuo dispositivo. I primi 30 secondi vengono visualizzati come anteprima con l’etichetta del relatore, non è necessario alcun account.
- Registrati per trascrivere il resto. Inserisci la tua email per creare un account. Nuovo qui? I primi 30 minuti li offriamo noi una volta verificato un metodo di pagamento, una trattenuta su carta di $ 1 (autorizzata, quindi rilasciata immediatamente, mai addebitata) o il tuo pacchetto primo minuto se paghi in un altro modo. Non è richiesta alcuna carta. La trascrizione viene fatturata in base alla durata dell’audio, non alle dimensioni del file.
- Esporta la trascrizione. Una volta pronta, scaricala in uno qualsiasi dei 21 formati (TXT, SRT e VTT per i sottotitoli, DOCX e PDF per i documenti, JSON e CSV per i dati, tra gli altri) oltre a un file .husharchive protetto da password. Le etichette dei parlanti sono incluse gratuitamente.
L’eliminazione dell’audio avviene automaticamente quando viene consegnata la trascrizione. Non c’è alcun passaggio di pulizia da ricordare.
Cosa significa “fatturato in base alla durata dell’audio”
Un MP4 di un’ora a 1080p potrebbe essere 6 GB. L’audio estratto da esso (tipicamente AAC a 128–256 kbps) è di circa 60–120 MB. Questo è ciò che viene caricato e il costo al minuto si basa su un’ora di audio, non sul file da 6 GB.
Il risultato: puoi trascrivere un documentario 4K di due ore da un registratore da campo e pagare lo stesso costo al minuto di un piccolo MP3, perché entrambi trasportano la stessa quantità di audio. Risoluzione, bitrate e dimensione del file sono completamente irrilevanti per l’importo che ti viene addebitato.
Un esempio pratico: un webinar registrato
Supponiamo che tu abbia eseguito un webinar di 52 minuti con due relatori e lo abbia registrato su un singolo MP4:q3-product-webinar.mp4, circa 3,4 GB a 1080p. Vuoi una trascrizione pulita dell’e-mail di riepilogo, oltre ai sottotitoli da allegare alla riproduzione.
Ecco come funziona:
- Apri /MP4-to-text e rilascia
q3-product-webinar.mp4. La pagina estrae l’audio localmente, in modo che il video da 3,4 GB diventi circa 70 MB di audio. Vengono caricati solo quei 70 MB. - I primi 30 secondi tornano etichettati, in modo da poter controllare la qualità audio prima di trascrivere tutti i 52 minuti.
- Quando la trascrizione completa è pronta, viene divisa in espressioni contrassegnate con
Parlante AoParlante B. Fai clic suParlante A, scrivi “Priya”, fai clic suParlante B, scrivi “Marcus” ed entrambi vengono rietichettati ovunque contemporaneamente. - Esporti TXT per l’e-mail di riepilogo e SRT per la traccia dei sottotitoli del replay. L’MP4 originale del webinar non ha mai lasciato il tuo laptop e l’audio è già stato eliminato dal server.
La parte che sorprende le persone la prima volta è il passaggio 1: un caricamento di più gigabyte che semplicemente non avviene. L’immagine rimane con te; viaggiano solo le parole.
Etichette dei parlanti per video con più persone
Ogni trascrizione include la diarizzazione automatica dei parlanti senza costi aggiuntivi. Per un’intervista, un panel o la registrazione di una riunione, ogni relatore viene etichettato Parlante A,Parlante B e così via, e puoi rinominarli con nomi reali nell’editor facendo clic sull’etichetta e digitando.
La diarizzazione funziona meglio con una separazione netta. L’audio della videocamera in una stanza tranquilla o una videochiamata registrata con tracce per partecipante offrono al motore il massimo con cui lavorare. Una stanza affollata con persone che parlano tra loro è più difficile per qualsiasi motore di diarizzazione. Consulta la sezione di risoluzione dei problemi di seguito per sapere cosa può esserti utile.
Ottieni i sottotitoli (SRT/VTT) dal video
Se il motivo per cui stai trascrivendo il video sono i sottotitoli, esporta la trascrizione come SRT. Ogni espressione arriva con un timestamp di inizio e fine, formattato secondo le specifiche SRT:
1
00:00:04,210 --> 00:00:07,880
Parlante A: Grazie per esserti unito a noi oggi.
2
00:00:08,100 --> 00:00:12,340
Parlante B: Felice di essere qui.
Carica l’SRT in un lettore desktop (VLC, QuickTime e la maggior parte degli editor lo accetta) o caricalo come traccia di sottotitoli su una piattaforma che ne supporta uno. L’esportazione Hushscript SRT mantiene le etichette dei parlanti, il che è utile per i video con più persone. Alcuni formati di didascalie eliminano i nomi; SRT li preserva.
Per i lettori web che utilizzano WebVTT (.vtt), la differenza da SRT è minima: una riga di intestazione WEBVTT e un . invece di , nei timestamp. Puoi convertire un SRT in VTT nel browser con lo strumento gratuito su /tools/SRT-to-VTT; la conversione viene eseguita localmente nella pagina.
Due guide sorelle vanno più in profondità di quanto ci sia spazio qui: come creare sottotitoli SRT da un video copre i tempi di modifica dei segnali d’azione e la lunghezza della linea, e come aggiungere sottotitoli a un video copre come allegare l’SRT o masterizzarlo. Masterizzazione permanente dei sottotitoli in l’immagine è una fase di codifica separata. Uno strumento gratuito come HandBrake gestisce il mux una volta ottenuto l’SRT.
Altri formati video (MOV, WebM, MKV)
Lo stesso processo di estrazione dal browser si applica ben oltre MP4:
- MOV: video iPhone ed esportazioni Final Cut.
- WebM: registrazioni di schermate da Chrome e acquisizioni OBS.
- MKV: il contenitore comune per registratori di schermate e contenuti estratti con una traccia audio standard.
Questi contenitori contengono i soliti codec audio (AAC, MP3, Opus, FLAC) e l’estrazione passo li demuxizza allo stesso modo di un MP4. In pratica, funzionerà qualsiasi cosa registrata su un telefono, una fotocamera o un registratore dello schermo. Basta inserirlo.
Puoi anche caricare direttamente file solo audio come MP3, WAV, M4A. Senza alcun flusso video da eliminare, la fase di estrazione viene saltata e il file viene caricato così com’è. E se desideri solo il file audio stesso anziché una trascrizione, convertire un MP4 in un MP3 è un lavoro separato che viene eseguito interamente nel tuo browser. La pagina da video a testo copre l’intero flusso di lavoro per qualsiasi formato video, compresi quelli con codec audio insoliti.
Risoluzione dei problemi
I file MP4 comuni di solito non richiedono preparazione manuale. Se uno fallisce o produce testo debole, controlla prima queste cause.
Il video sorgente è molto grande. L’app non ha limiti di dimensione del file: prepara l’audio anche da video molto grandi direttamente nel tuo browser, purché la registrazione avvenga entro 10 ore (il tuo browser necessita comunque di capacità locale sufficiente per eseguire il lavoro). Se l’estrazione si blocca su un file 4K di grandi dimensioni, chiudi le altre schede e riprova oppure estrai prima l’audio. Gli strumenti di estrazione audio gratuiti funzionano nel browser e producono un file più piccolo che puoi caricare direttamente.
Nessuna traccia audio o nessun parlato. Una registrazione dello schermo silenzioso o una clip di sola musica non può essere trascritta dal motore, quindi otterrai un risultato vuoto. Conferma che il video abbia effettivamente l’audio parlato riprodundolo con il volume alzato. Se si tratta di una registrazione dello schermo, verifica che il registratore sia impostato per acquisire l’audio del sistema o del microfono; molti hanno come impostazione predefinita solo il video.
Un codec audio non supportato o oscuro. L’estrattore interno al browser gestisce i codec comuni (AAC, MP3, Opus, FLAC). Un contenitore che utilizza un codec audio insolito o proprietario potrebbe non eseguire il demux in modo pulito e l’audio non verrà estratto. La soluzione consiste nel ricomporre o ricodificare prima l’audio del video in un codec standard; la maggior parte dei convertitori può produrre un MP4 standard o un semplice file audio. Se trovi un formato che non funziona, invia un’e-mail a support@hushscript.com e penseremo ad aggiungerlo.
Più parlanti, separazione disordinata. La diarizzazione ha bisogno di voci distinguibili. La sovrapposizione del parlato, un singolo microfono a campo lontano in una stanza grande o un forte rumore di fondo confondono i confini tra i parlanti. Riceverai comunque una trascrizione accurata; le etichette dei parlanti sono semplicemente meno precise. Se controlli la registrazione, una traccia per partecipante (come la maggior parte degli strumenti di videochiamata può esportare) o un microfono più vicino a ciascun parlante offre la separazione più pulita. In ogni caso, puoi correggere eventuali righe con etichette errate nell’editor prima dell’esportazione.
La trascrizione presenta errori di ortografia coerenti. Un nome proprio o un termine gergale ricorrente che viene sempre trascritto nello stesso modo sbagliato è una soluzione una tantum: un’unica operazione di ricerca e sostituzione nel testo esportato corregge ogni istanza. È più veloce che eseguire nuovamente qualsiasi cosa.
Esporta i formati a colpo d’occhio
| Formatta | Cosa ottieni |
|---|---|
| TXT | Testo normale, etichette dei parlanti, no timestamp |
| SRT | Sottotitoli con timestamp, pronti per il trasferimento laterale in qualsiasi lettore video |
| VTT | Sottotitoli web per lettori video HTML5 |
| CSV | Righe adatte ai fogli di calcolo con relatori e tempi |
| Markdown | Testo con etichetta del relatore per note e pubblicazione |
| JSON | Dati strutturati:{ speaker, start, end, text } per espressione |
| DOCX | Trascrizione con etichetta dell’oratore per Word o Google Docs |
| Trascrizione a layout fisso per la condivisione o l’archiviazione |
Tutti i formati di esportazione sono inclusi in ogni piano, compresi i 30 minuti gratuiti, e nessuno presenta una filigrana.
Per qualsiasi video in cui la privacy è importante, che si tratti di una riunione, un’intervista o una deposizione, il punto è valido: il tuo video non viene mai caricato. Puoi verificarlo tu stesso. Apri la scheda di rete del browser prima di rilasciare il file e guarda cosa viene inviato; vedrai l’audio salire e l’immagine restare ferma.
Fonti e standard indipendenti
Hushscript ha consultato queste fonti indipendenti e non concorrenti. Illustrano ricerche, standard o il funzionamento delle piattaforme e non implicano un sostegno a Hushscript.
Fonti verificate il: