Vai al contenuto principale

Come convertire un video MP4 in testo, in privato

Autore: Pubblicato: Ultima revisione:

Un flusso di lavoro video caricato per primo può inviare l’intero MP4 anche se il riconoscimento vocale necessita solo della traccia audio. A seconda della risoluzione, del codec e del bitrate, una lunga registrazione può occupare molti gigabyte. Hushscript evita questo trasferimento: il browser prepara prima l’audio e il video sorgente rimane sul tuo dispositivo.

Hushscript prende un percorso diverso. Il tuo browser estrae l’audio dal video prima che inizi il caricamento, quindi l’MP4 originale rimane sul tuo dispositivo. Viene trascritto solo l’audio e viene eliminato nel momento in cui la trascrizione è pronta. Questa guida illustra l’intero processo: i passaggi, un esempio pratico su un webinar registrato, come estrarre i sottotitoli SRT, gli altri formati video che funzionano allo stesso modo e cosa fare quando qualcosa va storto.

Perché non dovrebbe essere necessario caricare il tuo video

La traccia video è irrilevante per la trascrizione. Il motore vocale necessita solo dell’audio. Caricare l’immagine è puro spreco: tempo di rete, spazio di archiviazione sul server e un’impronta sulla privacy di cui non hai bisogno.

Come funziona l’estrazione nel browser, in modo semplice

Un MP4 è un contenitore. Al suo interno si trovano flussi separati: il video (l’immagine), l’audio (il suono) e alcuni metadati, una struttura spiegata nella guida all’elaborazione video di MDN. La trascrizione richiede solo il flusso audio.

Hushscript esegue un piccolo toolkit multimediale nativo del browser direttamente sulla pagina. Quando rilasci il tuo MP4, quel toolkit apre il contenitore localmente, copia il flusso audio e consegna l’audio al caricamento, senza che la pagina invii mai il video da nessuna parte. Il lavoro avviene nello stesso posto in cui viene riprodotto un video: sul tuo computer.

Quindi il risultato pratico è:

Questo è importante per riunioni, interviste registrate, deposizioni legali e qualsiasi cosa in cui si trovi il filmato stesso. sensibile. È importante anche quando la connessione è lenta con un file da più gigabyte: estraendo prima l’audio, un caricamento di mezz’ora si trasforma in un paio di minuti.

Cosa ti serve

Tre cose e niente da installare:

Non è necessario un estrattore audio separato, un convertitore o alcun software video. L’eliminazione dell’MP4 è l’intero input.

Converti un MP4 in tre passaggi

  1. Trascina il tuo MP4 sulla pagina in /MP4-to-text. Il tuo browser estrae la traccia audio e carica solo l’audio, in modo che il video stesso rimanga sul tuo dispositivo. I primi 30 secondi vengono visualizzati come anteprima con l’etichetta del relatore, non è necessario alcun account.
  2. Registrati per trascrivere il resto. Inserisci la tua email per creare un account. Nuovo qui? I primi 30 minuti li offriamo noi una volta verificato un metodo di pagamento, una trattenuta su carta di $ 1 (autorizzata, quindi rilasciata immediatamente, mai addebitata) o il tuo pacchetto primo minuto se paghi in un altro modo. Non è richiesta alcuna carta. La trascrizione viene fatturata in base alla durata dell’audio, non alle dimensioni del file.
  3. Esporta la trascrizione. Una volta pronta, scaricala in uno qualsiasi dei 21 formati (TXT, SRT e VTT per i sottotitoli, DOCX e PDF per i documenti, JSON e CSV per i dati, tra gli altri) oltre a un file .husharchive protetto da password. Le etichette dei parlanti sono incluse gratuitamente.

L’eliminazione dell’audio avviene automaticamente quando viene consegnata la trascrizione. Non c’è alcun passaggio di pulizia da ricordare.

Cosa significa “fatturato in base alla durata dell’audio”

Un MP4 di un’ora a 1080p potrebbe essere 6 GB. L’audio estratto da esso (tipicamente AAC a 128–256 kbps) è di circa 60–120 MB. Questo è ciò che viene caricato e il costo al minuto si basa su un’ora di audio, non sul file da 6 GB.

Il risultato: puoi trascrivere un documentario 4K di due ore da un registratore da campo e pagare lo stesso costo al minuto di un piccolo MP3, perché entrambi trasportano la stessa quantità di audio. Risoluzione, bitrate e dimensione del file sono completamente irrilevanti per l’importo che ti viene addebitato.

Un esempio pratico: un webinar registrato

Supponiamo che tu abbia eseguito un webinar di 52 minuti con due relatori e lo abbia registrato su un singolo MP4:q3-product-webinar.mp4, circa 3,4 GB a 1080p. Vuoi una trascrizione pulita dell’e-mail di riepilogo, oltre ai sottotitoli da allegare alla riproduzione.

Ecco come funziona:

  1. Apri /MP4-to-text e rilascia q3-product-webinar.mp4. La pagina estrae l’audio localmente, in modo che il video da 3,4 GB diventi circa 70 MB di audio. Vengono caricati solo quei 70 MB.
  2. I primi 30 secondi tornano etichettati, in modo da poter controllare la qualità audio prima di trascrivere tutti i 52 minuti.
  3. Quando la trascrizione completa è pronta, viene divisa in espressioni contrassegnate con Parlante A o Parlante B. Fai clic su Parlante A, scrivi “Priya”, fai clic su Parlante B, scrivi “Marcus” ed entrambi vengono rietichettati ovunque contemporaneamente.
  4. Esporti TXT per l’e-mail di riepilogo e SRT per la traccia dei sottotitoli del replay. L’MP4 originale del webinar non ha mai lasciato il tuo laptop e l’audio è già stato eliminato dal server.

La parte che sorprende le persone la prima volta è il passaggio 1: un caricamento di più gigabyte che semplicemente non avviene. L’immagine rimane con te; viaggiano solo le parole.

Etichette dei parlanti per video con più persone

Ogni trascrizione include la diarizzazione automatica dei parlanti senza costi aggiuntivi. Per un’intervista, un panel o la registrazione di una riunione, ogni relatore viene etichettato Parlante A,Parlante B e così via, e puoi rinominarli con nomi reali nell’editor facendo clic sull’etichetta e digitando.

La diarizzazione funziona meglio con una separazione netta. L’audio della videocamera in una stanza tranquilla o una videochiamata registrata con tracce per partecipante offrono al motore il massimo con cui lavorare. Una stanza affollata con persone che parlano tra loro è più difficile per qualsiasi motore di diarizzazione. Consulta la sezione di risoluzione dei problemi di seguito per sapere cosa può esserti utile.

Ottieni i sottotitoli (SRT/VTT) dal video

Se il motivo per cui stai trascrivendo il video sono i sottotitoli, esporta la trascrizione come SRT. Ogni espressione arriva con un timestamp di inizio e fine, formattato secondo le specifiche SRT:

1
00:00:04,210 --> 00:00:07,880
Parlante A: Grazie per esserti unito a noi oggi.

2
00:00:08,100 --> 00:00:12,340
Parlante B: Felice di essere qui.

Carica l’SRT in un lettore desktop (VLC, QuickTime e la maggior parte degli editor lo accetta) o caricalo come traccia di sottotitoli su una piattaforma che ne supporta uno. L’esportazione Hushscript SRT mantiene le etichette dei parlanti, il che è utile per i video con più persone. Alcuni formati di didascalie eliminano i nomi; SRT li preserva.

Per i lettori web che utilizzano WebVTT (.vtt), la differenza da SRT è minima: una riga di intestazione WEBVTT e un . invece di , nei timestamp. Puoi convertire un SRT in VTT nel browser con lo strumento gratuito su /tools/SRT-to-VTT; la conversione viene eseguita localmente nella pagina.

Due guide sorelle vanno più in profondità di quanto ci sia spazio qui: come creare sottotitoli SRT da un video copre i tempi di modifica dei segnali d’azione e la lunghezza della linea, e come aggiungere sottotitoli a un video copre come allegare l’SRT o masterizzarlo. Masterizzazione permanente dei sottotitoli in l’immagine è una fase di codifica separata. Uno strumento gratuito come HandBrake gestisce il mux una volta ottenuto l’SRT.

Altri formati video (MOV, WebM, MKV)

Lo stesso processo di estrazione dal browser si applica ben oltre MP4:

Questi contenitori contengono i soliti codec audio (AAC, MP3, Opus, FLAC) e l’estrazione passo li demuxizza allo stesso modo di un MP4. In pratica, funzionerà qualsiasi cosa registrata su un telefono, una fotocamera o un registratore dello schermo. Basta inserirlo.

Puoi anche caricare direttamente file solo audio come MP3, WAV, M4A. Senza alcun flusso video da eliminare, la fase di estrazione viene saltata e il file viene caricato così com’è. E se desideri solo il file audio stesso anziché una trascrizione, convertire un MP4 in un MP3 è un lavoro separato che viene eseguito interamente nel tuo browser. La pagina da video a testo copre l’intero flusso di lavoro per qualsiasi formato video, compresi quelli con codec audio insoliti.

Risoluzione dei problemi

I file MP4 comuni di solito non richiedono preparazione manuale. Se uno fallisce o produce testo debole, controlla prima queste cause.

Il video sorgente è molto grande. L’app non ha limiti di dimensione del file: prepara l’audio anche da video molto grandi direttamente nel tuo browser, purché la registrazione avvenga entro 10 ore (il tuo browser necessita comunque di capacità locale sufficiente per eseguire il lavoro). Se l’estrazione si blocca su un file 4K di grandi dimensioni, chiudi le altre schede e riprova oppure estrai prima l’audio. Gli strumenti di estrazione audio gratuiti funzionano nel browser e producono un file più piccolo che puoi caricare direttamente.

Nessuna traccia audio o nessun parlato. Una registrazione dello schermo silenzioso o una clip di sola musica non può essere trascritta dal motore, quindi otterrai un risultato vuoto. Conferma che il video abbia effettivamente l’audio parlato riprodundolo con il volume alzato. Se si tratta di una registrazione dello schermo, verifica che il registratore sia impostato per acquisire l’audio del sistema o del microfono; molti hanno come impostazione predefinita solo il video.

Un codec audio non supportato o oscuro. L’estrattore interno al browser gestisce i codec comuni (AAC, MP3, Opus, FLAC). Un contenitore che utilizza un codec audio insolito o proprietario potrebbe non eseguire il demux in modo pulito e l’audio non verrà estratto. La soluzione consiste nel ricomporre o ricodificare prima l’audio del video in un codec standard; la maggior parte dei convertitori può produrre un MP4 standard o un semplice file audio. Se trovi un formato che non funziona, invia un’e-mail a support@hushscript.com e penseremo ad aggiungerlo.

Più parlanti, separazione disordinata. La diarizzazione ha bisogno di voci distinguibili. La sovrapposizione del parlato, un singolo microfono a campo lontano in una stanza grande o un forte rumore di fondo confondono i confini tra i parlanti. Riceverai comunque una trascrizione accurata; le etichette dei parlanti sono semplicemente meno precise. Se controlli la registrazione, una traccia per partecipante (come la maggior parte degli strumenti di videochiamata può esportare) o un microfono più vicino a ciascun parlante offre la separazione più pulita. In ogni caso, puoi correggere eventuali righe con etichette errate nell’editor prima dell’esportazione.

La trascrizione presenta errori di ortografia coerenti. Un nome proprio o un termine gergale ricorrente che viene sempre trascritto nello stesso modo sbagliato è una soluzione una tantum: un’unica operazione di ricerca e sostituzione nel testo esportato corregge ogni istanza. È più veloce che eseguire nuovamente qualsiasi cosa.

Esporta i formati a colpo d’occhio

Formatta Cosa ottieni
TXT Testo normale, etichette dei parlanti, no timestamp
SRT Sottotitoli con timestamp, pronti per il trasferimento laterale in qualsiasi lettore video
VTT Sottotitoli web per lettori video HTML5
CSV Righe adatte ai fogli di calcolo con relatori e tempi
Markdown Testo con etichetta del relatore per note e pubblicazione
JSON Dati strutturati:{ speaker, start, end, text } per espressione
DOCX Trascrizione con etichetta dell’oratore per Word o Google Docs
PDF Trascrizione a layout fisso per la condivisione o l’archiviazione

Tutti i formati di esportazione sono inclusi in ogni piano, compresi i 30 minuti gratuiti, e nessuno presenta una filigrana.


Per qualsiasi video in cui la privacy è importante, che si tratti di una riunione, un’intervista o una deposizione, il punto è valido: il tuo video non viene mai caricato. Puoi verificarlo tu stesso. Apri la scheda di rete del browser prima di rilasciare il file e guarda cosa viene inviato; vedrai l’audio salire e l’immagine restare ferma.

Fonti e standard indipendenti

Hushscript ha consultato queste fonti indipendenti e non concorrenti. Illustrano ricerche, standard o il funzionamento delle piattaforme e non implicano un sostegno a Hushscript.

Fonti verificate il:

Domande frequenti

Il file video MP4 viene caricato sul server?

No. Il tuo browser estrae la traccia audio dal video prima che qualsiasi cosa lasci il tuo dispositivo. Solo l'audio viene inviato per la trascrizione. L'MP4 originale rimane sul tuo computer. Puoi confermarlo tu stesso nella scheda di rete del browser: vedrai il piccolo caricamento audio, non il video da più gigabyte.

Qual ​​è la dimensione massima del video che posso utilizzare?

Non c'è limite alla dimensione del file: sono accettate registrazioni fino a 10 ore, indipendentemente dalle dimensioni del video sorgente. Poiché viene caricato solo l'audio, un video lungo di solito invia molti meno dati rispetto alle sue dimensioni sul disco.

Quanto costa trascrivere un MP4?

Ricevi 30 minuti gratuiti dopo un controllo della carta da $ 1 (la trattenuta viene autorizzata, quindi rilasciata immediatamente, mai addebitata) o con il tuo primo acquisto se paghi in un altro modo. Dopodiché è a consumo, fatturato in base alla durata dell'audio, non alla dimensione del file del video. Consulta la pagina dei prezzi per i costi del pacchetto.

Posso ottenere i sottotitoli SRT da un MP4?

Sì. Dopo la trascrizione, esporta come SRT. Il file SRT include un timestamp di inizio e fine per ogni espressione e può essere trasferito nella maggior parte dei lettori video o caricato come traccia di didascalie. Mantiene le etichette dei parlanti, che alcuni altri formati di sottotitoli perdono.

Quali altri formati video funzionano allo stesso modo?

MOV, WebM, MKV e la maggior parte dei formati contenitore che contengono un codec audio standard (AAC, MP3, Opus, FLAC). La fase di estrazione nel browser gestisce il demux, quindi il metodo è identico a MP4.

Il mio video non ha audio parlato. Posso comunque trascriverlo?

No. La trascrizione funziona dal parlato, quindi un video senza traccia audio o una registrazione su schermo silenzioso non ha nulla da trascrivere. Se c'è musica di sottofondo ma non parlato, il risultato sarà vuoto o rumore, perché il motore restituisce solo parole.

L'audio viene eliminato dopo la trascrizione?

Sì. L'audio estratto viene eliminato dal server nel momento in cui la trascrizione è pronta e il motore vocale non conserva nulla. La trascrizione stessa è crittografata quando non è attiva, quindi anche una perdita di spazio di archiviazione esporrebbe un testo cifrato illeggibile anziché le tue parole.

Inizia con 30 minuti gratuiti

Inizia – 30 minuti gratuiti