Ir para o conteúdo principal

Como converter um vídeo MP4 em texto, de forma privada

Autor: Publicado em: Última revisão:

Um fluxo de trabalho de upload de vídeo primeiro pode enviar o MP4 inteiro, mesmo que o reconhecimento de fala precise apenas de sua trilha de áudio. Dependendo da resolução, codec e taxa de bits, uma gravação longa pode ter muitos gigabytes. O Hushscript evita essa transferência: o navegador prepara o áudio primeiro e o vídeo de origem permanece no seu dispositivo.

O Hushscript segue um caminho diferente. Seu navegador extrai o áudio do vídeo antes do início do upload, para que o MP4 original permaneça no seu dispositivo. Apenas o áudio é transcrito e é excluído no momento em que sua transcrição fica pronta. Este guia percorre todo o processo: as etapas, um exemplo prático em um webinar gravado, como extrair legendas SRT, os outros formatos de vídeo que funcionam da mesma maneira e o que fazer quando algo dá errado.

Por que seu vídeo não deveria ter que ser carregado

A faixa de vídeo é irrelevante para a transcrição. O mecanismo de fala precisa apenas do áudio. Carregar a imagem é puro desperdício: tempo de rede, armazenamento no servidor e uma pegada de privacidade que você não precisa.

Como funciona a extração no navegador, em linguagem simples

Um MP4 é um contêiner. Dentro dele estão fluxos separados: o vídeo (a imagem), o áudio (o som) e alguns metadados – uma estrutura explicada no guia de processamento de vídeo do MDN. A transcrição precisa apenas do fluxo de áudio.

O Hushscript executa um pequeno kit de ferramentas de mídia nativo do navegador diretamente na página. Quando você descarta seu MP4, esse kit de ferramentas abre o contêiner localmente, copia o fluxo de áudio e entrega esse áudio para upload, sem que a página envie o vídeo para qualquer lugar. O trabalho acontece no mesmo local em que um vídeo é reproduzido: na sua própria máquina.

Portanto, o resultado prático é:

Isso é importante para reuniões, entrevistas gravadas, depoimentos legais e qualquer coisa em que a filmagem em si seja sensível. Isso também é importante quando você está em uma conexão lenta com um arquivo de vários gigabytes: extrair o áudio primeiro transforma um upload de meia hora em alguns minutos.

O que você precisa

Três coisas e nada para instalar:

Você não precisa de um extrator de áudio separado, um conversor ou qualquer software de vídeo. Soltar o MP4 é a entrada completa.

Converta um MP4 em três etapas

  1. Solte seu MP4 na página em /MP4-to-text. Seu navegador extrai a faixa de áudio e carrega apenas o áudio, para que o vídeo em si permaneça no seu dispositivo. Os primeiros 30 segundos voltam como uma visualização etiquetada pelo palestrante, sem necessidade de conta.
  2. Inscreva-se para transcrever o restante. Digite seu e-mail para criar uma conta. Novo aqui? Os primeiros 30 minutos serão por nossa conta assim que você verificar uma forma de pagamento, seja uma retenção de US$ 1 no cartão (autorizada e liberada imediatamente, nunca cobrada) ou seu pacote de primeiro minuto se você pagar de outra forma. Nenhum cartão é necessário. A transcrição é cobrada pela duração do áudio, não pelo tamanho do arquivo.
  3. Exporte a transcrição. Quando estiver pronta, baixe-a em qualquer um dos 21 formatos (TXT, SRT e VTT para legendas, DOCX e PDF para documentos, JSON e CSV para dados, entre outros), além de um .husharchive protegido por senha. As etiquetas dos falantes são incluídas gratuitamente.

A exclusão do áudio acontece automaticamente quando a transcrição é entregue. Não há nenhuma etapa de limpeza a ser lembrada.

O que significa “cobrado pela duração do áudio”

Um MP4 de uma hora em 1080p pode ter 6 GB. O áudio extraído dele (normalmente AAC de 128–256 kbps) tem cerca de 60–120 MB. É isso que faz o upload, e o custo por minuto é baseado em uma hora de áudio, não no arquivo de 6 GB.

Resultado: você pode transcrever um documentário 4K de duas horas de um gravador de campo e pagar o mesmo custo por minuto que um pequeno MP3, porque ambos carregam a mesma quantidade de áudio. Resolução, taxa de bits e tamanho do arquivo são completamente irrelevantes para o valor cobrado.

Um exemplo prático: um webinar gravado

Digamos que você realizou um webinar de 52 minutos com dois apresentadores e o gravou em um único MP4:q3-product-webinar.mp4, cerca de 3,4 GB em 1080p. Você deseja uma transcrição limpa para o e-mail de recapitulação, além de legendas para anexar ao replay.

Veja como realmente funciona:

  1. Você abre /MP4-to-text e solta q3-product-webinar.mp4. A página extrai o áudio localmente, de modo que o vídeo de 3,4 GB se transforma em aproximadamente 70 MB de áudio. Apenas os 70 MB de upload.
  2. Os primeiros 30 segundos voltam rotulados, para que você possa verificar a qualidade do áudio antes de transcrever os 52 minutos completos.
  3. Quando a transcrição completa estiver pronta, ela será dividida em expressões marcadas como Falante A ou Falante B. Você clica em Falante A, digita “Priya”, clica em Falante B, digita “Marcus” e ambos renomeiam todos os lugares ao mesmo tempo.
  4. Você exporta TXT para o e-mail de recapitulação e SRT para a faixa de legenda do replay. O MP4 original do webinar nunca saiu do seu laptop e o áudio já foi excluído do servidor.

A parte que surpreende as pessoas na primeira vez é o passo 1: um upload de vários gigabytes que simplesmente não acontece. A imagem fica com você; apenas as palavras viajam.

Rótulos de falante para vídeos com várias pessoas

Cada transcrição inclui diarização automática de falante sem custo extra. Para uma entrevista, um painel ou uma gravação de reunião, cada palestrante é rotulado como Falante A,Falante B e assim por diante, e você pode renomeá-los com nomes reais no editor clicando no rótulo e digitando.

A diarização funciona melhor com separação limpa. O áudio da câmera em uma sala silenciosa ou uma chamada de vídeo gravada com faixas por participante oferecem ao mecanismo o máximo para trabalhar. Uma sala lotada com pessoas conversando é mais difícil para qualquer mecanismo de diarização. Consulte a seção de solução de problemas abaixo para saber o que ajuda.

Obtenha legendas (SRT/VTT) do vídeo

Se o motivo da transcrição do vídeo for legendas, exporte a transcrição como SRT. Cada enunciado chega com um carimbo de data e hora de início e fim, formatado de acordo com a especificação SRT:

1
00:00:04,210 --> 00:00:07,880
Falante A: Obrigado por se juntar a nós hoje.

2
00:00:08,100 --> 00:00:12,340
Falante B: Feliz por estar aqui.

Carregue o SRT em um player de desktop (VLC, QuickTime e a maioria dos editores o aceitam) ou carregue-o como uma faixa de legenda em uma plataforma que suporte um. A exportação Hushscript SRT mantém os rótulos dos falantes, o que é útil para vídeos com várias pessoas. Alguns formatos de legenda retiram os nomes; O SRT os preserva.

Para web players que usam WebVTT (.vtt), a diferença do SRT é pequena: uma linha de cabeçalho WEBVTT e um . em vez de , nos carimbos de data e hora. Você pode converter um SRT em VTT no navegador com a ferramenta gratuita em /tools/SRT-to-VTT; a conversão é executada localmente na página.

Dois guias irmãos vão mais fundo do que há espaço para aqui: como criar legendas SRT a partir de um vídeo cobre a edição do tempo de sinalização e comprimento da linha, e como adicionar legendas a um vídeo cobre anexar o SRT ou gravá-lo. Gravar legendas permanentemente no imagem é uma etapa de codificação separada. Uma ferramenta gratuita como o HandBrake cuida do mux assim que você tiver o SRT.

Outros formatos de vídeo (MOV, WebM, MKV)

O mesmo processo de extração do navegador se aplica muito além do MP4:

Esses contêineres carregam os codecs de áudio usuais (AAC, MP3, Opus, FLAC), e a etapa de extração os desmultiplica da mesma forma maneira que faz um MP4. Na prática, qualquer coisa gravada em um telefone, câmera ou gravador de tela funcionará. Basta inseri-lo.

Você também pode alimentar arquivos somente de áudio, como MP3, WAV, M4A diretamente. Sem nenhum fluxo de vídeo para extrair, a etapa de extração é ignorada e o arquivo é carregado como está. E se você quiser apenas o arquivo de áudio em vez de uma transcrição, converter o MP4 em MP3 é um trabalho separado que também é executado inteiramente no seu navegador. A página de vídeo para texto abrange todo o fluxo de trabalho para qualquer formato de vídeo, incluindo aqueles com codecs de áudio incomuns.

Solução de problemas

Arquivos MP4 comuns geralmente não precisam de preparação manual. Se um deles falhar ou produzir texto fraco, verifique primeiro essas causas.

O vídeo de origem é muito grande. O aplicativo não tem limite de tamanho de arquivo – ele prepara o áudio até mesmo de vídeos muito grandes diretamente no seu navegador, desde que a gravação ocorra dentro de 10 horas (seu navegador ainda precisa de capacidade local suficiente para fazer o trabalho). Se a extração travar em um arquivo 4K enorme, feche outras guias e tente novamente ou extraia o áudio primeiro. As ferramentas de extração de áudio gratuitas funcionam no navegador e produzem um arquivo menor que você pode enviar diretamente.

Nenhuma faixa de áudio ou fala. Uma gravação de tela silenciosa ou um clipe apenas de música não tem nada para o mecanismo transcrever, então você obterá um resultado vazio. Confirme se o vídeo realmente tem áudio falado reproduzindo-o com o volume aumentado. Se for uma gravação de tela, verifique se o gravador foi configurado para capturar áudio do sistema ou do microfone; muitos usam apenas vídeo como padrão.

Um codec de áudio obscuro ou não suportado. O extrator no navegador lida com os codecs comuns (AAC, MP3, Opus, FLAC). Um contêiner que usa um codec de áudio incomum ou proprietário pode não demuxar corretamente e o áudio não será extraído. A solução é primeiro recodificar ou recodificar o áudio do vídeo para um codec padrão; a maioria dos conversores pode gerar um MP4 padrão ou um arquivo de áudio simples. Se você encontrar um formato que não funciona, envie um e-mail para support@hushscript.com e veremos como adicioná-lo.

Vários falantes, separação confusa. A diarização precisa de vozes distinguíveis. Fala sobreposta, um único microfone de campo distante em uma sala grande ou ruído de fundo intenso confundem os limites entre os falantes. Você ainda receberá uma transcrição precisa; os rótulos dos falantes são menos precisos. Se você controlar a gravação, uma trilha por participante (como a maioria das ferramentas de videochamada pode exportar) ou um microfone mais próximo de cada falante oferece a separação mais nítida. De qualquer forma, você pode corrigir quaisquer linhas com rótulos incorretos no editor antes de exportar.

A transcrição tem erros ortográficos consistentes. Um nome próprio recorrente ou um jargão que é sempre transcrito da mesma maneira errada é uma solução única: uma única localização e substituição no texto exportado corrige todas as instâncias. Isso é mais rápido do que executar qualquer coisa novamente.

Exporte formatos rapidamente

Formatar O que você obtém
TXT Texto simples, rótulos de falante, sem carimbos de data/hora
SRT Legendas com carimbo de data/hora, prontas para serem carregadas em qualquer player de vídeo
VTT Legendas da Web para players de vídeo HTML5
CSV Linhas compatíveis com planilhas com falantes e tempos
Markdown Texto rotulado pelo falante para anotações e publicação
JSON Dados estruturados:{ speaker, start, end, text } por enunciado
DOCX Transcrição rotulada pelo falante para Word ou Google Docs
PDF Transcrição de layout fixo para compartilhamento ou arquivamento

Todos os formatos de exportação estão incluídos em todos os planos, incluindo os 30 minutos gratuitos, e nenhum traz marca d’água.


Para qualquer vídeo em que a privacidade seja importante, seja uma reunião, uma entrevista ou um depoimento, o ponto é válido: seu vídeo nunca é enviado. Você pode verificar você mesmo. Abra a aba de rede do navegador antes de soltar o arquivo e observe o que é enviado; você verá o áudio subir e a imagem permanecer no lugar.

Fontes e normas independentes

O Hushscript consultou estas referências independentes e não concorrentes. Elas explicam pesquisas, normas ou o funcionamento de plataformas e não representam endosso do Hushscript.

Fontes revisadas em:

Perguntas frequentes

O arquivo de vídeo MP4 é enviado para o servidor?

Não. Seu navegador extrai a trilha de áudio do vídeo antes que qualquer coisa saia do seu dispositivo. Apenas o áudio é enviado para transcrição. O MP4 original permanece na sua máquina. Você mesmo pode confirmar na guia de rede do navegador: você verá o pequeno upload de áudio, não o vídeo de vários gigabytes.

Qual ​​é o tamanho máximo de vídeo que posso usar?

Não há limite de tamanho de arquivo – são aceitas gravações de até 10 horas de duração, independentemente do tamanho do vídeo de origem. Como apenas o upload de áudio, um vídeo longo geralmente envia muito menos dados do que seu tamanho no disco.

Quanto custa transcrever um MP4?

Você ganha 30 minutos grátis após uma verificação de US$ 1 no cartão (a retenção é autorizada, liberada imediatamente, nunca cobrada) ou na sua primeira compra, se você pagar de outra forma. Depois disso, é pago conforme o uso, cobrado pela duração do áudio, não pelo tamanho do arquivo do vídeo. Consulte a página de preços para saber os custos do pacote.

Posso obter legendas SRT de um MP4?

Sim. Após a transcrição, exporte como SRT. O arquivo SRT inclui um carimbo de data e hora de início e término em cada expressão e pode ser transferido para a maioria dos players de vídeo ou carregado como uma faixa de legenda. Ele mantém os rótulos dos falantes, que alguns outros formatos de legenda eliminam.

Quais outros formatos de vídeo funcionam da mesma maneira?

MOV, WebM, MKV e a maioria dos formatos de contêiner que carregam um codec de áudio padrão (AAC, MP3, Opus, FLAC). A etapa de extração no navegador cuida da demuxação, portanto o método é idêntico ao MP4.

Meu vídeo não tem áudio falado. Ainda posso transcrevê-lo?

Não. A transcrição funciona a partir da fala, portanto, um vídeo sem trilha de áudio ou uma gravação de tela silenciosa não tem nada para transcrever. Se houver música de fundo, mas não houver fala, o resultado será vazio ou ruído, porque o mecanismo retorna apenas palavras.

O áudio é excluído após a transcrição?

Sim. O áudio extraído é excluído do servidor no momento em que sua transcrição fica pronta e o mecanismo de fala não retém nada. A transcrição em si é criptografada em repouso, portanto, mesmo um vazamento de armazenamento exporia um texto cifrado ilegível em vez de suas palavras.

Comece com 30 minutos grátis

Começar – 30 minutos grátis