Como transcrever qualquer arquivo de áudio para texto
Autor: Hushscript Publicado em: Última revisão:
Um MP3 de um editor de podcast, um M4A do seu iPhone, um WAV de um gravador de campo, um CAF obscuro de um aplicativo de gravador de voz: para transcrever qualquer um deles, você faz a mesma coisa. Solte o arquivo, obtenha uma transcrição com os falantes já separados, exporte no formato que você precisa. O recipiente em que o áudio veio não altera as etapas.
O que o formato afeta é um pouco mais abaixo: o tamanho do arquivo, a clareza com que ele transcreve e o que fazer nas raras ocasiões em que um arquivo não carrega. Este guia aborda quais formatos de áudio funcionam, o método que lida com todos eles, como escolher o melhor formato quando você tiver escolha e como consertar os arquivos que ficam irregulares.
O que você precisa
- Um arquivo de áudio (ou vídeo). Qualquer um dos formatos comuns abaixo. Não há nada para instalar: nenhum aplicativo de desktop, nenhuma extensão. Tudo funciona no navegador e na sua conta.
- Uma conta Hushscript, para a transcrição completa. Você ganha 30 minutos grátis para testar. A maneira mais rápida de desbloqueá-los é adicionar um cartão: uma retenção de US$ 1 o valida, é liberada imediatamente e nunca é cobrada. Se você preferir não usar um cartão, um método de pagamento alternativo também funciona, e os 30 minutos chegam à sua primeira compra.
A visualização de 30 segundos não precisa de conta. Você pode descartar um arquivo e ver o estilo rotulado pelo palestrante antes de se inscrever, que é a maneira honesta de verificar se a saída se ajusta antes de confirmar qualquer coisa. Além dos minutos grátis, a transcrição é pré-paga: você compra minutos apenas quando precisa, sem assinatura. Os custos estão na página de preços.
Quais formatos de áudio funcionam
O Hushscript utiliza todos os formatos de áudio padrão. É aqui que cada um tende a vir, para que você possa reconhecer o que tem:
Os nomes não são apenas convenções de nomes de arquivos. O registro de tipos de mídia da IANA atual registra tipos padronizados como audio/aac,audio/mp4,audio/mpeg,audio/ogg e audio/opus, e é por isso que o contêiner e a codificação de áudio dentro dele são questões separadas.
| Formato | Fonte comum |
|---|---|
| MP3 | Podcasts, gravações telefônicas, exportações da maioria dos aplicativos de gravação |
| M4A / AAC | Memorandos de voz do iPhone, notas de voz do WhatsApp, exportações da Apple |
| WAV | Gravadores digitais, exportações de DAW, Windows Voice Recorder |
| FLAC | Gravações de arquivo, Exportações DAW, rasgos sem perdas |
| OGG | Notas de voz Android, ferramentas de gravação de código aberto |
| AIFF / CAF | Áudio Mac e iOS, GarageBand |
Arquivos de vídeo funcionam da mesma maneira. Solte um MP4, MOV, WebM ou MKV e a trilha de áudio será extraída em seu navegador antes de qualquer upload, para que o vídeo em si nunca saia do seu dispositivo; apenas o áudio chega ao servidor.
A lista acima não é uma barreira. A promessa é mais simples do que uma tabela de formatos suportados: basta soltar o arquivo e ele será convertido e transcrito. Se você tiver algo genuinamente incomum (um arquivo AMR de um Nokia antigo, um .3gp de um Android de uma década, um clipe RealAudio), tente enviá-lo mesmo assim. O navegador pode ler a maioria dos contêineres padrão e, se não puder, você terá duas alternativas: convertê-lo para MP3 ou WAV com as ferramentas gratuitas do navegador em /tools e fazer upload, ou enviar um e-mail para support@hushscript.com e adicionaremos o formato. Você não precisa descobrir antecipadamente se seu arquivo está qualificado.
Transcreva um arquivo de áudio em três etapas
O fluxo é idêntico, independentemente do formato com o qual você começa. A primeira etapa acontece antes de você ter uma conta.
- Solte seu arquivo para visualizá-lo. Vá para /audio-to-text e arraste o arquivo para a zona de soltar ou clique para navegar. Os primeiros 30 segundos são transcritos ali mesmo no navegador, rotulados pelo locutor, sem necessidade de conta. Esta é a sua verificação de que o resultado está como você deseja antes de se inscrever em qualquer coisa.
- Inscreva-se para transcrever o resto. Digite seu e-mail para criar uma conta. Seus 30 minutos grátis são desbloqueados quando você adiciona e valida um cartão (a retenção de $ 1 descrita acima) ou em sua primeira compra se você pagar de outra forma. O arquivo completo é carregado aqui. Uma gravação pode durar até 10 horas, sem limite de tamanho de arquivo – até mesmo um arquivo muito grande é preparado diretamente no navegador. As salvaguardas de segurança do serviço e de trabalho ativo também se aplicam.
- Obtenha e exporte a transcrição. O mecanismo de fala processa o arquivo e retorna uma transcrição com os falantes já separados. Renomeie os falantes se desejar e baixe-os em qualquer um dos 21 formatos (TXT, SRT, DOCX e PDF entre eles, além de formatos de legenda e linha do tempo do editor) ou um .husharchive protegido por senha. Cada exportação está incluída: sem acesso pago, sem marca d’água.
O processamento é executado em segundo plano e é dimensionado de acordo com a duração do áudio (aproximadamente alguns minutos por hora de gravação), para que você não precise manter a guia aberta enquanto um arquivo longo termina.
Um exemplo prático: uma gravação, dois formatos
Digamos que você gravou uma conversa de 38 minutos e seu gravador salvou duas vezes: um meeting.wav com qualidade total e um meeting.m4a que seu telefone fez ao mesmo tempo. Ambos passam pelas três etapas idênticas, e a transcrição volta segmentada por turno do orador, com um carimbo de data e hora em cada:
[00:00:06] Falante A: Antes de começarmos, todos receberam os números que enviei?
[00:00:10] Falante B: Recebi esta manhã. O número Q3 é o que eu quero
aprofundar.
[00:00:17] Falante R: Certo, então essa é a linha que mudou. Deixe-me puxar.
[00:00:21] Falante C: Enquanto você faz isso, podemos voltar à contratação depois?
Os dois arquivos produzem essencialmente a mesma transcrição. O WAV é um upload muito maior e o M4A é pequeno, mas as palavras e os rótulos dos falantes chegam da mesma maneira, porque ambos carregam o mesmo discurso subjacente. A partir daqui a edição é leve: você clica em Falante A uma vez para renomeá-lo, e cada linha desse locutor é atualizada; você procura alguns nomes próprios que o mecanismo adivinhou (um sobrenome, um nome de produto) e os corrige com localizar e substituir, que corrige todas as instâncias de uma só vez.
Esse é o resultado prático de um método para cada formato. Você não mantém uma ferramenta diferente ou uma lista de verificação mental diferente para WAV versus M4A versus MP3. Seja qual for o seu gravador, telefone ou arquivo de exportação de outra pessoa, ele passa pela mesma zona de lançamento e sai como o mesmo tipo de transcrição.
Escolhendo o melhor formato para precisão
Na maioria das vezes você não consegue escolher. Você transcreve o arquivo que recebeu e tudo bem. Mas se você controlar como o áudio é gravado ou exportado, algumas opções definem o quão limpo o resultado pode ser.
A qualidade da gravação vem em primeiro lugar, por uma ampla margem. Um MP3 de 128 kbps de um microfone bem próximo irá sempre superar um WAV sem perdas gravado em toda a sala no microfone embutido de um laptop. Antes de pensar no formato, pense em aproximar o microfone de quem está falando. O contêiner está em um distante segundo lugar.
Evite MP3 com taxa de bits muito baixa. O MP3 tem perdas: a codificação descarta partes do áudio para manter o arquivo pequeno e, quanto menor a taxa de bits, mais ele é descartado. O reconhecimento de fala depende dos detalhes de alta frequência nas consoantes, onde reside a lacuna entre “quinze” e “dezesseis”, ou “pode” e “não pode”. A compressão agressiva elimina exatamente esse detalhe primeiro. Abaixo de cerca de 64 kbps, os erros de palavras aumentam. A 128 kbps e acima, você já passou do ponto em que o número importa; uma taxa de bits mais alta não tornará a transcrição melhor.
Lossless remove o formato como uma variável. WAV, FLAC e AIFF fornecem áudio não compactado ao mecanismo. Para uma gravação limpa, o ganho de precisão em relação a um bom MP3 é marginal, mas elimina totalmente a compressão. O guia de áudio digital da MDN explica a compensação subjacente: sem perdas preserva os detalhes em um tamanho maior, enquanto a codificação com perdas pode reduzir o áudio ainda mais, descartando informações. Esse é um contexto útil quando a gravação é preciosa e você não quer se perguntar mais tarde se o formato lhe custou alguma coisa.
Mono é bom; você não precisa de estéreo. O mecanismo mixa estéreo em mono internamente para fala, de modo que um arquivo mono transcreve igualmente bem e carrega mais rápido em uma conexão lenta. A única ressalva: se sua configuração gravou cada pessoa em um canal estéreo separado (um “duplo-ender”), mixá-la em uma única faixa mono antes do upload tende a ajudar os rótulos do locutor, porque o mecanismo ouve uma conversa combinada em vez de dois fluxos isolados.
Taxa de amostragem acima de 16 kHz não compra nada para a fala. Qualquer coisa entre 16 kHz e 48 kHz funciona, e um WAV de 48 kHz de um editor de vídeo transcreve o mesmo que um arquivo mono de 16 kHz de um aplicativo de telefone, dada a mesma fala subjacente. O modelo é treinado em voz, não em música, portanto não há ganho de precisão com uma taxa mais alta.
Sem perdas vs. com perdas, e ao converter ajuda
Uma pergunta comum: converter seu MP3 para WAV primeiro melhoraria a precisão? Não vai. Depois que o áudio for salvo como MP3 de 128 kbps, os detalhes descartados desaparecem para sempre. Envolver o mesmo áudio em um WAV apenas cria um arquivo maior, sem informações extras. A conversão para cima só ajuda como uma solução alternativa para um formato que não carrega, nunca como um aumento de precisão.
Converter para baixo é o caso genuinamente útil. Um WAV de várias horas pode ser um arquivo muito grande; recodificá-lo para um MP3 de 128 kbps antes do upload o reduz drasticamente, sem nenhum custo significativo de precisão, o que acelera o upload em um link lento. O conversor no navegador gratuito faz isso sem que o áudio saia do seu dispositivo. A regra honesta: se o seu arquivo já carrega e não tem uma taxa de bits pequena, transcreva-o como está. Converta apenas para resolver um problema real, como um arquivo que não abre ou um arquivo muito grande para ser carregado confortavelmente.
Rótulos de falante, incluídos gratuitamente
Cada transcrição do Hushscript vem com separação automática de falante (diarização) sem custo extra. O mecanismo seleciona vozes distintas e as rotula como Falante A,Falante B e assim por diante, e você as renomeia com nomes reais no editor com um clique por falante. Ele está ativado por padrão, independentemente do formato de origem, sem uma camada separada de rótulo de falante.
O grau de clareza dos rótulos depende da gravação, não do tipo de arquivo:
- Turnos distintos ajudam mais. Quando as pessoas se revezam e não falam umas com as outras, os rótulos são confiáveis. Uma entrevista com duas pessoas geralmente é separada de forma clara.
- A sobreposição é o caso difícil. Quando duas vozes chegam ao mesmo tempo, o mecanismo atribui as palavras à mais alta. Essa é uma limitação da separação dos falantes em geral, e não de qualquer ferramenta. Reserve um pouco de tempo de edição para o crosstalk em uma chamada de grupo animada.
- Vozes semelhantes podem ficar confusas. Duas pessoas com registros muito semelhantes (irmãos do mesmo sexo, por exemplo) desafiarão qualquer mecanismo de diarização. Uma relação sinal-ruído razoável ajuda na separação completa.
Para a maioria das entrevistas, podcasts e reuniões, os rótulos podem ser usados com, no máximo, algumas reatribuições. Se você quiser saber mais detalhes sobre como a diarização funciona nos bastidores, consulte o que é a diarização de falante ou a página de identificação de falante para obter uma visão geral dos recursos.
Corrigir arquivos que ficam brutos
A maioria das transcrições brutas remonta à gravação, não ao formato ou à ferramenta. Os culpados habituais e o que fazer com eles:
Um arquivo que não carrega. Raro, mas acontece com um contêiner incomum ou corrompido. Experimente o conversor no navegador gratuito para transformá-lo primeiro em MP3 ou WAV, o que corrige a maioria dos arquivos difíceis. Se ainda assim não funcionar, envie um e-mail para support@hushscript.com. Adicionar suporte de formato é algo que fazemos.
Volume baixo. Se a gravação for muito silenciosa, o mecanismo terá menos sinal para trabalhar e a precisão diminuirá. Normalize ou amplifique o áudio em qualquer editor antes de enviar. Aumentar o nível de uma gravação fraca é uma das soluções de maior retorno que existe.
Ruído de fundo. Ruído constante (ar condicionado, zumbido da estrada) é razoavelmente bem tratado. Ruídos repentinos que se sobrepõem à fala (uma porta, uma tosse, talheres) são os que derrubam as palavras. Uma leve redução de ruído antes do upload pode ajudar, mas não exagere: a remoção pesada de ruído adiciona artefatos que prejudicam mais a precisão do que o ruído.
Acentos pesados ou vocabulário especializado. Os mecanismos modernos lidam bem com uma ampla variedade de acentos. Os erros confiáveis são termos de domínio que o mecanismo não tem motivos para esperar: nomes de medicamentos, citações legais, nomes de marcas de nicho. Planeje uma leitura rápida após a exportação e confie em localizar e substituir; se um nome cair errado da mesma maneira todas as vezes, uma correção varrerá todo o arquivo.
Arquivos muito grandes ou muito longos. O limite máximo de 10 horas cobre quase tudo e não há limite de tamanho de arquivo além dele, então não há necessidade de cortar uma gravação longa em pedaços. Se um arquivo sem perdas for desajeitadamente grande para ser preparado no navegador, codifique-o primeiro para MP3 de 128 kbps (sem custo real de precisão) para acelerar o processo. Para detalhes específicos de sessões mais longas, o guia de gravação longa é mais detalhado.
O que acontece com seu arquivo
O áudio é excluído do servidor no momento em que a transcrição fica pronta. Não há armazenamento em nuvem, nem uso para treinamento de modelo, nem período de retenção. Se você derrubou um arquivo de vídeo, apenas o áudio extraído chegou ao servidor (o vídeo permaneceu no seu dispositivo), e você pode excluir a transcrição do seu painel com um clique sempre que quiser.
Exportando sua transcrição
Após a transcrição, escolha o formato que se adapta ao que você está fazendo com o texto. Se você não tiver certeza de qual formato de transcrição você realmente precisa, comece com as escolhas comuns abaixo:
| Formato | O que está incluído | Melhor para |
|---|---|---|
| TXT | Rótulos de falante, texto simples | Notas, pesquisa, alimentação em outra ferramenta |
| SRT | Carimbos de data e hora por enunciado, rótulos de falante | Vídeo legendas, navegando em uma gravação longa por tempo |
| VTT | Carimbos de data e hora de legendas da Web, rótulos de falantes | players de vídeo HTML5 e publicação na web |
| CSV | Linhas com falante, tempo e texto campos | Revisão de planilhas e transferência leve de dados |
| Markdown | Transcrição rotulada pelo falante em Markdown | Notas, documentos, fluxos de trabalho de publicação e sites estáticos |
| DOCX | Formatado para Word ou Google Docs | Edição, compartilhamento, anotação |
| JSON | { speaker, start, end, text } por item | Pipelines e ferramentas personalizadas |
| Transcrição legível de layout fixo | Compartilhamento e arquivamento somente leitura |
Cada exportação traz as etiquetas dos falantes, sem marca d’água em nenhuma delas, e todos os formatos de exportação estão incluídos em todos os planos, entre eles os 30 minutos grátis. Os carimbos de data e hora no SRT ficam no nível da expressão (uma entrada por turno do locutor), que é a granularidade correta para legendas e citações; se você precisar de uma estrutura em nível de palavra para processar no código, o JSON fornece o horário de início e término em milissegundos para cada turno.
Idiomas
Hushscript transcreve cerca de 99 idiomas, detectado automaticamente, não definido manualmente. A precisão é mais forte em 18, incluindo quatro variantes em inglês (Global, Britânico, Australiano, EUA), Espanhol, Francês, Alemão, Japonês, Mandarim, Hindi e Árabe. A lista completa está na página de idiomas.
Se você estiver decidindo entre uma transcrição no mesmo idioma e uma transcrição traduzida, o guia para “traduzir áudio para texto” explica a diferença.
Esse é o trabalho completo (descartar, transcrever, exportar), e ele lê o mesmo, seja qual for o formato com o qual você começou. Para notas específicas de formato, os guias irmãos cobrem os casos mais comuns: MP3, WAV e M4A/Apple Voice Memo. A página de áudio para texto tem uma visão geral completa dos recursos, e todos os formatos chegam lá da mesma maneira: basta soltar o arquivo.
Fontes e normas independentes
O Hushscript consultou estas referências independentes e não concorrentes. Elas explicam pesquisas, normas ou o funcionamento de plataformas e não representam endosso do Hushscript.
Fontes revisadas em: