Converter MP3 em texto com identificação de falantes
Autor: Hushscript Publicado em: Última revisão:
Converter um MP3 em texto é um dos trabalhos de transcrição mais comuns que existem, e as etapas não mudam com a fonte: um episódio de podcast, uma entrevista gravada, uma palestra ou um memo de voz do seu telefone, todos passam pelo mesmo fluxo. Faça upload do arquivo, aguarde a transcrição, exporte no formato que você precisa.
O que muda é como o próprio MP3 afeta o resultado. A maioria dos guias ignora isso. Um MP3 é um arquivo compactado com perdas, e a taxa de bits em que foi salvo define um limite máximo para a quantidade de detalhes com os quais o mecanismo de fala precisa trabalhar. Este guia cobre as três etapas e depois se aprofunda: um exemplo prático com saída real rotulada por falante, o que a taxa de bits realmente significa para a precisão e como corrigir as gravações que saem irregulares.
O que você precisa
- Um arquivo MP3. Qualquer taxa de bits será carregada. Para maior precisão, 64 kbps é o limite prático e 128 kbps ultrapassa confortavelmente o ponto em que o número importa (mais sobre isso abaixo).
- Uma conta Hushscript. Você ganha 30 minutos grátis para testar. A maneira mais rápida de desbloqueá-los é adicionar um cartão: uma retenção de US$ 1 o valida, é liberada imediatamente e nunca é cobrada. Se você preferir não usar cartão, um método de pagamento alternativo também funciona, e os 30 minutos chegam na sua primeira compra. De qualquer forma, não é necessário um cartão.
Não há nada para instalar; nenhum aplicativo de desktop, nenhuma extensão de navegador. Tudo funciona no navegador e na conta.
Além dos minutos grátis, a transcrição é pré-paga: você compra minutos apenas quando precisa deles, sem assinatura. Os custos estão na página de preços.
Converta um MP3 em texto em três etapas
- Faça upload do seu arquivo. Abra /audio-to-text e arraste o MP3 para a zona de soltar ou clique para navegar. São aceitos arquivos com até 10 horas de duração, sem limite de tamanho de arquivo. Os primeiros 30 segundos são visualizados diretamente no navegador antes de você fazer login, para que você possa ver o estilo rotulado pelo locutor antes de confirmar.
- Deixe-o transcrever. Depois que você estiver conectado e o arquivo for carregado, o mecanismo de fala o processa e retorna uma transcrição com os falantes já separados. O tempo de processamento varia e o trabalho é executado em segundo plano, portanto você não precisa manter a guia aberta.
- Exportar. Baixe o resultado em qualquer um dos 21 formatos. Isso abrange TXT simples, SRT com carimbo de data e hora, Word DOCX, PDF e os formatos de legenda e linha do tempo do editor, além de um .husharchive protegido por senha. Todos os formatos estão incluídos, sem acesso pago nas exportações e sem marca d’água em nenhum deles.
A transcrição finalizada é aberta em seu painel. Os palestrantes aparecem como Falante A,Falante B e assim por diante, e você pode clicar em qualquer rótulo para renomeá-lo com um nome real, que atualiza cada linha que o palestrante possui.
Um exemplo prático: uma entrevista para duas pessoas
Digamos que você tenha founder-interview.mp3: uma entrevista de 42 minutos gravação, 128 kbps, um entrevistador e um convidado, gravada em ligação. Depois de fazer o upload, a transcrição volta segmentada por turno do locutor, com um carimbo de data e hora em cada:
[00:00:04] Falante R: Obrigado por disponibilizar seu tempo. Vamos começar do início –
de onde veio a ideia?
[00:00:11] Falante B: Honestamente, surgiu de um problema que nós mesmos tivemos. Estávamos
afogados em chamadas gravadas e nenhuma delas era pesquisável.
[00:00:23] Falante A: Então você construiu o que precisava.
[00:00:25] Falante B: Praticamente. A primeira versão foi fixada com fita adesiva.
A partir daí a edição é leve. Você renomeia Falante A para entrevistador e Falante B para convidado uma vez, e cada linha é atualizada. Você procura alguns nomes próprios que o mecanismo adivinhou, como o nome de um produto ou o sobrenome de uma pessoa, e os corrige com localizar e substituir, que corrige todas as instâncias de uma só vez. Para uma entrevista limpa de 128 kbps como esta, essa leitura superficial geralmente é toda a limpeza necessária antes que a transcrição possa ser citada.
É aqui que a transcrição que rotula os palestrantes gratuitamente ganha seu lugar. Uma parede de texto inteiro de uma entrevista é quase inútil até que você volte e marque quem disse o quê; uma transcrição que chega já dividida em turnos é algo que você pode citar imediatamente.
O que a taxa de bits significa para precisão
MP3 é um formato com perdas: a codificação descarta partes do áudio consideradas menos audíveis para manter o arquivo pequeno. Taxa de bits é quantos kilobits por segundo o codificador gasta fazendo isso. Quanto mais baixo, mais ele descarta. A referência atual do codec MP3 do MDN documenta as taxas de bits e taxas de amostragem suportadas pelo formato e identifica sua compactação como com perdas.
O reconhecimento de fala depende fortemente dos detalhes de alta frequência nas consoantes. A diferença entre “quinze” e “dezesseis”, ou “posso” e “não posso”, reside aí. A compressão agressiva é exatamente onde os detalhes vão primeiro. Portanto, a taxa de bits não degrada uma transcrição uniformemente; ele consome as palavras mais difíceis de ouvir nos limites da fala.
Na prática:
- 32 kbps e menos: visivelmente comprimido até mesmo para o ouvido humano, e o mecanismo reage da mesma maneira. Os erros de palavras aumentam. Evite isso para qualquer coisa que você queira transcrever.
- 64 kbps: o piso realista para uma conversão de fala em texto confiável. Ótimo para voz nítida e com microfone próximo.
- 128 kbps e superior: confortável o suficiente para transcrição. Ir mais alto não melhorará a transcrição. O mecanismo tem todos os detalhes que pode usar bem antes disso.
Alguns esclarecimentos que evitam recodificações desnecessárias. Taxa de bits variável (VBR) está correta; ele não tem penalidade de precisão em relação à ** taxa de bits constante (CBR)** para fala, portanto, não converta um arquivo VBR apenas para “consertá-lo”. E o ** mono funciona tão bem quanto o estéreo** para transcrição, já que a voz não precisa de dois canais. Na verdade, veja a nota sobre double-enderers estéreo abaixo.
MP3 vs sem perdas: quando regravar
Uma questão natural é se converter primeiro seu MP3 para um formato sem perdas como WAV ajudaria. Não vai. Depois que o áudio for salvo como MP3 de 128 kbps, os detalhes que faltam desaparecem; agrupar o mesmo áudio em um contêiner WAV apenas cria um arquivo maior que não contém informações extras. Se você estiver gravando de novo e tiver escolha, uma fonte sem perdas ou com alta taxa de bits é o melhor ponto de partida (consulte o guia de WAV para texto para esse caso), mas converter um MP3 existente para cima não compra nada.
A regra de decisão honesta: se sua única cópia for um MP3 com taxa de bits razoável, transcreva-o como está. Se a gravação for realmente ruim (cortada, com ruído ou salva a 32 kbps) e você puder capturá-la novamente, a regravação ajudará muito mais do que qualquer conversão. Quando você grava do zero, dois hábitos são mais importantes do que a taxa de bits: coloque o microfone perto de quem está falando e dê a cada pessoa seu próprio microfone, se possível, já que a separação clara na fonte é o que faz com que as palavras e os rótulos do falante saiam corretos.
Corrigir problemas comuns
A maioria das transcrições grosseiras remonta à gravação, não à ferramenta. Aqui está o que fazer com os culpados habituais.
Volume baixo. Se a forma de onda parecer plana (uma gravação muito silenciosa), o mecanismo terá menos sinal para trabalhar e a precisão diminuirá. Normalize ou amplifique o áudio em qualquer editor de áudio primeiro e depois carregue a versão mais alta. O nível de reforço é uma das soluções de maior retorno para uma gravação fraca.
Ruído de fundo. Ruído constante (ar condicionado, zumbido da estrada) é razoavelmente bem tratado; ruído repentino que se sobrepõe à fala, como uma porta, uma tosse ou talheres, é o que causa a perda de palavras. Se você puder executar uma passagem leve de redução de ruído antes de enviar, faça-o, mas não processe demais: a remoção pesada de ruído introduz artefatos que prejudicam mais a precisão do que o ruído.
Sotaques pesados ou vocabulário especializado. Os mecanismos modernos lidam bem com uma ampla variedade de sotaques do inglês. Os erros confiáveis são termos de domínio que o mecanismo não tem motivos para esperar, como nomes de medicamentos, citações legais ou nomes de marcas de nicho. Planeje uma rápida leitura após a exportação para capturá-los e confie em localizar e substituir: se o nome de uma empresa cair errado da mesma maneira todas as vezes, uma correção varrerá todo o arquivo.
MP3s muito longos. Uma gravação de 6 horas não é problema por si só. O limite máximo de 10 horas cobre quase tudo e não há limite de tamanho de arquivo, portanto, não há necessidade de cortar primeiro um arquivo longo em pedaços. O que realmente degrada um arquivo longo é a variação na qualidade da gravação: um falante que se afasta do microfone, um nível que cai após a primeira hora, um local que fica lotado e fica mais barulhento. Onde puder, mantenha a fonte estável; onde não for possível, espere que os trechos mais ásperos precisem de mais edição do que os limpos. Os carimbos de data e hora facilitam o gerenciamento: você pode ir direto para o patch que está com leitura ruim, em vez de ouvir tudo novamente.
falantes sobrepostos. Quando duas pessoas falam ao mesmo tempo, o mecanismo atribui as palavras à voz mais alta, uma limitação da separação dos falantes geralmente, e não de qualquer ferramenta. Não há correção no lado do upload; orçamente o tempo de edição para as seções de conversa cruzada de uma gravação de grupo animada.
Manter os falantes bem separados
A separação dos falantes (diarização) ocorre em cada transcrição sem nenhum custo extra, e algumas coisas no nível do MP3 afetam a clareza do resultado. Se você quiser detalhes sobre como isso funciona nos bastidores, consulte o que é diarização de falante; os pontos práticos aqui:
- Entradas duplas estéreo. Algumas configurações de podcast e chamadas gravam cada falante em um canal estéreo separado. Contra-intuitivamente, mixar isso em uma única faixa mono antes do upload tende a ajudar: o mecanismo ouve uma conversa combinada em vez de dois fluxos isolados. A maioria dos editores exporta uma “mixagem” mono.
- Vai-e-vem rápido. Trocas muito curtas (turnos de menos de dois segundos) podem ocasionalmente se fundir em uma expressão rotulada. Raramente prejudica a legibilidade, e você pode dividir uma curva manualmente se uma citação específica precisar.
- Curvas limpas ajudam mais. Quanto mais limpas forem as transferências entre os falantes (menos interrupções, menos diafonia), mais confiáveis serão as etiquetas. Não há nada para configurar; é puramente uma propriedade da gravação.
Exportando sua transcrição
O formato correto depende do que você está fazendo com o texto. A tabela abaixo lista aqueles que as pessoas mais alcançam, entre os 21 formatos oferecidos; para ver todas as compensações, consulte qual formato de transcrição você realmente precisa:
| Formato | Melhor para |
|---|---|
| TXT | Notas, copiar e colar, alimentar o texto em outra ferramenta |
| SRT | Legendas em um vídeo ou navegação por carimbo de data/hora; também é a escolha certa se sua fonte for um arquivo de vídeo como MP4 |
| VTT | Legendas da Web e players de vídeo nativos do navegador |
| CSV | Revisão de planilhas e dados leves transferência |
| Markdown | Notas de publicação, arquivos estilo README e rascunhos editáveis |
| JSON | Processamento programático e ferramentas personalizadas |
| DOCX | Compartilhamento com editores ou anotadores que trabalham no Word |
| Compartilhamento e arquivamento somente leitura |
Cada exportação inclui rótulos e carimbos de data e hora do locutor, sem marca d’água em nenhum deles.
Carimbos de data e hora e edição
O editor mostra cada enunciado com seu horário de início, rótulo do locutor e texto. Clique em qualquer linha para reproduzir esse segmento do áudio no texto. Isso é útil para verificar uma passagem complicada sem limpar todo o arquivo manualmente.
Os carimbos de data e hora na exportação SRT ficam no nível da expressão: uma entrada por turno do locutor, não por palavra. Para legendas, navegação e citações com carimbo de data/hora, essa é a granularidade certa. Se você precisar de uma estrutura em nível de palavra para processar em código, exporte JSON: cada entrada fornece o rótulo do orador, o horário de início e término em milissegundos e o texto desse turno.
Carregar, transcrever, exportar: esse é o trabalho completo, com os detalhes específicos do MP3 que decidem o quão limpo será o resultado. A página de MP3 para texto tem uma visão geral completa dos recursos e, se você estiver trabalhando com uma gravação em outro contêiner, a página de áudio para texto cobre todos os formatos da mesma maneira. Fazendo um show inteiro? O guia de transcrição de podcast explica como transformar a transcrição em notas de programa e, se o seu arquivo for um WAV em vez de um MP3, o guia de WAV para texto contém notas sobre como lidar com arquivos grandes sem perdas.
Fontes e normas independentes
O Hushscript consultou estas referências independentes e não concorrentes. Elas explicam pesquisas, normas ou o funcionamento de plataformas e não representam endosso do Hushscript.
Fontes revisadas em: