Blog
Converter MP3 em texto com identificação de falantes
Autor: Hushscript Publicado em: Última revisão:
Converter um MP3 em texto é um dos trabalhos de transcrição mais comuns que existem, e as etapas não mudam com a fonte: um episódio de podcast, uma entrevista gravada, uma palestra ou um memo de voz do seu telefone, todos passam pelo mesmo fluxo. Faça upload do arquivo, aguarde a transcrição, exporte no formato que você precisa.
O que muda é como o próprio MP3 afeta o resultado. A maioria dos guias ignora isso. Um MP3 é um arquivo compactado com perdas, e a taxa de bits em que foi salvo define um limite máximo para a quantidade de detalhes com os quais o mecanismo de fala precisa trabalhar. Este guia cobre as três etapas e depois se aprofunda: um exemplo prático com saída real rotulada por falante, o que a taxa de bits realmente significa para a precisão e como corrigir as gravações que saem irregulares.
O que você precisa
- Um arquivo MP3. Qualquer taxa de bits será carregada. Para maior precisão, 64 kbps é o limite prático e 128 kbps ultrapassa confortavelmente o ponto em que o número importa (mais sobre isso abaixo).
- Uma conta Hushscript. Você ganha 30 minutos grátis para testar. A maneira mais rápida de desbloqueá-los é adicionar um cartão: uma retenção de US$ 1 o valida, é liberada imediatamente e nunca é cobrada. Se você preferir não usar cartão, um método de pagamento alternativo também funciona, e os 30 minutos chegam na sua primeira compra. De qualquer forma, não é necessário um cartão.
Não há nada para instalar; nenhum aplicativo de desktop, nenhuma extensão de navegador. Tudo funciona no navegador e na conta.
Além dos minutos grátis, a transcrição é pré-paga: você compra minutos apenas quando precisa deles, sem assinatura. Os custos estão na página de preços.
Converta um MP3 em texto em três etapas
- Faça upload do seu arquivo. Abra a página de envio e arraste o MP3 para a zona de soltar ou clique para navegar. São aceitos arquivos com até 10 horas de duração, sem limite de tamanho de arquivo. Os primeiros 5 minutos são visualizados diretamente no navegador antes de você fazer login, para que você possa ver o estilo rotulado pelo locutor antes de confirmar.
- Deixe-o transcrever. Depois que você estiver conectado e o arquivo for carregado, o mecanismo de fala o processa e retorna uma transcrição com os falantes já separados. O tempo de processamento varia e o trabalho é executado em segundo plano, portanto você não precisa manter a guia aberta.
- Exportar. Baixe o resultado em qualquer um dos 21 formatos. Isso abrange TXT simples, SRT com carimbo de data e hora, Word DOCX, PDF e os formatos de legenda e linha do tempo do editor, além de um .husharchive protegido por senha. Todos os formatos estão incluídos, sem acesso pago nas exportações e sem marca d’água em nenhum deles.
A transcrição finalizada é aberta em seu painel. Os palestrantes aparecem como Falante A,Falante B e assim por diante, e você pode clicar em qualquer rótulo para renomeá-lo com um nome real, que atualiza cada linha que o palestrante possui.
Um exemplo prático: uma entrevista para duas pessoas
Digamos que você tenha founder-interview.mp3: uma entrevista de 42 minutos gravação, 128 kbps, um entrevistador e um convidado, gravada em ligação. Depois de fazer o upload, a transcrição volta segmentada por turno do locutor, com um carimbo de data e hora em cada:
[00:00:04] Falante R: Obrigado por disponibilizar seu tempo. Vamos começar do início –
de onde veio a ideia?
[00:00:11] Falante B: Honestamente, surgiu de um problema que nós mesmos tivemos. Estávamos
afogados em chamadas gravadas e nenhuma delas era pesquisável.
[00:00:23] Falante A: Então você construiu o que precisava.
[00:00:25] Falante B: Praticamente. A primeira versão foi fixada com fita adesiva.
A partir daí a edição é leve. Você renomeia Falante A para entrevistador e Falante B para convidado uma vez, e cada linha é atualizada. Você procura alguns nomes próprios que o mecanismo adivinhou, como o nome de um produto ou o sobrenome de uma pessoa, e os corrige com localizar e substituir, que corrige todas as instâncias de uma só vez. Para uma entrevista limpa de 128 kbps como esta, essa leitura superficial geralmente é toda a limpeza necessária antes que a transcrição possa ser citada.
É aqui que a transcrição que rotula os palestrantes gratuitamente ganha seu lugar. Uma parede de texto inteiro de uma entrevista é quase inútil até que você volte e marque quem disse o quê; uma transcrição que chega já dividida em turnos é algo que você pode citar imediatamente.
O que a taxa de bits significa para precisão
MP3 é um formato com perdas: a codificação descarta partes do áudio consideradas menos audíveis para manter o arquivo pequeno. Taxa de bits é quantos kilobits por segundo o codificador gasta fazendo isso. Quanto mais baixo, mais ele descarta. A referência atual do codec MP3 do MDN documenta as taxas de bits e taxas de amostragem suportadas pelo formato e identifica sua compactação como com perdas.
O reconhecimento de fala depende fortemente dos detalhes de alta frequência nas consoantes. A diferença entre “quinze” e “dezesseis”, ou “posso” e “não posso”, reside aí. A compressão agressiva é exatamente onde os detalhes vão primeiro. Portanto, a taxa de bits não degrada uma transcrição uniformemente; ele consome as palavras mais difíceis de ouvir nos limites da fala.
Na prática:
- 32 kbps e menos: visivelmente comprimido até mesmo para o ouvido humano, e o mecanismo reage da mesma maneira. Os erros de palavras aumentam. Evite isso para qualquer coisa que você queira transcrever.
- 64 kbps: o piso realista para uma conversão de fala em texto confiável. Ótimo para voz nítida e com microfone próximo.
- 128 kbps e superior: confortável o suficiente para transcrição. Ir mais alto não melhorará a transcrição. O mecanismo tem todos os detalhes que pode usar bem antes disso.
Alguns esclarecimentos que evitam recodificações desnecessárias. Taxa de bits variável (VBR) está correta; ele não tem penalidade de precisão em relação à ** taxa de bits constante (CBR)** para fala, portanto, não converta um arquivo VBR apenas para “consertá-lo”. E o ** mono funciona tão bem quanto o estéreo** para transcrição, já que a voz não precisa de dois canais. Na verdade, veja a nota sobre double-enderers estéreo abaixo.
MP3 vs sem perdas: quando regravar
Uma questão natural é se converter primeiro seu MP3 para um formato sem perdas como WAV ajudaria. Não vai. Depois que o áudio for salvo como MP3 de 128 kbps, os detalhes que faltam desaparecem; agrupar o mesmo áudio em um contêiner WAV apenas cria um arquivo maior que não contém informações extras. Se você estiver gravando de novo e tiver escolha, uma fonte sem perdas ou com alta taxa de bits é o melhor ponto de partida (consulte o guia de WAV para texto para esse caso), mas converter um MP3 existente para cima não compra nada.
A regra de decisão honesta: se sua única cópia for um MP3 com taxa de bits razoável, transcreva-o como está. Se a gravação for realmente ruim (cortada, com ruído ou salva a 32 kbps) e você puder capturá-la novamente, a regravação ajudará muito mais do que qualquer conversão. Quando você grava do zero, dois hábitos são mais importantes do que a taxa de bits: coloque o microfone perto de quem está falando e dê a cada pessoa seu próprio microfone, se possível, já que a separação clara na fonte é o que faz com que as palavras e os rótulos do falante saiam corretos.
Corrigir problemas comuns
A maioria das transcrições grosseiras remonta à gravação, não à ferramenta. Aqui está o que fazer com os culpados habituais.
Volume baixo. Se a forma de onda parecer plana (uma gravação muito silenciosa), o mecanismo terá menos sinal para trabalhar e a precisão diminuirá. Normalize ou amplifique o áudio em qualquer editor de áudio primeiro e depois carregue a versão mais alta. O nível de reforço é uma das soluções de maior retorno para uma gravação fraca.
Ruído de fundo. Ruído constante (ar condicionado, zumbido da estrada) é razoavelmente bem tratado; ruído repentino que se sobrepõe à fala, como uma porta, uma tosse ou talheres, é o que causa a perda de palavras. Se você puder executar uma passagem leve de redução de ruído antes de enviar, faça-o, mas não processe demais: a remoção pesada de ruído introduz artefatos que prejudicam mais a precisão do que o ruído.
Sotaques pesados ou vocabulário especializado. Os mecanismos modernos lidam bem com uma ampla variedade de sotaques do inglês. Os erros confiáveis são termos de domínio que o mecanismo não tem motivos para esperar, como nomes de medicamentos, citações legais ou nomes de marcas de nicho. Planeje uma rápida leitura após a exportação para capturá-los e confie em localizar e substituir: se o nome de uma empresa cair errado da mesma maneira todas as vezes, uma correção varrerá todo o arquivo.
MP3s muito longos. Uma gravação de 6 horas não é problema por si só. O limite máximo de 10 horas cobre quase tudo e não há limite de tamanho de arquivo, portanto, não há necessidade de cortar primeiro um arquivo longo em pedaços. O que realmente degrada um arquivo longo é a variação na qualidade da gravação: um falante que se afasta do microfone, um nível que cai após a primeira hora, um local que fica lotado e fica mais barulhento. Onde puder, mantenha a fonte estável; onde não for possível, espere que os trechos mais ásperos precisem de mais edição do que os limpos. Os carimbos de data e hora facilitam o gerenciamento: você pode ir direto para o patch que está com leitura ruim, em vez de ouvir tudo novamente.
falantes sobrepostos. Quando duas pessoas falam ao mesmo tempo, o mecanismo atribui as palavras à voz mais alta, uma limitação da separação dos falantes geralmente, e não de qualquer ferramenta. Não há correção no lado do upload; orçamente o tempo de edição para as seções de conversa cruzada de uma gravação de grupo animada.
Manter os falantes bem separados
A separação dos falantes (diarização) ocorre em cada transcrição sem nenhum custo extra, e algumas coisas no nível do MP3 afetam a clareza do resultado. Se você quiser detalhes sobre como isso funciona nos bastidores, consulte o que é diarização de falante; os pontos práticos aqui:
- Entradas duplas estéreo. Algumas configurações de podcast e chamadas gravam cada falante em um canal estéreo separado. Contra-intuitivamente, mixar isso em uma única faixa mono antes do upload tende a ajudar: o mecanismo ouve uma conversa combinada em vez de dois fluxos isolados. A maioria dos editores exporta uma “mixagem” mono.
- Vai-e-vem rápido. Trocas muito curtas (turnos de menos de dois segundos) podem ocasionalmente se fundir em uma expressão rotulada. Raramente prejudica a legibilidade, e você pode dividir uma curva manualmente se uma citação específica precisar.
- Curvas limpas ajudam mais. Quanto mais limpas forem as transferências entre os falantes (menos interrupções, menos diafonia), mais confiáveis serão as etiquetas. Não há nada para configurar; é puramente uma propriedade da gravação.
Exportando sua transcrição
O formato correto depende do que você está fazendo com o texto. A tabela abaixo lista aqueles que as pessoas mais alcançam, entre os 21 formatos oferecidos; para ver todas as compensações, consulte qual formato de transcrição você realmente precisa:
| Formato | Melhor para |
|---|---|
| TXT | Notas, copiar e colar, alimentar o texto em outra ferramenta |
| SRT | Legendas em um vídeo ou navegação por carimbo de data/hora; também é a escolha certa se sua fonte for um arquivo de vídeo como MP4 |
| VTT | Legendas da Web e players de vídeo nativos do navegador |
| CSV | Revisão de planilhas e dados leves transferência |
| Markdown | Notas de publicação, arquivos estilo README e rascunhos editáveis |
| JSON | Processamento programático e ferramentas personalizadas |
| DOCX | Compartilhamento com editores ou anotadores que trabalham no Word |
| Compartilhamento e arquivamento somente leitura |
Cada exportação inclui rótulos e carimbos de data e hora do locutor, sem marca d’água em nenhum deles.
Carimbos de data e hora e edição
O editor mostra cada enunciado com seu horário de início, rótulo do locutor e texto. Clique em qualquer linha para reproduzir esse segmento do áudio no texto. Isso é útil para verificar uma passagem complicada sem limpar todo o arquivo manualmente.
Os carimbos de data e hora na exportação SRT ficam no nível da expressão: uma entrada por turno do locutor, não por palavra. Para legendas, navegação e citações com carimbo de data/hora, essa é a granularidade certa. Se você precisar de uma estrutura em nível de palavra para processar em código, exporte JSON: cada entrada fornece o rótulo do orador, o horário de início e término em milissegundos e o texto desse turno.
Carregar, transcrever, exportar: esse é o trabalho completo, com os detalhes específicos do MP3 que decidem o quão limpo será o resultado. A página de MP3 para texto tem uma visão geral completa dos recursos e, se você estiver trabalhando com uma gravação em outro contêiner, a página de áudio para texto cobre todos os formatos da mesma maneira. Fazendo um show inteiro? O guia de transcrição de podcast explica como transformar a transcrição em notas de programa e, se o seu arquivo for um WAV em vez de um MP3, o guia de WAV para texto contém notas sobre como lidar com arquivos grandes sem perdas.
Fontes e normas independentes
O Hushscript consultou estas referências independentes e não concorrentes. Elas explicam pesquisas, normas ou o funcionamento de plataformas e não representam endosso do Hushscript.
Fontes revisadas em: