Diarização de falantes: como funcionam os rótulos
Autor: Hushscript Publicado em: Última revisão:
A diarização do locutor é o processo automático de separar uma gravação em segmentos por locutor, respondendo “quem falou quando?” antes que qualquer ser humano leia a transcrição. A pesquisa atual sobre diarização de falantes na ACL Anthology descreve a mesma tarefa para conversas com vários participantes. É a diferença entre uma parede de palavras e uma conversa estruturada, e é a razão pela qual a transcrição de uma entrevista entre duas pessoas volta como um diálogo legível em vez de um longo parágrafo.
Em termos simples: você carrega uma gravação, o mecanismo de diarização encontra os pontos onde a voz muda, agrupa os segmentos que soam como a mesma pessoa e devolve uma transcrição que parece um roteiro: uma linha por turno, rotulada por voz. Esta postagem explica como isso funciona, por que a diarização não é o mesmo que reconhecer uma voz e como transformar os rótulos genéricos em nomes reais.
Diarização do locutor, em linguagem simples
Imagem transcrevendo à mão uma entrevista de 90 minutos. Depois de transformar o discurso em texto, a próxima coisa a fazer é adicionar as atribuições: “Entrevistador:”, “Assunto:”, indo e voltando, sempre que a voz mudar. Esse trabalho de atribuição, decidir quem está falando a qualquer momento, é exatamente o que a diarização faz por você.
O resultado é uma transcrição em formato de diálogo:
Falante A [00:00:12]: A primeira coisa a entender é que os dados só existem por um momento.
Falante B [00:00:27]: Certo, e essa é a parte que a maioria das pessoas não percebe até que seja tarde demais.
Falante A [00:00:34]: Exatamente. Portanto, a verdadeira questão é o que você faz nessa janela.
Cada expressão está vinculada a um locutor e a um carimbo de data/hora. Você pode então renomear Falante A e Falante B para nomes reais; uma edição por palestrante, e o rótulo é atualizado onde quer que apareça.
A alternativa, uma transcrição simples sem diarização, é um bloco contínuo de texto onde você tem que reproduzir o áudio para descobrir quem disse o quê. Qualquer coisa que ultrapasse alguns minutos com duas ou mais vozes é um verdadeiro trabalho manual, e é o trabalho que o passe de diarização elimina.
O que você precisa antes de começar
Não há configurações para configurar e nada para instalar. A diarização é executada na própria gravação, portanto, o único pré-requisito real é o áudio em que os falantes são razoavelmente distintos:
- Uma gravação com todas as vozes. A diarização funciona em um único arquivo, portanto, todos os falantes devem estar presentes nesse arquivo. Uma mesa redonda onde todos compartilham o mesmo microfone da sala; duas pessoas gravadas cada uma em seu próprio dispositivo separado, salvas como dois arquivos separados, não. Combine-os primeiro em uma mixagem.
- Áudio claro o suficiente. Não precisa ter qualidade de estúdio. É necessário que cada pessoa seja audível sem esforço, com interferências e ruídos de fundo limitados. Quanto mais limpa for a separação entre as vozes, mais limpos serão os rótulos.
- Uma ideia aproximada de quantas pessoas estão falando. Você não precisa fornecer isso, mas saber disso ajuda a verificar a sanidade do resultado: se você gravou três pessoas e a transcrição mostra seis falantes, você sabe onde procurar.
É isso. Sem registro de microfone, sem amostras de voz, sem configuração por falante.
Como funciona a identificação automática de falante
A diarização se divide em alguns estágios distintos. Conhecê-los torna a saída mais fácil de ler e de corrigir quando há algo errado.
Extração de recursos. O áudio é dividido em quadros curtos, normalmente de 10 a 40 milissegundos cada, e o mecanismo mede os recursos acústicos em cada quadro. Os recursos importantes para distinguir os falantes estão no domínio da frequência: altura, formantes e padrões espectrais que tendem a permanecer consistentes na voz de uma pessoa e diferem entre as pessoas.
Segmentação. O mecanismo procura pontos de mudança de falante: momentos em que essas características de voz mudam. Esta é a parte difícil. Uma mudança pode ocorrer no meio da frase quando alguém a interrompe, e o ruído ou a fala sobreposta podem ocultar um limite real ou inventar um limite falso.
Clustering. Segmentos que soam como a mesma voz são agrupados. O motor não informa quantas pessoas estão na sala; ele infere a contagem de falantes do áudio. Se você souber a contagem com antecedência, algumas configurações permitem fornecê-la; caso contrário, o mecanismo estima, que é de onde vem a maioria dos erros “dividir uma pessoa em duas” e “fundir duas pessoas em uma”.
Rotulagem. Cada cluster recebe um rótulo:Falante A,Falante B,Falante C, ou Falante 0,Falante 1. Os rótulos são espaços reservados arbitrários. Não há identidade por trás deles, apenas um controle estável para uma voz durante toda a gravação.
Todo o pipeline é executado como uma passagem automatizada junto com a transcrição, para que você não execute um trabalho separado de rotulagem de falante.
Diarização versus reconhecimento de voz
Esses dois são confundidos constantemente, mas respondem a perguntas diferentes.
Diarização pergunta: quem está falando neste momento, em relação às outras vozes neste arquivo? Ela separa as vozes, mas não tem ideia de quem elas pertencem. Ele não precisa de conhecimento prévio e não mantém nenhum registro de voz após a conclusão do trabalho.
O reconhecimento de voz, também chamado de identificação do locutor, pergunta: esta é a mesma pessoa que em uma gravação de referência conhecida? Ele precisa de uma amostra de voz registrada para comparar e é a tecnologia por trás dos sistemas de “verificação de sua identidade por voz”.
O Hushscript usa diarização, não reconhecimento de voz. Não há banco de dados de vozes inscritas e sua gravação nunca é comparada com a de outra pessoa. Os rótulos dos falantes são derivados puramente das características de voz dentro desse arquivo.
Essa distinção explica por que a diarização não consegue nomear as pessoas. Ela pode afirmar com segurança que ‘a mesma pessoa falou nestes 200 turnos ao longo da hora’, mas não pode dizer quem é essa pessoa. Essa identificação cabe a você e exige apenas um clique por falante. Para entender em detalhes como o Hushscript processa gravações com vários falantes do início ao fim, consulte a página sobre identificação de falantes.
Um exemplo prático: uma reunião de três pessoas
Digamos que você grave uma reunião de projeto de 40 minutos com três pessoas em uma sala, compartilhando um único microfone de laptop, salvo como um único arquivo .m4a. Você o insere e, após a transcrição, o resultado fica assim:
Falante A [00:00:04]: Ok, vamos começar com a data de lançamento. Onde estamos?
Falante B [00:00:09]: O design está feito. Entregamos as telas finais na segunda-feira.
Falante C [00:00:14]: A engenharia precisa de cerca de mais duas semanas para o fluxo de pagamento.
Falante A [00:00:21]: Duas semanas nos ultrapassam a data que prometemos ao marketing.
Falante B [00:00:27]: Podemos enviar sem o novo fluxo de pagamento e acompanhamento?
Falante C [00:00:33]: Não de forma limpa. O fluxo antigo é interrompido com os novos preços.
Três vozes, separadas e rotuladas, com carimbos de data e hora em cada turno. Agora você renomeia:Falante A passa a ser “Priya” (ela está comandando a reunião),Falante B passa a ser “Tom”,Falante C passa a ser “Dana”. Depois de três cliques, cada linha traz um nome real e a transcrição está pronta para ser colada nas notas da reunião com a atribuição correta.
O mesmo formato vale para uma entrevista para duas pessoas, um podcast para quatro pessoas ou uma chamada telefônica bilateral: o mecanismo separa o que ouve e você coloca os nomes.
Como renomear falantes em Hushscript
Os rótulos chegam genéricos propositalmente; nomeá-los é uma etapa rápida do editor. O fluxo antes de chegar lá é: solte seu arquivo e uma visualização de 30 segundos com rótulo de falante será renderizada sem a necessidade de conta, inscreva-se para transcrever o restante e abra a transcrição finalizada. A partir daí:
- Clique em qualquer rótulo de locutor no editor de transcrição, como
Falante B. - Digite o nome real, como “Tom”.
- Cada instância desse locutor é atualizada de uma vez, da primeira à última linha.
A renomeação é global, então você nunca edita o mesmo rótulo duas vezes. Para uma entrevista de 90 minutos com dois palestrantes, uma passagem completa de reclassificação leva menos de um minuto e você acaba com uma transcrição pronta para citação que atribui cada linha corretamente. Você pode então exportá-lo, com os nomes inseridos, em qualquer um dos 21 formatos, como TXT, SRT, DOCX, PDF e JSON, além de um .husharchive protegido por senha.
Solução de problemas comuns de diarização
A diarização é confiável em gravações limpas e fica mais difícil à medida que o áudio fica mais confuso. Os problemas comuns e o que fazer com eles:
Fala sobreposta. Quando duas pessoas falam ao mesmo tempo, o mecanismo precisa atribuir áudio sobreposto a um único falante e pode rotular incorretamente o cruzamento ou omitir algumas palavras. Não há solução no software; o áudio contém genuinamente duas vozes no mesmo momento. A prevenção é a alavanca: uma gravação em que as pessoas se revezam ao falar produz uma diarização muito mais limpa do que uma gravação cheia de interrupções. Onde ocorrem sobreposições, uma leitura rápida do áudio detecta algumas falas afetadas.
Vozes com sons semelhantes. Dois falantes com tom e sotaque próximos (digamos, dois homens de idade semelhante ou irmãos) são mais difíceis de separar do que um par contrastante, porque suas características de voz se sobrepõem genuinamente. O motor pode ocasionalmente trocar uma volta entre eles. Examine a transcrição em busca de linhas que pareçam estranhas para o orador designado; esses são os que devem ser reatribuídos manualmente.
Uma pessoa dividida em dois rótulos. Se o áudio de alguém mudar no meio da gravação (ele se aproxima do microfone, muda de fone de ouvido para viva-voz ou a conexão diminui), o mecanismo pode ler a segunda metade como uma nova voz e criar um rótulo extra. Mescle os dois renomeando ambos com o mesmo nome; as duplicatas se agrupam em um falante.
Duas pessoas fundidas em um rótulo. O inverso acontece quando duas vozes baixas ou distantes soam muito parecidas para que o mecanismo possa se dividir. Isso é mais difícil de reparar após o fato, por isso vale a pena prevenir: aproxime o microfone dos falantes e evite gravar em uma sala grande.
Áudio de campo distante ou barulhento. Um microfone de laptop no final de uma mesa de conferência, um telefone na mesa durante um bate-papo em grupo ou um eco pesado na sala confundem os limites entre as vozes. O posicionamento mais próximo do microfone ajuda todos os falantes e a redução do ruído de fundo (ventiladores, tráfego, música) aumenta a separação. A qualidade da diarização acompanha de perto a qualidade do áudio.
Chamadas telefônicas gravadas como dois arquivos separados. Se o seu gravador salvou cada lado de uma chamada como seu próprio arquivo mono, a diarização em qualquer arquivo verá apenas uma voz. Combine os dois em uma única gravação mixada primeiro, para que ambas as vozes estejam presentes em um arquivo, depois transcreva-o.
Dicas de precisão que realmente movem a agulha
Alguns hábitos tornam a diarização visivelmente melhor, e a maioria deles é sobre a gravação, não sobre o software:
- Deixe as pessoas se revezarem. A conversa cruzada é a maior fonte de erros de diarização. Uma discussão moderada é melhor do que uma discussão aberta para todos.
- Aproxime o microfone. A distância e o eco ambiente desfocam as vozes. Um microfone próximo por pessoa é o ideal; um microfone compartilhado no meio da mesa supera um no canto.
- Corte o ruído de fundo óbvio. Música, um ventilador correndo ou um café movimentado competem com as vozes e turvam os limites.
- Coloque cada voz no arquivo que você transcreve. A diarização compara falantes em uma gravação. Se um gravador produziu faixas de participantes separadas, misture-as ou mescle-as primeiro em um arquivo para que o passe de diarização possa ouvir toda a conversa.
Nada disso precisa ser perfeito. Turnos claros e uma posição razoável do microfone fazem com que a maioria das gravações fiquem limpas, e o editor cuida do resto.
Por que isso é importante para entrevistas e reuniões
Sem diarização, uma transcrição de uma conversa com várias pessoas é quase inutilizável para suas tarefas mais comuns:
- Citações diretas. Você não pode citar alguém se não souber qual. as linhas são deles.
- Atribuição de resumo. Um resumo da reunião que não diz quem disse o que é pouco mais útil do que nenhum resumo.
- Pesquisa por orador. Se você está procurando algo que uma pessoa disse, não pode filtrar um único bloco indiferenciado de texto.
Com a diarização, cada um deles é simples e a transcrição se torna um documento em vez de texto bruto. Para qualquer coisa que será publicada ou citada, seja jornalismo, pesquisa ou notas de programas de podcast, a atribuição precisa não é opcional, e obtê-la a partir da transcrição em vez de reconstruí-la a partir do áudio é onde o tempo é economizado. Para trabalhos internos, como anotações de reuniões, pesquisas de entrevistas ou registros de RH, a estrutura rotulada é igualmente valiosa: digitalizar um diálogo é muito mais rápido do que ler uma parede de texto.
Para obter um passo a passo completo no contexto, consulte como transcrever uma entrevista, que abrange gravação, transcrição e reetiquetagem para jornalismo e pesquisa, e como transcrever um podcast para rotular apresentadores e convidados em um episódio.
Os rótulos de falante são gratuitos em todas as transcrições do Hushscript.
A diarização do palestrante está incluída em todas as transcrições do Hushscript, sem nenhum custo extra. Não há complemento de diarização, nenhum nível de plano separado para isso e nenhum limite de quantos falantes uma gravação pode ter. O próprio Hushscript é pré-pago, sem assinatura. São 30 minutos grátis para testar e você paga apenas pelos minutos que usar depois disso; consulte a página de preços para obter detalhes.
A separação dos falantes é gratuita porque a transcrição de uma conversa sem ela é apenas metade da transcrição: texto legível sem ideia de quem o disse. Insira uma gravação, obtenha os rótulos automaticamente, renomeie-os com um clique e exporte o resultado. Saiba mais sobre como tudo isso se encaixa na página áudio para texto.
Fontes e normas independentes
O Hushscript consultou estas referências independentes e não concorrentes. Elas explicam pesquisas, normas ou o funcionamento de plataformas e não representam endosso do Hushscript.
Fontes revisadas em: