Ir para o conteúdo principal

Diarização de falantes: como funcionam os rótulos

Autor: Publicado em: Última revisão:

A diarização do locutor é o processo automático de separar uma gravação em segmentos por locutor, respondendo “quem falou quando?” antes que qualquer ser humano leia a transcrição. A pesquisa atual sobre diarização de falantes na ACL Anthology descreve a mesma tarefa para conversas com vários participantes. É a diferença entre uma parede de palavras e uma conversa estruturada, e é a razão pela qual a transcrição de uma entrevista entre duas pessoas volta como um diálogo legível em vez de um longo parágrafo.

Em termos simples: você carrega uma gravação, o mecanismo de diarização encontra os pontos onde a voz muda, agrupa os segmentos que soam como a mesma pessoa e devolve uma transcrição que parece um roteiro: uma linha por turno, rotulada por voz. Esta postagem explica como isso funciona, por que a diarização não é o mesmo que reconhecer uma voz e como transformar os rótulos genéricos em nomes reais.

Diarização do locutor, em linguagem simples

Imagem transcrevendo à mão uma entrevista de 90 minutos. Depois de transformar o discurso em texto, a próxima coisa a fazer é adicionar as atribuições: “Entrevistador:”, “Assunto:”, indo e voltando, sempre que a voz mudar. Esse trabalho de atribuição, decidir quem está falando a qualquer momento, é exatamente o que a diarização faz por você.

O resultado é uma transcrição em formato de diálogo:

Falante A [00:00:12]: A primeira coisa a entender é que os dados só existem por um momento.
Falante B [00:00:27]: Certo, e essa é a parte que a maioria das pessoas não percebe até que seja tarde demais.
Falante A [00:00:34]: Exatamente. Portanto, a verdadeira questão é o que você faz nessa janela.

Cada expressão está vinculada a um locutor e a um carimbo de data/hora. Você pode então renomear Falante A e Falante B para nomes reais; uma edição por palestrante, e o rótulo é atualizado onde quer que apareça.

A alternativa, uma transcrição simples sem diarização, é um bloco contínuo de texto onde você tem que reproduzir o áudio para descobrir quem disse o quê. Qualquer coisa que ultrapasse alguns minutos com duas ou mais vozes é um verdadeiro trabalho manual, e é o trabalho que o passe de diarização elimina.

O que você precisa antes de começar

Não há configurações para configurar e nada para instalar. A diarização é executada na própria gravação, portanto, o único pré-requisito real é o áudio em que os falantes são razoavelmente distintos:

É isso. Sem registro de microfone, sem amostras de voz, sem configuração por falante.

Como funciona a identificação automática de falante

A diarização se divide em alguns estágios distintos. Conhecê-los torna a saída mais fácil de ler e de corrigir quando há algo errado.

Extração de recursos. O áudio é dividido em quadros curtos, normalmente de 10 a 40 milissegundos cada, e o mecanismo mede os recursos acústicos em cada quadro. Os recursos importantes para distinguir os falantes estão no domínio da frequência: altura, formantes e padrões espectrais que tendem a permanecer consistentes na voz de uma pessoa e diferem entre as pessoas.

Segmentação. O mecanismo procura pontos de mudança de falante: momentos em que essas características de voz mudam. Esta é a parte difícil. Uma mudança pode ocorrer no meio da frase quando alguém a interrompe, e o ruído ou a fala sobreposta podem ocultar um limite real ou inventar um limite falso.

Clustering. Segmentos que soam como a mesma voz são agrupados. O motor não informa quantas pessoas estão na sala; ele infere a contagem de falantes do áudio. Se você souber a contagem com antecedência, algumas configurações permitem fornecê-la; caso contrário, o mecanismo estima, que é de onde vem a maioria dos erros “dividir uma pessoa em duas” e “fundir duas pessoas em uma”.

Rotulagem. Cada cluster recebe um rótulo:Falante A,Falante B,Falante C, ou Falante 0,Falante 1. Os rótulos são espaços reservados arbitrários. Não há identidade por trás deles, apenas um controle estável para uma voz durante toda a gravação.

Todo o pipeline é executado como uma passagem automatizada junto com a transcrição, para que você não execute um trabalho separado de rotulagem de falante.

Diarização versus reconhecimento de voz

Esses dois são confundidos constantemente, mas respondem a perguntas diferentes.

Diarização pergunta: quem está falando neste momento, em relação às outras vozes neste arquivo? Ela separa as vozes, mas não tem ideia de quem elas pertencem. Ele não precisa de conhecimento prévio e não mantém nenhum registro de voz após a conclusão do trabalho.

O reconhecimento de voz, também chamado de identificação do locutor, pergunta: esta é a mesma pessoa que em uma gravação de referência conhecida? Ele precisa de uma amostra de voz registrada para comparar e é a tecnologia por trás dos sistemas de “verificação de sua identidade por voz”.

O Hushscript usa diarização, não reconhecimento de voz. Não há banco de dados de vozes inscritas e sua gravação nunca é comparada com a de outra pessoa. Os rótulos dos falantes são derivados puramente das características de voz dentro desse arquivo.

Essa distinção explica por que a diarização não consegue nomear as pessoas. Ela pode afirmar com segurança que ‘a mesma pessoa falou nestes 200 turnos ao longo da hora’, mas não pode dizer quem é essa pessoa. Essa identificação cabe a você e exige apenas um clique por falante. Para entender em detalhes como o Hushscript processa gravações com vários falantes do início ao fim, consulte a página sobre identificação de falantes.

Um exemplo prático: uma reunião de três pessoas

Digamos que você grave uma reunião de projeto de 40 minutos com três pessoas em uma sala, compartilhando um único microfone de laptop, salvo como um único arquivo .m4a. Você o insere e, após a transcrição, o resultado fica assim:

Falante A [00:00:04]: Ok, vamos começar com a data de lançamento. Onde estamos?
Falante B [00:00:09]: O design está feito. Entregamos as telas finais na segunda-feira.
Falante C [00:00:14]: A engenharia precisa de cerca de mais duas semanas para o fluxo de pagamento.
Falante A [00:00:21]: Duas semanas nos ultrapassam a data que prometemos ao marketing.
Falante B [00:00:27]: Podemos enviar sem o novo fluxo de pagamento e acompanhamento?
Falante C [00:00:33]: Não de forma limpa. O fluxo antigo é interrompido com os novos preços.

Três vozes, separadas e rotuladas, com carimbos de data e hora em cada turno. Agora você renomeia:Falante A passa a ser “Priya” (ela está comandando a reunião),Falante B passa a ser “Tom”,Falante C passa a ser “Dana”. Depois de três cliques, cada linha traz um nome real e a transcrição está pronta para ser colada nas notas da reunião com a atribuição correta.

O mesmo formato vale para uma entrevista para duas pessoas, um podcast para quatro pessoas ou uma chamada telefônica bilateral: o mecanismo separa o que ouve e você coloca os nomes.

Como renomear falantes em Hushscript

Os rótulos chegam genéricos propositalmente; nomeá-los é uma etapa rápida do editor. O fluxo antes de chegar lá é: solte seu arquivo e uma visualização de 30 segundos com rótulo de falante será renderizada sem a necessidade de conta, inscreva-se para transcrever o restante e abra a transcrição finalizada. A partir daí:

  1. Clique em qualquer rótulo de locutor no editor de transcrição, como Falante B.
  2. Digite o nome real, como “Tom”.
  3. Cada instância desse locutor é atualizada de uma vez, da primeira à última linha.

A renomeação é global, então você nunca edita o mesmo rótulo duas vezes. Para uma entrevista de 90 minutos com dois palestrantes, uma passagem completa de reclassificação leva menos de um minuto e você acaba com uma transcrição pronta para citação que atribui cada linha corretamente. Você pode então exportá-lo, com os nomes inseridos, em qualquer um dos 21 formatos, como TXT, SRT, DOCX, PDF e JSON, além de um .husharchive protegido por senha.

Solução de problemas comuns de diarização

A diarização é confiável em gravações limpas e fica mais difícil à medida que o áudio fica mais confuso. Os problemas comuns e o que fazer com eles:

Fala sobreposta. Quando duas pessoas falam ao mesmo tempo, o mecanismo precisa atribuir áudio sobreposto a um único falante e pode rotular incorretamente o cruzamento ou omitir algumas palavras. Não há solução no software; o áudio contém genuinamente duas vozes no mesmo momento. A prevenção é a alavanca: uma gravação em que as pessoas se revezam ao falar produz uma diarização muito mais limpa do que uma gravação cheia de interrupções. Onde ocorrem sobreposições, uma leitura rápida do áudio detecta algumas falas afetadas.

Vozes com sons semelhantes. Dois falantes com tom e sotaque próximos (digamos, dois homens de idade semelhante ou irmãos) são mais difíceis de separar do que um par contrastante, porque suas características de voz se sobrepõem genuinamente. O motor pode ocasionalmente trocar uma volta entre eles. Examine a transcrição em busca de linhas que pareçam estranhas para o orador designado; esses são os que devem ser reatribuídos manualmente.

Uma pessoa dividida em dois rótulos. Se o áudio de alguém mudar no meio da gravação (ele se aproxima do microfone, muda de fone de ouvido para viva-voz ou a conexão diminui), o mecanismo pode ler a segunda metade como uma nova voz e criar um rótulo extra. Mescle os dois renomeando ambos com o mesmo nome; as duplicatas se agrupam em um falante.

Duas pessoas fundidas em um rótulo. O inverso acontece quando duas vozes baixas ou distantes soam muito parecidas para que o mecanismo possa se dividir. Isso é mais difícil de reparar após o fato, por isso vale a pena prevenir: aproxime o microfone dos falantes e evite gravar em uma sala grande.

Áudio de campo distante ou barulhento. Um microfone de laptop no final de uma mesa de conferência, um telefone na mesa durante um bate-papo em grupo ou um eco pesado na sala confundem os limites entre as vozes. O posicionamento mais próximo do microfone ajuda todos os falantes e a redução do ruído de fundo (ventiladores, tráfego, música) aumenta a separação. A qualidade da diarização acompanha de perto a qualidade do áudio.

Chamadas telefônicas gravadas como dois arquivos separados. Se o seu gravador salvou cada lado de uma chamada como seu próprio arquivo mono, a diarização em qualquer arquivo verá apenas uma voz. Combine os dois em uma única gravação mixada primeiro, para que ambas as vozes estejam presentes em um arquivo, depois transcreva-o.

Dicas de precisão que realmente movem a agulha

Alguns hábitos tornam a diarização visivelmente melhor, e a maioria deles é sobre a gravação, não sobre o software:

Nada disso precisa ser perfeito. Turnos claros e uma posição razoável do microfone fazem com que a maioria das gravações fiquem limpas, e o editor cuida do resto.

Por que isso é importante para entrevistas e reuniões

Sem diarização, uma transcrição de uma conversa com várias pessoas é quase inutilizável para suas tarefas mais comuns:

Com a diarização, cada um deles é simples e a transcrição se torna um documento em vez de texto bruto. Para qualquer coisa que será publicada ou citada, seja jornalismo, pesquisa ou notas de programas de podcast, a atribuição precisa não é opcional, e obtê-la a partir da transcrição em vez de reconstruí-la a partir do áudio é onde o tempo é economizado. Para trabalhos internos, como anotações de reuniões, pesquisas de entrevistas ou registros de RH, a estrutura rotulada é igualmente valiosa: digitalizar um diálogo é muito mais rápido do que ler uma parede de texto.

Para obter um passo a passo completo no contexto, consulte como transcrever uma entrevista, que abrange gravação, transcrição e reetiquetagem para jornalismo e pesquisa, e como transcrever um podcast para rotular apresentadores e convidados em um episódio.

Os rótulos de falante são gratuitos em todas as transcrições do Hushscript.

A diarização do palestrante está incluída em todas as transcrições do Hushscript, sem nenhum custo extra. Não há complemento de diarização, nenhum nível de plano separado para isso e nenhum limite de quantos falantes uma gravação pode ter. O próprio Hushscript é pré-pago, sem assinatura. São 30 minutos grátis para testar e você paga apenas pelos minutos que usar depois disso; consulte a página de preços para obter detalhes.

A separação dos falantes é gratuita porque a transcrição de uma conversa sem ela é apenas metade da transcrição: texto legível sem ideia de quem o disse. Insira uma gravação, obtenha os rótulos automaticamente, renomeie-os com um clique e exporte o resultado. Saiba mais sobre como tudo isso se encaixa na página áudio para texto.

Fontes e normas independentes

O Hushscript consultou estas referências independentes e não concorrentes. Elas explicam pesquisas, normas ou o funcionamento de plataformas e não representam endosso do Hushscript.

Fontes revisadas em:

Perguntas frequentes

O que é diarização de falante?

A diarização de falante é o processo de segmentar uma gravação de áudio em partes que correspondem a falantes distintos. O resultado é uma transcrição onde cada linha é atribuída ao locutor que a disse (“O Falante A disse isto, o Falante B disse aquilo”) em vez de um bloco indiferenciado de texto. Responde à pergunta 'quem falou quando?' automaticamente, antes que alguém leia a transcrição.

A diarização do locutor é o mesmo que reconhecimento de voz?

Não. A diarização separa as vozes em uma gravação e informa que a mesma pessoa disse esses segmentos, mas não sabe quem é essa pessoa. O reconhecimento de voz (identificação do locutor) compara uma voz com uma amostra de referência conhecida para atribuir um nome a ela. A diarização não precisa de referência e não cria perfil de voz; é por isso que rotula os falantes como 'Falante A' e 'Falante B' em vez de pelo nome.

Quantos falantes a diarização pode suportar?

Hushscript não tem limite pago para a contagem de falantes, mas não existe um número universal no qual a diarização permaneça igualmente precisa. Sobreposição, vozes com sons semelhantes, distância do microfone e ruído da sala são importantes. Um painel limpo pode separar melhor do que uma chamada barulhenta de duas pessoas, portanto, revise os rótulos sempre que a atribuição for importante.

Por que a transcrição dividiu uma pessoa em dois falantes?

Normalmente, uma grande mudança na forma como essa pessoa soa no meio da conversa: ela se aproximou ou se afastou do microfone, mudou de um fone de ouvido para um viva-voz ou a qualidade da linha mudou. O mecanismo agrupa as vozes por suas características, portanto, uma grande mudança nessas características pode ser interpretada como uma nova voz. Mesclar os dois rótulos no editor corrige o problema de uma só vez.

A diarização pode me dizer quem é o locutor pelo nome?

Não. A diarização separa os falantes, mas não os identifica pelo nome. Ele os rotula como 'Falante A', 'Falante B' e assim por diante. Você mesmo atribui nomes reais no editor depois que a transcrição é gerada, e cada renomeação se aplica a cada linha que o locutor disse.

A diarização do locutor funciona em gravações de chamadas telefônicas?

Sim, quando ambos os lados da chamada são capturados. Se a gravação for uma única faixa mixada com ambas as vozes, a diarização as separará como qualquer outro arquivo de dois falantes. Se cada lado foi salvo como seu próprio arquivo mono separado, combine-os primeiro em uma mixagem para que ambas as vozes estejam presentes na mesma gravação.

A diarização do locutor está incluída em cada transcrição do Hushscript?

Sim. Cada transcrição inclui rótulos de falante sem custo extra, sem complementos separados e sem necessidade de nível superior para eles. Você pode renomear os rótulos para nomes reais com um clique após a transcrição, e o novo nome é atualizado ao longo de toda a transcrição.

Comece com 30 minutos grátis

Começar – 30 minutos grátis