Como transcrever uma entrevista com privacidade
Autor: Hushscript Publicado em: Última revisão:
Transcrever bem uma entrevista significa duas coisas ao mesmo tempo: texto preciso e atribuição clara. Uma parede de palavras onde você não consegue dizer quem disse o que dá quase tanto trabalho quanto a gravação bruta. E quando a conversa é delicada, um assunto jurídico, uma fonte confidencial, uma situação de RH, a forma como o áudio é tratado é tão importante quanto a própria transcrição. Este guia cobre todo o arco: obter um áudio limpo antes de gravar, executar a transcrição, manter o entrevistador e o assunto separados, citar com precisão com carimbos de data e hora e manter tudo privado.
O que você precisa antes de começar
A lista é curta. Você precisa de uma gravação da entrevista como um arquivo de áudio ou vídeo. Hushscript aceita qualquer formato comum, portanto, uma mensagem de voz de telefone, uma gravação Zoom, um WAV de gravador dedicado ou uma captura de tela MP4 funcionam sem conversão. Você precisa do consentimento de todos os registrados, que é abordado abaixo e não é opcional. E você precisa de uma maneira de visualizar e editar a transcrição, que é o aplicativo Hushscript em seu navegador. Sem instalações, sem plugins.
Você não precisa escolher um idioma. O Hushscript o detecta automaticamente em cerca de 99 idiomas, portanto, uma entrevista bilíngue ou um sujeito que muda no meio da frase é tratado sem que você defina nada. Se você quiser ver a lista completa, a página de idiomas a contém.
Antes de gravar
A qualidade do áudio no momento da gravação é o maior fator na precisão da transcrição. Nenhum mecanismo de transcrição, automático ou humano, pode recuperar uma palavra que o microfone nunca captou com clareza. Alguns detalhes compensam mais do que qualquer coisa que você faça depois.
Posicionamento do microfone. Para uma entrevista pessoal, um pequeno gravador colocado sobre a mesa equidistante de ambos os falantes é melhor do que um telefone deixado em seu bolso. Se você puder dar a cada pessoa seu próprio microfone, faça-o: duas entradas limpas são mais fáceis de separar do que uma sala mista. Para entrevistas remotas em uma chamada de vídeo, grave cada lado como sua própria trilha quando a plataforma permitir, porque duas trilhas se separam de maneira mais clara do que uma única transmissão mixada.
Um ambiente silencioso. O zumbido do HVAC, o tráfego através de uma janela, a vibração de fundo de um café e a reverberação de uma sala vazia, tudo isso diminui a precisão. Uma pequena sala acarpetada, ou mesmo um armário com roupas penduradas, soa melhor do que um escritório aberto. No campo, um microfone direcional apontado para o sujeito ajuda a elevar a voz dele acima do ambiente.
Consentimento, antes de mais nada. Gravar uma pessoa sem seu conhecimento é ilegal em muitos lugares e inaceitável em todos os lugares. Diga ao assunto que você está gravando antes de começar. Algumas jurisdições exigem o consentimento de uma parte, mas várias, incluindo vários estados dos EUA e muitos países, exigem que todos os presentes concordem. Em caso de dúvida, peça um sim explícito na própria gravação, logo após iniciar, para que o acordo faça parte do arquivo.
Configurações de formato sensatas. Você não precisa de qualidade de estúdio. WAV ou MP3 a 128 kbps ou superior é suficiente, e uma taxa de amostragem de 16 kHz ou superior é confortável. A única coisa a evitar é a compressão para a qualidade do telefone, em torno de 8 kHz, onde as consoantes se misturam e a precisão cai visivelmente.
Transcreva a entrevista, passo a passo
O fluxo é construído para que você possa ver a qualidade antes de confirmar. Aqui está a verdadeira ordem.
- Deixe sua gravação em /audio-to-text. Se for um vídeo, o áudio é extraído primeiro no seu navegador, para que o arquivo de vídeo nunca saia do seu dispositivo. Apenas o áudio está envolvido aqui.
- Leia a prévia de 30 segundos. O Hushscript transcreve o primeiro meio minuto e mostra-o de volta para você com os rótulos dos falantes já aplicados, antes de você criar uma conta. Esta é a etapa sem conta: você julga a separação dos oradores e o texto do seu arquivo real, não uma demonstração.
- Inscreva-se para transcrever o resto. A criação de uma conta desbloqueia a transcrição completa. Novas contas têm 30 minutos grátis para testar, o suficiente para uma entrevista curta ou longa. Depois disso, o Hushscript é pré-pago, sem assinatura, então você compra minutos apenas quando precisa deles.
- Reetiquete e exporte. A transcrição finalizada retorna como uma linha por enunciado, cada uma marcada com um rótulo de orador e um carimbo de data/hora. Renomeie os rótulos para nomes reais e depois exporte.
Uma observação sobre os minutos grátis, já que as pessoas perguntam como funciona a parte “grátis”. Os 30 minutos são concedidos uma vez. A maneira mais rápida de desbloqueá-los é uma verificação rápida do cartão: uma retenção de US$ 1 é autorizada para confirmar o cartão e liberada imediatamente, sem cobrança. Se preferir pagar de outra forma, um método alternativo disponível no seu país também funciona, e os 30 minutos chegam na sua primeira compra. De qualquer forma, um cartão não é necessário.
Mantenha o entrevistador e o sujeito separados
É aqui que a transcrição da entrevista se torna utilizável, em vez de uma transcrição que você precisa ouvir novamente de qualquer maneira. O recurso de identificação do falante atribui a cada voz distinta seu próprio rótulo, sem configuração e sem custo extra. Para uma entrevista com duas pessoas, isso significa um diálogo como este:
Falante A [00:00:07]: Você pode me levar de volta ao momento em que percebeu que o projeto estava com problemas?
Falante B [00:00:13]: Era o início de 2019. Eu estava executando o lançamento e os números simplesmente pararam de somar.
Falante A [00:00:28]: E o que você fez a respeito?
Falante B [00:00:31]: Sinceramente, a princípio, nada. Essa é a parte da qual me arrependo.
Para colocar nomes reais:
- Clique em qualquer ocorrência de
Falante Ana transcrição. - Digite o nome desejado, por exemplo “Entrevistador” ou o nome do sujeito.
- Cada linha desse locutor é atualizada em uma vez.
Você faz isso uma vez por palestrante. Para uma entrevista de 90 minutos com duas pessoas, toda a passagem leva menos de um minuto e você termina com um documento pronto para citação, onde cada linha é atribuída a uma pessoa nomeada. Se você quiser detalhes de como essa separação realmente funciona nos bastidores, como funciona a diarização do locutor explica isso em linguagem simples.
Um exemplo prático: uma entrevista de pesquisa de uma hora
Digamos que você gravou uma entrevista de pesquisa de 58 minutos em seu telefone como um arquivo .m4a. A sala estava silenciosa, vocês dois estavam perto do telefone, e houve a habitual sobreposição quando o assunto ficou animado.
Você solta o arquivo em /audio-to-text. A visualização de 30 segundos mostra sua pergunta inicial como Falante A e a primeira resposta do sujeito como Falante B, o que indica que a separação é clara. Você se inscreve e deixa o arquivo completo ser transcrito. Uma entrevista de 58 minutos usa 58 minutos do seu saldo, então os 30 minutos grátis cobrem pouco mais da metade e você recarrega o resto.
A transcrição é lida como um vai-e-vem limpo. Você clica no primeiro Falante A, digita seu próprio nome, clica no primeiro Falante B, digita o nome do seu assunto e todo o documento é atualizado. Ao folhear, você percebe três trechos curtos em que o mecanismo divide o assunto em um segundo rótulo porque eles se afastaram do telefone, então você os mescla de volta. Você exporta suas anotações para DOCX e para JSON para que seu script de análise possa extrair cada expressão com horário de início, horário de término e falante. Tempo total de prática após o upload: alguns minutos.
Citar com precisão com carimbos de data/hora
Cada expressão na transcrição carrega um carimbo de data/hora, que é o que torna a saída segura para citação. Ao obter uma cotação de um artigo, relatório ou artigo, observe o carimbo de data e hora ao lado. Isso lhe dá um ponto preciso para ouvir durante a verificação dos fatos, dá ao editor uma maneira de verificar a citação e lhe dá algo para apontar se uma fonte posteriormente contestar o que disse. Quanto arrumar uma citação depois de obtê-la, seja para manter cada início falso ou suavizar o texto em uma prosa limpa, é uma escolha de estilo que vale a pena fazer propositalmente, e transcrição limpa versus transcrição literal estabelece ambas as convenções.
A exportação DOCX mantém os carimbos de data e hora alinhados. Se você precisar da estrutura bruta, a exportação JSON fornecerá dados em nível de expressão, cada entrada com horário de início, horário de término, locutor e texto, que você pode processar programaticamente. A exportação TXT é a cópia de leitura limpa, e o SRT fornece linhas de legenda cronometradas se a entrevista for exibida em um vídeo.
Um limite que vale a pena conhecer: os carimbos de data e hora estão no nível da expressão, não na palavra individual. Para a maioria dos trabalhos de entrevista, é exatamente isso que você deseja, já que você está citando uma frase, não uma sílaba. Se você precisar especificamente de tempo em nível de palavra para gravar legendas em filmagens, o tempo da linha SRT é próximo o suficiente para quase todos os propósitos.
Problemas comuns e como corrigi-los
A maioria das gravações de entrevistas é transcrita de forma limpa. Quando algo está errado, quase sempre é um dos vários problemas, e cada um tem uma solução simples.
Um falante dividido em dois rótulos. É o caso inesperado mais comum. Geralmente significa que o som da pessoa mudou no meio do processo: ela se aproximou ou se afastou do microfone, mudou de fone de ouvido para viva-voz ou a qualidade da linha mudou durante uma chamada. O mecanismo se agrupa de acordo com a forma como uma voz soa, de modo que uma grande mudança pode ser interpretada como uma nova voz. Mescle os dois rótulos no editor e ele será fixado em uma única passagem, como no exemplo prático acima.
Duas pessoas mescladas em um rótulo. O inverso. Isto acontece quando duas vozes são genuinamente semelhantes ou quando a gravação é silenciosa e as diferenças são difíceis de ouvir. É mais difícil consertar de forma clara após o fato, e é por isso que duas entradas separadas no momento da gravação, uma por pessoa, são a melhor garantia contra isso.
Conversa cruzada e pessoas conversando umas com as outras. Quando ambos falam ao mesmo tempo, qualquer transcritor, automático ou humano, tem dificuldades, porque as palavras estão fisicamente sobrepostas no áudio. Espere que os momentos mais movimentados de uma entrevista acalorada precisem de uma escuta manual. Os carimbos de data e hora facilitam a localização desses momentos.
Acentos fortes ou termos especializados. A precisão se mantém bem em todos os sotaques, mas nomes próprios, jargões técnicos e nomes desconhecidos são onde a transcrição automática tem maior probabilidade de falhar. Faça uma pesquisa e substitua alguns nomes e termos específicos para sua entrevista e confirme aqueles que pretende citar. Quando a entrevista é uma conversa clínica ou de pesquisa repleta de vocabulário especializado, a transcrição médica para ditados e entrevistas aborda como lidar com esses termos.
Uma gravação silenciosa ou distante. Se o sujeito estava longe do microfone ou falava baixo, a precisão cai em geral e não há correção de software após o fato. Este é o caso que a seção “antes de gravar” existe para evitar. Se você estiver com uma gravação fraca, transcreva-a mesmo assim como um rascunho e corrija-a com o áudio.
Um arquivo muito longo ou grande. Uma gravação pode durar até 10 horas, sem limite de tamanho de arquivo – mesmo uma gravação muito grande é preparada diretamente no navegador. Divida apenas as gravações que excedam o limite de 10 horas, usando uma pausa natural e, em seguida, transcreva cada parte.
Fonte de áudio ou fonte de vídeo: qual enviar
Se você tiver um arquivo de áudio e um vídeo da mesma entrevista, carregue qualquer um deles. A transcrição é idêntica, porque o Hushscript funciona a partir do áudio em ambos os casos. A diferença prática é a privacidade. Quando você fornece um vídeo, o áudio é extraído em seu navegador e somente esse áudio é enviado, de forma que o vídeo, muitas vezes o artefato mais identificador e mais sensível, nunca sai de sua máquina. Para uma entrevista delicada, esse é o melhor padrão. Se você já possui um arquivo limpo apenas de áudio, carregá-lo é mais simples.
Manter entrevistas confidenciais privadas
Para entrevistas que abordam questões jurídicas, fontes confidenciais, casos de RH ou divulgações pessoais, a forma como o áudio é tratado é importante além da qualidade da transcrição. O Hushscript foi criado exatamente para isso.
O áudio é excluído do servidor no momento em que a transcrição fica pronta. Não há janela de retenção nem cópia de backup da gravação em algum lugar posterior. Se você enviou um vídeo, apenas o áudio extraído foi enviado, e ele também desapareceu. O mecanismo de fala não treina suas gravações, então nada que você envia alimenta um modelo.
As próprias transcrições são criptografadas em repouso. Em termos simples, se o armazenamento fosse violado, o que um invasor encontraria seria um texto cifrado ilegível, e não as palavras do alvo. Isso é proteção contra vazamentos, não uma alegação de que não podemos ler suas transcrições: a chave está em nosso lado para que o produto possa mostrar seu próprio trabalho. Isso significa que um vazamento de dados, a ameaça real para qualquer ferramenta de nuvem, não entrega o conteúdo legível da entrevista.
Para os casos mais fortes, proteção de fontes no jornalismo, material jurídico privilegiado, tome a precaução padrão: mantenha sua própria cópia off-line do áudio e da transcrição final em um dispositivo que você controla e não trate nenhum serviço de nuvem, incluindo este, como a única cópia. Se você quiser ter uma visão completa do tratamento de dados, a página transcrição privada apresenta tudo.
Se a sua gravação for um podcast com vários hosts em vez de uma entrevista individual, o fluxo de trabalho é o mesmo e como transcrever um podcast aborda os detalhes de múltiplas vozes.
Fontes e normas independentes
O Hushscript consultou estas referências independentes e não concorrentes. Elas explicam pesquisas, normas ou o funcionamento de plataformas e não representam endosso do Hushscript.
Fontes revisadas em: