Ir para o conteúdo principal

Como transcrever um podcast e criar notas do episódio

Autor: Publicado em: Última revisão:

Uma transcrição de podcast vale duas vezes. Torna o episódio pesquisável e acessível para ouvintes que lêem em vez de ouvir, e fornece matéria-prima para notas do episódio, citações e legendas sem reproduzir toda a gravação. O suporte da plataforma é concreto, não teórico: Apple Podcasts documenta transcrições e navegação de capítulos para criadores. Este guia orienta a transcrição de um episódio, rotulando cada apresentador e convidado e transformando o resultado em um documento utilizável de notas do episódio.

A parte que mais economiza tempo é a separação dos falantes. Uma transcrição que parece um bloco indiviso de texto é quase tão trabalhosa quanto o próprio áudio. O Hushscript rotula cada voz automaticamente e a inclui gratuitamente em cada transcrição, para que a conversa volte como uma conversa.

O que você precisa antes de começar

Uma gravação do episódio, em qualquer formato comum de áudio ou vídeo. Se você exportou um arquivo de áudio simples do seu editor (MP3, WAV, M4A), isso funciona diretamente. Se sua única cópia for a gravação de vídeo do Zoom, Riverside ou Ecamm, isso também funciona, e o áudio é extraído dela no seu navegador para que o vídeo nunca seja carregado.

O áudio de fonte limpa ajuda mais do que qualquer outra coisa. Os rótulos dos falantes funcionam melhor quando cada voz é distinta e as pessoas não falam constantemente umas com as outras. Se você gravou cada participante em uma trilha separada, você já terá a entrada mais limpa possível. Uma única faixa mixada ainda funciona; apenas depende mais da diarização para distinguir as vozes. Se puder, grave vozes secas e adicione a música depois em seu editor, já que um jingle rodando sob fala contínua é a única coisa que diminui a precisão de maneira confiável.

Você precisará de uma conta para transcrever um episódio completo. A visualização de 30 segundos é a etapa sem conta, para que você possa verificar os rótulos dos falantes e a qualidade do texto em seu arquivo real antes de se inscrever em qualquer coisa.

Transcreva o episódio

O fluxo segue a ordem real do funil: visualize primeiro, depois inscreva-se e depois transcreva o resto.

  1. Solte o arquivo em /podcast-transcription. O Hushscript recorta os primeiros 30 segundos no seu navegador e retorna uma visualização rotulada pelo orador. Nenhuma conta é necessária para esta etapa. Você vê exatamente como o anfitrião e o convidado se dividem e como o texto é lido em seu próprio áudio.
  2. Inscreva-se para transcrever o resto. Depois de inserir seu e-mail e fazer login, você carrega o episódio completo. Novas contas recebem 30 minutos grátis para testar, concedidos uma vez. A maneira mais rápida de reivindicá-los é um cheque de cartão de US$ 1 que é autorizado e liberado imediatamente, sem nunca ser cobrado. Se preferir um método de pagamento alternativo disponível no seu país, os 30 minutos chegam na sua primeira compra; não é necessário um cartão.
  3. Deixe a transcrição ser executada e depois exporte. A transcrição volta com um rótulo e um carimbo de data/hora em cada expressão. Exporte DOCX para um documento que você editará em notas de programa, TXT para um bloco limpo para colar em seu CMS, SRT para legendas em uma versão de vídeo ou JSON se o host do seu podcast aceitar uploads de transcrição em nível de expressão.

Os 30 minutos gratuitos podem cobrir um episódio curto ou uma seção representativa de um episódio mais longo. Um episódio de 60 minutos usa 60 minutos do seu saldo, por isso precisa de uma recarga após o limite de teste.

Etiquete cada anfitrião e convidado

A ​​diarização do falante é executada automaticamente, para que você não ligue nada. Para um episódio de duas pessoas (um apresentador, um convidado), a transcrição volta dividida de forma clara, com cada linha atribuída a um dos dois rótulos. Para um painel, o Hushscript separa quantas vozes distintas ele ouve, sem limite de falante.

Para substituir os rótulos genéricos por nomes reais:

  1. Clique em qualquer instância de Falante A no editor.
  2. Digite o nome, como “Alex” ou “Host”.
  3. Cada instância desse rótulo é atualizada ao longo da transcrição de uma só vez.

Você renomeia cada voz uma vez, não linha por linha. Um episódio para duas pessoas leva cerca de um minuto; um painel de quatro pessoas leva alguns. Após a reetiquetagem, um trecho da transcrição fica assim:

Alex [00:03:12]: Então você dirigia a empresa naquele momento. Quais foram os primeiros sinais?
Jamie [00:03:19]: Honestamente, foram os números. Tivemos uma queda de 40% em um trimestre.
Alex [00:03:27]: E você não conseguiu explicar na época?
Jamie [00:03:35]: Faltam semanas para isso. Essa foi a parte que me manteve acordado.

Essa é a estrutura que você precisa para obter citações e escrever capítulos com carimbo de data/hora. Como os rótulos percorrem todo o arquivo, um episódio longo é rotulado exatamente uma vez. Para conhecer a mecânica por trás da separação de voz, veja como funciona a diarização do falante.

Quando os rótulos precisam de uma correção

A diarização é precisa em gravações limpas, mas não infalível, e vale a pena conhecer alguns padrões para que você possa corrigi-los rapidamente.

Se dois convidados tiverem vozes muito semelhantes, um uma linha ocasional pode pousar no falante errado. Digitalize a transcrição com o áudio aberto e reatribua manualmente as poucas linhas atribuídas incorretamente. Isso é muito mais rápido do que digitar os nomes dos falantes do zero, porque você está apenas corrigindo exceções.

Se um co-apresentador silencioso que mal fala for mesclado em outro rótulo, primeiro dê aos falantes principais seus nomes reais e, em seguida, procure algumas linhas que deveriam pertencer à voz baixa. Em uma gravação bem separada, você raramente atinge qualquer um dos casos, e é por isso que uma faixa separada por pessoa vale a pequena configuração extra no tempo de gravação.

Problemas comuns e o que realmente os causa

A maioria dos problemas de transcrição remontam à gravação, não à ferramenta. Vale a pena planejar alguns antes de publicar um programa.

Conversa e pessoas conversando umas com as outras. Essa é a coisa mais difícil para qualquer sistema de separação de falantes, porque duas vozes no mesmo instante não podem ser divididas de forma clara. O texto geralmente permanece legível, mas um momento de sobreposição pesada pode atingir um falante ou ficar borrado na costura. Uma boa higiene do podcast já ajuda aqui: um apresentador que permite que os convidados terminem produz uma transcrição mais limpa como efeito colateral. Onde isso acontecer, corrija essas poucas linhas manualmente no áudio.

Convidados remotos gravados em uma faixa. Uma chamada gravada como um único arquivo misto é mais difícil de separar do que a mesma chamada capturada como uma faixa por participante. Se a sua ferramenta suportar gravação local por participante, use-a; se você tiver apenas o arquivo misto, a transcrição ainda será exibida, apenas depende mais da diarização. De qualquer forma, o áudio é o mesmo upload, então não há nada diferente para fazer no momento da transcrição.

Sotaques fortes e troca de código. O Hushscript detecta o idioma automaticamente e transcreve cerca de 99 idiomas, com precisão de alto nível em dezoito deles, para que um convidado com sotaque pronunciado em um idioma compatível seja bem tratado. Um convidado que alterna entre dois idiomas no meio de uma frase é o caso genuinamente difícil; espere limpar as frases trocadas manualmente. Para obter a lista completa de idiomas suportados, consulte a página de idiomas.

Música de introdução e stingers. Uma base musical entre segmentos geralmente é ignorada em vez de ser transcrita como sem sentido. O problema só começa quando a música é executada em fala contínua por um longo período. A solução limpa é editorial: grave as vozes secas e coloque a música depois, para que a transcrição só veja a fala.

Nomes, jargões e grafias de marcas. Um convidado especialista usará termos e nomes de produtos que o modelo pode interpretar foneticamente. Eles são fáceis de corrigir porque se repetem, e uma busca e substituição no documento exportado resolve erros ortográficos recorrentes de uma só vez.

Algumas dicas de precisão

A maior alavanca é a qualidade da gravação, portanto, o esforço despendido em microfones e em uma sala silenciosa compensa na hora da transcrição. Além disso, uma faixa por falante fornece o texto mais limpo e os rótulos de falante mais limpos, já que o sistema nunca precisa desembaraçar duas vozes de uma forma de onda. Mantenha o microfone do convidado próximo e consistente, em vez de ficar à deriva, e você gastará seu tempo de edição no conteúdo, em vez de em reparos.

Ao revisar, leia com o áudio aberto e corrija nas passagens: primeiro os rótulos dos falantes, depois os nomes e jargões ouvidos incorretamente e, em seguida, a sobreposição ocasional. Trabalhar por categoria é mais rápido do que ler de cima a baixo e deixa você com um documento limpo o suficiente para ser publicado.

Da transcrição para mostrar notas

Mostrar notas não é um resumo de tudo o que foi dito. Eles são um auxílio à navegação para os ouvintes e uma superfície de busca para quem ainda não apertou o play. Uma estrutura que funciona para a maioria das entrevistas e conversas mostra:

Resumo do episódio, duas a quatro frases. Extraia o tópico principal da transcrição. Qual é o argumento central, história ou conclusão? Escreva para alguém que está decidindo se quer ouvir.

Capítulos com carimbo de data/hora. Examine a transcrição em busca de mudanças de tópico. Cada vez que a conversa muda para um novo assunto, anote a data e hora e escreva uma descrição de uma linha. Os carimbos de data e hora vêm direto da transcrição, então você nunca ouve novamente para encontrá-los.

[00:02:15] Lançamento da empresa sem orçamento de marketing
[00:14:30] A queda de 40% na receita e o que a causou
[00:28:44] Reconstrução: o que mudou internamente
[00:51:00] Conselhos para fundadores na mesma posição

Citações importantes. Extraia duas ou três linhas que capturem as principais afirmações do episódio ou seus momentos mais citáveis. Cite literalmente a transcrição e atribua cada um ao orador pelo nome. Executar uma citação exatamente como foi falada ou cortar o preenchimento e inícios falsos para notas do episódio mais limpas é uma decisão que vale a pena fazer de propósito, e transcrição limpa versus literalmente percorre ambos. Como o texto pode ser pesquisado, encontrar o texto exato de uma linha da qual você se lembra pela metade leva segundos.

Links e recursos para convidados. Adicione qualquer coisa que o convidado tenha mencionado. Para encontrar URLs falados rapidamente, pesquise na transcrição fragmentos como “ponto com” ou “barra”; as pessoas dizem endereços da web em voz alta com mais frequência do que você esperaria, e uma transcrição literal os captura.

Transcrição completa, opcional, mas valiosa. Cole o texto completo abaixo das notas ou crie um link para uma página de transcrição separada. É aqui que mora o valor da busca, pois o conteúdo falado passa a ser indexável. Se sua plataforma host aceitar uploads de transcrição, a exportação JSON transportará dados em nível de expressão; caso contrário, o texto simples é suficiente.

Um exemplo prático

Digamos que você gravou uma entrevista de 58 minutos com o fundador em duas faixas e as mixou em um MP3. Você coloca o MP3 em /podcast-transcription, assiste à prévia de 30 segundos dividindo o host e o convidado corretamente, inscreve-se e carrega o arquivo completo. A transcrição retorna com Falante A e Falante B; você os renomeia para “Alex” e “Jamie” em dois cliques. A partir daí, o resumo vem dos dois minutos iniciais, os quatro capítulos acima vêm da varredura em busca de mudanças de tópico e as duas citações vêm da busca no texto pelos momentos que você lembra. As notas do início ao fim do programa duram aproximadamente quinze minutos, a maior parte delas editadas por você mesmo, em vez de esperar ou transcrever.

Adicione legendas ou legendas

Se você publicar uma versão em vídeo do episódio em uma plataforma como um host de vídeo, Spotify Video ou LinkedIn, a exportação SRT será um arquivo de legenda cronometrado pronto para upload. Não há nenhuma etapa extra, porque a transcrição que você já gerou contém os dados de tempo. Para um fluxo de trabalho mais amplo de obtenção de legendas em um clipe, incluindo arquivos gravados versus arquivos secundários, consulte como adicionar legendas a um vídeo.

Se o seu ponto de partida for uma gravação de vídeo em vez de uma exportação de áudio, o processo é idêntico; o áudio é extraído primeiro no seu navegador. A página vídeo para texto cobre esse caminho na íntegra.

Episódios longos e com várias partes

Para um episódio de longa-metragem ou uma gravação ao vivo, o Hushscript faz uploads de até 10 horas de duração, sem limite de tamanho de arquivo. Um painel de quatro horas ou um episódio em formato de documentário passa como um único arquivo, em vez de ser dividido em pedaços, o que é importante por dois motivos. Os rótulos dos falantes permanecem consistentes em todo o arquivo, então você pode renomeá-los uma vez. E os carimbos de data e hora são contínuos, então um capítulo na marca de três horas diz [03:12:40] em vez de reiniciar do zero na parte dois.

Se você gravar uma série de várias partes em uma sessão, transcreva a sessão inteira como um único arquivo e depois divida as notas do episódio por parte. Cortar o áudio primeiro apenas multiplica o trabalho de renomeação.

Por que isso fica rápido

Para uma cadência de publicação regular, semanal ou duas vezes por semana, a rotina de transcrever para mostrar notas é compactada para minutos por episódio depois de fazer isso algumas vezes: descartar o arquivo, renomear os falantes, procurar capítulos, extrair citações, exportar. As etiquetas dos falantes fazendo a atribuição de graça é o que elimina a parte tediosa. Você gasta seu tempo no julgamento editorial que as notas realmente precisam, e não em descobrir quem disse o quê.

Fontes e normas independentes

O Hushscript consultou estas referências independentes e não concorrentes. Elas explicam pesquisas, normas ou o funcionamento de plataformas e não representam endosso do Hushscript.

Fontes revisadas em:

Perguntas frequentes

Como rotular o apresentador e cada convidado na transcrição?

O Hushscript separa os palestrantes automaticamente com rótulos como 'Falante A' e 'Falante B'. Após a transcrição, clique em qualquer rótulo no editor, digite o nome real e ele será atualizado em todos os lugares em que o palestrante aparecer. Um episódio para duas pessoas leva cerca de um minuto para ser renomeado; um painel com quatro vozes leva alguns minutos.

As etiquetas dos falantes têm um custo extra?

Não. As etiquetas de falante são incluídas gratuitamente em cada transcrição produzida pelo Hushscript, sem taxa por palestrante e sem limite para o número de vozes. Muitas ferramentas restringem isso a um nível superior; aqui faz parte da saída padrão.

Posso transcrever uma gravação de vídeo do podcast?

Sim. Se você tiver um arquivo de vídeo como MP4, MOV ou MKV, o áudio será extraído no seu navegador antes de qualquer upload, para que o vídeo permaneça no seu dispositivo. Somente o áudio extraído chega ao servidor, o que também evita que um arquivo de vídeo grande obstrua sua conexão.

Quanto tempo posso transcrever um episódio de uma só vez?

Até 10 horas por upload, sem limite de tamanho de arquivo. Um episódio de 60 minutos, um mergulho profundo de duas horas ou uma gravação ao vivo de quatro horas passam como um único arquivo, então você renomeia os falantes uma vez, em vez de juntar as partes.

Quais formatos de exportação o Hushscript produz?

TXT, SRT, VTT, CSV, TSV, Markdown, HTML, RTF, XML, JSON, DOCX, PDF e .husharchive protegido por senha, sem marca d'água. Para notas do episódio, DOCX oferece um documento formatado para edição direta. SRT fornece legendas cronometradas se você publicar uma versão em vídeo. JSON fornece dados em nível de expressão se você alimentar um host de podcast que aceita uploads de transcrições.

Preciso transcrever o episódio inteiro para escrever notas do episódio?

Para carimbos de data e hora precisos e citações literais, sim. Você pode esboçar notas aproximadas de memória, mas marcadores de capítulo, citações exatas e uma transcrição completa pesquisável vêm do texto completo. A visualização de 30 segundos mostra a qualidade antes de você se comprometer com o episódio completo.

A música de fundo ou um jingle de introdução confundirão a transcrição?

A música entre os segmentos geralmente é ignorada ou deixada sem transcrição, e um jingle curto sob uma voz raramente causa problemas. Se uma cama musical funciona sob fala contínua, a precisão nesse trecho pode diminuir. Gravar vozes limpas e adicionar música em seu editor depois fornece a melhor transcrição.

Quão precisa é a transcrição de um podcast claramente gravado?

Em uma gravação limpa de dois microfones com pouca interferência, o texto é preciso o suficiente para ser publicado após uma revisão rápida. A precisão depende principalmente da qualidade da gravação, dos sotaques e da frequência com que os convidados falam uns com os outros, e não do formato do arquivo que você carrega.

Comece com 30 minutos grátis

Começar – 30 minutos grátis