Ir para o conteúdo principal

Como transcrever uma gravação longa (mais de 2 horas)

Autor: Publicado em: Última revisão:

Uma gravação longa torna todos os limites visíveis: duração máxima, preparação do navegador, confiabilidade de upload, saldo de minutos e proteção de fila. Se você tiver uma entrevista de 3 horas, um workshop de meio dia ou uma reunião do conselho para transformar em texto, verifique esses limites antes do upload, e não depois de um trabalho fracassado.

O Hushscript leva uploads de até 10 horas cada, sem limite de tamanho de arquivo– arquivos grandes são preparados diretamente no seu navegador. Não há diária baseada em plano; um alto teto de segurança de 40 horas contínuas e 24 horas por dia e proteções de trabalho ativo protegem o serviço. Um arquivo longo não é um caso especial aqui; é o mesmo fluxo de trabalho de um clipe de dois minutos, apenas deixado para terminar sozinho.

O que você precisa antes de começar

Você precisa de três coisas e provavelmente já tem todas as três.

Uma observação rápida sobre os minutos grátis, porque gravações longas passam rapidamente por eles: você ganha 30 minutos grátis uma vez. A maneira mais rápida de desbloqueá-los é adicionar um cartão (uma retenção de $ 1 o valida e é liberada imediatamente, nunca cobrada), e os minutos chegam imediatamente. Se você preferir usar outro método de pagamento disponível em seu país, os 30 minutos chegam na sua primeira compra. Não é necessário cartão; é apenas o caminho mais rápido. Trinta minutos são suficientes para transcrever um pequeno segmento e julgar a precisão antes de enviar um pacote completo para um arquivo de três horas.

O que verificar antes de um upload longo

Quatro verificações evitam a maioria das surpresas:

Confirme esses limites antes de fazer upload. O Hushscript os declara aqui para que um trabalho longo possa ser planejado a partir da duração da fonte, em vez de descoberto por tentativa e erro.

Transcreva uma gravação longa, passo a passo

Não há modo de gravação longa para ativar. O processo é idêntico a um clipe curto; ele apenas dura mais tempo em segundo plano.

  1. Abra o conversor e solte seu arquivo. Vá para áudio para texto e arraste a gravação para a área de upload ou clique para navegar. Qualquer formato comum de áudio ou vídeo é aceito. Se for um vídeo, o áudio é extraído no seu navegador neste momento, para que o arquivo de vídeo pesado nunca saia da sua máquina.
  2. Verifique a visualização de 30 segundos. Antes de você se inscrever, o Hushscript prepara um clipe curto no seu navegador, envia esse clipe para transcrição e mostra a saída rotulada pelo locutor. A gravação completa permanece local nesta fase. Leia a prévia, confirme se os falantes estão divididos de maneira sensata e se as palavras estão corretas, e você saberá se o áudio está limpo o suficiente para a execução completa.
  3. Faça login para transcrever o resto. Se a visualização parecer correta, inscreva-se e o arquivo completo será carregado. É aqui que o saldo de minutos é importante: um arquivo de 150 minutos gasta 150 minutos. Certifique-se de que o pacote que você possui cobre a duração.
  4. Deixe o trabalho terminar sozinho. O tempo de processamento varia de acordo com o tamanho do arquivo e a carga do serviço, mas o trabalho é executado sem supervisão. Você não precisa manter a guia em foco; volte quando terminar.
  5. Renomeie os falantes. A transcrição chega com rótulos genéricos como Falante A e Falante B. No editor, renomeie Falante A para um nome real uma vez e ele será atualizado em todo o documento, para que uma entrevista de três horas seja lida com os nomes corretos.
  6. Exporte no formato que você precisa. Baixe em qualquer um dos 21 formatos (TXT, SRT, DOCX, PDF e formatos de legenda e editor-linha do tempo entre eles), além de um arquivo .husharchive protegido por senha, sem marca d’água em nenhum deles. SRT é o ideal para arquivos longos, porque seus carimbos de data e hora permitem que você vá direto para qualquer momento, em vez de rolar.

O resultado fica em seu painel com rótulos de falantes, carimbos de data e hora e o menu de exportação completo, e permanece lá para você voltar.

Um exemplo prático: uma entrevista gravada de 2,5 horas

Veja como isso fica com um formato de arquivo real. Digamos que você gravou uma entrevista de 2 horas e 30 minutos como um único MP3: duas pessoas, uma silenciosa e outra alta, gravada em uma chamada de vídeo.

Você coloca o MP3 na área de upload. A prévia de 30 segundos mostra dois falantes já separados na amostra de abertura. Você faz login; os uploads de arquivos de 150 minutos e o trabalho são iniciados. Quando concluído, o resultado é um documento contínuo com carimbos de data e hora em execução ininterrupta de 00:00:00 a 02:30:00.

A saída bruta é assim:

[00:00:04] Falante A: Obrigado por disponibilizar seu tempo. Podemos começar contando como o projeto começou?
[00:00:11] Falante B: Claro. Então tudo realmente começou no início de 2023, quando...

Você renomeia Falante A para entrevistador e Falante B para sujeito uma vez, e cada linha é atualizada. Em seguida, você exporta duas vezes: um TXT para colar em um resumidor para um resumo de primeira passagem e um SRT para que, ao escrever uma citação direta, você possa clicar no carimbo de data e hora e ouvir exatamente como foi dito. Custo total: 150 minutos fora do seu saldo, um upload, sem divisão, sem truncamento, sem segunda tentativa.

Manter os falantes rotulados durante uma sessão longa

A diarização em uma gravação de 3 horas é genuinamente mais difícil do que em um clipe de 10 minutos: as vozes flutuam, as pausas se estendem e o ruído de fundo vai e vem. O Hushscript executa a rotulagem em toda a transcrição de uma só vez, para que os rótulos permaneçam consistentes de ponta a ponta, mas a gravação em si pode ajudar ou prejudicar isso.

No momento da gravação:

Qualidade de áudio:

Depois que a transcrição estiver de volta, renomear Falante A com um nome real é uma edição única que se propaga por todo o documento. Para uma visão mais aprofundada de como a rotulagem em si funciona, consulte identificação do falante.

Dividir o arquivo ou enviá-lo inteiro?

A resposta curta para quase todos: enviá-lo inteiro. Dividir uma gravação longa em partes é o que deve ser evitado, não o que deve ser feito, e há apenas duas situações em que isso é necessário.

Fazer upload como um arquivo quando a gravação durar 10 horas ou menos, o que abrange a grande maioria das entrevistas, palestras, reuniões e painéis – não há limite de tamanho de arquivo para contornar. Um arquivo significa um conjunto contínuo de carimbos de data/hora e um conjunto consistente de rótulos de falante. A divisão quebra ambos: cada parte reinicia seu relógio em zero, e a mesma pessoa pode obter uma etiqueta diferente na parte dois e na parte um, deixando você costurar e remapear manualmente.

Os sistemas de fala ainda podem dividir áudios longos internamente. A pesquisa recente do IWSLT 2026 sobre processamento de fala de formato longo comparou várias estratégias de segmentação e descobriu que a escolha afetou a robustez. Essa é uma preocupação no nível do mecanismo, não uma razão para cortar sua fonte manualmente: manter um upload preserva uma transcrição contínua voltada para o usuário, enquanto o pipeline de processamento lida com seus próprios limites internos.

Divida somente quando a gravação tiver realmente mais de 10 horas, como uma gravação de conferência de vários dias. Nesse caso, corte um silêncio natural (uma pausa na sessão) em vez de no meio da frase, e anote o deslocamento para que você possa renumerar os carimbos de data e hora posteriormente. Se você estiver cortando um MP3 antes do upload, prefira uma taxa de bits constante (CBR) em vez de uma taxa de bits variável (VBR), pois a VBR pode introduzir desvios de sincronização em alguns editores.

Um arquivo de vídeo de vários gigabytes não é um problema. Como o Hushscript extrai o áudio no seu navegador antes do upload, o tamanho do vídeo de origem não é o tamanho do upload e não há limite para o tamanho do arquivo de origem. Apenas o fluxo de áudio muito menor viaja, desde que seu navegador e dispositivo possam prepará-lo.

Melhores configurações para precisão em áudio longo

O maior fator de precisão é a claridade da fala, não a taxa de amostragem ou formato de arquivo. Especificamente para sessões longas:

Solucionar problemas comuns de arquivos longos

A precisão cai na metade posterior da gravação. Isso quase sempre ocorre na queda dos níveis de áudio ou no aumento do ruído da sala no final de uma sessão longa, e não um limite de duração. Verifique a gravação original em torno dos carimbos de data e hora onde os erros se agrupam; se o nível cair, normalize e execute novamente, e use a visualização de 30 segundos em um segmento mais tarde para confirmar antes de gastar os minutos novamente.

Duas pessoas continuam sendo mescladas em um falante. Fala sobreposta e diafonia são a causa comum. Não há uma solução perfeita após o fato, mas uma gravação com mais separação entre vozes (uma faixa por canal ou microfones mais distantes) é agendada com muito mais clareza na próxima vez. Na transcrição que você tem agora, você pode corrigir erros ocasionais de rótulo manualmente no editor.

O upload de um arquivo grande é lento. A velocidade de upload é sua conexão, não a ferramenta. Para um vídeo de vários gigabytes, lembre-se de que o áudio é extraído localmente primeiro, portanto o upload real é muito menor que o arquivo no disco. Se você estiver em uma conexão fraca, um link com fio ou simplesmente deixá-lo funcionando irá chegar lá.

Ruído de fundo durante toda a gravação. Ruído constante (ar condicionado, tráfego, zumbido na sala) diminui a precisão em todo o arquivo. A normalização do volume leve geralmente ajuda mais do que a eliminação de ruído, que tende a prejudicar a fala. Se um segmento for gravemente afetado, os carimbos de data/hora ainda permitirão que você o encontre e ouça.

A transcrição parece ter terminado mais cedo. No Hushscript, uma transcrição cobre o arquivo completo; não há truncamento silencioso. Se o texto parecer curto, compare o carimbo de data/hora final com a duração real da gravação. Longos períodos de silêncio ou música simplesmente produzem poucas palavras, que podem ser lidas como “ausentes”, mas não estão.

Exporte uma transcrição longa: qual formato

Para uma sessão de várias horas, o formato escolhido altera a utilidade da transcrição.

Cada exportação está incluída em cada plano, sem marca d’água e sem taxa separada para desbloquear legendas.


Para gravações longas cobradas por minuto, a transcrição pré-paga evita um plano mensal recorrente. Você paga pelas horas que transcreve, com um teto alto de segurança e controles de trabalho ativo para lotes excepcionalmente pesados. Os dois trabalhos mais comuns de gravação longa têm seus próprios tutoriais: como transcrever um podcast cobre episódios com vários convidados e notas de programa, e como transcrever uma palestra cobre peculiaridades do áudio da sala de aula, como reverberação e perguntas do público do outro lado da sala. E se o seu material for uma pilha de arquivos separados em vez de uma gravação longa, transcrever uma pasta de gravações abrange executá-las em lote.

Fontes e normas independentes

O Hushscript consultou estas referências independentes e não concorrentes. Elas explicam pesquisas, normas ou o funcionamento de plataformas e não representam endosso do Hushscript.

Fontes revisadas em:

Perguntas frequentes

Existe um limite de tamanho de arquivo para gravações longas?

Não. As gravações podem durar até 10 horas, sem limite de tamanho de arquivo – arquivos grandes são preparados diretamente no seu navegador. Não há subsídio diário ou mensal baseado em plano, mas se aplicam um teto de segurança elevado de 40 horas contínuas e 24 horas e salvaguardas de trabalho ativo.

Tenho que dividir uma gravação longa em partes?

Não. Um arquivo de 3 ou 8 horas é enviado como um upload e retorna como uma transcrição com carimbos de data/hora contínuos. Você só precisará dividir se a gravação durar mais de 10 horas.

Os rótulos dos falantes permanecerão consistentes durante uma gravação de 3 horas?

Sim. A diarização do locutor percorre toda a transcrição de uma só vez, não pedaço por pedaço, para que cada pessoa mantenha o mesmo rótulo do primeiro ao último minuto.

Posso enviar um arquivo de vídeo longo em vez de áudio?

Sim. O áudio é extraído do vídeo no seu navegador antes de qualquer coisa ser enviada, então apenas o áudio chega ao servidor. O vídeo original nunca é carregado, o que geralmente transforma uma captura de palestra de vários gigabytes em um upload de áudio muito menor.

Quanto tempo leva para transcrever um arquivo longo?

O tempo de processamento varia de acordo com a duração da gravação e a carga do serviço. Tarefas longas são executadas sem supervisão, então você pode sair da página e retornar quando a transcrição for concluída.

Quais formatos de exportação funcionam melhor para uma transcrição longa?

TXT para alimentar outras ferramentas, SRT para saltar para um carimbo de data/hora, DOCX para compartilhamento e anotação e JSON para os dados brutos de falante e tempo. Todos os formatos de exportação estão incluídos sem marca d'água.

Meus minutos expiram se eu transcrever apenas ocasionalmente?

Os minutos expiram após 180 dias sem uma transcrição concluída ou compra de minutos. Qualquer uma das atividades redefine a janela e nós lhe enviaremos um e-mail antes de expirar.

Comece com 30 minutos grátis

Começar – 30 minutos grátis