Vocabulário personalizado: ensine seus termos ao transcritor
Autor: Hushscript Publicado em: Última revisão:
Um mecanismo de fala de uso geral tem menos contexto para um codinome de produto, um sobrenome regional ou um acrônimo interno que sua equipe usa dez vezes por reunião. A pesquisa chama a técnica de direcionar o reconhecimento para termos esperados de viés contextual, e uma sessão de Web Speech do W3C 2025 a descreveu como um recurso disponível no Chrome. O Hushscript transforma essa ideia em quatro controles de vocabulário, que vão desde uma adição única para um arquivo até uma configuração permanente que você pode reutilizar.
Onde o vocabulário personalizado mais ajuda
Três categorias fazem com que a maior parte do reconhecimento perca um modelo de uso geral. Os nomes das pessoas são os primeiros, especialmente as grafias que não são a variante mais comum. Um modelo não tem como adivinhar se o áudio dizia “Nguyen” ou quase homófono, a menos que algo diga que o nome está em jogo. Os nomes de produtos e marcas são os segundos: um nome como “FlowBridge” é ouvido como as duas palavras comuns que soa, e não como o nome próprio que uma empresa específica escolheu. O jargão interno e as siglas são o terceiro: termos que significam apenas algo dentro de uma equipe ou setor, que nenhum vocabulário geral jamais conteria. Os nomes de medicamentos e procedimentos de uma prática clínica são o mesmo problema em uma escala maior, que a transcrição médica trata com um modo dedicado junto com essas ferramentas de vocabulário. Uma sigla repetida dez vezes em uma reunião ou transcreve dez vezes errado ou dez vezes certo; não há crédito parcial, então corrigi-lo uma vez em uma lista de termos-chave ou dicionário corrige todas as ocorrências nesse arquivo automaticamente.
Para um único arquivo: termos-chave e um prompt personalizado
Se você estiver transcrevendo uma gravação incomum e não precisar de uma configuração permanente, adicione termos-chave diretamente a esse trabalho. Até 1.000 termos-chave (nomes, marcas, siglas) direcionam o reconhecimento para as palavras que você realmente disse, apenas para aquele arquivo. Junto com eles, um prompt personalizado de até 2.000 caracteres fornece ao mecanismo o contexto que o áudio sozinho não consegue: quem está falando, o que a gravação cobre, termos específicos para a situação. Ambos desaparecem após o trabalho; nada é transferido para o próximo arquivo, a menos que você o adicione novamente.
Para trabalhos recorrentes: dicionários salvos e predefinições de prompt
Se os mesmos nomes e jargões aparecerem arquivo após arquivo, uma lista única deixa de valer a pena redigitar. Um dicionário salvo resolve isso: importe termos em massa de um arquivo CSV ou TSV, organize-os em categorias e anexe variantes ortográficas a cada termo canônico para que “McAllister” seja reconhecido independentemente de o áudio de origem soar como “MacAlister” ou “McAllaster”. As predefinições de prompt funcionam da mesma maneira para o contexto, salvando o plano de fundo que você redigitaria todas as vezes. Marque um dicionário ou uma predefinição como padrão e ele será pré-selecionado automaticamente na próxima vez que você transcrever, para que uma configuração permanente não precise ser selecionada novamente em todos os arquivos.
Eles se combinam, não se substituem
Um dicionário permanente e uma adição única não são uma escolha entre duas opções; eles se candidatam ao mesmo emprego juntos. Mantenha um dicionário padrão com os nomes dos produtos da sua equipe e um prompt padrão descrevendo o que geralmente são suas gravações e, em seguida, adicione um termo-chave único para o nome de um convidado que seja relevante apenas para o arquivo desta semana. A configuração permanente cobre o vocabulário recorrente; a adição única cobre o que é específico desta gravação. Nenhum deles precisa levar em conta o que o outro já trata.
O que ele não toca
O vocabulário personalizado em qualquer uma de suas quatro formas molda o que o mecanismo ouve enquanto está transcrevendo e não configura o trabalho posterior do Insights. Os Insights são executados na transcrição resultante. Acertar o vocabulário antecipadamente pode, portanto, melhorar o texto fonte que o Insights lê, sem alterar o que o Insights gera.
Um exemplo prático
Um podcast semanal entrevista um convidado diferente a cada episódio, mas sempre cobre as mesmas três linhas de produtos por nome. O apresentador cria um dicionário salvo uma vez, importado de uma planilha com nomes de produtos e nomes da própria equipe, escrito da maneira que o programa realmente os diz e marca-o como padrão. O episódio de cada semana é beneficiado automaticamente. Para o convidado daquela semana, um nome que o dicionário permanente não tem motivos para saber, o anfitrião adiciona um termo-chave antes de fazer o upload, específico para aquele arquivo. O dicionário permanente e o termo-chave único se aplicam à mesma transcrição, e nenhum deles exige tocar o outro.
Onde configurá-lo
As opções de vocabulário ficam junto com outras configurações por arquivo em áudio para texto, quer você esteja adicionando um termo-chave único a um único upload ou gerenciando um dicionário salvo para trabalho recorrente. Eles funcionam da mesma maneira, independentemente de qual dos cerca de 99 idiomas o Hushscript detecta automaticamente na gravação, e a página de idiomas tem a lista completa, junto com quais deles obtêm precisão de nível superior. Para saber mais sobre como fazer a transcrição antes de se preocupar com o vocabulário, consulte como transcrever um podcast para o fluxo de trabalho de convidados recorrentes que este exemplo segue.
Fontes e normas independentes
O Hushscript consultou estas referências independentes e não concorrentes. Elas explicam pesquisas, normas ou o funcionamento de plataformas e não representam endosso do Hushscript.
Fontes revisadas em: