É seguro fazer upload de áudio para transcrição?
Autor: Hushscript Publicado em: Última revisão:
O upload de áudio para transcrição pode ser razoável quando a ferramenta, a gravação e as regras aplicáveis estão alinhadas. A transcrição em si é apenas uma parte do risco. O que importa é o que acontece quando o arquivo sai do seu dispositivo: onde está armazenado, quanto tempo permanece lá, quem mais o processa e se ele pode ser usado para treinamento de modelo. As políticas variam muito, então a questão de segurança é na verdade uma questão sobre o serviço específico em que você está prestes a confiar.
Esta postagem aborda o que realmente acontece com um arquivo que você carrega, as quatro perguntas que vale a pena fazer a qualquer ferramenta de transcrição, como o Hushscript mantém a exposição pequena e os sinais de alerta que devem fazer você fechar a guia. É um explicador, não um discurso de vendas. As perguntas se aplicam a todas as ferramentas, inclusive aquelas que não são as nossas.
O que realmente acontece com seu áudio
Quando você envia um arquivo, ele não vai para um lugar e volta direto. Ele transita por vários sistemas, e a questão da privacidade é o que cada um faz com ele.
Armazenamento. Um serviço de upload pode gravar seu arquivo no armazenamento de objetos na nuvem antes que o mecanismo de fala o veja. Esse armazenamento tem uma política de retenção, quer a página de marketing o indique claramente ou não. Os princípios do GDPR da Comissão Europeia determinam que os dados pessoais devem ser armazenados pelo menor tempo possível e revisados de acordo com os limites de eliminação definidos. Solicite a janela de retenção real em vez de inferi-la a partir de uma lista de recursos.
Processamento. O áudio pode passar por um ou mais sistemas executando reconhecimento de fala, separação de falantes e limpeza. Um serviço pode usar seu próprio mecanismo ou processador, portanto, verifique os subprocessadores nomeados e seus termos de retenção em vez de presumir que a empresa na página de upload é a única parte envolvida.
Dados de treinamento. Os modelos de fala melhoram com o treinamento em áudio real, e gravações reais de clientes são um valioso combustível de treinamento. Alguns serviços reservam-se o direito de utilizar os seus carregamentos para “melhoria do produto” nos seus termos. Esta raramente é uma caixa de aceitação clara no momento do upload. Geralmente está oculto nos termos de serviço ou ativado por padrão com uma opção de exclusão que você precisa procurar.
Registros. Mesmo as ferramentas que excluem o áudio geralmente mantêm metadados: quando você fez o upload, o tamanho do arquivo, qual idioma foi detectado, quantos falantes. Esses metadados apresentam um risco muito menor do que o áudio em si, mas vale a pena saber que geralmente sobrevivem à gravação.
A conclusão não é que tudo isso seja sinistro. É que “carregar áudio, receber texto de volta” esconde quatro ou cinco decisões separadas, e uma ferramenta que é cuidadosa com todas elas parece muito diferente de outra que não o é.
As quatro perguntas a serem feitas a qualquer ferramenta de transcrição
Você não precisa ler todo o blog de engenharia de uma empresa para julgar uma ferramenta. Quatro perguntas cobrem a maior parte do risco, e um serviço que considera suas práticas de dados pode responder a todas as quatro claramente.
Quando o áudio é excluído?
A resposta que você deseja é “imediatamente após a transcrição estar pronta”, não “dentro de 30, 60 ou 90 dias” e não “quando você excluir sua conta”. A exclusão que exige que você tome uma ação significa que o áudio persiste por padrão e os padrões são o que realmente acontece. Uma janela de retenção fixa de semanas ou meses significa que há uma cópia da sua gravação em um servidor durante todo esse tempo, disponível para qualquer pessoa que possa acessar o intervalo.
O mecanismo de fala mantém uma cópia?
Se o serviço usar uma API de fala de terceiros, seu áudio também passará por esse fornecedor. “Não armazenamos seu áudio” da empresa com a qual você se inscreveu não é o mesmo que o mecanismo subjacente que não o armazena. Pergunte se o provedor de voz também exclui imediatamente ou se retém o áudio de acordo com sua própria política separada. Este é o passo que a maioria das pessoas não percebe, porque é invisível do lado de fora.
O áudio é usado para treinamento?
A política de privacidade é o documento vinculativo, não a página de destino. Procure linguagem específica sobre se as gravações são usadas para treinamento de modelo, ajuste fino ou avaliação. Se a política disser algo vago como “melhorar e desenvolver os nossos serviços”, assuma que isso inclui formação até que seja dito o contrário. A ambigüidade em uma política de privacidade tende a ser resolvida a favor da empresa, não a seu favor.
O que é armazenado e está criptografado?
Mesmo com o áudio excluído, a transcrição geralmente permanece. Foi para isso que você veio. A transcrição de uma conversa confidencial é sensível por si só. Pergunte se as transcrições armazenadas são criptografadas em repouso, para que uma violação de armazenamento exponha um texto cifrado ilegível em vez de um arquivo pesquisável de tudo o que alguém já transcreveu.
Estas não são perguntas pegajosas. Uma ferramenta que responde a todas as quatro perguntas merece uma análise mais detalhada. Uma ferramenta que os evita também lhe disse algo.
Como o Hushscript mantém a exposição pequena
O princípio de design por trás do Hushscript é o contato mínimo: seu áudio deve passar o mínimo de tempo possível em qualquer servidor fora do seu próprio dispositivo, e o que for armazenado deve ser ilegível se vazar. Essa é a questão da privacidade, e vale a pena ser concreto sobre como ela funciona.
Seu vídeo nunca é enviado. Se você soltar um arquivo de vídeo, o Hushscript prepara sua trilha de áudio no seu navegador antes de qualquer coisa ser enviada. Uma faixa compatível é copiada sem recodificação; a conversão é executada localmente apenas quando a faixa precisa dela. O que chega ao serviço de transcrição é um upload apenas de áudio com os dados de vídeo deixados para trás. O vídeo permanece no seu dispositivo do início ao fim.
O áudio é excluído no momento em que a transcrição fica pronta. Não há período de carência de 30 dias, nem intervalo de backup, nem camada de armazenamento frio. A exclusão é automática na conclusão. Não é algo que você solicita e não depende de você se lembrar de fazê-lo. O áudio está em um estado de processamento transitório desde o upload até a transcrição e depois desaparece.
O mecanismo de fala não retém nada. O mecanismo que faz a transcrição não mantém seu áudio para treinamento, avaliação ou depuração. Ele processa o arquivo e o descarta. Isso responde à pergunta do subprocessador diretamente para o Hushscript, em vez de deixá-la implícita em uma solicitação de exclusão no nível do aplicativo.
Suas transcrições são criptografadas em repouso. A transcrição que chega ao seu painel é criptografada no local onde está armazenada. Se nosso armazenamento vazasse, o que um invasor obteria seria um texto cifrado ilegível, e não um arquivo legível de suas palavras. Para ser mais preciso sobre o limite dessa afirmação: trata-se de proteção contra vazamentos, e não de conhecimento zero. A chave é mantida em nossos servidores para que o aplicativo possa descriptografar e mostrar sua própria transcrição, por isso não estamos afirmando que não podemos lê-la. Afirmamos que um banco de dados roubado seria inútil sem a chave, que é a ameaça que a criptografia em repouso realmente pretende resolver.
Sobre certificações. O Hushscript não possui SOC 2 ou outra certificação formal de conformidade. A abordagem é manter a superfície exposta pequena em primeiro lugar (extrair áudio no navegador, excluí-lo ao concluir, criptografar o que está armazenado) em vez de construir um grande armazenamento de gravações e depois certificar os controles em torno dele. Se um certificado de conformidade for um requisito difícil para o seu trabalho, esse é um motivo justo para escolher um fornecedor certificado; é melhor saber disso antecipadamente do que presumi-lo.
O efeito líquido é uma pequena pegada de dados. Seu áudio existe em nossa infraestrutura apenas durante o período de transcrição. Antes disso, está no seu dispositivo. Depois disso, em lugar nenhum, e a transcrição que resta é um texto cifrado em repouso. Você pode ver o fluxo completo na página de como funciona, e na página de transcrição privada entra nas especificações de tratamento de dados.
Um exemplo prático: uma entrevista confidencial
Digamos que você é um jornalista com uma entrevista gravada de 50 minutos, em MP4, porque você a filmou em um telefone. A fonte pediu para permanecer anônima. Veja o que acontece, passo a passo, e onde as garantias de privacidade realmente afetam.
- Você coloca o MP4 na visualização. Ainda não há conta. A página lê o arquivo no seu navegador e prepara o áudio localmente. O vídeo de 1,8 GB nunca sai do seu laptop; apenas um upload somente de áudio é preparado para a próxima etapa.
- Uma visualização de 30 segundos rotulada pelo orador aparece. Você vê a troca de abertura já dividida em “Falante 1” e “Falante 2”, então você pode confirmar se a diarização é sensata antes de confirmar. Esta visualização é a única etapa genuinamente sem conta.
- Você se inscreve para transcrever o resto. A transcrição é bloqueada, por isso precisa de uma conta. Novas contas recebem 30 minutos grátis para testar: instantaneamente quando você valida um cartão com retenção de US$ 1 que é autorizado e liberado imediatamente, nunca cobrado, ou em sua primeira compra se você usar um método de pagamento disponível em seu país. Uma entrevista de 50 minutos ultrapassa os 30 gratuitos, então você recarrega; a página de preços tem o custo por minuto.
- O áudio completo é transcrito e depois excluído. O arquivo de áudio é processado e removido no momento em que sua transcrição fica pronta. Não há nenhuma cópia da voz da sua fonte em um servidor.
- Você renomeia e exporta. Você renomeia “Falante 1” para o entrevistador e “Falante 2” para o pseudônimo da fonte, depois exporta para DOCX para o editor e mantém um TXT para suas anotações. A transcrição fica em seu painel, criptografada em repouso, até que você a exclua.
O objetivo do exemplo: em nenhum momento o vídeo bruto está em um servidor, o áudio sobrevive à transcrição ou a transcrição armazenada pode ser lida por qualquer pessoa que viola o armazenamento sem a chave. Essa é a diferença entre “transcrevemos seu arquivo” e “mantemos a voz gravada de sua fonte indefinidamente.”
Preocupações comuns, respondidas
Algumas situações surgem com frequência suficiente para serem abordadas diretamente.
“Meu arquivo é enorme: isso significa um upload longo e arriscado?” Um vídeo grande é preparado localmente primeiro, porque o vídeo permanece ligado? seu dispositivo e apenas o áudio é enviado. As faixas compatíveis são copiadas sem recodificação, enquanto a conversão é reservada para arquivos que precisam dela. Não há limite de tamanho de arquivo – até mesmo um vídeo muito grande é preparado diretamente no seu navegador, desde que a gravação ocorra dentro de 10 horas.
“E se a transcrição tiver coisas que eu não quero que sejam armazenadas?” Use o modo privado apenas para reconhecimento de fala e um resultado de arquivo protegido por senha, sem salvar a transcrição em sua conta. Para transcrições normais, exporte o que você precisa e exclua a transcrição quando não precisar mais dela.
“Eu só tenho um arquivo de áudio, sem vídeo. A extração do navegador ainda é importante?” Para um arquivo de áudio simples, não há vídeo para reter, então a proteção específica não se aplica. Os que ainda o fazem são os grandes para trabalhos sensíveis: o áudio é excluído após a transcrição, o mecanismo não guarda nada e a transcrição é criptografada em repouso.
“Uma ferramenta gratuita é automaticamente menos segura?” Não automaticamente. Mas se uma ferramenta é totalmente gratuita e não há nenhuma maneira óbvia de gerar dinheiro, vale a pena perguntar o que está sendo monetizado. Às vezes, a resposta são os dados com os quais você está contribuindo. Uma ferramenta paga ou pré-paga tem pelo menos um modelo de financiamento que não depende da mineração de seus uploads.
Arquivo armazenado versus transcrição e exclusão
Existem dois modelos honestos para uma ferramenta de transcrição, e qual deles se adapta depende do que você está transcrevendo.
Uma ferramenta de arquivo armazenado mantém seu áudio e transcrições em uma biblioteca pesquisável à qual você pode retornar meses depois. Isso é realmente útil se você estiver construindo uma base de conhecimento pessoal de suas próprias gravações e o conteúdo não for confidencial, como um podcaster arquivando seus próprios episódios. O custo é que uma pilha crescente de suas gravações fica no servidor de outra pessoa.
Uma ferramenta de transcrever e excluir, como o Hushscript, trata a transcrição como a entrega e o áudio como um meio de obtê-la. O áudio é excluído após a conclusão e a transcrição é sua para exportar e remover. Esse é o modelo certo quando a gravação é confidencial e você já possui sua própria cópia do arquivo de origem, pois não há razão para a ferramenta manter uma também.
Nenhum dos dois está errado. Mas para gravações legais, entrevistas, anotações de terapia ou qualquer coisa com fonte anônima, o segundo modelo remove uma responsabilidade que o primeiro acumula ao longo do tempo.
Sinais de alerta a serem observados
Quando você está avaliando qualquer ferramenta, vale a pena tratar alguns sinais como avisos.
Linguagem de retenção vaga.“Armazenamos seus arquivos por um período razoável período” ou “arquivos podem ser retidos para melhorar nossos serviços” não são compromissos. “Razoável” pode significar qualquer coisa, e “melhorar nossos serviços” frequentemente abrange treinamento.
Cláusulas de treinamento ocultas nos termos. Verifique a seção “Uso aceitável”, “Conteúdo” ou “Licença” dos termos de serviço, não apenas a política de privacidade. Algumas ferramentas concedem a si mesmas uma ampla licença para usar o conteúdo enviado da maneira que desejarem, o que pode incluir discretamente o treinamento de um modelo sobre ele.
Nenhuma resposta clara a uma pergunta direta. Se o suporte não puder dizer claramente quando o áudio é excluído ou se as gravações são usadas para treinamento, esse silêncio é a resposta.
Gratuita, sem modelo de financiamento visível. Se uma ferramenta for totalmente gratuita e a economia não for óbvio, considere se o produto que está sendo vendido são os dados que você está entregando.
Armazenamento indefinido combinado com uma exportação com acesso pago. Uma ferramenta que armazena seu áudio para sempre, mas cobra pela exportação da transcrição, foi projetada para mantê-lo dependente de seu armazenamento, e não para entregar a você o controle de seu próprio conteúdo.
Para entrevistas, gravações legais, ou qualquer áudio cujo conteúdo seja sensível, a questão que importa não é se a transcrição é precisa – mas se o áudio que a produziu permanece seu. A página de transcrição privada mostra como a abordagem do Hushscript se compara ao padrão.
E se você quiser a mecânica de exclusão especificamente (quando isso acontece, o que conta como “excluído” e por que tornamos isso o padrão), por que excluímos seu áudio após a transcrição aborda isso em detalhes.
Fontes e normas independentes
O Hushscript consultou estas referências independentes e não concorrentes. Elas explicam pesquisas, normas ou o funcionamento de plataformas e não representam endosso do Hushscript.
Fontes revisadas em: