Saltar al contenido principal

¿Es seguro cargar audio para transcripción?

Autor: Publicado: Última revisión:

Cargar audio para transcripción puede ser razonable cuando la herramienta, la grabación y las reglas aplicables se alinean. La transcripción en sí es sólo una parte del riesgo. Lo que importa es qué sucede una vez que el archivo sale de su dispositivo: dónde se almacena, cuánto tiempo permanece allí, quién más lo procesa y si se puede utilizar para el entrenamiento de modelos. Las políticas varían ampliamente, por lo que la pregunta de seguridad es en realidad una pregunta sobre el servicio específico en el que está a punto de confiar.

Esta publicación analiza lo que realmente sucede con un archivo que usted carga, las cuatro preguntas que vale la pena hacerle a cualquier herramienta de transcripción, cómo Hushscript mantiene la exposición pequeña y las señales de alerta que deberían hacerle cerrar la pestaña. Es una explicación, no un argumento de venta. Las preguntas se aplican a todas las herramientas, incluidas las que no somos nosotros.

Qué sucede realmente con tu audio

Cuando subes un archivo, no va a un lugar y regresa directamente. Se mueve por varios sistemas y la cuestión de la privacidad es qué hace cada uno con él.

Almacenamiento. Un servicio de carga puede escribir su archivo en el almacenamiento de objetos en la nube antes de que el motor de voz lo vea. Ese almacenamiento tiene una política de retención, ya sea que la página de marketing lo indique claramente o no. Los principios del RGPD de la Comisión Europea establecen que los datos personales deben almacenarse durante el menor tiempo posible y revisarse según los límites de eliminación definidos. Solicite la ventana de retención real en lugar de inferirla de una lista de funciones.

Procesamiento. El audio puede pasar a través de uno o más sistemas que ejecutan reconocimiento de voz, separación de hablantes y limpieza. Un servicio puede utilizar su propio motor o procesador, así que verifique los subprocesadores nombrados y sus términos de retención en lugar de asumir que la empresa en la página de carga es la única parte involucrada.

Datos de capacitación. Los modelos de habla mejoran al entrenarse con audio real, y las grabaciones reales de los clientes son un combustible valioso para la capacitación. Algunos servicios se reservan el derecho de utilizar sus cargas para “mejorar el producto” en sus términos. Rara vez se trata de una casilla de suscripción clara en el momento de la carga. Por lo general, está oculto en los términos de servicio o está activado de forma predeterminada con una opción de exclusión que debes buscar.

Registros. Incluso las herramientas que eliminan el audio a menudo conservan metadatos: cuándo lo subiste, cuánto duraba el archivo, qué idioma se detectó y cuántos hablantes. Esos metadatos tienen un riesgo mucho menor que el audio en sí, pero vale la pena saber que generalmente sobreviven a la grabación.

La conclusión no es que todo esto sea siniestro. Es que “cargar audio, recuperar texto” oculta cuatro o cinco decisiones separadas, y una herramienta que es cuidadosa con todas ellas se ve muy diferente de una que no lo es.

Las cuatro preguntas que debe hacerle a cualquier herramienta de transcripción

No es necesario leer el blog de ingeniería completo de una empresa para juzgar una herramienta. Cuatro preguntas cubren la mayor parte del riesgo, y un servicio que analiza sus datos puede responderlas claramente.

¿Cuándo se elimina el audio?

La respuesta que desea es “inmediatamente después de que la transcripción esté lista”, no “dentro de 30, 60 o 90 días” ni “cuando elimine su cuenta”. La eliminación que requiere que usted tome medidas significa que el audio persiste de forma predeterminada, y los valores predeterminados son lo que realmente sucede. Una ventana de retención fija de semanas o meses significa que hay una copia de su grabación en un servidor durante todo ese tiempo, disponible para cualquiera que pueda alcanzar el depósito.

¿El motor de voz guarda una copia?

Si el servicio utiliza una API de voz de terceros, su audio también pasa a través de ese proveedor. “No almacenamos su audio” de la empresa con la que se registró no es lo mismo que el motor subyacente que no lo almacena. Pregunte si el proveedor de voz también elimina inmediatamente o si conserva el audio según su propia política independiente. Este es el paso que la mayoría de la gente pasa por alto porque es invisible desde el exterior.

¿Se utiliza el audio para la capacitación?

La política de privacidad es el documento vinculante, no la página de inicio. Busque lenguaje específico sobre si las grabaciones se utilizan para el entrenamiento, ajuste o evaluación del modelo. Si la política dice algo vago como “mejorar y desarrollar nuestros servicios”, suponga que eso incluye capacitación hasta que diga lo contrario. La ambigüedad en una política de privacidad tiende a resolverse a favor de la empresa, no del suyo.

¿Qué se almacena y está cifrado?

Incluso si se elimina el audio, la transcripción generalmente permanece. Para eso viniste. La transcripción de una conversación confidencial es sensible por derecho propio. Pregunte si las transcripciones almacenadas están cifradas en reposo, de modo que una violación del almacenamiento expondría texto cifrado ilegible en lugar de un archivo con capacidad de búsqueda de todo lo que alguien haya transcrito.

Estas no son preguntas que te entiendan. Una herramienta que responde claramente a las cuatro preguntas merece una mirada más cercana. Una herramienta que los esquiva también te ha dicho algo.

Cómo Hushscript mantiene pequeña la exposición

El principio de diseño detrás de Hushscript es el contacto mínimo: tu audio debe pasar el menor tiempo posible en cualquier servidor fuera de tu propio dispositivo, y lo que se almacena debe ser ilegible si alguna vez se filtra. Ésa es la brecha de privacidad, y vale la pena ser concreto acerca de cómo funciona.

Tu video nunca se carga. Si sueltas un archivo de video, Hushscript prepara su pista de audio en tu navegador antes de enviar algo. Una pista compatible se copia sin volver a codificarla; La conversión se ejecuta localmente sólo cuando la pista lo necesita. Lo que llega al servicio de transcripción es una carga de solo audio con los datos del video dejados. El vídeo en sí permanece en su dispositivo de principio a fin.

El audio se elimina en el momento en que la transcripción está lista. No hay un período de gracia de 30 días, ni un depósito de respaldo, ni un nivel de almacenamiento en frío. La eliminación es automática al finalizar. No es algo que usted solicite y no depende de que lo recuerde. El audio se encuentra en un estado de procesamiento transitorio desde la carga hasta la transcripción y luego desaparece.

El motor de voz no retiene nada. El motor que realiza la transcripción no conserva el audio para entrenamiento, evaluación o depuración. Procesa el archivo y lo descarta. Esto responde a la pregunta del subprocesador directamente para Hushscript en lugar de dejarla implícita en un reclamo de eliminación a nivel de aplicación.

Sus transcripciones están cifradas en reposo. La transcripción que llega a su panel está cifrada donde se almacena. Si alguna vez se filtrara nuestro almacenamiento, lo que un atacante obtendría es un texto cifrado ilegible, no un archivo legible de sus palabras. Para ser precisos sobre el límite de esa afirmación: se trata de protección contra fugas, no de conocimiento cero. La clave se guarda en nuestros servidores para que la aplicación pueda descifrarla y mostrarle su propia transcripción, por lo que no afirmamos que no podamos leerla. Afirmamos que una base de datos robada sería inútil sin la clave, que es la amenaza que el cifrado en reposo en realidad pretende abordar.

Acerca de las certificaciones. Hushscript no posee SOC 2 ni ninguna otra certificación de cumplimiento formal. El enfoque es, en primer lugar, mantener pequeña la superficie expuesta (extraer audio en el navegador, eliminarlo al finalizar, cifrar lo que está almacenado) en lugar de crear un gran almacén de grabaciones y luego certificar los controles a su alrededor. Si un certificado de cumplimiento es un requisito estricto para su trabajo, esa es una razón justa para elegir un proveedor certificado; es mejor saberlo desde el principio que asumirlo.

El efecto neto es una huella de datos corta. Su audio existe en nuestra infraestructura solo durante la ventana de transcripción. Antes de eso, está en tu dispositivo. Después de eso, a ninguna parte, y la transcripción que queda es texto cifrado en reposo. Puede ver el flujo completo en la página de cómo funciona, y la página de transcripción privada aborda los detalles específicos del manejo de datos.

Un ejemplo práctico: una entrevista confidencial

Supongamos que es un periodista con una entrevista grabada de 50 minutos, en MP4 porque Lo filmé en un teléfono. La fuente pidió permanecer en el anonimato. Esto es lo que sucede, paso a paso, y dónde realmente afectan las garantías de privacidad.

  1. Sueltas el MP4 en la vista previa. Aún no tienes cuenta. La página lee el archivo en su navegador y prepara el audio localmente. El vídeo de 1,8 GB nunca sale de su computadora portátil; solo se prepara una carga de solo audio para el siguiente paso.
  2. Aparece una vista previa de 30 segundos con la etiqueta del hablante. Verá que el intercambio de apertura ya está dividido en “Hablante 1” y “Hablante 2”, por lo que puede confirmar que la diarización es sensata antes de comprometerse. Esta vista previa es el único paso que realmente no requiere una cuenta.
  3. Te registras para transcribir el resto. La transcripción está cerrada, por lo que necesita una cuenta. Las cuentas nuevas obtienen 30 minutos gratis para probar: instantáneamente cuando validas una tarjeta con una retención de $1 que se autoriza y luego se libera de inmediato, nunca se cobra, o con tu primera compra si usas un método de pago disponible en tu país. Una entrevista de 50 minutos supera los 30 gratuitos, por lo que deberías recargar; la página de precios tiene el costo por minuto.
  4. El audio completo se transcribe y luego se elimina. El archivo de audio se procesa y elimina en el momento en que la transcripción está lista. No queda ninguna copia de la voz de su fuente en un servidor.
  5. Reetiqueta y exporta. Cambia el nombre de “Hablante 1” al entrevistador y “Hablante 2” al seudónimo de la fuente, luego exporta a DOCX para el editor y guarda un TXT para tus notas. La transcripción permanece en su panel, cifrada en reposo, hasta que la elimina.

El punto del ejemplo: en ningún momento el video sin procesar está en un servidor, el audio sobrevive a la transcripción o la transcripción almacenada es legible por cualquiera que infrinja el almacenamiento sin la clave. Esa es la diferencia entre “transcribimos su archivo” y “mantuvimos la voz grabada de su fuente indefinidamente”.

Preocupaciones comunes, respondidas

Algunas situaciones surgen con suficiente frecuencia como para abordarlas directamente.

“Mi archivo es enorme: ¿eso significa una carga larga y riesgosa?” Un video grande se prepara localmente primero, porque el El video permanece en su dispositivo y solo se envía su audio. Las pistas compatibles se copian sin volver a codificarlas, mientras que la conversión se reserva para los archivos que la necesitan. No hay límite de tamaño de archivo: incluso un video muy grande se prepara directamente en su navegador, siempre y cuando la grabación se realice dentro de las 10 horas.

“¿Qué pasa si la transcripción tiene cosas que no quiero almacenar en absoluto?” Utilice el modo privado solo para reconocimiento de voz y un resultado de archivo protegido con contraseña sin guardar la transcripción en su cuenta. Para transcripciones normales, exporte lo que necesita y elimine la transcripción cuando ya no la necesite.

“Solo tengo un archivo de audio, no video. ¿Aún importa la extracción del navegador?” Para un archivo de audio simple no hay video que retener, por lo que no se aplica la protección específica. Los que todavía lo hacen son los más importantes para trabajos delicados: el audio se elimina después de la transcripción, el motor no guarda nada y la transcripción se cifra en reposo.

“¿Es una herramienta gratuita automáticamente menos segura?” No automáticamente. Pero si una herramienta es completamente gratuita y no hay una forma obvia de generar dinero, vale la pena preguntarse qué se monetiza. A veces la respuesta son los datos que estás aportando. Una herramienta paga o de pago por uso al menos tiene un modelo de financiación que no depende de la extracción de tus cargas.

Archivo almacenado versus transcripción y eliminación

Hay dos modelos honestos para una herramienta de transcripción, y cuál se adapta depende de lo que estás transcribiendo.

A La herramienta de archivo almacenado mantiene su audio y transcripciones en una biblioteca con capacidad de búsqueda a la que puede volver meses después. Esto es realmente útil si estás creando una base de conocimiento personal de tus propias grabaciones y el contenido no es sensible, como un podcaster que archiva sus propios episodios. El costo es que una pila cada vez mayor de tus grabaciones reside en el servidor de otra persona.

Una herramienta de transcripción y eliminación, como Hushscript, trata la transcripción como el producto entregable y el audio como un medio para obtenerlo. El audio se elimina al finalizar y la transcripción es suya para exportarla y eliminarla. Ese es el modelo correcto cuando la grabación es confidencial y ya tienes tu propia copia del archivo fuente, ya que no hay razón para que la herramienta conserve una también.

Tampoco está mal. Pero para grabaciones legales, entrevistas, notas de terapia o cualquier cosa con una fuente anónima, el segundo modelo elimina una responsabilidad que el primero acumula con el tiempo.

Señales de alerta a tener en cuenta

Al evaluar cualquier herramienta, vale la pena tratar algunas señales como advertencias.

Lenguaje de retención vago.“Almacenamos sus archivos durante un período razonable” o “los archivos podrán conservarse para mejorar nuestros servicios” no son compromisos. “Razonable” puede significar cualquier cosa, y “mejorar nuestros servicios” frecuentemente cubre capacitación.

Cláusulas de capacitación ocultas en los términos. Consulte la sección “Uso aceptable”, “Contenido” o “Licencia” de los términos de servicio, no solo la política de privacidad. Algunas herramientas se otorgan una licencia amplia para usar el contenido enviado como quieran, lo que puede incluir silenciosamente entrenar un modelo sobre él.

No hay una respuesta clara a una pregunta directa. Si el soporte no puede decir claramente cuándo se elimina el audio o si las grabaciones se usan para capacitación, ese silencio es en sí mismo la respuesta.

Gratis sin ningún modelo de financiación visible. Si una herramienta es completamente gratuita y la economía no son obvios, considere si el producto que se vende son los datos que está entregando.

Almacenamiento indefinido combinado con una exportación de pago. Una herramienta que almacena su audio para siempre pero cobra por exportar la transcripción está diseñada para mantenerlo dependiente de su almacenamiento, no para entregarle el control de su propio contenido.


Para entrevistas, grabaciones legales o cualquier audio cuyo contenido sea confidencial, la pregunta que importa no es si la transcripción es precisa, sino si el audio que la produjo sigue siendo suyo. La página de transcripción privada describe cómo se compara el enfoque de Hushscript con el predeterminado.

Y si desea conocer la mecánica de eliminación específicamente (cuándo sucede, qué se considera “eliminado” y por qué lo convertimos en el predeterminado), por qué eliminamos su audio después de la transcripción lo cubre en detalle.

Fuentes y normas independientes

Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.

Fuentes revisadas:

Preguntas frecuentes

¿Es seguro cargar audio para transcripción?

Depende de la grabación, el servicio y las reglas que se aplican a su caso. El manejo de video en el navegador, la retención de audio breve, el almacenamiento cifrado y una política de no capacitación reducen la exposición; no hacen que cada carga sea adecuada para trabajos regulados o altamente sensibles. Primero verifique la política del servicio y sus propios requisitos.

¿Hushscript conserva mi audio después de la transcripción?

No. El audio se elimina del servidor en el momento en que su transcripción está lista: sin período de gracia, sin depósito de respaldo, sin almacenamiento en frío, sin copia de capacitación. Lo único que persiste es el texto de la transcripción en tu panel de control, hasta que lo elimines también.

Si subo un vídeo, ¿el archivo de vídeo sale de mi dispositivo?

No. Hushscript prepara la pista de audio del video en su navegador y envía solo ese audio para su transcripción. Una pista compatible se copia sin volver a codificarla; la conversión se ejecuta localmente sólo cuando es necesario. El vídeo permanece en su dispositivo.

¿Mis transcripciones están cifradas?

Sí. Las transcripciones se cifran en reposo, por lo que si alguna vez se filtrara nuestro almacenamiento, sus palabras serían texto cifrado ilegible en lugar de texto sin formato. El cifrado protege contra una violación del almacenamiento; no es conocimiento cero, ya que la clave se guarda en nuestros servidores para que la aplicación pueda mostrarle su transcripción.

¿Cómo sé que un servicio de transcripción no está entrenando en mis grabaciones?

Pregunte directamente y lea la política de privacidad en lugar de la página de marketing. Frases como "podemos usar su contenido para mejorar nuestros servicios" son una señal de alerta, ya que esa redacción generalmente cubre la capacitación modelo. Busque una declaración explícita de que el audio no se utiliza para entrenar o perfeccionar ningún modelo.

¿Qué tipos de grabaciones conllevan el mayor riesgo?

Consultas legales, sesiones de terapia, visitas médicas, negociaciones comerciales, entrevistas de recursos humanos y grabaciones de fuentes periodísticas son los casos obvios. Pero cualquier grabación con voces, nombres o detalles privados identificables conlleva cierto riesgo si se almacena en un servidor de terceros que no controlas.

¿Es segura la transcripción para contenido confidencial?

Sí, si eliges la herramienta con cuidado. Para cualquier cosa que no le resulte cómodo dejar en el servidor de otra persona de forma indefinida, utilice un servicio que extraiga audio en el navegador, lo elimine después de la transcripción, encripte lo que guarda y establezca claramente que no se entrena con sus datos. Confirme cada una de esas afirmaciones en la política de privacidad antes de cargar.

Comienza con 30 minutos gratis

Comenzar – 30 minutos gratis