Saltar al contenido principal

Cómo transcribir una entrevista (privada)

Autor: Publicado: Última revisión:

Transcribir bien una entrevista significa dos cosas a la vez: texto preciso y atribución clara. Un muro de palabras donde no se puede saber quién dijo qué es casi tanto trabajo como la grabación en bruto. Y cuando la conversación es delicada, un asunto legal, una fuente confidencial, una situación de recursos humanos, la forma en que se maneja el audio es tan importante como la transcripción misma. Esta guía cubre todo el arco: obtener audio limpio antes de grabar, ejecutar la transcripción, mantener al entrevistador y al sujeto separados, citar con precisión con marcas de tiempo y mantener todo en privado.

Lo que necesita antes de comenzar

La lista es corta. Necesita una grabación de la entrevista como archivo de audio o vídeo. Hushscript acepta cualquier formato común, por lo que una nota de voz de un teléfono, una grabación de Zoom, un WAV de una grabadora dedicada o una captura de pantalla MP4 funcionan sin conversión. Necesita el consentimiento de todas las personas registradas, que se trata a continuación y no es opcional. Y necesita una forma de ver y editar la transcripción, que es la aplicación Hushscript en su navegador. Sin instalaciones ni complementos.

No es necesario elegir un idioma. Hushscript lo detecta automáticamente en alrededor de 99 idiomas, por lo que una entrevista bilingüe o un sujeto que cambia a mitad de una frase se maneja sin que usted configure nada. Si desea ver la lista completa, la página de idiomas la tiene.

Antes de grabar

La calidad del audio en el momento de la grabación es el factor más importante en la precisión de la transcripción. Ningún motor de transcripción, automático o humano, puede recuperar una palabra que el micrófono nunca captó con claridad. Algunos detalles valen más que cualquier cosa que hagas más adelante.

Ubicación del micrófono. Para una entrevista en persona, una pequeña grabadora colocada sobre la mesa, equidistante de ambos hablantes, suena mejor que un teléfono que llevas en el bolsillo. Si puedes darle a cada persona su propio micrófono, hazlo: dos entradas limpias son más fáciles de separar que una sala mixta. Para entrevistas remotas en una videollamada, grabe cada lado como su propia pista cuando la plataforma lo permita, porque dos pistas se separan más claramente que una sola transmisión mezclada.

Un entorno tranquilo. El zumbido del sistema HVAC, el tráfico a través de una ventana, la charla de fondo de una cafetería y la reverberación de una habitación desnuda reducen la precisión. Una pequeña habitación alfombrada, o incluso un armario con ropa colgada, suena mejor que una oficina abierta. En el campo, un micrófono direccional apuntado al sujeto ayuda a elevar su voz por encima del entorno.

Consentimiento, antes que nada. Grabar a una persona sin su conocimiento es ilegal en muchos lugares e inaceptable en todas partes. Dígale a su sujeto que está grabando antes de comenzar. Algunas jurisdicciones requieren el consentimiento de una sola parte, pero varias, incluidos varios estados de EE. UU. y muchos países, requieren que todos los presentes estén de acuerdo. En caso de duda, obtenga un sí explícito y hablado en la grabación en sí, justo después de comenzar, para que el acuerdo sea parte del archivo.

Configuraciones de formato sensibles. No necesita calidad de estudio. WAV o MP3 a 128 kbps o más es suficiente, y una frecuencia de muestreo de 16 kHz o más es cómoda. Lo único que se debe evitar es comprimir hasta la calidad del teléfono, alrededor de 8 kHz, donde las consonantes se confunden y la precisión disminuye notablemente.

Transcribe la entrevista, paso a paso

El flujo está diseñado para que puedas ver la calidad antes de comprometerte. Este es el orden real.

  1. Deje su grabación en /audio-to-text. Si es un video, el audio se extrae primero en su navegador, por lo que el archivo de video nunca sale de su dispositivo. Desde aquí solo interviene el audio.
  2. Lea la vista previa de 30 segundos. Hushscript transcribe el primer medio minuto y se lo muestra con las etiquetas de hablante ya aplicadas, antes de que cree una cuenta. Este es el paso sin cuenta: usted puede juzgar la separación de los hablantes y la redacción de su archivo real, no una demostración.
  3. Regístrese para transcribir el resto. Al crear una cuenta se desbloquea la transcripción completa. Las cuentas nuevas obtienen 30 minutos gratis para probar, suficiente para una entrevista corta o una parte larga. Hushscript es un sistema de pago por uso sin suscripción, por lo que compras minutos solo cuando los necesitas.
  4. Vuelve a etiquetar y exportar. La transcripción terminada aparece como una línea por expresión, cada una etiquetada con una etiqueta de hablante y una marca de tiempo. Cambie el nombre de las etiquetas a nombres reales y luego exporte.

Una nota sobre los minutos gratuitos, ya que la gente pregunta cómo funciona la parte “gratuita”. Los 30 minutos se conceden una vez. La forma más rápida de desbloquearlos es una verificación rápida de la tarjeta: se autoriza una retención de $1 para confirmar la tarjeta y luego se libera de inmediato, sin ningún cargo. Si prefieres pagar de otra forma, también funciona un método alternativo disponible en tu país, y los 30 minutos llegan con tu primera compra. No se requiere una tarjeta de ninguna manera.

Mantenga al entrevistador y al sujeto separados

Aquí es donde se puede utilizar una transcripción de la entrevista en lugar de una transcripción que tiene que volver a escuchar de todos modos. La función de identificación del hablante asigna a cada voz distinta su propia etiqueta, sin configuración ni costo adicional. Para una entrevista de dos personas, eso significa un diálogo como este:

Hablante A [00:00:07]: ¿Puede recordarme cuando se dio cuenta por primera vez de que el proyecto estaba en problemas?
Hablante B [00:00:13]: Era a principios de 2019. Estaba ejecutando la implementación y los números simplemente dejaron de cuadrar.
Hablante A [00:00:28]: ¿Y qué hiciste al respecto?
Hablante B [00:00:31]: Sinceramente, al principio nada. Esa es la parte de la que me arrepiento.

Para ponerle nombres reales:

  1. Haga clic en cualquier instancia de Hablante A en la transcripción.
  2. Escriba el nombre que desee, por ejemplo, “Entrevistador” o el nombre de su sujeto.
  3. Cada línea de ese hablante se actualiza en una vez.

Esto se hace una vez por hablante. Para una entrevista de 90 minutos con dos personas, todo el pase dura menos de un minuto y finaliza con un documento listo para cotizar donde cada línea se atribuye a una persona nombrada. Si desea conocer en detalle cómo funciona realmente esta separación, cómo funciona la diarización del hablante lo explica con palabras sencillas.

Un ejemplo práctico: una entrevista de investigación de una hora

Supongamos que ha grabado una entrevista de investigación de 58 minutos en su teléfono como un archivo .m4a. La habitación estaba en silencio, ambos estaban cerca del teléfono y se produce la habitual superposición cuando el sujeto se anima.

Sueltas el archivo en /audio-to-text. La vista previa de 30 segundos muestra su pregunta inicial como Hablante A y la primera respuesta del sujeto como Hablante B, lo que le indica que la separación es limpia. Te registras y dejas que se transcriba el archivo completo. Una entrevista de 58 minutos utiliza 58 minutos de tu saldo, por lo que los 30 minutos gratuitos cubren poco más de la mitad y tú recargas el resto.

La transcripción se lee como un claro ir y venir. Haga clic en el primer Hablante A, escriba su propio nombre, haga clic en el primer Hablante B, escriba el nombre de su sujeto y todo el documento se actualizará. Al hojearlo, observa tres tramos cortos en los que el motor dividió al sujeto en una segunda etiqueta porque se alejó del teléfono, por lo que los fusiona nuevamente. Exporta a DOCX para sus notas y a JSON para que su script de análisis pueda extraer cada expresión con su hora de inicio, hora de finalización y hablante. Tiempo total de práctica después de la carga: unos minutos.

Cita con precisión con marcas de tiempo

Cada expresión en la transcripción lleva una marca de tiempo, que es lo que hace que sea seguro citar el resultado. Cuando obtenga una cita para un artículo, un informe o un artículo, anote la marca de tiempo al lado. Eso le brinda un punto preciso para escuchar durante la verificación de hechos, le brinda al editor una forma de verificar la cita y le brinda algo que señalar si una fuente luego cuestiona lo que dijo. Cuánto hay que ordenar una cita una vez que la tienes, ya sea para mantener todos los comienzos en falso o para suavizar la redacción en prosa limpia, es una elección de estilo que vale la pena hacer a propósito, y claro palabra por palabra versus transcripción literal establece ambas convenciones.

La exportación DOCX mantiene las marcas de tiempo en línea. Si necesita la estructura sin formato, la exportación JSON le proporciona datos a nivel de expresión, cada entrada con una hora de inicio, hora de finalización, hablante y texto, que puede procesar mediante programación. La exportación TXT es la copia de lectura limpia, y SRT le brinda líneas de subtítulos cronometradas si la entrevista se ubicará debajo de un video.

Un límite que vale la pena conocer: las marcas de tiempo están en el nivel de expresión, no en la palabra individual. Para la mayoría de los trabajos de entrevista, eso es exactamente lo que desea, ya que está citando una oración, no una sílaba. Si necesita específicamente una sincronización a nivel de palabra para grabar subtítulos en el metraje, la sincronización de la línea SRT es lo suficientemente cercana para casi todos los propósitos.

Problemas comunes y cómo solucionarlos

La mayoría de las grabaciones de entrevistas se transcriben limpiamente. Cuando algo no funciona, casi siempre es uno de varios problemas, y cada uno tiene una solución sencilla.

Un hablante se divide en dos etiquetas. Es el caso inesperado más frecuente. Por lo general, significa que el sonido de esa persona cambió a mitad de camino: se acercó o se alejó del micrófono, pasó de los auriculares al altavoz o la calidad de la línea cambió en una llamada. El motor agrupa las voces según cómo suenan, por lo que un gran cambio puede leerse como una nueva voz. Combine las dos etiquetas en el editor y se arreglará de una sola vez, como en el ejemplo anterior.

Dos personas se fusionaron en una etiqueta. Al revés. Esto sucede cuando dos voces son realmente similares o cuando la grabación es silenciosa y las diferencias son difíciles de escuchar. Es más difícil arreglarlo claramente después del hecho, por lo que dos entradas separadas en el momento de la grabación, una por persona, son el mejor seguro contra esto.

Difonía y personas hablando entre sí. Cuando ambos hablan a la vez, cualquier transcriptor, automático o humano, tiene dificultades, porque las palabras se superponen físicamente en el audio. Espere que los momentos más ocupados de una entrevista acalorada necesiten una escucha manual. Las marcas de tiempo facilitan la búsqueda de esos momentos.

Acentos fuertes o términos especializados. La precisión se mantiene bien en todos los acentos, pero los nombres propios, la jerga técnica y los nombres desconocidos son donde es más probable que falle la transcripción automática. Realice una búsqueda y reemplazo de algunos nombres y términos específicos de su entrevista y confirme los que desee citar. Cuando la entrevista es una conversación clínica o de investigación repleta de vocabulario especializado, la transcripción médica para dictado y entrevistas cubre cómo manejar esos términos.

Una grabación tranquila o distante. Si el sujeto estaba lejos del micrófono o hablaba en voz baja, la precisión disminuye en todos los ámbitos y no hay ninguna solución de software después del hecho. Este es el caso que la sección “antes de grabar” existe para evitarlo. Si tiene una grabación débil, transcríbala de todos modos como borrador y luego corríjala con el audio.

Un archivo muy largo o grande. Una grabación puede durar hasta 10 horas, sin límite de tamaño de archivo; incluso una muy grande se prepara directamente en el navegador. Divida solo las grabaciones que excedan el límite de 10 horas, usando una pausa natural, luego transcriba cada parte.

Fuente de audio o fuente de video: cuál cargar

Si tiene un archivo de audio y un video de la misma entrevista, cárguelo cualquiera de los dos. La transcripción es idéntica, porque Hushscript trabaja a partir del audio en ambos casos. La diferencia práctica es la privacidad. Cuando le das un video, el audio se extrae en tu navegador y solo se envía ese audio, por lo que el video, a menudo el artefacto más identificable y más sensible, nunca sale de tu máquina. Para una entrevista delicada, esa es la mejor opción por defecto. Si ya tiene un archivo limpio de solo audio, cargarlo es lo más sencillo.

Mantener las entrevistas confidenciales en privado

Para entrevistas que tocan asuntos legales, fuentes confidenciales, casos de recursos humanos o revelaciones personales, la forma en que se maneja el audio es importante más allá de la calidad de la transcripción. Hushscript está diseñado exactamente para esto.

El audio se elimina del servidor en el momento en que la transcripción está lista. No hay ventana de retención ni copia de seguridad de la grabación en algún lugar posterior. Si subiste un video, solo se envió el audio extraído, y ese también desaparece. El motor de voz no se entrena con sus grabaciones, por lo que nada de lo que envía alimenta un modelo.

Las transcripciones en sí están cifradas en reposo. En términos sencillos, si alguna vez se violara el almacenamiento, lo que un atacante encontraría es un texto cifrado ilegible, no las palabras del sujeto. Esto es protección contra fugas, no una afirmación de que no podemos leer sus transcripciones: la clave está en nuestro lado para que el producto pueda mostrarle su propio trabajo. Lo que sí significa es que una filtración de datos, la amenaza realista para cualquier herramienta en la nube, no entrega contenido legible de la entrevista.

Para los casos más fuertes, protección de fuentes en periodismo, material legal privilegiado, tome la precaución estándar: guarde su propia copia fuera de línea del audio y la transcripción terminada en un dispositivo que usted controle, y no trate ningún servicio en la nube, incluido este, como la única copia. Si desea obtener una imagen completa del manejo de datos, la página transcripción privada lo presenta.

Si su grabación es un podcast con varios anfitriones en lugar de una entrevista individual, el flujo de trabajo es el mismo y cómo transcribir un podcast cubre los detalles específicos de varias voces.

Fuentes y normas independientes

Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.

Fuentes revisadas:

Preguntas frecuentes

¿Cómo mantengo al entrevistador y al sujeto separados en la transcripción?

Hushscript etiqueta a cada hablante automáticamente, de modo que una entrevista de dos personas resulte como 'Hablante A' y 'Hablante B' sin configuración. Después de la transcripción, haga clic en cualquier etiqueta, escriba el nombre real (por ejemplo, "Entrevistador" o el nombre del sujeto) y el nombre se actualizará en cada línea que dijo el hablante. Un pase completo de reetiquetado en una entrevista de 90 minutos toma menos de un minuto.

¿Hushscript es lo suficientemente privado para una entrevista delicada?

El audio se elimina del servidor en el momento en que la transcripción está lista, sin ventana de retención ni copia de seguridad. Si su grabación es un video, el audio se extrae primero en su navegador, por lo que el archivo de video nunca se carga. Las transcripciones también se cifran en reposo, lo que significa que una fuga de almacenamiento expondría texto cifrado ilegible en lugar de las palabras del sujeto.

¿Qué formato de audio y configuración ofrecen la mejor precisión?

Cualquier archivo de audio o vídeo común funciona, por lo que puede colocar la grabación tal como está. Para mayor precisión, lo ideal es WAV o FLAC a 16 kHz o más, y MP3 a 128 kbps o más está bien para la mayoría de las entrevistas. El formato importa mucho menos que la ubicación del micrófono y una habitación silenciosa, que son los verdaderos factores determinantes de una transcripción limpia.

¿Cuánto puede durar una entrevista?

Hasta 10 horas de duración, sin límite de tamaño de archivo. Una entrevista de investigación de dos horas o una sesión de historia oral de cuatro horas van en un solo archivo. Si una grabación dura más de 10 horas, divídala en una pausa natural y transcriba cada parte.

¿Necesito consentimiento para grabar y transcribir una entrevista?

Necesita consentimiento para grabar. Muchas jurisdicciones requieren el consentimiento de una sola parte, pero varias requieren que todas las personas en la llamada estén de acuerdo, y grabar a alguien sin su conocimiento es inaceptable, independientemente de la ley. Dígale a su sujeto que está grabando antes de comenzar, y en llamadas remotas obtenga un sí claro una vez que la grabación esté en marcha.

¿Puedo usar esto para periodismo donde la confidencialidad importa?

Hushscript se basa en una retención mínima: audio eliminado al finalizar, video nunca cargado, transcripciones cifradas y sin capacitación sobre sus grabaciones. No existen certificaciones de cumplimiento formales, por lo que, para proteger las fuentes de alto riesgo, mantenga su propia copia fuera de línea del audio y la transcripción y no trate ninguna herramienta en la nube como la única copia.

¿Cuánto cuesta transcribir una entrevista?

Hushscript es un sistema de pago por uso sin suscripción. Obtienes 30 minutos gratis para probar, que cubren una entrevista corta o un segmento de una más larga, luego compras minutos solo cuando los necesitas. Consulte la página de precios de los paquetes actuales.

¿Puedo cotizar directamente de la transcripción con confianza?

Sí. Cada expresión lleva una marca de tiempo, por lo que puedes citar una cita con el punto exacto de la grabación de donde proviene. Antes de publicar una cita confidencial, escuche nuevamente esa marca de tiempo una vez para confirmar la redacción, ya que la transcripción automática es precisa pero no infalible en caso de interferencias o nombres desconocidos.

Comienza con 30 minutos gratis

Comenzar – 30 minutos gratis