Diarización de hablantes: cómo funcionan las etiquetas
Autor: Hushscript Publicado: Última revisión:
La diarización del hablante es el proceso automático de separar una grabación en segmentos por hablante, respondiendo “¿quién habló y cuándo?” antes de que cualquier humano lea la transcripción. La investigación actual sobre la diarización del hablante en la Antología ACL describe la misma tarea para conversaciones entre múltiples partes. Es la diferencia entre un muro de palabras y una conversación estructurada, y es la razón por la que la transcripción de una entrevista entre dos personas resulta un diálogo legible en lugar de un párrafo largo.
En términos sencillos: usted carga una grabación, el motor de diarización encuentra los puntos donde cambia la voz, agrupa los segmentos que suenan como la misma persona y devuelve una transcripción que se lee como un guión: una línea por turno, etiquetada por voz. Esta publicación explica cómo funciona, por qué la diarización no es lo mismo que reconocer una voz y cómo convertir las etiquetas genéricas en nombres reales.
Diarización de hablantes, con palabras sencillas
Imagen que transcribe a mano una entrevista de 90 minutos. Luego de convertir el discurso en texto, lo siguiente que harías es agregar las atribuciones: “Entrevistador:”, “Asunto:”, de ida y vuelta, cada vez que la voz cambie. Ese trabajo de atribución, decidir quién habla en un momento determinado, es exactamente lo que la diarización hace por usted.
El resultado es una transcripción en formato de diálogo:
Hablante A [00:00:12]: Lo primero que debe comprender es que los datos solo existen por un momento.
Hablante B [00:00:27]: Correcto, y esa es la parte que la mayoría de la gente no se da cuenta hasta que es demasiado tarde.
Hablante A [00:00:34]: Exacto. Entonces, la verdadera pregunta es qué haces en esa ventana.
Cada expresión está vinculada a un hablante y una marca de tiempo. Luego puede cambiar el nombre de Hablante A y Hablante B a nombres reales; una edición por hablante y la etiqueta se actualiza en todas partes donde aparece.
La alternativa, una transcripción simple sin diarización, es un bloque continuo de texto donde tienes que reproducir el audio para determinar quién dijo qué. Para cualquier cosa que pase un par de minutos con dos o más voces, eso es trabajo manual real y es el trabajo que elimina el proceso de diarización.
Lo que necesita antes de comenzar
No hay ajustes que configurar ni nada que instalar. La diarización se ejecuta en la grabación misma, por lo que el único requisito previo real es un audio en el que los hablantes sean razonablemente distintos:
- Una grabación con todas las voces. La diarización funciona dentro de un solo archivo, por lo que todos los hablantes deben estar presentes en ese archivo. Una mesa redonda donde todos comparten trabajos de micrófono de una sala; dos personas, cada una grabada en su propio dispositivo separado, guardadas como dos archivos separados, no. Primero combínelos en una mezcla.
- Audio lo suficientemente claro. No es necesario que tenga calidad de estudio. Necesita que cada persona sea audible sin esforzarse, con conversaciones cruzadas y ruidos de fondo limitados. Cuanto más limpia sea la separación entre voces, más limpias serán las etiquetas.
- Una idea aproximada de cuántas personas están hablando. No es necesario que proporciones esto, pero saberlo te ayuda a comprobar la cordura del resultado: si grabaste a tres personas y la transcripción muestra seis hablantes, sabes dónde buscar.
Eso es todo. Sin registro de micrófono, sin muestras de voz, sin configuración por hablante.
Cómo funciona la identificación automática del hablante
La diarización se divide en algunas etapas distintas. Conocerlos hace que el resultado sea más fácil de leer y más fácil de corregir cuando algo sale mal.
Extracción de características. El audio se divide en fotogramas cortos, normalmente de 10 a 40 milisegundos cada uno, y el motor mide las características acústicas en cada fotograma. Las características que importan para diferenciar a los hablantes viven en el dominio de la frecuencia: tono, formantes y patrones espectrales que tienden a permanecer consistentes dentro de la voz de una persona y difieren entre las personas.
Segmentación. El motor busca puntos de cambio de hablante: momentos en los que cambian esas características de voz. Ésta es la parte difícil. Un cambio puede producirse a mitad de una frase cuando alguien interrumpe, y el ruido o la superposición del discurso pueden ocultar un límite real o inventar uno falso.
Agrupación. Los segmentos que suenan como la misma voz se agrupan. Al motor no se le dice cuántas personas hay en la sala; infiere el recuento de hablantes del audio. Si conoce el recuento de antemano, algunas configuraciones le permiten proporcionarlo; si no, el motor lo estima, que es de donde provienen la mayoría de los errores de “dividir una persona en dos” y “fusionar dos personas en una”.
Etiquetado. Cada grupo recibe una etiqueta:Hablante A,Hablante B,Hablante C o Hablante 0.Hablante 1. Las etiquetas son marcadores de posición arbitrarios. No hay ninguna identidad detrás de ellos, solo un control estable para una voz en toda la grabación.
Todo el proceso se ejecuta como un paso automatizado junto con la transcripción, por lo que no se ejecuta un trabajo de etiquetado de hablantes por separado.
Diarización versus reconocimiento de voz
Estos dos se combinan constantemente, pero responden a preguntas diferentes.
Diarización pregunta: ¿quién está hablando en este momento, en relación con las otras voces en este archivo? Separa las voces pero no tiene idea de a quién pertenecen. No necesita conocimientos previos y no guarda ningún registro de ninguna voz una vez finalizado el trabajo.
El reconocimiento de voz, también llamado identificación del hablante, pregunta: ¿es esta la misma persona que aparece en una grabación de referencia conocida? Necesita una muestra de voz registrada para comparar, y es la tecnología detrás de los sistemas de “verificar su identidad por voz”.
Hushscript utiliza diarización, no reconocimiento de voz. No existe una base de datos de voces inscritas y su grabación nunca se compara con la de nadie más. Las etiquetas de los hablantes se derivan exclusivamente de las características de voz dentro de ese archivo.
Esta distinción es la razón por la que la diarización no puede nombrar personas por usted. Puede decir con confianza “la misma persona habló estas 200 vueltas a lo largo de la hora”, pero no puede decir quién es esa persona. Ese paso es suyo y requiere un clic por hablante. Si desea una visión más profunda de cómo Hushscript maneja las grabaciones de varios hablantes de principio a fin, la página de identificación del hablante lo cubre.
Un ejemplo práctico: una reunión de tres personas
Supongamos que graba una reunión de proyecto de 40 minutos con tres personas en una sala, compartiendo un solo micrófono de computadora portátil, guardado como un solo Archivo .m4a. Lo colocas y, después de la transcripción, el resultado se ve así:
Hablante A [00:00:04]: Bien, comencemos con la fecha de lanzamiento. ¿Dónde estamos?
Hablante B [00:00:09]: El diseño está hecho. Entregamos las pantallas finales el lunes.
Hablante C [00:00:14]: Ingeniería necesita aproximadamente dos semanas más para el flujo de pagos.
Hablante A [00:00:21]: Dos semanas nos sitúan más allá de la fecha que prometimos a marketing.
Hablante B [00:00:27]: ¿Podemos realizar envíos sin el nuevo flujo de pago y seguimiento?
Hablante C [00:00:33]: No de forma limpia. El antiguo flujo se interrumpe con el nuevo precio.
Tres voces, separadas y etiquetadas, con marcas de tiempo en cada turno. Ahora vuelves a etiquetar:Hablante A se convierte en “Priya” (ella dirige la reunión),Hablante B se convierte en “Tom”,Hablante C se convierte en “Dana”. Después de tres clics, cada línea lleva un nombre real y la transcripción está lista para pegar en las notas de la reunión con la atribución correcta.
La misma forma se aplica a una entrevista de dos personas, un podcast de cuatro personas o una llamada telefónica de dos personas: el motor separa lo que escucha y usted pone los nombres.
Cómo volver a etiquetar a los hablantes en Hushscript
Las etiquetas llegan genéricas a propósito; nombrarlos es un paso rápido del editor. El flujo antes de llegar allí es: suelte su archivo y se renderizará una vista previa de 30 segundos etiquetada por el hablante sin necesidad de cuenta, regístrese para transcribir el resto y luego abra la transcripción terminada. Desde allí:
- Haga clic en la etiqueta de cualquier hablante en el editor de transcripciones, como
Hablante B. - Escriba el nombre real, como “Tom”.
- Cada instancia de ese hablante se actualiza a la vez, desde la primera línea hasta la última.
El cambio de nombre es global, por lo que nunca editas la misma etiqueta dos veces. Para una entrevista de 90 minutos con dos hablantes, un pase completo de reetiquetado toma menos de un minuto y termina con una transcripción lista para citar que atribuye cada línea correctamente. Luego puede exportarlo, con los nombres incorporados, en cualquiera de los 21 formatos, como TXT, SRT, DOCX, PDF y JSON, además de un archivo .husharchive protegido con contraseña.
Solución de problemas comunes de diarización
La diarización es confiable en grabaciones limpias y se vuelve más difícil a medida que el audio se vuelve más complicado. Los problemas comunes y qué hacer al respecto:
Discurso superpuesto. Cuando dos personas hablan a la vez, el motor tiene que asignar audio superpuesto a un solo hablante y puede etiquetar mal el cruce o eliminar algunas palabras. No hay ninguna solución en el software; el audio realmente contiene dos voces en el mismo momento. La prevención es la palanca: una grabación en la que las personas se turnan se diariza con mucha más precisión que una llena de interrupciones. Cuando se producen superposiciones, una lectura rápida del audio detecta las pocas líneas afectadas.
Voces que suenan similares. Dos hablantes con tono y acento parecidos (por ejemplo, dos hombres de edad similar o hermanos) son más difíciles de separar que un par contrastante, porque sus características de voz realmente se superponen. Ocasionalmente, el motor puede intercambiar una vuelta entre ellos. Escanee la transcripción en busca de líneas que se lean de manera extraña para el hablante asignado; esos son los que se deben reasignar manualmente.
Una persona se divide en dos etiquetas. Si el audio de alguien cambia durante la grabación (se acerca al micrófono, pasó de los auriculares al altavoz o la conexión se degrada), el motor puede leer la segunda mitad como una nueva voz y crear una etiqueta adicional. Fusione los dos volviendo a etiquetarlos con el mismo nombre; los duplicados colapsan en un solo hablante.
Dos personas se fusionan en una etiqueta. Lo contrario sucede cuando dos voces tranquilas o distantes suenan demasiado parecidas para que el motor las separe. Esto es más difícil de solucionar después del hecho, por lo que vale la pena evitarlo: acerque el micrófono a los hablantes y evite grabar desde el otro lado de una sala grande.
Audio de campo lejano o ruidoso. Un micrófono de computadora portátil al final de una mesa de conferencias, un teléfono sobre la mesa durante una charla grupal o un eco de sala intenso desdibujan los límites entre las voces. La ubicación más cercana del micrófono ayuda a todos los hablantes y la reducción del ruido de fondo (ventiladores, tráfico, música) agudiza la separación. La calidad de la diarización sigue de cerca la calidad del audio.
Las llamadas telefónicas se graban como dos archivos separados. Si su grabadora guardó cada lado de una llamada como su propio archivo mono, la diarización en cada archivo solo ve una sola voz. Primero combine los dos en una única grabación mixta, de modo que ambas voces estén presentes en un solo archivo, luego transcríbalo.
Consejos de precisión que realmente mueven la aguja
Algunos hábitos hacen que la diarización sea notablemente mejor, y la mayoría de ellos tienen que ver con la grabación, no con el software:
- Deje que las personas se turnen. La conversación cruzada es el único mayor fuente de errores de registro. Una discusión moderada es mejor que una discusión todos contra todos.
- Acerque el micrófono. La distancia y el eco de la habitación difuminan las voces. Lo ideal es un micrófono cercano por persona; un micrófono compartido en el medio de la mesa supera al de la esquina.
- Elimine el ruido de fondo obvio. La música, un ventilador corriendo o un café concurrido compiten con las voces y enturbian los límites.
- Incorpore cada voz en el archivo que transcribe. La diarización compara los hablantes dentro de una grabación. Si un grabador produjo pistas de participantes separadas, primero mézclelas o combínelas en un solo archivo para que el proceso de diarización pueda escuchar toda la conversación.
Nada de esto tiene que ser perfecto. Los giros claros y una posición razonable del micrófono hacen que la mayoría de las grabaciones tengan etiquetas limpias, y el editor se encarga del resto.
Por qué es importante para entrevistas y reuniones
Sin diarización, una transcripción de una conversación entre varias personas es prácticamente inutilizable para sus tareas más comunes:
- Citas directas. No puedes citar a alguien si no no sé qué líneas son las suyas.
- Atribución del resumen. Un resumen de la reunión que no dice quién dijo qué es apenas más útil que ningún resumen.
- Búsqueda por hablante. Si buscas algo que dijo una persona, no puedes filtrar un solo bloque de texto indiferenciado.
Con la diarización, cada uno de estos es sencillo y la transcripción se convierte en un documento en lugar de texto sin formato. Para cualquier cosa que se publique o se cite, ya sea periodismo, investigación o notas de programas de podcasts, la atribución precisa no es opcional, y obtenerla de la transcripción en lugar de reconstruirla a partir del audio es donde se ahorra tiempo. Para trabajos internos como notas de reuniones, investigaciones de entrevistas o registros de recursos humanos, la estructura etiquetada es igualmente valiosa: escanear un diálogo es mucho más rápido que leer una pared de texto.
Para obtener un recorrido completo en contexto, consulte cómo transcribir una entrevista, que cubre la grabación, transcripción y reetiquetado para periodismo e investigación, y cómo transcribir una podcast para etiquetar a los presentadores e invitados en un episodio.
Las etiquetas de los hablantes son gratuitas en cada transcripción de Hushscript
La diarización del hablante se incluye en cada transcripción de Hushscript sin costo adicional. No hay ningún complemento de diarización, ni un nivel de plan separado para ello, ni límite en el número de hablantes que puede tener una grabación. Hushscript en sí es de pago por uso sin suscripción. Hay 30 minutos gratis para probar y pagas solo por los minutos que uses después; consulte la página de precios para obtener más detalles.
La separación del hablante es gratuita porque la transcripción de una conversación sin ella es solo la mitad de la transcripción: texto legible sin tener idea de quién lo dijo. Introduzca una grabación, obtenga las etiquetas automáticamente, cámbieles el nombre con un clic y exporte el resultado. Encontrará más información sobre cómo encaja todo en la página audio a texto.
Fuentes y normas independientes
Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.
Fuentes revisadas: