Aller au contenu principal

Diarisation : fonctionnement des étiquettes de locuteur

Auteur : Publié le : Dernière révision :

La diarisation des locuteurs est le processus automatique de séparation d’un enregistrement en segments par locuteur, en répondant “qui a parlé quand ?” avant qu’un humain ne lise la transcription. La recherche actuelle sur la diarisation des locuteurs dans l’anthologie ACL décrit la même tâche pour les conversations à plusieurs. C’est la différence entre un mur de mots et une conversation structurée, et c’est la raison pour laquelle la transcription d’un entretien à deux revient sous la forme d’un dialogue lisible au lieu d’un long paragraphe.

En termes simples : vous téléchargez un enregistrement, le moteur de diarisation trouve les points où la voix change, regroupe les segments qui ressemblent à la même personne et rend une transcription qui se lit comme un script : une ligne par tour, étiquetée par la voix. Cet article explique comment cela fonctionne, pourquoi la diarisation n’est pas la même chose que la reconnaissance d’une voix et comment transformer les étiquettes génériques en vrais noms.

Diarisation du locuteur, en termes simples

Image transcrivant à la main une interview de 90 minutes. Après avoir transformé le discours en texte, la prochaine chose à faire est d’ajouter les attributions : « Intervieweur : », « Sujet : », d’un côté à l’autre, à chaque fois que la voix change. Ce travail d’attribution, qui consiste à décider qui parle à une seconde donnée, est exactement ce que la diarisation fait pour vous.

Le résultat est une transcription au format dialogue :

Locuteur A [00:00:12] : La première chose à comprendre est que les données n'existent que pour un instant.
Locuteur B [00:00:27] : C'est vrai, et c'est ce que la plupart des gens ne réalisent pas avant qu'il ne soit trop tard.
Locuteur A [00:00:34] : Exactement. La vraie question est donc de savoir ce que vous faites dans cette fenêtre.

Chaque énoncé est lié à un locuteur et à un horodatage. Vous pouvez ensuite renommer Locuteur A et Locuteur B en vrais noms ; une modification par locuteur, et l’étiquette est mise à jour partout où elle apparaît.

L’alternative, une transcription simple sans diarisation, est un bloc de texte continu dans lequel vous devez relire l’audio pour déterminer qui a dit quoi. Pour tout ce qui dépasse quelques minutes avec deux voix ou plus, il s’agit d’un véritable travail manuel, et c’est le travail que la passe de diarisation supprime.

Ce dont vous avez besoin avant de commencer

Il n’y a aucun paramètre à configurer ni rien à installer. La diarisation s’exécute sur l’enregistrement lui-même, donc la seule véritable condition préalable est l’audio où les locuteurs sont raisonnablement distincts :

C’est tout. Pas d’enregistrement de microphone, pas d’échantillons de voix, pas de configuration par locuteur.

Fonctionnement de l’identification automatique du locuteur

La diarisation se divise en quelques étapes distinctes. Les connaître rend le résultat plus facile à lire et plus facile à corriger en cas de problème.

Extraction des fonctionnalités. L’audio est divisé en images courtes, généralement de 10 à 40 millisecondes chacune, et le moteur mesure les caractéristiques acoustiques dans chaque image. Les caractéristiques qui permettent de distinguer les locuteurs se situent dans le domaine fréquentiel : tonalité, formants et modèles spectraux qui ont tendance à rester cohérents dans la voix d’une personne et à différer d’une personne à l’autre.

Segmentation. Le moteur recherche les points de changement de locuteur : les moments où ces caractéristiques vocales changent. C’est la partie la plus difficile. Un changement peut se produire au milieu d’une phrase lorsque quelqu’un l’interrompt, et le bruit ou les chevauchements de paroles peuvent masquer une frontière réelle ou en inventer une fausse.

Clustering. Les segments qui ressemblent à la même voix sont regroupés. Le moteur ne sait pas combien de personnes se trouvent dans la pièce ; il déduit le nombre de locuteurs à partir de l’audio. Si vous connaissez le décompte à l’avance, certaines configurations vous permettent de le fournir ; sinon, le moteur l’estime, d’où la plupart des erreurs de type “diviser une personne en deux” et “fusionner deux personnes en une seule”.

Étiquetage. Chaque cluster reçoit une étiquette :Locuteur A,Locuteur B,Locuteur C ou Locuteur 0,Locuteur 1. Les étiquettes sont des espaces réservés arbitraires. Il n’y a aucune identité derrière eux, juste une poignée stable pour une voix tout au long de l’enregistrement.

L’ensemble du pipeline fonctionne comme un passage automatisé parallèlement à la transcription, vous n’exécutez donc pas un travail distinct d’étiquetage du locuteur.

Diarisation vs reconnaissance vocale

Ces deux sont constamment confondus, mais ils répondent à des questions différentes.

La diarisation demande : qui parle en ce moment, par rapport aux autres voix de ce fichier ? Elle sépare les voix mais n’a aucune idée à qui elles appartiennent. Il ne nécessite aucune connaissance préalable et ne conserve aucune trace de voix une fois le travail terminé.

La reconnaissance vocale, également appelée identification du locuteur, demande : est-ce la même personne que dans un enregistrement de référence connu ? Elle a besoin d’un échantillon vocal enregistré pour comparer, et c’est la technologie derrière les systèmes de « vérification de votre identité par la voix ».

Hushscript utilise la diarisation, pas la voix. reconnaissance. Il n’existe pas de base de données des voix enregistrées et votre enregistrement n’est jamais comparé à celui de quelqu’un d’autre. Les étiquettes des locuteurs sont dérivées uniquement des caractéristiques vocales contenues dans ce fichier.

Cette distinction est la raison pour laquelle la diarisation ne peut pas nommer les personnes à votre place. Il peut affirmer avec assurance que « la même personne a parlé pendant 200 tours en une heure », mais il ne peut pas dire qui cette personne. Cette étape vous appartient et nécessite un clic par intervenant. Si vous souhaitez en savoir plus sur la manière dont Hushscript gère les enregistrements multi-intervenants de bout en bout, la page d’identification de l’intervenant la couvre.

Un exemple concret : une réunion à trois personnes

Disons que vous enregistrez une réunion de projet de 40 minutes avec trois personnes dans une pièce, partageant un seul micro d’ordinateur portable, enregistrée en tant que seul Fichier .m4a. Vous le déposez, et après transcription, le résultat ressemble à ceci :

Locuteur A [00:00:04] : D'accord, commençons par la date de lancement. Où en sommes-nous ?
Locuteur B [00:00:09] : Le design est terminé. Nous avons remis les derniers écrans lundi.
Locuteur C [00:00:14] : L'ingénierie a besoin d'environ deux semaines supplémentaires pour le flux de paiement.
Locuteur A [00:00:21] : Deux semaines nous placent au-delà de la date promise pour la commercialisation.
Locuteur B [00:00:27] : Pouvons-nous expédier sans le nouveau flux de paiement et le suivi ?
Locuteur C [00:00:33] : Pas proprement. L'ancien flux s'interrompt avec la nouvelle tarification.

Trois voix, séparées et étiquetées, avec des horodatages à chaque tour. Maintenant, vous ré-étiquetez :Locuteur A devient “Priya” (elle dirige la réunion),Locuteur B devient “Tom”,Locuteur C devient “Dana”. Après trois clics, chaque ligne porte un vrai nom et la transcription est prête à être collée dans les notes de réunion avec l’attribution correcte.

La même forme s’applique à une interview à deux, un podcast à quatre ou un appel téléphonique bilatéral : le moteur sépare ce qu’il entend et vous mettez les noms.

Comment réétiqueter les intervenants dans Hushscript

Les étiquettes sont volontairement génériques ; les nommer est une étape rapide de l’éditeur. Le flux avant d’y arriver est le suivant : déposez votre fichier et un aperçu de 30 secondes étiqueté par le locuteur s’affiche sans compte requis, inscrivez-vous pour transcrire le reste, puis ouvrez la transcription terminée. À partir de là :

  1. Cliquez sur n’importe quelle étiquette de locuteur dans l’éditeur de transcription, comme Locuteur B.
  2. Tapez le vrai nom, comme “Tom”.
  3. Chaque instance de ce locuteur est mise à jour en même temps, de la première ligne à la dernière.

Le changement de nom est global, vous ne modifiez donc jamais deux fois la même étiquette. Pour une interview de 90 minutes avec deux intervenants, un réétiquetage complet prend moins d’une minute et vous vous retrouvez avec une transcription prête à être citée qui attribue correctement chaque ligne. Vous pouvez ensuite l’exporter, avec les noms intégrés, dans l’un des 21 formats tels que TXT, SRT, DOCX, PDF et JSON, ainsi qu’une archive .husharchive protégée par mot de passe.

Dépannage des problèmes courants de diarisation

La diarisation est fiable sur les enregistrements propres et devient plus difficile à mesure que l’audio devient plus compliqué. Les problèmes courants et les mesures à prendre :

Discours superposés. Lorsque deux personnes parlent en même temps, le moteur doit attribuer un chevauchement audio à un seul locuteur, et il peut mal étiqueter le croisement ou laisser tomber quelques mots. Il n’y a pas de solution dans le logiciel ; l’audio contient véritablement deux voix au même moment. La prévention est le levier : un enregistrement dans lequel les gens se relaient se diarise bien plus proprement qu’un enregistrement rempli d’interruptions. Lorsque des chevauchements se produisent, une lecture rapide de l’audio détecte la poignée de lignes affectées.

Des voix au son similaire. Deux locuteurs avec un ton et un accent proches (par exemple, deux hommes du même âge, ou des frères et sœurs) sont plus difficiles à séparer qu’une paire contrastée, car leurs caractéristiques vocales se chevauchent véritablement. Le moteur peut occasionnellement échanger un tour entre eux. Parcourez la transcription à la recherche de lignes qui se lisent étrangement pour l’orateur désigné ; ce sont ceux-là qu’il faut réattribuer à la main.

Une personne divisée en deux étiquettes. Si l’audio d’une personne change en cours d’enregistrement (elle se rapproche du micro, passe d’un casque au haut-parleur ou la connexion se dégrade), le moteur peut lire la seconde moitié comme une nouvelle voix et créer une étiquette supplémentaire. Fusionnez les deux en les renommant tous les deux avec le même nom ; les doublons se regroupent en un seul locuteur.

Deux personnes fusionnées en un seul label. L’inverse se produit lorsque deux voix faibles ou distantes se ressemblent trop pour que le moteur se divise. C’est le problème le plus difficile à réparer après coup, il vaut donc la peine de l’éviter : rapprochez le micro des locuteurs et évitez d’enregistrer depuis l’autre côté d’une grande pièce.

Audio en champ lointain ou bruyant. Un micro d’ordinateur portable au bout d’une table de conférence, un téléphone sur la table lors d’une discussion de groupe ou un écho lourd dans une pièce brouillent tous les frontières entre les voix. Un placement plus rapproché du micro aide chaque locuteur, et la réduction du bruit de fond (ventilateurs, trafic, musique) accentue la séparation. La qualité de la diarisation suit de près la qualité audio.

Appels téléphoniques enregistrés dans deux fichiers distincts. Si votre enregistreur a enregistré chaque côté d’un appel dans son propre fichier mono, la diarisation sur l’un ou l’autre fichier seul ne voit qu’une seule voix. Combinez d’abord les deux dans un seul enregistrement mixé, afin que les deux voix soient présentes dans un seul fichier, puis transcrivez-le.

Conseils de précision qui font réellement bouger l’aiguille

Quelques habitudes améliorent sensiblement la diarisation, et la plupart d’entre elles concernent l’enregistrement, pas le logiciel :

Rien de tout cela n’a besoin d’être parfait. Des rotations claires et une position raisonnable du micro permettent à la plupart des enregistrements d’être propres, et le monteur s’occupe du reste.

Pourquoi est-ce important pour les entretiens et les réunions

Sans diarisation, la transcription d’une conversation à plusieurs personnes est presque inutilisable pour ses tâches les plus courantes :

Avec la diarisation, chacun de ces éléments est simple et la transcription devient un document plutôt qu’un texte brut. Pour tout ce qui sera publié ou cité, qu’il s’agisse de notes de journalisme, de recherche ou de podcast, une attribution précise n’est pas facultative, et l’obtenir à partir de la transcription au lieu de la reconstruire à partir de l’audio est le moyen de gagner du temps. Pour le travail interne comme les notes de réunion, la recherche d’entretiens ou les dossiers RH, la structure étiquetée est tout aussi précieuse : la numérisation d’un dialogue est bien plus rapide que la lecture d’un mur de texte.

Pour une présentation complète en contexte, consultez comment transcrire une interview, qui couvre l’enregistrement, la transcription et le réétiquetage pour le journalisme et la recherche, et comment transcrire un podcast pour étiqueter les hôtes et les invités tout au long d’un épisode.

Les étiquettes de locuteur sont gratuites sur chaque transcription Hushscript

La diarisation des intervenants est incluse dans chaque transcription Hushscript sans frais supplémentaires. Il n’y a pas de module complémentaire de diarisation, pas de niveau de plan séparé et pas de limite sur le nombre de locuteurs qu’un enregistrement peut avoir. Hushscript lui-même est payant à l’utilisation, sans abonnement. Vous avez 30 minutes gratuites pour essayer, et vous ne payez que pour les minutes que vous utilisez par la suite ; consultez la page de tarification pour plus de détails.

La séparation des intervenants est gratuite, car la transcription d’une conversation sans elle n’est qu’une moitié d’une transcription : un texte lisible sans aucune idée de qui l’a dit. Déposez un enregistrement, récupérez automatiquement les étiquettes, renommez-les en un clic et exportez le résultat. Pour en savoir plus sur la manière dont tout cela s’articule, consultez la page audio en texte.

Sources et normes indépendantes

Hushscript a consulté ces références indépendantes et non concurrentes. Elles présentent des recherches, des normes ou le fonctionnement de plateformes et ne constituent pas une recommandation de Hushscript.

Sources vérifiées le :

Questions fréquentes

Qu'est-ce que la diarisation des locuteurs ?

La diarisation des locuteurs est le processus de segmentation d'un enregistrement audio en parties qui correspondent à des locuteurs distincts. Le résultat est une transcription où chaque ligne est attribuée au locuteur qui l'a dit (« Le locuteur A a dit ceci, le locuteur B a dit cela ») au lieu d'un bloc de texte indifférencié. Il répond à la question « qui a parlé quand ? » automatiquement, avant que quiconque ne lise la transcription.

La diarisation du locuteur est-elle la même chose que la reconnaissance vocale ?

Non. La diarisation sépare les voix au sein d'un même enregistrement et vous indique que c'est la même personne qui a prononcé ces segments, mais elle ne sait pas qui est cette personne. La reconnaissance vocale (identification du locuteur) compare une voix à un échantillon de référence connu pour lui attribuer un nom. La diarisation n'a besoin d'aucune référence et ne crée aucun profil vocal ; c'est pourquoi il étiquette les locuteurs « Locuteur A » et « Locuteur B » plutôt que par leur nom.

Combien de locuteurs la diarisation peut-elle gérer ?

Hushscript n'a pas de plafond payant sur le nombre de locuteurs, mais il n'y a pas de nombre universel auquel la diarisation reste aussi précise. Le chevauchement, les voix au son similaire, la distance du microphone et le bruit de la pièce sont tous importants. Un panneau propre peut mieux séparer qu'un appel bruyant à deux personnes, alors vérifiez les étiquettes chaque fois que l'attribution est importante.

Pourquoi la transcription a-t-elle divisé une personne en deux locuteurs ?

Habituellement, un grand changement dans la façon dont cette personne sonne à mi-chemin : elle s'est rapprochée ou éloignée du micro, est passée d'un casque au haut-parleur, ou la qualité de la ligne a changé. Le moteur regroupe les voix selon leurs caractéristiques, de sorte qu'un changement important dans ces caractéristiques peut être interprété comme une nouvelle voix. La fusion des deux étiquettes dans l'éditeur corrige le problème en une seule passe.

La diarisation peut-elle me dire qui est un locuteur par son nom ?

Non. La diarisation sépare les locuteurs mais ne les identifie pas par leur nom. Il les étiquette « Locuteur A », « Locuteur B », etc. Vous attribuez vous-même de vrais noms dans l'éditeur une fois la transcription générée, et chaque changement de nom s'applique à chaque ligne prononcée par l'orateur.

La diarisation des locuteurs fonctionne-t-elle sur les enregistrements d'appels téléphoniques ?

Oui, lorsque les deux côtés de l'appel sont capturés. Si l'enregistrement est une seule piste mixée avec les deux voix, la diarisation les sépare comme n'importe quel autre fichier à deux locuteurs. Si chaque face a été enregistrée dans son propre fichier mono distinct, combinez-les d'abord en un seul mixage afin que les deux voix soient présentes dans le même enregistrement.

La diarisation des locuteurs est-elle incluse avec chaque transcription Hushscript ?

Oui. Chaque transcription comprend des étiquettes de locuteurs sans frais supplémentaires, sans module complémentaire distinct ni niveau supérieur requis pour celles-ci. Vous pouvez renommer les étiquettes en vrais noms en un clic après la transcription, et le nouveau nom est mis à jour tout au long de la transcription.

Commencer avec 30 minutes gratuites

Commencer – 30 minutes gratuites