Aller au contenu principal

Comment transcrire une interview (en privé)

Auteur : Publié le : Dernière révision :

Bien transcrire une interview signifie deux choses à la fois : un texte précis et une attribution claire. Un mur de mots où vous ne pouvez pas dire qui a dit quoi, c’est presque autant de travail à utiliser que l’enregistrement brut. Et lorsque la conversation est sensible, qu’il s’agisse d’une question juridique, d’une source confidentielle, d’une situation RH, la façon dont l’audio est traité compte autant que la transcription elle-même. Ce guide couvre tout l’arc : obtenir un son clair avant d’enregistrer, exécuter la transcription, séparer l’intervieweur et le sujet, citer avec précision avec des horodatages et garder le tout privé.

Ce dont vous avez besoin avant de commencer

La liste est courte. Vous avez besoin d’un enregistrement de l’entretien sous forme de fichier audio ou vidéo. Hushscript accepte n’importe quel format courant, donc un mémo vocal de téléphone, un enregistrement Zoom, le WAV d’un enregistreur dédié ou une capture d’écran MP4 fonctionnent tous sans conversion. Vous avez besoin du consentement de toutes les personnes enregistrées, ce qui est couvert ci-dessous et n’est pas facultatif. Et vous avez besoin d’un moyen d’afficher et de modifier la transcription, qui est l’application Hushscript dans votre navigateur. Aucune installation, aucun plugin.

Vous n’avez pas besoin de choisir une langue. Hushscript le détecte automatiquement dans environ 99 langues, de sorte qu’un entretien bilingue ou un sujet qui change au milieu d’une phrase est traité sans que vous ne définissiez quoi que ce soit. Si vous souhaitez voir la liste complète, la page des langues la propose.

Avant d’enregistrer

La qualité audio au moment de l’enregistrement est le facteur le plus important dans la précision de la transcription. Aucun moteur de transcription, automatique ou humain, ne peut récupérer un mot que le microphone n’a jamais capté clairement. Quelques détails sont plus rentables que tout ce que vous ferez plus tard.

Placement du microphone. Pour un entretien en personne, un petit enregistreur placé sur la table à égale distance des deux locuteurs bat un téléphone laissé dans votre poche. Si vous pouvez donner à chacun son propre micro, faites-le : deux entrées claires sont plus faciles à séparer qu’une seule salle mixte. Pour les interviews à distance lors d’un appel vidéo, enregistrez chaque côté sur sa propre piste lorsque la plate-forme le permet, car deux pistes se séparent plus clairement qu’un seul flux mixé.

Un environnement calme. Le bourdonnement du CVC, la circulation à travers une fenêtre, le bruit de fond d’un café et la réverbération d’une pièce nue nuisent à la précision. Une petite pièce recouverte de moquette, ou même un placard rempli de vêtements suspendus, sonne mieux qu’un bureau ouvert. Sur le terrain, un microphone directionnel pointé vers votre sujet aide à élever sa voix au-dessus de l’environnement.

Consentez avant toute autre chose. L’enregistrement d’une personne à son insu est illégal dans de nombreux endroits et inacceptable partout. Dites à votre sujet que vous enregistrez avant de commencer. Certaines juridictions exigent le consentement d’une seule partie, mais plusieurs, y compris un certain nombre d’États américains et de nombreux pays, exigent que toutes les personnes présentes soient d’accord. En cas de doute, obtenez un oui explicite sur l’enregistrement lui-même, juste après avoir commencé, afin que l’accord fasse partie du fichier.

Paramètres de format raisonnables. Vous n’avez pas besoin de qualité studio. WAV ou MP3 à 128 kbps ou plus sont suffisants, et une fréquence d’échantillonnage de 16 kHz ou plus est confortable. La seule chose à éviter est de compresser la qualité téléphonique, autour de 8 kHz, où les consonnes se mélangent et où la précision diminue sensiblement.

Transcrivez l’interview, étape par étape

Le flux est conçu pour que vous puissiez voir la qualité avant de vous engager. Voici le véritable ordre.

  1. Déposez votre enregistrement sur /audio-to-text. S’il s’agit d’une vidéo, l’audio est d’abord extrait dans votre navigateur, de sorte que le fichier vidéo lui-même ne quitte jamais votre appareil. Seul l’audio est impliqué à partir d’ici.
  2. Lisez l’aperçu de 30 secondes. Hushscript transcrit la première demi-minute et vous la montre avec les étiquettes de locuteur déjà appliquées, avant de créer un compte. Il s’agit de l’étape sans compte : vous pouvez juger de la séparation des locuteurs et du libellé de votre fichier réel, pas d’une démo.
  3. Inscrivez-vous pour transcrire le reste. La création d’un compte débloque la transcription complète. Les nouveaux comptes bénéficient de 30 minutes gratuites pour essayer, suffisamment pour une courte interview ou une partie d’une longue. Hushscript est ensuite payant, sans abonnement, vous achetez donc des minutes uniquement lorsque vous en avez besoin.
  4. Réétiquetez et exportez. La transcription terminée revient sous la forme d’une ligne par énoncé, chacune étant étiquetée avec une étiquette de locuteur et un horodatage. Renommez les étiquettes en vrais noms, puis exportez.

Une note sur les minutes gratuites, car les gens demandent comment fonctionne la partie “gratuite”. Les 30 minutes sont accordées une seule fois. Le moyen le plus rapide de les débloquer est un contrôle rapide de la carte : une retenue de 1 $ est autorisée pour confirmer la carte, puis immédiatement libérée, jamais facturée. Si vous préférez payer autrement, une méthode alternative disponible dans votre pays fonctionne également, et les 30 minutes arrivent avec votre premier achat. Une carte n’est pas requise dans les deux cas.

Gardez l’intervieweur et le sujet séparés

C’est là qu’une transcription d’entretien devient utilisable plutôt qu’une transcription que vous devez de toute façon réécouter. La fonction d’identification du locuteur attribue à chaque voix distincte sa propre étiquette, sans configuration ni frais supplémentaires. Pour une interview à deux, cela signifie un dialogue comme celui-ci :

Locuteur A [00:00:07] : Pouvez-vous me rappeler le moment où vous avez réalisé pour la première fois que le projet était en difficulté ?
Locuteur B [00:00:13] : C'était début 2019. J'étais en charge du déploiement et les chiffres ont tout simplement cessé de s'additionner.
Locuteur A [00:00:28] : Et qu'as-tu fait à ce sujet ?
Locuteur B [00:00:31] : Honnêtement, au début, rien. C'est la partie que je regrette.

Pour y mettre de vrais noms :

  1. Cliquez sur n’importe quelle instance de Locuteur A dans la transcription.
  2. Tapez le nom souhaité, par exemple “Interviewer” ou le nom de votre sujet.
  3. Chaque ligne de cet intervenant mises à jour en même temps.

Vous faites cela une fois par locuteur. Pour un entretien de 90 minutes à deux, le processus complet prend moins d’une minute et vous terminez par un document prêt à être cité dans lequel chaque ligne est attribuée à une personne nommée. Si vous voulez en savoir plus sur la façon dont cette séparation fonctionne réellement sous le capot, comment fonctionne la diarisation du locuteur le décrit en termes simples.

Un exemple concret : un entretien de recherche d’une heure

Disons que vous avez enregistré un entretien de recherche de 58 minutes sur votre téléphone sous la forme d’un fichier .m4a. La pièce était calme, vous étiez tous les deux proches du téléphone, et il y a le peu de chevauchement habituel lorsque votre sujet s’anime.

Vous déposez le fichier dans /audio-to-text. L’aperçu de 30 secondes montre votre question d’ouverture en tant que Locuteur A et la première réponse de votre sujet en tant que Locuteur B, ce qui vous indique que la séparation est nette. Vous vous inscrivez et laissez le fichier complet transcrire. Un entretien de 58 minutes utilise 58 minutes de votre solde, donc les 30 minutes gratuites couvrent un peu plus de la moitié et vous rechargez le reste.

La transcription se lit comme un va-et-vient propre. Vous cliquez sur le premier Locuteur A, tapez votre propre nom, cliquez sur le premier Locuteur B, tapez le nom de votre sujet et tout le document est mis à jour. En parcourant, vous remarquez trois courtes séquences où le moteur a divisé votre sujet en une deuxième étiquette parce qu’il s’est éloigné du téléphone, vous les fusionnez donc en arrière. Vous exportez vers DOCX pour vos notes et vers JSON afin que votre script d’analyse puisse extraire chaque énoncé avec son heure de début, son heure de fin et son locuteur. Temps total de manipulation après le téléchargement : quelques minutes.

Citer avec précision grâce aux horodatages

Chaque énoncé de la transcription porte un horodatage, ce qui permet de citer le résultat en toute sécurité. Lorsque vous rédigez une citation pour un article, un rapport ou un article, notez l’horodatage à côté. Cela vous donne un point précis à réécouter lors de la vérification des faits, donne à un éditeur un moyen de vérifier la citation et vous donne quelque chose sur lequel pointer si une source conteste plus tard ce qu’elle a dit. La nécessité de ranger une citation une fois que vous l’avez obtenue, qu’il s’agisse de conserver chaque faux départ ou de lisser le texte dans une prose claire, est un choix de style qui mérite d’être fait exprès, et textuellement propre versus verbatim intégral définit les deux conventions.

L’exportation DOCX conserve les horodatages en ligne. Si vous avez besoin de la structure brute, l’exportation JSON vous remet des données au niveau de l’énoncé, chaque entrée avec une heure de début, une heure de fin, un locuteur et un texte, que vous pouvez traiter par programme. L’exportation TXT est la copie de lecture propre, et SRT vous donne des lignes de sous-titres chronométrées si l’interview doit se dérouler sous une vidéo.

Une limite à connaître : les horodatages sont au niveau de l’énoncé, pas au niveau du mot individuel. Pour la plupart des travaux d’entretien, c’est exactement ce que vous souhaitez, puisque vous citez une phrase et non une syllabe. Si vous avez spécifiquement besoin d’un timing au niveau des mots pour graver des sous-titres sur des séquences, le timing de ligne SRT est suffisamment proche pour presque tous les objectifs.

Problèmes courants et comment les résoudre

La plupart des enregistrements d’interviews sont transcrits proprement. Quand quelque chose ne va pas, il s’agit presque toujours d’un problème parmi une poignée d’autres, et chacun a une solution simple.

Un locuteur divisé en deux étiquettes. C’est le cas inattendu le plus fréquent. Cela signifie généralement que le son de cette personne a changé à mi-chemin : elle s’est rapprochée ou éloignée du micro, est passée d’un casque au haut-parleur ou la qualité de la ligne a changé lors d’un appel. Le moteur regroupe les voix selon leur signature sonore, de sorte qu’un changement important peut se lire comme une nouvelle voix. Fusionnez les deux étiquettes dans l’éditeur et le résultat est corrigé en un seul passage, comme dans l’exemple ci-dessus.

Deux personnes fusionnées en une seule étiquette. L’inverse. Cela se produit lorsque deux voix sont véritablement similaires ou lorsque l’enregistrement est silencieux et que les différences sont difficiles à entendre. Il est plus difficile de le corriger proprement après coup, c’est pourquoi deux entrées distinctes au moment de l’enregistrement, une par personne, constituent la meilleure assurance contre cela.

Diphonie et personnes qui se parlent. Lorsque les deux parlent en même temps, tout transcripteur, automatique ou humain, a du mal, car les mots se chevauchent physiquement dans l’audio. Attendez-vous à ce que les moments les plus chargés d’une interview animée nécessitent une réécoute manuelle. Les horodatages permettent de retrouver rapidement ces moments.

Accents forts ou termes spécialisés. La précision résiste bien à tous les accents, mais les noms propres inconnus, le jargon technique et les noms sont ceux où la transcription automatique est le plus susceptible de glisser. Effectuez une recherche et un remplacement pour la poignée de noms et de termes spécifiques à votre entretien, et confirmez ceux que vous avez l’intention de citer. Lorsque l’entretien est une conversation clinique ou de recherche riche en vocabulaire spécialisé, la transcription médicale pour la dictée et les entretiens explique comment gérer ces termes.

Un enregistrement silencieux ou distant. Si le sujet était loin du micro ou parlait doucement, la précision diminue dans tous les domaines et il n’y a pas de solution logicielle après coup. C’est le cas pour éviter que la section « avant d’enregistrer » existe. Si vous êtes coincé avec un enregistrement faible, transcrivez-le quand même sous forme de brouillon, puis corrigez-le par rapport à l’audio.

Un fichier très long ou volumineux. Un enregistrement peut durer jusqu’à 10 heures, sans limite de taille de fichier ; même un très gros enregistrement est préparé directement dans le navigateur. Divisez uniquement les enregistrements qui dépassent la limite de 10 heures, en utilisant une pause naturelle, puis transcrivez chaque partie.

Source audio ou source vidéo : laquelle télécharger

Si vous disposez à la fois d’un fichier audio et d’une vidéo de la même interview, téléchargez l’un ou l’autre. La transcription est identique, car Hushscript fonctionne à partir de l’audio dans les deux cas. La différence pratique est la confidentialité. Lorsque vous lui donnez une vidéo, l’audio est extrait dans votre navigateur et seul cet audio est envoyé, de sorte que la vidéo, souvent l’artefact le plus identifiant et le plus sensible, ne quitte jamais votre machine. Pour un entretien sensible, c’est le meilleur choix par défaut. Si vous disposez déjà d’un fichier audio uniquement, le téléchargement est le plus simple.

Garder les entretiens sensibles privés

Pour les entretiens portant sur des questions juridiques, des sources confidentielles, des dossiers RH ou des divulgations personnelles, la façon dont l’audio est traité compte au-delà de la qualité de la transcription. Hushscript est conçu exactement pour cela.

L’audio est supprimé du serveur au moment où la transcription est prête. Il n’y a pas de fenêtre de conservation ni de copie de sauvegarde de l’enregistrement quelque part par la suite. Si vous avez téléchargé une vidéo, seul l’audio extrait a été envoyé, et cela a également disparu. Le moteur vocal ne s’entraîne pas sur vos enregistrements, donc rien de ce que vous soumettez n’alimente un modèle.

Les transcriptions elles-mêmes sont cryptées au repos. En termes simples, si le stockage était violé, un attaquant trouverait un texte chiffré illisible, et non les mots de votre sujet. Il s’agit d’une protection contre les fuites, et non d’une affirmation selon laquelle nous ne pouvons pas lire vos transcriptions : la clé est conservée de notre côté afin que le produit puisse vous montrer votre propre travail. Cela signifie qu’une fuite de données, menace réaliste pour tout outil cloud, ne permet pas de transmettre un contenu d’interview lisible.

Pour les cas les plus graves, protection des sources dans le journalisme, matériel juridique privilégié, prenez la précaution standard : conservez votre propre copie hors ligne de l’audio et de la transcription finale sur un appareil que vous contrôlez, et ne traitez aucun service cloud, celui-ci inclus, comme la seule copie. Si vous souhaitez une image complète du traitement des données, la page de transcription privée la présente.

Si votre enregistrement est un podcast multi-hôtes plutôt qu’une interview individuelle, le flux de travail est le même et comment transcrire un podcast couvre les spécificités multi-voix.

Sources et normes indépendantes

Hushscript a consulté ces références indépendantes et non concurrentes. Elles présentent des recherches, des normes ou le fonctionnement de plateformes et ne constituent pas une recommandation de Hushscript.

Sources vérifiées le :

Questions fréquentes

Comment puis-je séparer l'intervieweur et le sujet dans la transcription ?

Hushscript étiquette automatiquement chaque locuteur, de sorte qu'un entretien à deux revient comme « Locuteur A » et « Locuteur B » sans configuration. Après la transcription, cliquez sur n'importe quelle étiquette, tapez le vrai nom (par exemple « Intervieweur » ou le nom de votre sujet), et le nom se met à jour sur chaque ligne prononcée par l'orateur. Un réétiquetage complet d'une interview de 90 minutes prend moins d'une minute.

Hushscript est-il suffisamment privé pour une interview sensible ?

L'audio est supprimé du serveur dès que la transcription est prête, sans fenêtre de conservation ni copie de sauvegarde. Si votre enregistrement est une vidéo, l'audio est d'abord extrait dans votre navigateur, de sorte que le fichier vidéo n'est jamais téléchargé. Les transcriptions sont également chiffrées au repos, ce qui signifie qu'une fuite de stockage exposerait un texte chiffré illisible plutôt que les mots de votre sujet.

Quels formats audio et quels paramètres offrent la meilleure précision ?

N'importe quel fichier audio ou vidéo courant fonctionne, vous pouvez donc déposer l'enregistrement tel quel. Pour plus de précision, un WAV ou FLAC à 16 kHz ou plus est idéal, et un MP3 à 128 kbps ou plus convient à la plupart des interviews. Le format importe bien moins que l'emplacement du microphone et une pièce calme, qui sont les véritables moteurs d'une transcription claire.

Combien de temps une interview peut-elle durer ?

Jusqu'à 10 heures, sans limite de taille de fichier. Un entretien de recherche de deux heures ou une séance d'histoire orale de quatre heures se déroule dans un seul fichier. Si un enregistrement dure plus de 10 heures, divisez-le selon une pause naturelle et transcrivez chaque partie.

Ai-je besoin du consentement pour enregistrer et transcrire une interview ?

Vous avez besoin du consentement pour enregistrer. De nombreuses juridictions prévoient le consentement d'une seule partie, mais plusieurs exigent que chaque personne participant à l'appel soit d'accord, et l'enregistrement d'une personne à son insu est inacceptable, quelle que soit la loi. Dites à votre sujet que vous enregistrez avant de commencer, et lors des appels à distance, obtenez un oui clair une fois l'enregistrement en cours.

Puis-je l'utiliser pour le journalisme où la confidentialité est importante ?

Hushscript est construit autour d'une rétention minimale : audio supprimé à la fin, vidéo jamais téléchargée, transcriptions cryptées et aucune formation sur vos enregistrements. Il n'existe aucune certification de conformité formelle, donc pour une protection des sources à enjeux élevés, conservez votre propre copie hors ligne de l'audio et de la transcription et ne traitez aucun outil cloud comme seule copie.

Combien coûte la transcription d'une interview ?

Hushscript est payant à l'utilisation, sans abonnement. Vous bénéficiez de 30 minutes gratuites pour essayer, qui couvrent une courte interview ou un segment d'une interview plus longue, puis vous achetez des minutes uniquement selon vos besoins. Consultez la page de tarification des packs actuels.

Puis-je citer directement la transcription en toute confiance ?

Oui. Chaque énoncé porte un horodatage, vous pouvez donc citer une citation avec le point exact de l'enregistrement d'où elle provient. Avant de publier une citation sensible, réécoutez une fois cet horodatage pour confirmer le libellé, car la transcription automatique est précise mais pas infaillible en cas de diaphonie ou de noms inconnus.

Commencer avec 30 minutes gratuites

Commencer – 30 minutes gratuites