Aller au contenu principal

Comment transcrire un podcast et créer des notes d’épisode

Auteur : Publié le : Dernière révision :

Une transcription de podcast gagne deux fois sa récompense. Il rend l’épisode consultable et accessible aux auditeurs qui lisent plutôt qu’écoutent, et il vous donne de la matière première pour les notes de l’épisode, les citations et les sous-titres sans relire l’intégralité de l’enregistrement. La prise en charge de la plate-forme est concrète et non théorique : Apple Podcasts documente les transcriptions et la navigation dans les chapitres pour les créateurs. Ce guide explique comment transcrire un épisode, étiqueter chaque hôte et invité et transformer le résultat en un document de notes d’épisode utilisable.

La partie qui permet de gagner le plus de temps est la séparation des locuteurs. Une transcription qui se lit comme un bloc de texte indivis représente presque autant de travail à utiliser que l’audio lui-même. Hushscript étiquette automatiquement chaque voix et l’inclut gratuitement dans chaque transcription, afin que la conversation revienne comme une conversation.

Ce dont vous avez besoin avant de commencer

Un enregistrement de l’épisode, dans n’importe quel format audio ou vidéo courant. Si vous avez exporté un fichier audio brut depuis votre éditeur (MP3, WAV, M4A), cela fonctionne directement. Si votre seule copie est l’enregistrement vidéo de Zoom, Riverside ou Ecamm, cela fonctionne également et l’audio en est extrait dans votre navigateur afin que la vidéo ne soit jamais téléchargée.

L’audio source propre est plus utile que toute autre chose. Les étiquettes de locuteurs fonctionnent mieux lorsque chaque voix est distincte et que les gens ne se parlent pas constamment. Si vous avez enregistré chaque participant sur une piste distincte, vous disposez déjà de l’entrée la plus propre possible. Une seule piste mixée fonctionne toujours ; il s’appuie simplement plus fort sur la diarisation pour distinguer les voix. Si vous le pouvez, enregistrez les voix à sec et ajoutez ensuite la musique dans votre éditeur, car un jingle exécuté en continu est la seule chose qui diminue de manière fiable la précision.

Vous aurez besoin d’un compte pour transcrire un épisode complet. L’aperçu de 30 secondes est l’étape sans compte, vous pouvez donc vérifier les étiquettes de locuteur et la qualité du texte sur votre fichier réel avant de vous inscrire à quoi que ce soit.

Transcrire l’épisode

Le flux suit l’ordre réel de l’entonnoir : prévisualisez d’abord, puis inscrivez-vous, puis transcrivez le reste.

  1. Déposez le fichier sur /podcast-transcription. Hushscript extrait les 30 premières secondes de votre navigateur et renvoie un aperçu étiqueté par le locuteur. Aucun compte n’est nécessaire pour cette étape. Vous voyez exactement comment l’hôte et l’invité sont divisés et à quel point le texte est clair sur votre propre audio.
  2. Inscrivez-vous pour transcrire le reste. Une fois que vous avez saisi votre e-mail et connecté, vous téléchargez l’épisode complet. Les nouveaux comptes bénéficient de 30 minutes gratuites pour essayer, accordées une fois. Le moyen le plus rapide de les réclamer est un chèque de carte de 1 $ autorisé puis immédiatement libéré, jamais facturé. Si vous préférez un mode de paiement alternatif disponible dans votre pays, les 30 minutes arrivent avec votre premier achat ; une carte n’est pas requise.
  3. Laissez la transcription s’exécuter, puis exportez-la. La transcription revient avec une étiquette et un horodatage sur chaque énoncé. Exportez DOCX pour un document que vous modifierez dans les notes de l’épisode, TXT pour un bloc propre à coller dans votre CMS, SRT pour les sous-titres d’une version vidéo ou JSON si votre hébergeur de podcast accepte les téléchargements de transcriptions au niveau de l’énoncé.

Les 30 minutes gratuites peuvent couvrir un épisode court ou une section représentative d’un épisode plus long. Un épisode de 60 minutes utilise 60 minutes de votre solde, il nécessite donc une recharge après l’allocation d’essai.

Étiquetez chaque hôte et invité

La diarisation des intervenants s’exécute automatiquement afin que vous n’activiez rien. Pour un épisode à deux (un animateur, un invité), la transcription revient proprement divisée, chaque ligne étant attribuée à l’une des deux étiquettes. Pour un panneau, Hushscript sépare autant de voix distinctes qu’il entend, sans plafond de locuteurs.

Pour remplacer les étiquettes génériques par de vrais noms :

  1. Cliquez sur n’importe quelle instance de Locuteur A dans l’éditeur.
  2. Tapez le nom, tel que “Alex” ou “Host”.
  3. Chaque instance de cette étiquette est mise à jour tout au long de la transcription en même temps.

Vous réétiquetez chaque voix une fois, et non ligne par ligne. Un épisode à deux dure environ une minute ; un panel de quatre personnes en prend quelques-uns. Après le réétiquetage, une partie de la transcription se lit comme ceci :

Alex [00:03:12] : Vous dirigiez donc l'entreprise à ce moment-là. Quels ont été les premiers signes ?
Jamie [00:03:19] : Honnêtement, c'étaient les chiffres. Nous avons eu une baisse de 40 % en un trimestre.
Alex [00:03:27] : Et vous ne pouviez pas l'expliquer à l'époque ?
Jamie [00:03:35] : Pas depuis des semaines. C'est la partie qui m'a tenu éveillé.

C’est la structure dont vous avez besoin pour extraire des citations et écrire des chapitres horodatés. Étant donné que les étiquettes portent sur l’ensemble du fichier, un long épisode est étiqueté une seule fois. Pour connaître les mécanismes derrière la séparation des voix, consultez comment fonctionne la diarisation des locuteurs.

Lorsque les étiquettes ont besoin d’être corrigées

La diarisation est précise sur des enregistrements propres, mais pas infaillible, et quelques modèles valent la peine d’être connus afin que vous puissiez les corriger rapidement.

Si deux invités ont des sentiments très similaires. voix, une ligne occasionnelle peut atterrir sur le mauvais interlocuteur. Scannez la transcription avec l’audio ouvert et réattribuez manuellement les quelques lignes mal attribuées. C’est beaucoup plus rapide que de saisir les noms des intervenants à partir de zéro, car vous ne corrigez que les exceptions.

Si un co-animateur discret qui parle à peine est fusionné dans un autre label, donnez d’abord aux intervenants principaux leurs vrais noms, puis recherchez la poignée de lignes qui devraient appartenir à la voix calme. Sur un enregistrement bien séparé, vous rencontrez rarement l’un ou l’autre des cas, c’est pourquoi une piste distincte par personne vaut la petite configuration supplémentaire au moment de l’enregistrement.

Problèmes courants et leurs causes réelles

La plupart des problèmes de transcription remontent à l’enregistrement, pas à l’outil. Quelques-unes valent la peine d’être planifiées avant de publier une émission.

La diaphonie et les gens qui parlent entre eux. C’est la chose la plus difficile pour tout système de séparation des locuteurs, car deux voix au même instant ne peuvent pas être clairement séparées. Le texte reste généralement lisible, mais un moment de chevauchement important peut atterrir sur un locuteur ou devenir flou au niveau de la couture. Une bonne hygiène des podcasts est déjà utile ici : un hôte qui laisse les invités terminer produit une transcription plus claire comme effet secondaire. Lorsque cela se produit, corrigez ces quelques lignes à la main avec l’audio.

Invités distants enregistrés sur une seule piste. Un appel enregistré sous la forme d’un seul fichier mixé est plus difficile à séparer que le même appel capturé sous forme de piste par participant. Si votre outil prend en charge l’enregistrement local par participant, utilisez-le ; si vous n’avez que le fichier mixte, la transcription apparaît toujours, elle repose simplement davantage sur la diarisation. Quoi qu’il en soit, l’audio est le même téléchargement, il n’y a donc rien de différent à faire au moment de la transcription.

Accents forts et changement de code. Hushscript détecte automatiquement la langue et transcrit environ 99 langues, avec une précision optimale dans dix-huit d’entre elles, de sorte qu’un invité avec un accent prononcé dans une langue prise en charge est bien géré. Un invité qui bascule entre deux langues au milieu d’une phrase est le cas véritablement difficile ; attendez-vous à nettoyer les phrases commutées à la main. Pour la liste complète des langues prises en charge, consultez la page des langues.

Musique d’introduction et stingers. Un lit de musique entre les segments est généralement ignoré plutôt que transcrit comme un non-sens. Les problèmes ne commencent que lorsque la musique est diffusée en continu pendant une longue période. La solution claire est éditoriale : enregistrez les voix à sec et déposez la musique ensuite, de sorte que la transcription ne voit que la parole.

Noms, jargon et orthographe des marques. Un invité spécialisé utilisera des termes et des noms de produits que le modèle peut rendre phonétiquement. Ces problèmes sont rapides à corriger car ils se répètent, et une recherche et remplacement sur le document exporté gère une faute d’orthographe récurrente en un seul passage.

Quelques conseils de précision

Le plus grand levier est la qualité de l’enregistrement, donc les efforts consacrés aux microphones et à une pièce calme sont récompensés au moment de la transcription. Au-delà de cela, une piste par locuteur donne à la fois le texte le plus clair et les étiquettes de locuteur les plus claires, puisque le système n’a jamais besoin de démêler deux voix d’une même forme d’onde. Gardez le micro d’un invité proche et cohérent plutôt que de dériver, et vous passerez votre temps d’édition sur le fond plutôt que sur les réparations.

Lorsque vous effectuez une relecture, lisez avec l’audio ouvert et corrigez par passes : les étiquettes des locuteurs d’abord, puis les noms et le jargon mal entendus, puis les chevauchements occasionnels. Travailler par catégorie est plus rapide que lire de haut en bas, et cela vous laisse un document suffisamment propre pour être publié.

De la transcription à l’affichage des notes

Afficher les notes ne sont pas un résumé de tout ce qui est dit. Ils constituent une aide à la navigation pour les auditeurs et une surface de recherche pour les personnes qui n’ont pas encore appuyé sur Play. Une structure qui fonctionne pour la plupart des émissions d’interviews et de conversations :

Résumé de l’épisode, deux à quatre phrases. Extrayez le sujet principal de la transcription. Quel est l’argument central, l’histoire ou le point à retenir ? Écrivez-le pour que quelqu’un décide de l’écouter.

Chapitres horodatés. Parcourez la transcription pour détecter les changements de sujet. Chaque fois que la conversation aborde un nouveau sujet, notez l’horodatage et rédigez une description sur une ligne. Les horodatages proviennent directement de la transcription, vous ne les réécoutez donc jamais pour les retrouver.

[00:02:15] Lancer l'entreprise sans budget marketing
[00:14:30] La baisse des revenus de 40 % et ses causes
[00:28:44] Reconstruire : ce qui a changé en interne
[00:51:00] Conseils aux fondateurs occupant le même poste

Citations clés. Tirez deux ou trois lignes qui capturent les principales revendications de l’épisode ou ses moments les plus cités. Citez textuellement la transcription et attribuez chacun à l’orateur par son nom. Qu’il s’agisse d’exécuter une citation exactement telle qu’elle est prononcée ou de couper le remplissage et les faux départs pour des notes d’épisode plus claires est un appel qui mérite d’être fait exprès, et verbatim épuré et verbatim intégral parcourt les deux. Étant donné que le texte est consultable, trouver le libellé exact d’une ligne dont vous vous souvenez à moitié prend quelques secondes.

Liens et ressources invités. Ajoutez tout ce que l’invité a mentionné. Pour trouver rapidement des URL parlées, recherchez dans la transcription des fragments tels que « dot com » ou « slash » ; les gens prononcent des adresses Web à voix haute plus souvent que prévu, et une transcription textuelle les capture.

Transcription complète, facultative mais précieuse. Collez le texte intégral sous les notes ou créez un lien vers une page de transcription distincte. C’est là que réside la valeur de la recherche, car le contenu parlé devient indexable. Si votre plate-forme hôte accepte les téléchargements de transcriptions, l’exportation JSON contient des données au niveau de l’énoncé ; sinon, le texte brut suffit.

Un exemple concret

Disons que vous avez enregistré une interview d’un fondateur de 58 minutes sous forme de deux pistes et que vous les avez mixées en un seul MP3. Vous déposez le MP3 sur /podcast-transcription, regardez l’aperçu de 30 secondes diviser correctement l’hôte et l’invité, vous inscrivez et téléchargez le fichier complet. La transcription revient avec Locuteur A et Locuteur B; vous les renommez « Alex » et « Jamie » en deux clics. À partir de là, le résumé provient des deux premières minutes, les quatre chapitres ci-dessus proviennent de la recherche de changements de sujet et les deux citations proviennent de la recherche dans le texte des moments dont vous vous souvenez. Les notes du début à la fin du spectacle durent environ quinze minutes, la plupart étant votre propre édition plutôt que d’attendre ou de transcrire.

Ajouter des légendes ou des sous-titres

Si vous publiez une version vidéo de l’épisode sur une plate-forme telle qu’un hébergeur vidéo, une vidéo Spotify ou LinkedIn, l’exportation SRT est un fichier de sous-titres chronométré prêt à être téléchargé. Il n’y a aucune étape supplémentaire, car la transcription que vous avez déjà générée contient les données de synchronisation. Pour connaître le processus plus large d’obtention de sous-titres sur un clip, y compris les fichiers gravés et les fichiers side-car, consultez comment ajouter des sous-titres à une vidéo.

Si votre point de départ est un enregistrement vidéo plutôt qu’une exportation audio, le processus est identique ; l’audio est d’abord extrait dans votre navigateur. La page vidéo en texte couvre ce chemin dans son intégralité.

Épisodes longs et en plusieurs parties

Pour un épisode de long métrage ou un enregistrement en direct, Hushscript prend en charge les téléchargements jusqu’à 10 heures, sans limite de taille de fichier. Un panel de quatre heures ou un épisode au format documentaire est traité comme un seul fichier plutôt que d’être divisé en morceaux, ce qui est important pour deux raisons. Les étiquettes des locuteurs restent cohérentes dans l’ensemble du fichier, vous devez donc les renommer une fois. Et les horodatages sont continus, donc un chapitre après trois heures indique [03:12:40] plutôt que de redémarrer à partir de zéro dans la deuxième partie.

Si vous enregistrez une série en plusieurs parties en une seule session, transcrivez toute la session dans un seul fichier et divisez ensuite les notes de l’épisode en parties. Couper d’abord l’audio ne fait que multiplier le travail de réétiquetage.

Pourquoi cela devient rapide

Pour une cadence de publication régulière, hebdomadaire ou bihebdomadaire, la routine de transcription pour afficher les notes se compresse en minutes par épisode une fois que vous l’avez fait plusieurs fois : supprimez le fichier, réétiquetez les intervenants, recherchez les chapitres, extrayez les citations, exportez. Les labels d’locuteurs effectuant l’attribution gratuitement sont ce qui supprime la partie fastidieuse. Vous consacrez votre temps au jugement éditorial dont les notes ont réellement besoin, pas à déterminer qui a dit quoi.

Sources et normes indépendantes

Hushscript a consulté ces références indépendantes et non concurrentes. Elles présentent des recherches, des normes ou le fonctionnement de plateformes et ne constituent pas une recommandation de Hushscript.

Sources vérifiées le :

Questions fréquentes

Comment puis-je étiqueter l'hôte et chaque invité dans la transcription ?

Hushscript sépare automatiquement les locuteurs avec des étiquettes telles que « Locuteur A » et « Locuteur B ». Après la transcription, cliquez sur n'importe quelle étiquette dans l'éditeur, tapez le vrai nom et il se met à jour partout où ce locuteur apparaît. Un épisode à deux prend environ une minute pour être réintitulé ; un panel à quatre voix prend quelques minutes.

Les étiquettes de locuteur entraînent-elles un coût supplémentaire ?

Non. Les étiquettes des orateurs sont incluses gratuitement sur chaque transcription produite par Hushscript, sans frais par orateur ni plafond sur le nombre de voix. De nombreux outils font passer cela derrière un niveau supérieur ; ici, il fait partie de la sortie standard.

Puis-je transcrire un enregistrement vidéo du podcast ?

Oui. Si vous disposez d'un fichier vidéo tel que MP4, MOV ou MKV, l'audio est extrait dans votre navigateur avant tout téléchargement, de sorte que la vidéo reste sur votre appareil. Seul l'audio extrait atteint le serveur, ce qui empêche également un fichier vidéo volumineux d'obstruer votre connexion.

Combien de temps puis-je transcrire un épisode en une seule fois ?

Jusqu'à 10 heures par téléchargement, sans limite de taille de fichier. Un épisode de 60 minutes, une plongée approfondie de deux heures ou un enregistrement en direct de quatre heures sont tous traités dans un seul fichier, vous devez donc réétiqueter les locuteurs une fois plutôt que d'assembler les parties.

Quels formats d'exportation Hushscript produit-il ?

TXT, SRT, VTT, CSV, TSV, Markdown, HTML, RTF, XML, JSON, DOCX, PDF et .husharchive protégé par mot de passe, sans filigrane. Pour afficher les notes, DOCX vous propose un document formaté à modifier directement. SRT vous propose des sous-titres chronométrés si vous publiez une version vidéo. JSON vous fournit des données au niveau de l'énoncé si vous alimentez un hébergeur de podcast qui accepte les téléchargements de transcriptions.

Dois-je transcrire l'intégralité de l'épisode pour rédiger des notes d’épisode ?

Pour des horodatages précis et des citations textuelles, oui. Vous pouvez rédiger des notes approximatives de mémoire, mais les marqueurs de chapitre, les citations exactes et une transcription complète consultable proviennent tous du texte complet. L'aperçu de 30 secondes vous montre la qualité avant de vous engager dans l'épisode complet.

Une musique de fond ou un jingle d'introduction perturbera-t-il la transcription ?

La musique entre les segments est généralement ignorée ou non transcrite, et un court jingle sous une voix pose rarement des problèmes. Si un lit musical fonctionne sous une parole continue, la précision sur cette partie peut diminuer. Enregistrer des voix propres et ajouter ensuite de la musique dans votre éditeur donne la meilleure transcription.

Quelle est la précision de la transcription pour un podcast clairement enregistré ?

Sur un enregistrement propre à deux micros avec peu de diaphonie, le texte est suffisamment précis pour être publié après une relecture rapide. La précision dépend principalement de la qualité de l'enregistrement, des accents et de la fréquence à laquelle les invités se parlent, et non du format de fichier que vous téléchargez.

Commencer avec 30 minutes gratuites

Commencer – 30 minutes gratuites