Aller au contenu principal

Convertir un MP3 en texte avec identification des locuteurs

Auteur : Publié le : Dernière révision :

La conversion d’un MP3 en texte est l’une des tâches de transcription les plus courantes, et les étapes ne changent pas avec la source : un épisode de podcast, une interview enregistrée, une conférence ou un mémo vocal sur votre téléphone suivent tous le même flux. Téléchargez le fichier, attendez la transcription, exportez-le dans le format dont vous avez besoin.

Ce qui change, c’est la façon dont le MP3 lui-même affecte le résultat. La plupart des guides l’ignorent. Un MP3 est un fichier compressé avec perte, et le débit binaire auquel il a été enregistré fixe un plafond sur le niveau de détails avec lequel le moteur vocal doit travailler. Ce guide couvre les trois étapes, puis va plus loin : un exemple concret avec une sortie réelle étiquetée par un locuteur, ce que le débit signifie réellement pour la précision et comment réparer les enregistrements qui sortent mal.

Ce dont vous avez besoin

Il n’y a rien à installer ; pas d’application de bureau, pas d’extension de navigateur. Tout se déroule dans le navigateur et le compte.

Au-delà des minutes gratuites, la transcription est payante : vous achetez des minutes uniquement lorsque vous en avez besoin, sans abonnement. Les coûts figurent sur la page de tarification.

Convertissez un MP3 en texte en trois étapes

  1. Téléchargez votre fichier. Ouvrez /audio-to-text, puis faites glisser le MP3 sur la zone de dépôt ou cliquez pour parcourir. Les fichiers d’une durée maximale de 10 heures sont acceptés, sans limite de taille de fichier. Aperçu des 30 premières secondes directement dans le navigateur avant de vous connecter, afin que vous puissiez voir le style étiqueté du locuteur avant de vous engager.
  2. Laissez-le transcrire. Une fois que vous êtes connecté et que le fichier est téléchargé, le moteur vocal le traite et renvoie une transcription avec les locuteurs déjà séparés. Le temps de traitement varie et la tâche s’exécute en arrière-plan, vous n’avez donc pas besoin de garder l’onglet ouvert.
  3. Exporter. Téléchargez le résultat dans l’un des 21 formats. Cela couvre les formats TXT simple, SRT horodaté, Word DOCX, PDF et les formats de sous-titres et de chronologie de l’éditeur, ainsi qu’une archive .husharchive protégée par mot de passe. Chaque format est inclus, sans paywall sur les exportations ni filigrane sur aucun d’entre eux.

La transcription terminée s’ouvre dans votre tableau de bord. Les locuteurs apparaissent comme Locuteur A,Locuteur B, etc., et vous pouvez cliquer sur n’importe quelle étiquette pour la renommer en un vrai nom, ce qui met à jour chaque ligne de l’orateur.

Un exemple pratique : une interview à deux personnes

Disons que vous avez founder-interview.mp3: un Enregistrement de 42 minutes, 128 kbps, un intervieweur et un invité, enregistré lors d’un appel. Une fois que vous l’avez téléchargée, la transcription revient segmentée par tour de parole, avec un horodatage sur chacun :

[00:00:04] Locuteur A : Merci d'avoir pris le temps. Commençons par le début –
           d'où est venue réellement l'idée ?
[00:00:11] Locuteur B : Honnêtement, c'est parti d'un problème que nous avions nous-mêmes. Nous étions
           noyés sous les appels enregistrés et aucun d'entre eux n'était consultable.
[00:00:23] Locuteur A : Vous avez donc construit ce dont vous aviez besoin.
[00:00:25] Locuteur B : À peu près. La première version a été maintenue avec du ruban adhésif.

À partir de là, le montage est léger. Vous renommez Locuteur A en intervieweur et Locuteur B en invité une fois, et chaque ligne est mise à jour. Vous parcourez la poignée de noms propres que le moteur a devinés, comme le nom d’un produit ou le nom de famille d’une personne, et vous les corrigez avec la fonction Rechercher et remplacer, qui corrige chaque instance en un seul passage. Pour une interview propre à 128 kbps comme celle-ci, ce survol constitue généralement tout le nettoyage nécessaire avant que la transcription puisse être citée.

C’est là que la transcription qui étiquette gratuitement les locuteurs gagne sa place. Un mur de texte non divisé provenant d’une interview est presque inutile jusqu’à ce que vous l’ayez parcouru et marqué qui a dit quoi ; une transcription qui arrive déjà divisée en tours est quelque chose que vous pouvez citer immédiatement.

Ce que le débit signifie pour la précision

MP3 est un format avec perte : l’encodage supprime les parties de l’audio jugées les moins audibles pour garder le fichier petit. Le débit correspond au nombre de kilobits par seconde que l’encodeur dépense pour cela. Plus il est bas, plus il en rejette. La référence actuelle du codec MP3 de MDN documente les débits binaires et les fréquences d’échantillonnage pris en charge par le format et identifie sa compression comme avec perte.

La reconnaissance vocale s’appuie fortement sur les détails haute fréquence des consonnes. La différence entre « quinze » et « seize », ou « peut » et « ne peut pas », réside là. La compression agressive est exactement là où ce détail passe en premier. Le débit ne dégrade donc pas une transcription de manière uniforme ; il mange les mots les plus difficiles à entendre aux limites de la parole.

En pratique :

Quelques précisions qui évitent un réencodage inutile. Le débit binaire variable (VBR) convient ; il n’a aucune pénalité de précision par rapport au ** débit binaire constant (CBR)** pour la parole, donc ne convertissez pas un fichier VBR juste pour le “réparer”. Et le ** mono fonctionne aussi bien que le stéréo** pour la transcription, puisque la voix n’a pas besoin de deux canaux. Si quoi que ce soit, consultez la note sur les doubles-enders stéréo ci-dessous.

MP3 ou sans perte : quand réenregistrer à la place

Une question naturelle est de savoir si la conversion d’abord de votre MP3 vers un format sans perte comme WAV serait utile. Ce ne sera pas le cas. Une fois l’audio enregistré au format MP3 à 128 kbps, les détails manquants ont disparu ; envelopper ce même audio dans un conteneur WAV crée simplement un fichier plus gros qui ne contient aucune information supplémentaire. Si vous enregistrez récemment et que vous avez le choix, une source sans perte ou à haut débit est le meilleur point de départ (voir le guide WAV en texte pour ce cas), mais convertir un MP3 existant vers le haut ne rapporte rien.

La règle de décision honnête : si votre seule copie est un MP3 à débit raisonnable, transcrivez-la telle quelle. Si l’enregistrement est vraiment mauvais (écrêté, enfoui dans le bruit ou enregistré à 32 kbps) et que vous pouvez le capturer à nouveau, le réenregistrement sera bien plus utile que n’importe quelle conversion. Lorsque vous effectuez un nouvel enregistrement, deux habitudes comptent plus que le débit : rapprochez le microphone de celui qui parle et donnez à chaque personne son propre micro si vous le pouvez, car une séparation nette à la source est ce qui fait que les mots et les étiquettes du locuteur ressortent correctement.

Résoudre les problèmes courants

La plupart des transcriptions approximatives remontent à l’enregistrement, pas à l’outil. Voici ce qu’il faut faire face aux coupables habituels.

Volume faible. Si la forme d’onde semble plate (un enregistrement très silencieux), le moteur a moins de signal avec lequel travailler et la précision diminue. Normalisez ou amplifiez d’abord l’audio dans n’importe quel éditeur audio, puis téléchargez la version la plus forte. Le niveau d’amplification est l’une des solutions les plus rentables pour un enregistrement faible.

Bruit de fond. Le bruit constant (un climatiseur, un bourdonnement de la route) est raisonnablement bien géré ; un bruit soudain qui chevauche la parole, comme une porte, une toux ou des couverts, est à l’origine des mots perdus. Si vous pouvez exécuter une légère passe de réduction du bruit avant de télécharger, faites-le, mais ne sur-traitez pas : un débruitage important introduit des artefacts qui nuisent plus à la précision que le bruit.

Accents prononcés ou vocabulaire spécialisé. Les moteurs modernes gèrent bien une large gamme d’accents anglais. Les erreurs fiables sont des termes de domaine auxquels le moteur n’a aucune raison de s’attendre, comme les noms de médicaments, les citations légales ou les noms de marques de niche. Prévoyez un survol après l’exportation pour les détecter, et appuyez-vous sur la recherche et le remplacement : si le nom d’une entreprise se trompe de la même manière à chaque fois, une correction balaie tout le fichier.

MP3 très longs. Un enregistrement de 6 heures n’est pas un problème en soi. Le plafond de 10 heures couvre presque tout, et il n’y a pas de limite de taille de fichier, il n’est donc pas nécessaire de découper d’abord un long fichier en morceaux. Ce qui dégrade réellement un long fichier, c’est la dérive de la qualité d’enregistrement : un locuteur qui s’éloigne du micro, un niveau qui baisse après la première heure, une salle qui se remplit et devient de plus en plus bruyante. Dans la mesure du possible, maintenez la source stable ; là où vous ne pouvez pas, attendez-vous à ce que les tronçons les plus grossiers nécessitent plus de modifications que les plus propres. Les horodatages rendent cela facile à gérer : vous pouvez accéder directement au patch qui lit mal au lieu de réécouter le tout.

locuteurs superposés. Lorsque deux personnes parlent en même temps, le moteur attribue les mots à la voix la plus forte, une limitation de la séparation des locuteurs en général, et non d’un seul outil. Il n’y a pas de correctif côté téléchargement ; budget d’édition pour les sections de diaphonie d’un enregistrement de groupe animé.

Garder les locuteurs proprement séparés

La séparation des locuteurs (diarisation) s’exécute sur chaque transcription sans frais supplémentaires, et quelques éléments au niveau MP3 affectent la pureté du résultat. Si vous souhaitez en savoir plus sur son fonctionnement sous le capot, consultez qu’est-ce que la diarisation des locuteurs ; les points pratiques ici :

Exporter votre transcription

Le bon format dépend de ce que vous faites avec le texte. Le tableau ci-dessous répertorie ceux que les gens recherchent le plus, parmi les 21 formats proposés ; pour connaître tous les compromis, consultez de quel format de transcription vous avez réellement besoin :

Format Idéal pour
TXT Notes, copier-coller, insérer le texte dans un autre outil
SRT Sous-titres sur une vidéo, ou navigation par horodatage ; C’est également le bon choix si votre source est un fichier vidéo tel que MP4
VTT Sous-titres Web et lecteurs vidéo natifs du navigateur
CSV Révision de feuilles de calcul et données légères transfert
Markdown Notes de publication, fichiers de style README et brouillons modifiables
JSON Traitement programmatique et outils personnalisés
DOCX Partage avec des éditeurs ou des annotateurs qui travaillent dans Word
PDF Partage et archivage en lecture seule

Chaque exportation inclut les étiquettes et les horodatages du locuteur, sans filigrane sur aucun d’entre eux.

Horodatage et édition

L’éditeur affiche chaque énoncé avec son heure de début, son étiquette du locuteur et son texte. Cliquez sur n’importe quelle ligne pour lire ce segment de l’audio par rapport au texte. C’est pratique pour vérifier un passage délicat sans parcourir tout le fichier à la main.

Les horodatages dans l’exportation SRT se situent au niveau de l’énoncé : une entrée par tour de locuteur, pas par mot. Pour le sous-titrage, la navigation et les citations avec horodatage, c’est la bonne granularité. Si vous avez besoin d’une structure au niveau des mots à traiter dans le code, exportez JSON : chaque entrée vous donne l’étiquette du locuteur, l’heure de début et de fin en millisecondes et le texte de ce tour.


Télécharger, transcrire, exporter : c’est tout le travail, avec les détails spécifiques au MP3 qui décident de la propreté du résultat. La page MP3-to-text présente un aperçu complet des fonctionnalités, et si vous travaillez avec un enregistrement dans un autre conteneur, la page audio-to-text couvre tous les formats de la même manière. Faire un spectacle entier ? Le guide de transcription de podcast explique comment transformer la transcription en notes d’épisode, et si votre fichier est un WAV plutôt qu’un MP3, le guide WAV-to-text contient des notes sur la gestion des fichiers volumineux sans perte.

Sources et normes indépendantes

Hushscript a consulté ces références indépendantes et non concurrentes. Elles présentent des recherches, des normes ou le fonctionnement de plateformes et ne constituent pas une recommandation de Hushscript.

Sources vérifiées le :

Questions fréquentes

Quelle est la taille maximale de fichier MP3 que je peux télécharger ?

Jusqu'à 10 heures par fichier, sans limite de taille de fichier. Chaque fichier puise dans vos minutes prépayées ; la sécurité du service et les garanties de travail actif s'appliquent également.

Le débit binaire MP3 affecte-t-il la précision de la transcription ?

En dessous d'environ 64 kbps, cela peut. La compression à des débits binaires très faibles macule les consonnes sur lesquelles repose la reconnaissance vocale, de sorte que les mots situés à la limite de la parole sont perdus. À 128 kbit/s ou plus, vous avez déjà dépassé le point où le débit binaire compte, et un nombre plus élevé n'améliorera pas la transcription.

Puis-je obtenir un fichier de sous-titres SRT à partir d'un MP3 uniquement audio ?

Oui. Hushscript exporte SRT, TXT, DOCX et JSON à partir de n'importe quelle source. Le SRT contient des horodatages par énoncé même si l'entrée était audio sans vidéo attachée, vous pouvez donc le déposer directement sur une vidéo plus tard.

Ai-je besoin d'une carte de crédit pour commencer ?

Non. Une carte n’est que le moyen le plus rapide d’accéder aux 30 minutes gratuites. Une retenue de 1 $ le valide, puis le libère immédiatement et n'est jamais facturé. Si vous préférez utiliser un autre mode de paiement disponible dans votre pays, vos 30 minutes arrivent avec votre premier pack de minutes.

Qu'arrive-t-il à mon MP3 une fois qu'il a été transcrit ?

Il est supprimé du serveur dès que la transcription est prête. Rien n'est conservé pour le stockage ou la formation du modèle. Vous pouvez également supprimer la transcription elle-même de votre tableau de bord en un clic.

Quelle est la précision de la séparation des locuteurs sur un MP3 ?

Les étiquettes des locuteurs sont plus fiables lorsque les gens se relaient et que l'enregistrement est raisonnablement propre. Un entretien à deux se sépare généralement clairement ; un appel de groupe bruyant avec des personnes qui parlent entre elles nécessitera ensuite davantage d'édition manuelle.

Un MP3 à débit binaire variable (VBR) fonctionnera-t-il ?

Oui. VBR, c'est bien. Il ne présente aucun inconvénient en termes de précision par rapport au débit binaire constant (CBR) pour la parole. Mono et stéréo fonctionnent également ; vous n'avez pas besoin de ré-encoder quoi que ce soit avant de télécharger.

Peut-il transcrire un MP3 qui n'est pas en anglais ?

Oui. La langue est détectée automatiquement dans environ 99 langues. Un enregistrement propre dans une seule langue retranscrit mieux ; Les changements de code lourds au milieu d'une phrase sont plus difficiles pour n'importe quel moteur.

Commencer avec 30 minutes gratuites

Commencer – 30 minutes gratuites