Comment transcrire n'importe quel fichier audio en texte
Auteur : Hushscript Publié le : Dernière révision :
Un MP3 provenant d’un éditeur de podcast, un M4A de votre iPhone, un WAV d’un enregistreur de terrain, un obscur CAF d’une application d’enregistrement vocal : pour transcrire n’importe lequel d’entre eux, vous faites la même chose. Déposez le fichier, obtenez une transcription avec les intervenants déjà séparés, exportez-le dans le format dont vous avez besoin. Le conteneur dans lequel l’audio est entré ne change pas les étapes.
Ce que le format affecte est un peu plus bas : la taille du fichier, la précision de sa transcription et que faire dans les rares occasions où un fichier ne se charge pas. Ce guide explique quels formats audio fonctionnent, la méthode qui les gère tous, comment choisir le meilleur format lorsque vous avez le choix et comment réparer les fichiers qui sortent mal.
Ce dont vous avez besoin
- Un fichier audio (ou vidéo). L’un des formats courants ci-dessous. Il n’y a rien à installer : pas d’application de bureau, pas d’extension. Tout se déroule dans le navigateur et dans votre compte.
- Un compte Hushscript, pour la transcription complète. Vous bénéficiez de 30 minutes gratuites pour essayer. Le moyen le plus rapide de les débloquer est d’ajouter une carte : une retenue de 1 $ la valide, puis se libère immédiatement et n’est jamais facturée. Si vous préférez ne pas utiliser de carte, un mode de paiement alternatif fonctionne également et les 30 minutes arrivent avec votre premier achat.
L’aperçu de 30 secondes ne nécessite aucun compte. Vous pouvez déposer un fichier et voir le style étiqueté du locuteur avant de vous inscrire, ce qui est le moyen honnête de vérifier les résultats avant de commettre quoi que ce soit. Au-delà des minutes gratuites, la transcription est payante : vous achetez des minutes uniquement lorsque vous en avez besoin, sans abonnement. Les coûts figurent sur la page de tarification.
Quels formats audio fonctionnent
Hushscript prend tous les formats audio standards. Voici d’où chacun tend à provenir, afin que vous puissiez reconnaître ce que vous avez :
Les noms ne sont pas de simples conventions de nom de fichier. Le registre des types de médias IANA enregistre les types standardisés tels que audio/aac,audio/mp4,audio/mpeg,audio/ogg et audio/opus, c’est pourquoi le conteneur et l’encodage audio qu’il contient sont des questions distinctes.
| Format | Source commune |
|---|---|
| MP3 | Podcasts, enregistrements téléphoniques, exportations depuis la plupart des applications d’enregistrement |
| M4A / AAC | Mémos vocaux iPhone, notes vocales WhatsApp, exportations Apple |
| WAV | Enregistreurs numériques, exportations DAW, enregistreur vocal Windows |
| FLAC | Enregistrements d’archives, exportations DAW, extractions sans perte |
| OGG | Notes vocales Android, outils d’enregistrement open source |
| AIFF / CAF | Audio Mac et iOS, GarageBand |
Les fichiers vidéo fonctionnent de la même manière. Déposez un MP4, MOV, WebM ou MKV et la piste audio est extraite dans votre navigateur avant tout téléchargement, de sorte que la vidéo elle-même ne quitte jamais votre appareil ; seul l’audio atteint le serveur.
La liste ci-dessus n’est pas une clôture. La promesse est plus simple qu’un tableau des formats pris en charge : déposez simplement votre fichier et il sera converti et transcrit. Si vous avez quelque chose de vraiment inhabituel (un fichier AMR d’un vieux Nokia, un .3gp d’un Android vieux de dix ans, un clip RealAudio), essayez quand même de le télécharger. Le navigateur peut lire la plupart des conteneurs standard, et s’il ne le peut pas, vous avez deux solutions de secours : convertissez-le en MP3 ou WAV avec les outils gratuits du navigateur à l’adresse /tools et téléchargez-le, ou envoyez un e-mail à support@hushscript.com et nous ajouterons le format. Vous n’avez pas besoin de déterminer à l’avance si votre fichier est éligible.
Transcrivez un fichier audio en trois étapes
Le flux est identique quel que soit le format avec lequel vous commencez. La première étape a lieu avant que vous ayez un compte.
- Déposez votre fichier pour le prévisualiser. Accédez à /audio-to-text et faites glisser le fichier sur la zone de dépôt, ou cliquez pour parcourir. Les 30 premières secondes sont transcrites directement dans le navigateur, étiquetées par le locuteur, sans qu’aucun compte ne soit nécessaire. Ceci vous permet de vérifier que le résultat se lit comme vous le souhaitez avant de vous inscrire à quoi que ce soit.
- Inscrivez-vous pour transcrire le reste. Saisissez votre adresse e-mail pour créer un compte. Vos 30 minutes gratuites se débloquent lorsque vous ajoutez et validez une carte (la retenue de 1 $ décrite ci-dessus) ou lors de votre premier achat si vous payez d’une autre manière. Le fichier complet est téléchargé à partir d’ici. Un enregistrement peut durer jusqu’à 10 heures, sans limite de taille de fichier : même un très gros fichier est préparé directement dans le navigateur. Les garanties de sécurité du service et d’emploi actif s’appliquent également.
- Récupérez et exportez la transcription. Le moteur vocal traite le fichier et renvoie une transcription avec les locuteurs déjà séparés. Renommez les locuteurs si vous le souhaitez, puis téléchargez-le dans l’un des 21 formats (notamment TXT, SRT, DOCX et PDF, ainsi que les formats de sous-titres et de chronologie de l’éditeur) ou dans une archive .husharchive protégée par mot de passe. Chaque exportation est incluse : pas de paywall, pas de filigrane.
Le traitement s’exécute en arrière-plan et s’adapte à la durée de l’audio (environ quelques minutes par heure d’enregistrement), vous n’avez donc pas besoin de garder l’onglet ouvert pendant la fin d’un long fichier.
Un exemple concret : un enregistrement, deux formats
Disons que vous avez enregistré un Une conversation de 38 minutes et votre enregistreur l’a enregistrée deux fois : un meeting.wav en pleine qualité et un meeting.m4a créé par votre téléphone en même temps. Les deux passent par les trois étapes identiques, et la transcription revient segmentée par tour de parole, avec un horodatage sur chacun :
[00:00:06] Locuteur A : Avant de commencer, est-ce que tout le monde a reçu les chiffres que j'ai envoyés ?
[00:00:10] Locuteur B : Je les ai reçus ce matin. Le numéro du troisième trimestre est celui que je veux
explorer.
[00:00:17] Locuteur A : C'est vrai, c'est donc la ligne qui a bougé. Laissez-moi le récupérer.
[00:00:21] Locuteur C : Pendant que vous le faites, pouvons-nous revenir à l'embauche après ?
Les deux fichiers produisent essentiellement la même transcription. Le WAV est un téléchargement beaucoup plus volumineux et le M4A un petit, mais les mots et les étiquettes du locuteur atterrissent de la même manière, car les deux véhiculent le même discours sous-jacent. A partir de là, l’édition est légère : vous cliquez une fois sur Locuteur A pour le renommer, et chaque ligne de ce locuteur est mise à jour ; vous parcourez la poignée de noms propres que le moteur a devinés (un nom de famille, un nom de produit) et vous les corrigez avec la recherche et le remplacement, qui corrige chaque instance en un seul passage.
C’est le résultat pratique d’une méthode pour chaque format. Vous ne conservez pas un outil différent ou une liste de contrôle mentale différente pour WAV, M4A et MP3. Quel que soit votre enregistreur, votre téléphone ou l’exportation de quelqu’un d’autre, il passe par la même zone de dépôt et sort sous la forme du même type de transcription.
Choisir le meilleur format pour plus de précision
La plupart du temps, vous n’avez pas le choix. Vous retranscrivez le dossier qu’on vous a remis, et c’est très bien. Mais si vous contrôlez la façon dont l’audio est enregistré ou exporté, quelques choix fixent le plafond quant à la propreté du résultat.
La qualité d’enregistrement passe en premier, de loin. Un MP3 de 128 kbps provenant d’un bon microphone proche battra à chaque fois un WAV sans perte enregistré dans la pièce sur le micro intégré d’un ordinateur portable. Avant de penser au format, pensez à rapprocher le micro de celui qui parle. Le conteneur est loin derrière.
Évitez les MP3 à très faible débit. Le MP3 entraîne des pertes : l’encodage supprime des parties de l’audio pour garder le fichier petit, et plus le débit est faible, plus il en jette. La reconnaissance vocale s’appuie sur les détails à haute fréquence des consonnes, où se situe l’écart entre « quinze » et « seize », ou « peut » et « ne peut pas ». Une compression agressive mange exactement ce détail en premier. En dessous d’environ 64 kbps, les erreurs de mots grimpent. À 128 kbps et plus, vous avez déjà dépassé le point où le nombre compte ; un débit binaire plus élevé n’améliorera pas la transcription.
Lossless supprime le format en tant que variable. WAV, FLAC et AIFF transmettent l’audio non compressé au moteur. Pour un enregistrement propre, le gain de précision par rapport à un bon MP3 est marginal, mais il supprime complètement la compression. Le guide audio numérique de MDN explique le compromis sous-jacent : le système sans perte préserve les détails à une taille plus grande, tandis que l’encodage avec perte peut réduire considérablement l’audio en supprimant les informations. C’est un contexte utile lorsque l’enregistrement est précieux et que vous ne voulez pas vous demander plus tard si le format vous a coûté quelque chose.
Mono convient ; vous n’avez pas besoin de stéréo. Le moteur mixe la stéréo en mono en interne pour la parole, donc un fichier mono est tout aussi bien transcrit et téléchargé plus rapidement sur une connexion lente. La seule nuance : si votre configuration a enregistré chaque personne sur un canal stéréo distinct (un “double-ender”), le mixer sur une seule piste mono avant le téléchargement a tendance à aider les étiquettes des locuteurs, car le moteur entend une conversation mélangée plutôt que deux flux isolés.
Une fréquence d’échantillonnage supérieure à 16 kHz n’achète rien pour la parole. Tout ce qui se situe entre 16 kHz et 48 kHz fonctionne, et un WAV de 48 kHz provenant d’un éditeur vidéo. transcrit la même chose qu’un fichier mono 16 kHz provenant d’une application téléphonique, étant donné le même discours sous-jacent. Le modèle est entraîné sur la voix, pas sur la musique, donc il n’y a aucun gain de précision avec un taux plus élevé.
Sans perte ou avec perte, et lors de la conversion aide
Une question courante : la conversion de votre MP3 au format WAV améliorerait-elle d’abord la précision ? Ce ne sera pas le cas. Une fois l’audio enregistré au format MP3 à 128 kbps, les détails supprimés ont disparu pour de bon. Envelopper ce même audio dans un WAV crée simplement un fichier plus gros sans informations supplémentaires. La conversion vers le haut n’est qu’une solution de contournement pour un format qui ne se charge pas, jamais pour améliorer la précision.
La conversion vers le bas est le cas véritablement utile. Un WAV de plusieurs heures peut être un très gros fichier ; Le réencoder en MP3 à 128 kbps avant de le télécharger le réduit considérablement sans coût de précision significatif, ce qui accélère le téléchargement sur une liaison lente. Le convertisseur intégré au navigateur fait cela sans que l’audio ne quitte votre appareil. La règle honnête : si votre fichier est déjà chargé et n’a pas un débit binaire minime, transcrivez-le tel quel. Convertissez uniquement pour résoudre un problème réel, comme un fichier qui ne s’ouvre pas ou qui est trop volumineux pour être téléchargé facilement.
Étiquettes de locuteur, incluses gratuitement
Chaque transcription Hushscript est livrée avec une séparation automatique des locuteurs (diarisation) sans frais supplémentaires. Le moteur sélectionne des voix distinctes et les étiquete Locuteur A,Locuteur B, etc., et vous les renommez en vrais noms dans l’éditeur en un seul clic par locuteur. Il est activé par défaut quel que soit le format source, sans niveau d’étiquette de locuteur séparé.
La propreté des étiquettes dépend de l’enregistrement, et non du type de fichier :
- Les tours distincts sont les plus utiles. Lorsque les gens se relaient et ne se parlent pas, les étiquettes sont fiables. Une interview à deux se sépare généralement clairement.
- Le chevauchement est le cas difficile. Lorsque deux voix retentissent en même temps, le moteur attribue les mots à la plus forte. Il s’agit d’une limitation de la séparation des locuteurs en général, et non d’un outil en particulier. Prévoyez un peu de temps d’édition pour la diaphonie lors d’un appel de groupe animé.
- Des voix similaires peuvent être floues. Deux personnes avec des registres très similaires (des frères et sœurs de même sexe, par exemple) défieront n’importe quel moteur de diarisation. Un rapport signal/bruit raisonnable facilite la séparation.
Pour la plupart des interviews, podcasts et réunions, les étiquettes s’avèrent utilisables avec au plus une poignée de réaffectations. Si vous souhaitez en savoir plus sur le fonctionnement de la diarisation, consultez qu’est-ce que la diarisation du locuteur ou la page d’identification du locuteur pour un aperçu des fonctionnalités.
Correction des fichiers qui sortent mal
La plupart des transcriptions approximatives remontent à l’enregistrement, pas au format. ou l’outil. Les coupables habituels et que faire à leur sujet :
Un fichier qui ne se charge pas. Rare, mais cela arrive avec un conteneur inhabituel ou corrompu. Essayez le convertisseur intégré au navigateur gratuit pour le réemballer d’abord au format MP3 ou WAV, ce qui corrige la plupart des fichiers tenaces. Si cela ne fonctionne toujours pas, envoyez un e-mail à support@hushscript.com. Nous ajoutons la prise en charge du format.
Faible volume. Si l’enregistrement est très silencieux, le moteur a moins de signal avec lequel travailler et la précision diminue. Normalisez ou amplifiez l’audio dans n’importe quel éditeur avant de le télécharger. Augmenter le niveau d’un enregistrement faible est l’une des solutions les plus rentables qui soient.
Bruit de fond. Le bruit constant (un climatiseur, un bourdonnement de la route) est raisonnablement bien géré. Un bruit soudain qui chevauche la parole (une porte, une toux, des couverts) est ce qui fait tomber les mots. Une légère réduction du bruit avant le téléchargement peut aider, mais n’en faites pas trop : un débruitage important ajoute des artefacts qui nuisent plus à la précision que le bruit.
Accents forts ou vocabulaire spécialisé. Les moteurs modernes gèrent bien une large gamme d’accents. Les erreurs fiables sont des termes de domaine auxquels le moteur n’a aucune raison de s’attendre : noms de médicaments, citations légales, noms de marques de niche. Prévoyez un seul survol après l’exportation et appuyez-vous sur la recherche et le remplacement ; si un nom se trompe de la même manière à chaque fois, une correction balaie tout le fichier.
Fichiers très volumineux ou très longs. Le plafond de 10 heures couvre presque tout, et il n’y a pas de limite de taille de fichier en plus, il n’est donc pas nécessaire de découper un long enregistrement en morceaux. Si un fichier sans perte est difficilement volumineux à préparer dans le navigateur, réencodez-le d’abord en MP3 à 128 kbps (aucun coût réel en termes de précision) pour accélérer les choses. Pour les sessions plus longues, le guide d’enregistrement long va plus loin.
Qu’arrive-t-il à votre fichier
L’audio est supprimé du serveur dès que la transcription est prête. Il n’y a pas de stockage cloud, aucune utilisation de la formation de modèles et aucune période de conservation. Si vous avez déposé un fichier vidéo, seul l’audio extrait a atteint le serveur (la vidéo est restée sur votre appareil) et vous pouvez supprimer la transcription elle-même de votre tableau de bord en un clic quand vous le souhaitez.
Exportation de votre transcription
Après la transcription, choisissez le format qui correspond à ce que vous faites avec le texte. Si vous n’êtes pas sûr du de quel format de transcription vous avez réellement besoin, commencez par les choix courants ci-dessous :
| Format | Ce qui est inclus | Idéal pour |
|---|---|---|
| TXT | Étiquettes des locuteurs, texte brut | Notes, recherche, alimentation dans un autre outil |
| SRT | Horodatages par énoncé, étiquettes des locuteurs | Sous-titres vidéo, navigation dans un long enregistrement par durée |
| VTT | Horodatage des sous-titres Web, étiquettes des locuteurs | Lecteurs vidéo HTML5 et publication Web |
| CSV | Lignes avec champs de locuteur, de timing et de texte | Révision de la feuille de calcul et transfert léger des données |
| Markdown | Transcription étiquetée par l’intervenant dans Markdown | Notes, documents, flux de publication et sites statiques |
| DOCX | Formaté pour Word ou Google Docs | Édition, partage, annotation |
| JSON | { speaker, start, end, text } par élément | Pipelines et outils personnalisés |
| Transcription lisible à mise en page fixe | Partage et archivage en lecture seule |
Chaque exportation porte les étiquettes des locuteurs, sans filigrane sur aucune d’elles, et tous les formats d’exportation sont inclus avec chaque plan, parmi lesquels les 30 minutes gratuites. Les horodatages dans le SRT se situent au niveau de l’énoncé (une entrée par tour de locuteur), ce qui correspond à la bonne granularité pour le sous-titrage et la citation ; si vous avez besoin d’une structure au niveau des mots à traiter dans le code, JSON vous donne l’heure de début et de fin en millisecondes pour chaque tour.
Langues
Hushscript transcrit environ 99 langues, détectées automatiquement, non définies manuellement. La précision est la plus forte dans 18, dont quatre variantes anglaises (mondiale, britannique, australienne, américaine), espagnole, française, allemande, japonaise, mandarin, hindi et arabe. La liste complète se trouve sur la page des langues.
Si vous décidez entre une transcription dans la même langue et une transcription traduite, le guide pour “traduire l’audio en texte” explique la différence.
C’est tout le travail (drop, transcrire, exporter), et il se lit de la même manière quel que soit le format avec lequel vous avez commencé. Pour les notes spécifiques au format, les guides frères couvrent les cas les plus courants : MP3, WAV et M4A / Apple Voice Memo. La page audio-texte présente un aperçu complet des fonctionnalités, et chaque format y arrive de la même manière : déposez simplement votre fichier.
Sources et normes indépendantes
Hushscript a consulté ces références indépendantes et non concurrentes. Elles présentent des recherches, des normes ou le fonctionnement de plateformes et ne constituent pas une recommandation de Hushscript.
Sources vérifiées le :