Aller au contenu principal

Reconnaissance vocale : comment convertir la parole en texte

Auteur : Publié le : Dernière révision :

Speech to Text est un logiciel qui transforme l’audio parlé en mots écrits. Le terme couvre deux emplois différents qui se ressemblent mais fonctionnent différemment : la dictée en direct, où vous parlez et le texte apparaît au fur et à mesure, et la transcription, où vous remettez un enregistrement et récupérez une transcription terminée. L’idée de base est la même dans les deux cas. Le flux de travail, la précision et ce que vous pouvez faire avec le résultat ne le sont pas.

Ce guide explique ce qu’est réellement la parole en texte, en termes simples, comment le moteur passe du son aux mots et en quoi les deux modes diffèrent. Ensuite, il explique la conversion d’un enregistrement en texte sur Hushscript, avec un exemple concret, les problèmes qui trébuchent les gens et une courte FAQ à la fin.

Qu’est-ce que la parole en texte

Dans sa forme la plus simple, la reconnaissance automatique de la parole (ASR) prend une onde sonore et produit une séquence de mots. Un microphone capture la parole sous la forme d’une forme d’onde continue, une ligne vacillante qui représente l’évolution de la pression atmosphérique au fil du temps. Cette forme d’onde transporte tout : les mots, la voix de l’orateur, la pièce, le bourdonnement d’un climatiseur. La tâche du moteur est d’extraire les mots de ce mix et de les écrire.

Pour ce faire, le moteur découpe l’audio en petites tranches, généralement de 10 à 30 millisecondes chacune, et mesure le son dans chaque tranche. Ces mesures alimentent un modèle entraîné qui mappe les modèles sonores sur les unités vocales d’une langue, puis sur des mots, puis sur des phrases entières. Vous ne voyez rien de tout cela. Vous voyez un enregistrement entrer et une transcription sortir. Mais savoir à peu près ce qui se passe à l’intérieur explique pourquoi certains enregistrements sont transcrits proprement et d’autres reviennent grossièrement.

Il y a deux niveaux de connaissances qui travaillent ensemble. L’une est acoustique : ce que sont les sons d’une langue et comment ils ont tendance à être prononcés à travers différentes voix et accents. L’autre est linguistique : quelles séquences de mots sont plausibles. La couche linguistique est la raison pour laquelle un bon moteur écrit « leur voiture est en panne » plutôt que « leur voiture est en panne », même si les deux semblent identiques. Il s’agit d’utiliser le contexte pour choisir l’orthographe qu’un humain utiliserait.

La reconnaissance vocale plus ancienne reposait sur des règles écrites à la main et de petits ensembles de formation, et elle était fragile. Les moteurs modernes sont de grands modèles d’IA entraînés sur des milliers d’heures de parole enregistrée provenant de nombreux locuteurs, accents et conditions d’enregistrement. Cette ampleur est la seule raison pour laquelle les transcriptions d’aujourd’hui sont utilisables. Sur une parole claire dans un enregistrement décent, les modèles actuels atteignent une précision de mot d’environ 90 à 97 pour cent. Les quelques pour cent restants sont ceux où le dépannage plus loin dans ce guide gagne sa place.

Discours enregistré vs dictée en direct

La répartition qui compte le plus dans la pratique est de savoir si l’audio est traité en direct ou après coup.

La dictée en direct s’exécute en temps réel. Vous parlez dans un téléphone, un assistant vocal ou la fonction de saisie vocale d’un traitement de texte, et les mots apparaissent presque aussi vite que vous les prononcez. Pour suivre le rythme, le moteur doit s’engager sur chaque mot avec très peu de phrases sur lesquelles s’appuyer. C’est une contrainte difficile, et c’est pourquoi la dictée devine parfois un mot, puis le réécrit tranquillement une fois les mots suivants arrivés. La dictée en direct est l’outil idéal lorsqu’il s’agit de capturer votre propre discours au fur et à mesure : prendre une note en mains libres, rédiger un e-mail vocalement, contrôler un appareil.

La transcription fonctionne sur un enregistrement complet. Vous donnez au moteur un fichier audio ou vidéo terminé, il traite le tout et vous obtenez une transcription complète en retour. Parce que rien ne doit se produire en temps réel, le moteur peut lire à l’avance et voir la phrase entière avant de décider d’un mot, ce qui améliore la précision. Il peut également effectuer un travail que la dictée en direct ne peut pas faire. Il peut séparer les intervenants, en attribuant chaque ligne à celui qui l’a prononcée, et il peut associer des horodatages afin que vous puissiez passer d’une ligne de texte directement à ce moment dans l’audio.

Si vous avez affaire à une réunion, une interview, une conférence, un épisode de podcast ou un appel téléphonique que vous avez enregistré, vous effectuez une transcription à partir d’un fichier enregistré, pas une dictée en direct. Les deux se confondent car les deux sont commercialisés sous le nom de « parole en texte », mais l’enregistrement que vous avez déjà n’a pas la bonne forme pour un outil de dictée et la bonne forme pour un transcripteur. Hushscript est conçu pour les enregistrements. Il n’y a pas de mode de dictée en direct, et cette orientation est délibérée : travailler à partir du fichier complet est ce qui permet de lire à l’avance pour plus de précision et d’étiqueter les locuteurs dans le même passage.

Comment convertir une parole enregistrée en texte

Voici le flux réel sur Hushscript, dans l’ordre dans lequel vous le rencontrez. Vous avez besoin de l’enregistrement sous forme de fichier sur votre appareil, d’un fichier audio ou vidéo dans n’importe quel format courant et d’une adresse e-mail pour vous inscrire. C’est toute la liste. Il n’y a rien à installer.

  1. Déposez le fichier et regardez l’aperçu. Ouvrez la page audio-texte et déposez votre fichier dessus. Hushscript retranscrit d’emblée les 30 premières secondes et vous montre le résultat avec des intervenants déjà séparés. Aucun compte n’est nécessaire pour cette étape. L’aperçu est là pour que vous puissiez juger de l’exactitude de votre propre enregistrement avant de commettre quoi que ce soit.
  2. Inscrivez-vous pour transcrire le reste. Si l’aperçu semble correct, inscrivez-vous avec votre e-mail. La transcription du fichier complet est fermée, c’est donc à cette étape qu’intervient un compte. Les nouveaux comptes bénéficient de 30 minutes gratuites pour essayer le service correctement.
  3. Téléchargez le fichier complet. Une fois connecté, téléchargez l’intégralité de l’enregistrement. S’il s’agit d’une vidéo, l’audio est d’abord extrait dans votre navigateur et seul l’audio est envoyé, de sorte que la vidéo elle-même reste sur votre appareil.
  4. Lire, réétiqueter et exporter. La transcription revient avec chaque tour attribué à un locuteur (Locuteur A, Locuteur B, etc.) et horodaté. Cliquez sur n’importe quelle étiquette de locuteur pour la renommer, et le nouveau nom sera mis à jour partout où cette personne a parlé. Lorsqu’il est lu comme vous le souhaitez, exportez au format TXT pour le texte brut, SRT ou VTT pour les sous-titres, CSV ou JSON pour les données structurées, Markdown pour la publication de notes, DOCX pour l’édition ou PDF pour le partage.

Trente minutes suffisent pour transcrire une courte interview, un extrait de conférence de 10 minutes ou la première partie d’un enregistrement plus long si vous souhaitez vérifier l’exactitude avant d’aller plus loin. Les minutes gratuites se débloquent instantanément à partir d’un contrôle rapide de la carte : une retenue de 1 $ est autorisée pour vérifier la carte, puis levée immédiatement et jamais facturée. Utilisez un autre mode de paiement et ils arriveront avec votre premier achat. Une carte n’est pas requise ; c’est simplement le chemin le plus rapide vers le bonus. Après les minutes gratuites, vous ne payez que les minutes que vous transcrivez, sans abonnement. La page de tarification présente les tarifs actuels.

Un exemple concret

Disons que vous avez enregistré un entretien client de 38 minutes sur votre téléphone. Il a enregistré au format M4A deux voix, le bruit occasionnel d’une tasse de café, enregistrés dans une salle de réunion normale.

Vous déposez le M4A sur la page audio-texte. L’aperçu de 30 secondes apparaît sous la forme d’une courte conversation :

Locuteur A 00:00 Merci d'avoir pris le temps. Pourriez-vous commencer par me dire
                    qu'est-ce qui vous a poussé à rechercher un outil comme celui-ci ?
Locuteur B 00:11 Bien sûr. Nous étions noyés sous les tickets d'assistance et l'ancien
                    ne pouvait tout simplement pas suivre le rythme, alors j'ai commencé à chercher autour de moi.

C’est l’aperçu non édité. Les deux voix sont divisées, chaque ligne est horodatée et la formulation est claire. Vous vous inscrivez, téléchargez le fichier complet de 38 minutes et quelques minutes plus tard, la transcription complète est prête sous la même forme. Le Locuteur A est vous et le Locuteur B est votre interviewé, vous cliquez donc sur le label « Locuteur A », tapez votre nom, puis cliquez sur « Locuteur B » pour saisir le leur. Les deux renomment tout le document en un seul passage. Vous exportez vers DOCX, l’ouvrez dans votre traitement de texte, corrigez les deux ou trois endroits où un nom de produit est orthographié phonétiquement et vous obtenez une transcription d’entretien terminée. Les 38 minutes ont été épuisées, c’est pourquoi les 30 minutes gratuites sont pratiques pour un premier vrai travail plutôt que pour un simple test.

Problèmes courants et comment les résoudre

Les transcriptions les plus décevantes remontent à l’enregistrement, pas au moteur. Ce sont les problèmes qui reviennent le plus, et que faire pour chacun d’entre eux.

L’enregistrement est silencieux ou boueux. Si les voix sont faibles ou si la pièce semble bruyante, le moteur a moins de travail et la précision diminue. Un microphone proche du locuteur, un micro-cravate ou un casque à moins de 10 à 20 centimètres de la bouche fait une plus grande différence que n’importe quel réglage. Une grande pièce nue ajoute un écho qui brouille les frontières entre les sons ; un espace plus petit ou meublé de manière douce enregistre mieux. Vous ne pouvez pas résoudre ce problème après coup, il vaut donc la peine d’y remédier avant d’enregistrer la prochaine fois.

Deux personnes parlent en même temps. Lorsque les voix se chevauchent, la formulation et le qui a dit quoi deviennent plus difficiles, car deux ensembles de sons sont en compétition dans la même tranche audio. Il n’existe pas de solution logicielle propre pour un véritable chevauchement. Dans un enregistrement que vous contrôlez, laisser un rythme entre les tours s’avère payant plus tard. Dans celui que vous ne pouvez pas refaire, attendez-vous à quelques lignes croisées autour des interruptions et rangez-les à la main.

Un terme spécialisé sort mal. Les modèles à usage général connaissent bien le langage courant mais n’ont pas nécessairement vu le jargon de votre secteur, un nom de famille inhabituel ou un nom de produit. Ceux-ci ont tendance à être transcrits par la façon dont ils sonnent plutôt que par la façon dont ils sont orthographiés. Une recherche et un remplacement dans le DOCX exporté efface un terme récurrent en quelques secondes, ce qui est l’une des raisons pour lesquelles DOCX est l’exportation la plus simple à corriger.

Un fichier ne se chargera pas. La plupart des fichiers audio et vidéo standard fonctionnent tout simplement. Si l’on refuse, il s’agit généralement d’un conteneur inhabituel ou très ancien. Le convertir en MP3 ou WAV simple avec les outils intégrés au navigateur gratuits, qui s’exécutent sur votre appareil et ne téléchargent rien, résout presque toujours le problème. Si un format ne parvient toujours pas à être transmis, envoyez un e-mail à support@hushscript.com et l’équipe l’ajoutera.

Un locuteur est divisé en deux. Parfois, la même personne est étiquetée comme deux locuteurs, normalement parce que sa voix a changé à mi-chemin : elle s’est rapprochée du micro, est passée d’un casque au haut-parleur ou la qualité de la ligne a changé. Le moteur regroupe en fonction du son d’une voix, de sorte qu’un grand changement peut être lu comme une nouvelle personne. La fusion des deux étiquettes dans l’éditeur le corrige en une seule étape. Ce mécanisme sont présentés dans le guide sur le comment fonctionne la diarisation des locuteurs.

Précision et accents

La couverture des accents dépend du modèle et de la langue. Pour l’anglais, les modèles formés sur de vastes ensembles de données gèrent bien l’anglais américain, britannique, australien et indien, et Hushscript propose quatre accents anglais distincts. Un dialecte régional prononcé ou une variété d’accent moins représentée nécessitera une correction supplémentaire, mais vous éditez toujours un brouillon plutôt que de taper à partir de rien.

Quelques habitudes améliorent la précision de n’importe quel enregistrement, quel que soit l’accent. Enregistrez avec un microphone proche. Laissez chaque personne terminer avant que la suivante ne commence. Évitez les grandes pièces qui font écho. Un rythme de parole modéré retranscrit mieux qu’un sprint au-delà de 200 mots par minute. Et un débit raisonnable est important : un MP3 à 128 kbps convient, tandis que l’audio des messages vocaux fortement compressés en bande étroite perd les détails dont le moteur a besoin. Pour une présentation plus complète des formats et des particularités de chacun, consultez comment transcrire n’importe quel fichier audio.

Hushscript détecte automatiquement la langue et transcrit environ 99 langues, avec une précision exceptionnelle dans 18 d’entre elles. Un enregistrement qui reste dans une langue est transcrit de la manière la plus propre possible ; Changer de langue au milieu d’une phrase est difficile pour n’importe quel moteur.

Étiquettes des locuteurs, dans le même passage

La séparation des locuteurs, officiellement appelée diarisation des locuteurs, s’effectue parallèlement à la reconnaissance vocale plutôt que comme un deuxième travail pour lequel vous payez un supplément. Vous obtenez les mots et l’attribution ensemble, gratuitement sur chaque transcription. Pour un entretien à deux ou une petite réunion, cette séparation est généralement précise et évite le travail fastidieux consistant à marquer chaque ligne à la main. Il n’y a pas de limite au nombre de locuteurs qu’un fichier peut contenir, bien que la précision soit la plus élevée lorsque les voix sont distinctes, ne se chevauchent pas et ne se ressemblent pas. Le fait que l’étiquetage du locuteur soit fourni avec chaque transcription sans frais supplémentaires est le genre de détail honnête par défaut sur lequel toute cette approche est construite : la partie utile est incluse, et non retenue derrière un niveau supérieur.

La distinction claire à laquelle s’accrocher est la suivante. Si vous souhaitez capturer la parole pendant que vous parlez, tapez de la voix ou dictez, utilisez l’outil en direct intégré à votre appareil ou traitement de texte. Si vous disposez déjà d’un enregistrement dont vous avez besoin sous forme de texte, sa transcription à partir de la page audio en texte est plus rapide, plus précise et vous fournit des étiquettes de locuteur et une sortie exportable en une seule étape.

Sources et normes indépendantes

Hushscript a consulté ces références indépendantes et non concurrentes. Elles présentent des recherches, des normes ou le fonctionnement de plateformes et ne constituent pas une recommandation de Hushscript.

Sources vérifiées le :

Questions fréquentes

Qu'est-ce que la parole en texte ?

La parole en texte, également appelée reconnaissance automatique de la parole ou ASR, est un logiciel qui transforme l'audio parlé en mots écrits. Il écoute le son de la parole, détermine quels mots ont été prononcés et produit une transcription du texte. Les versions modernes fonctionnent sur des modèles d'IA entraînés sur des milliers d'heures de voix enregistrées, c'est pourquoi elles gèrent bien mieux les accents et le bruit de fond que les outils de dictée d'il y a dix ans.

Quelle est la différence entre la dictée en direct et la transcription d'un enregistrement ?

La dictée en direct transforme la parole en texte en temps réel pendant que vous parlez, comme le fait la saisie vocale dans un téléphone ou un traitement de texte. La transcription d'un enregistrement fonctionne sur un fichier audio ou vidéo enregistré après coup. Les enregistrements sont généralement plus précis, car le moteur peut voir la phrase entière avant de s'engager sur les mots, et il peut identifier qui a prononcé quand. Hushscript gère les enregistrements, pas la dictée en direct.

Quelle est la précision de la synthèse vocale automatique ?

Pour une parole claire dans une pièce calme, les modèles d'IA actuels atteignent environ 90 à 97 % de précision des mots dans les langues bien prises en charge. La précision diminue avec un bruit de fond important, deux personnes qui se parlent, des accents forts dont le modèle n'a pas beaucoup entendu parler ou un vocabulaire spécialisé comme les noms de médicaments ou le latin légal. Le nettoyage de l'enregistrement fait plus pour la précision que n'importe quel paramètre unique.

La synthèse vocale fonctionne-t-elle avec les accents ?

Oui, et bien mieux que les anciens systèmes. Les modèles formés sur des ensembles de données volumineux et variés gèrent confortablement l'anglais américain, britannique, australien et indien, et Hushscript propose quatre accents anglais distincts. Un dialecte régional fort ou un accent moins représenté nécessitera un peu plus de correction par la suite, mais la transcription reste une première ébauche utilisable plutôt que quelque chose que vous retapez à partir de zéro.

Comment convertir la parole enregistrée en texte sur Hushscript ?

Déposez votre fichier audio ou vidéo sur la page audio-texte et un aperçu de 30 secondes étiqueté par le locuteur apparaît sans qu'aucun compte ne soit nécessaire. Inscrivez-vous avec votre email pour transcrire le reste, puis téléchargez le fichier complet. La transcription terminée revient avec les étiquettes des locuteurs et les horodatages, et vous pouvez renommer les locuteurs et les exporter dans 21 formats, de TXT, SRT et DOCX au format PDF, ou sous forme d'archive .husharchive protégée par mot de passe.

La parole en texte est-elle gratuite ?

Hushscript n'est pas gratuit, car l'IA qui le sous-tend coûte de l'argent réel à faire fonctionner, il est donc paiement à l'utilisation sans abonnement. Vous bénéficiez de 30 minutes gratuites pour l’essayer. Ils se déverrouillent instantanément lorsque vous validez une carte avec une retenue de 1 $ immédiatement libérée et jamais facturée, ou lors de votre premier achat si vous payez d'une autre manière. L'aperçu de 30 secondes et les outils intégrés au navigateur sont véritablement gratuits et sans compte.

Quelles langues Hushscript peut-il transcrire ?

Il détecte automatiquement la langue et transcrit environ 99 langues, avec une précision optimale dans 18 d'entre elles, dont l'anglais mondial, britannique, australien et américain, l'espagnol, le français, l'allemand, le japonais, le mandarin, Hindi et arabe. La page Langues répertorie tout le monde. Un enregistrement qui reste dans une seule langue est mieux transcrit.

Commencer avec 30 minutes gratuites

Commencer – 30 minutes gratuites