Vocabulaire personnalisé pour une transcription précise
Auteur : Hushscript Publié le : Dernière révision :
Un moteur vocal à usage général a moins de contexte pour un nom de code de produit, un nom de famille régional ou un acronyme interne que votre équipe utilise dix fois lors d’une réunion. La recherche appelle la technique permettant d’orienter la reconnaissance vers les termes attendus biaisation contextuelle, et une session Web Speech du W3C 2025 l’a décrite comme une fonctionnalité disponible dans Chrome. Hushscript transforme cette idée en quatre contrôles de vocabulaire, allant d’un ajout ponctuel pour un fichier à une configuration permanente que vous pouvez réutiliser.
Là où le vocabulaire personnalisé est le plus utile
Trois catégories font que la majeure partie de la reconnaissance manque à un modèle à usage général. Les noms des personnes sont les premiers, en particulier les orthographes qui ne sont pas la variante la plus courante. Un modèle n’a aucun moyen de deviner si l’audio dit “Nguyen” ou un quasi-homophone à moins que quelque chose ne lui indique que le nom est en jeu. Les noms de produits et de marques viennent en deuxième position : un nom comme “FlowBridge” est entendu comme les deux mots ordinaires auxquels il ressemble, et non comme le nom propre choisi par une entreprise spécifique. Le jargon interne et les acronymes viennent en troisième position : des termes qui ne signifient quelque chose qu’au sein d’une équipe ou d’un secteur, qu’aucun vocabulaire général ne pourrait jamais contenir. Les noms de médicaments et de procédures d’une pratique clinique constituent le même problème à plus grande échelle, que la transcription médicale traite avec un mode dédié aux côtés de ces outils de vocabulaire. Un acronyme répété dix fois dans une réunion retranscrit soit le mal dix fois, soit le bien dix fois ; il n’y a pas de crédit partiel, donc le corriger une fois dans une liste de termes clés ou un dictionnaire corrige automatiquement chaque occurrence dans ce fichier.
Pour un seul fichier : des termes clés et une invite personnalisée
Si vous transcrivez un enregistrement inhabituel et n’avez pas besoin d’une configuration permanente, ajoutez des termes clés directement à cette tâche. Jusqu’à 1 000 termes clés (noms, marques, acronymes) biaisent la reconnaissance en faveur des mots que vous avez réellement prononcés, pour ce seul fichier. À côté d’eux, une invite personnalisée pouvant contenir jusqu’à 2 000 caractères donne au moteur un contexte que l’audio seul ne peut pas : qui parle, ce que couvre l’enregistrement, les termes spécifiques à la situation. Les deux disparaissent après le travail ; rien n’est transféré au fichier suivant à moins que vous ne l’ajoutiez à nouveau.
Pour le travail récurrent : dictionnaires enregistrés et préréglages d’invite
Si les mêmes noms et le même jargon reviennent fichier après fichier, une liste unique ne vaut plus la peine d’être retapée. Un dictionnaire enregistré résout ce problème : importez des termes en masse à partir d’un fichier CSV ou TSV, organisez-les en catégories et attachez des variantes orthographiques à chaque terme canonique afin que « McAllister » soit reconnu, que l’audio source le fasse ressembler à « MacAlister » ou « McAllaster ». Les préréglages d’invite fonctionnent de la même manière pour le contexte, en enregistrant l’arrière-plan que vous retaperiez autrement à chaque fois. Marquez soit un dictionnaire, soit un préréglage par défaut, et il sera présélectionné automatiquement la prochaine fois que vous transcrivez, donc une configuration permanente n’a pas besoin d’être resélectionnée sur chaque fichier.
Ils se combinent, ils ne se remplacent pas
Un dictionnaire permanent et un ajout ponctuel ne sont pas un choix entre deux options ; ils postulent ensemble au même emploi. Conservez un dictionnaire par défaut des noms de produits de votre équipe et une invite par défaut décrivant ce que sont habituellement vos enregistrements, puis ajoutez un terme clé unique pour le nom d’un invité qui ne concerne que le fichier de cette semaine. La configuration debout couvre le vocabulaire récurrent ; l’ajout ponctuel couvre ce qui est spécifique à cet enregistrement. Aucun des deux n’a à tenir compte de ce que l’autre gère déjà.
Ce qu’il ne touche pas
Le vocabulaire personnalisé, sous l’une de ses quatre formes, façonne ce que le moteur entend pendant sa transcription, et il ne configure pas la tâche Insights ultérieure. Les Insights sont exécutés par rapport à la transcription qui en résulte. Obtenir le bon vocabulaire plus tôt peut donc améliorer le texte source lu par Insights, sans changer ce qu’Insights génère.
Un exemple concret
Un podcast hebdomadaire interviewe un invité différent à chaque épisode mais couvre toujours les trois mêmes lignes de produits par leur nom. L’hôte crée une fois un dictionnaire enregistré, importé à partir d’une feuille de calcul de noms de produits et des noms de l’équipe, épelé comme l’émission les dit réellement et le marque comme valeur par défaut. L’épisode de chaque semaine en bénéficie automatiquement. Pour l’invité cette semaine-là, un nom que le dictionnaire permanent n’a aucune raison de connaître, l’hôte ajoute un terme clé avant le téléchargement, spécifique à ce fichier. Le dictionnaire permanent et le terme clé unique s’appliquent tous deux à la même transcription, et aucun des deux n’exige de toucher l’autre.
Où le configurer
Les options de vocabulaire se trouvent à côté des autres paramètres par fichier sur audio vers texte, que vous ajoutiez un terme clé unique à un seul téléchargement ou que vous gériez un dictionnaire enregistré pour travail récurrent. Ils fonctionnent de la même manière, quelle que soit la langue parmi les quelque 99 langues que Hushscript détecte automatiquement dans l’enregistrement, et la page des langues contient la liste complète, ainsi que celles qui obtiennent une précision de premier ordre. Pour en savoir plus sur la façon d’obtenir la transcription elle-même avant de vous soucier du vocabulaire, consultez comment transcrire un podcast pour le flux de travail pour invités récurrents que cet exemple suit.
Sources et normes indépendantes
Hushscript a consulté ces références indépendantes et non concurrentes. Elles présentent des recherches, des normes ou le fonctionnement de plateformes et ne constituent pas une recommandation de Hushscript.
Sources vérifiées le :