Aller au contenu principal

Comment convertir une vidéo MP4 en texte, en privé

Auteur : Publié le : Dernière révision :

Un flux de travail de téléchargement vidéo en premier peut envoyer l’intégralité du MP4 même si la reconnaissance vocale n’a besoin que de sa piste audio. En fonction de la résolution, du codec et du débit binaire, un enregistrement long peut représenter plusieurs gigaoctets. Hushscript évite ce transfert : le navigateur prépare d’abord l’audio et la vidéo source reste sur votre appareil.

Hushscript emprunte un chemin différent. Votre navigateur extrait l’audio de la vidéo avant le début du téléchargement, de sorte que le MP4 d’origine reste sur votre appareil. Seul l’audio est transcrit et il est supprimé dès que votre transcription est prête. Ce guide décrit le processus complet : les étapes, un exemple pratique sur un webinaire enregistré, comment extraire les sous-titres SRT, les autres formats vidéo qui fonctionnent de la même manière et que faire en cas de problème.

Pourquoi votre vidéo ne devrait pas avoir à être téléchargée

La piste vidéo n’a aucun rapport avec la transcription. Le moteur vocal n’a besoin que de l’audio. Télécharger l’image est un pur gaspillage : du temps réseau, du stockage sur le serveur et une empreinte de confidentialité dont vous n’avez pas besoin.

Comment fonctionne l’extraction dans le navigateur, en termes simples

Un MP4 est un conteneur. À l’intérieur se trouvent des flux séparés : la vidéo (l’image), l’audio (le son) et certaines métadonnées – une structure expliquée dans le guide de traitement vidéo de MDN. La transcription n’a besoin que du flux audio.

Hushscript exécute une petite boîte à outils multimédia native du navigateur directement sur la page. Lorsque vous déposez votre MP4, cette boîte à outils ouvre le conteneur localement, copie le flux audio et transmet cet audio au téléchargement, sans que la page n’envoie la vidéo nulle part. Le travail se déroule au même endroit où une vidéo est lue : sur votre propre machine.

Le résultat pratique est donc le suivant :

Cela est important pour les réunions, les interviews enregistrées, les dépositions juridiques et tout ce où la séquence elle-même est sensible. Cela est également important lorsque vous utilisez une connexion lente avec un fichier de plusieurs Go : l’extraction de l’audio transforme d’abord un téléchargement d’une demi-heure en quelques minutes.

Ce dont vous avez besoin

Trois choses et rien à installer :

Vous n’avez pas besoin d’un extracteur audio séparé, d’un convertisseur ou d’un logiciel vidéo. Supprimer le MP4 représente toute l’entrée.

Convertissez un MP4 en trois étapes

  1. Déposez votre MP4 sur la page /MP4-to-text. Votre navigateur extrait la piste audio et télécharge uniquement l’audio, de sorte que la vidéo elle-même reste sur votre appareil. Les 30 premières secondes reviennent sous forme d’aperçu étiqueté par l’intervenant, aucun compte requis.
  2. Inscrivez-vous pour transcrire le reste. Saisissez votre e-mail pour créer un compte. Nouveau ici ? Les 30 premières minutes sont offertes une fois que vous avez vérifié un mode de paiement, soit une retenue de carte de 1 $ (autorisée, puis libérée immédiatement, jamais facturée) ou votre pack de première minute si vous payez d’une autre manière. Aucune carte n’est requise. La transcription est facturée en fonction de la durée audio, et non de la taille du fichier.
  3. Exportez la transcription. Une fois prête, téléchargez-la dans l’un des 21 formats (TXT, SRT et VTT pour les sous-titres, DOCX et PDF pour les documents, JSON et CSV pour les données, entre autres) ainsi qu’une archive .husharchive protégée par mot de passe. Les étiquettes de locuteur sont incluses gratuitement.

La suppression audio se produit automatiquement lorsque la transcription est livrée. Il n’y a aucune étape de nettoyage à retenir.

Ce que signifie “facturé en fonction de la durée audio”

Un MP4 d’une heure à 1080p peut représenter 6 Go. L’audio qui en est extrait (généralement AAC à 128-256 kbps) fait environ 60-120 Mo. C’est ce qui est mis en ligne, et le coût à la minute est basé sur une heure d’audio, et non sur un fichier de 6 Go.

Le résultat : vous pouvez transcrire un documentaire 4K de deux heures à partir d’un enregistreur de terrain et payer le même coût par minute qu’un petit MP3, car les deux contiennent la même quantité d’audio. La résolution, le débit et la taille du fichier n’ont aucune incidence sur ce qui vous est facturé.

Un exemple concret : un webinaire enregistré

Disons que vous avez organisé un webinaire de 52 minutes avec deux présentateurs et que vous l’avez enregistré sur un seul MP4 :q3-product-webinar.mp4, environ 3,4 Go à 1080p. Vous voulez une transcription claire pour l’e-mail récapitulatif, ainsi que des sous-titres à joindre à la rediffusion.

Voici comment cela se déroule réellement :

  1. Vous ouvrez /MP4-to-text et déposez q3-product-webinar.mp4. La page extrait l’audio localement, de sorte qu’une vidéo de 3,4 Go représente environ 70 Mo d’audio. Seuls ces 70 Mo de téléchargement.
  2. Les 30 premières secondes reviennent étiquetées, afin que vous puissiez vérifier la qualité audio avant de transcrire les 52 minutes complètes.
  3. Lorsque la transcription complète est prête, elle est divisée en énoncés étiquetés Locuteur A ou Locuteur B. Vous cliquez sur Locuteur A, tapez « Priya », cliquez sur Locuteur B, tapez « Marcus » et les deux renommez partout en même temps.
  4. Vous exportez TXT pour l’e-mail récapitulatif et SRT pour la piste de sous-titres de la rediffusion. Le MP4 original du webinaire n’a jamais quitté votre ordinateur portable et l’audio est déjà supprimé du serveur.

La partie qui surprend les gens la première fois est l’étape 1 : un téléchargement de plusieurs gigaoctets qui n’a tout simplement pas lieu. L’image reste avec vous ; seuls les mots voyagent.

Étiquettes des locuteurs pour les vidéos à plusieurs personnes

Chaque transcription inclut une diarisation automatique des locuteurs sans frais supplémentaires. Pour une interview, un panel ou un enregistrement de réunion, chaque intervenant est étiqueté Locuteur A,Locuteur B, etc., et vous pouvez les renommer en vrais noms dans l’éditeur en cliquant sur l’étiquette et en tapant.

La diarisation fonctionne mieux avec une séparation nette. L’audio de la caméra dans une pièce calme ou un appel vidéo enregistré avec les pistes de chaque participant donne au moteur le maximum de travail. Une salle bondée avec des gens qui parlent entre eux est plus difficile pour n’importe quel moteur de diarisation. Consultez la section de dépannage ci-dessous pour savoir ce qui peut vous aider.

Obtenir les sous-titres (SRT / VTT) de la vidéo

Si la raison pour laquelle vous transcrivez la vidéo est due aux sous-titres, exportez la transcription au format SRT. Chaque énoncé arrive avec un horodatage de début et de fin, formaté selon la spécification SRT :

1
00:00:04,210 --> 00:00:07,880
Locuteur A : Merci de vous joindre à nous aujourd'hui.

2
00:00:08,100 --> 00:00:12,340
Locuteur B : Heureux d'être ici.

Chargez le SRT dans un lecteur de bureau (VLC, QuickTime et la plupart des éditeurs l’acceptent) ou téléchargez-le en tant que piste de sous-titres. sur une plate-forme qui en prend en charge un. L’exportation Hushscript SRT conserve les étiquettes des locuteurs, ce qui est utile pour les vidéos à plusieurs personnes. Certains formats de sous-titres suppriment les noms ; SRT les préserve.

Pour les lecteurs web qui utilisent WebVTT (.vtt), la différence avec SRT est infime : une ligne d’en-tête WEBVTT et un . au lieu de , dans les horodatages. Vous pouvez convertir un SRT en VTT dans le navigateur avec l’outil gratuit disponible à l’adresse /tools/SRT-to-VTT ; la conversion s’effectue localement dans la page.

Deux guides frères vont plus loin qu’il n’y a de place ici : comment créer des sous-titres SRT à partir d’une vidéo couvre l’édition du timing et de la longueur de ligne, et comment ajouter des sous-titres à une vidéo couvre la fixation du SRT ou sa gravure. Graver des sous-titres de manière permanente dans l’image est une étape de codage distincte. Un outil gratuit comme HandBrake gère le multiplexeur une fois que vous avez le SRT.

Autres formats vidéo (MOV, WebM, MKV)

Le même processus d’extraction par navigateur s’applique bien au-delà du MP4 :

Ces conteneurs contiennent les codecs audio habituels (AAC, MP3, Opus, FLAC), et l’étape d’extraction les démultiplexe de la même manière qu’un MP4. En pratique, tout ce qui est enregistré sur un téléphone, un appareil photo ou un enregistreur d’écran fonctionnera. Déposez-le simplement.

Vous pouvez également alimenter directement des fichiers audio uniquement tels que MP3, WAV, M4A. En l’absence de flux vidéo à supprimer, l’étape d’extraction est ignorée et le fichier est téléchargé tel quel. Et si vous souhaitez simplement le fichier audio lui-même plutôt qu’une transcription, la conversion du MP4 en MP3 est une tâche distincte qui s’exécute également entièrement dans votre navigateur. La page vidéo en texte couvre le flux de travail complet pour n’importe quel format vidéo, y compris ceux dotés de codecs audio inhabituels.

Dépannage

Les fichiers MP4 courants ne nécessitent généralement aucune préparation manuelle. Si l’une d’elles échoue ou produit un texte faible, vérifiez d’abord ces causes.

La vidéo source est très volumineuse. L’application n’a pas de limite de taille de fichier : elle prépare l’audio, même à partir d’une vidéo très volumineuse, directement dans votre navigateur, à condition que l’enregistrement ait lieu dans les 10 heures (votre navigateur a encore besoin de suffisamment de capacité locale pour effectuer le travail). Si l’extraction se bloque sur un énorme fichier 4K, fermez les autres onglets et réessayez, ou extrayez d’abord l’audio. Les outils d’extraction audio gratuits effectuent ce travail dans le navigateur et produisent un fichier plus petit que vous pouvez télécharger directement.

Pas de piste audio ni de parole. Un enregistrement d’écran silencieux ou un clip uniquement musical n’a rien à transcrire pour le moteur, vous obtiendrez donc un résultat vide. Confirmez que la vidéo contient réellement de l’audio parlé en la lisant avec le volume augmenté. S’il s’agit d’un enregistrement d’écran, vérifiez que l’enregistreur a été configuré pour capturer le son du système ou du microphone ; beaucoup par défaut sont uniquement vidéo.

Un codec audio non pris en charge ou obscur. L’extracteur intégré au navigateur gère les codecs courants (AAC, MP3, Opus, FLAC). Un conteneur utilisant un codec audio inhabituel ou propriétaire peut ne pas démultiplexer proprement et l’audio ne sera pas extrait. La solution consiste à remuxer ou à réencoder d’abord l’audio de la vidéo sur un codec standard ; la plupart des convertisseurs peuvent produire un MP4 standard ou un simple fichier audio. Si vous rencontrez un format qui ne passe pas, envoyez un e-mail à support@hushscript.com et nous envisagerons de l’ajouter.

Plusieurs locuteurs, séparation désordonnée. La diarisation nécessite des voix distinctes. Des discours qui se chevauchent, un seul micro à champ lointain dans une grande pièce ou un bruit de fond intense brouillent tous les frontières entre les locuteurs. Vous obtiendrez toujours une transcription précise ; les étiquettes des locuteurs sont tout simplement moins précises. Si vous contrôlez l’enregistrement, une piste par participant (comme la plupart des outils d’appel vidéo peuvent exporter) ou un micro plus proche de chaque locuteur offre la séparation la plus nette. Dans tous les cas, vous pouvez corriger toutes les lignes mal étiquetées dans l’éditeur avant d’exporter.

La transcription présente des fautes d’orthographe constantes. Un nom propre récurrent ou un morceau de jargon qui est toujours transcrit de la même manière incorrecte est une solution ponctuelle : une seule recherche et remplacement dans le texte exporté corrige chaque instance. C’est plus rapide que de réexécuter quoi que ce soit.

Les formats d’exportation en un coup d’œil

Format Ce que vous obtenez
TXT Texte brut, étiquettes de locuteur, pas d’horodatage
SRT Sous-titres horodatés, prêts à être chargés dans n’importe quel lecteur vidéo
VTT Sous-titres Web pour lecteurs vidéo HTML5
CSV Lignes adaptées aux feuilles de calcul avec les intervenants et les timings
Markdown Texte étiqueté par l’intervenant pour les notes et la publication
JSON Données structurées :{ speaker, start, end, text } par énoncé
DOCX Transcription étiquetée par le locuteur pour Word ou Google Docs
PDF Transcription à mise en page fixe pour le partage ou l’archivage

Tous les formats d’exportation sont inclus avec chaque forfait, y compris les 30 minutes gratuites, et aucun ne porte de filigrane.


Pour toute vidéo où la confidentialité est importante, qu’il s’agisse d’une réunion, d’une interview ou d’une déposition, le point est valable : votre vidéo n’est jamais téléchargée. Vous pouvez le vérifier vous-même. Ouvrez l’onglet réseau du navigateur avant de déposer le fichier et regardez ce qui est envoyé ; vous verrez le son monter et l’image rester en place.

Sources et normes indépendantes

Hushscript a consulté ces références indépendantes et non concurrentes. Elles présentent des recherches, des normes ou le fonctionnement de plateformes et ne constituent pas une recommandation de Hushscript.

Sources vérifiées le :

Questions fréquentes

Le fichier vidéo MP4 est-il téléchargé sur le serveur ?

Non. Votre navigateur extrait la piste audio de la vidéo avant que quoi que ce soit ne quitte votre appareil. Seul l'audio est envoyé pour transcription. Le MP4 original reste sur votre machine. Vous pouvez le confirmer vous-même dans l'onglet Réseau du navigateur : vous verrez le petit téléchargement audio, pas la vidéo de plusieurs gigaoctets.

Quelle est la taille maximale de la vidéo que je peux utiliser ?

Il n'y a pas de limite de taille de fichier : les enregistrements d'une durée maximale de 10 heures sont acceptés, quelle que soit la taille de la vidéo source. Parce que seuls les téléchargements audio, une longue vidéo envoie généralement beaucoup moins de données que sa taille sur le disque.

Combien coûte la transcription d'un MP4 ?

Vous bénéficiez de 30 minutes gratuites après un contrôle de carte de 1 $ (la retenue est autorisée, puis libérée immédiatement, jamais facturée), ou avec votre premier achat si vous payez autrement. Après cela, le paiement est facturé à l'utilisation, facturé en fonction de la durée de l'audio et non de la taille du fichier vidéo. Consultez la page de tarification pour connaître les coûts du pack.

Puis-je obtenir des sous-titres SRT à partir d'un MP4 ?

Oui. Après transcription, exportez au format SRT. Le fichier SRT comprend un horodatage de début et de fin à chaque énoncé et peut être téléchargé dans la plupart des lecteurs vidéo ou téléchargé en tant que piste de sous-titres. Il conserve les étiquettes des locuteurs, que certains autres formats de sous-titres suppriment.

Quels autres formats vidéo fonctionnent de la même manière ?

MOV, WebM, MKV et la plupart des formats de conteneurs comportant un codec audio standard (AAC, MP3, Opus, FLAC). L'étape d'extraction dans le navigateur gère la démultiplication, la méthode est donc identique à MP4.

Ma vidéo n'a pas de son parlé. Puis-je quand même le transcrire ?

Non. La transcription fonctionne à partir de la parole, donc une vidéo sans piste audio, ou un enregistrement d'écran silencieux, n'a rien à transcrire. S'il y a de la musique de fond mais pas de parole, le résultat sera vide ou bruyant, car le moteur ne renvoie que des mots.

L'audio est-il supprimé après la transcription ?

Oui. L'audio extrait est supprimé du serveur dès que votre transcription est prête, et le moteur vocal ne conserve rien. La transcription elle-même est cryptée au repos, de sorte que même une fuite de stockage exposerait un texte chiffré illisible plutôt que vos mots.

Commencer avec 30 minutes gratuites

Commencer – 30 minutes gratuites