Intermédiaire 10 minAudio

WhisperX : horodatage mot à mot et locuteurs

Whisper transcrit très bien et horodate approximativement. WhisperX ajoute deux choses qui changent tout dès qu'on sort du simple document : un alignement forcé qui donne un horodatage mot à mot réellement exact, et une séparation des locuteurs qui indique qui a parlé quand. C'est ce qui transforme une transcription en sous-titres utilisables et en compte rendu de réunion lisible.

Par Mohamed Meguedmi·Màj 2026-09-22·Testé sur Windows, macOS, Linux

#Ce que Whisper seul ne résout pas

Whisper produit un excellent texte. Ses faiblesses apparaissent dès qu'on veut autre chose que du texte. Les horodatages sont émis par segment et peuvent dériver d'une seconde ou plus : invisible dans un document, inacceptable en sous-titrage, où un sous-titre qui arrive un temps trop tard est pire que pas de sous-titre du tout. Et Whisper n'a aucune notion de locuteur : deux heures de réunion reviennent en un monologue indifférencié.

WhisperX répond aux deux en ajoutant des étapes plutôt qu'en remplaçant le modèle. C'est ce choix de conception qui préserve la qualité de transcription que vous connaissez.

#Les trois étapes

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j
Ce que fait chaque étape et ce qu'elle réclame
ÉtapeRôleCe qu'il lui faut
TranscriptionL'audio devient du texte, via une implémentation rapide de WhisperUn modèle Whisper : sa taille décide qualité et mémoire
Alignement forcéChaque mot est repositionné exactement dans l'audioUn modèle phonétique pour la langue
Séparation des locuteursL'audio est découpé par voix et les tours étiquetésUn modèle dédié, dont l'accès demande d'accepter des conditions

L'étape d'alignement est celle qu'on sous-estime. C'est elle qui rend l'horodatage mot à mot digne de confiance, et elle dépend de la langue : sans modèle d'alignement disponible pour la langue traitée, on retombe sur un horodatage par segment, c'est-à-dire exactement ce qu'on cherchait à quitter.

#La séparation des locuteurs, sans illusion

L'étiquetage fonctionne en regroupant les caractéristiques vocales sur l'ensemble de l'enregistrement. Il est bon sur un audio propre avec des voix distinctes qui parlent chacune à leur tour, et il se dégrade précisément dans les situations que produisent les réunions : des gens qui se coupent la parole, quelqu'un loin du micro, des voix proches, une connexion médiocre.

Deux remarques pratiques. On peut en général indiquer le nombre de locuteurs, et le faire améliore nettement le résultat : le modèle n'a plus à le deviner. Et les étiquettes sont anonymes par construction : le système dit qu'il y avait trois voix et quels tours appartiennent à chacune, pas qui elles sont. Associer une étiquette à un nom est une étape manuelle — et c'est aussi le moment où la transcription devient une donnée personnelle.

!
Traiter en local ne vaut pas consentement
Une transcription avec étiquetage des locuteurs est une donnée personnelle, qu'elle quitte ou non votre machine. Le traitement local est la bonne posture technique ; il ne dispense pas d'informer les personnes enregistrées et d'obtenir leur accord.

#Ce que ça demande

La taille du modèle Whisper décide de tout
Un grand modèle donne le meilleur texte et demande le plus de mémoire ; un modèle intermédiaire est le compromis courant sur les longs enregistrements.
Trois modèles se chargent, pas un
La mémoire culmine quand transcription, alignement et séparation sont tous résidents. Enchaîner les étapes en libérant entre elles est le remède sur une petite carte.
Le processeur fonctionne, lentement
Comptez des heures plutôt que des minutes sur un long audio ; un GPU en fait un outil praticable.
Le traitement par lots aide
Les longs fichiers vont beaucoup plus vite avec une inférence groupée.

#Le bon usage : la transcription est une entrée, pas un livrable

Dans la quasi-totalité des cas réels, la transcription n'est pas le but : elle alimente un modèle local qui en tire un compte rendu, un relevé de décisions ou un résumé. Cela a une conséquence sur la qualité attendue : une erreur de transcription sur un mot rare compte moins que la structure des tours de parole, parce que c'est cette structure qui permet au modèle d'attribuer correctement ce qui a été dit.

#FAQ

WhisperX est-il gratuit ?+
Oui, c'est un projet libre qui tourne localement. La séparation des locuteurs s'appuie sur des modèles dont l'accès demande d'accepter des conditions sur la plateforme de modèles : une inscription, pas un paiement.
Quelle est la fiabilité de la séparation des locuteurs ?+
Bonne sur un audio propre avec des voix distinctes, nettement moins avec des paroles qui se chevauchent, un micro lointain ou des voix proches. Indiquer le nombre de locuteurs améliore le résultat.
Faut-il un GPU ?+
Il fonctionne sur processeur mais lentement — des heures pour de longs enregistrements. Un GPU le rend praticable, et la mémoire culmine quand plusieurs étapes sont chargées en même temps.
WhisperX ou Whisper seul ?+
Whisper seul si vous ne voulez que du texte. WhisperX dès que vous avez besoin d'un horodatage mot à mot pour des sous-titres, ou d'étiquettes de locuteurs pour une réunion.
Fonctionne-t-il en français ?+
La transcription couvre de nombreuses langues. L'alignement dépend de l'existence d'un modèle phonétique pour la langue ; à défaut, on retombe sur des horodatages par segment, moins précis.
Peut-il transcrire en direct ?+
Non, il est conçu pour des fichiers. Le sous-titrage en direct demande un moteur orienté flux, avec un autre compromis entre latence et précision.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.