WhisperX : horodatage mot à mot et locuteurs
Whisper transcrit très bien et horodate approximativement. WhisperX ajoute deux choses qui changent tout dès qu'on sort du simple document : un alignement forcé qui donne un horodatage mot à mot réellement exact, et une séparation des locuteurs qui indique qui a parlé quand. C'est ce qui transforme une transcription en sous-titres utilisables et en compte rendu de réunion lisible.
#Ce que Whisper seul ne résout pas
Whisper produit un excellent texte. Ses faiblesses apparaissent dès qu'on veut autre chose que du texte. Les horodatages sont émis par segment et peuvent dériver d'une seconde ou plus : invisible dans un document, inacceptable en sous-titrage, où un sous-titre qui arrive un temps trop tard est pire que pas de sous-titre du tout. Et Whisper n'a aucune notion de locuteur : deux heures de réunion reviennent en un monologue indifférencié.
WhisperX répond aux deux en ajoutant des étapes plutôt qu'en remplaçant le modèle. C'est ce choix de conception qui préserve la qualité de transcription que vous connaissez.
#Les trois étapes
Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
| Étape | Rôle | Ce qu'il lui faut |
|---|---|---|
| Transcription | L'audio devient du texte, via une implémentation rapide de Whisper | Un modèle Whisper : sa taille décide qualité et mémoire |
| Alignement forcé | Chaque mot est repositionné exactement dans l'audio | Un modèle phonétique pour la langue |
| Séparation des locuteurs | L'audio est découpé par voix et les tours étiquetés | Un modèle dédié, dont l'accès demande d'accepter des conditions |
L'étape d'alignement est celle qu'on sous-estime. C'est elle qui rend l'horodatage mot à mot digne de confiance, et elle dépend de la langue : sans modèle d'alignement disponible pour la langue traitée, on retombe sur un horodatage par segment, c'est-à-dire exactement ce qu'on cherchait à quitter.
#La séparation des locuteurs, sans illusion
L'étiquetage fonctionne en regroupant les caractéristiques vocales sur l'ensemble de l'enregistrement. Il est bon sur un audio propre avec des voix distinctes qui parlent chacune à leur tour, et il se dégrade précisément dans les situations que produisent les réunions : des gens qui se coupent la parole, quelqu'un loin du micro, des voix proches, une connexion médiocre.
Deux remarques pratiques. On peut en général indiquer le nombre de locuteurs, et le faire améliore nettement le résultat : le modèle n'a plus à le deviner. Et les étiquettes sont anonymes par construction : le système dit qu'il y avait trois voix et quels tours appartiennent à chacune, pas qui elles sont. Associer une étiquette à un nom est une étape manuelle — et c'est aussi le moment où la transcription devient une donnée personnelle.
#Ce que ça demande
- La taille du modèle Whisper décide de tout
- Un grand modèle donne le meilleur texte et demande le plus de mémoire ; un modèle intermédiaire est le compromis courant sur les longs enregistrements.
- Trois modèles se chargent, pas un
- La mémoire culmine quand transcription, alignement et séparation sont tous résidents. Enchaîner les étapes en libérant entre elles est le remède sur une petite carte.
- Le processeur fonctionne, lentement
- Comptez des heures plutôt que des minutes sur un long audio ; un GPU en fait un outil praticable.
- Le traitement par lots aide
- Les longs fichiers vont beaucoup plus vite avec une inférence groupée.
- Whisper en local : la transcription de base
- Produire un compte rendu de réunion en local
- Assistant vocal local : la chaîne complète
#Le bon usage : la transcription est une entrée, pas un livrable
Dans la quasi-totalité des cas réels, la transcription n'est pas le but : elle alimente un modèle local qui en tire un compte rendu, un relevé de décisions ou un résumé. Cela a une conséquence sur la qualité attendue : une erreur de transcription sur un mot rare compte moins que la structure des tours de parole, parce que c'est cette structure qui permet au modèle d'attribuer correctement ce qui a été dit.
#FAQ
WhisperX est-il gratuit ?+
Quelle est la fiabilité de la séparation des locuteurs ?+
Faut-il un GPU ?+
WhisperX ou Whisper seul ?+
Fonctionne-t-il en français ?+
Peut-il transcrire en direct ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.