Débutant 9 minAudio

Faster-Whisper : transcrire vite, même sans GPU

Faster-Whisper est une réimplémentation de Whisper qui transcrit nettement plus vite et consomme sensiblement moins de mémoire, pour une qualité de texte équivalente. Ce n'est pas un nouveau modèle : ce sont les mêmes poids, exécutés par un moteur d'inférence différent. C'est l'implémentation à choisir par défaut pour transcrire en local, et elle rend enfin raisonnable la transcription sur processeur.

Par Mohamed Meguedmi·Màj 2026-09-25·Testé sur Windows, macOS, Linux

#Ce que c'est, et ce que ce n'est pas

Whisper désigne à la fois une famille de modèles et l'implémentation de référence qui les exécute. Faster-Whisper garde les premiers et remplace la seconde par un moteur optimisé pour les modèles de type transformeur. Le texte produit est le même à qualité équivalente ; ce qui change, c'est le temps et la mémoire.

Conséquence pratique : tout ce que vous savez du choix de taille de modèle Whisper reste valable, et la plupart des outils de transcription locale que vous croisez l'utilisent déjà sous le capot sans forcément le dire.

#D'où vient le gain

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j
Un moteur d'inférence spécialisé
Écrit pour exécuter des transformeurs efficacement, plutôt qu'un cadriciel généraliste.
La quantification
Exécuter le modèle en 8 bits divise l'empreinte mémoire et accélère, avec une perte de qualité de transcription en général imperceptible.
Le traitement par lots
Les longs fichiers sont découpés et traités en parallèle plutôt que strictement l'un après l'autre.
La détection d'activité vocale
Sauter les silences évite de faire travailler le modèle sur du vide — sur des enregistrements de réunion, c'est loin d'être négligeable.

#Quel modèle, quelle précision

Choisir la taille selon l'usage
TailleMémoire indicative en 8 bitsPour quoi
PetitQuelques centaines de MoPrise de notes rapide, audio propre, une seule langue
MoyenAutour de 1 à 2 GoLe compromis courant sur de longs enregistrements
Grand3 à 5 GoFrançais soigné, vocabulaire spécialisé, audio difficile

Pour du français, la différence entre un modèle intermédiaire et un grand modèle se voit sur les noms propres, les sigles et les passages où plusieurs personnes parlent. Si la transcription alimente ensuite un modèle de langage qui rédige un compte rendu, une erreur sur un mot rare compte moins qu'on ne le croit ; si elle doit être lue telle quelle, le grand modèle se justifie.

#Les réglages qui comptent vraiment

  1. 01
    Forcer la langue
  2. 02
    Activer la détection d'activité vocale
  3. 03
    Choisir la quantification
  4. 04
    Découper les très longs fichiers
i
Les hallucinations de silence
Whisper a une manie connue : sur un passage sans parole, il lui arrive de produire une phrase récurrente — une formule de politesse, un générique. La détection d'activité vocale est le remède principal ; un contrôle rapide des passages répétés en est le complément.

#Faster-Whisper ou autre chose

L'outil selon le besoin
BesoinChoix
Du texte, vite, en localFaster-Whisper
Un horodatage mot à mot pour du sous-titrageUne chaîne avec alignement forcé
Savoir qui a parléUne chaîne avec séparation des locuteurs
De la transcription en directUn moteur orienté flux
Une machine très modeste, sans GPUUn petit modèle en 8 bits, ou un moteur plus léger encore

#FAQ

Faster-Whisper est-il moins précis que Whisper ?+
Non, à taille de modèle égale la qualité est équivalente : ce sont les mêmes poids exécutés par un moteur différent. La quantification en 8 bits a un effet en général imperceptible sur la transcription.
Faut-il un GPU ?+
Non, et c'est son intérêt : sur processeur, il rend la transcription locale praticable. Un GPU accélère fortement les longs enregistrements.
Pourquoi le modèle invente-t-il des phrases sur les silences ?+
C'est un comportement connu de Whisper sur les passages sans parole. Activer la détection d'activité vocale est le principal remède.
Quelle taille de modèle pour du français ?+
Le modèle intermédiaire suffit si le texte alimente ensuite un résumé automatique. Pour une transcription destinée à être lue telle quelle, le grand modèle se justifie sur les noms propres et les sigles.
Peut-il faire du direct ?+
Il est conçu pour des fichiers. Le sous-titrage en direct demande un moteur orienté flux, avec un autre compromis entre latence et précision.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.