Intermédiaire 9 minAudio

Vosk : la reconnaissance vocale en direct, hors ligne

Vosk est un moteur de reconnaissance vocale hors ligne, très léger, qui fonctionne en flux continu : il transcrit à mesure que l'on parle, sur un processeur modeste, avec des modèles de quelques dizaines de mégaoctets. Il ne rivalise pas avec les grands modèles sur la qualité du texte — il fait autre chose, et ce qu'il fait ne se remplace pas facilement.

Par Mohamed Meguedmi·Màj 2026-09-27·Testé sur Windows, macOS, Linux

#Ce que Vosk fait autrement

Les modèles de transcription de référence traitent des fichiers : on leur donne un enregistrement complet, ils rendent un texte. Vosk traite un flux : il reçoit l'audio par petits morceaux et produit des résultats partiels puis définitifs au fil de la parole, avec une latence de l'ordre de la fraction de seconde.

Cette différence d'architecture explique tout le reste : des modèles minuscules, une exécution sur processeur sans effort, une empreinte mémoire compatible avec un Raspberry Pi ou un téléphone, et une qualité de texte inférieure à celle des grands modèles sur de l'audio difficile.

#Le direct, sa vraie spécialité

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j
Latence
Le texte apparaît pendant qu'on parle, ce qui autorise les commandes vocales et le sous-titrage en direct.
Résultats partiels
L'application peut réagir avant la fin de la phrase — indispensable pour un mot de réveil ou une commande courte.
Empreinte
Quelques dizaines de mégaoctets par langue, contre plusieurs gigaoctets pour un grand modèle.
Vocabulaire restreint
On peut limiter la reconnaissance à une liste de mots attendus, ce qui augmente fortement la précision sur des commandes.

Ce dernier point est sous-estimé. Pour piloter une application par la voix, restreindre le vocabulaire à cinquante commandes possibles transforme un moteur moyen en moteur très fiable — là où un grand modèle généraliste continuera d'hésiter entre des homophones.

#Vosk ou Whisper

Deux outils, deux métiers
CritèreVoskWhisper et dérivés
ModeFlux continuFichier
LatenceFraction de secondeAprès traitement
Taille des modèlesDizaines de MoCentaines de Mo à plusieurs Go
MatérielProcesseur modeste, embarquéProcesseur correct, GPU souhaitable
Qualité sur audio difficileCorrecteNettement meilleure
Ponctuation et mise en formeLimitéeBonne
À choisir pourCommandes vocales, direct, embarquéTranscription de réunions, d'interviews, de vidéos

Il n'y a pas de vainqueur général. Une chaîne sérieuse utilise souvent les deux : Vosk pour détecter une commande ou afficher un retour immédiat, un modèle plus lourd pour produire la transcription définitive une fois l'enregistrement terminé.

#Les cas où il gagne

  1. 01
    Commande vocale d'une application
  2. 02
    Sous-titrage en direct
  3. 03
    Matériel embarqué
  4. 04
    Confidentialité stricte sans GPU

#Mise en œuvre

Le fonctionnement est simple : on télécharge un modèle pour la langue voulue, on ouvre un flux audio, on pousse des morceaux dans le moteur, on lit les résultats partiels puis définitifs. Des liaisons existent pour les langages courants, et un serveur WebSocket permet de brancher une page web ou une application mobile sur un moteur qui tourne sur votre machine.

Deux points d'attention : la qualité dépend fortement du modèle de langue choisi — vérifiez ce qui existe pour le français avant de bâtir dessus — et le taux d'échantillonnage de l'audio doit correspondre à ce qu'attend le modèle, faute de quoi la reconnaissance se dégrade sans message d'erreur explicite.

#FAQ

Vosk est-il gratuit ?+
Oui, c'est un projet libre, avec des modèles téléchargeables par langue. Vérifiez la licence du modèle précis que vous utilisez pour un usage commercial.
Faut-il une carte graphique ?+
Non, et c'est tout son intérêt : il est conçu pour tourner sur processeur, y compris sur du matériel embarqué.
Vosk ou Whisper ?+
Vosk pour le direct, les commandes vocales et l'embarqué. Whisper et ses dérivés pour transcrire des fichiers avec la meilleure qualité de texte. Les deux se combinent très bien.
Fonctionne-t-il en français ?+
Oui, des modèles français existent. Leur qualité varie selon le modèle choisi : testez sur vos propres enregistrements avant de vous engager.
Peut-on limiter le vocabulaire reconnu ?+
Oui, et c'est le réglage qui change le plus la précision pour des commandes vocales : restreindre la reconnaissance à une liste de phrases attendues améliore nettement la fiabilité.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.