Vosk : la reconnaissance vocale en direct, hors ligne
Vosk est un moteur de reconnaissance vocale hors ligne, très léger, qui fonctionne en flux continu : il transcrit à mesure que l'on parle, sur un processeur modeste, avec des modèles de quelques dizaines de mégaoctets. Il ne rivalise pas avec les grands modèles sur la qualité du texte — il fait autre chose, et ce qu'il fait ne se remplace pas facilement.
#Ce que Vosk fait autrement
Les modèles de transcription de référence traitent des fichiers : on leur donne un enregistrement complet, ils rendent un texte. Vosk traite un flux : il reçoit l'audio par petits morceaux et produit des résultats partiels puis définitifs au fil de la parole, avec une latence de l'ordre de la fraction de seconde.
Cette différence d'architecture explique tout le reste : des modèles minuscules, une exécution sur processeur sans effort, une empreinte mémoire compatible avec un Raspberry Pi ou un téléphone, et une qualité de texte inférieure à celle des grands modèles sur de l'audio difficile.
#Le direct, sa vraie spécialité
Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
- Latence
- Le texte apparaît pendant qu'on parle, ce qui autorise les commandes vocales et le sous-titrage en direct.
- Résultats partiels
- L'application peut réagir avant la fin de la phrase — indispensable pour un mot de réveil ou une commande courte.
- Empreinte
- Quelques dizaines de mégaoctets par langue, contre plusieurs gigaoctets pour un grand modèle.
- Vocabulaire restreint
- On peut limiter la reconnaissance à une liste de mots attendus, ce qui augmente fortement la précision sur des commandes.
Ce dernier point est sous-estimé. Pour piloter une application par la voix, restreindre le vocabulaire à cinquante commandes possibles transforme un moteur moyen en moteur très fiable — là où un grand modèle généraliste continuera d'hésiter entre des homophones.
#Vosk ou Whisper
| Critère | Vosk | Whisper et dérivés |
|---|---|---|
| Mode | Flux continu | Fichier |
| Latence | Fraction de seconde | Après traitement |
| Taille des modèles | Dizaines de Mo | Centaines de Mo à plusieurs Go |
| Matériel | Processeur modeste, embarqué | Processeur correct, GPU souhaitable |
| Qualité sur audio difficile | Correcte | Nettement meilleure |
| Ponctuation et mise en forme | Limitée | Bonne |
| À choisir pour | Commandes vocales, direct, embarqué | Transcription de réunions, d'interviews, de vidéos |
Il n'y a pas de vainqueur général. Une chaîne sérieuse utilise souvent les deux : Vosk pour détecter une commande ou afficher un retour immédiat, un modèle plus lourd pour produire la transcription définitive une fois l'enregistrement terminé.
#Les cas où il gagne
- 01Commande vocale d'une application
- 02Sous-titrage en direct
- 03Matériel embarqué
- 04Confidentialité stricte sans GPU
#Mise en œuvre
Le fonctionnement est simple : on télécharge un modèle pour la langue voulue, on ouvre un flux audio, on pousse des morceaux dans le moteur, on lit les résultats partiels puis définitifs. Des liaisons existent pour les langages courants, et un serveur WebSocket permet de brancher une page web ou une application mobile sur un moteur qui tourne sur votre machine.
Deux points d'attention : la qualité dépend fortement du modèle de langue choisi — vérifiez ce qui existe pour le français avant de bâtir dessus — et le taux d'échantillonnage de l'audio doit correspondre à ce qu'attend le modèle, faute de quoi la reconnaissance se dégrade sans message d'erreur explicite.
#FAQ
Vosk est-il gratuit ?+
Faut-il une carte graphique ?+
Vosk ou Whisper ?+
Fonctionne-t-il en français ?+
Peut-on limiter le vocabulaire reconnu ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.