Débutant 9 minAudio

Kokoro TTS : une voix locale convaincante et légère

La plupart des bonnes synthèses vocales tournent dans le cloud ou réclament du matériel sérieux. Kokoro est un modèle ouvert de très petite taille dont le rendu est convaincant et qui génère plus vite que le temps réel sur une machine ordinaire — y compris sans carte graphique. Cela ne change pas seulement la qualité disponible en local : cela change ce qu'on peut se permettre de construire.

Par Mohamed Meguedmi·Màj 2026-09-27·Testé sur Windows, macOS, Linux

#Pourquoi un petit modèle change le calcul

La qualité de la synthèse vocale n'est plus le problème depuis un moment ; le coût et la localisation, si. Les voix en ligne sonnent très bien et impliquent que chaque phrase prononcée par votre système part chez un prestataire et soit facturée. Les gros modèles locaux sonnent bien et occupent une carte graphique que vous préféreriez donner à votre modèle de langage.

Un modèle assez petit pour s'exécuter en une seconde sur un processeur lève les deux contraintes d'un coup. Lire un long document à voix haute cesse d'être une décision budgétaire. Un assistant peut prononcer toutes ses réponses au lieu des seules réponses importantes. Un traitement par lots peut narrer cent fichiers pendant la nuit sur du matériel que vous possédez déjà.

#Ce qu'il fait, et ne fait pas

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j
Capacités réelles
CapacitéKokoro
Prosodie naturelle sur de la prose ordinaireSolide pour sa taille
Voix prédéfiniesPlusieurs, variant par accent et timbre
Clonage de voix à partir d'un échantillonCe n'est pas son objet
Direction émotionnelle fineLimitée
VitessePlus rapide que le temps réel sur matériel modeste
Fonctionnement hors ligneOui, une fois les poids téléchargés

La formulation honnête : c'est un très bon lecteur, pas un comédien. Pour de la narration, des notifications, un assistant ou de l'accessibilité, c'est plus que suffisant. Pour un travail d'interprétation où une intention précise compte, il vous faudra un outil que l'on peut diriger.

#Sa place dans une chaîne locale

  1. 01
    La voix entre
  2. 02
    Le modèle réfléchit
  3. 03
    La voix sort

Le budget de latence se raisonne dans son ensemble : l'utilisateur perçoit le total — transcription, puis génération, puis synthèse. La synthèse est en général la moins coûteuse des trois, ce qui signifie que la réactivité perçue d'un assistant vocal est décidée par la vitesse de votre modèle de langage, pas par la voix.

i
Diffusez la voix au fil du texte
Attendre la réponse complète avant de commencer à parler gâche les secondes que le modèle a passées à la produire. Synthétiser phrase par phrase à mesure que le texte arrive rend le système spectaculairement plus vif sans qu'il soit plus rapide.

#Kokoro ou Piper

Deux priorités différentes
KokoroPiper
Qualité de sortieSupérieure, prosodie plus naturelleBonne, plus plate
EmpreintePetiteTrès petite
Vitesse sur processeurRapideExtrêmement rapide
Matériel embarquéEnvisageableLe choix habituel
Couverture linguistiqueCibléeLarge jeu de voix
À choisir quandLa qualité primeL'empreinte ou la latence priment

Vérifiez la couverture linguistique du moment avant de vous engager : les modèles de voix sont souvent les plus aboutis en anglais, et un projet francophone doit contrôler plutôt que supposer.

#Licence et éthique

Deux questions décident si un modèle de synthèse vocale est utilisable dans votre projet, et une seule est technique. La première est la licence des poids et des voix, qui gouverne l'usage commercial : elle se lit sur la fiche du modèle, pas dans un résumé. La seconde est qu'un modèle à voix prédéfinies évite entièrement la question du consentement, là où cloner la voix de quelqu'un à partir d'un échantillon exige son accord et emporte, dans un nombre croissant de juridictions, des conséquences juridiques. Choisir des voix prédéfinies est souvent le moyen le plus simple de garder un projet simple.

#FAQ

Kokoro est-il utilisable commercialement ?+
Il est publié en poids ouverts ; ce sont les termes exacts de la fiche du modèle qui gouvernent l'usage commercial. Lisez-les à la source plutôt que dans une description tierce.
Faut-il une carte graphique ?+
Non. Sa petite taille rend la génération sur processeur praticable, en général plus rapide que le temps réel. Un GPU sert surtout pour le traitement de gros volumes.
Peut-il cloner ma voix ?+
Non, il utilise des voix prédéfinies. Le clonage relève d'une autre classe de modèles, et soulève des questions de consentement que les voix prédéfinies évitent.
Kokoro ou Piper ?+
Kokoro pour un rendu plus naturel ; Piper quand l'empreinte minimale et la latence la plus basse priment, typiquement sur matériel embarqué. Les deux fonctionnent entièrement hors ligne.
Quelles langues sont prises en charge ?+
La couverture est ciblée plutôt qu'universelle et évolue avec les versions. Vérifiez votre langue cible sur la fiche du modèle avant de bâtir dessus.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.