Kokoro
Modèle de synthèse vocale à poids ouverts, 82 millions de paramètres, publié sous licence Apache 2.0. Il tourne chez toi via un paquet Python, couvre 8 langues dont le français, et ne pèse que 327 Mo de poids à télécharger.
Forces
- Poids sous Apache 2.0, usage commercial inclus, aucune clause à négocier ni clé API à gérer
- 82 millions de paramètres et 327 Mo sur le disque : c'est le plus léger de sa catégorie, l'inférence reste rapide sans matériel exotique
- 8 langues couvertes (anglais, français, espagnol, italien, portugais brésilien, hindi, japonais, mandarin) avec une banque de voix fournie
- Rien ne quitte ta machine : les textes que tu fais lire ne transitent chez aucun prestataire
Limites
- Aucun clonage de voix : tu es enfermé dans la banque de voix livrée, impossible de faire parler la tienne ou celle d'une marque
- Pas de contrôle d'émotion ni de direction d'intonation : sur un texte long, la lecture s'aplatit et ça s'entend
- Dépendance système espeak-ng à installer à côté du paquet Python : sur un serveur, c'est un composant de plus à déployer et à maintenir
- Tu héberges l'inférence toi-même : machine allumée, environnement Python à tenir à jour, et latence sensible si tu n'as pas de GPU
Pour qui
- Lecture audio d'articles ou de documentation, où le volume compte plus que le charme de la voix
- Prototypes d'agent vocal, pour valider un parcours sans ouvrir un compte ni consommer de quota
- Contextes où les textes vocalisés sont confidentiels et ne peuvent pas partir chez un prestataire