VoxCPM
Modèle de synthèse vocale qui clone une voix à partir de quelques secondes d'audio, en plusieurs langues, et qui accepte une description écrite pour ajuster le rendu (plus grave, plus posé, accent marqué). Tout tourne sur ta machine, sans clé API ni abonnement, mais il faut une carte NVIDIA avec environ 8 Go de mémoire vidéo. Le résultat varie d'une génération à l'autre : deux ou trois essais sont souvent nécessaires pour obtenir la voix visée.
Forces
- Aucun coût par minute générée, là où les services facturent au volume d'audio
- L'audio source ne quitte jamais ta machine, ce qui compte quand c'est la voix d'un client
- Réglage par description écrite, plus accessible qu'un jeu de curseurs techniques
Limites
- Carte NVIDIA avec environ 8 Go de mémoire vidéo obligatoire en pratique
- Résultat irrégulier : il faut souvent générer deux ou trois fois pour la même phrase
- Le consentement de la personne clonée reste ton problème, la licence du modèle ne le traite pas
Pour qui
- Narrer tes propres contenus sans réenregistrer à chaque correction de script
- Prototyper une interface vocale sans ouvrir de compte ni exposer l'audio à un tiers