VibeVoice
Modèle de synthèse vocale de Microsoft qui génère des dialogues longs, jusqu'à 90 minutes et quatre voix distinctes en une seule passe, pensé pour le format podcast. Microsoft a retiré le code de génération de son dépôt en septembre 2025, après des usages contraires à l'intention annoncée ; les poids restent sur Hugging Face et un fork communautaire conserve le code. Entraîné en anglais et en chinois uniquement.
Forces
- Jusqu'à 90 minutes et quatre voix distinctes en une seule génération, pensé pour le dialogue
- Licence MIT et poids toujours téléchargeables sur Hugging Face, sans abonnement
- La variante Realtime 0.5B reste dans le dépôt Microsoft, avec un premier son en 300 ms environ
Limites
- Anglais et chinois uniquement : la fiche officielle prévient qu'une autre langue peut sortir inintelligible
- Code de génération retiré par Microsoft : tu dépends d'un fork communautaire sans éditeur responsable
- Présenté comme modèle de recherche, avec usage commercial déconseillé sans tests supplémentaires
- Besoin matériel non chiffré par les pages officielles, à mesurer sur ta machine
Pour qui
- Tester un format podcast anglais à plusieurs voix avant de réserver un studio
- Juger sur pièce les démos de dialogue généré qui circulent, avant de promettre ce format à un client