Voicebox
Voice studio open-source local-first : dictation système avec Whisper local (MLX Apple Silicon, PyTorch CUDA/ROCm/CPU), voice cloning depuis 3 secondes d'audio, TTS 5 engines, 23 langues. MCP natif pour Claude Code, Cursor, Cline. Nettoyage des « euh hum » par un Qwen3 local. 28K+ stars GitHub, alternative gratuite à ElevenLabs.
Forces
- 100% local : ta voix et tes transcriptions ne sortent jamais de la machine
- MCP natif pour Claude Code, Cursor, Windsurf, Cline, VS Code
- Cleanup LLM intégré (Qwen3 local) : « euh hum » nettoyés avant paste
- Voice cloning depuis 3 secondes plus 5 TTS engines plus 23 langues
Limites
- Nécessite Apple Silicon ou GPU CUDA / ROCm pour des perfs correctes
- Setup initial plus complexe qu'un SaaS (download modèles, Qwen3, MLX)
- Pas de cloud sync : si tu changes de machine, tu repars de zéro
Pour qui
- Devs et créateurs qui dictent à Claude Code et veulent privacy et zero cost ongoing
- Podcasters et content creators qui veulent voice cloning sans dépendance cloud