Whisper (transcription audio)
Le modèle de transcription audio d'OpenAI, devenu la référence pour passer de la voix au texte. Tu lui donnes un fichier audio ou vidéo, il rend une transcription propre, ponctuée, multilingue. C'est la brique qui transforme un podcast, un appel ou un mémo vocal en données exploitables par le reste de ta chaîne IA.
Forces
- Qualité de transcription solide sur de nombreuses langues et conditions de bruit
- Disponible en API hébergée OU en local (poids open source) selon ton besoin de confidentialité
Limites
- La diarisation (qui parle quand) n'est pas native, il faut une couche en plus
- Le local exige du GPU pour rester rapide sur de longs fichiers
Pour qui
- Transcrire réunions, interviews ou vidéos pour les rendre cherchables et résumables
- Alimenter un agent multimodal en texte issu de sources audio