IA multimodale produits, vision, audio, documents, agents multi-canaux
IA multimodale pour le produit : construis des agents IA multimodaux qui lisent images, PDF et audio. Tu apprends quand le multimodal change vraiment ton produit (vs gadget), comment extraire la structure d'un PDF, transcrire un audio, et combiner les 3 inputs dans un agent qui audite un mockup, lit un brief et écoute un debrief oral. Au-delà du vision basique : coûts tokens, resize, batch, équivalents audio (Whisper, Deepgram).
Niveau : intermediate