IA multimodale produits, vision, audio, documents, agents multi-canaux

IA multimodale pour le produit : construis des agents IA multimodaux qui lisent images, PDF et audio. Tu apprends quand le multimodal change vraiment ton produit (vs gadget), comment extraire la structure d'un PDF, transcrire un audio, et combiner les 3 inputs dans un agent qui audite un mockup, lit un brief et écoute un debrief oral. Au-delà du vision basique : coûts tokens, resize, batch, équivalents audio (Whisper, Deepgram).

Niveau : intermediate

Modules

  1. 1. Au-delà du vision basique, quand multimodal change ton produit
  2. 2. Documents et graphiques, PDFs, slides, captures de dashboards
  3. 3. Audio → texte, Whisper, transcription, summary de meetings
  4. 4. Agents multimodaux, crop tool, sub-agents, workflows visuels

Voir sur Coeurdar