Vision (modèles multimodaux)
La capacité d'un modèle IA à lire une image comme il lit un texte : capture d'écran, photo de document, graphique, maquette. Tu envoies l'image dans le même appel que ta question, et le modèle décrit, extrait, compare ou raisonne dessus. C'est ce qui fait passer un assistant de « comprend le texte » à « comprend ce que je lui montre ».
Forces
- Supprime le besoin d'un pipeline OCR séparé pour la plupart des documents
- Raisonne sur le contenu visuel, pas juste extraire le texte (comprend un graphique)
Limites
- Précision fragile sur les chiffres denses et les petits caractères
- Coût par image plus élevé qu'un simple appel texte
Pour qui
- Extraire des données de documents scannés ou de captures sans coder un OCR
- Donner du contexte visuel à un agent (interface, maquette, diagramme)