Vision (modèles multimodaux)

La capacité d'un modèle IA à lire une image comme il lit un texte : capture d'écran, photo de document, graphique, maquette. Tu envoies l'image dans le même appel que ta question, et le modèle décrit, extrait, compare ou raisonne dessus. C'est ce qui fait passer un assistant de « comprend le texte » à « comprend ce que je lui montre ».

Forces

Limites

Pour qui

Site officiel

Voir sur Coeurdar