Temps réel, flux, lot, différé, appareil : les cinq façons de servir…
Un modèle entraîné ne sert à rien tant que quelqu'un ne peut pas lui poser de question. La façon de le mettre à disposition se choisit parmi cinq modes, et ce qui les distingue n'est pas la technique mais une question simple : qui attend la réponse, et combien de temps ? **Le temps réel** : une requête, une réponse en quelques millisecondes, et un humain qui attend devant l'écran, comme la vérification d'un paiement au moment où tu cliques sur payer. **Le flux** : le même point d'accès au modèle, mais alimenté par une file d'événements plutôt que par un clic, comme l'heure d'arrivée d'une livraison qui se recalcule à chaque mouvement du livreur. **Le lot** : des prédictions calculées d'un coup pour tout le monde, à heure fixe, comme un score de risque de départ recalculé chaque nuit pour chaque abonné. **Le différé** : un travail trop lourd pour qu'on l'attende, que tu soumets et dont on te prévient quand il est prêt, comme le résumé d'un long PDF ; chez AWS, ce mode accepte des charges jusqu'à 1 Go et une heure de traitement. **L'appareil** : le modèle tourne sur le téléphone ou la montre, sans réseau, sans aller-retour vers un serveur, et sans que les données quittent l'utilisateur, ce qui explique l'intérêt pour les petits modèles de langage. Le même partage existe pour les grands modèles de langage : chez Anthropic, l'API de traitement par lots coûte deux fois moins cher que l'appel classique, et la plupart des lots sont terminés en moins d'une heure.