Patterns de scaling d'une API LLM
L'ensemble des briques d'architecture qui permettent à une API adossée à un modèle d'encaisser la charge sans exploser le coût ni tomber : passerelle d'entrée unique (authentification et limitation de débit), cache des requêtes d'embedding identiques, files de messages pour les appels asynchrones, disjoncteurs pour isoler un modèle en échec, autoscaling GPU et répartition de charge entre nœuds. C'est la question type posée en entretien d'architecture : comment tiens-tu dix mille requêtes concurrentes vers une API de modèle ?
Forces
- Donne un vocabulaire commun avec les équipes plateforme, qui connaissent déjà ces briques hors IA
- La plupart des briques sont classiques : rien à réinventer, seulement à brancher au bon endroit
Limites
- Empiler les briques trop tôt ajoute des points de panne sur un trafic qui ne les justifie pas encore
Pour qui
- Cadrer l'architecture d'un service qui appelle un modèle sous trafic réel