vLLM
Moteur d'inférence qui sert un modèle open weight à plusieurs centaines d'utilisateurs simultanés sur le même GPU. Il regroupe les requêtes en continu au lieu d'attendre qu'un lot se termine, et gère la mémoire du cache d'attention par blocs, comme un système d'exploitation gère la mémoire virtuelle.
Forces
- Le regroupement continu garde le GPU occupé au lieu de le laisser attendre la fin du lot en cours
- La pagination du cache d'attention supprime la fragmentation mémoire qui gaspille l'essentiel de la VRAM
- Serveur compatible avec le format API OpenAI, donc branchable sans réécrire le client
Limites
- Configuration nettement plus technique que la mise en route en une commande, et un vrai GPU obligatoire
- Sans utilisateurs simultanés, aucun bénéfice mesurable par rapport à un runtime local simple
- Aucune interface, c'est un serveur : la couche de discussion reste à ta charge
Pour qui
- Servir un modèle open weight à une équipe ou à des clients depuis une infrastructure que tu contrôles
- Faire passer un prototype local au stade de service partagé sans repasser par une API tierce