vLLM

Moteur d'inférence qui sert un modèle open weight à plusieurs centaines d'utilisateurs simultanés sur le même GPU. Il regroupe les requêtes en continu au lieu d'attendre qu'un lot se termine, et gère la mémoire du cache d'attention par blocs, comme un système d'exploitation gère la mémoire virtuelle.

Forces

Limites

Pour qui

Site officiel

Voir sur Coeurdar