Groq
Fournisseur d'inférence qui fait tourner des modèles open-weight (Llama, Mixtral, Qwen) sur du matériel maison appelé LPU, au lieu des GPU habituels. Résultat concret : des réponses qui arrivent à 300-1000 tokens par seconde là où un fournisseur classique en donne 30 à 80. L'API parle le même dialecte qu'OpenAI, donc brancher Groq revient à changer une URL et une clé dans un code existant. Tier gratuit sans carte bancaire, environ 30 requêtes par minute, suffisant pour prototyper.
Forces
- Vitesse de réponse hors norme (300 à 1000 tokens par seconde) qui change la sensation du produit
- API compatible OpenAI : brancher ou débrancher revient à changer une URL et une clé
- Tier gratuit sans carte bancaire, utilisable pour un vrai prototype et pas seulement une démo
Limites
- Catalogue limité aux modèles open-weight : ni Claude, ni GPT, donc pas un remplaçant sur le raisonnement long
- Quotas du tier gratuit vite atteints dès que plusieurs utilisateurs tapent en même temps
- Dépendance à un fournisseur unique pour la vitesse : prévoir une porte de sortie si l'API ralentit
Pour qui
- Prototyper un agent ou un chat où l'attente se voit à l'écran, sans budget d'infrastructure
- Boucles qui enchaînent beaucoup de petits appels de modèle et où la latence cumulée pique