Groq

Fournisseur d'inférence qui fait tourner des modèles open-weight (Llama, Mixtral, Qwen) sur du matériel maison appelé LPU, au lieu des GPU habituels. Résultat concret : des réponses qui arrivent à 300-1000 tokens par seconde là où un fournisseur classique en donne 30 à 80. L'API parle le même dialecte qu'OpenAI, donc brancher Groq revient à changer une URL et une clé dans un code existant. Tier gratuit sans carte bancaire, environ 30 requêtes par minute, suffisant pour prototyper.

Forces

Limites

Pour qui

Site officiel

Voir sur Coeurdar