Paramètres de génération LLM
Les paramètres de génération, ce sont les réglages qui pilotent CE que le modèle sort une fois le prompt fixé, pas ce que tu lui demandes mais la façon dont il le produit. Il y en a cinq qui reviennent partout. « max-tokens » : le plafond de longueur de la réponse, il joue directement sur le coût et la latence. « temperature » : à quel point le modèle suit les probabilités les plus fortes, bas donne du prévisible et répétable, haut donne du varié et créatif. « top-p » (nucleus) : au lieu de régler l'audace, il coupe la traîne des tokens improbables et ne garde que le noyau vraisemblable. « pénalité de répétition » : réduit les mots et tournures qui reviennent en boucle. « stop-sequence » : arrête net la génération dès qu'un mot ou un symbole choisi apparaît.
Forces
- Cinq réglages universels, présents dans toutes les API de modèles, une fois compris ils se transfèrent partout
- Le duo max-tokens + temperature couvre la quasi-totalité des cas réels, pas besoin de maîtriser les cinq pour être efficace
- Levier direct sur la reproductibilité : temperature à 0 rend une sortie stable, indispensable en éval et en prod
Limites
- Régler temperature et top-p ensemble te fait poursuivre un effet sans savoir lequel le produit, source d'heures perdues
- temperature à 0 n'est pas un déterminisme garanti : certains modèles gardent une variance résiduelle, ne t'y fie pas aveuglément
Pour qui
- Devs qui intègrent une API modèle et voient des réponses coupées ou instables sans comprendre d'où ça vient
- PM et PO qui écrivent des specs de features IA et doivent savoir quel réglage rend une sortie fiable ou créative