Paramètres de génération LLM
Les paramètres de génération, ce sont les réglages qui pilotent CE que le modèle sort une fois le prompt fixé, pas ce que tu lui demandes mais la façon dont il le produit. Il y en a cinq qui reviennent partout. « max-tokens » : le plafond de longueur de la réponse, il joue directement sur le coût et la latence. « temperature » : à quel point le modèle suit les probabilités les plus fortes, bas donne du prévisible et répétable, haut donne du varié et créatif. « top-p » (nucleus) : au lieu de régler l'audace, il coupe la traîne des tokens improbables et ne garde que le noyau vraisemblable. « pénalité de répétition » : réduit les mots et tournures qui reviennent en boucle. « stop-sequence » : arrête net la génération dès qu'un mot ou un symbole choisi apparaît. Sous le capot, deux mots expliquent pourquoi ces boutons fonctionnent. À chaque pas, le modèle donne un score brut à chaque token possible, les **logits**, puis une fonction appelée **softmax** transforme ces scores en probabilités. La temperature intervient à ce moment-là : la baisser rend la distribution plus pointue, les tokens déjà probables le deviennent encore plus et les improbables s'effacent. Et tirer au sort n'est pas la seule façon de choisir : le **beam search**, proposé par des bibliothèques comme Transformers de Hugging Face, garde plusieurs suites candidates en parallèle et retient la plus probable dans son ensemble. Il marche bien quand la longueur de la sortie est prévisible (traduction, résumé), et tourne vite à la répétition sur une réponse ouverte. Le mécanisme de top-p : avec top-p à 0,9, le modèle classe les tokens suivants du plus au moins probable, en garde autant qu'il faut pour que leurs probabilités cumulées atteignent au moins 90 %, puis tire parmi eux seulement. Le reste de la traîne n'est jamais tiré. Source : [Instagram reel DeMqr3Ijx22](https://www.instagram.com/reel/DeMqr3Ijx22/).
Forces
- Cinq réglages universels, présents dans toutes les API de modèles, une fois compris ils se transfèrent partout
- Le duo max-tokens + temperature couvre la quasi-totalité des cas réels, pas besoin de maîtriser les cinq pour être efficace
- Levier direct sur la reproductibilité : temperature à 0 rend une sortie stable, indispensable en éval et en prod
Limites
- Régler temperature et top-p ensemble te fait poursuivre un effet sans savoir lequel le produit, source d'heures perdues
- temperature à 0 n'est pas un déterminisme garanti : certains modèles gardent une variance résiduelle, ne t'y fie pas aveuglément
Pour qui
- Devs qui intègrent une API modèle et voient des réponses coupées ou instables sans comprendre d'où ça vient
- PM et PO qui écrivent des specs de features IA et doivent savoir quel réglage rend une sortie fiable ou créative