LLM Day-to-Day Degradation

7 mécanismes expliquant la variance de qualité des LLMs d'un jour à l'autre, même avec des weights figés : drift de température, routing A/B des providers, contamination de cache, pollution du context window, bruit de tokenization, instabilité des prompts système, et variance d'infrastructure. Chacun est diagnosticable avec des techniques spécifiques. Le mécanisme 'pollution du contexte' a été officialisé par Anthropic sous le nom Context Rot, la dégradation progressive de la qualité de raisonnement à mesure que la fenêtre se remplit, avec autocompacts faits 'au pire moment' qui produisent des résumés incohérents. Pour le mécanisme #4 (pollution du context window), les praticiens parlent de dumb zone : passé un certain remplissage, souvent situé vers 40% sans que ce chiffre soit une mesure, l'attention se dilue et le modèle retrouve mieux le début et la fin que le milieu, ce que l'étude Lost in the Middle (Liu et al., 2023) a mesuré. Conséquence pratique : démarrer une nouvelle conversation est plus efficace qu'empiler des messages dans la même session, même si la fenêtre annonce 1M tokens.

Forces

Limites

Pour qui

Site officiel

Voir sur Coeurdar