Context Window
La mémoire de travail d'un LLM : la quantité de texte qu'il peut « voir » en une seule fois (conversation + instructions + documents). Plus la fenêtre est grande, plus vous pouvez partager de contexte. Au-delà de ~40% de remplissage, la qualité chute (dump zone) : le LLM retient principalement le début et la fin de la fenêtre, le milieu devient flou et favorise les hallucinations (pattern 'lost in the middle'). Annoncer 1M tokens ne signifie pas exploiter 1M tokens, la limite utile est typiquement autour de 400k.
Forces
- Claude Sonnet 3.7 : 200k tokens, assez pour tout un codebase moyen
- Heuristique opérationnelle : viser <40% de remplissage avant compaction, au-delà, hallucinations en hausse
Limites
- Les fenêtres larges coûtent plus cher en tokens, vérifier la tarification
Pour qui
- Comprendre pourquoi un agent perd le fil sur les longues sessions