Context Window
La mémoire de travail d'un LLM : la quantité de texte qu'il peut « voir » en une seule fois (conversation + instructions + documents). Tout ce qui n'y tient pas n'existe pas pour lui. Une fenêtre plus grande n'est pas une fenêtre mieux lue : l'étude Lost in the Middle (Liu et al., 2023) montre qu'un modèle retrouve mieux une information placée au début ou à la fin du contexte qu'au milieu. Les praticiens parlent aussi de dumb zone, le remplissage au-delà duquel les réponses se dégradent : c'est une règle de terrain, pas une mesure, et Dex Horthy (HumanLayer), qui a popularisé le terme, dit s'arrêter vers 300 000 à 400 000 tokens sur un modèle annoncé à 1 million. Annoncer 1M tokens ne signifie donc pas exploiter 1M tokens.
Forces
- Repartir d'une conversation neuve à chaque tâche distincte suffit souvent à retrouver des réponses nettes, parce qu'une conversation empilée n'apprend rien au modèle
- Règle de terrain : compacter ou repartir à neuf bien avant la limite, les oublis et les hallucinations montent avec le remplissage
Limites
- Les fenêtres larges coûtent plus cher en tokens, vérifier la tarification
Pour qui
- Comprendre pourquoi un agent perd le fil sur les longues sessions