KV Cache
Le mécanisme qui permet à un LLM de ne pas recalculer tout le début d'une conversation à chaque nouveau mot généré. Il garde en mémoire le travail déjà fait sur le contexte (les « clés » et « valeurs »), et ne traite que la suite. Conséquence directe pour toi : si le début de ton prompt reste identique d'un appel à l'autre, le modèle le réutilise et ça coûte beaucoup moins cher. C'est le moteur derrière le « prompt caching » que facturent Anthropic et les autres.
Forces
- Préfixe de prompt stable réutilisé = facture de tokens en entrée fortement réduite
- Réduit aussi la latence : moins de calcul à refaire à chaque tour
Limites
- Casse dès que tu modifies le début du prompt : un seul caractère en amont invalide le cache
- En session Claude Code, changer de modèle ou ajouter un MCP en cours de route invalide tout le cache : instructions, CLAUDE.md et historique sont re-facturés plein tarif. Configure avant de démarrer
Pour qui
- Réduire le coût d'un agent qui rejoue le même contexte système en boucle