KV Cache

Le mécanisme qui permet à un LLM de ne pas recalculer tout le début d'une conversation à chaque nouveau mot généré. Il garde en mémoire le travail déjà fait sur le contexte (les « clés » et « valeurs »), et ne traite que la suite. Conséquence directe pour toi : si le début de ton prompt reste identique d'un appel à l'autre, le modèle le réutilise et ça coûte beaucoup moins cher. C'est le moteur derrière le « prompt caching » que facturent Anthropic et les autres.

Forces

Limites

Pour qui

Site officiel

Voir sur Coeurdar