Métriques d'un RAG : Top K, recall@K, precision@K, coût par requête
Quatre chiffres qui disent si la recherche d'un RAG fait son travail, avant même de regarder la réponse du modèle. **Top K** : le nombre de passages que la recherche renvoie. Avec K = 5, le système rend les 5 passages les mieux notés, pas un de plus. **Recall@K** : la part des passages utiles qui se retrouvent dans ces K. S'il existe 4 passages utiles et que 2 seulement sont dans ton Top K, le recall est de 50 %. Il mesure ce que tu as raté. **Precision@K** : la part des K passages renvoyés qui sont réellement utiles. Si tu en renvoies 5 et que 2 seulement servent, la précision est de 40 %. Elle mesure le bruit que tu paies. **Coût par requête** : ce que coûte une seule réponse, recherche, reclassement éventuel et appels au modèle compris. Les deux premières mesures tirent en sens inverse : augmenter K ramène plus de passages utiles (le recall monte) mais noie davantage l'utile dans le bruit (la précision baisse), et chaque passage de plus alourdit la facture. Top P n'appartient pas à cette liste : c'est un réglage de génération, traité dans la fiche Paramètres de génération LLM. Source : [Instagram reel DeMqr3Ijx22](https://www.instagram.com/reel/DeMqr3Ijx22/).
Forces
- Quatre définitions chiffrées qui remplacent « la recherche a l'air bonne » par une mesure
- Recall et précision se calculent à la main sur un petit jeu de questions dont tu connais les passages utiles
Limites
- Recall@K et precision@K supposent de savoir à l'avance quels passages sont utiles : il faut annoter un jeu de questions
- Aucune des quatre mesures ne dit si la réponse finale du modèle est juste : elles ne jugent que la recherche et la facture
Pour qui
- Qui diagnostique un RAG qui répond à côté et veut savoir si la panne est dans la recherche
- PM et PO qui doivent fixer un seuil de qualité et un budget par réponse pour une fonctionnalité IA