Evals (évaluation d'un système LLM)
Le jeu de tests qui mesure si ton système à base de modèle fait ce qu'il doit, sur des cas que tu as choisis à l'avance. Sans evals, tu changes un prompt, tu regardes trois réponses, tu trouves que c'est mieux, et tu n'as aucune idée de ce que tu viens de casser ailleurs. Avec des evals, une modification devient un chiffre qui monte ou qui descend, et une régression se voit avant la mise en ligne.
Forces
- Rend une modification de prompt mesurable au lieu d'être une impression
- Attrape les régressions silencieuses, celles qui ne cassent rien mais dégradent la réponse
Limites
- Les métriques jugées par un modèle consomment des appels API : une suite large coûte à chaque run
- Facile de mesurer ce qui est facile à mesurer plutôt que ce qui compte pour l'utilisateur
Pour qui
- Prouver avec des chiffres que le changement de prompt a bien amélioré le système