Évaluer ses prompts en prod, du human-graded au model-graded
Tu as un prompt qui marche en démo mais qui régresse silencieusement en prod ? Les LLMs n'ont pas de tests unitaires standards. Vous installez Workbench (eval humain), puis promptfoo (eval automatisé code-graded + model-graded), avec assertions déterministes et LLM-as-judge pour la qualité subjective. À la fin, votre prompt est gardé par une CI qui fail dès qu'une régression apparaît.
Niveau : intermediate · Durée : 240 min
Modules
- 1. Pourquoi évaluer un prompt, concept + 4 composants canoniques
- 2. Workbench Anthropic, premier eval humain (rubric 1-5)
- 3. Code-graded, assertions déterministes + métriques classifier
- 4. promptfoo, framework eval YAML, multi-provider, custom graders
- 5. Model-graded, LLM-as-judge avec rubric structurée