Évaluer ses prompts en prod, du human-graded au model-graded

Tu as un prompt qui marche en démo mais qui régresse silencieusement en prod ? Les LLMs n'ont pas de tests unitaires standards. Vous installez Workbench (eval humain), puis promptfoo (eval automatisé code-graded + model-graded), avec assertions déterministes et LLM-as-judge pour la qualité subjective. À la fin, votre prompt est gardé par une CI qui fail dès qu'une régression apparaît.

Niveau : intermediate · Durée : 240 min

Modules

  1. 1. Pourquoi évaluer un prompt, concept + 4 composants canoniques
  2. 2. Workbench Anthropic, premier eval humain (rubric 1-5)
  3. 3. Code-graded, assertions déterministes + métriques classifier
  4. 4. promptfoo, framework eval YAML, multi-provider, custom graders
  5. 5. Model-graded, LLM-as-judge avec rubric structurée

Voir sur Coeurdar