DeepEval
Framework d'évaluation LLM open source (Apache 2.0) qui fonctionne comme Pytest mais pour les systèmes à base de modèles de langage. Tu écris des fichiers de test, tu lances `deepeval test run`, et tu obtiens des métriques : G-Eval (LLM-as-a-judge personnalisable), hallucination, pertinence de la réponse, métriques RAG (fidélité, rappel et précision du contexte) et métriques agentiques (complétion de tâche, justesse des appels d'outils). La plupart tournent en local sur ta machine. Le framework est gratuit ; Confident AI est la plateforme cloud payante optionnelle par-dessus (datasets, tracing, monitoring prod).
Forces
- Logique Pytest : n'importe quel dev sait déjà écrire et lancer les tests, zéro concept nouveau
- Métriques riches (G-Eval, hallucination, RAG, agentiques) qui tournent en local, sans plateforme payante
- Se branche sur OpenAI, LangChain, CrewAI et la plupart des frameworks LLM
Limites
- Les métriques LLM-as-a-judge consomment des appels API : une suite large coûte des tokens à chaque run
- Facile de sur-mesurer : empiler des métriques décoratives au lieu de défendre la claim réelle
Pour qui
- Prouver avec des métriques qu'une réplication LLM tient la claim du papier
- Ajouter des tests d'éval à un RAG, un agent ou un chatbot avant de le montrer
- Détecter les régressions d'un système LLM comme on détecte un test cassé