DeepEval

Framework d'évaluation LLM open source (Apache 2.0) qui fonctionne comme Pytest mais pour les systèmes à base de modèles de langage. Tu écris des fichiers de test, tu lances `deepeval test run`, et tu obtiens des métriques : G-Eval (LLM-as-a-judge personnalisable), hallucination, pertinence de la réponse, métriques RAG (fidélité, rappel et précision du contexte) et métriques agentiques (complétion de tâche, justesse des appels d'outils). La plupart tournent en local sur ta machine. Le framework est gratuit ; Confident AI est la plateforme cloud payante optionnelle par-dessus (datasets, tracing, monitoring prod).

Forces

Limites

Pour qui

Site officiel

Voir sur Coeurdar