LM Arena
Plateforme d'évaluation de LLM par battles aveugles en pairs : tu soumets un prompt, deux modèles anonymes répondent, tu votes pour le meilleur. Système Elo style chess (Bradley-Terry). Inclut text, vision, image, video arenas. La plateforme s'appelle désormais Arena et vit sur arena.ai. Elle publie un classement par type de tâche (texte, développement web, vision, documents, recherche, image, vidéo, agents), et c'est ce découpage qui sert : le premier du classement général n'est pas forcément le premier sur ta tâche, et le podium change d'un mois à l'autre.
Forces
- Méthodologie blind pairwise transparente (Elo, pas vibes)
- Tens of millions de votes cumulés, largest blind-preference dataset public
- Surface étendue : text, vision, WebDev, Copilot, Search, Image, Video arenas
- Permet de battler tes propres prompts persona avant prod
Limites
- Le score Elo masque les écarts use-case (un modèle peut être numéro 1 en text mais numéro 5 en coding)
- Pas de garantie reproductibilité prompt-par-prompt
- Bias votants vers les outputs longs et well-formatted
Pour qui
- PM et Tech Lead choisissant un LLM pour intégration produit
- Curieux qui veulent comparer 2 modèles sur leur propre prompt sans signup