LM Arena
Plateforme d'évaluation de LLM par battles aveugles en pairs : tu soumets un prompt, deux modèles anonymes répondent, tu votes pour le meilleur. Système Elo style chess (Bradley-Terry). Inclut text, vision, image, video arenas. En mai 2026, Claude Opus 4.6 tient le numéro 1 text (Elo 1418), suivi de Gemini 3.1 Pro (1406) et GPT-5.2 (1402).
Forces
- Méthodologie blind pairwise transparente (Elo, pas vibes)
- Tens of millions de votes cumulés, largest blind-preference dataset public
- Surface étendue : text, vision, WebDev, Copilot, Search, Image, Video arenas
- Permet de battler tes propres prompts persona avant prod
Limites
- Le score Elo masque les écarts use-case (un modèle peut être numéro 1 en text mais numéro 5 en coding)
- Pas de garantie reproductibilité prompt-par-prompt
- Bias votants vers les outputs longs et well-formatted
Pour qui
- PM et Tech Lead choisissant un LLM pour intégration produit
- Curieux qui veulent comparer 2 modèles sur leur propre prompt sans signup