Illustration abstraite représentant un classement de modèles IA

LMArena : ce que le classement mesure vraiment (et ce qu’il ignore)

6,8 millions de votes à l’aveugle | Un écart de 30 points ne veut rien dire | Le classement ignore complètement le prix

Le nom a changé, pas le principe. Vous tapez « lmarena », vous atterrissez sur arena.ai. La plateforme s’est rebaptisée le 28 janvier 2026 et l’ancien domaine redirige. Vos signets tombent au bon endroit.

Ce classement est cité partout dès qu’un modèle sort. Le problème, c’est que la plupart des gens le lisent comme un bulletin de notes, alors qu’il mesure une chose très précise et en ignore beaucoup d’autres.

Comment ça marche, en clair

Vous posez une question. Deux modèles anonymes répondent côte à côte. Vous votez. Les noms se révèlent après.

Ces millions de duels alimentent une notation par paires. On parle couramment de score Elo, par analogie avec les échecs, et c’était vrai au départ. Depuis fin 2023, la plateforme utilise le modèle de Bradley-Terry : au lieu de mettre à jour match après match, il réestime toutes les notes à partir de l’ensemble des votes. Plus stable, se lit pareil.

Le chiffre qui compte n’est pas le rang, c’est l’écart. 100 points d’écart correspondent à environ 64 % de victoires en duel. 30 points, c’est 54 %, autant dire un match nul.

À la mi-août 2026 : plus de 6,8 millions de votes sur plus de 360 modèles, avec Claude Fable 5 en tête du classement texte autour de 1 525 points. Les suivants se tiennent dans une cinquantaine de points, donc la première place change de main régulièrement (ne bâtissez rien sur un podium relevé il y a trois semaines).

Quatre raisons de ne pas prendre ce score au pied de la lettre

En avril 2025, des chercheurs de Cohere Labs, AI2, Princeton, Stanford et Washington publiaient The Leaderboard Illusion, repris ensuite dans la track Datasets and Benchmarks de NeurIPS 2025. Leurs constats, plus deux limites structurelles, font quatre points de vigilance.

1. Le test privé avantage les gros. Un éditeur peut soumettre plusieurs variantes du même modèle, garder la meilleure, retirer les autres. L’étude documente le cas de Meta, qui aurait évalué jusqu’à 27 variantes avant la sortie de Llama 4. Publier le meilleur tirage sur 27, ce n’est pas publier son modèle.

Arena répond que sa politique est la même pour tous : chacun soumet autant de variantes qu’il a les moyens d’en faire tourner. En creux, ça confirme l’avantage aux mieux dotés.

2. Les données de vote sont très inégalement réparties. Les modèles propriétaires captent plus de 60 % des duels selon la même étude. Or ces données servent aussi à entraîner. Les auteurs évoquent jusqu’à +112 % de performance sur la distribution propre à l’arène, c’est-à-dire une progression sur ce que l’arène mesure, pas ailleurs.

3. Un vote à l’aveugle juge une réponse, pas un travail. C’est la limite la plus importante, et personne ne la conteste. Le votant lit deux réponses en quelques secondes (souvent moins). Il ne teste pas la tenue sur une session de deux heures, la mémoire d’une consigne posée trente messages plus tôt, la fiabilité sur des appels d’outils, ni le comportement face à un fichier de 400 lignes.

Un modèle peut être brillant en réponse unique et décevant en usage prolongé. C’est même assez fréquent.

4. On vote pour ce qui se lit bien. Un vote rapide récompense les réponses bien mises en forme et un peu flatteuses. La plateforme corrige l’effet de longueur, mais aucun correctif n’annule le fait qu’on juge un texte agréable plutôt qu’un texte exact. Sur une question factuelle pointue, le mieux classé n’a pas toujours raison.

Le filtre français, la fonction que personne n’utilise

Arena permet de filtrer par langue. Le classement global est massivement alimenté par des votes en anglais, et filtrer sur le français change l’ordre, parfois de plusieurs places.

La contrepartie est mécanique : moins de votes, donc des intervalles de confiance beaucoup plus larges. Sur le classement francophone, un écart de 20 ou 30 points ne signifie rien. Regardez la barre d’incertitude à côté du score : si elle chevauche celle du voisin, les deux sont à égalité.

L’usage utile du filtre est donc négatif. Il sert moins à désigner un gagnant qu’à repérer les modèles qui décrochent nettement hors anglais. Bon à savoir quand on rédige en français toute la journée.

Le classement image, et l’affaire Nano Banana

Même principe, deux visuels générés depuis le même prompt. Il a un avantage réel sur le texte : juger deux images demande moins d’expertise que juger deux raisonnements, et le biais de mise en forme disparaît.

C’est ce classement qui a rendu Nano Banana célèbre. Le modèle est arrivé sous un nom de code, sans annonce, sans marque, sans documentation, et a grimpé en tête sur les seuls votes avant que Google ne confirme sa paternité. Le meilleur argument en faveur de la méthode : à l’aveugle, la notoriété de l’éditeur ne pèse rien.

La vidéo suit le même mécanisme, avec une réserve : peu de votes, des générations coûteuses et lentes, des classements qui bougent à peine. Une indication, pas un verdict.

La méthode pour s’en servir vraiment

Étape Ce qu’on fait Ce qu’on évite
1. Choisir le bon classement Texte, code, vision, image ou vidéo selon l’usage Citer « le » classement global
2. Lire l’écart, pas le rang Retenir un groupe de tête de 4 ou 5 S’arrêter au numéro 1
3. Vérifier l’intervalle de confiance Écarter les écarts qui se chevauchent Comparer deux modèles à 15 points
4. Filtrer sur le français Repérer les décrochages nets Désigner un vainqueur sur peu de votes
5. Tester sur 3 tâches réelles Vos prompts, vos fichiers Décider sans avoir rien essayé

L’étape 5 n’est pas une formule de politesse. Le classement est un outil de présélection : il vous fait passer de quarante modèles à cinq. Le dernier tri dépend de votre usage, et lui seul. Si vous codez toute la journée, le duel qui compte est celui du match Claude Code contre Cursor sur des tâches réelles, pas un score agrégé sur des questions génériques.

Les deux angles morts

Le prix. Le classement l’ignore totalement. Un modèle 20 points sous le leader peut coûter dix fois moins cher, et plusieurs modèles ouverts sont exactement dans ce cas.

La confidentialité. Si vos données ne peuvent pas sortir de vos machines, aucun score ne vous servira : la vraie question devient ce que vous pouvez faire tourner en local.

Le classement se consulte sur arena.ai, et les modèles y sont testables gratuitement, souvent sans compte. C’est aussi une façon commode d’essayer un modèle payant avant de s’abonner.

Le catalogue d’OpenRouter mesure autre chose qu’un classement de préférences : ce que les développeurs paient réellement au million de jetons.

Questions fréquentes

LMArena et Arena, c’est la même chose ?

Oui. Chatbot Arena en 2023 chez LMSYS Berkeley, puis LMArena, puis Arena depuis le 28 janvier 2026. Même outil, redirection en place. Un article qui parle encore de « LMSYS » parle du même classement, avec des chiffres probablement périmés.

Le score Arena est-il vraiment un score Elo ?

Plus depuis fin 2023. C’est un modèle de Bradley-Terry, qui réestime toutes les notes à partir de l’ensemble des votes au lieu de les mettre à jour duel par duel. Plus stable, et se lit de la même façon.

Peut-on truquer le classement ?

Pas directement, les votes sont à l’aveugle. Mais on peut l’optimiser : soumettre plusieurs variantes en test privé et ne publier que la meilleure, ce que documente The Leaderboard Illusion.

Un modèle en tête est-il le meilleur pour moi ?

Rien ne le garantit. Le classement mesure une préférence humaine sur des réponses isolées, pas la tenue sur un projet, le prix, ni la confidentialité. Il présélectionne, il ne décide pas.

Pourquoi les positions bougent-elles autant ?

Parce que le haut du tableau se tient dans une cinquantaine de points, soit une marge où quelques milliers de votes suffisent à inverser deux modèles. Regardez le groupe de tête, pas le numéro un.

Les accès gratuits aux IA bougent tout le temps

Quotas qui changent, nouvelles offres, alternatives sans inscription : chaque mardi, un email court avec l'actu IA de la semaine, les outils qui valent vraiment le coup et un prompt testé. Pour ne pas avoir à re-chercher à chaque fois.

Gratuit · Désinscription en 1 clic · Pas de spam

Publications similaires