Classement LMArena text-to-image : 80 modèles, 6,5 millions de votes

Le classement LMArena text-to-image en septembre 2026 : GPT Image 2.5 en tête, la place des modèles open-weight et ce que l'Elo ne dit pas.
Mes notes sur le classement text-to-image d'arena.ai, le site qui s'appelait auparavant LMArena. L'original est ici : arena.ai/leaderboard/text-to-image. Le tableau est mis à jour en direct, de nouveaux votes tombent chaque jour, donc si vous lisez ceci dans un mois, allez vérifier les chiffres du moment.
On était en train de revoir la sélection de modèles que Flami propose par défaut pour les photos produit, et je voulais un repère extérieur. Pas notre propre goût, plutôt un gros tas d'avis de parfaits inconnus. Je suis donc allé voir le classement text-to-image de LMArena, toujours la référence la plus citée pour les modèles d'image, même si l'ancienne adresse lmarena.ai redirige maintenant vers arena.ai. Le principe est simple. Quelqu'un tape un prompt, reçoit deux images issues de deux modèles anonymes, choisit celle qu'il préfère, et toutes ces victoires et défaites s'additionnent dans un score façon Elo. La mise à jour du 24 septembre 2026 recense 80 modèles et 6 478 738 votes. Voici ce que j'en ai retenu, avec mes propres remarques.
OpenAI truste maintenant les trois premières places
En juin, GPT Image 2 trônait seul en tête, avec plus de cent points d'avance. Il y est toujours. Simplement, ses propres petits frères l'ont fait glisser à la troisième place.
- 1er, gpt-image-2.5-sunburst (OpenAI), 1424, marqué préliminaire ;
- 2e, gpt-image-2.5-flare (OpenAI), 1401, préliminaire aussi ;
- 3e, gpt-image-2 en qualité medium (OpenAI), 1383 ;
- 4e, mai-image-2.6 (Microsoft AI), 1335 ;
- 5e, reve-2.1 (Reve), 1302.
OpenAI a sorti Images 2.5 le 8 septembre (l'annonce d'OpenAI), avec deux versions API pour les développeurs. Flare est la version par défaut, Sunburst est plus lente et vise le travail fin, là où il faut un contrôle serré sur l'édition (9to5Mac en a fait un bon résumé). Je n'irais pas encore sacrer l'un des deux. Chacun n'a qu'environ 10 000 votes et un intervalle de confiance de plus ou moins 8 points, donc l'ordre entre eux peut encore bouger. GPT Image 2, c'est une autre histoire. 88 744 votes et un intervalle de 4 points : son 1383 est aussi stable qu'un chiffre peut l'être sur ce tableau.
Ce qui saute vraiment aux yeux, c'est l'écart entre OpenAI et tout le reste. De Sunburst jusqu'à MAI-Image-2.6 de Microsoft, ça fait 89 points. La meilleure entrée de Google, Nano Banana 2 en mode recherche web, arrive neuvième avec 1261. J'ai détaillé comment GPT Image 2 a construit une telle avance sur deux arènes différentes dans cet article. Pour savoir ce que ça donne sur de vrais projets, il y a l'avis sur GPT Image 2.
Le ventre du classement, là où vivent les modèles qu'on utilise vraiment
Zéro point. C'est l'écart entre seedream-5.0-pro et qwen-image-3.0-pro, à égalité à 1256 en 10e et 11e position. Passé le top dix, les voisins sont en général à quelques points d'écart, et les intervalles de confiance vont de 3 à 6 points. En pratique, ces lignes sont interchangeables. Ce qui tranche, c'est surtout le prix, et le fait que le modèle comprenne ou non ce qu'est votre produit.
Quelques lignes qui m'intéressent. grok-imagine-image est 23e, avec 1170 et 262 132 votes. En juin, c'était le modèle avec le plus de votes du tableau. Le record appartient maintenant au Nano Banana d'origine, avec 878 451, ce qui veut probablement juste dire qu'il traîne là depuis plus longtemps que les autres. qwen-image-2.0-pro est 19e, à 1192.
Seedream, c'est le cas intéressant. La famille s'est scindée en deux. Le nouveau seedream-5.0-pro a bondi en 10e position, pendant que seedream-4.5 stagne en 35e (1147) et seedream-5.0-lite en 38e (1138). Les versions allégées prennent toujours une claque dans les tests à l'aveugle, sans doute parce que les votants voient une image et jamais l'étiquette de prix. Toute la gamme, comparée côte à côte, est dans l'avis Seedream 5 si vous voulez les détails ; on trouve le modèle lui-même sur la page Seedream 5.
Où se classent vraiment les modèles open-weight ?
Ça dépend de ce qu'on appelle open, honnêtement. Si on ne compte que les licences permissives comme Apache 2.0 ou MIT, le meilleur est qwen-image-2512, 42e avec 1125. Juste derrière, hidream-o1-image sous licence MIT, 46e à 1116. Ensuite vient une longue série de modèles fermés avant z-image-turbo, lui aussi Apache 2.0, 57e avec 1084.
En élargissant la définition à « poids qu'on peut télécharger », le tableau devient bien plus flatteur. qwen-image-2.1 est 17e à 1228, même si c'est préliminaire, avec seulement 4 445 votes et une licence de recherche. Ideogram 4.0 en mode qualité est 18e à 1205. Ideogram a publié ses poids le 3 juin 2026 (leur billet de lancement), et c'est le modèle ouvert le plus voté aussi haut dans le classement. Le Cosmos3 de Nvidia est 25e. Chacun a sa propre licence, et je la relirais deux fois avant d'utiliser le modèle pour un client.
wan2.7-image-pro est 53e à 1103. Il est classé propriétaire, pas ouvert, mais je le mentionne parce qu'on le garde pour les photos produit : voir la page Wan 2.7 Image ou l'avis Wan 2.7 Image si vous voulez l'essayer.
Cinquante-septième, ça sonne mal pour Z-Image Turbo. Sauf que l'arène mesure à quel point une seule image est jolie, et ignore ce que coûtent mille images comme elle. Pourquoi Turbo reste notre moteur de brouillon principal malgré ce score, c'est une histoire plus longue, que j'ai racontée dans le dossier Z-Image ; vous pouvez aussi simplement l'essayer sur la page Z-Image.
Ce que le classement ne vous dira pas si vous vendez en ligne
Les votants de l'arène choisissent juste l'image la plus jolie. Personne là-bas ne se demande si elle va réellement vendre votre produit. Personne ne vérifie si le petit texte sur votre emballage reste lisible, ni si le produit sur la photo correspond à votre photo de référence. Boucler 300 références dans les temps et le budget n'est pas non plus au programme. Rien de tout ça n'entre dans le vote. J'utilise le classement général comme premier filtre, rien de plus, puis je fais passer le produit réel sur les deux ou trois modèles qui ont l'air corrects sur le papier. Je suis peut-être trop prudent sur ce point, mais chaque modèle de ce tableau passe par nos propres tests produit avant qu'on le propose aux utilisateurs.
Si vous voulez une vérification qui compte vraiment pour votre catalogue, laissez tomber le classement général et faites tourner vos propres produits sur les deux ou trois modèles qui ont l'air corrects sur le papier, côte à côte. Ce ne sera pas rigoureux statistiquement, mais au moins vous jugez votre propre catalogue, et pas celui d'un inconnu.
Tout ce qui, dans cette sélection, a passé ces tests est sur Flami, et les nouveaux comptes reçoivent des crédits de départ gratuits pour essayer.
Réponses rapides
Quel modèle d'image IA est numéro un sur arena.ai en ce moment ?
D'après la mise à jour du 24 septembre 2026, c'est gpt-image-2.5-sunburst d'OpenAI, avec 1424. Toujours marqué préliminaire. Flare est deuxième avec 1401, et GPT Image 2 troisième avec 1383.
En quoi arena.ai diffère-t-il d'Artificial Analysis ?
L'idée de base est la même : des votes à l'aveugle par paires transformés en Elo. Les votants changent, et les prompts aussi. Les positions ne correspondent pas d'un site à l'autre, et les scores ne sont pas sur la même échelle. Je regarde les deux, arena.ai et le classement Artificial Analysis. Pour ce que ça vaut, Sunburst est aussi en tête chez Artificial Analysis.
Y a-t-il des modèles open-weight proche du sommet ?
Oui, si vous acceptez les licences maison. qwen-image-2.1 est 17e et Ideogram 4.0 est 18e, chacun avec sa propre licence. Le meilleur modèle en licence Apache 2.0, qwen-image-2512, est 42e.
Qu'est-il arrivé à LMArena ?
Le site a déménagé de lmarena.ai vers arena.ai, et les anciens liens redirigent vers le même classement text-to-image. L'historique des votes semble avoir suivi lui aussi, puisque des modèles plus anciens comme le Nano Banana d'origine affichent toujours des centaines de milliers de votes.
Comment le score est-il calculé ?
Un votant voit deux images pour le même prompt, sans étiquette indiquant quel modèle a produit quoi. Les scores se recalculent à la façon des échecs, à partir des victoires et des défaites. Plus les votes s'accumulent, plus l'intervalle de confiance se resserre. Le leader actuel est à plus ou moins 8 points sur environ 11 000 votes. GPT Image 2 a huit fois plus de votes, et se situe à plus ou moins 4.
Mise à jour le 30 septembre 2026, sur la base de l'actualisation du classement du 24 septembre 2026.
Sources
À lire aussi
Flux 2 Klein : les petits modèles ouverts de BFL, huit mois après leur sortie
Classement GPT Image 2 : il a gagné deux arènes, avant qu'OpenAI ne le dépasse
Classement LMArena image-to-video : MiniMax H3 prend la tête
Avis Wan 2.7 : le modèle vidéo d'Alibaba qui garde les textes lisibles et les produits crédibles