← Tous les articlesÉtudes

Classement GPT Image 2 : il a gagné deux arènes, avant qu'OpenAI ne le dépasse

Camille Moreau30 septembre 2026Lecture : 7 min
Classement GPT Image 2 : il a gagné deux arènes, avant qu'OpenAI ne le dépasse

GPT Image 2 sur les classements Artificial Analysis et arena.ai : l'ampleur de son avance, son rang en septembre 2026, et ce que signifient les écarts d'Elo.

Voici ma lecture de deux classements indépendants texte-vers-image, Artificial Analysis et arena.ai. Les deux recalculent après chaque nouvelle vague de votes, donc considérez les chiffres ci-dessous comme une photographie de septembre 2026, et vérifiez les originaux pour les chiffres du jour.

88 744 votes. C'est le nombre que GPT Image 2 a désormais rassemblé sur le classement arena.ai, et son score a à peine bougé depuis qu'il en comptait la moitié. Sur les deux grandes arènes, GPT Image 2 occupe la troisième place. Troisième, ça sonne comme une rétrogradation, et d'une certaine façon ça l'est, mais les deux modèles devant lui appartiennent à OpenAI. Je m'occupe de la direction artistique chez Flami, donc choisir quel modèle génère l'image principale, c'est littéralement mon choix, et je surveille celui-ci depuis le printemps. Ce qui m'avait frappé à l'époque était rare : deux arènes qui n'ont rien à voir entre elles tombaient d'accord sur le même vainqueur. Ce qui est intéressant maintenant, c'est la façon dont cette avance s'est réduite.

Pourquoi je regarde deux arènes à la fois

Une seule arène peut se tromper. Qui vient voter compte, et le choix des prompts aussi. L'appariement des modèles biaise également le résultat, plus qu'on ne le pense. Chacun de ces facteurs peut faire bouger le classement. Si deux tableaux aux méthodes différentes placent le même modèle en tête, je prends ça beaucoup plus au sérieux que l'un ou l'autre pris isolément.

Les deux utilisent un vote par paires en aveugle. Pour les mécanismes précis, je les ai détaillés dans mes notes sur l'arène image d'arena.ai. Et l'échelle est sérieuse : arena.ai compte maintenant 80 modèles et près de 6,5 millions de votes dans sa catégorie texte-vers-image, à la date de sa mise à jour du 24 septembre 2026. Un tel volume ne laisse guère de place au hasard.

Artificial Analysis : d'une avance de 74 points à 17

En juin, le tableau sur Artificial Analysis était très déséquilibré. GPT Image 2 (high) devançait le second de 74 points Elo, soit plus que tout l'écart entre la deuxième et la cinquième place.

Aujourd'hui, la photo est différente. Le haut du tableau :

  • 1er, GPT Image 2.5 Sunburst (max), 1 197 ;
  • 2e, GPT Image 2.5 Flare (max), 1 190 ;
  • 3e, GPT Image 2 (high), 1 172 sur 15 346 comparaisons ;
  • 4e, Grok Imagine Image 2.0 de xAI, 1 155 ;
  • 5e, MAI-Image-2.6 de Microsoft AI, 1 150.

Une précision avant toute comparaison avec de vieilles captures d'écran. Le tableau tourne désormais sur une méthodologie révisée, baptisée v2.0, et les scores ne sont plus sur la même échelle. Le 1 340 affiché par GPT Image 2 en juin et le 1 172 d'aujourd'hui ne se mesurent pas à la même toise, donc ne lisez pas ça comme un effondrement de 170 points. Ce qu'on peut comparer, c'est l'écart. Face au meilleur modèle hors OpenAI, il est tombé à 17 points, avec un intervalle à 95 % de plus ou moins 9 de chaque côté. En pratique, ça donne 52 victoires sur 100, loin de l'avance écrasante des chiffres de juin.

Plus bas, Nano Banana 2 est sixième avec 1 125, et GPT Image 1.5 (high) huitième avec 1 107. Parmi les modèles à poids ouverts, Qwen-Image-2.1 est le mieux classé, 18e avec 1 034. En juin, ce titre revenait à Cosmos3-Super, pour ce que ça vaut.

arena.ai : l'étiquette « provisoire » a disparu, le score a tenu

C'est la partie qui me rassure. En juin, gpt-image-2 (medium) était à 1 385 avec 45 100 votes et une étiquette Preliminary, ce qui veut dire que la note pouvait encore bouger avec l'arrivée de nouveaux votes. À l'époque, je pensais qu'il pourrait en perdre environ 30 points. Ce n'est pas arrivé. Dans la mise à jour du 24 septembre, il est à 1 383 plus ou moins 4, avec 88 744 votes, et l'étiquette a disparu.

Il a quand même perdu la première place. Le 8 septembre, OpenAI a sorti Images 2.5 pour ChatGPT (voici l'annonce). Ses deux versions API se sont placées directement au-dessus de leur grand frère. gpt-image-2.5-sunburst affiche 1 424 et gpt-image-2.5-flare 1 401, toutes deux encore provisoires, avec environ 10 000 votes chacune.

Ce qui devient intéressant, c'est l'écart avec tout ce qui n'est pas OpenAI. En juin, le poursuivant le plus proche était reve-2.0 à 1 273, plus de cent points derrière, et je ne me souvenais pas d'une avance pareille sur une arène image. Aujourd'hui, le challenger le plus proche est mai-image-2.6 de Microsoft, à 1 335. Ça fait 48 points d'écart, alors que reve-2.0 a glissé à la huitième place. OpenAI reste devant, mais avec une marge que Microsoft pourrait combler avec une seule bonne sortie.

Ce que signifie vraiment un écart d'Elo

L'Elo vient des échecs, et l'arithmétique derrière est plus abordable qu'il n'y paraît. Un écart de 100 points veut dire que le modèle le mieux noté devrait gagner environ 64 votes sur 100 en face à face. À 48 points, la marge actuelle de GPT Image 2 sur Microsoft sur arena.ai, on tombe plutôt à 57 sur 100. À 17 points, son avance sur Artificial Analysis, on descend vers 52.

Donc oui, GPT Image 2 bat encore presque tout le monde. Simplement, il le fait de façon plus serrée qu'au printemps, et les votants auraient sans doute du mal à distinguer le haut du classement dans beaucoup de duels.

Et les modèles plus bas dans le tableau

Ça vaut aussi le coup de regarder le bas du tableau. Sur arena.ai, Seedream 5.0 Lite est 38e avec 1 138. En juin, il était 28e, et son score a à peine changé : ce sont simplement les nouveaux modèles qui se sont empilés au-dessus. Si vous voulez le tester sur des photos produit, Seedream 5 est disponible sur Flami, et toute la famille est comparée dans un article séparé.

Z-Image Turbo est 57e avec 1 084, contre 46e auparavant. Le même angle mort que d'habitude : l'arène ne le crédite pas de pouvoir tourner sur votre propre matériel. J'y reviens dans le dossier sur LMArena. On a creusé ce compromis dans notre étude Z-Image, et vous pouvez l'essayer directement sur Flami.

Un rang bas là-dedans veut peut-être simplement dire que moins d'inconnus ont aimé cette image précise, pas que le modèle ne convient pas à votre tâche.

Ce que j'en fais concrètement

Pour une image principale unique où seule la qualité compte, mon premier choix reste le modèle d'OpenAI. Il avait pris la tête des deux arènes en avril. La couverture de lancement de TechCrunch soulignait déjà sa qualité de rendu du texte, et c'est justement le détail qui compte le plus sur une photo de packaging. Je ne sais pas encore si 2.5 vaut le changement pour le travail courant. Les scores provisoires disent oui, mais j'attendrais probablement qu'ils se stabilisent.

Le plus simple pour juger par vous-même, c'est d'envoyer une de vos photos produit sur Flami et de faire tourner le même brief sur deux ou trois de ces modèles côte à côte.

Questions fréquentes

  • Où se classe GPT Image 2 actuellement ? Troisième sur les deux tableaux, derrière le duo Images 2.5 d'OpenAI lui-même. Sur arena.ai, il affiche 1 383 sur 88 744 votes. Sur Artificial Analysis, 1 172 sur 15 346 comparaisons.
  • Pourquoi son score Artificial Analysis est-il passé de 1 340 à 1 172 ? Le tableau est passé à une méthodologie révisée v2.0, avec une échelle différente. Comparez les écarts entre modèles, pas les scores bruts entre versions.
  • Que signifiait l'étiquette Preliminary sur arena.ai ? Elle signale un modèle qui n'a pas encore réuni assez de votes. GPT Image 2 a perdu cette étiquette pendant l'été, et son score n'a bougé que de 2 points.
  • Quel modèle à poids ouverts est le mieux classé sur Artificial Analysis ? Qwen-Image-2.1, 18e avec 1 034. Sur arena.ai, ça dépend de la rigueur avec laquelle on définit ce qui est ouvert, et je vérifierais chaque licence avant un projet client.

Photographie prise le 30 septembre 2026, à partir de la mise à jour arena.ai du 24 septembre 2026 et du tableau Artificial Analysis en direct.

Sources

  1. TechCrunch, ChatGPT's new Images 2.0 model is surprisingly good at generating text
  2. OpenAI, Introducing ChatGPT Images 2.0
  3. Artificial Analysis, image arena rankings (text to image)
  4. OpenAI blog, ChatGPT Images 2.5 launch
  5. arena.ai, Image Arena, text-to-image board

L’auteur

Camille Moreau

Testeuse chez Flami

À lire aussi

Recevez 15 crédits gratuits

Utilisez-les pour générer des images et des vidéos :

≈ 11 × Nano Banana 2, ≈ 12 × GPT Image 2, ≈ 1 × Seedance 2

Obtenir des crédits gratuits