GPT Image 2 Rangliste im Check: zwei Arenen gewonnen, dann von OpenAI selbst überholt

GPT Image 2 in den Ranglisten von Artificial Analysis und arena.ai: der Vorsprung, der Stand im September 2026 und was die Elo-Abstände bedeuten.
Das hier ist mein Blick auf zwei unabhängige Text-zu-Bild-Ranglisten, Artificial Analysis und arena.ai. Beide rechnen nach jeder neuen Stimmen-Charge neu, die Zahlen unten sind also eine Momentaufnahme aus September 2026, für den aktuellen Stand lohnt der Blick ins Original.
88.744 Stimmen. So viele hat GPT Image 2 mittlerweile in der arena.ai-Rangliste gesammelt, und sein Score hat sich kaum bewegt, seit es halb so viele waren. In beiden großen Arenen steht GPT Image 2 auf Platz drei. Das klingt nach einem Abstieg, und ein Stück weit ist es das auch, nur stehen darüber ausschließlich OpenAIs eigene Modelle. Ich mache Art Direction bei Flami, die Wahl des Modells fürs Hero-Bild liegt also buchstäblich bei mir, und ich beobachte es seit dem Frühjahr. Damals fiel mir etwas Seltenes auf: zwei Arenen, die nichts miteinander zu tun haben, einigten sich auf denselben Sieger. Spannend ist jetzt, wie stark dieser Vorsprung geschrumpft ist.
Warum zwei Arenen mehr zählen als eine
Eine einzelne Arena kann danebenliegen. Wer überhaupt abstimmt, spielt eine Rolle, genau wie der Pool an Prompts. Auch die Paarung der Modelle verzerrt das Bild, mehr, als die meisten denken. All das verschiebt die Rangliste ein Stück. Wenn zwei Boards mit unterschiedlicher Methodik dasselbe Modell ganz oben sehen, nehme ich das deutlich ernster als jedes für sich.
Beide arbeiten mit blindem Paarvergleich. Wie das im Detail funktioniert, habe ich in meinen Notizen zum arena.ai-Bildboard aufgeschrieben. Und die Größenordnung ist beachtlich: arena.ai zählt inzwischen 80 Modelle und fast 6,5 Millionen Stimmen in der Kategorie Text-zu-Bild, Stand: Update vom 24. September 2026. Bei solchen Zahlen ist reiner Zufall so gut wie ausgeschlossen.
Artificial Analysis: von 74 Punkten Vorsprung auf 17
Im Juni sah das Bild bei Artificial Analysis noch einseitig aus. GPT Image 2 (high) lag 74 Elo-Punkte vor dem Zweitplatzierten, mehr als die gesamte Strecke vom zweiten bis zum fünften Platz.
Heute liest sich das anders. Die Spitze der Rangliste:
- Platz 1, GPT Image 2.5 Sunburst (max), 1197;
- Platz 2, GPT Image 2.5 Flare (max), 1190;
- Platz 3, GPT Image 2 (high), 1172 bei 15.346 Vergleichen;
- Platz 4, Grok Imagine Image 2.0 von xAI, 1155;
- Platz 5, MAI-Image-2.6 von Microsoft AI, 1150.
Eine Warnung, bevor jemand das mit alten Screenshots vergleicht: Die Rangliste läuft inzwischen auf einer überarbeiteten Methodik namens v2.0, und die Skala ist eine andere. Die 1340 Punkte, die GPT Image 2 im Juni hatte, und die 1172 von heute sind nicht dasselbe Maß, als Einbruch um 170 Punkte sollte man das also nicht lesen. Vergleichbar ist der Abstand. Zum besten Nicht-OpenAI-Modell sind es noch 17 Punkte, mit einem 95-%-Intervall von plus/minus 9. In der Praxis heißt das 52 Siege von 100, nicht mehr der klare Vorsprung aus dem Juni.
Weiter unten liegt Nano Banana 2 auf Platz sechs mit 1125, GPT Image 1.5 (high) auf Platz acht mit 1107. Unter den offenen Modellen führt Qwen-Image-2.1, Platz 18 mit 1034. Im Juni trug noch Cosmos3-Super diesen Titel, nur damit es erwähnt ist.
arena.ai: die Markierung „Preliminary“ ist verschwunden, der Score blieb stehen
Dieser Teil beruhigt mich am meisten. Im Juni stand gpt-image-2 (medium) bei 1385 Punkten, 45.100 Stimmen, mit der Markierung „Preliminary“, die bedeutet, dass sich die Bewertung mit weiteren Stimmen noch verschieben kann. Ich hatte damals getippt, dass da noch 30 Punkte oder so verloren gehen. Ist nicht passiert. Beim Update vom 24. September steht es bei 1383 plus/minus 4, 88.744 Stimmen, die Markierung ist weg.
Den ersten Platz hat es trotzdem verloren. Am 8. September brachte OpenAI Images 2.5 für ChatGPT heraus (hier der Launch-Post). Die beiden API-Versionen haben sich direkt über ihren älteren Bruder gesetzt: gpt-image-2.5-sunburst steht bei 1424, gpt-image-2.5-flare bei 1401, beide noch mit „Preliminary“-Status und jeweils rund 10.000 Stimmen.
Spannend wird es beim Abstand zu allen außerhalb von OpenAI. Im Juni lag reve-2.0 als Zweiter bei 1273, mehr als hundert Punkte zurück, so einen Vorsprung hatte ich auf einer Bild-Arena noch nicht gesehen. Jetzt ist Microsofts mai-image-2.6 mit 1335 der nächste Verfolger, 48 Punkte Abstand, während reve-2.0 auf Platz acht zurückgefallen ist. OpenAI führt weiter, nur mit einem Vorsprung, den Microsoft mit einem einzigen guten Release aufholen könnte.
Was ein Elo-Abstand wirklich bedeutet
Elo kommt aus dem Schach, und die Rechnung dahinter ist freundlicher, als sie aussieht. 100 Punkte Abstand heißen, dass das höher bewertete Modell etwa 64 von 100 direkten Duellen gewinnen sollte. Bei 48 Punkten, dem aktuellen Vorsprung von GPT Image 2 vor Microsoft auf arena.ai, sind es eher 57 von 100. Bei 17 Punkten, seinem Vorsprung auf Artificial Analysis, bleiben noch etwa 52.
GPT Image 2 schlägt also nach wie vor fast alle. Nur eben knapper als im Frühjahr, und bei vielen Paarungen würden Abstimmende die Top-Modelle vermutlich kaum noch auseinanderhalten können.
Und die Modelle weiter unten
Ein Blick auf die untere Hälfte der Tabelle lohnt sich auch. Bei arena.ai steht Seedream 5.0 Lite auf Platz 38 mit 1138. Im Juni war es Platz 28, der Score hat sich kaum verändert, es haben sich einfach neuere Modelle darüber gestapelt. Wer es an Produktfotos testen will: Seedream 5 gibt es bei Flami, die ganze Modellfamilie im Vergleich steht in einem eigenen Beitrag.
Z-Image Turbo liegt auf Platz 57 mit 1084, runter von Platz 46. Derselbe blinde Fleck wie immer: Die Arena gibt keine Punkte dafür, dass ein Modell auf der eigenen Hardware läuft. Warum das trotzdem zählt, habe ich in der LMArena-Analyse durchgekaut. Diesen Kompromiss haben wir in unserer Z-Image-Recherche behandelt, ausprobieren lässt es sich direkt bei Flami.
Ein niedriger Platz heißt dort nur, dass weniger Fremde genau dieses eine Bild mochten, nicht, dass das Modell für deine Aufgabe falsch wäre.
Was ich daraus für mich mache
Für ein einzelnes Hero-Bild, bei dem nur die Qualität zählt, ist meine erste Wahl weiterhin OpenAIs Modell. Es hat sich im April beide Arenen geholt. TechCrunch hob in seiner Launch-Berichterstattung hervor, wie gut es Text rendert, und genau das ist bei Packshots das entscheidende Detail. Ich bin mir nicht sicher, ob sich der Wechsel zu 2.5 für die tägliche Arbeit schon lohnt. Die vorläufigen Werte sprechen dafür, ich würde aber wohl warten, bis sie sich setzen.
Am einfachsten testest du das selbst: ein Produktfoto zu Flami hochladen und dasselbe Briefing durch zwei, drei dieser Modelle laufen lassen.
Kurz gefragt
- Wo steht GPT Image 2 gerade? Auf beiden Boards auf Platz drei, hinter OpenAIs eigenem Images 2.5-Duo. Bei arena.ai steht es bei 1383 Punkten und 88.744 Stimmen, bei Artificial Analysis bei 1172 und 15.346 Vergleichen.
- Warum ist der Artificial-Analysis-Score von 1340 auf 1172 gefallen? Die Rangliste ist auf die überarbeitete Methodik v2.0 mit anderer Skala umgestiegen. Vergleichbar sind die Abstände zwischen Modellen, nicht die reinen Punktzahlen über Versionen hinweg.
- Was bedeutete die Markierung „Preliminary“ bei arena.ai? Sie kennzeichnet ein Modell, das noch nicht genug Stimmen gesammelt hat. GPT Image 2 hat die Markierung im Laufe des Sommers verloren, sein Score hat sich dabei nur um 2 Punkte bewegt.
- Welches offene Modell steht bei Artificial Analysis am höchsten? Qwen-Image-2.1, Platz 18 mit 1034. Bei arena.ai hängt das Bild davon ab, wie eng man „offen“ definiert, vor Kundenprojekten würde ich jede Lizenz einzeln prüfen.
Momentaufnahme vom 30. September 2026, auf Basis des arena.ai-Updates vom 24. September 2026 und der live laufenden Artificial-Analysis-Rangliste.
Quellen
Über den Autor
Lena Wagner
Testerin bei Flami
Auch interessant
LMArena-Rangliste Bild-zu-Video: MiniMax H3 an der Spitze
Flux 2 Klein: BFLs kleine offene Bildmodelle, acht Monate nach dem Start
Grok Imagine Test: das Videomodell, das ich nutze, wenn ich mich noch nicht entschieden habe
Veo 3.1 vs Kling 3.0 vs Runway: Ich habe dieselben Produktvideos durch alle drei gejagt