LMArena-Rangliste für Text-zu-Bild: 80 Modelle, 6,5 Millionen Stimmen

Die LMArena-Rangliste für Text-zu-Bild im September 2026: GPT Image 2.5 vorn, wo offene Modelle liegen und was der Elo-Wert nicht zeigt.
Meine Notizen zur Text-zu-Bild-Rangliste bei arena.ai, der Seite, die früher LMArena hieß. Das Original liegt unter arena.ai/leaderboard/text-to-image. Es ist eine Live-Tabelle, jeden Tag kommen neue Stimmen dazu, wer das hier erst in einem Monat liest, sollte die aktuellen Zahlen also selbst dort nachschauen.
Wir haben bei Flami gerade die Standardauswahl der Modelle für Produktbilder neu sortiert, und ich wollte einen Blick von außen. Nicht unseren eigenen Geschmack. Einen großen Haufen fremder Augen. Also bin ich zur LMArena-Rangliste für Text-zu-Bild bei arena.ai gegangen, immer noch die meistzitierte Rangliste für Bildmodelle, auch wenn die alte Adresse lmarena.ai inzwischen nur noch auf arena.ai weiterleitet. Wie es funktioniert, ist simpel. Jemand tippt einen Prompt, bekommt zwei Bilder von zwei anonymen Modellen, wählt das bessere, und aus all diesen Siegen und Niederlagen wird ein Elo-artiger Wert. Das Update vom 24. September 2026 listet 80 Modelle und 6.478.738 Stimmen. Hier ist, was ich mir notiert habe, dazu meine eigenen Kommentare.
OpenAI hält jetzt die ersten drei Plätze
Im Juni lag GPT Image 2 mit über hundert Punkten Vorsprung noch ganz allein an der Spitze. Dort steht es immer noch, nur eben auf Platz drei, verdrängt von den eigenen jüngeren Geschwistern.
- 1. gpt-image-2.5-sunburst (OpenAI), 1.424, vorläufig markiert;
- 2. gpt-image-2.5-flare (OpenAI), 1.401, ebenfalls vorläufig;
- 3. gpt-image-2 in mittlerer Qualität (OpenAI), 1.383;
- 4. mai-image-2.6 (Microsoft AI), 1.335;
- 5. reve-2.1 (Reve), 1.302.
OpenAI hat Images 2.5 am 8. September veröffentlicht (Ankündigung von OpenAI), mit zwei API-Versionen für Entwickler. Flare ist die Standardversion. Sunburst arbeitet langsamer, dafür mit mehr Kontrolle für Detailarbeit, wo präzise Bearbeitung zählt (9to5Mac hat das gut zusammengefasst). Ich würde noch keinem der beiden den Sieg zusprechen. Beide haben erst etwa 10.000 Stimmen und ein Konfidenzintervall von plus/minus 8 Punkten, die Reihenfolge zwischen ihnen kann also noch kippen. Bei GPT Image 2 sieht das anders aus: 88.744 Stimmen, ein Intervall von 4 Punkten, sein Wert von 1383 ist damit so gefestigt, wie Zahlen auf dieser Rangliste überhaupt werden.
Was wirklich auffällt, ist der Abstand zwischen OpenAI und dem Rest. Von Sunburst bis zu Microsofts MAI-Image-2.6 sind es 89 Punkte. Googles bester Eintrag, Nano Banana 2 im Websuche-Modus, liegt auf Platz neun bei 1.261. Wie GPT Image 2 diesen Vorsprung über zwei verschiedene Arenen aufgebaut hat, habe ich in diesem Beitrag aufgeschlüsselt. Wie es sich bei echten Aufträgen tatsächlich schlägt, steht in der GPT Image 2 Test.
Die Tabellenmitte, wo die Arbeitsmodelle leben
Null Punkte. So groß ist der Abstand zwischen seedream-5.0-pro und qwen-image-3.0-pro, gleichauf auf Platz 10 und 11 mit je 1256. Hinter den Top Ten liegen die Nachbarn meist nur wenige Punkte auseinander, und die Konfidenzintervalle bewegen sich dort zwischen 3 und 6 Punkten, in der Praxis sind diese Zeilen also austauschbar. Entschieden wird es meist über den Preis, und darüber, ob das Modell überhaupt versteht, was dein Produkt eigentlich ist.
Ein paar Zeilen, die mich interessieren. grok-imagine-image liegt auf Platz 23 mit 1170 und 262.132 Stimmen. Im Juni hatte es noch mehr Stimmen als jedes andere Modell auf der Liste. Den Rekord hält inzwischen das ursprüngliche Nano Banana mit 878.451, was wahrscheinlich nur bedeutet, dass es am längsten dabei ist. qwen-image-2.0-pro steht auf Platz 19 bei 1192.
Spannend ist Seedream. Die Familie hat sich aufgespalten. Das neue seedream-5.0-pro ist auf Platz 10 gesprungen, während seedream-4.5 auf Platz 35 (1147) und seedream-5.0-lite auf Platz 38 (1138) liegt. Leichtere Versionen bekommen im Blindtest immer eins drauf, vermutlich weil die Wähler nur ein Bild sehen und nie den Preis. Die ganze Reihe nebeneinander steht in der Seedream 5 Review, falls dich die Details interessieren, das Modell selbst liegt auf der Seedream 5 Seite.
Wo stehen offene Modelle eigentlich?
Kommt ganz darauf an, was für dich als offen zählt. Zählst du nur permissive Lizenzen wie Apache 2.0 oder MIT, liegt qwen-image-2512 mit 1125 auf Platz 42 vorn. Direkt dahinter folgt hidream-o1-image unter MIT, Platz 46 bei 1116. Dann kommt eine lange Strecke geschlossener Modelle, bevor z-image-turbo, ebenfalls Apache 2.0, auf Platz 57 mit 1084 auftaucht.
Lockerst du die Definition auf Gewichte, die man herunterladen kann, sieht es deutlich besser aus. qwen-image-2.1 liegt auf Platz 17 bei 1228, allerdings vorläufig mit nur 4.445 Stimmen und unter einer Forschungslizenz. Ideogram 4.0 im Qualitätsmodus folgt auf Platz 18 mit 1205. Ideogram hat seine Gewichte am 3. Juni 2026 veröffentlicht (Ankündigung zum Start), und es ist das meistgewählte offene Modell so weit oben. Nvidias Cosmos3 liegt auf Platz 25. Jedes davon hat seine eigene Lizenz, und ich würde sie zweimal lesen, bevor ich eines für einen Kundenauftrag einsetze.
wan2.7-image-pro liegt auf Platz 53 bei 1103. Gelistet ist es als proprietär, nicht offen, ich erwähne es trotzdem, weil wir es für Produktfotos im Einsatz haben, siehe die Wan 2.7 Image Seite oder die Wan 2.7 Image Review, falls du es ausprobieren willst.
Platz siebenundfünfzig klingt nach wenig für Z-Image Turbo. Nur misst die Arena eben, wie gut ein einzelnes Bild aussieht, und ignoriert, was tausend davon kosten. Warum Turbo bei uns trotzdem die Haupt-Engine für Entwürfe bleibt, ist eine längere Geschichte, die ich im Beitrag zu Z-Image aufgeschrieben habe, ausprobieren lässt es sich auch direkt auf der Z-Image-Seite.
Was die Rangliste nicht verrät, wenn du online verkaufst
Wer in der Arena abstimmt, wählt einfach das hübschere Bild. Niemand dort fragt, ob es dein Produkt tatsächlich verkauft. Niemand prüft, ob das Kleingedruckte auf deiner Verpackung noch lesbar bleibt, oder ob das Produkt im Bild wirklich zu deinem Referenzfoto passt, und ob 300 SKUs im Budget bleiben, fragt in der Abstimmung auch niemand. Nichts davon steht zur Abstimmung. Ich nutze den Gesamtrang nur als ersten Filter, nicht mehr, und schicke das eigentliche Produkt dann durch die zwei oder drei Modelle, die auf dem Papier gut aussehen. Vielleicht bin ich hier zu vorsichtig, aber jedes Modell aus dieser Tabelle läuft bei uns erst durch eigene Produkttests, bevor wir es den Nutzern geben.
Willst du einen Test, der für deinen Katalog wirklich etwas aussagt, überspring den Gesamtrang und schick deine eigenen Produkte einfach durch die zwei, drei Modelle, die auf dem Papier gut wirken, direkt im Vergleich. Statistisch hält das nicht stand, aber wenigstens beurteilst du deinen eigenen Katalog und nicht den von irgendjemand Fremdem.
Alles aus dieser Momentaufnahme, was diese Tests bestanden hat, steht bei Flami, und neue Konten bekommen kostenloses Start-Guthaben zum Ausprobieren.
Kurz beantwortet
Welches KI-Bildmodell steht bei arena.ai gerade auf Platz eins?
Mit dem Update vom 24. September 2026 ist es gpt-image-2.5-sunburst von OpenAI mit 1424, noch als vorläufig markiert. Flare folgt auf Platz zwei mit 1401, GPT Image 2 auf Platz drei mit 1383.
Wie unterscheidet sich arena.ai von Artificial Analysis?
Im Kern dieselbe Idee: blinde Paarvergleiche, die zu einem Elo-Wert verrechnet werden. Die Wähler unterscheiden sich trotzdem, ebenso die Prompts. Die Platzierungen stimmen nicht überein, und die Skalen sind unterschiedlich. Ich schaue mir beide an, arena.ai und die Artificial-Analysis-Rangliste. Nebenbei: Auch bei Artificial Analysis liegt Sunburst vorn.
Gibt es offene Modelle nahe an der Spitze?
Ja, wenn du eigene Lizenzbedingungen akzeptierst. qwen-image-2.1 liegt auf Platz 17, Ideogram 4.0 auf Platz 18, beide mit eigenen Lizenzen. Das beste Modell unter Apache 2.0, qwen-image-2512, liegt auf Platz 42.
Was ist aus LMArena geworden?
Es ist von lmarena.ai zu arena.ai umgezogen, alte Links leiten auf dieselbe Text-zu-Bild-Rangliste um. Die Stimmenhistorie scheint mitgewandert zu sein, denn ältere Modelle wie das ursprüngliche Nano Banana zeigen weiterhin Hunderttausende Stimmen.
Wie wird der Wert berechnet?
Ein Wähler sieht zwei Bilder zum selben Prompt, ohne Hinweis, welches Modell welches erzeugt hat. Die Werte werden nach Schachprinzip aus Siegen und Niederlagen neu berechnet. Mit mehr Stimmen schrumpft das Konfidenzintervall. Der aktuelle Spitzenreiter liegt bei plus/minus 8 Punkten auf rund 11.000 Stimmen. GPT Image 2 hat achtmal so viele Stimmen und liegt bei plus/minus 4.
Aktualisiert am 30. September 2026, auf Basis des Rangliste-Updates vom 24. September 2026.
Quellen
Über den Autor
Lena Wagner
Testerin bei Flami
Auch interessant
GPT Image 2 Rangliste im Check: zwei Arenen gewonnen, dann von OpenAI selbst überholt
LMArena-Rangliste Bild-zu-Video: MiniMax H3 an der Spitze
Flux 2 Klein: BFLs kleine offene Bildmodelle, acht Monate nach dem Start
Grok Imagine Test: das Videomodell, das ich nutze, wenn ich mich noch nicht entschieden habe