GPT Image 2: So nutzt du es, und wo es wirklich überzeugt

GPT Image 2 versteht lange Prompts und hält Text im Bild scharf. So schreibst du dafür Prompts, und hier liest du, wo das Modell gewinnt und wo nicht.
GPT Image 2 unterscheidet sich von der Konkurrenz durch eine Eigenschaft: Das Modell liest komplizierte schriftliche Anweisungen besser als die meisten anderen. Nicht „ein schönes Produktfoto“, sondern ein ganzer Absatz mit Details, bei dem jede einzelne Angabe tatsächlich ankommt. Wer einen klaren Auftrag formulieren kann, holt aus diesem Modell deutlich mehr heraus.
Der Job: Text im Bild
Genau hier zeigt sich das besonders deutlich. Ein Label auf der Verpackung, eine Überschrift auf einem Banner, ein Preisschild, ein Slogan.
Das Modell hält lange Textpassagen spürbar besser als die meisten Konkurrenten, auch wenn es nicht perfekt ist. Bei langen Sätzen kann trotzdem mal ein Buchstabe verrutschen oder ein Wort verschwimmen. Kurze Wörter sitzen fast immer korrekt. Wir haben einen Vergleich der Textdarstellung über ein Dutzend Modelle gemacht, und das gleiche Muster bestätigt sich auch hier.
Ein Trick, der funktioniert: Setz den exakten Text in Anführungszeichen als eigenen Satzteil im Prompt, etwa so: das Label zeigt „Handcreme“. Das signalisiert dem Modell, dass es sich um wörtlichen Text handelt, nicht um eine Beschreibung.
Der Job: einer detaillierten Beschreibung zu folgen
Die zweite Stärke, und eigentlich der Hauptgrund, sich für dieses Modell zu entscheiden.
Braucht eine Szene fünf bestimmte Objekte in einer bestimmten Anordnung, schafft GPT Image 2 das deutlich öfter als die Konkurrenz. Andere Modelle fangen an, Details leise fallen zu lassen, sobald der Prompt länger wird.
Das heißt: Ein kurzer Einzeiler bringt bei diesem Modell wenig. Es lohnt sich erst bei langen, konkreten Prompts. Schreib in Absätzen, nicht in einem einzigen Satz.
Ich geb zu, dieser Rat widerspricht sich selbst ein bisschen. Ich sage den Leuten, sie sollen ganze Absätze schreiben, und wenn ich das genau so mache, lande ich regelmäßig bei einem überladenen Bild: Das Modell packt brav alles rein, was ich aufgezählt habe.
Der Job: Produktfotografie
Solide, aber kein Ausreißer nach oben. Textur und Licht wirken glaubwürdig, auch wenn Nano Banana und Seedream 5.0 bei feinen Oberflächendetails oft überzeugender sind.
Ist das Produkt simpel gehalten und zählt vor allem der Text auf der Verpackung, ist GPT Image die richtige Wahl. Verkauft sich die Aufnahme über die Textur, greif lieber zu einem der anderen beiden.
Der Job: Geschwindigkeit und Menge
Hier liegt die Schwachstelle. Das Modell denkt länger als schnelle Modelle und kostet pro Generierung mehr.
Für hundert grobe Entwürfe ist es nicht gedacht. Günstiger fährt man damit, Varianten auf Z-Image durchzuprobieren und erst den Gewinner hierher zur finalen Version zu bringen.
Wie du einen Prompt schreibst, der wirklich ankommt
Diese Reihenfolge funktioniert in der Praxis für mich am besten.
Fang mit dem Objekt an: was es ist, woraus es besteht, welche Farbe, welcher Zustand.
Dann die Szene: worauf es steht, was drumherum ist, was im Hintergrund zu sehen ist.
Dann das Licht: Richtung, Weichheit, Tageszeit.
Dann die Kamera: Nahaufnahme, Halbnah, Blickwinkel.
Dann der Text, in Anführungszeichen, falls das Bild welchen braucht.
Und zum Schluss, was nicht im Bild auftauchen soll.
Diese Reihenfolge ist keine Pflicht, das Modell kommt auch mit freier Formulierung klar. Aber sobald die Beschreibung länger wird, hilft Struktur dabei, nicht die Hälfte zu vergessen. Wie man einen Prompt aufbaut, haben wir ausführlicher in diesem Guide beschrieben.
Ich empfehle Absätze, und genau das Schreiben in Absätzen ist es, was bei mir immer wieder zu einem überladenen Bild führt, weil das Modell brav alles einbaut, was ich geschrieben habe. Zehn präzise Formulierungen schlagen dreißig vage.
Wo du mehr Details findest
Eine technische Einordnung mit Benchmark-Zahlen gibt es in unserem GPT Image 2 Review, und wo das Modell in den Ranglisten steht, zeigt dieser Beitrag. Das Modell selbst findest du auf der GPT Image 2 Seite, dort siehst du auch die aktuellen Kosten pro Generierung.
FAQ
Was kann GPT Image 2? Bilder aus einer detaillierten Textbeschreibung oder einem Referenzbild erzeugen, inklusive Text, der im Bild selbst erscheint. Die größten Stärken sind präzises Befolgen von Anweisungen bei langen Prompts und die Darstellung von Text im Bild.
Stellt GPT Image 2 Text korrekt dar? Lange Textpassagen gelingen besser als bei den meisten Konkurrenzmodellen, besonders bei kurzen Wörtern. Bei längeren Sätzen kann trotzdem mal etwas danebengehen, deshalb hilft es, den exakten Wortlaut in Anführungszeichen als eigenen Satzteil im Prompt zu setzen.
Worin unterscheidet sich GPT Image 2 von anderen Modellen? Es ist besser darin, komplexe Anweisungen zu verarbeiten. Bei einem langen Prompt voller Details setzt es mehr davon um als Modelle, die bei wachsender Prompt-Länge anfangen, Anforderungen zu überspringen.
Eignet es sich für Produktfotos auf Marktplätzen? Ja, vor allem wenn der Text auf der Verpackung wichtig ist oder die Szene exakt einer bestimmten Komposition entsprechen muss. Steht die Oberflächentextur im Vordergrund, lohnt sich ein Vergleich mit Nano Banana und Seedream.
Quellen
- Flami: GPT Image 2 Review
- Flami: GPT Image 2 in der Rangliste
- Flami: Prompt-Struktur für Bilder
Über den Autor
Lena Wagner
Testerin bei Flami