Ranking de GPT Image 2: ganó dos arenas y después lo superó la propia OpenAI

GPT Image 2 en Artificial Analysis y arena.ai: qué tan grande era su ventaja, dónde queda en septiembre de 2026 y qué dicen las brechas de Elo.
Esta es mi lectura de dos rankings independientes de texto a imagen, Artificial Analysis y arena.ai. Los dos recalculan después de cada tanda de votos, así que toma los números que siguen como una foto de septiembre de 2026 y revisa los originales si quieres la cifra de hoy.
88.744 votos. Eso es lo que GPT Image 2 lleva acumulado en el ranking de arena.ai, y su puntaje casi no se movió desde que tenía la mitad de esos votos. GPT Image 2 quedó tercero en las dos arenas grandes. Suena a bajón, y en parte lo es, pero los dos modelos que tiene por delante son de la propia OpenAI. Hago dirección de arte en Flami, así que decidir qué modelo genera la imagen principal es, literalmente, decisión mía, y vengo siguiendo a este desde abril. Lo que me llamó la atención en ese momento fue poco común: dos arenas que no tienen nada que ver entre sí coincidiendo en el mismo ganador. Lo que me interesa ahora es cómo se achicó esa ventaja.
Por qué reviso dos arenas
Una sola arena se puede equivocar. Importa quién vota, e importa también el conjunto de prompts que se usan. El emparejamiento de modelos también distorsiona el resultado, más de lo que la gente cree. Cualquiera de esos factores puede mover el ranking. Si dos tableros con métodos distintos ponen al mismo modelo arriba, eso sí me convence, mucho más que cualquiera de los dos por separado.
Las dos funcionan con votación ciega por pares. Si quieres el mecanismo completo, ya lo expliqué en mis notas sobre el ranking de imágenes de arena.ai. Y la escala es seria. arena.ai ya tiene 80 modelos y casi 6,5 millones de votos en su categoría de texto a imagen, según la actualización del 24 de septiembre de 2026. Con esos números, no hay margen para la suerte.
Artificial Analysis: de una ventaja de 74 puntos a 17
El panorama en Artificial Analysis, en junio, estaba muy desparejo. GPT Image 2 (en calidad alta) le sacaba 74 puntos Elo al segundo lugar, una diferencia mayor que toda la distancia entre el segundo puesto y el quinto.
Hoy se lee distinto. Así está la punta de la tabla:
- 1.º, GPT Image 2.5 Sunburst (max), 1197;
- 2.º, GPT Image 2.5 Flare (max), 1190;
- 3.º, GPT Image 2 (alta calidad), 1172 sobre 15.346 comparaciones;
- 4.º, Grok Imagine Image 2.0, de xAI, 1155;
- 5.º, MAI-Image-2.6, de Microsoft AI, 1150.
Una advertencia antes de que alguien compare esto con capturas viejas. La tabla ahora corre con una metodología revisada, la v2.0, y las puntuaciones están en otra escala. El 1340 que GPT Image 2 tenía en junio y el 1172 que tiene ahora no se miden con la misma vara, así que no lo leas como una caída de 170 puntos. Lo que sí se puede comparar es la brecha. Contra el mejor modelo que no es de OpenAI, quedó en 17 puntos, con un intervalo de confianza del 95% de más o menos 9 para cada lado. Son 52 victorias de cada 100 en la práctica, nada que ver con la ventaja arrolladora que mostraban los números de junio.
Más abajo, Nano Banana 2 es sexto con 1125 y GPT Image 1.5 (alta calidad) es octavo con 1107. Entre los modelos de pesos abiertos, el mejor ubicado es Qwen-Image-2.1, 18.º con 1034. Ese lugar, en junio, lo tenía Cosmos3-Super, dicho sea de paso.
arena.ai: se le cayó la etiqueta de preliminar, pero el puntaje aguantó
Esta es la parte que más me tranquiliza. Gpt-image-2 en calidad media estaba en 1385 con 45.100 votos en junio, con la etiqueta de preliminar, que significa que la puntuación todavía podía moverse a medida que entraran más votos. Calculé que probablemente perdería unos 30 puntos en ese momento. No pasó. La actualización del 24 de septiembre lo deja en 1383 más o menos 4, con 88.744 votos, y ya sin la etiqueta.
Aun así, perdió el primer lugar. El 8 de septiembre OpenAI lanzó Images 2.5 para ChatGPT (acá está el anuncio del lanzamiento). Sus dos versiones de API entraron directo por encima de su hermano mayor. gpt-image-2.5-sunburst tiene 1424 y gpt-image-2.5-flare 1401, las dos todavía preliminares, con unos 10.000 votos cada una.
Lo interesante está en la brecha con todo lo que queda fuera de OpenAI. El segundo lugar en junio era reve-2.0, con 1273, a más de cien puntos, y no recordaba una ventaja así de grande en una arena de imágenes. Ahora el rival más cercano es mai-image-2.6, de Microsoft, con 1335. Son 48 puntos de distancia, mientras que reve-2.0 bajó al octavo puesto. OpenAI sigue arriba, aunque por un margen que Microsoft podría cerrar con un solo lanzamiento bien hecho.
¿Qué significa en la práctica una brecha de Elo?
El Elo viene del ajedrez, y la cuenta detrás es más amigable de lo que parece. Una brecha de 100 puntos significa que el modelo mejor puntuado debería ganar unas 64 de cada 100 votaciones cara a cara. Con 48 puntos, que es lo que hoy le saca GPT Image 2 a Microsoft en arena.ai, la cosa baja a 57 de cada 100. Con 17 puntos, su ventaja en Artificial Analysis, queda en apenas 52.
Así que sí, GPT Image 2 le sigue ganando a casi todos. Lo que cambió es el margen, más ajustado que unos meses atrás, y en varios pares de imágenes a quien vota le costaría distinguir a los primeros puestos entre sí.
Y los modelos que están más abajo
Vale la pena mirar también la mitad de abajo de la tabla. Seedream 5.0 Lite está 38.º con 1138 en arena.ai. Estaba 28.º en junio, y el puntaje casi no cambió: lo que pasó es que se acumularon modelos nuevos por encima. Si quieres probarlo en fotos de producto, Seedream 5 está disponible en Flami, y toda la familia queda comparada en un artículo aparte.
Z-Image Turbo está 57.º con 1084, un bajón desde el puesto 46.º. El mismo punto ciego de siempre. La arena no le reconoce que corre en tu propio hardware. Ya expliqué por qué eso importa igual en el desglose de LMArena. Profundizamos en esa disyuntiva en nuestro análisis de Z-Image, y también puedes probarlo directo en Flami.
Un puesto bajo ahí solo dice que a menos desconocidos les gustó ese fotograma en particular, no que el modelo esté mal para lo que necesitas.
Lo que hago yo con todo esto
Para una sola imagen principal, donde lo único que importa es la calidad, mi primera opción sigue siendo el modelo de OpenAI. Se llevó las dos arenas en abril. La cobertura de TechCrunch sobre el lanzamiento destacó lo bien que renderiza texto, y esa es justo la parte que más pesa en fotos de empaque. No estoy seguro todavía de si vale la pena pasarse a 2.5 para el trabajo del día a día. Los puntajes preliminares dicen que sí, pero yo esperaría a que se asienten.
La forma más fácil de decidir por tu cuenta es subir una de tus fotos de producto a Flami y correr el mismo brief en dos o tres de estos modelos, uno al lado del otro.
Preguntas rápidas
- ¿En qué puesto está GPT Image 2 ahora mismo? Tercero en las dos tablas, detrás del propio par Images 2.5 de OpenAI. Tiene 1383 sobre 88.744 votos en arena.ai, y 1172 sobre 15.346 comparaciones en Artificial Analysis.
- ¿Por qué su puntaje en Artificial Analysis bajó de 1340 a 1172? La tabla cambió a una metodología revisada, la v2.0, con otra escala. Hay que comparar las brechas entre modelos, no los puntajes en bruto entre versiones distintas.
- ¿Qué significaba la etiqueta de preliminar en arena.ai? Marca a un modelo que todavía no juntó suficientes votos. GPT Image 2 perdió esa etiqueta durante estos meses, y su puntaje se movió apenas 2 puntos.
- ¿Qué modelo de pesos abiertos queda mejor ubicado en Artificial Analysis? Qwen-Image-2.1, 18.º con 1034. Depende de lo estricto que seas con la definición de abierto en arena.ai, y yo revisaría cada licencia antes de usarlo en trabajo para un cliente.
Foto del momento tomada el 30 de septiembre de 2026, a partir de la actualización de arena.ai del 24 de septiembre de 2026 y de la tabla en vivo de Artificial Analysis.
Fuentes
Sobre el autor
Lucía Fernández
Redactora de reseñas en Flami
Sigue leyendo
Ranking LMArena imagen a video: MiniMax H3 llega a la cima
Reseña de Wan 2.7: el modelo de video de Alibaba para etiquetas legibles y productos creíbles
Reseña de Grok Imagine: el modelo de video que abro cuando todavía no sé qué va a funcionar
Veo 3.1 vs Kling 3.0 vs Runway: probé los tres con los mismos videos de producto