Ranking de LMArena para texto a imagen: 80 modelos, 6,5 millones de votos

El ranking de LMArena para texto a imagen a septiembre de 2026: GPT Image 2.5 arriba, dónde quedan los modelos de pesos abiertos y qué no mide el Elo.
Estas son mis notas sobre el ranking de texto a imagen en arena.ai, el sitio que antes se llamaba LMArena. El original está en arena.ai/leaderboard/text-to-image. Es una tabla viva y le entran votos todos los días, así que si estás leyendo esto dentro de un mes, revisa ahí los números actuales.
Estábamos revisando el set de modelos que Flami recomienda por defecto para fotos de producto, y quería una referencia externa. No mi propio gusto. Un montón de ojos ajenos. Por eso fui al ranking de LMArena para texto a imagen, que sigue siendo la clasificación más citada de modelos de imagen, aunque la antigua dirección lmarena.ai ahora solo redirige a arena.ai. El mecanismo es simple. Alguien escribe un prompt, recibe dos imágenes de dos modelos sin nombre, elige la que más le gusta, y todas esas victorias y derrotas se acumulan en una puntuación al estilo Elo. La actualización del 24 de septiembre de 2026 lista 80 modelos y 6.478.738 votos. Abajo va lo que anoté, con mis propios comentarios.
OpenAI ahora ocupa los tres primeros puestos
Allá por junio, GPT Image 2 estaba solo en la cima, con una ventaja de más de cien puntos. Sigue arriba. Lo que pasó es que sus propios hermanos menores lo bajaron al tercer puesto.
- 1.º, gpt-image-2.5-sunburst (OpenAI), 1424, marcado como preliminar;
- 2.º, gpt-image-2.5-flare (OpenAI), 1401, también preliminar;
- 3.º, gpt-image-2 en calidad media (OpenAI), 1383;
- 4.º, mai-image-2.6 (Microsoft AI), 1335;
- 5.º, reve-2.1 (Reve), 1302.
OpenAI lanzó Images 2.5 el 8 de septiembre (el anuncio de OpenAI), y a los desarrolladores les llegaron dos versiones de API. Flare es la que viene por defecto, mientras que Sunburst es más lenta y apunta a trabajo detallado donde necesitas un control de edición más fino (9to5Mac lo explica bien). Yo esperaría antes de coronar a cualquiera de los dos. Ambos tienen solo unos 10.000 votos cada uno y un intervalo de confianza de más o menos 8 puntos, así que el orden entre ellos todavía puede moverse. GPT Image 2 es otra historia: con 88.744 votos y un intervalo de 4 puntos, su 1383 es de lo más asentado que hay en esta tabla.
Lo que de verdad llama la atención es la distancia entre OpenAI y el resto. De Sunburst hasta el MAI-Image-2.6 de Microsoft hay 89 puntos. La mejor entrada de Google, Nano Banana 2 en su modo de búsqueda web, está en el noveno puesto con 1261. Ya conté cómo GPT Image 2 construyó esta ventaja en dos arenas distintas en ese análisis. Para saber cómo se comporta en trabajos reales, está la reseña de GPT Image 2.
La mitad de la tabla, donde viven los modelos de trabajo
Cero puntos. Esa es la distancia entre seedream-5.0-pro y qwen-image-3.0-pro, empatados en 1256 en el 10.º y el 11.º puesto. Pasado el top diez, los vecinos suelen quedar a pocos puntos, y los intervalos de confianza ahí van de 3 a 6 puntos, así que en la práctica esas filas son intercambiables. Lo que de verdad decide es el precio, sobre todo, y si el modelo entiende siquiera qué es tu producto.
Hay un par de filas que me interesan. grok-imagine-image está en el puesto 23.º con 1170 y 262.132 votos. En junio tenía más votos que cualquier otro en la tabla. Ahora el récord es del Nano Banana original, con 878.451, lo que probablemente solo significa que lleva más tiempo ahí sentado. qwen-image-2.0-pro está 19.º con 1192.
Seedream es el caso interesante. La familia se dividió en dos. El nuevo seedream-5.0-pro saltó al 10.º puesto, mientras que seedream-4.5 se quedó en el 35.º (1147) y seedream-5.0-lite en el 38.º (1138). Las versiones más ligeras siempre salen golpeadas en pruebas a ciegas, creo que porque quien vota ve un solo fotograma y nunca ve el precio. Toda la línea, comparada de cerca, está en la reseña de Seedream 5 si quieres los detalles; el modelo en sí vive en la página de Seedream 5.
¿Dónde quedan realmente los modelos de pesos abiertos?
Depende de qué cuentes como abierto, la verdad. Si solo cuentas licencias permisivas como Apache 2.0 o MIT, el mejor es qwen-image-2512 en el puesto 42.º con 1125. Justo detrás está hidream-o1-image bajo MIT, 46.º con 1116. Después hay un tramo largo de modelos cerrados antes de llegar a z-image-turbo, también Apache 2.0, en el 57.º con 1084.
Si aflojas la definición a "pesos que puedes descargar", el panorama mejora bastante. qwen-image-2.1 está 17.º con 1228, aunque es preliminar, con apenas 4.445 votos y licencia de investigación. Ideogram 4.0 en modo calidad está 18.º con 1205. Ideogram publicó sus pesos el 3 de junio de 2026 (el post de su lanzamiento), y es el modelo abierto más votado en un puesto tan alto. Cosmos3 de Nvidia está 25.º. Cada uno tiene su propia licencia, y yo la leería dos veces antes de usar cualquiera de ellos para trabajo de cliente.
wan2.7-image-pro está 53.º con 1103. Figura como propietario, no como abierto, pero lo menciono porque lo seguimos usando para fotos de producto: mira la página de Wan 2.7 Image o la reseña de Wan 2.7 Image si quieres probarlo.
El puesto cincuenta y siete suena mal para Z-Image Turbo. La cuestión es que la arena mide qué tan bonito se ve un fotograma y no le importa cuánto te cuesta producir mil de esos fotogramas. Por qué Turbo sigue siendo nuestro motor de borrador principal a pesar de esa puntuación es una historia más larga, y la conté en el análisis de Z-Image; también puedes probarlo tú mismo en la página de Z-Image.
Lo que el ranking no te dice si vendes en línea
La gente que vota en la arena solo elige la imagen más bonita. Ahí nadie pregunta si eso te va a vender el producto. Nadie revisa si la letra pequeña del empaque sigue siendo legible, ni si el producto del cuadro coincide de verdad con tu foto de referencia, y terminar 300 SKU dentro de presupuesto tampoco entra en esa votación. Nada de eso cuenta en esa votación. Yo uso el puesto general como un primer filtro y nada más, y después paso el producto real por los dos o tres modelos que se ven decentes en el papel. Puede que sea demasiado cauteloso en esto, pero cada modelo de esta tabla igual pasa por nuestras propias pruebas de producto antes de que se lo demos a los usuarios.
Si quieres una prueba que de verdad signifique algo para tu catálogo, sáltate el ranking agregado y pasa tus propios productos por los dos o tres modelos que se ven bien en el papel, uno al lado del otro. Eso no va a servir como estadística, pero al menos estás juzgando tu propio catálogo y no el de un desconocido.
Todo lo de esta foto del momento que pasó esas pruebas está en Flami, y las cuentas nuevas reciben créditos gratis para probarlos.
Respuestas rápidas
¿Qué modelo de imagen con IA es el número uno en arena.ai ahora mismo?
Según la actualización del 24 de septiembre de 2026, es gpt-image-2.5-sunburst de OpenAI con 1424. Sigue marcado como preliminar. Flare va segundo con 1401, y GPT Image 2 va tercero con 1383.
¿En qué se diferencia arena.ai de Artificial Analysis?
La idea de base es la misma: votos ciegos por pares que se convierten en Elo. Lo que cambia es quién vota y qué prompts se usan. Los puestos no coinciden, y las puntuaciones están en escalas distintas. Yo reviso tanto arena.ai como el ranking de Artificial Analysis. Para lo que vale, Sunburst también está arriba en Artificial Analysis.
¿Hay modelos de pesos abiertos cerca de la cima?
Sí, si aceptas licencias propias. qwen-image-2.1 está 17.º e Ideogram 4.0 está 18.º, ambos con su propia licencia. El mejor con Apache 2.0, qwen-image-2512, está 42.º.
¿Qué pasó con LMArena?
Se mudó de lmarena.ai a arena.ai, y los enlaces viejos redirigen al mismo ranking de texto a imagen. Parece que el historial de votos también se trasladó, porque modelos más viejos como el Nano Banana original siguen mostrando cientos de miles de votos.
¿Cómo se calcula la puntuación?
Quien vota ve dos imágenes para el mismo prompt, sin etiquetas que digan qué modelo hizo cuál. Las puntuaciones se recalculan al estilo del ajedrez, a partir de victorias y derrotas. A medida que se acumulan votos, el intervalo de confianza se achica. El líder actual está en más o menos 8 puntos sobre unos 11.000 votos. GPT Image 2 tiene ocho veces más votos y está en más o menos 4.
Revisado el 30 de septiembre de 2026, con base en la actualización del ranking del 24 de septiembre de 2026.
Fuentes
Sobre el autor
Lucía Fernández
Redactora de reseñas en Flami
Sigue leyendo
Flux 2 Klein: los modelos pequeños y abiertos de BFL, ocho meses después del lanzamiento
Ranking de GPT Image 2: ganó dos arenas y después lo superó la propia OpenAI
Ranking LMArena imagen a video: MiniMax H3 llega a la cima
Reseña de Wan 2.7: el modelo de video de Alibaba para etiquetas legibles y productos creíbles