Ranking LMArena de imagens: 80 modelos, 6,5 milhões de votos

O ranking LMArena de imagens de IA em setembro de 2026: GPT Image 2.5 no topo, onde ficam os modelos de peso aberto e o que o Elo não mostra.
Minhas anotações sobre o ranking de texto para imagem no arena.ai, o site que antes se chamava LMArena. O original está em arena.ai/leaderboard/text-to-image. É uma tabela viva, com votos novos chegando todo dia, então se você está lendo isso daqui a um mês, confira os números atualizados lá.
Estávamos reorganizando o conjunto padrão de modelos que a Flami sugere para fotos de produto, e eu queria uma referência de fora. Não o nosso próprio gosto. Um monte de gente que eu nem conheço, olhando as imagens. Fui então atrás do ranking LMArena de imagens, que continua sendo o ranking de modelos de imagem mais citado por aí, mesmo com o endereço antigo, lmarena.ai, hoje só redirecionando para arena.ai. O funcionamento é simples. Alguém digita um prompt, recebe duas imagens de dois modelos sem identificação, escolhe a que gosta mais, e essas vitórias e derrotas vão se acumulando numa pontuação estilo Elo. A atualização de 24 de setembro de 2026 lista 80 modelos e 6.478.738 votos. Abaixo está o que anotei, com meus comentários.
A OpenAI ocupa agora as três primeiras posições
Lá em junho, o GPT Image 2 estava sozinho no topo, com uma vantagem de mais de cem pontos. Ele continua lá em cima. Só que foi empurrado para o terceiro lugar pelos próprios irmãos mais novos.
- 1º, gpt-image-2.5-sunburst (OpenAI), 1424, marcado como preliminar;
- 2º, gpt-image-2.5-flare (OpenAI), 1401, também preliminar;
- 3º, gpt-image-2 em qualidade média (OpenAI), 1383;
- 4º, mai-image-2.6 (Microsoft AI), 1335;
- 5º, reve-2.1 (Reve), 1302.
A OpenAI lançou o Images 2.5 em 8 de setembro (anúncio da OpenAI), e os desenvolvedores ganharam duas versões de API. A Flare é a padrão, enquanto a Sunburst é mais lenta e voltada para trabalho detalhado, onde você precisa de controle fino na edição (o 9to5Mac tem um resumo bom). Eu não bateria o martelo ainda. As duas têm só uns 10.000 votos cada uma e um intervalo de confiança de mais ou menos 8 pontos, então a ordem entre elas ainda pode mudar. Já o GPT Image 2 é outra história: são 88.744 votos e um intervalo de 4 pontos, então o 1383 dele está praticamente definido para os padrões desse ranking.
O que mais chama atenção é a distância entre a OpenAI e todo o resto. Do Sunburst até o MAI-Image-2.6 da Microsoft são 89 pontos. A melhor entrada do Google, o Nano Banana 2 no modo de busca na web, fica em nono lugar com 1261. Já mostrei como o GPT Image 2 construiu essa vantagem em duas arenas diferentes naquele texto. Para saber como ele se sai no dia a dia, tem a análise do GPT Image 2.
O meio da tabela, onde moram os modelos do dia a dia
Zero pontos. Essa é a distância entre seedream-5.0-pro e qwen-image-3.0-pro, empatados em 1256, na 10ª e na 11ª posição. Depois do top dez, os vizinhos costumam ficar a poucos pontos de distância, e ali os intervalos de confiança vão de 3 a 6 pontos, então na prática essas linhas são intercambiáveis. O que decide, na maioria das vezes, é o preço, e se o modelo sequer entende o que é o seu produto.
Algumas linhas que me interessam. Com 1170 e 262.132 votos, o grok-imagine-image está em 23º. Em junho, era o que tinha mais votos no ranking inteiro. Hoje o recorde é do Nano Banana original, com 878.451, o que provavelmente só quer dizer que ele está ali há mais tempo. Já o qwen-image-2.0-pro está em 19º, com 1192.
O Seedream é o caso interessante aqui. A família se dividiu em duas. O novo seedream-5.0-pro saltou para o 10º lugar, enquanto o seedream-4.5 ficou lá embaixo, no 35º (1147), e o seedream-5.0-lite no 38º (1138). Versão mais leve sempre apanha nos testes às cegas, acho que porque quem vota vê um quadro só e nunca vê o preço. A linha completa, lado a lado, está na análise do Seedream 5 se você quiser os detalhes; o modelo em si está na página do Seedream 5.
Onde ficam de verdade os modelos de peso aberto?
Depende sinceramente do que você considera aberto. Se você só contar licenças permissivas como Apache 2.0 ou MIT, o melhor é o qwen-image-2512, em 42º lugar, com 1125. Logo atrás vem o hidream-o1-image, sob MIT, em 46º com 1116. Depois tem uma sequência longa de modelos fechados antes do z-image-turbo, também Apache 2.0, em 57º com 1084.
Se você afrouxar a definição para "pesos que dá para baixar", a situação melhora bastante. O qwen-image-2.1 está em 17º com 1228, embora ainda seja preliminar, com apenas 4.445 votos e licença de pesquisa. Em modo qualidade, o Ideogram 4.0 está em 18º com 1205. A Ideogram publicou os pesos em 3 de junho de 2026 (post de lançamento deles), e é o modelo aberto mais votado nessa faixa alta do ranking. Da Nvidia, o Cosmos3 está em 25º. Cada um tem sua própria licença, e eu leria duas vezes antes de usar qualquer um deles em trabalho para cliente.
Em 53º, com 1103, está o wan2.7-image-pro. Está listado como proprietário, não aberto, mas cito ele aqui porque a gente mantém esse modelo para fotos de produto. Dá uma olhada na página do Wan 2.7 Image ou na análise do Wan 2.7 Image se quiser testar.
Ficar tão baixo no ranking parece ruim para o Z-Image Turbo. Acontece que a arena mede só o quanto um quadro fica bonito, e ignora quanto custam milhares desses quadros. Por que o Turbo continua sendo o nosso motor principal de rascunho apesar dessa posição é uma história mais longa, e falei sobre isso no texto sobre o Z-Image; dá pra testar direto na página do Z-Image.
O que o ranking não conta pra quem vende online
Quem vota na arena está só escolhendo a imagem mais bonita. Ninguém ali está perguntando se aquilo vai realmente vender o seu produto. Ninguém confere se a letrinha miúda na embalagem continua legível, ou se o produto na foto bate com a sua referência, e entregar 300 SKUs dentro do orçamento também não entra nessa votação. Nada disso está na cédula. Eu uso a posição geral como um primeiro filtro e nada além disso, depois rodo o produto de verdade nos dois ou três modelos que parecem bons no papel. Talvez eu esteja sendo cauteloso demais aqui, mas todo modelo dessa tabela ainda passa pelos nossos próprios testes de produto antes de chegar ao usuário.
Se você quiser um teste que realmente signifique algo pro seu catálogo, esqueça o ranking agregado e rode seus próprios produtos nos dois ou três modelos que parecem bons no papel, lado a lado. Isso não vira estatística, mas pelo menos você está julgando o seu catálogo, não o de um estranho.
Tudo desse retrato que passou nesses testes está na Flami, e contas novas ganham créditos iniciais grátis para testar.
Respostas rápidas
Qual modelo de IA de imagem está em primeiro no arena.ai agora?
Na atualização de 24 de setembro de 2026, é o gpt-image-2.5-sunburst da OpenAI, com 1424. Ainda está marcado como preliminar. Em segundo vem o Flare, com 1401, e o GPT Image 2 fica em terceiro, com 1383.
Qual a diferença entre o arena.ai e o Artificial Analysis?
A ideia básica é a mesma: votos cegos em duplas, virando pontuação Elo. Só que os votantes são diferentes, e os prompts também. As posições não batem, e as pontuações ficam em escalas diferentes. Eu confiro os dois, o arena.ai e o ranking do Artificial Analysis. Para constar, o Sunburst também está no topo por lá.
Existem modelos de peso aberto perto do topo?
Existem, se você aceitar licenças personalizadas. O qwen-image-2.1 está em 17º e o Ideogram 4.0 em 18º, cada um com sua própria licença. Já o melhor modelo Apache 2.0, o qwen-image-2512, está em 42º.
O que aconteceu com o LMArena?
Ele mudou de lmarena.ai para arena.ai, e os links antigos redirecionam para o mesmo ranking de texto para imagem. O histórico de votos parece ter vindo junto, já que modelos mais antigos, como o Nano Banana original, ainda mostram centenas de milhares de votos.
Como a pontuação é calculada?
Quem vota vê duas imagens do mesmo prompt, sem indicação de qual modelo fez qual. As notas são recalculadas no estilo do xadrez, a partir de vitórias e derrotas. Conforme os votos se acumulam, o intervalo de confiança encolhe. Hoje, o líder está em mais ou menos 8 pontos, com uns 11.000 votos. Já o GPT Image 2 tem oito vezes mais votos e está em mais ou menos 4.
Atualizado em 30 de setembro de 2026, com base na atualização do ranking de 24 de setembro de 2026.
Fontes
Sobre o autor
Camila Souza
Redatora de análises na Flami
Leia também
Flux 2 Klein: os modelos de imagem pequenos e abertos da BFL, oito meses depois do lançamento
GPT Image 2 no ranking das arenas: venceu as duas, aí a OpenAI passou na frente
Ranking LMArena de imagem para vídeo: MiniMax H3 assume a liderança
Análise do Wan 2.7: o modelo de vídeo da Alibaba pra rótulo legível e produto que parece de verdade