GPT Image 2 no ranking das arenas: venceu as duas, aí a OpenAI passou na frente

Ranking do GPT Image 2 na Artificial Analysis e no arena.ai: qual era a vantagem, a posição atual e o que as diferenças de Elo significam na prática.
Esta é a minha leitura de dois rankings independentes de texto para imagem, o Artificial Analysis e o arena.ai. Os dois recalculam a pontuação a cada leva de votos, então trate os números abaixo como um retrato de setembro de 2026 e confira os originais para os valores de hoje.
88.744 votos. É quanto o GPT Image 2 já acumulou no ranking do arena.ai, e a pontuação dele quase não se mexeu desde quando tinha metade disso. Somando as duas grandes arenas, o GPT Image 2 está em terceiro lugar. Terceiro parece rebaixamento, e de certa forma é, só que os dois modelos acima dele são da própria OpenAI. Eu cuido da direção de arte aqui na Flami, então escolher qual modelo gera a imagem de capa é literalmente trabalho meu, e venho acompanhando esse aqui desde abril. O que me chamou atenção lá atrás foi raro: duas arenas que não têm nada a ver uma com a outra concordando no mesmo vencedor. Agora, o que chama atenção é como essa vantagem encolheu.
Por que eu confio em duas arenas
Uma arena sozinha pode errar. Quem aparece para votar importa, e o conjunto de prompts também. Já o pareamento de modelos distorce o resultado mais do que as pessoas imaginam. Qualquer um desses fatores mexe no ranking. Quando dois quadros com métodos diferentes colocam o mesmo modelo no topo, eu levo isso muito mais a sério do que um ranking isolado.
Os dois usam votação cega e pareada. Se quiser entender a mecânica, eu detalhei isso nas minhas anotações sobre o ranking de imagem do arena.ai. E a escala é séria. O arena.ai já tem 80 modelos e quase 6,5 milhões de votos na categoria de texto para imagem, conforme a atualização de 24 de setembro de 2026. Sorte não sobrevive a números assim.
Artificial Analysis: de uma vantagem de 74 pontos para 17
Em junho, o retrato no Artificial Analysis era bem desequilibrado. O GPT Image 2 (high) liderava com 74 pontos de Elo à frente do vice-líder, mais do que toda a distância entre o segundo e o quinto lugar.
Hoje o quadro é outro. Veja como ficou o topo do ranking:
- 1º, GPT Image 2.5 Sunburst (max), 1.197;
- 2º, GPT Image 2.5 Flare (max), 1.190;
- 3º, GPT Image 2 (high), 1.172, com 15.346 comparações;
- 4º, Grok Imagine Image 2.0, da xAI, 1.155;
- 5º, MAI-Image-2.6, da Microsoft AI, 1.150.
Uma ressalva antes de comparar isso com prints antigos. O ranking agora roda numa metodologia revisada, chamada v2.0, e a pontuação está numa escala diferente. Os 1.340 que o GPT Image 2 tinha em junho e os 1.172 de agora não são medidos pela mesma régua, então não leia isso como um desmoronamento de 170 pontos. Dá para comparar, sim, a diferença. Contra o melhor modelo fora da OpenAI, ela caiu para 17 pontos, com um intervalo de confiança de 95% de mais ou menos 9 para cada lado. Na prática isso é 52 vitórias em cada 100, bem longe da disparada que os números de junho mostravam.
Mais abaixo, o Nano Banana 2 está em sexto com 1.125 e o GPT Image 1.5 (high) em oitavo com 1.107. Entre os modelos de peso aberto, o Qwen-Image-2.1 é o melhor colocado, 18º com 1.034. Em junho esse posto era do Cosmos3-Super, se é que isso ainda importa.
arena.ai: o selo "preliminar" saiu, a pontuação segurou
Essa parte eu acho reconfortante. Em junho, o gpt-image-2 (medium) estava em 1.385 com 45.100 votos e o selo Preliminary, que significa que a nota ainda podia deslizar conforme mais votos entrassem. Na época, chutei que ele perderia uns 30 pontos. Não perdeu. Na atualização de 24 de setembro está em 1.383, mais ou menos 4, com 88.744 votos, e sem o selo.
Mesmo assim perdeu a liderança. No dia 8 de setembro a OpenAI lançou o Images 2.5 para o ChatGPT (aqui está o anúncio). As duas versões de API entraram direto acima da versão anterior. O gpt-image-2.5-sunburst tem 1.424 e o gpt-image-2.5-flare, 1.401, os dois ainda preliminares, com uns 10.000 votos cada.
Onde fica interessante é na distância para quem está fora da OpenAI. Lá em junho o vice-líder era o reve-2.0, com 1.273, mais de cem pontos atrás, e sinceramente eu não lembrava de uma vantagem desse tamanho numa arena de imagem. Agora o desafiante mais próximo é o mai-image-2.6, da Microsoft, com 1.335. São 48 pontos de distância, enquanto o reve-2.0 escorregou para o oitavo lugar. A OpenAI ainda está na frente, só que por uma margem que a Microsoft fecharia com um único lançamento bem-feito.
O que uma diferença de Elo realmente significa?
O Elo vem do xadrez, e a conta por trás dele é mais amigável do que parece. Uma diferença de 100 pontos quer dizer que o modelo melhor avaliado deve vencer cerca de 64 de cada 100 votos diretos. Com 48 pontos, que é a margem atual do GPT Image 2 sobre a Microsoft no arena.ai, fica mais perto de 57 em 100. Com 17 pontos, sua vantagem na Artificial Analysis, cai para uns 52.
Então sim, o GPT Image 2 ainda vence quase todo mundo. Só que vence com uma margem mais apertada do que em abril, e quem vota teria dificuldade de distinguir os primeiros colocados em boa parte dos pares.
E os modelos mais para baixo na tabela
Vale espiar também a metade de baixo da tabela. No arena.ai o Seedream 5.0 Lite está em 38º com 1.138. Em junho era 28º, e a pontuação quase não mudou, só que modelos mais novos se empilharam acima dele. Se você quiser testar em fotos de produto, o Seedream 5 está disponível na Flami, e a família inteira é comparada num outro texto aqui do blog.
O Z-Image Turbo está em 57º com 1.084, caindo do 46º. É o mesmo ponto cego de sempre: a arena não dá crédito por ele rodar na sua própria máquina. Eu falo sobre por que isso ainda importa na análise do LMArena. A gente entrou nessa troca de vantagens na nossa análise do Z-Image, e dá para testar direto na Flami.
Uma posição baixa ali só quer dizer que menos desconhecidos gostaram daquele quadro específico, não que o modelo é errado para o seu uso.
O que eu faço com essa informação
Para uma imagem de capa única, em que só a qualidade importa, minha primeira escolha ainda é o modelo da OpenAI. Ele venceu as duas arenas em abril. A cobertura de lançamento do TechCrunch destacou o quanto ele renderiza bem texto, e esse é exatamente o detalhe que mais pesa numa foto de embalagem. Ainda não tenho certeza se vale a pena migrar para o 2.5 no dia a dia. As pontuações preliminares dizem que sim, mas eu provavelmente esperaria elas se acomodarem.
Pra julgar por conta própria, o jeito mais fácil é subir uma foto do seu produto na Flami e rodar o mesmo briefing em dois ou três desses modelos lado a lado.
Perguntas rápidas
- Em que posição está o GPT Image 2 agora? Terceiro nos dois rankings, atrás da dupla Images 2.5 da própria OpenAI. No arena.ai ele marca 1.383 em 88.744 votos. Na Artificial Analysis, 1.172 em 15.346 comparações.
- Por que a pontuação dele na Artificial Analysis caiu de 1.340 para 1.172? Aqui, o ranking mudou para uma metodologia revisada, a v2.0, com escala diferente. Melhor comparar a diferença entre modelos, não a pontuação bruta entre versões.
- O que significava o selo Preliminary no arena.ai? Ele marca um modelo que ainda não juntou votos suficientes. Ao longo dos últimos meses o GPT Image 2 perdeu o selo, e a pontuação mudou só 2 pontos.
- Qual modelo de peso aberto está melhor colocado na Artificial Analysis? Ele é o Qwen-Image-2.1, 18º com 1.034. No arena.ai o retrato muda dependendo de quão rígido é o critério de "aberto" que você usa, e eu conferiria a licença de cada um antes de um trabalho para cliente.
Retrato feito em 30 de setembro de 2026, com base na atualização do arena.ai de 24 de setembro de 2026 e no ranking ao vivo da Artificial Analysis.
Fontes
Sobre o autor
Camila Souza
Redatora de análises na Flami
Leia também
Ranking LMArena de imagem para vídeo: MiniMax H3 assume a liderança
Análise do Wan 2.7: o modelo de vídeo da Alibaba pra rótulo legível e produto que parece de verdade
Grok Imagine review: o modelo de vídeo que eu abro quando ainda não decidi
Veo 3.1 vs Kling 3.0 vs Runway: testei os mesmos vídeos de produto nos três