O modelo que liderou o gráfico de benchmarks perdeu quatro dos meus cinco testes.
Quero começar por aí porque esse é todo o ponto, e eu mesmo quase não acreditei. Tinha alinhado GLM 5.2 vs Qwen 3.7 Max vs Claude Opus 4.8 esperando que o Qwen ganhasse facilmente — ele lidera as tabelas publicadas de agentic-coding, a Alibaba tem sido vocal sobre as pontuações do Terminal-Bench e SWE-Bench Pro, e no papel deveria ter sido a escolha óbvia. Então dei aos três exatamente os mesmos prompts, uma tentativa cada, sem repetições, sem "tente de novo," e assisti o líder do ranking me entregar um voxel runner que era tecnicamente funcional e completamente sem vida. Enquanto isso, um modelo chinês de pesos abertos que nem publicou benchmarks da versão 5.2 continuava entregando coisas que realmente eram divertidas de usar.
Essa lacuna — entre o que um leaderboard promete e o que aparece na sua tela — é sobre o que todo este teste se trata. Se você está escolhendo um modelo de codificação agora com base em um número de SWE-Bench que viu em um tweet de lançamento, eu esperaria até ler o que aconteceu quando fiz esses três competirem em tarefas idênticas e reais sem segundas chances.
Um aviso honesto logo de início, o mesmo que faço toda vez: vou te dizer exatamente o que executei na prática e onde estou me baseando em afirmações de fornecedores. Os números de versão aqui — GLM 5.2, Qwen 3.7 Max, Claude Opus 4.8 — são todos modelos reais, lançados a partir de junho de 2026, e verifiquei seus detalhes de lançamento. Onde uma cifra de benchmark vem do próprio deck de um fornecedor, direi isso, porque toda a lição deste artigo é que você não deve confiar cegamente nesses números. Incluindo os meus.
Os Três Modelos, e Por Que Esta Comparação É Realmente Justa
Um breve contexto antes dos testes, porque se os participantes não são comparáveis, os resultados são ruído.
GLM 5.2 foi lançado pela Z.ai (a cisão da Zhipu AI) em 13 de junho de 2026. É um modelo mixture-of-experts com 744B de parâmetros e aproximadamente 40B parâmetros ativos por token, uma janela de contexto genuína de 1M de tokens, e — este é o destaque que continua importando — pesos abertos com licença MIT. Cobri seu lançamento em detalhe no meu resumo semanal de IA sobre GLM-5.2, Fable 5 e DiffusionGemma, então não vou relitigar a ficha técnica aqui. O fato relevante para este teste: a Z.ai publicou benchmarks para o GLM 5.1, não o 5.2. Então quando o GLM 5.2 ganha algo abaixo, ganha sem um benchmark para se esconder atrás.
Qwen 3.7 Max é o carro-chefe da Alibaba, anunciado na Cúpula da Alibaba Cloud em Hangzhou em 20 de maio de 2026, também com uma janela de 1M de tokens. As tabelas publicadas da Alibaba o colocam em aproximadamente 60,6 no SWE-Bench Pro e afirmam que supera a geração anterior do Claude Opus no Terminal-Bench 2.0 e MCP-Atlas. Está posicionado claramente como um modelo agente — construído para chamadas de ferramentas, orquestração e cadeias de tarefas de longo horizonte.
Claude Opus 4.8 chegou da Anthropic em 28 de maio de 2026 com preços inalterados ($5 por milhão de entrada, $25 por milhão de saída). Seu próprio número de SWE-Bench Pro é 69,2% — e vale notar que isso é na verdade mais alto que a cifra publicada do Qwen, o que já complica a história de "Qwen lidera os benchmarks" com a qual cheguei. A Anthropic também lançou Dynamic Workflows, permitindo que o Claude Code lance subagentes paralelos.
Aqui está a reviravolta que a fonte deste teste sinalizou, e quero ser direto sobre isso. Tinha visto circular uma cifra de SWE-Bench de 80,4% para o Qwen 3.7 Max. Não consegui verificar esse número contra as próprias tabelas publicadas da Alibaba, que mostram aproximadamente 60,6 no SWE-Bench Pro. Então trato 80,4% como uma afirmação não verificável próxima ao fornecedor e não a afirmo como fato. Os números verificados, reportados por terceiros, contam uma história diferente do hype — Opus 4.8 com 69,2% fica acima da pontuação Pro publicada do Qwen. Guarde isso; fica mais interessante quando os resultados do mundo real chegam.
O teste em si: cinco tarefas, cada modelo recebe o prompt idêntico, uma tentativa, sem repetições. Como você realmente os usaria em uma CLI numa terça-feira — não como um arnês de benchmark os mima com repetições e scaffolding.
Como Executei o Teste de Uma Tentativa (e Por Que "Uma Tentativa" Importa)
As regras foram deliberadamente rigorosas, porque indulgência é exatamente como os benchmarks mentem para você.
Um prompt por tarefa. O que o modelo produziu na primeira passada é o que foi avaliado. Sem "corrija o bug," sem "torne mais interessante," sem re-rolar até eu gostar. A maioria das pontuações de benchmark permite silenciosamente múltiplas tentativas, scaffolding de agentes ou amostragem best-of-N — e isso infla os números de uma forma que não tem nada a ver com sua experiência quando você dispara um único prompt e espera.
Avaliei em três eixos que um leaderboard não consegue capturar: funciona, é realmente bom, e um humano gostaria de usá-lo? Esse terceiro eixo é o decisivo. Um jogo de voxels pode compilar limpo, rodar a 60fps e ainda assim chegar morto porque é chato. Nenhuma célula do SWE-Bench tem uma coluna para "divertido." Essa omissão acaba explicando a maior parte da lacuna entre os rankings e a realidade.
Cinco tarefas, escolhidas para cobrir o espectro: um jogo 3D de voxel runner, um mapa orbital do sistema solar interior, uma simulação de física de líquido numa bola, uma landing page de marketing e um jogo arcade clássico. Duas são game-dev (criativo + interativo), duas pendem para simulação e física, uma é puramente front-end. Juntas, estressam qualidade visual, design de interação, matemática de física, senso de layout e aquela qualidade intangível de "isso é delightful?" tudo ao mesmo tempo.
Antes de mostrar a scorecard, algo para ter em mente: esperava que fosse apertado. Não foi.
A Scorecard: Resultados de Uma Tentativa nas Cinco Tarefas
Aqui está onde cada modelo ficou, cara a cara, sem repetições.
| Tarefa | GLM 5.2 | Qwen 3.7 Max | Claude Opus 4.8 | Vencedor |
|---|---|---|---|---|
| Jogo Voxel Runner | Divertido, fluido, genuinamente interessante | Funciona, mas com bugs e tedioso | Muito básico, sem graça | GLM 5.2 |
| Mapa Orbital do Sistema Interior | Baixa qualidade visual | Aceitável mas fraco | Altamente interativo e claro | Claude Opus 4.8 |
| Sim de Líquido na Bola | Bela animação, interativo | Menos envolvente | Muito entediante | GLM 5.2 |
| Landing Page | Bem estruturada com animação | Canvas vazio, fraco | Muito básica, sem inspiração | GLM 5.2 |
| Jogo Arcade | Altamente envolvente e divertido | Bug: bola desaparece | Mais jogável que Qwen | GLM 5.2 |
Quatro a um para o GLM 5.2. O modelo agente líder em benchmarks, Qwen 3.7 Max, ganhou exatamente zero tarefas. E o Claude Opus 4.8 — o modelo com a maior pontuação verificada de SWE-Bench Pro dos três — ganhou uma única tarefa e fracassou no resto do trabalho criativo.
Se você levar apenas uma coisa deste artigo, que seja a forma dessa tabela. Os rankings publicados teriam previsto Qwen em primeiro, Opus em segundo, GLM em algum lugar atrás sem números 5.2 em seu nome. Na prática, a ordem quase se inverteu. Agora deixe-me explicar por quê, tarefa por tarefa, porque as razões são mais úteis que o veredicto.
Voxel Runner: Onde "Funciona" e "Bom" Se Separam
A primeira tarefa traçou a linha mais limpa de todo o teste.
Pedi aos três um voxel runner 3D — pense em um endless-runner onde você desvia e pula por um mundo de blocos. O GLM 5.2 entregou algo com que eu realmente queria continuar jogando. O movimento tinha peso, a câmera seguia de forma sensata, o mundo tinha variedade visual suficiente para não parecer que você estava olhando para uma única textura. Era divertido. Essa palavra importa mais do que parece.
O Qwen 3.7 Max também produziu um voxel runner — e na base pura de "compilou e rodou?", passou. Mas tinha bugs persistentes de formas pequenas, e pior, era tedioso. Iluminação plana, sem sensação de velocidade, o tipo de coisa que tecnicamente satisfaz o prompt e não satisfaz mais nada. Essa é exatamente a armadilha de avaliar por "tarefa resolvida." O Qwen resolveu a tarefa. Um sistema tipo SWE-Bench o marcaria como verde. Um humano fecharia a aba em dez segundos.
O Claude Opus 4.8 foi a surpresa aqui, e não uma boa. Seu voxel runner foi o mais básico dos três — funcional, código limpo por baixo, quase certamente, mas visual e experiencialmente magro. Para um modelo que lidera os benchmarks verificados de coding, ver que produzia o jogo menos envolvente dos três foi a primeira rachadura nas minhas suposições.
A lição que já se cristaliza: esses modelos não diferem em correção. Diferem em gosto. E gosto é o que ninguém faz benchmark.
Mapa Orbital: A Única Vitória Clara do Claude, e É Real
Não quero que isso se leia como uma coroação do GLM, porque a tarefa do mapa orbital mostrou algo genuinamente importante sobre o Claude Opus 4.8.
O prompt: construa um mapa interativo do sistema solar interior — o Sol, Mercúrio até Marte, órbitas renderizadas claramente, idealmente algo com que você possa interagir. Esta é a única tarefa onde precisão e raciocínio espacial estruturado importam mais que atmosfera, e o Claude dominou. Seu mapa orbital foi o mais interativo e o mais claro por uma margem ampla: trajetórias orbitais legíveis, escala sensata, interação fluida, o tipo de output onde você imediatamente entende o que está vendo.
O GLM 5.2, o vencedor geral do teste, entregou baixa qualidade visual aqui — a única tarefa que claramente perdeu. O Qwen ficou no meio: aceitável, mas fraco, nunca passando de "ok."
Isso é o que tiro daqui. Quando uma tarefa trata fundamentalmente de correção e clareza — precisão espacial, layout estruturado, relações matemáticas que você não pode falsificar — os pontos fortes do Claude Opus 4.8 aparecem exatamente onde seu perfil de benchmark diz que deveriam estar. Este é o modelo ao qual você recorre quando "parece impressionante" importa menos que "está inequivocamente correto." Sua pontuação de 69,2% no SWE-Bench Pro não é uma mentira; simplesmente mede uma fatia mais estreita de utilidade do que o marketing implica.
Essa nuance é o núcleo honesto de toda esta comparação: nenhum modelo é ruim. Eles têm formas diferentes. O Claude perdeu a maioria das tarefas criativas não porque é fraco, mas porque interatividade criativa não é onde sua vantagem vive. Guarde isso, porque muda a recomendação no final.
Líquido na Bola e a Landing Page: O Padrão do GLM Se Mantém
Mais duas tarefas, e o mesmo tema continuou se repetindo com consistência quase entediante.
A simulação de líquido na bola — fluido chapinhando dentro de uma esfera, idealmente algo que você pode inclinar e interagir — foi novamente para o GLM 5.2. Sua versão tinha animação genuinamente bonita e interatividade real; você podia sentir a física respondendo. A do Qwen foi menos envolvente, o movimento mais rígido e menos vivo. A do Claude foi, em uma palavra, entediante — a física provavelmente estava correta, mas correto não é o mesmo que cativante, e uma simulação de fluido com a qual ninguém quer mexer falhou em sua tarefa real.
A landing page contou a mesma história de um ângulo diferente. Pedi uma landing page de marketing, e o GLM 5.2 entregou algo bem estruturado com animação pensada — um layout com hierarquia, seções que fluíam, movimento que guiava o olhar. O Qwen me deu algo próximo a um canvas vazio: tecnicamente uma página, praticamente um ponto de partida que você teria que construir do zero. A do Claude foi básica e sem inspiração, funcional mas plana.
Já construí landing pages reais suficientes — para o trabalho de clientes da Ramlit e meus próprios projetos — para conhecer a diferença entre "uma página existe" e "uma página vende." O GLM 5.2 foi o único dos três que pareceu entender que existe uma diferença.
Se você prefere que alguém construa um fluxo de trabalho de codificação multi-modelo que direcione cada tarefa ao modelo que realmente é melhor nela — em vez de apostar toda a sua pilha em um vencedor de leaderboard — esse é exatamente o tipo de trabalho de integração que aceito. Você pode ver o que entreguei em fiverr.com/s/EgxYmWD.
O Jogo Arcade: Uma Bola que Desaparece Decide Tudo
A última tarefa foi quase comicamente esclarecedora.
Um jogo arcade clássico — pense em paddle-and-ball, território de brick-breaker. O GLM 5.2 o tornou altamente envolvente e divertido, alcançando seu ritmo já familiar. O Claude Opus 4.8 foi mais jogável que o Qwen, ficando em um respeitável segundo lugar. E o Qwen 3.7 Max? A bola do Qwen desapareceu no meio do jogo. O objeto mais importante em um jogo arcade baseado em bola desapareceu no vazio.
Reflita sobre isso por um segundo ao lado da posição de benchmark do Qwen. Este é, no papel, o líder de agentic-coding — números fortes de SWE-Bench, construído para tarefas complexas de múltiplas etapas. E em uma construção arcade de uma tentativa, perdeu a bola. Não um bug de lógica sutil enterrado três funções abaixo. A bola literal, sumida.
Isso é toda a tese deste artigo comprimida em um sprite. Pontuações de benchmark medem o desempenho de um modelo em um conjunto curado de problemas sob condições favoráveis. Não medem se seu único prompt real produz algo que funciona do início ao fim. A lacuna entre essas duas coisas é onde a maioria dos erros de seleção de modelo são cometidos.
Por Que os Benchmarks Mentiram para Mim (e Provavelmente para Você Também)
Hora de olhar sob o capô da desconexão, porque entender por que acontece te torna um melhor selecionador de modelos do que qualquer leaderboard.
Benchmarks de fornecedores são executados pelas pessoas que lucram com o resultado. Isso não é uma acusação de fraude — é simplesmente estrutural. Quando a Alibaba reporta o SWE-Bench Pro do Qwen 3.7 Max em 60,6, eles executaram sob condições que escolheram, em um conjunto de tarefas que recompensa aquilo para o qual seu modelo é otimizado. Mesmo números completamente honestos refletem uma configuração que você nunca reproduzirá no seu terminal. E as cifras não verificadas que circulam — como aqueles 80,4% que não pude confirmar — pioram, porque entram na conversa como fato e são repetidas até que todos "sabem" que o Qwen lidera.
Depois há a forma do que os benchmarks testam. O SWE-Bench mede a resolução de issues reais do GitHub — corrigir bugs em codebases existentes. Isso é genuinamente valioso, e por isso os 69,2% do Claude Opus 4.8 são significativos para trabalho de manutenção. Mas "corrija este bug do Django" e "construa-me um voxel runner divertido do zero" são músculos completamente diferentes. Um modelo pode ser elite no primeiro e medíocre no segundo, e um benchmark construído em torno do primeiro não te dirá nada sobre o segundo.
Aqui está a parte que a maioria das pessoas perde: não existe benchmark para gosto. Nenhuma coluna de leaderboard para "esta landing page é algo de que um humano se orgulharia de lançar?" ou "este jogo é divertido?" Essas qualidades são o produto real quando você faz trabalho criativo ou de front-end — e são exatamente onde o GLM 5.2 continuava ganhando apesar de não ter cifras publicadas de 5.2 para apontar. O que faz de melhor é o que ninguém pontua.
Meu modelo mental corrigido após este teste: trate cada benchmark como uma medição de uma única capacidade estreita sob condições ideais de laboratório, e trate seu próprio teste de uma tentativa como o único número que prevê sua experiência real. Execute três prompts que realmente importam para você em cada modelo antes de se comprometer. Leva vinte minutos e vai sobrescrever cem tweets de leaderboard.
A Questão da Integração: Hermes Agent e O Que Realmente Se Conecta
Existe uma dimensão desta comparação que não tem nada a ver com qualidade de output, e para alguns de vocês vai importar mais do que qualquer resultado de teste.
A fonte deste teste rodou GLM 5.2 e Qwen 3.7 Max dentro de um sistema operacional de agentes que chamou de Hermes Agent — um dashboard para orquestrar múltiplos modelos, encadear tarefas e executar colaboração entre agentes. Quero ser transparente: não consegui verificar independentemente "Hermes Agent" como um produto mainstream amplamente documentado, então o apresento como a camada de orquestração que este teste específico usou, não como uma ferramenta que endosso ou afirmo como padrão da indústria. A categoria — um dashboard unificado que orquestra múltiplos modelos — é real e crescente, independentemente de como o produto específico se chama.
O que é relevante é a descoberta estrutural, porque se generaliza para qualquer plataforma de orquestração: GLM 5.2 e Qwen 3.7 Max se plugaram diretamente nesse OS de agentes. O Claude Opus 4.8, nessa configuração, não. Se seu fluxo de trabalho vive dentro de uma camada de orquestração multi-modelo onde modelos passam tarefas entre si, essa lacuna de integração é decisiva independentemente de quem ganhe um duelo de jogos de voxels. Um modelo que não pode se juntar à sua malha de agentes não é um candidato para esse trabalho, ponto final.
E dentro de fluxos de trabalho de agentes especificamente, os rankings se reorganizam novamente. Para tarefas de agente tipo pesquisa — ir coletar, sintetizar, reportar — o Qwen 3.7 Max produziu output mais completo e útil que o GLM 5.2, cujas respostas de tarefas de agente saíram mais curtas e menos eficazes. O Qwen também tendia a responder mais rápido em consultas práticas de agentes. Então o modelo que perdeu cada one-shot criativo lidera silenciosamente em throughput de pesquisa agêntica e velocidade. O GLM 5.2, por contraste, foi mais forte como modelo de codificação direta em uma CLI, onde sua qualidade criativa e de software brilhou, mas suas respostas de agente integrado às vezes correram mais devagar.
Já escrevi antes sobre tratar o OS agêntico como três camadas distintas, e este teste reforça isso: o modelo que é melhor em gerar algo e o modelo que é melhor em orquestrar um fluxo de trabalho podem ser dois modelos diferentes. Construir em torno dessa realidade é mais poderoso do que coroar um único vencedor.
Resultados: O Que Isto Realmente Prevê para o Seu Trabalho
Deixe-me traduzir cinco testes de game-dev em decisões que você realmente enfrentará.
Para codificação criativa e front-end direta — landing pages, jogos, simulações, qualquer coisa onde a qualidade e o prazer do output são o produto — o GLM 5.2 foi o claro destaque no meu teste de uma tentativa, e o fato de ser pesos abertos com licença MIT significa que você pode auto-hospedá-lo sem conta por token em escala. Essa combinação é difícil de superar para trabalho criativo intensivo em construção.
Para tarefas de precisão e clareza — visualização de dados, layouts estruturados, qualquer coisa onde ser inequivocamente correto supera ser chamativo — o Claude Opus 4.8 conquistou sua vitória no mapa orbital honestamente, e sua pontuação verificada de 69,2% no SWE-Bench Pro sustenta isso para correção de bugs e manutenção. Este é o modelo para "faça direito," não "faça brilhar."
Para orquestração de agentes e throughput de pesquisa — chamadas de ferramentas de múltiplas etapas, tarefas de coletar-e-sintetizar, qualquer coisa dentro de um dashboard multi-modelo onde velocidade e completude importam — o Qwen 3.7 Max redimiu sua pontuação criativa de zero em cinco. Respostas de agente mais rápidas e output de pesquisa mais completo é uma força real e útil, apenas não a que os leaderboards me fizeram esperar.
Note o que acabou de acontecer: cada modelo ganhou uma categoria diferente, e nenhuma dessas categorias é "maior pontuação de benchmark." Esse é o ganho prático. A resposta certa para "qual modelo é o melhor" é uma pergunta de volta — o melhor em quê, dentro de qual fluxo de trabalho?
A configuração que eu realmente rodaria, e a recomendação da fonte com a qual concordo totalmente: um dashboard unificado com os três (ou seus picks equivalentes), direcionando cada tarefa ao modelo que genuinamente é mais forte nela. GLM 5.2 para a construção, Claude Opus 4.8 para as peças de precisão, Qwen 3.7 Max para o trabalho de agente. Uma pilha, três especialistas. Vi uma equipe de agentes de vídeo IA rodar end-to-end no GLM 5.2 dentro de uma camada de orquestração e produzir autonomamente conteúdo finalizado — o dashboard multi-modelo não é teórico, é como o trabalho sério de agentes já é feito.
Perguntas Frequentes
O GLM 5.2 é melhor que o Claude Opus 4.8 para programar?
Para codificação criativa e front-end, o GLM 5.2 ganhou quatro dos meus cinco testes de uma tentativa, incluindo jogos e landing pages. Para precisão e correção de bugs, a pontuação verificada de 69,2% no SWE-Bench Pro do Claude Opus 4.8 e sua vitória no mapa orbital o tornam a escolha mais forte. Eles são melhores em diferentes trabalhos — veja a análise tarefa por tarefa acima.
O Qwen 3.7 Max realmente lidera os benchmarks?
O Qwen 3.7 Max lidera várias tabelas agênticas publicadas, mas sua cifra verificada de SWE-Bench Pro é aproximadamente 60,6 — na verdade abaixo dos 69,2% do Claude Opus 4.8. Uma cifra amplamente circulada de 80,4% não pôde ser verificada contra as próprias tabelas da Alibaba, então trate-a como uma afirmação não confirmada, não como fato.
Por que o modelo líder em benchmarks perdeu o teste do mundo real?
Benchmarks medem capacidades estreitas sob condições favoráveis de laboratório com múltiplas tentativas; meu teste foi uma tentativa por tarefa, avaliado parcialmente por se o output era realmente bom e utilizável. Não há coluna de benchmark para "divertido" ou "bem projetado," que é exatamente onde o GLM 5.2 continuava ganhando.
O Claude Opus 4.8 pode se conectar a um dashboard de agente multi-modelo?
Na configuração de orquestração usada para este teste, GLM 5.2 e Qwen 3.7 Max se integraram diretamente enquanto o Claude Opus 4.8 não. Se seu fluxo de trabalho depende de uma camada de agente multi-modelo, verifique o suporte de integração antes de se comprometer, pois pode sobrescrever a qualidade bruta do output para essa tarefa.
Qual é a melhor maneira de escolher um modelo de codificação IA em 2026?
Execute três prompts que realmente importam para você em cada candidato, uma tentativa cada, e avalie se o output funciona e se você realmente o lançaria. Vinte minutos de teste prático preveem sua experiência real melhor do que qualquer leaderboard. Para mais contexto, veja meu resumo semanal de IA sobre os mesmos modelos.
A Bola que Desaparece, Mais Uma Vez
Continuo voltando à bola desaparecida do Qwen, porque é o momento mais honesto de todo o teste.
Aqui estava um modelo que, pelos números, deveria ter sido a escolha segura — o líder de agentic-coding, forte no papel, construído para exatamente este tipo de trabalho. E em um único prompt real, sem repetição para salvá-lo, perdeu o único objeto em torno do qual todo o jogo foi construído. Nenhum benchmark jamais teria me dito isso. Apenas executá-lo fez isso.
Então aqui está a única coisa a fazer nas próximas vinte e quatro horas, independentemente do modelo para o qual você está inclinado: não pegue minha scorecard, e não pegue um leaderboard. Pegue três prompts que representem seu trabalho real, passe cada um exatamente uma vez pelos seus dois melhores candidatos, e avalie-os como um usuário em vez de como um benchmark. O modelo que sobreviver a esse teste é o seu modelo. Todo o resto é marketing de outra pessoa — incluindo, se você pular o teste, este artigo.
Vamos Trabalhar Juntos
Quer construir sistemas de IA, automatizar fluxos de trabalho ou escalar sua infraestrutura tecnológica? Adoraria ajudar.
- Fiverr (builds e integrações personalizadas): fiverr.com/s/EgxYmWD
- Portfolio: mejba.me
- Ramlit Limited (soluções empresariais): ramlit.com
- ColorPark (design e branding): colorpark.io
- xCyberSecurity (serviços de segurança): xcybersecurity.io