O modelo que supostamente ganhou esta comparação não existe. Nem existem dois dos três nomes que as pessoas continuam a repetir.
E isto não é um preciosismo — é a razão inteira pela qual me sentei a escrever este artigo. Um criador de conteúdos fez uma experiência genuinamente interessante: entregar a três modelos de fronteira o mesmo briefing criativo, construir um mundo aberto ao estilo GTA, um clone de Minecraft e um anúncio de iPhone de 30 segundos, tudo em Three.js nativo de browser, e depois ver quem ganha. Bom teste. Melhor do que mais uma tabela de SWE-bench, sinceramente. Mas o texto chamava-lhes "GPT 5.6", "Codeex" e "Claude's Fable", e quando esse enquadramento chega à terceira partilha, há pessoas a tomar decisões orçamentais reais com base em nomes de modelos que não são reais e num ranking de custos que está pura e simplesmente invertido.
Portanto, isto é uma comparação GPT-5.6 vs Grok 4.5 vs Fable 5 com os factos verificados. O mesmo ângulo criativo — porque é o ângulo certo, e a primeira página de resultados para esta pesquisa não passa de tabelas de benchmarks — mas com os nomes de produto reais, as tarifas reais de julho de 2026 e as contas reais do que um build criativo custa.
Um aviso honesto sobre um desses números: o modelo "mais barato" desse teste não é o modelo mais barato. Nem sequer anda lá perto. Já lá chego.
Deixem-me ser franco sobre de quem é este teste
Antes de analisar um único frame do clone de Minecraft de quem quer que seja, a devida transparência — porque já vi demasiada gente transformar uma demo do YouTube em "eu testei isto" e não vou fazer o mesmo.
Eu não executei os builds dos jogos. Não construí o Neon Burrow, a Apex City nem o Metro Rush. São outputs de um criador, a partir dos prompts de um criador, na máquina de um criador, e eu tenho exatamente o que vocês têm: as imagens. O que não vos posso dizer é o que diziam os prompts, quantas iterações correram antes do take que ficou no vídeo, que nível de esforço estava definido ou quanto foi a fatura de tokens. Esses quatro desconhecidos são precisamente as quatro variáveis que decidem o resultado de um teste destes. Guardem isso no bolso.
Aquilo de que posso falar em primeira mão é a parte que sobrevive à demo: os modelos em si, as tarifas e o que custam quando os usamos a sério. Corro pipelines de agentes multi-modelo quase todos os dias. Já passei pela versão dolorosa da lição de custos do Fable 5 — vi uma única tarefa queimar 22 dólares e tive de reconstruir toda a minha estratégia de níveis de esforço por causa disso, algo que documentei em detalhe na minha análise sobre cortar os custos de utilização do Fable 5. Integrei o Grok 4.5 na minha stack e expliquei porque é que o modelo eficiente ganha ao modelo inteligente mais vezes do que se admite. Essa é a minha base factual. Os builds são de outra pessoa.
Portanto, leiam isto pelo que é: uma camada de análise sobre um teste de terceiros, mais os números verificados que o teste omitiu. É menos entusiasmante do que "testei os três!". Também é verdade, e a versão verdadeira é mais útil para vocês, porque é nas correções que está o dinheiro.
A começar pelos nomes.
GPT-5.6 vs Grok 4.5 vs Fable 5: os nomes reais e as tarifas reais
Aqui está a tabela de correções. Tudo o que se segue vem da documentação de fornecedores e de preços à data de julho de 2026, não do vídeo.
| O vídeo chamou-lhe | Na verdade é | Input / output por 1M | Contexto |
|---|---|---|---|
| "GPT 5.6" (um modelo, três "cérebros") | GPT-5.6 Sol — topo de gama, raciocínio mais profundo | $5 / $30 | 1M |
| ↳ "meio-termo equilibrado" | GPT-5.6 Terra — o cavalo de batalha do dia a dia | $2.50 / $15 | 1M |
| ↳ "versão leve" | GPT-5.6 Luna — rápido, alto volume, sensível à latência | $1 / $6 | 1M |
| "Codeex" | Codex — o agente de programação da OpenAI | — | — |
"o comando /sites" |
@Sites — um plugin que se invoca dentro da thread |
— | — |
| "Claude's Fable" | Claude Fable 5 — o modelo da classe Mythos da Anthropic | $10 / $50 | — |
| "effort: extra ou max" | O esforço aceita low, medium, high, xhigh, max | — | — |
| "Grok 4.5" ✓ | Grok 4.5 (xAI — não SpaceX, apesar do que se lê por aí) | $2 / $6 | 500K |
| "3.js" | Three.js — a biblioteca WebGL | — | — |
Algumas destas correções importam mais do que a ortografia.
O GPT-5.6 é uma família, não um modelo. Toda a divisão Sol/Terra/Luna entrou em disponibilidade geral a 9 de julho de 2026, com uma janela de 1M de tokens nos três tiers — o desfecho de um lançamento faseado e geopoliticamente complicado que acompanhei na minha leitura sobre a série GPT-5.6 e a fronteira fechada da IA. Quando o teste diz que "o GPT 5.6 construiu um mundo aberto limpo", a única pergunta que interessa é qual tier — porque há uma diferença de preço de 5x entre o Sol e o Luna, e é a diferença entre um build que custa cêntimos e um que não custa. O enquadramento do vídeo de "três cérebros à escolha" não está exatamente errado. Só lhe faltam os nomes de que precisariam para efetivamente encomendar um.
Os níveis de esforço do Fable 5 não incluem "extra". A API aceita low, medium, high, xhigh, max. Se estiverem a ligar isto a alguma coisa, "extra" devolve um erro. Coisa pequena. Custa-vos vinte minutos.
O @Sites não é um comando de barra. É um plugin que se chama numa thread do Codex quando uma tarefa deve terminar num deployment. O Codex constrói o projeto, executa-o, faz o deploy para a infraestrutura da OpenAI e devolve um URL ao vivo. Foi lançado a 2 de junho de 2026 e entretanto passou a disponibilidade geral para subscritores pagos, com os workspaces Business e Enterprise ainda em preview atrás de toggles de administração. Escrever /sites não vos dá nada.
Agora — a correção que muda mesmo uma decisão.
O ranking de custos desse teste está invertido
A tabela-resumo do vídeo coloca o Grok 4.5 como "Custo: o mais baixo" e chama-lhe o acesso de entrada mais barato. Essa é a afirmação mais repetida sobre esta comparação e não sobrevive ao contacto com a tabela de preços.
O Grok 4.5 custa $2 de input / $6 de output. O GPT-5.6 Luna custa $1 de input / $6 de output.
O Luna custa metade no input e o mesmo no output. Não há leitura possível dessas duas linhas em que o Grok seja "o mais barato". Se a vossa carga de trabalho é pesada em input — contexto longo, ficheiros grandes, muita releitura, o que descreve basicamente qualquer build com agentes — o Luna é significativamente mais barato do que o modelo que o teste coroou como a escolha económica. Até o Terra, a $2.50/$15, fica a um erro de arredondamento do Grok no input.
Como é que o teste inverteu isto? Quase de certeza por ter comparado o Grok com o Sol e ter ficado por aí. Contra os $5/$30 do Sol, claro, o Grok parece barato. Mas isso é comparar o modelo económico com o topo de gama do concorrente e declarar uma vitória de preço, o que é como dizer que um Civic é mais barato do que um 911 e concluir que a Honda é a marca de bom valor. Comparem tier com tier e a história vira ao contrário.
A verdadeira vantagem de preço do Grok está noutro sítio, e é real — só que não é a tarifa de tabela:
- Input em cache a $0.50/M (um desconto de 75%) — forte se estiverem a martelar o mesmo contexto repetidamente.
- Até $175/mês em créditos de API gratuitos através do programa de partilha de dados da xAI, o free tier mais generoso que qualquer grande fornecedor oferece neste momento.
- Eficiência de tokens. Esta é a que interessa mesmo e a que ninguém põe num gráfico. A xAI reportou que o Grok 4.5 usa cerca de 4.2x menos tokens de output do que o Opus 4.8 em tarefas longas de programação — cerca de 15 954 tokens médios de output por tarefa contra 67 020. A tarifa de tabela é a taxa de imposto. A contagem de tokens é o rendimento. Um modelo nominalmente mais caro por token pode perder para um que simplesmente diz menos.
Há um senão nos créditos gratuitos que vale a pena conhecer antes de se entusiasmarem: é um programa de partilha de dados. O vosso tráfego treina o modelo deles. Para um jogo descartável em Three.js, quem quer saber. Para trabalho de cliente sob NDA, isso é uma conversa com o departamento jurídico, não um almoço grátis.
E a janela de contexto do Grok foi na direção errada — 500K, abaixo do 1M da geração anterior. Há relatos de que a xAI está a expandir de volta para 1M, mas arquitetem para 500K, porque é isso que existe hoje.
Portanto: o input mais barato é o Luna. O custo efetivo mais barato em trabalho agentic verboso é provavelmente o Grok, quando a eficiência de tokens começa a compor. O mais barato para contexto idêntico repetido é o Grok com caching. "O mais barato" nunca foi um número único, e o teste achatou três perguntas diferentes numa única resposta errada.
O que nos leva à parte mais interessante desta experiência — a parte que eu acho que acertou.
Porque é que construir um jogo expõe o que os benchmarks escondem
A primeira página de resultados para esta comparação é uma parede de números de SWE-bench Pro e Terminal-Bench. Aqui está o estado das coisas tal como reportado, e digo já que estes são em grande parte números dos fornecedores em harnesses dos fornecedores, o que significa que devem ser tratados como marketing com uma secção de metodologia:
| Benchmark | Fable 5 | Grok 4.5 | GPT-5.6 |
|---|---|---|---|
| SWE-Bench Pro | ~80.4% | ~64.7% | ~58.6% (5.5) |
| Terminal-Bench 2.1 | ~84% | ~83.3% | ~91.9% (Sol, modo ultra) |
Olhem para essa tabela e tentem responder à pergunta que realmente têm: qual deles faz um anúncio melhor?
Não conseguem. Nada ali mede isso. O SWE-bench pergunta se um modelo consegue resolver um issue real do GitHub. O Terminal-Bench pergunta se consegue planear e conduzir uma shell. Ambos são genuinamente úteis e ambos são completamente omissos sobre se um modelo sabe que um pôr do sol precisa de rim light quente, que o chanfro de um iPhone apanha um brilho especular ao longo de uma aresta, ou que um mundo sem som ambiente parece morto mesmo quando todas as mecânicas funcionam.
Esse é o argumento a favor do teste criativo, e é por isso que acho que o criador estava atrás de algo real. Um clone de GTA em Three.js é um prompt único brutal. Exige, em simultâneo: raciocínio espacial 3D, física, gestão de estado para um sistema de nível de procurado, um render loop que não colapsa e bom gosto. Falhem uma única destas coisas e nota-se em cerca de quatro segundos de vídeo. Não há crédito parcial e não há maneira de disfarçar no texto. Um benchmark dá-vos uma percentagem. Um build jogável dá-vos um veredito que se pode ver.
Eis o que foi observado nos três briefings, reportado como observação — não como medição minha:
O mundo aberto ao estilo GTA. O Metro Rush do Grok tinha o esqueleto — carros, polícia, um nível de procurado — mas corria com lag e parecia incompleto. O Neon Burrow do GPT-5.6 entregou um mundo aberto genuinamente estável com mecânicas de andar/conduzir e um sistema de procurado de cinco estrelas; limpo e jogável, sem iluminação dinâmica de ambiente. A Apex City do Fable levou a melhor na atmosfera — iluminação dinâmica de pôr do sol, melhor condução dos carros, um mundo que parecia habitado — a um custo de recursos mais pesado e com apenas um sistema de procurado de duas estrelas.
Releiam esse último par, porque é aí que está a pista. O Fable entregou melhor luz e menos funcionalidades. O GPT-5.6 entregou mais sistema e luz mais plana. Isso não é um modelo a ser mais inteligente. São dois modelos a fazer apostas diferentes sobre o que "constrói um jogo ao estilo GTA" significa quando o briefing não o diz. O Fable otimizou para a screenshot; o GPT-5.6 otimizou para a especificação. Ambas defensáveis. Nenhuma é um resultado de benchmark.
O clone de Minecraft. O Vauilcraft do Grok parecia correto e era oco — mobs presentes mas limitados, sem água. O GPT-5.6 acertou em cheio no core loop: andar, cortar árvores, um sistema de meteorologia funcional com controlo de chuva em tempo real. O Fable foi o único que entregou som — mobs a reagir de forma audível, além de água e areia.
O som é o resultado adormecido de todo o teste. Nenhum briefing dizia "adiciona áudio". Todas as grelhas de avaliação de todos os evals de modelos que já vi o ignoram. E é a única coisa que mais separa "demo técnica" de "jogo" nos primeiros três segundos. Se querem saber o que um modelo acredita que é o trabalho, olhem para o que ele faz quando ninguém pediu.
O anúncio do iPhone. O Grok distorceu o corpo e alterou a forma da porta — uma tentativa razoável, não um anúncio da Apple. O GPT-5.6 chegou perto: lente e corpo fielmente replicados, frames sincronizados, reconhecível como a coisa real. O Fable produziu reflexos, iluminação e materiais que parecem trabalho de estúdio de motion.
Padrão consistente nos três: o Fable ganha em fidelidade, o GPT-5.6 ganha em mecânicas e estabilidade, o Grok dá-vos uma fundação sobre a qual iterar. É uma conclusão coerente. Bate certo com a reputação geral dos modelos. E vale exatamente tanto quanto a vossa confiança em quatro desconhecidos — prompts, número de iterações, nível de esforço e custo — nenhum dos quais foi divulgado.
Sobretudo esse último.
O número que o teste nunca vos mostrou
Cada um daqueles builds tem uma fatura associada e nenhuma delas foi mencionada. Deixem-me então fazer a aritmética que a demo saltou, porque muda o veredito.
Peguem num build criativo single-shot realista: um jogo Three.js complexo a partir de um briefing detalhado. Digamos 15K tokens de input (briefing, contexto, talvez algum código de referência) e 40K de output (um build grande num ficheiro único mais o raciocínio). Aproximado, mas direcionalmente honesto.
| Modelo | Input (15K) | Output (40K) | Por build |
|---|---|---|---|
| GPT-5.6 Luna | $0.015 | $0.24 | ~$0.26 |
| Grok 4.5 | $0.03 | $0.24 | ~$0.27 |
| GPT-5.6 Terra | $0.038 | $0.60 | ~$0.64 |
| GPT-5.6 Sol | $0.075 | $1.20 | ~$1.28 |
| Claude Fable 5 | $0.15 | $2.00 | ~$2.15 |
O Fable 5 custa cerca de 8x o que o Luna custa pelo mesmo build. E aqui está o que a demo não pode mostrar: ninguém obtém o clone de GTA num único shot. Nem o Fable, nem ninguém. O verdadeiro trabalho criativo é iterativo — constrói-se, olha-se, diz-se "a iluminação está plana", vai-se de novo. Multipliquem aquela tabela por oito iterações e os $2.15 por build do Fable tornam-se $17, enquanto os do Luna ficam em $2.
Agora acrescentem o que eu aprendi da maneira cara: o nível de esforço é um multiplicador de tokens, não um escalão de preços. A tarifa por token do Fable 5 é fixa em $10/$50, independentemente do esforço. O que o esforço muda é quantos tokens ele queima a pensar antes de responder — e cada um desses tokens de raciocínio é faturado como output, na classe de tokens mais cara que a Anthropic vende. Liguem o max numa tarefa que não precisava dele e estão a pagar $50/M por raciocínio que deitaram fora. É assim que uma única tarefa chega aos $22.
O conselho do vídeo é correr o Fable em "extra ou max" para builds complexos. Pondo de parte o facto de esses dois não serem ambos valores reais — esse conselho, aplicado por alguém que acabou de ver uma demo entusiasmante, é como se acorda com uma fatura que não se orçamentou. A própria documentação da Anthropic nota que os níveis de esforço mais baixos do Fable 5 excedem frequentemente o desempenho xhigh de modelos anteriores. max por defeito não é uma estratégia de qualidade. É um imposto que se paga voluntariamente.
Portanto, a leitura honesta de custos: a vitória do Fable em fidelidade é real e é cara, e se vale 8x depende inteiramente de o output ir parar a um cliente ou morrer na vossa pasta de downloads. O teste declarou um vencedor numa dimensão em que o preço não era uma variável. O preço é sempre uma variável.
Se quiserem a versão alavanca a alavanca de como baixar essa fatura sem descer para um modelo mais burro, as cinco mudanças que cortaram os meus custos de Fable 5 até 80% é o artigo para onde vos apontaria primeiro.
E o deployment — o @Sites decide a questão?
O teste dá aqui uma vantagem real ao GPT-5.6 e acho que é a conclusão mais subvalorizada de todo o exercício.
O @Sites significa que o Codex consegue construir um jogo em Three.js, alojá-lo e devolver um URL ao vivo, partilhável — sem conta de hosting, sem pipeline de deploy, sem ticket de DevOps. Corre em infraestrutura da OpenAI com tecnologia compatível com Cloudflare Workers. Para trabalho criativo, esse ciclo é genuinamente diferente: prompt → link jogável que se pode enviar a alguém. O ciclo de feedback encolhe de horas para minutos.
Isso não é uma capacidade do modelo. É uma capacidade de produto, e vale a pena ser preciso na distinção, porque é a coisa com mais probabilidade de decidir a vossa escolha real. O Fable 5 pode renderizar um pôr do sol melhor. Se o GPT-5.6 coloca o vosso build à frente de um cliente em noventa segundos enquanto vocês ainda estão a decidir onde alojar a obra-prima do Fable, o pôr do sol melhor perdeu.
A realidade do acesso à data de julho de 2026: disponibilidade geral para subscritores pagos do ChatGPT com sites visíveis publicamente; preview para Business e Enterprise, ligado por defeito no Business, controlado por administradores via RBAC no Enterprise. "Visíveis publicamente" está a fazer trabalho silencioso nessa frase — verifiquem antes de fazerem deploy de material de cliente.
Do lado da Anthropic, o Cowork cobre a metade do fluxo de trabalho — acesso a ficheiros, execução multi-passo, conectores MCP, plugins, agora com paridade total no Windows e tarefas na cloud a partir do telemóvel. Tenho corrido nele a minha própria pipeline de briefing matinal e escrevi sobre o que realmente funciona e o que se parte na atualização cloud do Cowork. É um sistema de trabalho forte. Não é um alvo de deploy público de um comando, e fingir que essas duas coisas são a mesma funcionalidade não ajuda ninguém.
GPT-5.6 vs Grok 4.5 vs Fable 5: qual deveriam realmente usar?
Não há um vencedor universal — o teste acertou nessa parte, mesmo que lá tenha chegado em parte por sorte. Aqui está o quadro que eu aplicaria de facto, com o preço incluído:
Peguem no GPT-5.6 Luna quando estão a iterar. Exploração inicial, protótipos descartáveis, doze variações da mesma cena. A ~$0.26 por build, é a maneira mais barata de descobrir se a vossa ideia presta. É também — repita-se — mais barato no input do que o modelo que aquele teste chamou de mais barato.
Peguem no GPT-5.6 Terra quando é trabalho a sério com um orçamento. O cavalo de batalha do dia a dia, competitivo com o GPT-5.5 a metade do custo, e o default de onde eu partiria para a maioria das cargas de produção. Subam de tier apenas quando conseguirem nomear aquilo em que o Terra falhou.
Peguem no GPT-5.6 Sol quando precisam de mecânicas que se aguentam e de um deploy no fim. A melhor combinação de estabilidade mais entrega do teste, ~91.9% no Terminal-Bench 2.1 via subagentes paralelos do modo ultra, e o @Sites fecha o ciclo. Cerca de um terço do custo do Fable.
Peguem no Grok 4.5 quando o trabalho é verboso e repetitivo — execuções longas de agentes, contexto em cache, o tipo de coisa em que a eficiência de tokens compõe. A sua eficiência de 4.2x em tokens de output faz mais pela vossa fatura do que qualquer tarifa de tabela. Só planeiem para 500K de contexto e leiam os termos de partilha de dados.
Peguem no Fable 5 quando o output é o produto. Material virado para o cliente, nível de portefólio, o anúncio que tem de parecer feito por um estúdio. Quando a qualidade máxima bate genuinamente o preço — e sejam honestos sobre a frequência com que isso é verdade. Depois corram-no primeiro em medium ou high e obriguem-no a provar que precisa de mais.
A jogada meta, e a que me tem servido melhor do que qualquer lealdade a um único modelo: iterar barato, terminar caro. Encontrem a ideia no Luna. Construam a estrutura no Terra ou no Sol. Se vai ser entregue a alguém que está a pagar, corram a passagem final no Fable. O enquadramento do teste — escolham o vosso lutador, um ganha — tem a forma errada para o modo como este trabalho realmente se faz. Não estão a escolher um modelo. Estão a escolher um modelo por fase, e a fase em que precisam de tokens de output a $50/M é normalmente a última.
O que eu precisaria de ver antes de confiar em qualquer parte disto
Deixem-me apontar o ceticismo também à minha própria análise, já que passei 2 000 palavras a apontá-lo à de outra pessoa.
Tudo o que está acima assenta em observações que eu não fiz. Quatro divulgações mudariam a minha leitura e, até existirem, calibrem em conformidade:
- Os prompts exatos. Um modelo que "perdeu" com um briefing vago pode simplesmente tê-lo interpretado de forma diferente. O sistema de procurado de duas estrelas do Fable contra as cinco estrelas do GPT não é obviamente uma lacuna de capacidade — pode ser uma lacuna de leitura do prompt.
- O número de iterações. One-shot contra melhor-de-cinco é uma afirmação completamente diferente. Se o pôr do sol do Fable levou quatro tentativas e a iluminação plana do GPT levou uma, o ranking inverte-se em qualquer eixo que inclua o vosso tempo.
- O nível de esforço. Se o Fable correu em
maxe o GPT-5.6 no default, isso não é uma comparação de modelos. É uma comparação de configurações com um título de comparação de modelos. - A fatura de tokens por build. Sem ela, "o Fable ganha" significa "o Fable ganha a um custo desconhecido", o que não é uma conclusão. É uma preferência.
Também quereria uma repetição com um briefing fresco. Todos os modelos desta classe foram treinados com um planeta inteiro de clones de Minecraft, discussões sobre GTA e frames de anúncios da Apple. "Constrói um clone de Minecraft" está muito perto de ser uma sonda de memorização. Peçam um jogo que não existe — uma mecânica qualquer sem resposta no Stack Overflow — e suspeito que as diferenças fiquem com outro aspeto. Possivelmente muito menores. Possivelmente muito maiores. Esse é o teste que eu quereria mesmo ver, e é o que eu teria de construir eu próprio antes de pôr o meu nome num veredito.
A comparação criativa a três em que eu confiaria ainda não foi feita. Esta é um bom esboço dela.
A parte que vale a pena levar convosco
Voltem ao ponto onde começámos: o modelo que ganhou não existia, e o ranking de preços também não.
Isto não é um tiro contra um criador. É a textura de todo este momento. Agora saem modelos todas as semanas. Os nomes esbatem-se. Uma demo é recortada, o recorte ganha um título, o título ganha uma alcunha, e três semanas depois há pessoas a escolher infraestrutura com base numa cadeia de telefone estragado que começou com alguém a avaliar um pôr do sol a olho. O teste criativo por baixo era uma ideia genuinamente boa — melhor do que as tabelas de benchmarks com que compete, porque mediu o gosto, e o gosto é a coisa que os benchmarks estruturalmente não conseguem ver. Só foi publicado sem os quatro números que fariam dele uma conclusão em vez de uma vibe.
Portanto, aqui está o que vos pediria mesmo para fazer, e leva dez minutos. Antes da vossa próxima decisão de modelo, abram a página de preços — a verdadeira, a do fornecedor — e escrevam a tarifa de input, a tarifa de output e a janela de contexto de todos os modelos que estão a considerar. Tier com tier. Não topo de gama contra económico. Depois perguntem de que é que o vosso trabalho é realmente feito: é pesado em input ou em output? Iterativo ou one-shot? Vai para um cliente ou morre na vossa pasta de downloads?
Dez minutos disso valem mais do que dez horas de demos. Teriam apanhado a questão do Luna instantaneamente.
Os modelos são extraordinários. Os três. O clone de GTA num único prompt teria sido ficção científica há dezoito meses e agora já nos aborrece. Mas o fosso entre "isto é incrível" e "isto é o que devo correr na terça-feira" está preenchido inteiramente com aritmética, e ninguém está a recortar essa parte para o YouTube.
Façam a aritmética. É a única parte disto que é realmente vossa.
GPT-5.6 vs Grok 4.5 vs Fable 5: Respostas Rápidas
Qual é mais barato, o Grok 4.5 ou o GPT-5.6?
O GPT-5.6 Luna é mais barato no input, a $1 por milhão de tokens contra os $2 do Grok 4.5, e ambos custam $6 por milhão no output. A verdadeira vantagem do Grok é a eficiência de tokens — cerca de 4.2x menos tokens de output em tarefas longas — mais input em cache a $0.50/M. Vejam a secção de preços acima para as contas tier a tier.
Quais são os três modelos GPT-5.6?
O GPT-5.6 chega em três tiers: Sol ($5/$30 por 1M de tokens, raciocínio topo de gama), Terra ($2.50/$15, o cavalo de batalha equilibrado) e Luna ($1/$6, rápido e económico). Os três entraram em disponibilidade geral a 9 de julho de 2026 com janelas de contexto de 1M de tokens.
O Claude Fable 5 vale o preço para trabalho criativo?
O Fable 5 custa cerca de 8x o GPT-5.6 Luna por build ($10/$50 por 1M de tokens), e os testes observados dão-lhe vantagem em fidelidade visual, iluminação e áudio. Vale a pena quando o output vai para um cliente — não para iterar. Corram com esforço medium ou high antes de recorrerem ao max.
Quais são os níveis de esforço do Claude Fable 5?
A API aceita exatamente cinco valores: low, medium, high, xhigh e max. O esforço não é um escalão de preços — a tarifa de $10/$50 é fixa. Esforço mais alto queima mais tokens de raciocínio, todos faturados como output, e é assim que uma única tarefa chega aos $22.
O GPT-5.6 consegue fazer o deploy de um jogo para um URL ao vivo?
Sim — o plugin @Sites do Codex (não um comando /sites) constrói, aloja e devolve um URL partilhável em infraestrutura da OpenAI. Está em disponibilidade geral para subscritores pagos do ChatGPT com sites visíveis publicamente, e em preview para workspaces Business e Enterprise.
A Parte Que Vale a Pena Levar Convosco
Retirem o teatro dos leaderboards e uma coisa fica de pé: os três modelos são extraordinários, e o verdadeiro diferenciador não é qual ganha um benchmark — é qual justifica o seu custo no trabalho que realmente fazem. Um build de um jogo expõe o que uma folha de especificações esconde, e o ranking de custos virou-se exatamente onde vivia a confusão de nomes.
Portanto, corram o vosso próprio teste na vossa própria tarefa antes de confiarem em qualquer comparação, incluindo a minha. O modelo que ganha no vosso trabalho é o único ranking que paga as vossas contas.
Se quiserem ajuda a escolher e a integrar o modelo certo num produto real, é algo que faço através da Ramlit. O teste criativo acima é a minha tentativa honesta de cortar através dos nomes.