Skip to main content
Modelos de IA

GPT-5.6 vs Grok 4.5 vs Fable 5: O Teste Criativo

GPT-5.6 vs Grok 4.5 vs Fable 5 avaliados em jogos e anúncios, não em benchmarks. Preços reais, os tiers Sol/Terra/Luna e que modelo justifica o custo.

25 min
Tempo de leitura
4,842
Palavras
Publicado
Engr Mejba Ahmed

Escrito por

Engr Mejba Ahmed

Compartilhar Artigo

GPT-5.6 vs Grok 4.5 vs Fable 5: O Teste Criativo

O modelo que supostamente ganhou esta comparação não existe. Nem existem dois dos três nomes que as pessoas continuam a repetir.

E isto não é um preciosismo — é a razão inteira pela qual me sentei a escrever este artigo. Um criador de conteúdos fez uma experiência genuinamente interessante: entregar a três modelos de fronteira o mesmo briefing criativo, construir um mundo aberto ao estilo GTA, um clone de Minecraft e um anúncio de iPhone de 30 segundos, tudo em Three.js nativo de browser, e depois ver quem ganha. Bom teste. Melhor do que mais uma tabela de SWE-bench, sinceramente. Mas o texto chamava-lhes "GPT 5.6", "Codeex" e "Claude's Fable", e quando esse enquadramento chega à terceira partilha, há pessoas a tomar decisões orçamentais reais com base em nomes de modelos que não são reais e num ranking de custos que está pura e simplesmente invertido.

Portanto, isto é uma comparação GPT-5.6 vs Grok 4.5 vs Fable 5 com os factos verificados. O mesmo ângulo criativo — porque é o ângulo certo, e a primeira página de resultados para esta pesquisa não passa de tabelas de benchmarks — mas com os nomes de produto reais, as tarifas reais de julho de 2026 e as contas reais do que um build criativo custa.

Um aviso honesto sobre um desses números: o modelo "mais barato" desse teste não é o modelo mais barato. Nem sequer anda lá perto. Já lá chego.

Deixem-me ser franco sobre de quem é este teste

Antes de analisar um único frame do clone de Minecraft de quem quer que seja, a devida transparência — porque já vi demasiada gente transformar uma demo do YouTube em "eu testei isto" e não vou fazer o mesmo.

Eu não executei os builds dos jogos. Não construí o Neon Burrow, a Apex City nem o Metro Rush. São outputs de um criador, a partir dos prompts de um criador, na máquina de um criador, e eu tenho exatamente o que vocês têm: as imagens. O que não vos posso dizer é o que diziam os prompts, quantas iterações correram antes do take que ficou no vídeo, que nível de esforço estava definido ou quanto foi a fatura de tokens. Esses quatro desconhecidos são precisamente as quatro variáveis que decidem o resultado de um teste destes. Guardem isso no bolso.

Aquilo de que posso falar em primeira mão é a parte que sobrevive à demo: os modelos em si, as tarifas e o que custam quando os usamos a sério. Corro pipelines de agentes multi-modelo quase todos os dias. Já passei pela versão dolorosa da lição de custos do Fable 5 — vi uma única tarefa queimar 22 dólares e tive de reconstruir toda a minha estratégia de níveis de esforço por causa disso, algo que documentei em detalhe na minha análise sobre cortar os custos de utilização do Fable 5. Integrei o Grok 4.5 na minha stack e expliquei porque é que o modelo eficiente ganha ao modelo inteligente mais vezes do que se admite. Essa é a minha base factual. Os builds são de outra pessoa.

Portanto, leiam isto pelo que é: uma camada de análise sobre um teste de terceiros, mais os números verificados que o teste omitiu. É menos entusiasmante do que "testei os três!". Também é verdade, e a versão verdadeira é mais útil para vocês, porque é nas correções que está o dinheiro.

A começar pelos nomes.

GPT-5.6 vs Grok 4.5 vs Fable 5: os nomes reais e as tarifas reais

Aqui está a tabela de correções. Tudo o que se segue vem da documentação de fornecedores e de preços à data de julho de 2026, não do vídeo.

O vídeo chamou-lhe Na verdade é Input / output por 1M Contexto
"GPT 5.6" (um modelo, três "cérebros") GPT-5.6 Sol — topo de gama, raciocínio mais profundo $5 / $30 1M
↳ "meio-termo equilibrado" GPT-5.6 Terra — o cavalo de batalha do dia a dia $2.50 / $15 1M
↳ "versão leve" GPT-5.6 Luna — rápido, alto volume, sensível à latência $1 / $6 1M
"Codeex" Codex — o agente de programação da OpenAI — —
"o comando /sites" @Sites — um plugin que se invoca dentro da thread — —
"Claude's Fable" Claude Fable 5 — o modelo da classe Mythos da Anthropic $10 / $50 —
"effort: extra ou max" O esforço aceita low, medium, high, xhigh, max — —
"Grok 4.5" ✓ Grok 4.5 (xAI — não SpaceX, apesar do que se lê por aí) $2 / $6 500K
"3.js" Three.js — a biblioteca WebGL — —

Algumas destas correções importam mais do que a ortografia.

O GPT-5.6 é uma família, não um modelo. Toda a divisão Sol/Terra/Luna entrou em disponibilidade geral a 9 de julho de 2026, com uma janela de 1M de tokens nos três tiers — o desfecho de um lançamento faseado e geopoliticamente complicado que acompanhei na minha leitura sobre a série GPT-5.6 e a fronteira fechada da IA. Quando o teste diz que "o GPT 5.6 construiu um mundo aberto limpo", a única pergunta que interessa é qual tier — porque há uma diferença de preço de 5x entre o Sol e o Luna, e é a diferença entre um build que custa cêntimos e um que não custa. O enquadramento do vídeo de "três cérebros à escolha" não está exatamente errado. Só lhe faltam os nomes de que precisariam para efetivamente encomendar um.

Os níveis de esforço do Fable 5 não incluem "extra". A API aceita low, medium, high, xhigh, max. Se estiverem a ligar isto a alguma coisa, "extra" devolve um erro. Coisa pequena. Custa-vos vinte minutos.

O @Sites não é um comando de barra. É um plugin que se chama numa thread do Codex quando uma tarefa deve terminar num deployment. O Codex constrói o projeto, executa-o, faz o deploy para a infraestrutura da OpenAI e devolve um URL ao vivo. Foi lançado a 2 de junho de 2026 e entretanto passou a disponibilidade geral para subscritores pagos, com os workspaces Business e Enterprise ainda em preview atrás de toggles de administração. Escrever /sites não vos dá nada.

Agora — a correção que muda mesmo uma decisão.

O ranking de custos desse teste está invertido

A tabela-resumo do vídeo coloca o Grok 4.5 como "Custo: o mais baixo" e chama-lhe o acesso de entrada mais barato. Essa é a afirmação mais repetida sobre esta comparação e não sobrevive ao contacto com a tabela de preços.

O Grok 4.5 custa $2 de input / $6 de output. O GPT-5.6 Luna custa $1 de input / $6 de output.

O Luna custa metade no input e o mesmo no output. Não há leitura possível dessas duas linhas em que o Grok seja "o mais barato". Se a vossa carga de trabalho é pesada em input — contexto longo, ficheiros grandes, muita releitura, o que descreve basicamente qualquer build com agentes — o Luna é significativamente mais barato do que o modelo que o teste coroou como a escolha económica. Até o Terra, a $2.50/$15, fica a um erro de arredondamento do Grok no input.

Como é que o teste inverteu isto? Quase de certeza por ter comparado o Grok com o Sol e ter ficado por aí. Contra os $5/$30 do Sol, claro, o Grok parece barato. Mas isso é comparar o modelo económico com o topo de gama do concorrente e declarar uma vitória de preço, o que é como dizer que um Civic é mais barato do que um 911 e concluir que a Honda é a marca de bom valor. Comparem tier com tier e a história vira ao contrário.

A verdadeira vantagem de preço do Grok está noutro sítio, e é real — só que não é a tarifa de tabela:

  • Input em cache a $0.50/M (um desconto de 75%) — forte se estiverem a martelar o mesmo contexto repetidamente.
  • Até $175/mês em créditos de API gratuitos através do programa de partilha de dados da xAI, o free tier mais generoso que qualquer grande fornecedor oferece neste momento.
  • Eficiência de tokens. Esta é a que interessa mesmo e a que ninguém põe num gráfico. A xAI reportou que o Grok 4.5 usa cerca de 4.2x menos tokens de output do que o Opus 4.8 em tarefas longas de programação — cerca de 15 954 tokens médios de output por tarefa contra 67 020. A tarifa de tabela é a taxa de imposto. A contagem de tokens é o rendimento. Um modelo nominalmente mais caro por token pode perder para um que simplesmente diz menos.

Há um senão nos créditos gratuitos que vale a pena conhecer antes de se entusiasmarem: é um programa de partilha de dados. O vosso tráfego treina o modelo deles. Para um jogo descartável em Three.js, quem quer saber. Para trabalho de cliente sob NDA, isso é uma conversa com o departamento jurídico, não um almoço grátis.

E a janela de contexto do Grok foi na direção errada — 500K, abaixo do 1M da geração anterior. Há relatos de que a xAI está a expandir de volta para 1M, mas arquitetem para 500K, porque é isso que existe hoje.

Portanto: o input mais barato é o Luna. O custo efetivo mais barato em trabalho agentic verboso é provavelmente o Grok, quando a eficiência de tokens começa a compor. O mais barato para contexto idêntico repetido é o Grok com caching. "O mais barato" nunca foi um número único, e o teste achatou três perguntas diferentes numa única resposta errada.

O que nos leva à parte mais interessante desta experiência — a parte que eu acho que acertou.

Porque é que construir um jogo expõe o que os benchmarks escondem

A primeira página de resultados para esta comparação é uma parede de números de SWE-bench Pro e Terminal-Bench. Aqui está o estado das coisas tal como reportado, e digo já que estes são em grande parte números dos fornecedores em harnesses dos fornecedores, o que significa que devem ser tratados como marketing com uma secção de metodologia:

Benchmark Fable 5 Grok 4.5 GPT-5.6
SWE-Bench Pro ~80.4% ~64.7% ~58.6% (5.5)
Terminal-Bench 2.1 ~84% ~83.3% ~91.9% (Sol, modo ultra)

Olhem para essa tabela e tentem responder à pergunta que realmente têm: qual deles faz um anúncio melhor?

Não conseguem. Nada ali mede isso. O SWE-bench pergunta se um modelo consegue resolver um issue real do GitHub. O Terminal-Bench pergunta se consegue planear e conduzir uma shell. Ambos são genuinamente úteis e ambos são completamente omissos sobre se um modelo sabe que um pôr do sol precisa de rim light quente, que o chanfro de um iPhone apanha um brilho especular ao longo de uma aresta, ou que um mundo sem som ambiente parece morto mesmo quando todas as mecânicas funcionam.

Esse é o argumento a favor do teste criativo, e é por isso que acho que o criador estava atrás de algo real. Um clone de GTA em Three.js é um prompt único brutal. Exige, em simultâneo: raciocínio espacial 3D, física, gestão de estado para um sistema de nível de procurado, um render loop que não colapsa e bom gosto. Falhem uma única destas coisas e nota-se em cerca de quatro segundos de vídeo. Não há crédito parcial e não há maneira de disfarçar no texto. Um benchmark dá-vos uma percentagem. Um build jogável dá-vos um veredito que se pode ver.

Eis o que foi observado nos três briefings, reportado como observação — não como medição minha:

O mundo aberto ao estilo GTA. O Metro Rush do Grok tinha o esqueleto — carros, polícia, um nível de procurado — mas corria com lag e parecia incompleto. O Neon Burrow do GPT-5.6 entregou um mundo aberto genuinamente estável com mecânicas de andar/conduzir e um sistema de procurado de cinco estrelas; limpo e jogável, sem iluminação dinâmica de ambiente. A Apex City do Fable levou a melhor na atmosfera — iluminação dinâmica de pôr do sol, melhor condução dos carros, um mundo que parecia habitado — a um custo de recursos mais pesado e com apenas um sistema de procurado de duas estrelas.

Releiam esse último par, porque é aí que está a pista. O Fable entregou melhor luz e menos funcionalidades. O GPT-5.6 entregou mais sistema e luz mais plana. Isso não é um modelo a ser mais inteligente. São dois modelos a fazer apostas diferentes sobre o que "constrói um jogo ao estilo GTA" significa quando o briefing não o diz. O Fable otimizou para a screenshot; o GPT-5.6 otimizou para a especificação. Ambas defensáveis. Nenhuma é um resultado de benchmark.

O clone de Minecraft. O Vauilcraft do Grok parecia correto e era oco — mobs presentes mas limitados, sem água. O GPT-5.6 acertou em cheio no core loop: andar, cortar árvores, um sistema de meteorologia funcional com controlo de chuva em tempo real. O Fable foi o único que entregou som — mobs a reagir de forma audível, além de água e areia.

O som é o resultado adormecido de todo o teste. Nenhum briefing dizia "adiciona áudio". Todas as grelhas de avaliação de todos os evals de modelos que já vi o ignoram. E é a única coisa que mais separa "demo técnica" de "jogo" nos primeiros três segundos. Se querem saber o que um modelo acredita que é o trabalho, olhem para o que ele faz quando ninguém pediu.

O anúncio do iPhone. O Grok distorceu o corpo e alterou a forma da porta — uma tentativa razoável, não um anúncio da Apple. O GPT-5.6 chegou perto: lente e corpo fielmente replicados, frames sincronizados, reconhecível como a coisa real. O Fable produziu reflexos, iluminação e materiais que parecem trabalho de estúdio de motion.

Padrão consistente nos três: o Fable ganha em fidelidade, o GPT-5.6 ganha em mecânicas e estabilidade, o Grok dá-vos uma fundação sobre a qual iterar. É uma conclusão coerente. Bate certo com a reputação geral dos modelos. E vale exatamente tanto quanto a vossa confiança em quatro desconhecidos — prompts, número de iterações, nível de esforço e custo — nenhum dos quais foi divulgado.

Sobretudo esse último.

O número que o teste nunca vos mostrou

Cada um daqueles builds tem uma fatura associada e nenhuma delas foi mencionada. Deixem-me então fazer a aritmética que a demo saltou, porque muda o veredito.

Peguem num build criativo single-shot realista: um jogo Three.js complexo a partir de um briefing detalhado. Digamos 15K tokens de input (briefing, contexto, talvez algum código de referência) e 40K de output (um build grande num ficheiro único mais o raciocínio). Aproximado, mas direcionalmente honesto.

Modelo Input (15K) Output (40K) Por build
GPT-5.6 Luna $0.015 $0.24 ~$0.26
Grok 4.5 $0.03 $0.24 ~$0.27
GPT-5.6 Terra $0.038 $0.60 ~$0.64
GPT-5.6 Sol $0.075 $1.20 ~$1.28
Claude Fable 5 $0.15 $2.00 ~$2.15

O Fable 5 custa cerca de 8x o que o Luna custa pelo mesmo build. E aqui está o que a demo não pode mostrar: ninguém obtém o clone de GTA num único shot. Nem o Fable, nem ninguém. O verdadeiro trabalho criativo é iterativo — constrói-se, olha-se, diz-se "a iluminação está plana", vai-se de novo. Multipliquem aquela tabela por oito iterações e os $2.15 por build do Fable tornam-se $17, enquanto os do Luna ficam em $2.

Agora acrescentem o que eu aprendi da maneira cara: o nível de esforço é um multiplicador de tokens, não um escalão de preços. A tarifa por token do Fable 5 é fixa em $10/$50, independentemente do esforço. O que o esforço muda é quantos tokens ele queima a pensar antes de responder — e cada um desses tokens de raciocínio é faturado como output, na classe de tokens mais cara que a Anthropic vende. Liguem o max numa tarefa que não precisava dele e estão a pagar $50/M por raciocínio que deitaram fora. É assim que uma única tarefa chega aos $22.

O conselho do vídeo é correr o Fable em "extra ou max" para builds complexos. Pondo de parte o facto de esses dois não serem ambos valores reais — esse conselho, aplicado por alguém que acabou de ver uma demo entusiasmante, é como se acorda com uma fatura que não se orçamentou. A própria documentação da Anthropic nota que os níveis de esforço mais baixos do Fable 5 excedem frequentemente o desempenho xhigh de modelos anteriores. max por defeito não é uma estratégia de qualidade. É um imposto que se paga voluntariamente.

Portanto, a leitura honesta de custos: a vitória do Fable em fidelidade é real e é cara, e se vale 8x depende inteiramente de o output ir parar a um cliente ou morrer na vossa pasta de downloads. O teste declarou um vencedor numa dimensão em que o preço não era uma variável. O preço é sempre uma variável.

Se quiserem a versão alavanca a alavanca de como baixar essa fatura sem descer para um modelo mais burro, as cinco mudanças que cortaram os meus custos de Fable 5 até 80% é o artigo para onde vos apontaria primeiro.

E o deployment — o @Sites decide a questão?

O teste dá aqui uma vantagem real ao GPT-5.6 e acho que é a conclusão mais subvalorizada de todo o exercício.

O @Sites significa que o Codex consegue construir um jogo em Three.js, alojá-lo e devolver um URL ao vivo, partilhável — sem conta de hosting, sem pipeline de deploy, sem ticket de DevOps. Corre em infraestrutura da OpenAI com tecnologia compatível com Cloudflare Workers. Para trabalho criativo, esse ciclo é genuinamente diferente: prompt → link jogável que se pode enviar a alguém. O ciclo de feedback encolhe de horas para minutos.

Isso não é uma capacidade do modelo. É uma capacidade de produto, e vale a pena ser preciso na distinção, porque é a coisa com mais probabilidade de decidir a vossa escolha real. O Fable 5 pode renderizar um pôr do sol melhor. Se o GPT-5.6 coloca o vosso build à frente de um cliente em noventa segundos enquanto vocês ainda estão a decidir onde alojar a obra-prima do Fable, o pôr do sol melhor perdeu.

A realidade do acesso à data de julho de 2026: disponibilidade geral para subscritores pagos do ChatGPT com sites visíveis publicamente; preview para Business e Enterprise, ligado por defeito no Business, controlado por administradores via RBAC no Enterprise. "Visíveis publicamente" está a fazer trabalho silencioso nessa frase — verifiquem antes de fazerem deploy de material de cliente.

Do lado da Anthropic, o Cowork cobre a metade do fluxo de trabalho — acesso a ficheiros, execução multi-passo, conectores MCP, plugins, agora com paridade total no Windows e tarefas na cloud a partir do telemóvel. Tenho corrido nele a minha própria pipeline de briefing matinal e escrevi sobre o que realmente funciona e o que se parte na atualização cloud do Cowork. É um sistema de trabalho forte. Não é um alvo de deploy público de um comando, e fingir que essas duas coisas são a mesma funcionalidade não ajuda ninguém.

GPT-5.6 vs Grok 4.5 vs Fable 5: qual deveriam realmente usar?

Não há um vencedor universal — o teste acertou nessa parte, mesmo que lá tenha chegado em parte por sorte. Aqui está o quadro que eu aplicaria de facto, com o preço incluído:

Peguem no GPT-5.6 Luna quando estão a iterar. Exploração inicial, protótipos descartáveis, doze variações da mesma cena. A ~$0.26 por build, é a maneira mais barata de descobrir se a vossa ideia presta. É também — repita-se — mais barato no input do que o modelo que aquele teste chamou de mais barato.

Peguem no GPT-5.6 Terra quando é trabalho a sério com um orçamento. O cavalo de batalha do dia a dia, competitivo com o GPT-5.5 a metade do custo, e o default de onde eu partiria para a maioria das cargas de produção. Subam de tier apenas quando conseguirem nomear aquilo em que o Terra falhou.

Peguem no GPT-5.6 Sol quando precisam de mecânicas que se aguentam e de um deploy no fim. A melhor combinação de estabilidade mais entrega do teste, ~91.9% no Terminal-Bench 2.1 via subagentes paralelos do modo ultra, e o @Sites fecha o ciclo. Cerca de um terço do custo do Fable.

Peguem no Grok 4.5 quando o trabalho é verboso e repetitivo — execuções longas de agentes, contexto em cache, o tipo de coisa em que a eficiência de tokens compõe. A sua eficiência de 4.2x em tokens de output faz mais pela vossa fatura do que qualquer tarifa de tabela. Só planeiem para 500K de contexto e leiam os termos de partilha de dados.

Peguem no Fable 5 quando o output é o produto. Material virado para o cliente, nível de portefólio, o anúncio que tem de parecer feito por um estúdio. Quando a qualidade máxima bate genuinamente o preço — e sejam honestos sobre a frequência com que isso é verdade. Depois corram-no primeiro em medium ou high e obriguem-no a provar que precisa de mais.

A jogada meta, e a que me tem servido melhor do que qualquer lealdade a um único modelo: iterar barato, terminar caro. Encontrem a ideia no Luna. Construam a estrutura no Terra ou no Sol. Se vai ser entregue a alguém que está a pagar, corram a passagem final no Fable. O enquadramento do teste — escolham o vosso lutador, um ganha — tem a forma errada para o modo como este trabalho realmente se faz. Não estão a escolher um modelo. Estão a escolher um modelo por fase, e a fase em que precisam de tokens de output a $50/M é normalmente a última.

O que eu precisaria de ver antes de confiar em qualquer parte disto

Deixem-me apontar o ceticismo também à minha própria análise, já que passei 2 000 palavras a apontá-lo à de outra pessoa.

Tudo o que está acima assenta em observações que eu não fiz. Quatro divulgações mudariam a minha leitura e, até existirem, calibrem em conformidade:

  1. Os prompts exatos. Um modelo que "perdeu" com um briefing vago pode simplesmente tê-lo interpretado de forma diferente. O sistema de procurado de duas estrelas do Fable contra as cinco estrelas do GPT não é obviamente uma lacuna de capacidade — pode ser uma lacuna de leitura do prompt.
  2. O número de iterações. One-shot contra melhor-de-cinco é uma afirmação completamente diferente. Se o pôr do sol do Fable levou quatro tentativas e a iluminação plana do GPT levou uma, o ranking inverte-se em qualquer eixo que inclua o vosso tempo.
  3. O nível de esforço. Se o Fable correu em max e o GPT-5.6 no default, isso não é uma comparação de modelos. É uma comparação de configurações com um título de comparação de modelos.
  4. A fatura de tokens por build. Sem ela, "o Fable ganha" significa "o Fable ganha a um custo desconhecido", o que não é uma conclusão. É uma preferência.

Também quereria uma repetição com um briefing fresco. Todos os modelos desta classe foram treinados com um planeta inteiro de clones de Minecraft, discussões sobre GTA e frames de anúncios da Apple. "Constrói um clone de Minecraft" está muito perto de ser uma sonda de memorização. Peçam um jogo que não existe — uma mecânica qualquer sem resposta no Stack Overflow — e suspeito que as diferenças fiquem com outro aspeto. Possivelmente muito menores. Possivelmente muito maiores. Esse é o teste que eu quereria mesmo ver, e é o que eu teria de construir eu próprio antes de pôr o meu nome num veredito.

A comparação criativa a três em que eu confiaria ainda não foi feita. Esta é um bom esboço dela.

A parte que vale a pena levar convosco

Voltem ao ponto onde começámos: o modelo que ganhou não existia, e o ranking de preços também não.

Isto não é um tiro contra um criador. É a textura de todo este momento. Agora saem modelos todas as semanas. Os nomes esbatem-se. Uma demo é recortada, o recorte ganha um título, o título ganha uma alcunha, e três semanas depois há pessoas a escolher infraestrutura com base numa cadeia de telefone estragado que começou com alguém a avaliar um pôr do sol a olho. O teste criativo por baixo era uma ideia genuinamente boa — melhor do que as tabelas de benchmarks com que compete, porque mediu o gosto, e o gosto é a coisa que os benchmarks estruturalmente não conseguem ver. Só foi publicado sem os quatro números que fariam dele uma conclusão em vez de uma vibe.

Portanto, aqui está o que vos pediria mesmo para fazer, e leva dez minutos. Antes da vossa próxima decisão de modelo, abram a página de preços — a verdadeira, a do fornecedor — e escrevam a tarifa de input, a tarifa de output e a janela de contexto de todos os modelos que estão a considerar. Tier com tier. Não topo de gama contra económico. Depois perguntem de que é que o vosso trabalho é realmente feito: é pesado em input ou em output? Iterativo ou one-shot? Vai para um cliente ou morre na vossa pasta de downloads?

Dez minutos disso valem mais do que dez horas de demos. Teriam apanhado a questão do Luna instantaneamente.

Os modelos são extraordinários. Os três. O clone de GTA num único prompt teria sido ficção científica há dezoito meses e agora já nos aborrece. Mas o fosso entre "isto é incrível" e "isto é o que devo correr na terça-feira" está preenchido inteiramente com aritmética, e ninguém está a recortar essa parte para o YouTube.

Façam a aritmética. É a única parte disto que é realmente vossa.

GPT-5.6 vs Grok 4.5 vs Fable 5: Respostas Rápidas

Qual é mais barato, o Grok 4.5 ou o GPT-5.6?

O GPT-5.6 Luna é mais barato no input, a $1 por milhão de tokens contra os $2 do Grok 4.5, e ambos custam $6 por milhão no output. A verdadeira vantagem do Grok é a eficiência de tokens — cerca de 4.2x menos tokens de output em tarefas longas — mais input em cache a $0.50/M. Vejam a secção de preços acima para as contas tier a tier.

Quais são os três modelos GPT-5.6?

O GPT-5.6 chega em três tiers: Sol ($5/$30 por 1M de tokens, raciocínio topo de gama), Terra ($2.50/$15, o cavalo de batalha equilibrado) e Luna ($1/$6, rápido e económico). Os três entraram em disponibilidade geral a 9 de julho de 2026 com janelas de contexto de 1M de tokens.

O Claude Fable 5 vale o preço para trabalho criativo?

O Fable 5 custa cerca de 8x o GPT-5.6 Luna por build ($10/$50 por 1M de tokens), e os testes observados dão-lhe vantagem em fidelidade visual, iluminação e áudio. Vale a pena quando o output vai para um cliente — não para iterar. Corram com esforço medium ou high antes de recorrerem ao max.

Quais são os níveis de esforço do Claude Fable 5?

A API aceita exatamente cinco valores: low, medium, high, xhigh e max. O esforço não é um escalão de preços — a tarifa de $10/$50 é fixa. Esforço mais alto queima mais tokens de raciocínio, todos faturados como output, e é assim que uma única tarefa chega aos $22.

O GPT-5.6 consegue fazer o deploy de um jogo para um URL ao vivo?

Sim — o plugin @Sites do Codex (não um comando /sites) constrói, aloja e devolve um URL partilhável em infraestrutura da OpenAI. Está em disponibilidade geral para subscritores pagos do ChatGPT com sites visíveis publicamente, e em preview para workspaces Business e Enterprise.

A Parte Que Vale a Pena Levar Convosco

Retirem o teatro dos leaderboards e uma coisa fica de pé: os três modelos são extraordinários, e o verdadeiro diferenciador não é qual ganha um benchmark — é qual justifica o seu custo no trabalho que realmente fazem. Um build de um jogo expõe o que uma folha de especificações esconde, e o ranking de custos virou-se exatamente onde vivia a confusão de nomes.

Portanto, corram o vosso próprio teste na vossa própria tarefa antes de confiarem em qualquer comparação, incluindo a minha. O modelo que ganha no vosso trabalho é o único ranking que paga as vossas contas.

Se quiserem ajuda a escolher e a integrar o modelo certo num produto real, é algo que faço através da Ramlit. O teste criativo acima é a minha tentativa honesta de cortar através dos nomes.

Publicidade
Coffee cup

Gostou deste artigo?

Seu apoio me ajuda a criar mais conteúdo técnico aprofundado, ferramentas open-source e recursos gratuitos para a comunidade de desenvolvedores.

Tópicos Relacionados

Engr Mejba Ahmed

Engr Mejba Ahmed

Engr. Mejba Ahmed builds AI-powered applications and secure cloud systems for businesses worldwide. With 8+ years shipping production software in Laravel, Python, and AWS, he's helped companies automate workflows, reduce infrastructure costs, and scale without security headaches. He writes about practical AI integration, cloud architecture, and developer productivity.

Artigos Relacionados

Ver Todos

Comments

Leave a Comment

Comments are moderated before appearing.

Learning Resources

Expand Your Knowledge

Accelerate your growth with structured courses, verified certificates, interactive flashcards, and production-ready AI agent skills.

Sample Certificate of Completion

Sample certificate — complete any course to earn yours

Engr Mejba Ahmed

Engr Mejba Ahmed

AI assistant · trained on my work

👋

Hey there!

Quick Actions

WhatsApp Direct line to me

Chat on WhatsApp

+880 1723 741224 · Replies within the hour on working days

Popular Questions

Engr Mejba Ahmed is connected
Engr Mejba Ahmed is typing...
Engr Mejba Ahmed avatar

✉ Want me to follow up? Drop your email

Engr Mejba Ahmed avatar

📞 Connect Directly

Choose how you'd like to reach me

WhatsApp

+880 1723 741224

Email

mejba.13@gmail.com

✓ Details sent! I'll get back to you shortly.

Powered by OpenAI

335+

Blog Posts

25

AI Courses

63

Projects

Services & Expertise

Pricing & Process

Learning & Resources

Connect & Support