Análise do Grok 4.5: um modelo de trabalho diário barato e rápido para programar
O número que me fez parar não foi um benchmark. Foi uma contagem de tokens.
A xAI lançou o Grok 4.5 a 8 de julho de 2026, e a minha primeira reação foi a mesma que tenho todas as semanas: mais um modelo ponto-qualquer-coisa, mais uma captura de ecrã de um leaderboard, provavelmente nada de especial. Estava a meio de uma execução de agente com o Opus 4.8 — daquelas que queimam silenciosamente milhões de tokens enquanto finjo não estar a olhar para o contador — e quase deslizei o anúncio para o lado.
Foi então que vi o valor de eficiência. A xAI reportou que o Grok 4.5 usa cerca de 4,2x menos tokens de saída do que o Opus 4.8 em tarefas longas de programação — aproximadamente 15.954 tokens de saída em média por tarefa contra 67.020 do Opus 4.8 nas definições máximas. Isso não é uma diferença de arredondamento. É a diferença entre uma fatura que me faz estremecer e uma fatura de que me esqueço.
Eu corro modelos profissionalmente. Não no sentido de "li a documentação" — quero dizer que tenho pipelines de agentes multi-modelo a entregar código real quase todos os dias, e sinto cada alteração de preço na minha fatura mensal. Por isso, um modelo que chega perto da fronteira da programação custando $2 por milhão de tokens de entrada captou a minha atenção mais depressa do que qualquer gráfico de benchmarks conseguiria. Deixem-me ser franco sobre uma coisa antes de continuarmos: ainda não passei um mês inteiro com o Grok 4.5. O que se segue é uma primeira análise construída com os dados do lançamento, as demonstrações públicas e — a parte de que posso falar em primeira mão — exatamente como encaixaria um modelo destes numa stack que já uso todos os dias.
Porque é que um modelo de programação barato e eficiente importa mais do que um mais inteligente neste momento
Ninguém vos diz isto quando passam de "conversar com um modelo" para "correr agentes que escrevem código": o modelo mais inteligente quase nunca é o que devem usar a maior parte do tempo.
Aprendi isto da forma mais cara. Durante uma temporada nesta primavera, encaminhei quase tudo pelo modelo mais forte a que tinha acesso, porque porque não usar o melhor? Depois fiz as contas a uma única semana de trabalho agêntico — tarefas de vários passos, imensas chamadas de ferramentas, contexto longo, o modelo a reler ficheiros e a replanear em cada iteração. Os totais de tokens eram absurdos. Os agentes de programação de fronteira consomem rotineiramente milhões de tokens por tarefa não trivial, quando se conta todo o raciocínio e o tráfego de ferramentas. Uma comparação reportada apontou para cerca de 1,9M de tokens totais numa tarefa agêntica completa de programação com o Grok 4.5, contra aproximadamente 6–7M para os modelos de fronteira mais caros nos respetivos harnesses. Multipliquem isso por um dia de trabalho e a estratégia "usar sempre o melhor" deixa de ser uma estratégia e passa a ser uma fuga de dinheiro.
É exatamente nessa lacuna que o Grok 4.5 foi construído para se posicionar. Não como "o modelo mais inteligente da sala". Como o eficiente — o cavalo de trabalho que se pode deixar a correr sem vigiar o contador, suficientemente rápido para nos manter em fluxo e suficientemente barato para deixarmos de o racionar.
E "suficientemente rápido para manter o fluxo" não é um benefício menor. Quando um modelo transmite a passo de caracol, mudamos de contexto. Fazemos alt-tab. Perdemos o fio à meada. O Grok 4.5 é servido a cerca de 80 tokens por segundo — o escalão de "modelo rápido" da xAI — e testadores independentes cronometraram o primeiro token a chegar em menos de meio segundo em comparações diretas. Essa capacidade de resposta muda a sensação de trabalhar com ele, de uma forma que uma tabela estática de benchmarks nunca vai captar.
Mas antes de falar de onde ele encaixa, deixem-me ser preciso sobre o que foi realmente lançado — porque os detalhes do lançamento importam, e alguns deles são genuinamente surpreendentes.
Por dentro da ficha técnica do Grok 4.5 — e o seu novo emblema SpaceXAI
Uma nota de marca antes de mais, porque confunde genuinamente as pessoas: o Grok 4.5 vem da xAI — mas a xAI já não é uma empresa independente. A SpaceX adquiriu-a num negócio totalmente em ações concluído em fevereiro de 2026 e, a 6 de julho de 2026 — dois dias antes deste lançamento —, a empresa mudou oficialmente de nome para SpaceXAI. Portanto, se viram o Grok 4.5 atribuído à SpaceX, isso agora está correto, não é um engano. O antigo enquadramento "a xAI é uma empresa separada" ficou desatualizado com este lançamento.
Eis a ficha técnica confirmada à data do lançamento de julho de 2026:
- Concebido de raiz para programação e agentes. A xAI descreve o Grok 4.5 como o seu modelo mais inteligente para programação, tarefas agênticas e trabalho de conhecimento — e, curiosamente, foi co-treinado com o Cursor em dados reais de interação entre programadores e agentes. É um modelo mixture-of-experts treinado em programação, ciência, engenharia e matemática, com o objetivo declarado de resolver problemas práticos de engenharia em vez de perseguir apenas posições em leaderboards.
- Preços: aproximadamente $2 por milhão de tokens de entrada e $6 por milhão de tokens de saída, com entrada em cache reportada a cerca de $0,50/M. Para contexto, isto fica muito abaixo dos modelos de programação de topo da fronteira.
- Janela de contexto: 500K tokens. Aqui está a surpresa — é na verdade mais pequena do que a janela de 1M da geração anterior. Há relatos de que a xAI planeia voltar a expandir para 1M, mas, tal como é lançado hoje, planeiem com 500K. Trataria o "1M em breve" como um sinal de roadmap, não como algo sobre o qual arquitetar já.
- Velocidade: ~80 tokens/segundo, o escalão rápido da xAI.
- Stack completa de ferramentas modernas: function calling nativo, saída JSON estruturada, pesquisa na web, pesquisa no X e execução de código — com raciocínio elevado sempre ativo.
- Disponibilidade: a plataforma de build do Grok, a API da xAI e os planos do Cursor desde o lançamento. Um senão que vale a pena assinalar — o lançamento na UE terá ficado atrasado, chegando em meados de julho em vez do primeiro dia. Se estão a construir a partir da Europa, verifiquem o acesso antes de o integrarem no que quer que seja.
A avaliação independente sustenta o posicionamento e não o hype: a Artificial Analysis classificou o Grok 4.5 por volta do 4.º lugar entre 168 modelos no seu Intelligence Index no lançamento — perto da fronteira, a uma fração do custo por tarefa dos modelos acima dele.
Perto da fronteira. A uma fração do custo. É toda a proposta em seis palavras, e é nos benchmarks que a coisa fica interessante — e honesta.
Benchmarks do Grok 4.5: como lê-los sem se enganar a si próprio
Os benchmarks não mentem, propriamente. Apenas medem aquilo que medem, que raramente é aquilo que nos interessa. Por isso, vou dar-vos os números reportados e aquilo que cada um está realmente a testar, porque a história muda consoante o gráfico para que se olha.
Eis o que a xAI e a cobertura inicial reportaram:
| Benchmark | O que mede | Grok 4.5 (reportado) | Onde se posiciona |
|---|---|---|---|
| Terminal-Bench 2.1 | Planeamento e uso de ferramentas numa shell real | ~83,3% | Empatado com o GPT 5.5, ~1 ponto atrás do Fable 5 |
| SWE-bench Pro | Resolução de problemas reais de engenharia de software | ~64,7% | Acima do GPT 5.5, abaixo do Fable 5 (~80,4%) |
| DeepSWE 1.0 | Harness profundo de programação / agêntico | ~62% | Competitivo; lidera sobre o Opus 4.8 no harness do fornecedor |
| DeepSWE 1.1 | Execução neutra de deep research | ~53% | Fica atrás do topo do pelotão |
Leiam essa primeira linha com atenção, porque é a que mais importa para trabalho agêntico. O Terminal-Bench testa se um modelo consegue planear, iterar e coordenar ferramentas dentro de uma shell — que é exatamente aquilo de que um agente de programação autónomo vive ou morre. Uma pontuação de 83,3%, ombro a ombro com o GPT 5.5 e a um ponto do Fable 5, não é um resultado de brincadeira. É um modelo que consegue realmente conduzir um loop de agente, não apenas autocompletar uma função.
O número do SWE-bench Pro conta a outra metade da história. Com ~64,7%, bate o GPT 5.5 mas fica atrás dos ~80,4% reportados do Fable 5 por uma margem real. Portanto, nas tarefas mais difíceis de resolução de problemas de ponta a ponta, o Grok 4.5 é bom — genuinamente bom — mas não é o modelo a quem entregar o vosso problema mais espinhoso e ambíguo, do tipo "ninguém percebe totalmente este módulo legado".
E essa divisão é o verdadeiro insight. O Grok 4.5 agrupa-se com o GPT 5.5 na execução agêntica, fica um degrau abaixo do Fable 5 em profundidade bruta de resolução de problemas, e fica dramaticamente abaixo de ambos em custo e gasto de tokens. Não está a ganhar o troféu de "modelo mais inteligente". Nunca foi essa a intenção.
Onde os benchmarks silenciam é onde as demos falam alto — por isso, vejamos o que ele realmente constrói.
Demos de programação do Grok 4.5: onde brilha, onde tropeça
Os números dizem-nos o teto de um modelo. As demos dizem-nos a sua personalidade — onde está confiante, onde tropeça, o que claramente viu em abundância durante o treino. As demonstrações públicas em torno do lançamento pintaram um retrato nítido e consistente, e vou assinalar em que partes confiaria e quais verificaria pessoalmente antes de depender delas.
Onde pareceu genuinamente forte:
- Um clone do macOS — barra de menus superior, calendário, wallpapers, um Launchpad funcional e animações da dock. A demo mostrou ícones SVG limpos e coerentes do início ao fim, o que é mais difícil do que parece. Sistemas de ícones são onde modelos inferiores produzem papa.
- Uma landing page SaaS de gama alta num único ficheiro HTML — React 18 com GSAP e ScrollTrigger para animação de scroll, gerada de uma só vez. Este é o ponto ideal: frontend moderno, biblioteca de animação real, layout coeso.
- Trabalho em SVG como ponto forte destacado — uma borboleta detalhada, uma "pintura" em SVG e uma lâmpada de lava animada em CSS. Trabalho vetorial escrito à mão é um indicador real da qualidade de um modelo, e o Grok 4.5 terá acertado em cheio, com resultados legíveis e coloridos.
- Um renderizador de ray tracing em WebGL com nevoeiro atmosférico e um céu procedural, além de uma cena low-poly ao estilo Zelda: Breath of the Wild que foi, segundo o apresentador, um dos pontos altos de toda a sessão.
- Um clone ao estilo Minecraft com crafting, blocos, ferramentas e mobs — classificado aproximadamente em terceiro lugar entre os modelos testados, portanto: competente, não líder da categoria.
Onde teve dificuldades visíveis:
- Um sistema solar em 3D saiu fraco — uma falha real, e exatamente o tipo de problema de escala espacial astrofísica em que estes modelos tendem a falhar.
- Uma cena de drift de F1 a fazer donuts ficou-se por uns 6/10 — a física era imperfeita. Movimento que tem de parecer certo continua a ser um ponto fraco.
Notam o padrão? O Grok 4.5 é excelente em composição de UI frontend, SVG e layout de cenas 3D, e visivelmente mais fraco em simulação com física pesada e visualizações astrofísicas complexas. Não é uma distribuição aleatória. Alinha na perfeição com um modelo co-treinado com o Cursor que viu volumes enormes de trabalho real de frontend e construção de aplicações. Constrói interfaces como se tivesse crescido a fazê-lo, e aproxima a física como se tivesse lido sobre ela.
Isto corresponde quase exatamente ao que encontrei ao passar o GPT 5.5 por builds reais semelhantes — o frontend e o SVG acertam, a física vacila. Se quiserem a versão mais aprofundada desse padrão de testes, escrevi as execuções completas na minha análise prática do GPT 5.5 Codex, e a mesma regra "confia na UI, verifica a física" aplica-se aqui.
Então, onde é que um modelo destes realmente ganha o seu lugar? Para mim, a resposta não é "usá-lo para tudo". É mais cirúrgica do que isso.
Onde encaixa o Grok 4.5: o modelo de trabalho diário numa stack multi-modelo
Eu não uso um único modelo. Ninguém sério o faz hoje em dia. Uso uma pequena frota, e o jogo todo consiste em encaminhar a tarefa certa para o modelo certo ao custo certo. Se alguma vez se perguntaram porque é que a vossa fatura de IA dispara, é quase sempre porque estão a enviar tarefas baratas para modelos caros por hábito.
Eis o modelo mental que uso, e onde o Grok 4.5 se encaixa:
Nível 1 — o modelo de trabalho diário. O modelo que trata do grosso do volume: scaffolding, componentes de frontend, CRUD, refactors, boilerplate, o ciclo de iteração rápida em que o vamos correr cinquenta vezes. Este nível precisa de ser rápido, barato e eficiente muito mais do que precisa de ser a coisa mais inteligente à face da Terra. É exatamente o lugar para que o Grok 4.5 foi construído — e é o lugar que eu antes preencheria com um modelo intermédio como o Sonnet 5. Em eficiência e preço, o Grok 4.5 apresenta argumentos fortes para ficar com esse lugar de imediato.
Nível 2 — o peso-pesado. O modelo que se reserva para os problemas genuinamente difíceis: a decisão de arquitetura ambígua, o bug subtil de concorrência, o refactor do tipo "isto toca em quarenta ficheiros e não percebo totalmente porquê". É aqui que mantenho o Fable 5 ou o Opus 4.8, porque o SWE-bench Pro está a dizer a verdade neste ponto — a diferença de profundidade é real, e nos 20% difíceis queremos o modelo que resolve mais problemas, não o mais barato.
A jogada de orquestração consiste em pôr o Nível 1 a fazer o volume e só escalar para o Nível 2 quando o Nível 1 empanca ou a tarefa é sinalizada como difícil desde o início. Bem feito, obtém-se a maior parte da qualidade da fronteira a uma fração do custo da fronteira — porque deixámos de pagar preços premium por boilerplate. Analisei a economia deste exato padrão de encaminhamento no meu guia de otimização de custos de agentes de IA, e o Grok 4.5 está perto de ser uma atualização direta para o nível de trabalho diário nesse framework.
O que torna o Grok 4.5 especificamente atrativo para o Nível 1 não é só o preço de tabela — é a eficiência de tokens a compor por cima dele. Um modelo mais barato por token que também usa menos tokens para terminar uma tarefa poupa-nos duas vezes. Aquela redução de 4,2x nos tokens de saída face ao Opus 4.8 é onde vive a verdadeira poupança, porque em tarefas agênticas longas são os tokens de saída e de raciocínio que realmente esvaziam a conta.
Se preferirem não arquitetar este encaminhamento por vossa conta — ou quiserem uma stack de agentes multi-modelo construída, afinada e entregue à vossa equipa para não serem vocês a vigiar contadores de tokens — contactem-me se for um trabalho que preferem delegar em vez de montar sozinhos. O meu trabalho para clientes está aqui.
Este é o cenário otimista. Agora deixem-me argumentar contra mim próprio, porque uma primeira análise que só lista pontos fortes é marketing, não é uma review.
As limitações honestas que eu ponderaria antes de me comprometer
Quero gostar do Grok 4.5 mais do que quero ter razão sobre ele — e é exatamente por isso que tenho de ser cuidadoso aqui. Há algumas coisas que temperam o meu entusiasmo.
A janela de contexto andou para trás. 500K é muito, mas é metade do que a geração anterior oferecia, e se construíram workflows que dependem de enfiar bases de código enormes num único contexto, isso é uma regressão real com que contar. O reportado "1M em breve" é encorajador, mas eu não arquiteto sobre roadmaps. Arquiteto sobre o que foi lançado. Para trabalho em grandes monorepos hoje, esse teto de 500K é uma limitação genuína — e se quiserem o contraexemplo de apostar a fundo numa janela de um milhão de tokens, cobri esse trade-off no meu artigo sobre o Opus e o contexto de um milhão de tokens.
A fraqueza na física não é cosmética. Se o vosso trabalho envolve simulação, física de jogos, visualização científica ou qualquer coisa em que o movimento e a precisão espacial tenham de estar corretos em vez de plausíveis, as demos são um aviso. O Grok 4.5 compõe cenas belíssimas e depois atrapalha-se com a física dentro delas. Saibam de que lado dessa linha está o vosso trabalho.
O atraso do lançamento na UE é um obstáculo operacional real. Um lançamento em meados de julho para a Europa significa que, se estão a construir lá e contavam com disponibilidade no primeiro dia, podem ter batido numa parede. Verifiquem sempre o acesso regional antes de comprometerem uma dependência de produção com um modelo acabado de sair.
Os benchmarks são os benchmarks do fornecedor. A maioria dos números mais chamativos aqui remonta aos relatórios da própria xAI ou à cobertura da janela de lançamento. A classificação independente da Artificial Analysis é tranquilizadora, mas eu correria na mesma as minhas três ou quatro tarefas representativas antes de confiar em qualquer coisa disto com trabalho real. Não é ceticismo sobre o Grok em particular — é simplesmente como trato hoje todos os lançamentos. Os números levam-nos até "vale a pena testar", não até "liga-o à produção".
Nenhuma destas questões é impeditiva para o papel de modelo de trabalho diário. São guardas de segurança. E, honestamente, um modelo que é claro quanto a ser o cavalo de trabalho eficiente em vez do génio mais inteligente é mais fácil de confiar do que um que se vende em excesso, porque sabemos exatamente onde estão os seus limites.
Então, como saberiam realmente se está a funcionar para vocês? Deixem-me tornar isso concreto.
Como testar se o Grok 4.5 merece um lugar na vossa stack
Não aceitem o meu enquadramento — nem a demo de ninguém — como um ato de fé. Eis a forma honesta e barata de descobrir se o Grok 4.5 merece um lugar, numa tarde:
- Escolham três tarefas reais cuja resposta já conhecem. Uma build de frontend, uma correção de bug de dificuldade média, uma coisa em que esperam que ele tenha dificuldades (física, um refactor complicado). Tarefas com resposta conhecida são as únicas que nos dizem a verdade.
- Vigiem dois números, não um. Registem o total de tokens e o tempo de relógio até um resultado funcional — não apenas se terminou. Toda a tese do Grok 4.5 é a eficiência, por isso, se não for visivelmente mais barato e mais rápido do que o vosso atual modelo diário na mesma tarefa, a tese falha para a vossa carga de trabalho.
- Empurrem-no de propósito para fora da zona de conforto. Entreguem-lhe deliberadamente a tarefa pesada em física. Não estão a tentar fazê-lo ficar mal — estão a encontrar a linha exata onde precisam de escalar para um modelo mais pesado. Conhecer essa linha é o que faz o encaminhamento funcionar.
- Comparem com o vosso atual Nível 1, não com a fronteira. A pergunta certa não é "o Grok 4.5 é tão inteligente como o Fable 5?" Claramente não é. A pergunta é "faz o meu trabalho de grande volume tão bem como o meu atual modelo diário, por menos?" É a única comparação que muda a vossa fatura.
O que procuram é aborrecido da melhor maneira: qualidade de output comparável em trabalho de rotina, custo significativamente mais baixo e uma noção clara de quando escalar. Se obtiverem essas três coisas, encontraram um modelo de trabalho diário. Se a qualidade cair nas tarefas de rotina, deixem-no no banco.
Expectativa realista: para trabalho pesado em frontend e construção geral de aplicações, esperaria que o Grok 4.5 se aguentasse frente a um modelo diário intermédio custando menos em ambos os eixos. Para engenharia profunda e ambígua, contem com escalar. Isso não é uma crítica — é todo o design a funcionar como previsto.
A verdadeira conclusão
Há seis meses ter-vos-ia dito que a próxima grande novidade em IA seria um modelo maior e mais inteligente. Estaria a olhar para o eixo errado.
A história do Grok 4.5 não é sobre inteligência. É sobre a eficiência a chegar à fronteira da programação — um modelo que fica perto do topo do pelotão nos benchmarks que importam para agentes, transmite depressa o suficiente para nos manter em fluxo, e fá-lo por uma fração do gasto em tokens. Essa combinação não ganha manchetes como "o modelo mais inteligente de sempre". Mas é a combinação que realmente muda o que podemos dar-nos ao luxo de construir.
Não vou reformar o Fable 5 nem o Opus 4.8. A diferença no SWE-bench Pro é real, e os problemas difíceis continuam a ir para os pesos-pesados. O que estou a fazer é auditar cada tarefa que atualmente corre num modelo caro e fazer uma pergunta direta: isto precisa mesmo do génio, ou só precisa de ser feito depressa e barato? Para uma quantidade surpreendente do meu trabalho diário, a resposta honesta é a segunda — e é esse o lugar que o Grok 4.5 foi construído para preencher.
Vão buscar aquelas três tarefas de teste cujas respostas já conhecem. Corram-nas no Grok 4.5 esta semana e vigiem o contador de tokens, não apenas o output. Esse número — o mesmo que me fez parar logo no início — é o que vos dirá se a xAI vos acabou de entregar uma forma mais barata de entregar código.
Perguntas Frequentes
O Grok 4.5 é bom para programar?
Sim — o Grok 4.5 é um modelo de programação forte, especialmente para trabalho agêntico e de frontend. Obteve uns reportados ~83,3% no Terminal-Bench 2.1 (empatado com o GPT 5.5) e foi co-treinado com o Cursor em dados reais de interação entre programadores e agentes. Fica atrás de modelos de topo como o Fable 5 nas tarefas mais difíceis do SWE-bench Pro, pelo que encaixa melhor como modelo diário de grande volume do que como peso-pesado para os problemas mais complexos.
Quanto custa o Grok 4.5?
O Grok 4.5 tem um preço reportado de $2 por milhão de tokens de entrada e $6 por milhão de tokens de saída, com entrada em cache a cerca de $0,50 por milhão. Isso fica significativamente abaixo dos modelos de programação de topo da fronteira, e a sua eficiência de tokens (reportadamente ~4,2x menos tokens de saída do que o Opus 4.8 em tarefas longas) compõe a poupança em trabalho agêntico real.
Qual é a janela de contexto do Grok 4.5?
O Grok 4.5 é lançado com uma janela de contexto de 500K tokens. É, na verdade, mais pequena do que a janela de 1M da geração anterior — há relatos de que a xAI vai voltar a expandir para 1M, mas planeiem com 500K por agora. Para detalhes sobre porque é que uma janela de um milhão de tokens importa para grandes bases de código, vejam a minha análise acima.
O Grok 4.5 é feito pela SpaceX?
Na prática, sim. O Grok 4.5 vem da xAI, que a SpaceX adquiriu num negócio concluído em fevereiro de 2026. A 6 de julho de 2026 — dois dias antes deste lançamento — a xAI mudou oficialmente de nome para SpaceXAI, integrando-se na SpaceX. Portanto, o antigo enquadramento "a xAI e a SpaceX são empresas separadas" já não é rigoroso; o Grok 4.5 é lançado sob a marca SpaceXAI.
Devo substituir o meu modelo atual pelo Grok 4.5?
Não totalmente — a jogada inteligente é colocar o Grok 4.5 no nível de trabalho diário de uma stack multi-modelo para trabalho de grande volume, frontend e boilerplate, mantendo um modelo mais pesado como o Fable 5 ou o Opus 4.8 para os problemas de engenharia mais difíceis. Testem-no contra o vosso atual modelo diário em tarefas cujas respostas já conhecem antes de mudar.
Antes de encaminharem uma única tarefa
Se estão de olho numa configuração multi-modelo como a descrita acima — um modelo diário barato a fazer o volume, um peso-pesado de prevenção para os 20% difíceis —, a parte complicada não é escolher os modelos, é a lógica de encaminhamento e escalamento que decide que tarefa vai para onde. Desenhar e afinar essa camada de encaminhamento — para que as equipas deixem de pagar preços de fronteira por trabalho de boilerplate — é o tipo de projeto que construo de ponta a ponta. Se montar isto sozinhos não é a forma como querem passar a semana, é aqui que me encontram.