Skip to main content
Notícias de IA

Resumo de IA 14 de maio de 2026: Seis dias para o Google I/O

Vazamentos do Gemini 3.2, GPT-5.6 Ember-Alpha, a polêmica de cobrança do Claude Code, o turno autônomo de 8 horas da Figure. Minha visão de desenvolvedor a seis dias do I/O.

29 min
Tempo de leitura
5,633
Palavras
Publicado
Engr Mejba Ahmed

Escrito por

Engr Mejba Ahmed

Compartilhar Artigo

Resumo de IA 14 de maio de 2026: Seis dias para o Google I/O

São 7h14 de quinta-feira, tenho três terminais abertos, um deles está gritando comigo e meu café já está frio.

O terminal que está gritando comigo é o Claude Code. Especificamente, é o daemon que executo para um dos meus sites de marca, aquele que silenciosamente reconcilia conteúdo em quatro diretórios todas as manhãs. Duas semanas atrás, funcionava no piloto automático pelo preço de uma única assinatura Max. Desde 13 de maio, esse mesmo trabalho começou a me custar créditos reais de API além da assinatura — porque a Anthropic acabou de separar o uso programático em sua própria categoria medida. Mesmo agente. Mesmo modelo. Mesmo prompt. Conta diferente. Ainda estou fazendo as novas contas.

Em outra aba, um thread do Reddit se desenrola em tempo real sobre o app Gemini para iOS de alguém que rotacionou entre versões de modelos durante vinte e quatro horas e parou em algo chamado Gemini 3.2 Flash. Há capturas de tela. Há uma interface redesenhada com uma caixa de prompt em formato de pílula e um fundo de gradiente pulsante que ninguém pediu. O Google I/O é daqui a seis dias. Os vazamentos não são sutis.

E no meu segundo monitor, um post no X sobre os robôs Helix-02 da Figure está aberto com 14 milhões de visualizações — uma transmissão ao vivo onde humanoides completaram um turno inteiro de 8 horas em um armazém sem um único humano no processo. Trocas de bateria. Autodiagnóstico. Coordenação multi-robô através de sinais visuais. A esteira transportadora não parou uma única vez.

É assim que este resumo de IA de 14 de maio de 2026 se parece da minha mesa. Quatro laboratórios, uma empresa de robótica e uma indústria à beira de um verdadeiro avanço no Google I/O ou de uma decepção silenciosamente constrangedora. Quero guiá-los pelo que estou acompanhando, o que já testei, o que ninguém está dizendo em voz alta e o que eu faria esta semana se fosse vocês.

Se querem o panorama mais amplo de como tenho lido maio de 2026 — a história do SubQuadratic, a guerra dos agentes financeiros, o ocaso do Mariner — meu relatório de campo do início do mês prepara o terreno. Este resumo continua de onde aquele parou.

O cenário: A seis dias da keynote mais carregada em dois anos

Existe algo que acontece na semana antes de uma grande keynote de IA. Os vazamentos aceleram. Os laboratórios contraprogramam. Os benchmarks ficam suspeitos. Os comunicados de imprensa ficam vagos. E em algum lugar por baixo de tudo isso, o ciclo real de produto continua avançando, que é onde a história interessante geralmente vive.

Esta semana foi exatamente isso, em forma comprimida.

O Google tem variantes do Gemini 3.2 em testes A/B dentro do app iOS, aparecendo no LMArena e AI Studio sem anúncio — exatamente o padrão de atualização furtiva que rastreei no Flash há três semanas. A OpenAI tem o GPT-5.6 em testes internos sob dois codinomes, com uma previsão do Polymarket situando as chances em 89% para um lançamento antes de 30 de junho de 2026. A Anthropic acabou de lançar um aumento de 50% nos limites semanais para assinantes do Claude Code — e quase simultaneamente separou o uso do SDK e GitHub Actions em um pool de créditos pago separado que deixou a comunidade furiosa. A Figure realizou um turno completamente autônomo de 8 horas diante de câmeras. E em algum lugar nos bastidores, o Hermes Agent continua silenciosamente se acumulando como o projeto de agentes de código aberto mais interessante do ciclo.

Não são cinco histórias desconexas. É uma história contada de cinco ângulos diferentes. Computação está restrita. Os laboratórios ficaram sem orçamento de amostras grátis. A robótica está alcançando a curva. E a pergunta que todo construtor lendo isto deveria estar se fazendo é a mesma que eu me faço: em quais desses movimentos aposto esta semana e quais eu espero?

Vou mostrar no que estou apostando. Começo com o Google, porque a keynote é daqui a seis dias e o barulho é mais alto lá.

Google: Gemini 3.2 é menos do que o vazamento sugere

Esta é a parte do ciclo onde normalmente tenho que lutar contra a vontade de exagerar.

O vazamento do Gemini 3.2 Flash é real. Um pequeno número de usuários iOS na versão 1.2026.1710205 do app viram o modelo aparecer em seu seletor. O LMArena estava executando benchmarks silenciosos nele. O preço relatado — US$ 0,25 por milhão de tokens de entrada — é inferior ao do Gemini 3.1 Pro e supostamente iguala grande parte de sua capacidade em tarefas de codificação e criativas. O redesign de interface "Liquid Glass" é uma captura de tela real, não um mockup de fã. Nada disso está em disputa.

O que quero contestar é o enquadramento.

Passei tempo esta semana com as variantes vazadas através de todos os canais alternativos que consigo montar — rotações do seletor de modelos, a prévia do AI Studio, algumas das batalhas do LMArena onde o modelo atualizado surgiu. O Flash é genuinamente impressionante na geração de SVG. Executei meu prompt padrão de controle de PS5 e um prompt de controle de Xbox Series X e obtive proporções precisas em ambos, com posicionamento correto de botões e gatilhos. Isso é um avanço significativo em relação à linha base original do Gemini 3 Flash que testei em abril. A demo de clone do Mac OS com um único prompt que circula no X — uma interface de desktop com molduras de janela funcionais, barra de menu e três apps funcionando em uma única execução — é real. Reproduzi uma versão próxima dela.

Mas aqui está o que não está entrando na cobertura do vazamento. A variante principal do Gemini 3.2 — a que provavelmente será rotulada como "Pro" na keynote — não é um salto. Em testes lado a lado de geração de frontend contra o Gemini 3.1 Pro, o modelo atualizado na verdade produziu padrões de UI mais repetitivos. Cards com a mesma estrutura de cantos-arredondados-pílula-botão-ícone. Seções hero que todas rimam. Uma leve regressão ao tipo de saída de design que você esperaria de um modelo duas gerações mais antigo. Testei os mesmos prompts no Claude Opus 4.7 e a diferença não foi sutil.

Os codinomes internos são ainda mais interessantes. Há pelo menos duas outras variantes aparecendo em testes de canal lateral — vamos chamá-las de Sprite e Cola, porque é assim que aparecem nos logs de roteamento. A variante Cola funciona com esforço de raciocínio notavelmente maior e produz melhores resultados em tarefas de contexto longo. Essa pode ser a que recebe o selo "Deep Think" ou "Ultra" no I/O. Sprite parece um intermediário otimizado para velocidade que provavelmente se torna o substituto do Flash na linha.

Minha leitura honesta do que o Google lança em 19 ou 20 de maio: uma atualização real e útil do Flash com forte geração de SVG e UI com um único prompt. Um modelo Pro que é incremental, não transformador. Uma variante Deep Think ou Ultra que faz o trabalho pesado nos slides de benchmarks. As expectativas públicas de um salto estilo Sonnet 4.6 são altas demais. Eu calibraria para baixo.

Há outra coisa vazando do Google que ninguém está enquadrando corretamente ainda.

O modelo de vídeo Omni é a verdadeira história

O Gemini Omni vazou online esta semana — possivelmente Veo 4, possivelmente uma linha de produtos separada, a nomenclatura ainda está confusa. As demos que surgiram mostram edição de vídeo e modificação de cena com o tipo de preservação de movimento e consistência estrutural que gerações anteriores do Veo não conseguiam manter entre cortes. Rostos permanecem corretos entre mudanças de ângulo. A geometria do fundo sobrevive a movimentos de câmera. A permanência de objetos é mais nítida do que qualquer coisa que vi do Sora 2 ou Kling 3.0 com os mesmos prompts.

Ainda é muito cedo. As demos são curtas. Não há acesso público. As mãos e os detalhes de movimento fino ainda desviam em lugares onde você esperaria que um modelo de fronteira se mantivesse estável. Mas a trajetória é clara, e se o Google lançar qualquer versão disso no I/O com um nível de uso razoável, isso muda o pipeline de vídeo que venho executando para uma das minhas marcas.

Minha aposta: Omni recebe uma prévia no I/O, não um lançamento completo. Acesso de preview limitado. Lançamento real até o Q3.

Isso cobre o Google por enquanto. Vamos ao laboratório que está fazendo mais barulho nos canais do Slack de desenvolvedores esta semana.

Anthropic: Aumento de 50% nos limites, corte efetivo de 10x e um problema de confiança

Vou tentar muito escrever esta seção sem desabafar.

Provavelmente vou falhar.

A Anthropic lançou duas coisas quase simultaneamente em 13 de maio que puxam em direções opostas, e não se pode entender uma sem a outra. Vou apresentar ambas e depois dizer o que realmente significa na minha mesa.

A boa notícia: limites semanais subiram 50% até 13 de julho. A Anthropic anunciou que os limites semanais do Claude Code recebem um aumento de 50% para usuários Pro, Max, Team e Enterprise baseados em assentos, válido até 13 de julho de 2026. O plano gratuito está excluído. Isso se soma a uma duplicação dos limites no início de maio, financiada em parte por uma nova parceria de computação com a SpaceX. No papel, um usuário Max agora tem aproximadamente 3x o orçamento semanal de Claude Code que tinha em meados de abril. Isso é genuinamente significativo para o trabalho diário de codificação interativa — o tipo de trabalho onde você está sentado em um terminal, digitando prompts, revisando diffs, fazendo deploy.

A má notícia: o uso programático acabou de sair do prédio. Na mesma janela de tempo, a Anthropic separou o Agent SDK, GitHub Actions, claude -p e qualquer agente de terceiros em um pool de créditos separado e medido. Cargas programáticas agora consomem de um balde mensal fixo de US$ 20 a US$ 200 dependendo do plano, cobrado a preços de API, sem acumulação, expira no final do mês. Se você esgotar, paga preços de API além da sua assinatura.

Se você só usa Claude Code interativamente em um terminal, isso é um ganho líquido. Você obtém 50% mais margem e sua conta não muda.

Se você executa automação — e muitos dos que leem isto executam automação — seu uso efetivo acabou de ser cortado entre 10x e 40x.

Vou ser específico. Tenho vários setups autônomos distribuídos entre minhas marcas. Um é um agente de reconciliação de conteúdo que roda toda noite nos quatro sites. Um é um monitor de SEO por hora para um dos meus projetos de clientes. Um é um padrão de subagentes bifurcados que construí no início do ano para análise paralela de bases de código. Duas semanas atrás, essas cargas de trabalho rodavam dentro dos limites diários e semanais da minha assinatura Max — o que significava que o custo marginal de cada execução era efetivamente zero além da minha tarifa fixa. Hoje, essas cargas consomem de um balde mensal de créditos SDK de US$ 200 a preços de tokens API. O agente de reconciliação de marcas sozinho está a caminho de esgotar esse balde em onze dias.

Não sou o único sentindo isso. O thread da comunidade sobre esta mudança tem vários milhares de respostas no Reddit e X. A narrativa dentro da Anthropic parece ser que os usuários programáticos estavam fazendo arbitragem na assinatura — o que é tecnicamente verdade, particularmente os setups estilo OpenClaw que permitiam aos usuários rotear cargas de agentes headless através de um plano Pro de US$ 20. Do ponto de vista puro de economia unitária, a Anthropic está correta que esses fluxos eram insustentáveis. A separação faz sentido comercial.

O problema não é a separação. O problema é como foi lançada.

Foi lançada no mesmo dia do anúncio do aumento de 50%, o que fez a manchete ler "Limites do Claude Code sobem!" enquanto a experiência real para metade da base de usuários foi "sua automação existente acabou de ficar 10x mais cara." A transparência sobre o que contaria e o que não contra o novo pool de créditos foi escassa nas primeiras 24 horas. O caminho de migração para cargas programáticas existentes ainda está sendo definido. E a mensagem subjacente — "estamos com restrições de computação, então os que executam agentes são os que pagam" — não combina com a narrativa do acordo de computação com a SpaceX.

Aqui está minha leitura honesta. A Anthropic está lidando com uma escassez de computação real e estrutural. Os níveis de esforço de raciocínio no Opus 4.7 foram silenciosamente reduzidos nos planos de assinatura desde o final de abril, razão pela qual alguns de vocês notaram que o comportamento do modelo se degrada em tarefas de longa duração. O faturamento dividido é uma forma de manter o produto interativo com margem positiva enquanto cobra o uso programático ao seu custo real. Isso é racional. O que não é racional é como o lançamento tratou os desenvolvedores que construíram produtos reais em cima do modelo de preços anterior do Claude Code.

Continuo usando Claude Code diariamente. Não estou mudando. Mas movi três cargas de trabalho para um setup híbrido onde o trabalho programático pesado passa pelo Gemini 3.1 Pro no AI Studio (ainda efetivamente grátis para o volume que preciso) e o trabalho de codificação interativa fica no Claude Opus 4.7. O SDK de agentes da Anthropic ainda é a superfície de API mais limpa para construir — só estou sendo mais cuidadoso sobre quais trabalhos justificam seu preço premium.

O ponto positivo da Anthropic esta semana é genuinamente útil.

O Modo Rápido agora é o padrão no Opus 4.7

O Fast Mode para Claude Code — a configuração de velocidade 2,5x que executa o Opus a um custo maior por token sem alteração na qualidade — tornou-se o modelo padrão de Fast Mode no Opus 4.7 a partir de hoje, 14 de maio. Ativa-se com /fast no CLI. Requer Claude Code v2.1.139 ou posterior.

Venho executando Fast Mode no Opus 4.6 há semanas. Ativá-lo para o Opus 4.7 é, francamente, absurdo. Os tempos de resposta em uma refatoração de múltiplos arquivos que normalmente eu supervisionaria caíram de aproximadamente 90 segundos para cerca de 36. A saída do modelo é idêntica ao Opus 4.7 sem modo rápido em tudo que comparei. O compromisso é real — o Fast Mode consome créditos de uso extra, não do seu pool de assinatura — então você não quer ativá-lo para tudo. Para codificação interativa onde você realmente está esperando respostas, vale o custo extra. Desativo para execuções autônomas longas.

Dica profissional: combine o Fast Mode com o setup de fluxo de trabalho baseado em skills que venho executando e a velocidade se torna legitimamente desconfortável de uma boa maneira. O modelo gera mais rápido do que consigo ler.

Isso é a Anthropic. Vamos ao outro laboratório que silenciosamente teve uma semana real.

OpenAI: GPT-5.6 está em testes, e há uma super-app escondida

A OpenAI não lançou um modelo esta semana. Estão ocupados demais testando o próximo.

O GPT-5.6 está em testes internos completos sob dois codinomes que apareceram em logs de desenvolvedores e na rotação de modelos anônimos do LMArena: Ember Alpha e Beacon Alpha. O sufixo "-alpha" é significativo no padrão de lançamento da OpenAI. Tende a aparecer de quatro a seis semanas antes de um lançamento público. Combinando isso com a previsão do Polymarket de 89% para um lançamento do GPT-5.6 antes de 30 de junho, as contas apontam para meados de junho.

O que quero destacar aqui é o que está mudando no próprio processo de testes.

A OpenAI está executando ciclos de red-teaming e avaliação de segurança notavelmente mais longos no GPT-5.6 do que fez no GPT-5.5. Os pontos de verificação internos são visíveis nos logs do Codex há semanas, mas as janelas de teste estão estendidas. Múltiplos regimes de raciocínio estão sendo avaliados comparativamente sob diferentes ajustes de segurança antes que o modelo chegue perto de uma decisão de lançamento público. Isso é, na minha leitura, uma resposta direta às divulgações de métricas de alucinação pós-GPT-5.5 — onde o GPT-5.5 Instant reduziu alucinações em 52,5% em domínios de alto risco, e a empresa silenciosamente se comprometeu a fazer disso a linha base daqui em diante.

Acho que o GPT-5.6 sai com um piso de alucinações notavelmente melhor que o GPT-5.5. Não acho que sai com um salto dramático de inteligência. O ciclo Spud foi o salto de inteligência. Este ciclo é sobre confiabilidade.

Há também um teaser circulando sobre uma possível nova super-app da OpenAI chamada CodeX — com maiúsculas como nome de produto, não o Codex CLI existente. Os detalhes são escassos. Algumas capturas de tela, algumas descrições vagas de "um espaço de trabalho unificado para codificação, pesquisa e operações." Poderia ser um rebrand do guarda-chuva Codex existente com uma superfície de consumidor polida. Poderia ser a superfície browser-first que cobri na semana passada ganhando um envoltório de produto real. Poderia não ser nada.

Meu instinto: é a produtização do stack de extensão Chrome Codex + devbox remoto em algo que um não-desenvolvedor possa usar. Se a OpenAI está mirando na camada do sistema operacional — e as evidências de 9 de maio sugeriam fortemente que sim — o próximo passo é envolver o stack de agentes em uma superfície de app amigável ao consumidor. Meados de junho seria uma janela lógica. Veremos.

O que estou fazendo a respeito esta semana: nada. Não estou migrando cargas de trabalho para a OpenAI antes de um modelo que não testei. Mantenho o Codex instalado e fixado no meu dock, e executarei minha bateria de testes padrão no dia em que o GPT-5.6 chegar. Se ultrapassar um limiar específico de confiabilidade — medido contra meu próprio conjunto de avaliação interno, não slides de benchmarks — reequilibrarei algumas cargas de trabalho então.

Esses são os três grandes laboratórios. Agora quero dedicar um momento à história sobre a qual quase ninguém no meu feed está gritando, porque acho que deveria ser o verdadeiro título da semana.

Figure AI: O turno de 8 horas acabou de acontecer, e você deveria refletir sobre isso

Quero que imagine o armazém por um segundo.

Layout padrão. Esteira transportadora correndo pelo meio. Pilhas de caixas entrando de um lado, pacotes saindo do outro. Uma equipe normal para operar isso seria de seis a oito humanos no chão, mais um gerente, mais uma pessoa de manutenção de plantão. Um turno são oito horas. Você faz pausas. Rodízio de pessoal. Lida com o inevitável congestionamento na linha a cada quarenta minutos aproximadamente.

Agora imagine o mesmo armazém sem humanos no chão por oito horas seguidas.

É isso que a Figure AI transmitiu ao vivo na semana passada. Uma frota de robôs humanoides Helix-02 completou um turno completo de 8 horas movendo pacotes para uma esteira transportadora — detectando códigos de barras em caixas de entrada, pegando os pacotes, reorientando-os para que os códigos de barras fiquem para baixo, colocando-os na linha. Operação contínua. Sem teleoperação. Sem humanos no processo.

A rede neural do Helix-02 faz tudo com inferência a bordo. Sem ida e volta à nuvem. Os robôs veem através de suas câmeras, raciocinam sobre o que estão vendo, planejam seus movimentos, executam. Quando um robô detectou um problema com seu próprio desempenho, ele se autodiagnosticou e caminhou autonomamente até a área de manutenção para solicitar um substituto de frota. Os outros robôs ajustaram seu fluxo de trabalho para cobrir a lacuna. A esteira nunca parou.

Eles se coordenam visualmente. Não há comunicação verbal, nenhum protocolo de mensagens interno que se possa ler com um sniffer de rede. Eles se olham, observam o estado da linha e se ajustam. Da mesma forma que uma equipe humana de armazém que trabalha junto há dois anos se coordena sem falar.

Três coisas sobre isso me importam como construtor, não como entusiasta de robótica.

Um: a inferência está acontecendo no dispositivo. Essa é a parte que deveria preocupar os provedores de IA na nuvem. Se um envelope de computação de classe 1,5kW pode executar um modelo de visão-linguagem-ação bom o suficiente para 8 horas de manuseio de pacotes, a cauda longa da IA do mundo físico não precisa de um cluster de inferência de um bilhão de dólares. Precisa de um chip e uma fonte de alimentação. A economia da IA física acabou de divergir da economia da IA na nuvem de maneira significativa.

Dois: a coordenação multi-agente é emergente. Os robôs não foram pré-programados para acenar uns para os outros. A coordenação visual surgiu do treinamento. É o mesmo padrão que venho observando em setups de codificação multi-agente nos últimos seis meses — uma vez que você permite que agentes observem o estado um do outro, eles começam a se coordenar de maneiras que o treinamento original não especificou explicitamente. Estamos vendo o mesmo comportamento emergente aparecer no espaço físico.

Três: a implicação trabalhista não está mais a 18 meses de distância. Venho escrevendo sobre a questão de IA e empregos há um ano. O contra-argumento convencional sempre foi "sim, mas o trabalho físico está seguro por mais uma década." Esse argumento ficou mais difícil esta semana. Um turno de manuseio de pacotes não é um experimento mental. É uma categoria real de emprego em armazéns. Há um estimado de 1,7 milhão de manipuladores de pacotes só nos EUA. A economia unitária de um robô Figure 03 em escala está entre US$ 30.000 e US$ 50.000 por unidade amortizados durante sua vida útil — bem abaixo do custo total de um trabalhador humano fazendo o mesmo trabalho no mesmo período.

Não digo nada disso para ser catastrofista. Digo porque o ciclo está acontecendo mais rápido do que a conversa política. Se você ainda não começou a pensar no que seu negócio faz que é defensável no mundo físico, esta semana é um lembrete para começar.

Isso cobre a Figure. Vamos ao resto do que está se movendo esta semana.

Notas rápidas: Jules, Hermes e a camada de código aberto

Duas coisas que valem ser mencionadas e que não ganharam sua própria seção.

O acesso antecipado ao Google Jules V2 está aberto. O formulário foi ao ar para o que o Google posiciona como "uma plataforma de desenvolvimento de produtos agênticos de ponta a ponta." A atualização mais importante que todos esperam: operação contínua, inclusive quando o dispositivo do usuário está offline. Se o Jules V2 for lançado com execuções de agentes persistentes verdadeiramente do lado do servidor — onde você pode fechar seu laptop, sair por quatro horas e voltar para encontrar o trabalho feito — isso é uma resposta competitiva à direção do Codex e Claude Code. A lista de espera é o movimento certo por enquanto. Estou nela. Não estou apostando nenhum trabalho de produção no Jules até poder executar minha bateria de testes padrão contra o V2.

O Hermes Agent continua sendo o projeto de código aberto mais interessante do ciclo. O ciclo de auto-melhoria — onde o Hermes observa suas próprias conclusões de tarefas bem-sucedidas, as abstrai em "trajetórias" reutilizáveis e melhora progressivamente em seus fluxos de trabalho específicos — continua lançando atualizações. As integrações de provedores se ampliaram. E circulam relatos de que o modelo Qwen 3.6 Plus está sendo oferecido gratuitamente dentro do Hermes através de uma parceria com um portal de notícias por tempo limitado. (Nota: o material fonte chegou à minha mesa como "Coin 3.6 Plus" — tenho quase certeza de que é Qwen 3.6 Plus, dada a linha de modelos e o timing. Se virem referências a qualquer um dos dois, apontam para a mesma coisa.) Para construtores executando setups de agentes de código aberto, o Hermes está agora firmemente na mesma conversa que os players proprietários. Isso não era verdade há seis meses.

Esse é o campo. Encerro com a parte pela qual vocês vieram — o que eu realmente faria esta semana.

O que eu faria esta semana como construtor

Seis dias até o Google I/O. O modelo de cobrança da Anthropic se movendo sob seus pés. GPT-5.6 à espreita. Aqui está o plano.

Não migrar prematuramente. O erro mais caro que vejo construtores cometerem em semanas como esta é correr para trocar de stack antes de uma keynote que ainda não aconteceu. Os vazamentos do Gemini 3.2 são reais, mas não são o produto final. Os codinomes do GPT-5.6 são reais, mas o modelo não está em produção. Esperar. Deixar a poeira baixar. Executar seu stack existente mais uma semana.

Audite sua automação do Claude Code hoje. Especificamente: abra todas as cargas programáticas que você tem rodando no Claude — scripts SDK, GitHub Actions, jobs headless de claude -p, agentes de terceiros — e calcule-os com os novos preços do pool de créditos. Se encontrar uma carga que vai esgotar seu balde mensal de US$ 20 a US$ 200 em duas semanas, você tem uma decisão a tomar: pagar o prêmio de API, portar a carga para um provedor mais barato para o trabalho pesado, ou reestruturá-la para fazer menos. Faça isso antes de 31 de maio.

Teste o Fast Mode no Opus 4.7 se você faz codificação interativa. A aceleração de 2,5x é real. A qualidade não muda. O custo de uso extra é contido se você desativar para execuções autônomas longas. Este é o maior ganho de velocidade de fluxo de trabalho disponível para usuários do Claude Code esta semana. Execute /fast no seu CLI. Faça disso um hábito. (Requer v2.1.139 ou posterior — verifique com claude --version.)

Se você faz trabalho de frontend com IA, execute seus prompts padrão no Gemini 3.2 Flash esta semana. Através do AI Studio, através de qualquer canal alternativo que tenha. A geração de SVG é forte. O scaffolding de UI com um único prompt é particularmente forte no Flash. Para seções hero esboçadas, diagramas de controladores, conjuntos de ícones, esqueletos de dashboards — o Flash é genuinamente competitivo em custo por output agora. Guarde os tokens de Pro e Opus para o trabalho real.

Assista à keynote do I/O com um caderno aberto. Em 19 ou 20 de maio, o que estarei observando não é o modelo principal. É a profundidade da história de agentes que o Google conta. Especificamente: o Gemini Agent recebe uma revelação real de plataforma? O Omni recebe um nível de uso? O Jules V2 recebe uma data de lançamento? Esses três sinais me dirão mais sobre a posição real do Google na corrida do sistema operacional do que qualquer slide de benchmark.

E faça o que fizer esta semana, não deixe a demo da Figure passar sem dedicar uma hora de reflexão. Assista à repetição do livestream. Preste atenção nos momentos onde um robô se autodiagnostica e caminha até a manutenção. Preste atenção em como os outros se ajustam sem perder o ritmo na linha. É assim que um sistema multi-agente emergente se parece no mundo físico, e se tornou real esta semana. Seis meses atrás, era uma demo de pesquisa. Hoje é uma trajetória de produto.

A opinião honesta

Aqui está o que acho que realmente está acontecendo, se eu zoom para o máximo.

Os laboratórios ficaram sem orçamento de amostras grátis. Acordos de computação com a SpaceX, contratos do Pentágono, uso programático sendo reajustado, ciclos de red-teaming mais longos, codinomes internos escondendo experimentos de preços — tudo isso aponta para a mesma realidade subjacente. Estamos no final da fase onde cada grande laboratório de modelos absorve perdas de computação para capturar a mente dos desenvolvedores. Os próximos doze a dezoito meses vão se parecer muito mais com economia normal de SaaS, com todos os compromissos que isso implica. Os níveis gratuitos vão se estreitar. O uso programático será cobrado a custo. As assinaturas interativas se manterão. As janelas de arbitragem que construíram o boom de agentes de código aberto do início de 2026 estão se fechando.

As keynotes que você assistir nas próximas seis semanas — Google I/O em 19-20 de maio, a revelação do GPT-5.6 da OpenAI em meados de junho, a resposta da Anthropic ao que o Google lançar — vão ser o momento em que a indústria decide como é realmente a camada de produto com preço definido. O vale-tudo está acabando. Os preços estão se estabilizando. A diferenciação será medida em qualidade de fluxo de trabalho, confiabilidade e as partes do stack que cada laboratório realmente possui.

E por baixo de tudo isso, a Figure completou um turno completo de armazém sem humanos no processo. Que é o tipo de coisa que, em uma semana diferente, teria sido a única história de que todos falaram.

É assim que 14 de maio de 2026 se parece da minha mesa. Seis dias de uma keynote. Uma semana após o reset de preços da Anthropic. Uma rotação de vazamentos no novo seletor de modelos do Google. Um livestream para um futuro de IA física que chegou mais rápido do que eu esperava.

Escreverei de novo depois do I/O. Se você está executando qualquer coisa em produção em cima desses modelos, prepare-se.

Vão ser seis dias barulhentos.

Perguntas frequentes

Quando o Gemini 3.2 será lançado?

O Gemini 3.2 será lançado com maior probabilidade no Google I/O 2026 em 19-20 de maio. A variante Flash vem vazando através do app Gemini para iOS e LMArena há mais de uma semana, e o padrão do Google é anunciar formalmente modelos que já estão rodando em testes A/B de produção. Espere um nível Pro ao lado do Flash, mais uma possível variante Deep Think ou Ultra.

O que mudou nos limites do Claude Code em maio de 2026?

A Anthropic elevou os limites semanais interativos do Claude Code em 50% de 13 de maio a 13 de julho de 2026. Ao mesmo tempo, o uso do Agent SDK, GitHub Actions, claude -p e chamadas de agentes de terceiros foram movidos para um pool de créditos medido separado de US$ 20-US$ 200 por mês dependendo do plano, cobrado a preços de API. A codificação interativa ficou mais barata. O uso programático ficou dramaticamente mais caro.

O GPT-5.6 sai em breve?

O GPT-5.6 está em testes internos sob os codinomes Ember Alpha e Beacon Alpha, com o Polymarket prevendo 89% de chance de lançamento antes de 30 de junho de 2026. Meados de junho é a janela de lançamento mais provável. Espere uma redução significativa de alucinações em relação ao GPT-5.5 em vez de um salto dramático de inteligência.

O que a Figure AI demonstrou com o Helix-02?

A Figure AI transmitiu ao vivo uma frota de robôs humanoides Helix-02 executando um turno de armazém completamente autônomo de 8 horas de classificação de pacotes em uma esteira transportadora. A coordenação foi multi-robô e apenas visual, sem teleoperação. Os robôs autodiagnosticaram falhas, solicitaram substituições e trocaram baterias autonomamente. Toda a inferência rodou no dispositivo sem ida e volta à nuvem.

Como funciona o Fast Mode do Claude Code no Opus 4.7?

O Fast Mode executa o Claude Opus 4.7 com uma configuração de API otimizada para velocidade, produzindo saída de qualidade idêntica a 2,5x a velocidade por um custo maior por token. Ativa-se com /fast no Claude Code v2.1.139 ou posterior. Em planos de assinatura, o Fast Mode consome créditos de uso extra em vez do pool de limite de taxa de assinatura.

Vamos trabalhar juntos

Quer construir sistemas de IA, automatizar fluxos de trabalho ou escalar sua infraestrutura tecnológica? Adoraria ajudar.

Coffee cup

Gostou deste artigo?

Seu apoio me ajuda a criar mais conteúdo técnico aprofundado, ferramentas open-source e recursos gratuitos para a comunidade de desenvolvedores.

Tópicos Relacionados

Engr Mejba Ahmed

Engr Mejba Ahmed

Engr. Mejba Ahmed builds AI-powered applications and secure cloud systems for businesses worldwide. With 8+ years shipping production software in Laravel, Python, and AWS, he's helped companies automate workflows, reduce infrastructure costs, and scale without security headaches. He writes about practical AI integration, cloud architecture, and developer productivity.

Artigos Relacionados

Ver Todos

Comments

Leave a Comment

Comments are moderated before appearing.

Learning Resources

Expand Your Knowledge

Accelerate your growth with structured courses, verified certificates, interactive flashcards, and production-ready AI agent skills.

Sample Certificate of Completion

Sample certificate — complete any course to earn yours

Engr Mejba Ahmed

Engr Mejba Ahmed

AI assistant · trained on my work

👋

Hey there!

Quick Actions

WhatsApp Direct line to me

Chat on WhatsApp

+880 1723 741224 · Replies within the hour on working days

Popular Questions

Engr Mejba Ahmed is connected
Engr Mejba Ahmed is typing...
Engr Mejba Ahmed avatar

✉ Want me to follow up? Drop your email

Engr Mejba Ahmed avatar

📞 Connect Directly

Choose how you'd like to reach me

WhatsApp

+880 1723 741224

Email

mejba.13@gmail.com

✓ Details sent! I'll get back to you shortly.

Powered by OpenAI

335+

Blog Posts

25

AI Courses

63

Projects

Services & Expertise

Pricing & Process

Learning & Resources

Connect & Support