Última atualização: 14 de julho de 2026
Claude Opus 5 lançou em 10 de julho, e os benchmarks contam uma história mais nuançada que as manchetes. Perde cinco avaliações, e o score do Opus 4.8 que um veículo reporta não coincide com outro.
5 Derrotas: GPQA Diamond (vs Sonnet 5), certos benchmarks de matemática (vs GPT-5.6 Sol), multilíngue não-inglês (vs GLM/Qwen), eficiência de tokens (vs Fable 5), velocidade (vs Grok 4.5/Sonnet 5).
Onde ganha: Benchmarks de programação (novos recordes), raciocínio de contexto longo, tarefas agênticas, segurança/alinhamento.
Confusão do score do Opus 4.8: Diferentes veículos reportam scores diferentes — provavelmente diferenças de nível de esforço.
Gate de versão: No Claude Code, opus às vezes ainda aponta para 4.8. Use claude-opus-5-20250710.
Custo: $15/$75 por milhão de tokens como 4.8, mas maior consumo por tarefa. O custo por tarefa sobe.
Use Opus 5 para: Programação complexa, contexto longo, agentes autônomos. Sonnet 5 para: Diário, science-QA. Grok 4.5 para: 70% rotina.
Para ajuda com seleção de modelos: fiverr.com/s/EgxYmWD.
Vamos Trabalhar Juntos
- Fiverr: fiverr.com/s/EgxYmWD * Portfolio: mejba.me * Ramlit Limited: ramlit.com * ColorPark: colorpark.io * xCyberSecurity: xcybersecurity.io