Dernière mise à jour : 14 juillet 2026
Claude Opus 5 a été lancé le 10 juillet, et les benchmarks racontent une histoire plus nuancée que les titres. Il perd cinq évaluations, et le score d'Opus 4.8 qu'un média rapporte ne correspond pas à un autre.
5 Défaites : GPQA Diamond (vs Sonnet 5), certains benchmarks de maths (vs GPT-5.6 Sol), multilingue non-anglais (vs GLM/Qwen), efficacité de tokens (vs Fable 5), vitesse (vs Grok 4.5/Sonnet 5).
Où il gagne : Benchmarks de code (nouveaux records), raisonnement long contexte, tâches agentiques, sécurité/alignement.
Confusion du score Opus 4.8 : Différents médias rapportent différents scores — probablement des différences de niveau d'effort.
Gate de version : Dans Claude Code, opus pointe parfois encore vers 4.8. Utilisez claude-opus-5-20250710.
Coût : 15$/75$ par million de tokens comme 4.8, mais consommation plus élevée par tâche. Le coût par tâche monte.
Utilisez Opus 5 pour : Code complexe, long contexte, agents autonomes. Sonnet 5 pour : Quotidien, science-QA. Grok 4.5 pour : 70% routine.
Pour l'aide au choix de modèle : fiverr.com/s/EgxYmWD.
Travaillons Ensemble
- Fiverr : fiverr.com/s/EgxYmWD * Portfolio : mejba.me * Ramlit Limited : ramlit.com * ColorPark : colorpark.io * xCyberSecurity : xcybersecurity.io