Zuletzt aktualisiert: 14. Juli 2026
Claude Opus 5 launchte am 10. Juli, und die Benchmarks erzählen eine nuanciertere Geschichte als die Schlagzeilen. Es verliert fünf Evaluierungen, und der Opus 4.8-Score den ein Outlet berichtet stimmt nicht mit einem anderen überein.
5 Verluste: GPQA Diamond (vs Sonnet 5), bestimmte Mathe-Benchmarks (vs GPT-5.6 Sol), mehrsprachig nicht-Englisch (vs GLM/Qwen), Token-Effizienz (vs Fable 5), Geschwindigkeit (vs Grok 4.5/Sonnet 5).
Wo es gewinnt: Coding-Benchmarks (neue Rekorde), Lange-Kontext-Reasoning, Agentische Tasks, Sicherheit/Alignment.
Opus 4.8 Score-Verwirrung: Verschiedene Outlets berichten verschiedene Scores — wahrscheinlich Effort-Level-Unterschiede. Die „X% besser als 4.8"-Claims sind unzuverlässig.
Versions-Gate: In Claude Code zeigt opus manchmal noch auf 4.8. Nutze claude-opus-5-20250710 für Sicherheit.
Kosten: $15/$75 pro Million Token wie 4.8, aber höherer Token-Verbrauch pro Task. Kosten-pro-Task steigen.
Nutze Opus 5 für: Komplexes Coding, Lange-Kontext, Agent-Runs. Sonnet 5 für: Alltag, Science-QA. Grok 4.5 für: 70% Routine.
Für Modellauswahl-Hilfe: fiverr.com/s/EgxYmWD.
Lass Uns Zusammenarbeiten
- Fiverr: fiverr.com/s/EgxYmWD * Portfolio: mejba.me * Ramlit Limited: ramlit.com * ColorPark: colorpark.io * xCyberSecurity: xcybersecurity.io