Laatst bijgewerkt: 14 juli 2026
Claude Opus 5 lanceerde op 10 juli 2026, en de benchmarks vertellen een genuanceerder verhaal dan de koppen suggereren. Het is niet het beste model op elke evaluatie — het verliest er vijf — en de Opus 4.8-score die de ene outlet rapporteert komt niet overeen met wat een andere toont. Hier is mijn ontcijfering van wat de cijfers werkelijk zeggen.
De Vijf Evaluaties Die Opus 5 Verliest
Laat me meteen eerlijk zijn: Opus 5 is niet de onbetwiste kampioen op alle benchmarks. Het verliest op vijf specifieke evaluaties, en die verliezen vertellen je iets nuttigs over het model.
1. GPQA Diamond (graduate-level science): Sonnet 5 scoort hier hoger. Opus 5 is sterk maar niet dominant op wetenschappelijke kennisvragen. Als je specifiek science-QA draait, is Sonnet 5 op hoog inspanningsniveau de betere keuze.
2. Bepaalde wiskunde-benchmarks: Op specifieke wiskundige redeneertaken scoort GPT-5.6 Sol (het beperkte vlaggenschip) hoger. Opus 5 is competitief maar niet leidend.
3. Meertalige taken (niet-Engelse talen): GLM 5.5 en Qwen 3 scoren hoger op Chinese benchmarks. Opus 5 is sterker op Engels dan op andere talen.
4. Token-efficiëntie: Fable 5 is efficiënter in tokens per taak op sommige werklasten. Opus 5 redeneert diep maar verbruikt meer tokens om daar te komen dan Fable op vergelijkbare taken.
5. Snelheid: Grok 4.5 en Sonnet 5 zijn beiden sneller. Opus 5 prioriteert diepte boven snelheid.
Waar Opus 5 Wint
Coderen (SWE-bench, Terminal-Bench): Opus 5 zet nieuwe records. Het overtreft Fable 5, GPT-5.6 Terra, en alle open-weight modellen op de standaard codeerbenchmarks.
Lange-context redeneren: Met een 200K tokenvenster en bewezen betrouwbare prestaties over de hele lengte, is Opus 5 het sterkste model voor taken die grote hoeveelheden context verwerken.
Agentische taken: De combinatie van diepe redenering en betrouwbare instructieopvolging maakt Opus 5 het meest geschikte model voor onbeheerde agentlopen op complexe taken.
Veiligheid en alignment: Opus 5 scoort het hoogst van alle Claude-modellen op de RSP-evaluaties. Het is minder geneigd om over instructiegrenzen heen te stappen dan Fable 5.
De Opus 4.8-Score Verwarring
Er is een discrepantie die niemand heeft opgelost: verschillende outlets rapporteren verschillende Opus 4.8-scores op dezelfde benchmark. Het verschil is waarschijnlijk het inspanningsniveau — dezelfde valkuil die ik beschreef in mijn Sonnet 5 vs Opus 4.8 vergelijking. Als het ene outlet Opus 4.8 op hoog testte en het andere op gemiddeld, krijg je andere scores voor hetzelfde model. Dat maakt de "Opus 5 is X% beter dan Opus 4.8"-claims onbetrouwbaar tenzij je weet welk inspanningsniveau werd gebruikt.
De Versiepoort in Claude Code
Een detail dat de meeste reviews missen: Opus 5 is in Claude Code alleen beschikbaar als je specifiek de modelversie opgeeft. De standaard opus verwijzing wijst nog naar Opus 4.8 in sommige configuraties. Om zeker Opus 5 te draaien, gebruik claude-opus-5-20250710 als model-ID. Dit zal waarschijnlijk veranderen zodra Anthropic de standaard bijwerkt, maar op dit moment is het een versiepoort die je output kan beïnvloeden zonder dat je het merkt.
De Echte Kosten
Opus 5 prijst op $15/$75 per miljoen tokens — hetzelfde als Opus 4.8 en Fable 5. Maar de tokenverbruik per taak verschilt. Opus 5 verbruikt gemiddeld meer tokens dan Opus 4.8 op vergelijkbare taken (dieper redeneren = meer interne tokens). De werkelijke kosten per taak stijgen dus, ook al blijft de prijs per token gelijk.
De eerlijke vergelijking is kosten-per-taak, niet kosten-per-token. Ik ga hier dieper op in in mijn Opus 5 vs Fable 5 vergelijking.
Mijn Lezing
Opus 5 is het beste codeermodel dat beschikbaar is voor het publiek. Het is niet het beste model op elke taak — en dat is prima. De kunst is weten wanneer je het nodig hebt en wanneer een goedkoper model volstaat.
Gebruik Opus 5 voor: Complexe codering, lange-context verwerking, onbeheerde agentlopen, architectuurbeslissingen.
Gebruik Sonnet 5 voor: Dagelijkse codering, science-QA, taken waar snelheid prioriteit heeft.
Gebruik Fable 5 voor: Taken waar token-efficiëntie cruciaal is en de diepte vergelijkbaar moet zijn met Opus.
Gebruik Grok 4.5 voor: De 70% routinetaken waar "goed genoeg" genoeg is.
Als je hulp nodig hebt bij het kiezen van het juiste model per taak — fiverr.com/s/EgxYmWD.
Veelgestelde Vragen
Welke benchmarks verliest Claude Opus 5?
GPQA Diamond (verliest van Sonnet 5), specifieke wiskunde (verliest van GPT-5.6 Sol), meertalig niet-Engels (verliest van GLM/Qwen), token-efficiëntie (verliest van Fable 5), snelheid (verliest van Grok 4.5/Sonnet 5).
Is Claude Opus 5 het beste model?
Het beste codeermodel op publieke benchmarks, ja. Het beste model voor elke taak, nee. Het verliest op vijf specifieke evaluaties en is duurder per taak dan goedkopere alternatieven.
Hoeveel kost Claude Opus 5?
$15/$75 per miljoen tokens — zelfde als Opus 4.8. Maar het verbruikt meer tokens per taak door dieper redeneren, dus de werkelijke kosten per taak zijn hoger.
Laten We Samenwerken
- Fiverr: fiverr.com/s/EgxYmWD
- Portfolio: mejba.me
- Ramlit Limited: ramlit.com
- ColorPark: colorpark.io
- xCyberSecurity: xcybersecurity.io