Ongeveer een jaar lang was mijn logica voor het kiezen van een model lui, en het werkte: als de taak ertoe deed, greep ik naar Opus. Als het niet zo was, pakte ik Sonnet en accepteerde ik dat de output een tikje minder zou zijn. Twee lagen, twee prijzen, een schone mentale snelkoppeling.
Claude Sonnet 5 brak die snelkoppeling op 30 juni 2026, en ik ben er nog steeds aan het wennen.
Hier is de korte versie, want je hebt gezocht op Claude Sonnet 5 vs Opus 4.8 en je verdient het antwoord vóór je gaat scrollen: Sonnet 5 landt op de meeste benchmarks binnen een paar punten van Opus 4.8, verslaat het zelfs op kenniswerk, en kost 40% zoveel per input-token. Maar er zit ergens diep in de API een instelling — het effort level — die Sonnet 5 stilletjes kan omdraaien van "ongelooflijke koopje" naar "duurder dan Opus voor hetzelfde resultaat". De hele beslissing zit in dat detail, en bijna niemand heeft het erover.
Dus laten we het erover hebben. Niet het persbericht. De echte rekensom, de valkuil, en de regel die ik nu per taak gebruik om tussen de twee te kiezen.
Waar Sonnet 5 past in de Claude-lijn
Sonnet 5 is het nieuwe mid-tier model in de Claude-familie — het plekje tussen de instapmodellen en de zwaargewicht Opus- en Fable/Mythos-lijnen. Op papier is het "gewoon" een Sonnet-update. In de praktijk is de sprong vanaf Sonnet 4.6 de grootste generatiewinst die ik in die tier heb gezien, en werd het gat met Opus 4.8 zo klein dat het oprecht ongemakkelijk werd voor Anthropic's eigen prijsniveaus.
Het ging op lanceerdag live als standaardmodel voor Free- en Pro-abonnementen, en het is beschikbaar voor Max, Team, Enterprise, en via de API. Als je Claude sinds eind juni op het web hebt gebruikt en niets hebt veranderd, heb je waarschijnlijk al met Sonnet 5 gepraat zonder het te weten.
De framing die iedereen aangreep — TechCrunch, VentureBeat, The New Stack — was een of andere versie van "een goedkopere manier om agents te draaien". Dat klopt, maar het verkoopt de structurele verschuiving tekort. Voor het eerst zitten Sonnet en Opus op één kosten-prestatiecurve in plaats van twee aparte lagen. De oude "goed model / geweldig model"-splitsing is nu "dezelfde modelfamilie, kies je punt op de curve". Dat verandert hoe je alles ontwerpt wat meer dan een handvol modelaanroepen doet.
Voordat we bij de curve komen, kijk waar de cijfers echt landen. Dit is het deel dat de marketing overslaat.
Het benchmarkbeeld, eerlijk gelezen
Hier is Anthropic's eigen vergelijking, en ik wil hem lezen zoals ik zou doen voordat ik een project op de uitkomst zou zetten — kolom voor kolom, niet als hype-reel.
Agentic coding, SWE-bench Pro: Sonnet 5 haalt 63,2%, tegenover 58,1% voor Sonnet 4.6, met Opus 4.8 nog steeds bovenaan op 69,2%. Dit is de breedste schone kloof op het hele bord — zes punten. Als je workload zwaar, multi-file, autonoom coderen is, dan is dit het cijfer dat je aan het denken moet zetten. Opus is hier merkbaar beter, en we komen zo terug op waarom dat verschil van zes punten er meer toe doet dan het lijkt.
Agentic coding, Terminal-Bench 2.1: Sonnet 5 springt naar 80,4% vanaf 67,0% van 4.6 — een sprong van dertien punten in één generatie. Waar Opus 4.8 op deze specifieke harnas landt, is oprecht omstreden: sommige rapporten zetten hem een paar punten voor Sonnet 5, andere zetten hem er meerdere punten achter, dus ik hang op Terminal-Bench geen conclusie op, hoe dan ook. Wat niet ter discussie staat, is dat Sonnet 5 zijn eigen voorganger hier in het stof heeft achtergelaten.
Multidisciplinair redeneren, Humanity's Last Exam: Zonder tools 43,2% tegenover 49,8% voor Opus. Met tools 57,4% tegenover 57,9% voor Opus — praktisch gelijkspel. Het resultaat met tools is de verrader: geef Sonnet 5 de mogelijkheid om te zoeken en functies aan te roepen, en zijn redeneerkloof met Opus verdampt bijna. De meeste echte agent-workloads hebben tools. Hou dat op zak.
Computergebruik, OSWorld-Verified: 81,2% tegenover 83,4% voor Opus. Twee punten. Voor het besturen van een browser of desktop is dat ruis op de meeste taken.
Kenniswerk, GDPval-AA v2: Sonnet 5 scoort 1618. Opus 4.8 scoort 1615. Het mid-tier model won. Niet met verpletterend verschil, maar het won — op de benchmark die het dichtst bij "professioneel werk over disciplines heen doen" ligt.
Neem een stap terug en de vorm is onmiskenbaar: minimale terugval ten opzichte van Opus vrijwel overal, een duidelijke winst op kenniswerk, en precies één categorie — zware agentic coding — waar Opus echt daglicht houdt. Dat is een opmerkelijk smalle gracht voor een model dat meer dan twee keer zoveel kost.
Wat ons bij het geld brengt, want de benchmarks zijn maar de helft van de beslissing.
De prijsrekensom die de weegschaal echt doet doorslaan
Benchmarks vertellen je wat mogelijk is. Prijzen vertellen je wat betaalbaar is op schaal. En hier houdt Sonnet 5 op interessant te zijn en begint hij ontwrichtend te worden.
Per miljoen tokens, hier is de lijn per lancering:
- Fable 5 / Mythos 5: $10 input / $50 output — het premium plafond
- Opus 4.8: $5 input / $25 output
- Sonnet 5: $2 input / $10 output
Lees de Sonnet 5-regel tegenover Opus. Input is 40% van Opus' kosten. Output is minder dan de helft. Dat is geen korting — dat is een andere budgetcategorie.
Eén detail dat de lanceerdagdekking aanstipte en waar je rekening mee moet houden: die $2/$10 is introductieprijs, die loopt tot en met 31 augustus 2026. Daarna gaat hij omhoog naar $3/$15. Anthropic stelde het introtarief zo in dat de overgang voor bestaande Sonnet-gebruikers ongeveer kostenneutraal is, maar als je een prognose op deze cijfers bouwt, modelleer dan het tarief van na augustus. $3/$15 is nog steeds ruim onder Opus' $5/$25 — het is alleen niet de leegverkoop die de eerste twee maanden zijn.
Maak het nu concreet, want cijfers per miljoen tokens landen pas als je ze schaalt. Het getal dat dit voor mij herkaderde: een output-zware agent-workload die ongeveer $1.000/dag kost op Opus 4.8, landt rond de $400/dag op Sonnet 5 tegen het standaardtarief. Voor een solo-bouwer die één agent draait, boeit dat weinig. Voor een team dat honderden agents parallel draait, is dat het verschil tussen "dit product heeft rendabele economie" en "dit product is een wetenschapsproject".
Dit is het echte verhaal. Niet dat Sonnet 5 goed is — genoeg modellen zijn goed. Het is dat Sonnet 5 goed genoeg is om Opus voor de meerderheid van de workloads optioneel te laten lijken, terwijl hij minder dan de helft kost om ze te draaien. Voor iedereen die uit de prijs van Fable en Mythos werd geprijsd, is er zojuist een capabel Claude-model in een budget beland dat ze daadwerkelijk kunnen verdedigen.
Maar die 60% besparing is voorwaardelijk. Er is een instelling die hem volledig kan wegvegen, en de meeste teams merken het pas als de factuur binnenkomt.
De effort-val waar niemand je voor waarschuwt
Hier is het deel dat dit artikel zijn bestaansrecht geeft. Sonnet 5 legt effort levels bloot — low, medium, high, xhigh, en max helemaal bovenaan de knop. Hogere effort betekent dat het model meer tokens besteedt aan redeneren voordat het antwoordt. Meer redeneertokens betekent betere kwaliteit én hogere kosten. Outputtokens zijn waar de rekening zit, en redeneren verbrandt outputtokens.
Als je mijn analyse van de effort levels van Opus 4.8 hebt gelezen, weet je al dat deze knop de helft van de tijd meer uitmaakt dan de modelkeuze zelf. Bij Sonnet 5 maakt hij nog meer uit, want de knop bepaalt of je een koopje krijgt of te veel betaalt.
Loop het door zoals de agentic-search-resultaten daadwerkelijk uitpakken:
Bij low effort verslaat Sonnet 4.6 Sonnet 5 nog op slagingspercentage — Sonnet 5 landt rond de 55% op de agentic-search-taak. Sonnet 5 is bij deze instelling goedkoper, dus je ruilt een beetje nauwkeurigheid in voor een lagere rekening. Prima voor vergevingsgezind werk met hoog volume.
Bij medium effort zijn de twee vergelijkbaar in kwaliteit, maar Sonnet 5 doet het voor minder. Dit is de sweet spot — de instelling waarbij "goedkoper en minstens zo goed" gewoon waar is, zonder sterretje.
Bij high effort komt Sonnet 5 duidelijk vóór 4.6 op kwaliteit. Maar de kosten stijgen, en hier komt de clou: high-effort Sonnet 5 kost ongeveer hetzelfde als high-effort Opus. Je hebt je een weg terug uitgegeven naar Opus-prijzen.
Bij xhigh — en Sonnet 5 gaat nog een tandje hoger, tot max — zit je stevig in Opus-prijzen. Bovenaan de knop landt Sonnet 5 rond Opus 4.8's medium-tot-high-instelling op OSWorld-Verified en de BrowseComp agentic-search-benchmark. Je betaalt mogelijk meer dan Opus om een resultaat te krijgen dat alleen maar overeenkomt met Opus' middenversnelling. Dat is de val. Uitgeknepen Sonnet 5 is voor veel taken het slechtste van twee werelden — Opus-geld voor sub-Opus-plafonds.
De naïeve lezing — "Sonnet 5 is goedkoper, zet 'm vol open en bespaar geld" — is bovenaan de knop dus precies omgekeerd. De besparingen zitten bij low en medium effort. Duw hem naar de top en je hebt vaak gewoon een tragere, duurdere Opus gebouwd.
Die asymmetrie is het enige belangrijkste om over dit model te internaliseren, en daarom is het antwoord op "Sonnet 5 of Opus 4.8?" nooit een plat antwoord.
Als je liever niet zelf deze knop over een agentvloot afregelt — het uitzoeken van effort-budgetten per taak is oprecht lastig werk — dan is dit precies het soort architectuur dat ik voor klanten bouw via mijn Fiverr-profiel. Maar je kunt het absoluut zelf, en de regel hieronder is waar ik zou beginnen.
Dus wanneer wint het goedkopere model echt?
Strip de nuance eraf en hier is het beslissingskader dat ik nu gebruik. Het is niet "welk model is beter". Het is "wat heeft deze specifieke taak nodig, en waar plaatst me dat op de curve".
Kies Sonnet 5 wanneer:
- Het werk routinematig tot matig complex is — contentgeneratie, classificatie, extractie, samenvatten, standaard CRUD-achtig coderen, het meeste kenniswerk. (Denk eraan: hij versloeg Opus op GDPval-AA v2.)
- Je op volume draait. Honderden aanroepen, parallelle agents, alles waar kosten per aanroep oplopen tot een echt getal.
- Tools in de lus zitten. Sonnet 5's redeneerkloof met Opus sluit bijna zodra hij kan zoeken en functies aanroepen.
- Je kunt leven met low of medium effort. Hier is het kostenvoordeel echt en onvoorwaardelijk.
Kies Opus 4.8 wanneer:
- De taak zwaar, autonoom coderen is — multi-file refactors, gemene debugging, lange agentic coding-runs. Die zespuntskloof op SWE-bench Pro is echt, en op oprecht moeilijke problemen stapelt hij zich op: Opus' token-efficiëntie betekent dat hij het antwoord vaak in minder dure stappen bereikt. Bij zeer complexe agentic-search- en computer-use-taken levert Opus vaak betere resultaten tegen lagere totale kosten dan uitgeknepen Sonnet 5, juist omdat hij de top van de knop niet nodig heeft om er te komen.
- Precisie is niet-onderhandelbaar en je hebt geen zin om de output te babysitten.
- Je stond op het punt Sonnet 5 op xhigh te zetten "voor de zekerheid". Als je dat plafond nodig hebt, gebruik dan gewoon Opus — die is aan de bovenkant goedkoper en beter.
De schone vuistregel: Sonnet 5 is de baas over de low-tot-medium-effort meerderheid van je workload; Opus 4.8 is de baas over de high-effort, high-precisie minderheid. De meeste teams zullen merken dat de meerderheid groter is dan ze verwachtten, en dat is precies waarom deze lancering ertoe doet. Voor het bredere agentic-coding-beeld specifiek ging ik diep in mijn hands-on kijk op Sonnet 5 voor agentic coding — deze post is de kosten-en-beslissings-metgezel ervan.
Er is nog één dimensie die helemaal niet op de benchmarkgrafiek verschijnt, en voor iedereen die agents met echte permissies uitrolt, is die misschien wel de belangrijkste.
Hoe zit het met veiligheid, alignment en security?
Kosten-prestatie is de kop. Maar als je een model tool-toegang, bestandstoegang of een browser geeft, houdt "hoe gedraagt het zich als het adversair wordt" op academisch te zijn. Hier is waar Sonnet 5 landt, met de nuance erbij.
Anthropic's pre-deployment-evaluaties vonden dat Sonnet 5 over het geheel een verbetering is ten opzichte van Sonnet 4.6. Op agentic safety specifiek is hij beter in het weigeren van kwaadaardige verzoeken en beter bestand tegen kaping-pogingen bij prompt-injection-aanvallen — precies het faalscenario dat mij wakker houdt wanneer een agent schrijftoegang tot wat dan ook heeft. Op de geautomatiseerde gedragsaudit die op verkeerd gealignde gedragingen zoals misleiding en meewerken aan misbruik controleert, scoorde Sonnet 5 veiliger dan zijn voorganger.
De eerlijke kanttekening: Sonnet 5 vertoonde iets hogere percentages verkeerd gealignd gedrag dan de capabelere Opus 4.8 en de Mythos Preview. Meer capaciteit heeft in deze familie tot nu toe gecorreleerd met betere alignment, en Sonnet 5 zit qua capaciteit onder Opus. Dus als je use case oprecht high-stakes en adversair is, is dat weer een streepje in Opus' voordeel — geen dealbreaker voor Sonnet 5, maar een reële factor.
Op cybersecurity is het nieuws stilletjes goed. Anthropic heeft Sonnet 5 niet doelbewust op cybertaken getraind. Hij handelt routineus, niet-schadelijk cyberwerk af, maar presteert aanzienlijk slechter dan Opus 4.8 en Mythos 5 op gevaarlijke capaciteiten zoals het ontwikkelen van software-exploits. Die zwakte is hier een pré: Sonnet 5 draagt niet het soort exploit-ontwikkelingscapaciteit dat ertoe leidde dat Anthropic zwaardere beperkingen en toezicht rond Mythos plaatste (ik schreef over die hele episode in de lanceringsanalyse van Fable 5 en Mythos 5). Het resultaat is een model dat rechttoe rechtaan en stabiel is om breed uit te rollen. Hij kwam ook uit met realtime cyberbeveiligingen standaard aan — dezelfde die Anthropic bij Opus 4.7 en 4.8 draaide.
Netto: voor het overgrote deel van agentic werk is Sonnet 5 veilig uit te rollen en beter gedragen dan de Sonnet die je vorige maand gebruikte. Voor de meest hoogrisico, meest adversaire scenario's heeft Opus nog steeds de voorsprong. Hetzelfde patroon als al het andere in deze vergelijking — en dat is geen toeval.
Waarom deze lancering groter is dan één model
Zoom even uit, want het per-token-argument mist het strategische punt.
Anthropic racet naar een grote IPO, en Sonnet 5 leest als een model dat net zo hard voor de API-token-markt is gebouwd als voor welke individuele gebruiker dan ook. De kosten-prestatieverhouding is momenteel het hele competitieve slagveld voor inference, en Sonnet 5 is er een directe zet voor — capabel genoeg om echte productie-workloads aan te kunnen, goedkoop genoeg om bake-offs tegen rivalen op prijs te winnen.
Voor het ecosysteem vult hij het midden op. Er zit nu een oprecht sterk Claude-model tussen de instaptier en het Opus/Fable/Mythos-plafond, precies gericht op iedereen die naar Fable's $10/$50 keek en het tabblad stilletjes sloot. Dat zijn veel mensen. Veel startups. Veel agents die opeens uitkomen.
En omdat Sonnet en Opus nu één kosten-prestatiecurve delen, verandert het architectuurgesprek. Je stopt met "welke tier is dit product?" te vragen en begint met "welk punt op de curve heeft elke taak nodig?" — goedkope taken naar Sonnet 5 op low effort routeren en Opus reserveren voor de zware minderheid. Dat is een gesofisticeerdere, kostenefficiëntere manier om te bouwen, en Sonnet 5 is het model dat het eindelijk praktisch maakt.
Het ene ding om deze week te doen
Neem mijn kader niet op geloof — en neem de benchmarks ook niet op geloof. Ze zijn richtinggevend, geen evangelie voor jouw workload.
Hier is het experiment van 30 minuten. Kies één taak die je systeem veel draait. Draai hem drie keer: Sonnet 5 op medium effort, Sonnet 5 op high effort, en Opus 4.8. Log de outputkwaliteit en de tokenkosten voor elk. Je zult vrijwel zeker een van twee dingen vinden — óf medium-effort Sonnet 5 is genoeg en je hebt zojuist de kosten van die taak met 60% verlaagd, óf de taak heeft oprecht Opus nodig en je hebt nu bewijs in plaats van een gevoel. Beide antwoorden zijn dertig minuten waard.
Denk eraan waar dit begon: mijn luie twee-tier snelkoppeling, "belangrijke taak, grijp naar Opus". Sonnet 5 heeft dat instinct niet gedood — het heeft het gescherpt. De vraag is niet langer welk model. Het is welk punt op de curve, taak voor taak. Regel die routering goed, en je draait het meeste van je werk op 40% van de kosten met kwaliteit die je niet uit elkaar kunt houden, terwijl je alleen Opus-geld uitgeeft waar het je daadwerkelijk iets oplevert.
De goedkope wint vaker dan je zou denken. Alleen niet aan de bovenkant van de knop.
Veelgestelde vragen
Is Claude Sonnet 5 beter dan Opus 4.8?
Over het geheel niet — maar dichterbij dan de prijskloof suggereert. Sonnet 5 blijft op de meeste benchmarks slechts een paar punten achter Opus 4.8 en verslaat hem zelfs op kenniswerk (GDPval-AA v2: 1618 tegenover 1615). Opus houdt een duidelijke voorsprong op zware agentic coding (SWE-bench Pro: 69,2% tegenover 63,2%). Voor het beslissingskader, zie "Dus wanneer wint het goedkopere model echt?" hierboven.
Hoeveel kost Claude Sonnet 5 vergeleken met Opus 4.8?
Sonnet 5 is $2 input / $10 output per miljoen tokens (introductieprijs tot en met 31 augustus 2026), daarna $3/$15. Opus 4.8 is $5/$25. Dus Sonnet 5 draait op ongeveer 40% van Opus' inputkosten en onder de helft van de outputkosten — een output-zware workload die $1.000/dag kost op Opus, landt rond de $400/dag op Sonnet 5.
Wat is de Sonnet 5 effort level-val?
Bij zijn hoogste effort-instellingen (xhigh en max) kan Sonnet 5 evenveel of meer kosten dan Opus 4.8, terwijl hij slechts Opus' medium-tot-high kwaliteit evenaart. Het kostenvoordeel zit bij low en medium effort — duw de knop naar de top en je betaalt vaak Opus-geld voor een sub-Opus-plafond. Volledige uitleg in de sectie "De effort-val" hierboven.
Is Claude Sonnet 5 veilig uit te rollen voor agents?
Ja, voor de meeste use cases. Sonnet 5 is beter dan Sonnet 4.6 in het weigeren van kwaadaardige verzoeken en het weerstaan van prompt-injection-kapingen, en hij kwam uit met realtime cyberbeveiligingen standaard aan. De kanttekening: hij vertoont iets hogere percentages verkeerd gealignd gedrag dan Opus 4.8, dus de meest hoogrisico adversaire workloads geven nog steeds de voorkeur aan Opus.
Wanneer kwam Claude Sonnet 5 uit?
Claude Sonnet 5 werd op 30 juni 2026 gelanceerd als standaardmodel voor Free- en Pro-abonnementen en is beschikbaar voor Max-, Team- en Enterprise-gebruikers plus via de API.
Voordat je een model kiest
Als je Sonnet 5 en Opus 4.8 in hetzelfde systeem aan het bedraden bent en de effort-budgetten per taak wilt afregelen voordat de factuur je het op de harde manier leert, dan is die kosten-versus-kwaliteit-routering precies het soort werk dat ik oppak — bereik me hier. Draai wel eerst het 30-minuten-experiment hierboven. De helft van de tijd vertelt het je dat medium-effort Sonnet 5 de klus al aankon.