Ungefahr ein Jahr lang war meine Logik zur Modellauswahl faul und funktionierte trotzdem: Wenn die Aufgabe wichtig war, griff ich zu Opus. Wenn nicht, griff ich zu Sonnet und akzeptierte, dass das Ergebnis eine Stufe schlechter sein wurde. Zwei Stufen, zwei Preise, eine saubere gedankliche Abkurzung.
Claude Sonnet 5 hat diese Abkurzung am 30. Juni 2026 zerbrochen, und ich stelle mich immer noch darauf ein.
Hier die Kurzfassung, denn du hast Claude Sonnet 5 vs. Opus 4.8 gesucht und verdienst die Antwort vor dem Scrollen: Sonnet 5 landet bei den meisten Benchmarks innerhalb weniger Punkte von Opus 4.8, schlagt es sogar bei Wissensarbeit und kostet pro Input-Token nur 40 % so viel. Aber es gibt eine Einstellung, die tief in der API vergraben ist – das Effort-Level –, die Sonnet 5 leise von "unglaubliches Schnappchen" zu "teurer als Opus fur dasselbe Ergebnis" umkippen lassen kann. Die gesamte Entscheidung lebt in diesem Detail, und fast niemand spricht daruber.
Also reden wir daruber. Nicht die Pressemitteilung. Die tatsachliche Mathematik, die Falle und die Regel, die ich jetzt nutze, um pro Aufgabe zwischen den beiden zu wahlen.
Wo Sonnet 5 in die Claude-Reihe passt
Sonnet 5 ist das neue Mittelklasse-Modell in der Claude-Familie – der Slot zwischen den Einstiegsmodellen und den Schwergewichten Opus und der Fable/Mythos-Linie. Auf dem Papier ist es "nur" ein Sonnet-Update. In der Praxis ist der Sprung von Sonnet 4.6 der grosste Generationensprung, den ich in dieser Klasse gesehen habe, und die Lucke zu Opus 4.8 ist auf etwas geschrumpft, das fur Anthropics eigene Preisstufen aufrichtig unangenehm ist.
Es ging am Launch-Tag als Standardmodell fur die Plane Free und Pro live und ist fur Max, Team, Enterprise sowie uber die API verfugbar. Wenn du Claude seit Ende Juni im Web genutzt und nichts geandert hast, hast du wahrscheinlich schon mit Sonnet 5 geredet, ohne es zu wissen.
Der Rahmen, nach dem alle griffen – TechCrunch, VentureBeat, The New Stack – war irgendeine Variante von "eine gunstigere Moglichkeit, Agenten zu betreiben". Das stimmt, aber es unterverkauft die strukturelle Verschiebung. Zum ersten Mal sitzen Sonnet und Opus auf einer einzigen Kosten-Leistungs-Kurve statt in zwei separaten Klassen. Die alte Trennung "gutes Modell / grossartiges Modell" ist jetzt "dieselbe Modellfamilie, wahle deinen Punkt auf der Kurve". Das andert, wie man alles architekturiert, das mehr als eine Handvoll Modellaufrufe macht.
Bevor wir zur Kurve kommen, schau, wo die Zahlen tatsachlich landen. Das ist der Teil, uber den das Marketing hinweggeht.
Das Benchmark-Bild, ehrlich gelesen
Hier ist Anthropics eigener Vergleich, und ich mochte ihn so lesen, wie ich ihn lesen wurde, bevor ich ein Projekt darauf setze – Spalte fur Spalte, nicht als Hype-Video.
Agentisches Coding, SWE-bench Pro: Sonnet 5 erreicht 63,2 %, aufwarts von Sonnet 4.6 mit 58,1 %, wobei Opus 4.8 mit 69,2 % weiter an der Spitze steht. Das ist die grosste saubere Lucke auf dem ganzen Board – sechs Punkte. Wenn deine Arbeitslast schweres, mehrdateiiges, autonomes Coding ist, ist das die Zahl, die dich innehalten lassen sollte. Opus ist hier bedeutend besser, und wir kommen darauf zuruck, warum diese Sechs-Punkte-Lucke wichtiger ist, als sie aussieht.
Agentisches Coding, Terminal-Bench 2.1: Sonnet 5 springt von 4.6s 67,0 % auf 80,4 % – ein Sprung von dreizehn Punkten in einer Generation. Wo Opus 4.8 auf diesem speziellen Prufstand landet, ist ehrlich umstritten: Manche Berichte setzen es ein paar Punkte vor Sonnet 5, andere mehrere Punkte dahinter, also hange ich keine Schlussfolgerung an Terminal-Bench, egal in welche Richtung. Was nicht umstritten ist: Sonnet 5 hat seinen eigenen Vorganger hier im Staub liegen lassen.
Multidisziplinares Reasoning, Humanity's Last Exam: Ohne Tools 43,2 % gegen Opus' 49,8 %. Mit Tools 57,4 % gegen Opus' 57,9 % – im Grunde ein Unentschieden. Das Tool-Use-Ergebnis ist verraterisch: Gib Sonnet 5 die Fahigkeit, zu suchen und Funktionen aufzurufen, und seine Reasoning-Lucke zu Opus verdunstet fast. Die meisten echten Agenten-Workloads haben Tools. Behalte das in der Hinterhand.
Computer Use, OSWorld-Verified: 81,2 % gegen Opus' 83,4 %. Zwei Punkte. Fur das Steuern eines Browsers oder Desktops ist das bei den meisten Aufgaben Rauschen.
Wissensarbeit, GDPval-AA v2: Sonnet 5 erzielt 1618. Opus 4.8 erzielt 1615. Das Mittelklasse-Modell hat gewonnen. Nicht mit Erdrutsch, aber es hat gewonnen – auf dem Benchmark, der "nutzliche professionelle Arbeit uber Disziplinen hinweg leisten" am nachsten kommt.
Trete zuruck, und die Form ist unverkennbar: minimaler Ruckgang gegenuber Opus fast uberall, ein klarer Sieg bei Wissensarbeit und genau eine Kategorie – hartes agentisches Coding –, in der Opus echten Vorsprung halt. Das ist ein bemerkenswert schmaler Burggraben fur ein Modell, das mehr als doppelt so viel kostet.
Was uns zum Geld bringt, denn die Benchmarks sind nur die Halfte der Entscheidung.
Die Preismathematik, die den Ausschlag gibt
Benchmarks sagen dir, was moglich ist. Der Preis sagt dir, was im Massstab bezahlbar ist. Und hier hort Sonnet 5 auf, interessant zu sein, und fangt an, disruptiv zu sein.
Pro Million Tokens sieht die Aufstellung zum Launch so aus:
- Fable 5 / Mythos 5: 10 $ Input / 50 $ Output – die Premium-Obergrenze
- Opus 4.8: 5 $ Input / 25 $ Output
- Sonnet 5: 2 $ Input / 10 $ Output
Lies die Sonnet-5-Zeile gegen Opus. Input ist 40 % der Opus-Kosten. Output ist weniger als die Halfte. Das ist kein Rabatt – das ist eine andere Budgetkategorie.
Ein Detail, das die Launch-Tages-Berichterstattung markiert hat und um das du herumplanen musst: Diese 2 $/10 $ sind Einfuhrungspreise, gultig bis zum 31. August 2026. Danach geht es hoch auf 3 $/15 $. Anthropic hat den Einfuhrungspreis so gesetzt, dass der Ubergang fur bestehende Sonnet-Nutzer ungefahr kostenneutral ist, aber wenn du eine Prognose auf diese Zahlen baust, modelliere den Preis nach August. 3 $/15 $ liegt immer noch deutlich unter Opus' 5 $/25 $ – es ist nur nicht der Schnappchenpreis der ersten zwei Monate.
Jetzt mach es konkret, denn Pro-Million-Token-Zahlen landen nicht, bis du sie skalierst. Die Zahl, die das fur mich neu gerahmt hat: Eine output-lastige Agenten-Workload, die auf Opus 4.8 grob 1.000 $/Tag kostet, landet auf Sonnet 5 bei rund 400 $/Tag zum Standardpreis. Fur einen Solo-Entwickler, der einen Agenten laufen lasst, wen interessiert's. Fur ein Team, das Hunderte Agenten parallel betreibt, ist das die Linie zwischen "dieses Produkt hat eine Unit Economics" und "dieses Produkt ist ein Wissenschaftsprojekt".
Das ist die eigentliche Geschichte. Nicht dass Sonnet 5 gut ist – viele Modelle sind gut. Sondern dass Sonnet 5 gut genug ist, um Opus fur die Mehrheit der Workloads optional aussehen zu lassen, wahrend es weniger als die Halfte kostet, sie zu betreiben. Fur alle, die aus Fable und Mythos preislich rausgedrangt wurden, ist gerade ein leistungsfahiges Claude-Modell in ein Budget gefallen, das sie tatsachlich verteidigen konnen.
Aber diese 60 % Ersparnis sind an Bedingungen geknupft. Es gibt eine Einstellung, die sie vollstandig ausloschen kann, und die meisten Teams werden es erst bemerken, wenn die Rechnung kommt.
Die Effort-Level-Falle, vor der dich niemand warnt
Hier ist der Teil, der diesem Artikel seine Existenz einbringt. Sonnet 5 legt Effort-Level offen – low, medium, high, xhigh und max ganz oben am Regler. Hoherer Effort bedeutet, dass das Modell mehr Tokens fur Reasoning ausgibt, bevor es antwortet. Mehr Reasoning-Tokens bedeuten bessere Qualitat und hohere Kosten. Output-Tokens sind, wo die Rechnung wohnt, und Reasoning verbrennt Output-Tokens.
Wenn du meine Aufschlusselung der Effort-Level von Opus 4.8 gelesen hast, weisst du schon, dass dieser Regler die halbe Zeit wichtiger ist als die Modellwahl selbst. Bei Sonnet 5 ist er noch wichtiger, denn der Regler entscheidet, ob du ein Schnappchen bekommst oder zu viel bezahlst.
Geh es so durch, wie die agentischen Suchergebnisse tatsachlich verlaufen:
Bei low effort schlagt Sonnet 4.6 Sonnet 5 immer noch bei der Trefferrate – Sonnet 5 landet auf der agentischen Suchaufgabe bei etwa 55 %. Sonnet 5 ist in dieser Einstellung gunstiger, du tauschst also etwas Genauigkeit gegen eine niedrigere Rechnung. Fein fur nachsichtige Hochvolumenarbeit.
Bei medium effort sind die beiden qualitativ vergleichbar, aber Sonnet 5 schafft es fur weniger. Das ist der Sweet Spot – die Einstellung, bei der "gunstiger und mindestens so gut" einfach stimmt, ohne Sternchen.
Bei high effort zieht Sonnet 5 qualitativ deutlich an 4.6 vorbei. Aber die Kosten klettern, und hier kommt der Haken: High-Effort-Sonnet-5 kostet ungefahr dasselbe wie High-Effort-Opus. Du hast dich zuruck auf Opus-Preisniveau ausgegeben.
Bei xhigh – und Sonnet 5 geht noch eine Stufe hoher, bis max – bist du fest im Opus-Geldbereich. Am oberen Ende des Reglers landet Sonnet 5 in OSWorld-Verified und dem BrowseComp-agentischen-Suche-Benchmark bei etwa der Medium-bis-High-Einstellung von Opus 4.8. Du zahlst moglicherweise mehr als Opus, um ein Ergebnis zu bekommen, das lediglich Opus' Mittelstufe entspricht. Das ist die Falle. Voll ausgereiztes Sonnet 5 ist fur viele Aufgaben das Schlechteste aus beiden Welten – Opus-Geld fur sub-Opus-Obergrenzen.
Also ist die naive Lesart – "Sonnet 5 ist gunstiger, dreh es auf und spare Geld" – am oberen Ende des Reglers genau falsch herum. Die Ersparnisse leben bei low und medium effort. Druck es nach oben, und du hast oft nur ein langsameres, teureres Opus gebaut.
Diese Asymmetrie ist das Wichtigste, was man uber dieses Modell verinnerlichen muss, und deshalb ist die Antwort auf "Sonnet 5 oder Opus 4.8?" nie eine flache.
Falls du diesen Regler nicht per Hand uber eine Agentenflotte einstellen mochtest – Per-Task-Effort-Budgets herauszufinden ist ehrlich fummelige Arbeit –, ist das genau die Art von Architektur, die ich fur Kunden uber mein Fiverr-Profil baue. Aber du kannst es absolut selbst machen, und die untenstehende Regel ist, wo ich anfangen wurde.
Also wann gewinnt das gunstigere Modell tatsachlich?
Reiss die Nuance ab, und hier ist das Entscheidungsraster, das ich jetzt benutze. Es ist nicht "welches Modell ist besser". Es ist "was braucht diese spezifische Aufgabe, und wo setzt mich das auf die Kurve".
Greif zu Sonnet 5, wenn:
- Die Arbeit ist routiniert bis mittelkomplex – Content-Generierung, Klassifikation, Extraktion, Zusammenfassung, standardmassiges CRUD-artiges Coding, die meiste Wissensarbeit. (Zur Erinnerung: Es hat Opus bei GDPval-AA v2 geschlagen.)
- Du lauft im Volumen. Hunderte Aufrufe, parallele Agenten, alles, wo Per-Call-Kosten sich zu einer echten Zahl aufaddieren.
- Tools sind im Loop. Sonnet 5s Reasoning-Lucke zu Opus schliesst sich fast, sobald es suchen und Funktionen aufrufen kann.
- Du kannst mit low oder medium effort leben. Hier ist der Kostenvorteil echt und unbedingt.
Greif zu Opus 4.8, wenn:
- Die Aufgabe ist hartes, autonomes Coding – Mehrfach-Datei-Refactors, knifflige Fehlersuche, lange agentische Coding-Laufe. Diese Sechs-Punkte-Lucke bei SWE-bench Pro ist echt, und bei ehrlich schwierigen Problemen verstarkt sie sich: Opus' Token-Effizienz bedeutet, dass es die Antwort oft in weniger teuren Schritten erreicht. Bei hochkomplexen agentischen Such- und Computer-Use-Aufgaben liefert Opus haufig bessere Ergebnisse zu niedrigeren Gesamtkosten als voll ausgereiztes Sonnet 5, gerade weil es nicht die Spitze des Reglers braucht, um dorthin zu kommen.
- Prazision ist nicht verhandelbar und du mochtest den Output lieber nicht babysitten.
- Du warst kurz davor, Sonnet 5 "zur Sicherheit" auf xhigh zu stellen. Wenn du diese Obergrenze brauchst, nimm einfach Opus – es ist am oberen Ende gunstiger und besser.
Die saubere Heuristik: Sonnet 5 gehort der Low-bis-Medium-Effort-Mehrheit deiner Workload; Opus 4.8 gehort der High-Effort-, High-Prazisions-Minderheit. Die meisten Teams werden feststellen, dass die Mehrheit grosser ist, als sie erwartet haben, und genau deshalb ist dieser Launch wichtig. Fur das breitere Bild speziell zum agentischen Coding bin ich in meinem Praxistest von Sonnet 5 fur agentisches Coding tief eingestiegen – dieser Beitrag ist der Kosten-und-Entscheidungs-Begleiter dazu.
Es gibt noch eine Dimension, die auf dem Benchmark-Chart uberhaupt nicht auftaucht, und fur alle, die Agenten mit echten Berechtigungen einsetzen, konnte sie die wichtigste sein.
Was ist mit Sicherheit, Alignment und Security?
Kosten-Leistung ist die Uberschrift. Aber wenn du einem Modell Tool-Zugriff, Dateizugriff oder einen Browser in die Hand druckst, hort "wie verhalt es sich, wenn es adversariell wird" auf, akademisch zu sein. Hier landet Sonnet 5, mit Vorbehalt.
Anthropics Pre-Deployment-Evaluierungen fanden, dass Sonnet 5 insgesamt eine Verbesserung gegenuber Sonnet 4.6 ist. Speziell bei agentischer Sicherheit ist es besser darin, schadliche Anfragen abzulehnen, und resistenter gegen Hijack-Versuche bei Prompt-Injection-Angriffen – genau der Fehlermodus, der mich nachts wach halt, wenn ein Agent Schreibzugriff auf irgendetwas hat. Beim automatisierten Verhaltensaudit, das nach fehlausgerichtetem Verhalten wie Tauschung und Kooperation mit Missbrauch sucht, schnitt Sonnet 5 sicherer ab als sein Vorganger.
Der ehrliche Vorbehalt: Sonnet 5 zeigte etwas hohere Raten fehlausgerichteten Verhaltens als das leistungsfahigere Opus 4.8 und die Mythos Preview. Mehr Fahigkeit hat bisher in dieser Familie mit besserem Alignment korreliert, und Sonnet 5 sitzt bei der Fahigkeit unter Opus. Wenn dein Anwendungsfall also ehrlich hochriskant und adversariell ist, ist das ein weiterer Strich in Opus' Spalte – kein Deal-Breaker fur Sonnet 5, aber ein echter Faktor.
Bei Cybersecurity ist die Nachricht leise gut. Anthropic hat Sonnet 5 nicht absichtlich auf Cyber-Aufgaben trainiert. Es bewaltigt routinierte, harmlose Cyber-Arbeit, schneidet aber bei gefahrlichen Fahigkeiten wie der Entwicklung von Software-Exploits substanziell schlechter ab als Opus 4.8 und Mythos 5. Diese Schwache ist hier ein Feature: Sonnet 5 tragt nicht die Art von Exploit-Entwicklungs-Fahigkeit, die Anthropic dazu brachte, um Mythos herum starkere Beschrankungen und Prufung zu setzen (ich habe uber diese ganze Episode in der Fable-5-und-Mythos-5-Launch-Aufschlusselung geschrieben). Das Ergebnis ist ein Modell, das unkomplizierter und stabiler breit einzusetzen ist. Es wurde auch mit standardmassig aktiven Echtzeit-Cyber-Schutzmassnahmen ausgeliefert – denselben, die Anthropic auf Opus 4.7 und 4.8 laufen liess.
Netto: Fur die grosse Mehrheit agentischer Arbeit ist Sonnet 5 sicher einzusetzen und besser benommen als das Sonnet, das du letzten Monat benutzt hast. Fur die riskantesten, adversariellsten Szenarien hat Opus noch die Nase vorn. Dasselbe Muster wie alles andere in diesem Vergleich – und das ist kein Zufall.
Warum dieser Launch grosser ist als ein Modell
Zoom eine Sekunde raus, denn das Per-Token-Argument verfehlt den strategischen Punkt.
Anthropic rast auf einen grossen IPO zu, und Sonnet 5 liest sich wie ein Modell, das genauso fur den API-Token-Markt wie fur einen einzelnen Nutzer gebaut wurde. Das Kosten-Leistungs-Verhaltnis ist gerade das gesamte Wettbewerbsschlachtfeld fur Inferenz, und Sonnet 5 ist ein direkter Spielzug dafur – fahig genug, echte Produktionsworkloads zu bewaltigen, gunstig genug, um Bake-offs gegen Rivalen beim Preis zu gewinnen.
Fur das Okosystem fullt es die Mitte. Es sitzt jetzt ein ehrlich starkes Claude-Modell zwischen der Einstiegsklasse und der Opus/Fable/Mythos-Decke, gerichtet direkt an alle, die auf Fables 10 $/50 $ schauten und leise den Tab schlossen. Das sind viele Leute. Viele Startups. Viele Agenten, die sich plotzlich rechnen.
Und weil Sonnet und Opus jetzt eine Kosten-Leistungs-Kurve teilen, andert sich die Architekturdiskussion. Du horst auf zu fragen "welche Klasse ist dieses Produkt?" und fangst an zu fragen "welchen Punkt auf der Kurve braucht jede Aufgabe?" – gunstige Aufgaben zu Sonnet 5 bei low effort routen, Opus fur die schwere Minderheit reservieren. Das ist eine ausgefeiltere, kosteneffizientere Bauweise, und Sonnet 5 ist das Modell, das sie endlich praktikabel macht.
Die eine Sache, die du diese Woche tun solltest
Nimm mein Framework nicht auf Vertrauen an – und nimm auch die Benchmarks nicht auf Vertrauen an. Sie sind richtungsweisend, kein Evangelium fur deine Workload.
Hier ist das 30-Minuten-Experiment. Nimm eine Aufgabe, die dein System oft ausfuhrt. Fuhre sie dreimal aus: Sonnet 5 bei medium effort, Sonnet 5 bei high effort und Opus 4.8. Logge Output-Qualitat und Token-Kosten fur jede. Du wirst mit ziemlicher Sicherheit eines von zwei Dingen finden – entweder ist Medium-Effort-Sonnet-5 vollig ausreichend und du hast gerade die Kosten dieser Aufgabe um 60 % gesenkt, oder die Aufgabe braucht ehrlich Opus, und du hast jetzt einen Beweis statt einer Ahnung. Beide Antworten sind dreissig Minuten wert.
Erinnere dich, wo das anfing: meine faule Zwei-Klassen-Abkurzung, "wichtige Aufgabe, greif zu Opus". Sonnet 5 hat diesen Instinkt nicht getotet – es hat ihn geschliffen. Die Frage ist nicht mehr welches Modell. Sie ist welcher Punkt auf der Kurve, Aufgabe fur Aufgabe. Bring dieses Routing hin, und du wirst den grossten Teil deiner Arbeit zu 40 % der Kosten mit qualitativ ununterscheidbarem Ergebnis laufen lassen, wahrend du Opus-Geld nur dort ausgibst, wo es dir tatsachlich etwas kauft.
Das gunstige gewinnt ofter, als du denken wurdest. Nur nicht am oberen Ende des Reglers.
Haufig gestellte Fragen
Ist Claude Sonnet 5 besser als Opus 4.8?
Insgesamt nicht – aber naher, als die Preislucke vermuten lasst. Sonnet 5 liegt bei den meisten Benchmarks nur wenige Punkte hinter Opus 4.8 und schlagt es tatsachlich bei Wissensarbeit (GDPval-AA v2: 1618 vs. 1615). Opus halt einen klaren Vorsprung bei hartem agentischen Coding (SWE-bench Pro: 69,2 % vs. 63,2 %). Fur das Entscheidungsraster siehe "Also wann gewinnt das gunstigere Modell tatsachlich?" oben.
Was kostet Claude Sonnet 5 im Vergleich zu Opus 4.8?
Sonnet 5 kostet 2 $ Input / 10 $ Output pro Million Tokens (Einfuhrungspreis bis 31. August 2026), dann 3 $/15 $. Opus 4.8 kostet 5 $/25 $. Sonnet 5 lauft also bei rund 40 % der Opus-Input-Kosten und unter der Halfte der Output-Kosten – eine output-lastige Workload, die auf Opus 1.000 $/Tag kostet, landet auf Sonnet 5 bei rund 400 $/Tag.
Was ist die Effort-Level-Falle von Sonnet 5?
Bei den hochsten Effort-Einstellungen (xhigh und max) kann Sonnet 5 genauso viel oder mehr kosten als Opus 4.8, wahrend es nur Opus' Medium-bis-High-Qualitat erreicht. Der Kostenvorteil lebt bei low und medium effort – druck den Regler nach oben, und du zahlst oft Opus-Geld fur eine sub-Opus-Obergrenze. Vollstandige Aufschlusselung im Abschnitt "Die Effort-Level-Falle" oben.
Ist Claude Sonnet 5 sicher fur den Einsatz mit Agenten?
Ja fur die meisten Anwendungsfalle. Sonnet 5 ist besser als Sonnet 4.6 darin, schadliche Anfragen abzulehnen und Prompt-Injection-Hijacks zu widerstehen, und es wurde mit standardmassig aktiven Echtzeit-Cyber-Schutzmassnahmen ausgeliefert. Der Vorbehalt: Es zeigt etwas hohere Raten fehlausgerichteten Verhaltens als Opus 4.8, sodass die riskantesten adversariellen Workloads weiterhin Opus bevorzugen.
Wann kam Claude Sonnet 5 heraus?
Claude Sonnet 5 wurde am 30. Juni 2026 gestartet, als Standardmodell fur die Plane Free und Pro, und ist fur Max-, Team- und Enterprise-Nutzer sowie uber die API verfugbar.
Bevor du ein Modell wahlst
Wenn du Sonnet 5 und Opus 4.8 in dasselbe System verdrahtest und die Per-Task-Effort-Budgets eingestellt haben mochtest, bevor die Rechnung dich auf die harte Tour belehrt, ist dieses Kosten-gegen-Qualitat-Routing genau die Art von Arbeit, die ich ubernehme – erreiche mich hier. Fuhre zuerst das 30-Minuten-Experiment oben durch. Die Halfte der Zeit sagt es dir, dass Medium-Effort-Sonnet-5 den Job schon abgedeckt hatte.