Skip to main content
Claude Code

Sonnet 4.8, GPT-5.5 Cyber, Alpha & Codex: Meine Woche

Sonnet 4.8-Leaks, GPT-5.5 Cyber, OpenRouter Alpha Mystery-Modelle und Codex als Super-App — mein ehrlicher Blick auf die KI-Woche, die wirklich zählte.

18 min
Lesezeit
3,425
Wörter
Veröffentlicht
Engr Mejba Ahmed

Geschrieben von

Engr Mejba Ahmed

Artikel teilen

Sonnet 4.8, GPT-5.5 Cyber, Alpha & Codex: Meine Woche

Ich hätte diese Woche fast an mir vorbeiziehen lassen.

Ich hatte eine brennende Kundenlieferung, zwei Repos mitten in der Migration und eine Codex-Routine, die über Nacht leicht verwildert war. Als also mein Slack am Mittwoch um 7:14 Uhr mit einem Screenshot einer Anthropic-Quellcode-Referenz auf "Sonnet 4.8" aufleuchtete — in derselben Woche, in der das UK AI Security Institute eine öffentliche Evaluation veröffentlichte, bei der GPT-5.5 Claude Mythos bei offensiver Cybersicherheit entweder gleichkam oder übertraf, in derselben Woche, in der ein Stealth-Modell namens "Alpha" begann, die OpenRouter-Charts anzuführen, und in derselben Woche, in der OpenAI leise Codex in etwas verwandelte, das verdächtig nach einer Super-App aussieht — hätte ich fast das Verantwortungsvolle getan und alles bis zum Wochenende ignoriert.

Das tat ich nicht. Ich verbrachte zwei Abende damit, zu testen, was ich tatsächlich in die Hände bekommen konnte, die Leak-Berichterstattung zu lesen und die AISI-Evaluation Zeile für Zeile auseinanderzunehmen. Was ich fand, ist interessanter als die Schlagzeilen vermuten lassen, und die Schlagzeilen waren schon laut.

Dies ist mein Wochenrückblick für die sieben Tage, in denen die KI-Roadmap, die ich zu verstehen glaubte, still umgeschrieben wurde. Wenn du meine Signal-versus-Rauschen-Analyse von April 2026 gelesen hast, ist dies die natürliche Fortsetzung. Das Signal-Rausch-Verhältnis ist diese Woche deutlich höher. Fast jede Entwicklung auf dieser Liste wird beeinflussen, wie ich nächsten Monat arbeite.

Vier Stränge. Lass mich jeden einzelnen in der Reihenfolge durchgehen, in der er mein Denken tatsächlich verändert hat.

Strang 1: Beim Sonnet 4.8-Leak geht es nicht wirklich um Sonnet 4.8

Anthropic hatte einen schwierigen März. Zwei separate Sicherheitsvorfälle — ein öffentlich zugängliches internes CMS, das am 26. März exponiert wurde, dann 512.000 Zeilen TypeScript-Quellcode von Claude Code, die einige Tage später versehentlich auf npm veröffentlicht wurden — gaben der Außenwelt zusammen den detailliertesten Einblick in Anthropics Roadmap, den ich je gesehen habe, und wahrscheinlich mehr, als das Unternehmen je teilen wollte. Fortune brachte beide Geschichten. Das npm-Leak war besonders schmerzhaft, weil es Verweise auf eine Modellfamilie enthielt, die Anthropic noch nicht offiziell benannt hatte.

Das ist es, was die Leaks tatsächlich enthüllten, basierend auf dem, was über Fortunes Berichterstattung, Decoder-Berichterstattung und Folgeanalysen unabhängiger Forscher bestätigt wurde:

  • Opus 4.7 — bereits Mitte April 2026 ausgeliefert, öffentlich, dokumentiert
  • Sonnet 4.8 — im Code referenziert, erwartet Mai 2026, Verbesserungen bei Vision und Instruktionsbefolgung impliziert
  • Mythos — die nächste Generation über der aktuellen Opus/Sonnet-Aufteilung, derzeit in eingeschränkter Vorschau
  • Capybara — ein geleakter Tier-Name, positioniert über Opus, was darauf hindeutet, dass der Stammbaum bald eine neue Spitze bekommt
  • Undercover Mode — ein Flag, das ich nirgendwo in der offiziellen Dokumentation erklärt gefunden habe
  • 44 Feature Flags — die Art von Detail, die niemand außerhalb von Anthropic lesen sollte

Die Schlagzeileninterpretation in den meisten Medien lautete: "Anthropic hat versehentlich enthüllt, dass Sonnet 4.8 im Mai kommt." Dieser Teil ist technisch korrekt. Er ist auch der am wenigsten interessante Teil.

Wozu ich immer wieder zurückkomme, ist die Form der Roadmap. Vor zweieinhalb Jahren lieferte Anthropic eine Modellfamilie mit einer Klein/Mittel/Groß-Aufteilung. Die heute geleakte Struktur zeigt mindestens vier benannte Tiers in gleichzeitiger aktiver Entwicklung: eine Arbeitspferd-Sonnet-Linie, die in einem Rhythmus von ungefähr sechs bis acht Wochen iteriert, eine Opus-Linie, die bewusst voraus gehalten wird, eine Mythos-Linie, die das darstellt, was Anthropic selbst als "Quantensprung" in der Fähigkeit bezeichnete, und ein Capybara-Tier oberhalb von Opus, das niemand in der Analystengemeinschaft vollständig verstanden hat.

Als ich mich in die Mythos-Leak-Berichterstattung vertiefte, fiel mir auf, wie ernst Anthropic selbst die Cybersicherheitsimplikationen seines eigenen Modells zu nehmen scheint. Die geleakten Dokumente räumen ein, dass Mythos "Cybersicherheitsrisiken erheblich erhöhen könnte, indem es schnell Software-Schwachstellen findet und ausnutzt" — eine Sprache, die weniger nach Marketing und mehr nach einer behördlichen Einreichung klingt. Diese Rahmung ist wichtig, weil sie den nächsten Strang dieser Wochengeschichte einleitet.

Sonnet 4.8 wird wahrscheinlich unspektakulär erscheinen. Bessere Vision, bessere Instruktionsbefolgung, gleiche Preisgestaltung von $3/$15 pro Million Token, die üblichen inkrementellen Coding-Benchmark-Gewinne. Ich werde es am Tag der Veröffentlichung testen. Aber das Modell, das niemand außerhalb der Project-Glasswing-Partner testet — Mythos — ist dasjenige, über das ich immer wieder nachdenke.

Es gibt eine ausführlichere Behandlung des Leaks in meinem Anthropic Claude Mythos Leak-Post und eine längere cybersicherheitsspezifische Analyse in Claude Mythos Cybersecurity Impact. Ich werde das hier nicht wiederholen. Worauf ich mich konzentrieren möchte, ist, was als Nächstes passierte.

Denn was als Nächstes passierte, ist, dass OpenAI ein Modell veröffentlichte, das Mythos auf dem einzigen öffentlichen Benchmark, an dem beide gemessen wurden, einen Schlag versetzte.

Strang 2: GPT-5.5 sollte eigentlich nicht die Cybersicherheitsgeschichte sein

Das UK AI Security Institute (AISI) ist eine der wenigen Organisationen auf dem Planeten, die echte Cybersicherheitsevaluierungen gegen Frontier-Modelle mit öffentlicher Methodik und glaubwürdiger technischer Tiefe durchführt. Ihre Evaluierungssuite verwendet 95 Capture-the-Flag-Aufgaben über vier Schwierigkeitsstufen — leicht, mittel, schwer und Experte — die Reverse Engineering, Exploit-Entwicklung für verschiedene Speichersicherheitsfehler, kryptografische Angriffe, Netzwerk-Pivoting und das Entpacken verschleierter Malware umfassen. Das sind keine Spielzeugprobleme. Die "Experten"-Stufe ist gegen Aufgaben kalibriert, die menschliche Sicherheitsfachleute als nicht-trivial betrachten.

AISI veröffentlichte ihre GPT-5.5-Evaluierung am 30. April 2026. Die Schlagzeilenzahl, die Decoder aufgriff, ist, dass GPT-5.5 eine Erfolgsquote von 71,4% bei den Experten-Tier-offensiven Cyberaufgaben erreichte — statistisch gleichauf mit Claude Mythos Preview, dem Modell, um das sich Anthropic so sorgte, dass der Zugang über Project Glasswing eingeschränkt wurde.

Ich habe den AISI-Bericht zweimal gelesen. Drei Dinge fielen auf, die die Schlagzeilenberichterstattung übersah.

Erstens: Das "Last Ones"-Ergebnis ist die eigentliche Geschichte. Vergraben in der Evaluierung steckt eine 32-Schritte-End-to-End-Unternehmensnetzwerk-Angriffssimulation namens "The Last Ones." Ein menschlicher Experte braucht etwa 20 Stunden, um sie durchzuarbeiten. GPT-5.5 schloss die vollständige Kette in 2 von 10 Versuchen ab. Mythos Preview schaffte es in 3 von 10. Beide Ergebnisse sind einzeln alarmierend. Zusammen gelesen markieren sie, dass wir in ein Regime eingetreten sind, in dem ein Frontier-Modell autonom mehrstufige offensive Operationen ausführen kann, die zuvor Senior-Penetrationstester erforderten.

Zweitens: Die Kosten-und-Latenz-Zahlen sind der unterschätzte Teil der Evaluierung. Wenn GPT-5.5 bei diesen Aufgaben erfolgreich ist, ist es schnell. Die Last-Ones-Ausführungskosten werden in einstelligen Dollar pro Versuch und Minuten Wanduhrzeit gemessen. Die gleiche Kette durch einen menschlichen Experten kostet, was ein Senior-Pentester über 20 Stunden verdient, plus den Koordinierungsaufwand. Die wirtschaftliche Asymmetrie ist der Teil, der CISOs wach halten sollte.

Drittens: AISI fand einen universellen Jailbreak. Derselbe Bericht vermerkt, dass AISI-Red-Teamer einen einzelnen universellen Prompt identifizierten, der über jede bösartige Cyberanfrage, die OpenAI zum Testen bereitstellte, regelwidriges Verhalten auslöste. Der Angriff benötigte sechs Stunden Expert-Red-Teaming zur Entwicklung. Sechs Stunden. Für einen universellen Jailbreak. Auf dem Modell, das gerade Mythos bei offensiver Cyber gleichkam.

Dieser letzte Befund ist der Grund, warum die nächste Ankündigung anders landete, als die meisten Menschen es wohl verarbeitet haben.

GPT-5.5 Cyber und die Distributionsfrage

Am 30. April, demselben Tag, an dem der AISI-Bericht erschien, kündigte Sam Altman GPT-5.5 Cyber an — eine spezialisierte Variante, feinabgestimmt für Sicherheitsworkflows, die zunächst an einen geprüften Pool von "kritischen Cyberverteidigern" über OpenAIs neues Trusted Access for Cyber-Programm geht. Regierungsstellen, Betreiber kritischer Infrastruktur, Sicherheitsanbieter, Cloud-Provider und Finanzinstitutionen erhalten ihn zuerst. Die breitere Einführung ist gestaffelt.

Die Rahmung, die OpenAI verwendete, ist faszinierend. Zwei Wochen zuvor hatte Altman Anthropics Project-Glasswing-Ansatz für Mythos öffentlich als zu restriktiv kritisiert. Nun rollte OpenAI Cyber über ein Vetting-Programm aus. TechCrunch und The Register wiesen beide auf die Inkonsistenz hin. Ich denke, die Inkonsistenz ist tatsächlich das Ehrlichste, was beide Labs in Sachen Cyber getan haben.

Hier ist die Sache, die niemand auf beiden Seiten sauber aussprechen wollte: Es gibt keine gute Distributionspolitik für ein Frontier-offensives-Cybermodell. Beschränke es und die bösen Akteure kommen trotzdem über Open-Source-Modelle, die sechs Monate später folgen. Open-Source es und du hast jedem Bedrohungsakteur einen Kraftmultiplikator gegeben. Verkaufe es unter Unternehmenslizenz und du hast ein Klassensystem in der defensiven Sicherheit geschaffen, in dem Fortune-100-Banken Zugang zu Schwachstellenerkennungstools haben, die kommunale Wasserwerke nicht haben.

Zu beobachten, wie Anthropic und OpenAI trotz ihrer öffentlichen Positionierung auf ungefähr dieselbe restriktive Antwort konvergieren, sagt mir, dass beide Unternehmen die Rechnung aufgemacht und zum selben Schluss gekommen sind. Dieser Schluss lautet: "Wir wissen eigentlich nicht, was wir tun sollen, also fangen wir eng an und erweitern vorsichtig." Ich halte das für die ehrliche Position. Ich denke auch, dass die Open-Source-Labs sie innerhalb von zwölf Monaten irrelevant machen werden.

Für meine eigene Arbeit ist die praktische Implikation klar. Ich werde keinen Hands-on-Zugang zu Mythos oder GPT-5.5 Cyber bekommen. Die meisten Leser dieses Posts auch nicht. Was wir bekommen werden, ist der Windschatten — die öffentlichen Sonnet 4.8- und GPT-5.5-Basismodelle, die von denselben Trainingsfortschritten profitieren, minus der offensiven Cyber-Feinabstimmungen. Das sind die Modelle, die im nächsten Quartal in unseren IDEs und Terminals sitzen werden. Sie werden messbar besser im Code-Reasoning als Nebeneffekt der Cyberarbeit, und das ist es wert, beachtet zu werden, selbst wenn man nie einen Exploit im Leben ausführt.

Für tieferen Kontext darüber, wie ich über agentisches Coding-Capability-Creeping nachdenke, behandelt mein GPT-5.5 vs Opus 4.7 Vergleich die Modell-gegen-Modell-Seite, und mein früheres Mythos und DeepSeek V4 Autonomie-Stück geht auf die Open-Source-Frage ein.

Strang 3: Alpha ist das interessanteste Mystery-Modell, das OpenRouter je gehostet hat

OpenRouter führt seit über einem Jahr regelmäßig Stealth-Modell-Launches durch. Quasar Alpha war das erste, das mir auffiel. Optimus Alpha kam danach. Pony Alpha raste im Februar 2026 durch die Ranglisten und verarbeitete an seinem ersten Tag über 40 Milliarden Token, bevor Zhipu AI leise bestätigte, dass es sich um ihr GLM-5-System handelte. Ich schrieb über diesen gesamten Bogen in GLM-5 Pony Alpha getestet, und das Muster war konsistent: Ein chinesisches Lab nutzt OpenRouter als unauffälligen öffentlichen Belastungstest, bevor das Modell unter seinem echten Namen formal angekündigt wird.

Diese Woche erschien eine neue Stealth-Auflistung auf OpenRouter mit dem einfachen Label "Alpha" — unterschiedlich von den früheren Tier-Codenamen-Releases. Die Capabilities-Beschreibung auf der Auflistung liest sich wie eine Wunschliste: Hochleistungs-Basismodell, starke agentische Workloads, Tool-Calling-Genauigkeit, langer Kontext, Code-Generierung, automatisierte Workflows, Kompatibilität mit Claude Code und OpenCode und ähnlichen Produktivitätstools.

Ich gab ihm am Mittwochabend drei Stunden. Hier ist, was ich beobachtete.

Das Modell ist schnell. Die Tool-Calling-Latenz liegt näher an GPT-5.5-mini als an Opus 4.7 bei denselben Workflows. Die Code-Generierungsqualität bewegt sich im Bereich von Sonnet 4.6 — deutlich hinter Opus 4.7 bei schwierigem Reasoning, aber weit vor den Open-Source-Baselines des letzten Jahres. Das Langkontext-Verständnis fühlt sich echt an, aber ich habe es nicht über 400K Token hinaus getrieben, daher kann ich die 1M-Kontext-Behauptung nicht mit Sicherheit verifizieren. Agentische Workflows hielten über eine vierstufige Recherche-und-Zusammenfassungsaufgabe stand, bei der einige kleinere Modelle mittendrin abbrechen.

Was ich nicht sagen kann, ist, wer es gebaut hat. Die Kandidatenliste, basierend auf dem etablierten Muster und auf Response-Stilanalysen, die Leute auf OpenRouter durchgeführt haben, umfasst:

  • DeepSeek V4 — lang gemunkelt, würde den agentischen Tool-Fokus erklären
  • Zhipu AIs nächste Iteration über GLM-5 — wenn Pony Alpha GLM-5 war, könnte dies GLM-6 sein
  • MiniMax M2.x — MiniMax ist auf dem Vormarsch und die Namenskonvention passt
  • Qwen 3.x Update — Alibabas Qwen-Team war still, möglicherweise zu still
  • Ein westliches Lab — weniger wahrscheinlich angesichts des OpenRouter-Stealth-Musters, aber nicht unmöglich

Mein Bauchgefühl sagt chinesisches Open-Weights-Lab, wahrscheinlich Zhipu oder MiniMax, wahrscheinlich eine Reaktion auf DeepSeeks Positionierung oder auf die GPT-5.5-Veröffentlichung. Der Grund, warum ich denke, dass es wichtig ist, ist nicht das Modell selbst, sondern die Kadenz. Open-Source-ausgerichtete Labs liefern jetzt Frontier-nahe Capability ungefähr vier bis sechs Monate hinter den geschlossenen Labs. Die Kompression ist real. Die Mythos-vs-Cyber-Distributionsfrage, die ich oben gerahmt habe, wird durch diesen Trend gelöst, nicht durch Politikdebatten. Innerhalb eines Jahres wird die offensive Cyber-Capability, die derzeit auf Project-Glasswing-Partner und TAC-zugelassene Unternehmen beschränkt ist, auf dem Laptop von jemandem über einen Hugging-Face-Download laufen.

Wenn du Alpha selbst testen möchtest, ist es zum Zeitpunkt des Schreibens noch gelistet und kostenlos abfragbar. Ich würde keinen Produktionsverkehr darauf leiten — Stealth-Listings verschwinden ohne Vorankündigung und die Herkunft ist nicht verifiziert — aber zur Capability-Kalibrierung sind die dreißig Minuten es wert.

Strang 4: Codex wurde leise zur Super-App, und ich glaube, OpenAI hat das Quartal gewonnen

Ich betreibe OpenAI Codex als täglichen Begleiter neben Claude Code seit Monaten. Mein ehrlicher Hands-on-Test steht in openai-codex-super-app-tested. Das April-Update war wichtig. Das Mai-Update ist größer.

Hier ist, was sich geändert hat, basierend auf OpenAIs eigener Ankündigung und der anschließenden Berichterstattung:

  • Computer Use wurde auf macOS ausgeliefert. Codex hat jetzt einen eigenen Cursor. Es klickt, tippt, liest den Bildschirm und bedient Hintergrundfenster, während du weiterarbeitest.
  • Der Plugin-Marktplatz wuchs auf über 90 Integrationen. Gmail, Google Drive, Docs, Sheets, Slack, Notion, die vollständige Microsoft 365-Suite (Outlook, Excel, Word, PowerPoint, Teams, SharePoint), Atlassian Rovo, Jira, Confluence, GitLab, GitHub, Linear, CircleCI, CodeRabbit, Figma, Render, Neon, Salesforce, HubSpot, Zendesk. Die Liste liest sich wie jedes B2B-Tool, für das du dich je angemeldet hast. The Decoder hat eine gute Zusammenfassung.
  • Das Chronicle-Gedächtnissystem ist standardmäßig aktiviert. Codex merkt sich jetzt Kontext über Tage hinweg. Der Agent, der am Dienstag mit der Überprüfung eines PRs begonnen hat, nimmt am Donnerstag denselben Faden wieder auf, ohne die Codebasis erneut erklären zu müssen.
  • Mehrtägige Automatisierungen sind erstklassig. Wiederkehrende Aufgaben — monatliche Finanzabstimmung, wöchentliche Projektbriefings, Pipeline-Reviews — werden geplant und laufen autonom.
  • Rollenbasierte Setup-Wizards für Finanzen, Marketing, Operations, Recht, HR und Engineering, jeweils mit vorkonfigurierten Tool-Integrationen und Prompt-Vorlagen.

Die rollenbasierten Setup-Wizards sind der Teil, über den niemand richtig spricht. OpenAI positionierte Codex als Entwicklertool. Das April-zu-Mai-Update repositionierte es explizit als Wissensarbeiter-Tool mit noch angehängten Entwicklerfunktionen. Diese Repositionierung zeigt sich im Marketingtext ("Codex for almost everything"), in den Rollen-Wizards und vor allem in der Integrationsabdeckung — Excel, PowerPoint und Outlook sind keine Entwicklerintegrationen.

Die Wettbewerbsanalyse ist interessant. Codex ist nun direkt positioniert gegen:

  • Claude Code mit Routines und Computer Use — Anthropics äquivalenter Stack, derzeit ausgefeilter bei Coding-Workflows, aber weniger breit bei Integrationen
  • Microsoft 365 Copilot — der den Integrationsgraben hat, aber einen schwächeren Reasoning-Kern
  • Google Workspace Gemini — stark bei Google Workspace, schwach überall sonst
  • Maßgeschneiderte Enterprise-Agents gebaut auf Workspace Agents, OpenAIs Enterprise-Framework

Ich betreibe sowohl Codex als auch Claude Code parallel seit über einem Jahr. Meine ehrliche Einschätzung nach diesem Update: Codex hat Claude Code in der Breite überholt, während Claude Code beim reinen Coding-Workflow-Feinschliff noch vorne liegt. Wenn du nur eines haben kannst, wähle danach, ob du Tiefe oder Breite brauchst. Wenn du beides betreiben kannst — und ich tue es — solltest du es. Mein Codex plus Claude Code Zwei-Agenten-Workflow Post legt dar, wie ich die Arbeit zwischen ihnen aufteile.

Das Update, das mir in der Praxis am meisten auffällt, ist speziell das Slack-Plugin. Codex zieht Kanalkontext, entwirft Antworten, fasst lange Threads zusammen und kann Kanäle moderieren. Diese letzte Fähigkeit ist ein Hinweis. OpenAI baut nicht mehr einen Codierassistenten. Sie bauen einen Betriebsagenten, der bei Bedarf Code schreibt.

Für eine breitere Berichterstattung zum Super-App-Aspekt geht mein Codex AI Super App GPT-5.5 Workflow-Test tiefer auf das Mehrtages-Automatisierungsmuster ein und wie ich es für Kundenarbeit genutzt habe.

Wie diese vier Stränge zusammenhängen (und warum es für deinen Workflow wichtig ist)

Zusammen gelesen ist die Nachrichtenlage dieser Woche eine Geschichte, nicht vier.

Das Sonnet 4.8-Leak zeigt, dass Anthropics Roadmap über vier Modellschichten gleichzeitig beschleunigt. Die GPT-5.5-Cybersicherheits-Benchmarks zeigen, dass Frontier-Capability als Nebeneffekt besseren Reasonings und Tool-Einsatzes von Coding in offensive Cyber überschwappt. Das Alpha-Mystery-Modell auf OpenRouter zeigt, dass Open-Source-orientierte Labs den Abstand auf unter sechs Monate komprimieren. Das Codex-Super-App-Update zeigt, dass die geschlossenen Labs um die Wette rennen, die Distribution zu sichern, bevor die offenen Labs aufholen.

Die strukturelle Lesart: Geschlossene Labs sprinten gleichzeitig bei Capability und Distribution, wohlwissend, dass die offenen Labs die Capability-Schicht innerhalb eines Jahres commoditisieren werden. Ihre Wette ist, dass Distribution — die Integrationsgräben mit Slack, Microsoft, Google, die rollenbasierten Workflows, das mehrtägige Gedächtnis — das ist, was nicht commoditisiert wird.

Wenn du Software beruflich baust, hat diese Wette direkte Konsequenzen dafür, wie du die nächsten neunzig Tage verbringen solltest. Ich sehe vier:

Erstens: Hör auf, deine Prompts zu optimieren, und fang an, deine Tool-Integrationen zu optimieren. Das Modell wird besser werden. Deine Prompt-Engineering-Fähigkeit wird weniger kompoundieren als deine Fähigkeit, Tools, MCPs und Integrationen zusammenzuschalten. Ich verwende jetzt ein Verhältnis von zwei zu eins für Integrationsarbeit gegenüber Prompt-Design. Vor sechs Monaten war dieses Verhältnis umgekehrt.

Zweitens: Geh davon aus, dass deine IDE und dein Arbeitskalender bis zum Jahresende eine Oberfläche sein werden. Codex Computer Use plus Chronicle-Gedächtnis plus rollenbasierte Agents plus 90+ Plugins ist der Prototyp. Anthropic hat denselben Stack in leicht anderer Verpackung. Die einheitliche Arbeits-und-Code-Oberfläche ist keine Vorhersage für 2027 mehr. Sie wird jetzt ausgeliefert.

Drittens: Nimm Cybersecurity-Capability-Überschwappung ernst. Wenn du Code auslieferst und keinen Sicherheitsüberprüfungsschritt in deiner Agent-Pipeline hast, ist dies das Quartal, um einen hinzuzufügen. Dieselben Modelle, die deine Entwicklerproduktivität verbessern, verbessern die Angreiferproduktivität im selben Tempo. Ich habe vor zwei Wochen einen Sicherheitsüberprüfungs-Subagenten zu meiner eigenen Pipeline hinzugefügt. Er amortisiert sich bereits.

Viertens: Teste mindestens ein Stealth-Modell pro Monat. Alpha wird nicht das letzte sein. Die Kadenz auf OpenRouter ist jetzt monatlich. Dreißig Minuten pro Monat zu investieren, um zu testen, was auf der Plattform ist, hält deine Capability-Kalibrierung ehrlich, und es ist die günstigste Versicherung dagegen, von einem Open-Source-Modell überrascht zu werden, das plötzlich die geschlossene Frontier erreicht.

Die Woche, die ich fast ignoriert hätte, erwies sich als eine der wichtigsten Wochen des bisherigen Jahres. Das Sonnet 4.8-Leak schrieb mein mentales Modell von Anthropics Roadmap um. Die AISI-Evaluierung schrieb mein mentales Modell davon um, wie nah wir an autonomer offensiver Cyber sind. Alpha schrieb mein mentales Modell der Open-Source-Lücke um. Das Codex-Update schrieb mein mentales Modell davon um, was ein KI-Coding-Tool im Jahr 2026 überhaupt ist.

Vier Umschreibungen. Eine Woche. Wenn du immer noch denselben Tool-Stack und denselben Workflow fährst, den du im Februar gefahren hast, fährst du eine Architektur, die jetzt nachweislich veraltet ist. Ich werde Sonnet 4.8 am Tag der Veröffentlichung testen, Cyber am Tag nutzen, an dem ich mich für TAC-Zugang qualifiziere (werde ich nicht), und Alpha dieses Wochenende durch meinen vollständigen Workflow-Benchmark jagen.

Was ich heute Abend tun würde, wenn ich du wäre: Öffne den AISI-Bericht, lies den Last-Ones-Abschnitt und stelle dir eine Frage. Wenn ein Frontier-Modell autonom eine 32-Schritte-offensive Kette in 11 Minuten für unter zwei Dollar ausführen kann, wie sieht deine Infrastruktur für es aus?

Das ist die Frage, die ich die ganze Woche nicht ablegen konnte. Ich bezweifle, dass du es kannst.

Häufig gestellte Fragen

Wann erscheint Claude Sonnet 4.8?

Sonnet 4.8 wird basierend auf Referenzen im geleakten Claude-Code-Quellcode für Mai 2026 erwartet. Anthropic hat kein genaues Datum öffentlich bestätigt. Die Preisgestaltung soll angeblich bei $3 pro Million Eingabe-Token und $15 pro Million Ausgabe-Token bleiben, entsprechend Sonnet 4.6.

Ist GPT-5.5 besser als Claude Mythos bei Cybersicherheit?

Laut der Evaluierung des UK AI Security Institute vom 30. April 2026 erreichte GPT-5.5 eine Erfolgsquote von 71,4% bei den Experten-Tier-offensiven Cyberaufgaben — statistisch gleichauf mit Claude Mythos Preview. GPT-5.5 schloss auch die 32-Schritte "Last Ones"-Angriffskette in 2 von 10 Versuchen ab, verglichen mit Mythos' 3 von 10. Der Unterschied liegt innerhalb der statistischen Fehlermarge.

Was ist das Alpha-Modell auf OpenRouter?

Alpha ist ein namenloses Stealth-Basismodell, das Anfang Mai 2026 auf OpenRouter gelistet wurde und starke Leistung bei agentischen Workloads, Code-Generierung und langem Kontext beansprucht. Die Herkunft wurde nicht bestätigt, obwohl Community-Spekulationen auf ein chinesisches Open-Weights-Lab wie Zhipu, MiniMax oder DeepSeek basierend auf OpenRouters früherem Stealth-Launch-Muster hindeuten.

Was ist GPT-5.5 Cyber und wer hat Zugang?

GPT-5.5 Cyber ist eine spezialisierte Variante von GPT-5.5, die für Cybersicherheits-Workflows einschließlich Penetrationstests, Schwachstellenidentifikation und Malware-Reverse-Engineering feinabgestimmt wurde. OpenAI rollt es zuerst an geprüfte "kritische Cyberverteidiger" über sein Trusted Access for Cyber-Programm aus, mit Priorität für Regierungsstellen, Betreiber kritischer Infrastruktur, Sicherheitsanbieter sowie große Cloud- und Finanzinstitutionen.

Kann OpenAI Codex jetzt Claude Code ersetzen?

Das April-Mai 2026 Update von Codex fügte macOS Computer Use, 90+ Plugin-Integrationen, mehrtägiges Chronicle-Gedächtnis und rollenbasierte Wizards hinzu — womit es Claude Code in der Breite übertrifft. Claude Code bleibt stärker beim reinen Coding-Workflow-Feinschliff. Die meisten ernsthaften Nutzer betreiben beide parallel, anstatt sich für eines zu entscheiden. Siehe den Abschnitt über Codex oben für meinen detaillierten Vergleich.

Lass uns zusammenarbeiten

Du möchtest KI-Systeme bauen, Workflows automatisieren oder deine technische Infrastruktur skalieren? Ich helfe gerne.

Coffee cup

Hat Ihnen dieser Artikel gefallen?

Ihre Unterstützung hilft mir, mehr tiefgehende technische Inhalte, Open-Source-Tools und kostenlose Ressourcen für die Entwickler-Community zu erstellen.

Verwandte Themen

Engr Mejba Ahmed

Engr Mejba Ahmed

Engr. Mejba Ahmed builds AI-powered applications and secure cloud systems for businesses worldwide. With 8+ years shipping production software in Laravel, Python, and AWS, he's helped companies automate workflows, reduce infrastructure costs, and scale without security headaches. He writes about practical AI integration, cloud architecture, and developer productivity.

Verwandte Artikel

Alle anzeigen

Comments

Leave a Comment

Comments are moderated before appearing.

Learning Resources

Expand Your Knowledge

Accelerate your growth with structured courses, verified certificates, interactive flashcards, and production-ready AI agent skills.

Sample Certificate of Completion

Sample certificate — complete any course to earn yours

Engr Mejba Ahmed

Engr Mejba Ahmed

AI assistant · trained on my work

👋

Hey there!

Quick Actions

WhatsApp Direct line to me

Chat on WhatsApp

+880 1723 741224 · Replies within the hour on working days

Popular Questions

Engr Mejba Ahmed is connected
Engr Mejba Ahmed is typing...
Engr Mejba Ahmed avatar

✉ Want me to follow up? Drop your email

Engr Mejba Ahmed avatar

📞 Connect Directly

Choose how you'd like to reach me

WhatsApp

+880 1723 741224

Email

mejba.13@gmail.com

✓ Details sent! I'll get back to you shortly.

Powered by OpenAI

335+

Blog Posts

25

AI Courses

63

Projects

Services & Expertise

Pricing & Process

Learning & Resources

Connect & Support