Grok 4.5 im Test: ein günstiger, schneller Daily Driver fürs Coding
Die Zahl, die mich stoppte, war kein Benchmark. Es war eine Token-Anzahl.
xAI hat Grok 4.5 am 8. Juli 2026 veröffentlicht, und meine erste Reaktion war dieselbe, die ich inzwischen jede einzelne Woche habe: noch ein Punkt-irgendwas-Modell, noch ein Leaderboard-Screenshot, wahrscheinlich nichts Besonderes. Ich steckte gerade mitten in einem Opus-4.8-Agent-Run — von der Sorte, die still und leise Millionen von Tokens verbrennt, während ich so tue, als würde ich nicht auf den Zähler starren — und hätte die Ankündigung fast weggewischt.
Dann sah ich die Effizienzzahl. xAI berichtete, dass Grok 4.5 bei langen Coding-Aufgaben rund 4,2x weniger Output-Tokens als Opus 4.8 verbraucht — etwa 15.954 durchschnittliche Output-Tokens pro Aufgabe gegenüber 67.020 bei Opus 4.8 auf maximalen Einstellungen. Das ist kein Rundungsunterschied. Das ist der Unterschied zwischen einer Rechnung, bei der ich zusammenzucke, und einer Rechnung, die ich vergesse.
Ich betreibe Modelle beruflich. Nicht im Sinne von „ich habe die Docs gelesen" — ich meine, ich habe Multi-Modell-Agent-Pipelines, die an den meisten Tagen echten Code ausliefern, und ich spüre jede Preisänderung auf meiner tatsächlichen Monatsrechnung. Ein Modell, das nahe an der Coding-Frontier landet und dabei 2 $ pro Million Input-Tokens kostet, hat also meine Aufmerksamkeit schneller bekommen als jedes Benchmark-Diagramm es könnte. Eines möchte ich vorab klarstellen, bevor wir weitermachen: Ich habe noch keinen vollen Monat mit Grok 4.5 verbracht. Was folgt, ist ein erster Eindruck auf Basis der Launch-Daten, der öffentlichen Demos und — der Teil, über den ich aus erster Hand sprechen kann — genau der Frage, wie ich ein solches Modell in einen Stack einsortieren würde, den ich ohnehin jeden Tag betreibe.
Warum ein günstiges, effizientes Coding-Modell gerade wichtiger ist als ein klügeres
Niemand sagt einem das, wenn man von „mit einem Modell chatten" zu „Agenten betreiben, die Code schreiben" aufsteigt: Das klügste Modell ist fast nie das, das man die meiste Zeit laufen lassen sollte.
Ich habe das auf die teure Art gelernt. Eine Zeit lang habe ich in diesem Frühjahr fast alles durch das stärkste Modell geleitet, auf das ich Zugriff hatte, denn warum sollte man nicht das Beste nehmen? Dann habe ich die Rechnung für eine einzige Woche agentischer Arbeit aufgemacht — mehrstufige Aufgaben, viele Tool-Aufrufe, langer Kontext, das Modell, das in jeder Schleife Dateien neu einliest und neu plant. Die Token-Summen waren absurd. Frontier-Coding-Agenten fressen routinemäßig Millionen von Tokens pro nicht-trivialer Aufgabe, sobald man das gesamte Reasoning und den Tool-Traffic mitzählt. Ein veröffentlichter Vergleich bezifferte eine vollständige agentische Coding-Aufgabe auf rund 1,9 Mio. Gesamt-Tokens bei Grok 4.5 gegenüber etwa 6–7 Mio. bei den teureren Frontier-Modellen in ihren jeweiligen Harnessen. Multipliziert man das über einen Arbeitstag, hört die „nimm einfach das Beste"-Strategie auf, eine Strategie zu sein, und wird zu einem Leck.
Genau in diese Lücke ist Grok 4.5 hineingebaut. Nicht „das klügste Modell im Raum". Das effiziente — das Arbeitstier, das man laufen lassen kann, ohne den Zähler zu babysitten, das schnell genug ist, um einen im Flow zu halten, und günstig genug, dass man aufhört, es zu rationieren.
Und „schnell genug, um im Flow zu bleiben" ist kein weicher Vorteil. Wenn ein Modell im Schneckentempo streamt, wechselt man den Kontext. Man drückt Alt-Tab. Man verliert den Faden. Grok 4.5 wird mit rund 80 Tokens pro Sekunde ausgeliefert — xAIs „Fast Model"-Stufe — und unabhängige Tester maßen in direkten Vergleichsbuilds, dass das erste Token in unter einer halben Sekunde ankommt. Diese Reaktionsschnelligkeit verändert, wie es sich anfühlt, damit zu arbeiten — auf eine Weise, die eine statische Benchmark-Tabelle nie einfangen wird.
Aber bevor ich darüber spreche, wo es hinpasst, möchte ich präzise festhalten, was tatsächlich ausgeliefert wurde — denn die Launch-Details sind wichtig, und ein paar davon sind wirklich überraschend.
Ein Blick auf das Datenblatt von Grok 4.5 — und sein neues SpaceXAI-Label
Vorab eine Anmerkung zum Branding, weil sie wirklich für Verwirrung sorgt: Grok 4.5 kommt von xAI — aber xAI ist kein eigenständiges Unternehmen mehr. SpaceX hat es in einem reinen Aktiendeal übernommen, der im Februar 2026 abgeschlossen wurde, und am 6. Juli 2026 — zwei Tage vor diesem Launch — hat sich das Unternehmen offiziell in SpaceXAI umbenannt. Wenn Sie also gesehen haben, dass Grok 4.5 SpaceX zugeschrieben wurde: Das ist inzwischen korrekt, keine Verwechslung. Die alte Darstellung „xAI ist ein separates Unternehmen" ist seit diesem Launch überholt.
Hier ist das bestätigte Datenblatt, Stand Launch im Juli 2026:
- Speziell für Coding und Agenten gebaut. xAI beschreibt Grok 4.5 als sein klügstes Modell für Coding, agentische Aufgaben und Wissensarbeit — und bemerkenswerterweise wurde es gemeinsam mit Cursor auf echten Entwickler-Agent-Interaktionsdaten co-trainiert. Es ist ein Mixture-of-Experts-Modell, trainiert auf Coding, Naturwissenschaften, Engineering und Mathematik, mit dem erklärten Ziel, praktische Engineering-Probleme zu lösen, statt nur Leaderboard-Positionen zu jagen.
- Preise: rund 2 $ pro Million Input-Tokens und 6 $ pro Million Output-Tokens, mit gecachtem Input bei berichteten etwa 0,50 $/Mio. Zur Einordnung: Das unterbietet die Top-Frontier-Coding-Modelle mit deutlichem Abstand.
- Kontextfenster: 500K Tokens. Und hier kommt die Überraschung — das ist tatsächlich kleiner als das 1M-Fenster der Vorgängergeneration. Berichten zufolge plant xAI, wieder Richtung 1M zu erweitern, aber so, wie es heute ausgeliefert wird, sollte man mit 500K planen. Das „1M kommt bald" würde ich als Roadmap-Signal behandeln, nicht als etwas, worauf man schon jetzt seine Architektur aufbaut.
- Geschwindigkeit: ~80 Tokens/Sekunde, xAIs Fast-Stufe.
- Kompletter moderner Tool-Stack: natives Function Calling, strukturierter JSON-Output, Websuche, X-Suche und Code-Ausführung — mit dauerhaft aktiviertem High Reasoning.
- Verfügbarkeit: Groks Build-Plattform, die xAI API und Cursor-Pläne ab Launch. Ein Haken, den man erwähnen muss — der EU-Rollout hinkte Berichten zufolge hinterher und landete erst Mitte Juli statt am ersten Tag. Wer aus Europa heraus baut, sollte den Zugang prüfen, bevor er es irgendwo fest verdrahtet.
Unabhängige Auswertungen stützen die Positionierung statt des Hypes: Artificial Analysis rankte Grok 4.5 zum Launch auf etwa Platz 4 von 168 Modellen in seinem Intelligence Index — nahe an der Frontier, zu einem Bruchteil der Kosten pro Aufgabe der darüberliegenden Modelle.
Nahe an der Frontier. Zu einem Bruchteil der Kosten. Das ist der ganze Pitch in wenigen Worten, und bei den Benchmarks wird es interessant — und ehrlich.
Grok 4.5 Benchmarks: sie lesen, ohne sich selbst zu belügen
Benchmarks lügen nicht direkt. Sie messen nur das, was sie messen — und das ist selten das, worauf es einem ankommt. Deshalb gebe ich Ihnen die berichteten Zahlen und das, was jede davon tatsächlich testet, denn die Geschichte ändert sich je nachdem, auf welches Diagramm man schaut.
Hier ist, was xAI und die frühe Berichterstattung meldeten:
| Benchmark | Was er misst | Grok 4.5 (berichtet) | Wo es landet |
|---|---|---|---|
| Terminal-Bench 2.1 | Planung und Tool-Einsatz in einer echten Shell | ~83,3 % | Gleichauf mit GPT 5.5, ~1 Punkt hinter Fable 5 |
| SWE-bench Pro | Lösen echter Software-Engineering-Issues | ~64,7 % | Über GPT 5.5, unter Fable 5 (~80,4 %) |
| DeepSWE 1.0 | Tiefes Coding / agentischer Harness | ~62 % | Wettbewerbsfähig; führt vor Opus 4.8 im Anbieter-Harness |
| DeepSWE 1.1 | Neutraler Deep-Research-Durchlauf | ~53 % | Hinter der Spitze des Feldes |
Lesen Sie die oberste Zeile aufmerksam, denn sie ist die wichtigste für agentische Arbeit. Terminal-Bench testet, ob ein Modell innerhalb einer Shell planen, iterieren und Tools koordinieren kann — genau das, woran ein autonomer Coding-Agent lebt oder stirbt. Ein Wert von 83,3 %, Schulter an Schulter mit GPT 5.5 und einen Punkt hinter Fable 5, ist kein Spielzeugergebnis. Das ist ein Modell, das tatsächlich einen Agent-Loop steuern kann, nicht nur eine Funktion autovervollständigt.
Die SWE-bench-Pro-Zahl erzählt die andere Hälfte der Geschichte. Mit ~64,7 % schlägt es GPT 5.5, liegt aber mit deutlichem Abstand hinter Fable 5s berichteten ~80,4 %. Bei den härtesten End-to-End-Issue-Resolution-Aufgaben ist Grok 4.5 also gut — wirklich gut — aber es ist nicht das Modell, dem man sein verzwicktestes, mehrdeutiges „niemand versteht dieses Legacy-Modul vollständig"-Problem übergibt.
Und genau diese Zweiteilung ist die eigentliche Erkenntnis. Grok 4.5 gruppiert sich bei agentischer Ausführung mit GPT 5.5, sitzt bei roher Problemlösungstiefe eine Stufe unter Fable 5 und unterbietet beide dramatisch bei Kosten und Token-Verbrauch. Es gewinnt nicht den Pokal für das „klügste Modell". Das hat es auch nie versucht.
Wo die Benchmarks verstummen, werden die Demos laut — schauen wir uns also an, was es tatsächlich baut.
Grok 4.5 Coding-Demos: wo es glänzt, wo es strauchelt
Zahlen verraten die Obergrenze eines Modells. Demos verraten seine Persönlichkeit — wo es selbstsicher ist, wo es strauchelt, was es im Training offensichtlich in großen Mengen gesehen hat. Die öffentlichen Demos rund um den Launch zeichneten ein scharfes, konsistentes Bild, und ich markiere, welchen Teilen ich vertrauen würde und welche ich selbst verifizieren würde, bevor ich mich darauf verlasse.
Wo es wirklich stark aussah:
- Ein macOS-Klon — obere Menüleiste, Kalender, Wallpaper, ein funktionierendes Launchpad und Dock-Animationen. Die Demo zeigte durchweg saubere, kohärente SVG-Icons, was schwieriger ist, als es klingt. Icon-Systeme sind der Punkt, an dem schwächere Modelle Brei produzieren.
- Eine hochwertige SaaS-Landingpage in einer einzigen HTML-Datei — React 18 mit GSAP und ScrollTrigger für Scroll-Animation, in einem Durchgang generiert. Das ist der Sweet Spot: modernes Frontend, echte Animationsbibliothek, stimmiges Layout.
- SVG-Arbeit als herausragende Stärke — ein detaillierter Schmetterling, ein SVG-„Gemälde" und eine animierte CSS-Lavalampe. Handgeschriebene Vektorarbeit ist ein echtes Erkennungszeichen für Modellqualität, und Grok 4.5 hat sie Berichten zufolge sauber gemeistert, mit lesbarem, farbenfrohem Output.
- Ein WebGL-Raytracing-Renderer mit atmosphärischem Nebel und einem prozeduralen Himmel, dazu eine Low-Poly-Szene im Stil von Zelda: Breath of the Wild, die nach Aussage des Präsentators eines der Highlights der gesamten Session war.
- Ein Klon im Minecraft-Stil mit Crafting, Blöcken, Werkzeugen und Mobs — unter den getesteten Modellen ungefähr auf Platz drei gerankt, also: kompetent, nicht klassenbester.
Wo es sichtbar kämpfte:
- Ein 3D-Sonnensystem geriet schwach — eine echte Schwäche, und genau die Art von astrophysikalischem Raumskalen-Problem, bei dem diese Modelle typischerweise patzen.
- Eine F1-Drift-Donut-Szene landete bei etwa 6/10 — die Physik war unvollkommen. Bewegung, die sich richtig anfühlen muss, ist weiterhin eine Schwachstelle.
Fällt Ihnen das Muster auf? Grok 4.5 ist exzellent in Frontend-UI-Komposition, SVG und 3D-Szenenaufbau und merklich schwächer bei physiklastiger Simulation und komplexen astrophysikalischen Visualisierungen. Das ist keine zufällige Streuung. Es passt perfekt zu einem mit Cursor co-trainierten Modell, das enorme Mengen echter Frontend- und App-Building-Arbeit gesehen hat. Es baut Interfaces, als wäre es damit aufgewachsen, und es approximiert Physik, als hätte es darüber gelesen.
Das deckt sich fast exakt mit dem, was ich beim Durchlauf von GPT 5.5 durch ähnliche Real-World-Builds festgestellt habe — Frontend und SVG sitzen, die Physik wackelt. Wer die ausführlichere Version dieses Testmusters möchte: Ich habe die vollständigen Durchläufe in meinem GPT 5.5 Codex Hands-on-Review aufgeschrieben, und dieselbe Regel „dem UI vertrauen, die Physik verifizieren" gilt auch hier.
Wo verdient sich ein solches Modell also tatsächlich seinen Platz? Für mich lautet die Antwort nicht „für alles verwenden". Es ist chirurgischer als das.
Wo Grok 4.5 hinpasst: der Daily Driver in einem Multi-Modell-Stack
Ich betreibe nicht ein Modell. Das tut niemand mehr, der es ernst meint. Ich betreibe eine kleine Flotte, und das ganze Spiel besteht darin, die richtige Aufgabe zum richtigen Modell zum richtigen Preis zu routen. Wenn Sie sich je gefragt haben, warum Ihre AI-Rechnung aufbläht: Es liegt fast immer daran, dass Sie aus Gewohnheit billige Aufgaben an teure Modelle schicken.
Hier ist das mentale Modell, das ich verwende, und wo Grok 4.5 hineinpasst:
Tier 1 — der Daily Driver. Das Modell, das den Großteil des Volumens stemmt: Scaffolding, Frontend-Komponenten, CRUD, Refactorings, Boilerplate, der Schnell-iterieren-Loop, den man fünfzigmal laufen lässt. Diese Stufe muss viel eher schnell, günstig und effizient sein, als das klügste Wesen der Welt. Genau das ist der Platz, für den Grok 4.5 gebaut ist — und es ist der Platz, den ich bisher mit einem Mittelklasse-Modell wie Sonnet 5 besetzt hätte. Bei Effizienz und Preis liefert Grok 4.5 starke Argumente, diesen Platz direkt zu übernehmen.
Tier 2 — der Heavy Hitter. Das Modell, das man für die wirklich harten Probleme reserviert: die mehrdeutige Architekturentscheidung, den subtilen Concurrency-Bug, das „das berührt vierzig Dateien und ich verstehe nicht ganz, warum"-Refactoring. Hier behalte ich Fable 5 oder Opus 4.8, denn SWE-bench Pro sagt an dieser Stelle die Wahrheit — die Tiefenlücke ist real, und bei den harten 20 % will man das Modell, das die meisten Issues löst, nicht das billigste.
Der Orchestrierungs-Zug besteht darin, Tier 1 das Volumen erledigen zu lassen und nur dann zu Tier 2 zu eskalieren, wenn Tier 1 steckenbleibt oder die Aufgabe von Anfang an als schwer markiert ist. Richtig gemacht, bekommt man den Großteil der Frontier-Qualität zu einem Bruchteil der Frontier-Kosten — weil man aufgehört hat, Premiumpreise für Boilerplate zu zahlen. Die Ökonomie genau dieses Routing-Musters habe ich in meinem Leitfaden zur Kostenoptimierung von AI-Agenten aufgeschlüsselt, und Grok 4.5 ist in diesem Framework nahezu ein Drop-in-Upgrade für die Daily-Driver-Stufe.
Was Grok 4.5 für Tier 1 besonders überzeugend macht, ist nicht nur der Listenpreis — es ist die Token-Effizienz, die obendrauf kumuliert. Ein Modell, das pro Token billiger ist und zugleich weniger Tokens braucht, um eine Aufgabe abzuschließen, spart doppelt. Diese 4,2-fache Reduktion der Output-Tokens gegenüber Opus 4.8 ist der Ort, an dem die echten Ersparnisse liegen, denn bei langen agentischen Aufgaben sind es die Output- und Reasoning-Tokens, die das Konto tatsächlich leeren.
Falls Sie dieses Routing lieber nicht selbst architektieren möchten — oder einen Multi-Modell-Agent-Stack gebaut, getunt und Ihrem Team übergeben haben wollen, damit nicht Sie derjenige sind, der Token-Zähler babysittet — melden Sie sich, wenn das ein Job ist, den Sie lieber abgeben, als ihn selbst zu verdrahten. Meine Kundenarbeit finden Sie hier.
Das war der optimistische Fall. Jetzt argumentiere ich gegen mich selbst, denn ein erster Eindruck, der nur Stärken auflistet, ist Marketing, kein Review.
Die ehrlichen Einschränkungen, die ich vor einer Entscheidung abwägen würde
Ich möchte Grok 4.5 lieber mögen, als recht zu behalten — und genau deshalb muss ich hier vorsichtig sein. Ein paar Dinge dämpfen meine Begeisterung.
Das Kontextfenster ist geschrumpft. 500K ist viel, aber es ist die Hälfte dessen, was die Vorgängergeneration bot, und wer Workflows gebaut hat, die darauf beruhen, riesige Codebases in einen einzigen Kontext zu stopfen, muss mit einer echten Regression planen. Das berichtete „1M kommt bald" ist ermutigend, aber ich architektiere nicht auf Roadmaps. Ich architektiere auf dem, was ausgeliefert wurde. Für große Monorepo-Arbeit ist diese 500K-Grenze heute eine echte Einschränkung — und wer das Gegenbeispiel sehen will, das voll auf ein Millionen-Token-Fenster setzt: Diesen Trade-off habe ich in meinem Beitrag über Opus und den Millionen-Token-Kontext behandelt.
Die Physik-Schwäche ist nicht kosmetisch. Wenn Ihre Arbeit Simulation, Spielphysik, wissenschaftliche Visualisierung oder irgendetwas umfasst, bei dem Bewegung und räumliche Genauigkeit korrekt statt nur plausibel sein müssen, sind die Demos eine Warnung. Grok 4.5 komponiert wunderschöne Szenen und verpatzt dann die Physik darin. Wissen Sie, auf welcher Seite dieser Linie Ihre Arbeit liegt.
Die EU-Launch-Verzögerung ist ein echter operativer Stolperstein. Ein Rollout Mitte Juli für Europa bedeutet: Wer dort baut und mit Verfügbarkeit ab Tag eins geplant hat, ist womöglich gegen eine Wand gelaufen. Verifizieren Sie immer den regionalen Zugang, bevor Sie eine Produktionsabhängigkeit auf ein brandneues Modell festlegen.
Die Benchmarks sind die Benchmarks des Anbieters. Die meisten der auffälligen Zahlen hier gehen auf xAIs eigene Berichte oder die Berichterstattung im Launch-Fenster zurück. Das unabhängige Artificial-Analysis-Ranking ist beruhigend, aber ich würde trotzdem meine eigenen drei oder vier repräsentativen Aufgaben laufen lassen, bevor ich irgendetwas davon mit echter Arbeit betraue. Das ist keine Skepsis speziell gegenüber Grok — so behandle ich inzwischen jeden Launch. Die Zahlen bringen einen zu „einen Test wert", nicht zu „in die Produktion verdrahten".
Nichts davon ist ein Dealbreaker für die Daily-Driver-Rolle. Es sind Leitplanken. Und ehrlich gesagt ist ein Modell, das klar kommuniziert, das effiziente Arbeitstier statt des klügsten Genies zu sein, leichter zu vertrauen als eines, das sich überverkauft — weil man genau weiß, wo seine Grenzen liegen.
Wie würden Sie also tatsächlich merken, ob es für Sie funktioniert? Machen wir das konkret.
So testen Sie, ob Grok 4.5 in Ihren Stack gehört
Nehmen Sie weder mein Framing noch irgendeine Demo auf Treu und Glauben. Hier ist der ehrliche, günstige Weg, an einem Nachmittag herauszufinden, ob Grok 4.5 sich einen Platz verdient:
- Wählen Sie drei echte Aufgaben, deren Antwort Sie bereits kennen. Einen Frontend-Build, einen mittelschweren Bugfix und eine Sache, bei der Sie erwarten, dass es kämpft (Physik, ein haariges Refactoring). Aufgaben mit bekannter Antwort sind die einzigen, die einem die Wahrheit sagen.
- Beobachten Sie zwei Zahlen, nicht eine. Erfassen Sie die Gesamt-Tokens und die Wanduhrzeit bis zu einem funktionierenden Ergebnis — nicht nur, ob es fertig wurde. Die gesamte Grok-4.5-These ist Effizienz; wenn es bei derselben Aufgabe nicht spürbar billiger und schneller ist als Ihr aktueller Daily Driver, scheitert die These für Ihren Workload.
- Treiben Sie es absichtlich über seine Komfortzone hinaus. Geben Sie ihm die physiklastige Aufgabe ganz bewusst. Sie wollen es nicht schlecht aussehen lassen — Sie suchen die exakte Linie, an der Sie zu einem schwereren Modell eskalieren müssen. Diese Linie zu kennen ist es, was das Routing funktionieren lässt.
- Vergleichen Sie mit Ihrem aktuellen Tier 1, nicht mit der Frontier. Die richtige Frage ist nicht „Ist Grok 4.5 so klug wie Fable 5?" Ist es offensichtlich nicht. Die Frage lautet: „Erledigt es meine hochvolumige Arbeit so gut wie mein aktueller Daily Driver — für weniger Geld?" Das ist der einzige Vergleich, der Ihre Rechnung verändert.
Was Sie suchen, ist auf die beste Art langweilig: vergleichbare Output-Qualität bei Routinearbeit, deutlich niedrigere Kosten und ein klares Gespür dafür, wann eskaliert werden muss. Bekommen Sie diese drei Dinge, haben Sie einen Daily Driver gefunden. Sinkt die Qualität bei Routineaufgaben, lassen Sie es auf der Bank.
Realistische Erwartung: Bei frontendlastiger und allgemeiner App-Building-Arbeit würde ich erwarten, dass Grok 4.5 mit einem Mittelklasse-Daily-Driver mithält und Sie dabei auf beiden Achsen weniger kostet. Bei tiefem, mehrdeutigem Engineering: Rechnen Sie mit Eskalation. Das ist keine Kritik — das ist das gesamte Design, das wie beabsichtigt funktioniert.
Die eigentliche Erkenntnis
Vor sechs Monaten hätte ich Ihnen gesagt, das nächste große Ding in der AI werde ein größeres, klügeres Modell sein. Ich hätte auf die falsche Achse geschaut.
Die Grok-4.5-Geschichte handelt nicht von Intelligenz. Sie handelt davon, dass Effizienz an der Coding-Frontier ankommt — ein Modell, das bei den Benchmarks, die für Agenten zählen, nahe an die Spitze des Feldes kommt, schnell genug streamt, um einen im Flow zu halten, und das für einen Bruchteil des Token-Verbrauchs. Diese Kombination gewinnt keine Schlagzeilen wie „das klügste Modell aller Zeiten". Aber es ist die Kombination, die tatsächlich verändert, was man sich zu bauen leisten kann.
Ich schicke weder Fable 5 noch Opus 4.8 in Rente. Die SWE-bench-Pro-Lücke ist real, und die harten Probleme gehen weiterhin an die Heavy Hitter. Was ich stattdessen tue: Ich auditiere jede Aufgabe, die derzeit durch ein teures Modell läuft, und stelle eine unbequeme Frage: Braucht das hier wirklich das Genie — oder muss es einfach nur schnell und günstig erledigt werden? Für einen überraschend großen Teil meiner täglichen Arbeit lautet die ehrliche Antwort: Letzteres — und genau das ist der Platz, für den Grok 4.5 gebaut ist.
Holen Sie sich diese drei Testaufgaben, deren Antworten Sie bereits kennen. Lassen Sie sie diese Woche durch Grok 4.5 laufen und beobachten Sie den Token-Zähler, nicht nur den Output. Diese Zahl — dieselbe, die mich überhaupt erst gestoppt hat — wird Ihnen verraten, ob xAI Ihnen gerade einen günstigeren Weg zum Ausliefern in die Hand gedrückt hat.
Häufig gestellte Fragen
Ist Grok 4.5 gut fürs Coding?
Ja — Grok 4.5 ist ein starkes Coding-Modell, besonders für agentische und Frontend-Arbeit. Es erreichte berichtete ~83,3 % auf Terminal-Bench 2.1 (gleichauf mit GPT 5.5) und wurde mit Cursor auf echten Entwickler-Agent-Daten co-trainiert. Bei den härtesten SWE-bench-Pro-Aufgaben liegt es hinter Spitzenmodellen wie Fable 5, deshalb passt es am besten als hochvolumiger Daily Driver und nicht als Heavy Lifter für Ihre komplexesten Probleme.
Was kostet Grok 4.5?
Grok 4.5 ist mit berichteten 2 $ pro Million Input-Tokens und 6 $ pro Million Output-Tokens bepreist, gecachter Input liegt bei etwa 0,50 $ pro Million. Das unterbietet die Top-Frontier-Coding-Modelle deutlich, und die Token-Effizienz (Berichten zufolge ~4,2x weniger Output-Tokens als Opus 4.8 bei langen Aufgaben) verstärkt die Ersparnis bei echter agentischer Arbeit zusätzlich.
Wie groß ist das Kontextfenster von Grok 4.5?
Grok 4.5 wird mit einem Kontextfenster von 500K Tokens ausgeliefert. Das ist tatsächlich kleiner als das 1M-Fenster der Vorgängergeneration — Berichte deuten darauf hin, dass xAI wieder Richtung 1M erweitert, aber planen Sie vorerst mit 500K. Details dazu, warum ein Millionen-Token-Fenster für große Codebases wichtig ist, finden Sie in meiner Aufschlüsselung weiter oben.
Wird Grok 4.5 von SpaceX entwickelt?
Faktisch ja. Grok 4.5 kommt von xAI, das SpaceX in einem im Februar 2026 abgeschlossenen Deal übernommen hat. Am 6. Juli 2026 — zwei Tage vor diesem Launch — hat sich xAI offiziell in SpaceXAI umbenannt und ist in SpaceX aufgegangen. Die ältere Darstellung „xAI und SpaceX sind separate Unternehmen" ist also nicht mehr korrekt; Grok 4.5 erscheint unter der Marke SpaceXAI.
Sollte ich mein aktuelles Modell durch Grok 4.5 ersetzen?
Nicht vollständig — der kluge Zug ist, Grok 4.5 in die Daily-Driver-Stufe eines Multi-Modell-Stacks einzusetzen, für hochvolumige, Frontend- und Boilerplate-Arbeit, während man ein schwereres Modell wie Fable 5 oder Opus 4.8 für die härtesten Engineering-Probleme behält. Testen Sie es gegen Ihren aktuellen Daily Driver an Aufgaben, deren Antworten Sie bereits kennen, bevor Sie wechseln.
Bevor Sie eine einzige Aufgabe routen
Wenn Sie ein Multi-Modell-Setup wie das oben beschriebene ins Auge fassen — ein günstiger Daily Driver für das Volumen, ein Heavy Hitter auf Abruf für die harten 20 % — liegt die knifflige Stelle nicht in der Modellauswahl, sondern in der Routing- und Eskalationslogik, die entscheidet, welche Aufgabe wohin geht. Diese Routing-Schicht zu entwerfen und zu tunen — damit Teams aufhören, Frontier-Preise für Boilerplate-Arbeit zu zahlen — ist genau die Art von Projekt, die ich Ende-zu-Ende baue. Wenn Sie die Woche nicht damit verbringen wollen, das selbst zu verdrahten: Hier finden Sie mich.