Das Modell, das diesen Vergleich angeblich gewonnen hat, existiert nicht. Genauso wenig wie zwei der drei Namen, die alle ständig wiederholen.
Das ist keine Erbsenzählerei — das ist der ganze Grund, warum ich mich hingesetzt habe, um das hier zu schreiben. Ein Creator hat ein wirklich interessantes Experiment durchgeführt: drei Frontier-Modelle bekommen dasselbe kreative Briefing — eine Open World im GTA-Stil, ein Minecraft-Klon und ein 30-Sekunden-iPhone-Werbespot, alles in browserfähigem Three.js — und dann wird geschaut, wer gewinnt. Guter Test. Ehrlich gesagt besser als noch eine SWE-bench-Tabelle. Aber der Bericht nannte die Modelle „GPT 5.6", „Codeex" und „Claude's Fable", und wenn dieses Framing drei Shares tief gewandert ist, treffen Leute echte Budget-Entscheidungen auf Basis von Modellnamen, die es nicht gibt, und eines Kosten-Rankings, das schlicht auf dem Kopf steht.
Das hier ist also ein GPT-5.6 vs Grok 4.5 vs Fable 5-Vergleich mit geprüften Belegen. Derselbe kreative Blickwinkel — weil es der richtige Blickwinkel ist und Seite eins für diese Suchanfrage aus nichts als Benchmark-Tabellen besteht — aber mit den echten Produktnamen, den echten Preisen von Juli 2026 und der echten Rechnung, was ein kreativer Build tatsächlich kostet.
Eine faire Vorwarnung zu einer dieser Zahlen: Das „günstigste" Modell in diesem Test ist nicht das günstigste Modell. Nicht mal annähernd. Ich komme darauf zurück.
Lasst mich ehrlich sagen, wessen Test das ist
Bevor ich auch nur ein einziges Frame von irgendjemandes Minecraft-Klon analysiere, die Offenlegung — denn ich habe zu oft gesehen, wie Leute eine YouTube-Demo in „Ich habe das getestet" umetikettieren, und das mache ich nicht.
Ich habe die Game-Builds nicht selbst durchgeführt. Ich habe weder Neon Burrow noch Apex City noch Metro Rush gebaut. Das sind die Ergebnisse eines Creators mit den Prompts eines Creators auf der Maschine eines Creators, und ich habe genau das, was ihr auch habt: das Videomaterial. Was ich euch nicht sagen kann: was in den Prompts stand, wie viele Iterationen liefen, bevor der Take entstand, der es ins Video geschafft hat, welches Effort-Level eingestellt war oder wie die Token-Rechnung aussah. Diese vier Unbekannten sind zufällig genau die vier Variablen, die über das Ergebnis eines solchen Tests entscheiden. Behaltet das im Hinterkopf.
Wofür ich aus erster Hand sprechen kann, ist der Teil, der die Demo überlebt: die Modelle selbst, die Preise und was sie kosten, wenn man sie im echten Einsatz betreibt. Ich betreibe an den meisten Tagen Multi-Modell-Agent-Pipelines. Ich habe die schmerzhafte Version der Fable-5-Kostenlektion bereits hinter mir — ich habe zugesehen, wie ein einzelner Task 22 $ verbrannt hat, und musste meine gesamte Effort-Level-Strategie darum herum neu aufbauen, was ich ausführlich in meiner Analyse zum Senken der Fable-5-Nutzungskosten beschrieben habe. Ich habe Grok 4.5 in meinen Stack eingebaut und aufgeschrieben, warum das effiziente Modell öfter gewinnt als das schlaue, als irgendjemand zugibt. Das ist meine Faktenbasis. Die Builds sind die von jemand anderem.
Lest das hier also als das, was es ist: eine Analyse-Ebene über einem Test von Dritten, plus die verifizierten Zahlen, die der Test ausgelassen hat. Das ist weniger aufregend als „Ich habe alle drei getestet!" Es ist aber wahr, und die wahre Version ist nützlicher für euch, denn in den Korrekturen steckt das Geld.
Fangen wir mit den Namen an.
GPT-5.6 vs Grok 4.5 vs Fable 5: die echten Namen und die echten Preise
Hier ist die Korrekturtabelle. Alles darin stammt aus Anbieter- und Preisdokumentationen mit Stand Juli 2026, nicht aus dem Video.
| Das Video nannte es | Es heißt tatsächlich | Input / Output pro 1M | Kontext |
|---|---|---|---|
| „GPT 5.6" (ein Modell, drei „Gehirne") | GPT-5.6 Sol — Flaggschiff, tiefstes Reasoning | 5 $ / 30 $ | 1M |
| ↳ „ausgewogene Mitte" | GPT-5.6 Terra — das Arbeitstier für den Alltag | 2,50 $ / 15 $ | 1M |
| ↳ „leichte Version" | GPT-5.6 Luna — schnell, für hohes Volumen, latenzsensitiv | 1 $ / 6 $ | 1M |
| „Codeex" | Codex — OpenAIs Coding-Agent | — | — |
„der /sites-Befehl" |
@Sites — ein Plugin, das man im Thread aufruft |
— | — |
| „Claude's Fable" | Claude Fable 5 — Anthropics Modell der Mythos-Klasse | 10 $ / 50 $ | — |
| „effort: extra oder max" | Effort akzeptiert low, medium, high, xhigh, max | — | — |
| „Grok 4.5" ✓ | Grok 4.5 (xAI — nicht SpaceX, trotz der Berichterstattung) | 2 $ / 6 $ | 500K |
| „3.js" | Three.js — die WebGL-Bibliothek | — | — |
Einige dieser Punkte sind wichtiger als die Rechtschreibung.
GPT-5.6 ist eine Familie, kein Modell. Die gesamte Sol/Terra/Luna-Aufteilung ging am 9. Juli 2026 mit einem 1M-Token-Fenster über alle drei Stufen in die General Availability — das Ende eines abgestuften, geopolitisch chaotischen Rollouts, den ich in meiner Einordnung der GPT-5.6-Serie und der abgeriegelten KI-Frontier nachgezeichnet habe. Wenn der Test sagt „GPT 5.6 hat eine saubere Open World gebaut", ist die einzige Frage, die zählt: welche Stufe — denn zwischen Sol und Luna liegt ein 5-facher Preisunterschied, und das ist der Unterschied zwischen einem Build, der Centbeträge kostet, und einem, der es nicht tut. Das „drei Gehirne, aus denen man wählt"-Framing des Videos ist nicht direkt falsch. Es fehlen nur die Namen, die man bräuchte, um tatsächlich eines zu bestellen.
Fable 5s Effort-Level heißen nicht „extra". Die API akzeptiert low, medium, high, xhigh, max. Wer das in irgendetwas einbaut: „extra" wirft einen Fehler. Kleinigkeit. Kostet einen zwanzig Minuten.
@Sites ist kein Slash-Befehl. Es ist ein Plugin, das man in einem Codex-Thread aufruft, wenn ein Task in einem Deployment enden soll. Codex baut das Projekt, führt es aus, deployt auf OpenAI-Infrastruktur und liefert eine Live-URL zurück. Es startete am 2. Juni 2026 und ist inzwischen für zahlende Abonnenten allgemein verfügbar, während Business- und Enterprise-Workspaces noch in der Preview hinter Admin-Schaltern stecken. Wer /sites tippt, bekommt: nichts.
Und jetzt — die Korrektur, die tatsächlich eine Entscheidung verändert.
Das Kosten-Ranking in diesem Test steht auf dem Kopf
Die Zusammenfassungstabelle des Videos führt Grok 4.5 mit „Kosten: am niedrigsten" und nennt es den günstigsten Einstieg. Das ist die meistwiederholte Behauptung über diesen Vergleich, und sie übersteht den Kontakt mit der Preisliste nicht.
Grok 4.5 kostet 2 $ Input / 6 $ Output. GPT-5.6 Luna kostet 1 $ Input / 6 $ Output.
Luna kostet beim Input die Hälfte und beim Output dasselbe. Es gibt keine Lesart dieser beiden Zeilen, in der Grok „das günstigste" ist. Wenn euer Workload input-lastig ist — langer Kontext, große Dateien, viel wiederholtes Einlesen, was auf praktisch jeden agentischen Build zutrifft — ist Luna spürbar günstiger als das Modell, das der Test zum Budget-Sieger gekürt hat. Selbst Terra liegt mit 2,50 $/15 $ beim Input nur einen Rundungsfehler von Grok entfernt.
Wie hat der Test das verdreht? Höchstwahrscheinlich, indem er Grok gegen Sol verglichen und es dabei belassen hat. Gegen Sols 5 $/30 $ wirkt Grok natürlich billig. Aber das heißt, das Budget-Modell mit dem Flaggschiff des anderen zu vergleichen und einen Preissieg auszurufen — als würde man einen Civic für billiger als einen 911 erklären und daraus schließen, Honda sei die Preis-Leistungs-Marke. Vergleicht man Stufe mit Stufe, dreht sich die Geschichte um.
Groks tatsächlicher Preisvorteil liegt woanders, und er ist real — er steht nur nicht auf dem Preisschild:
- Gecachter Input für 0,50 $/M (75 % Rabatt) — stark, wenn man denselben Kontext immer wieder hämmert.
- Bis zu 175 $/Monat an kostenlosen API-Credits über xAIs Data-Sharing-Programm, das großzügigste Gratis-Kontingent, das derzeit ein großer Anbieter liefert.
- Token-Effizienz. Das ist der Punkt, der wirklich zählt, und der, den niemand in ein Diagramm packt. xAI berichtete, dass Grok 4.5 bei langen Coding-Tasks rund 4,2-mal weniger Output-Tokens verbraucht als Opus 4.8 — etwa 15.954 durchschnittliche Output-Tokens pro Task gegenüber 67.020. Der Listenpreis ist der Steuersatz. Die Token-Anzahl ist das Einkommen. Ein Modell, das pro Token nominell teurer ist, kann gegen eines verlieren, das einfach weniger sagt.
Bei den Gratis-Credits gibt es einen Haken, den man kennen sollte, bevor man sich freut: Es ist ein Data-Sharing-Programm. Euer Traffic trainiert deren Modell. Für ein Wegwerf-Three.js-Spiel: egal. Für Kundenarbeit unter NDA ist das ein Gespräch mit der Rechtsabteilung, kein Gratisessen.
Und Groks Kontextfenster ging in die falsche Richtung — 500K, runter von den 1M der Vorgängergeneration. Berichte deuten darauf hin, dass xAI wieder Richtung 1M ausbaut, aber plant mit 500K, denn das ist es, was heute ausgeliefert wird.
Also: Der günstigste Input ist Luna. Die günstigsten effektiven Kosten bei wortreicher agentischer Arbeit hat vermutlich Grok, sobald sich die Token-Effizienz aufsummiert. Am günstigsten für wiederholten identischen Kontext ist Grok mit Caching. „Am günstigsten" war nie eine einzelne Zahl, und der Test hat drei verschiedene Fragen zu einer falschen Antwort plattgedrückt.
Was uns zum interessanteren Teil dieses Experiments bringt — dem Teil, den es meiner Meinung nach richtig gemacht hat.
Warum ein Game-Build offenlegt, was Benchmarks verbergen
Seite eins für diesen Vergleich ist eine Wand aus SWE-bench-Pro- und Terminal-Bench-Zahlen. Hier ist der berichtete Stand der Dinge, und ich sage vorweg: Das sind größtenteils Anbieterzahlen auf Anbieter-Harnesses, also behandelt sie als Marketing mit Methodikkapitel:
| Benchmark | Fable 5 | Grok 4.5 | GPT-5.6 |
|---|---|---|---|
| SWE-Bench Pro | ~80,4 % | ~64,7 % | ~58,6 % (5.5) |
| Terminal-Bench 2.1 | ~84 % | ~83,3 % | ~91,9 % (Sol, Ultra-Modus) |
Schaut auf diese Tabelle und versucht, die Frage zu beantworten, die euch tatsächlich interessiert: Welches Modell macht den besseren Werbespot?
Geht nicht. Nichts darin misst das. SWE-bench fragt, ob ein Modell ein echtes GitHub-Issue lösen kann. Terminal-Bench fragt, ob es eine Shell planen und steuern kann. Beides ist wirklich nützlich, und beides schweigt komplett dazu, ob ein Modell weiß, dass ein Sonnenuntergang warmes Rim Light braucht, dass die Fase eines iPhones entlang einer Kante ein Glanzlicht einfängt oder dass sich eine Welt ohne Umgebungsgeräusche tot anfühlt, selbst wenn jede Mechanik funktioniert.
Das ist das Argument für den Kreativtest, und deshalb glaube ich, dass der Creator etwas Echtem auf der Spur war. Ein GTA-Klon in Three.js ist ein brutaler Einzel-Prompt. Er verlangt gleichzeitig: räumliches 3D-Denken, Physik, State Management für ein Fahndungssystem, eine Render-Loop, die nicht zusammenbricht, und Geschmack. Fehlt eines davon, sieht man es nach etwa vier Sekunden Footage. Es gibt keine Teilpunkte und keine Möglichkeit, es im Bericht zu kaschieren. Ein Benchmark liefert eine Prozentzahl. Ein spielbarer Build liefert ein Urteil, das man sehen kann.
Hier ist, was über die drei Briefings hinweg beobachtet wurde — als Beobachtung berichtet, nicht als meine Messung:
Die Open World im GTA-Stil. Groks Metro Rush hatte das Skelett — Autos, Polizei, ein Fahndungslevel — lief aber ruckelig und wirkte unfertig. GPT-5.6s Neon Burrow lieferte eine wirklich stabile Open World mit Geh-/Fahrmechaniken und einem Fünf-Sterne-Fahndungssystem; sauber und spielbar, ohne dynamische Stimmungsbeleuchtung. Fables Apex City holte sich den Sieg bei der Atmosphäre — dynamisches Sonnenuntergangslicht, besseres Fahrverhalten, eine Welt, die bewohnt wirkte — bei höherem Ressourcenverbrauch und nur einem Zwei-Sterne-Fahndungssystem.
Lest dieses letzte Gegensatzpaar noch einmal, denn es ist der entscheidende Hinweis. Fable lieferte besseres Licht und weniger Features. GPT-5.6 lieferte mehr System und flacheres Licht. Das ist nicht ein Modell, das schlauer ist. Das sind zwei Modelle, die unterschiedliche Wetten darauf abschließen, was „bau ein Spiel im GTA-Stil" bedeutet, wenn das Briefing es nicht sagt. Fable optimierte für den Screenshot; GPT-5.6 optimierte für die Spezifikation. Beides vertretbar. Keines davon ist ein Benchmark-Ergebnis.
Der Minecraft-Klon. Groks Vauilcraft sah korrekt aus und war hohl — Mobs vorhanden, aber begrenzt, kein Wasser. GPT-5.6 traf den Kern-Loop: Laufen, Bäume fällen, ein funktionierendes Wettersystem mit Echtzeit-Regensteuerung. Fable war das einzige Modell, das Sound lieferte — Mobs, die hörbar reagieren, dazu Wasser und Sand.
Sound ist das heimliche Ergebnis des gesamten Tests. In keinem Briefing stand „füge Audio hinzu". Jede Bewertungsrubrik in jeder Modell-Evaluation, die ich je gesehen habe, ignoriert es. Und es ist das eine Element, das „Tech-Demo" in den ersten drei Sekunden am stärksten von „Spiel" trennt. Wenn ihr wissen wollt, was ein Modell für seinen Job hält, schaut euch an, was es tut, wenn niemand danach gefragt hat.
Der iPhone-Werbespot. Grok verzerrte das Gehäuse und formte den Anschluss um — ein ordentlicher Versuch, keine Apple-Werbung. GPT-5.6 kam nah heran: Linse und Gehäuse eng nachgebildet, Frames synchronisiert, klar als das Original erkennbar. Fable produzierte Reflexionen, Beleuchtung und Materialien, die wie die Arbeit eines Motion-Studios wirkten.
Ein konsistentes Muster über alle drei Aufgaben: Fable gewinnt bei der Detailtreue, GPT-5.6 gewinnt bei Mechanik und Stabilität, Grok liefert ein Fundament zum Weiteriterieren. Das ist ein stimmiges Ergebnis. Es passt zum allgemeinen Ruf der Modelle. Und es ist genau so viel wert wie euer Vertrauen in vier Unbekannte — Prompts, Iterationsanzahl, Effort-Level und Kosten — von denen keine offengelegt wurde.
Vor allem die letzte.
Die Zahl, die der Test euch nie gezeigt hat
An jedem dieser Builds hängt eine Rechnung, und keine einzige davon wurde erwähnt. Also mache ich die Arithmetik, die die Demo übersprungen hat — denn sie verändert das Urteil.
Nehmen wir einen realistischen Single-Shot-Kreativ-Build: ein komplexes Three.js-Spiel aus einem detaillierten Briefing. Sagen wir 15K Input-Tokens (Briefing, Kontext, vielleicht etwas Referenzcode) und 40K Output (ein großer Single-File-Build plus Reasoning). Grob, aber in der Tendenz ehrlich.
| Modell | Input (15K) | Output (40K) | Pro Build |
|---|---|---|---|
| GPT-5.6 Luna | 0,015 $ | 0,24 $ | ~0,26 $ |
| Grok 4.5 | 0,03 $ | 0,24 $ | ~0,27 $ |
| GPT-5.6 Terra | 0,038 $ | 0,60 $ | ~0,64 $ |
| GPT-5.6 Sol | 0,075 $ | 1,20 $ | ~1,28 $ |
| Claude Fable 5 | 0,15 $ | 2,00 $ | ~2,15 $ |
Fable 5 kostet für denselben Build rund das 8-Fache von Luna. Und hier ist der Punkt, den die Demo euch nicht zeigen kann: Niemand bekommt den GTA-Klon im ersten Anlauf. Weder Fable noch sonst irgendjemand. Echte kreative Arbeit ist iterativ — man baut, man schaut, man sagt „das Licht ist flach", man geht in die nächste Runde. Multipliziert diese Tabelle mit acht Iterationen, und aus Fables 2,15 $ pro Build werden 17 $, während Luna bei 2 $ landet.
Rechnet jetzt ein, was ich auf die teure Art gelernt habe: Das Effort-Level ist ein Token-Multiplikator, keine Preisstufe. Fable 5s Preis pro Token liegt fix bei 10 $/50 $, unabhängig vom Effort. Was Effort verändert, ist, wie viele Tokens das Modell beim Nachdenken verbrennt, bevor es antwortet — und jeder dieser Denk-Tokens wird als Output abgerechnet, in der teuersten Token-Klasse, die Anthropic ausliefert. Dreht max bei einem Task auf, der es nicht brauchte, und ihr zahlt 50 $/M für Reasoning, das ihr weggeworfen habt. So kommt ein einzelner Task auf 22 $.
Der Rat des Videos lautet, Fable für komplexe Builds auf „extra oder max" laufen zu lassen. Abgesehen davon, dass das nicht beides echte Werte sind — dieser Rat, angewendet von jemandem, der gerade eine aufregende Demo gesehen hat, ist der Weg, mit einer Rechnung aufzuwachen, die man nicht eingeplant hat. Anthropics eigene Dokumentation weist darauf hin, dass Fable 5s niedrigere Effort-Level oft die xhigh-Leistung früherer Modelle übertreffen. Pauschal max ist keine Qualitätsstrategie. Es ist eine Steuer, für die man sich freiwillig meldet.
Also die ehrliche Kostenlesart: Fables Sieg bei der Detailtreue ist real, und er ist teuer — und ob er das 8-Fache wert ist, hängt komplett davon ab, ob das Ergebnis an einen Kunden geht oder im Downloads-Ordner stirbt. Der Test hat einen Sieger auf einer Dimension gekürt, in der der Preis keine Variable war. Der Preis ist immer eine Variable.
Wenn ihr die vollständige Version — Hebel für Hebel — wollt, wie man diese Rechnung senkt, ohne auf ein dümmeres Modell zu wechseln, ist die fünf Änderungen, die meine Fable-5-Kosten um bis zu 80 % gesenkt haben der Artikel, auf den ich zuerst verweisen würde.
Und das Deployment — entscheidet @Sites die Sache?
Der Test gibt GPT-5.6 hier einen echten Vorteil, und ich halte das für das am meisten unterschätzte Ergebnis des Ganzen.
@Sites bedeutet: Codex kann ein Three.js-Spiel bauen, hosten und eine live teilbare URL zurückgeben — kein Hosting-Account, keine Deploy-Pipeline, kein DevOps-Ticket. Es läuft auf OpenAI-Infrastruktur mit Cloudflare-Workers-kompatibler Technik. Für kreative Arbeit ist dieser Loop wirklich anders: Prompt → spielbarer Link, den man jemandem schicken kann. Der Feedback-Zyklus schrumpft von Stunden auf Minuten.
Das ist keine Modellfähigkeit. Das ist eine Produkt-Fähigkeit, und die Unterscheidung ist es wert, präzise zu sein, denn genau das wird eure tatsächliche Wahl am wahrscheinlichsten entscheiden. Fable 5 rendert vielleicht den schöneren Sonnenuntergang. Wenn GPT-5.6 euren Build in neunzig Sekunden vor einen Kunden bringt, während ihr noch herausfindet, wo ihr Fables Meisterwerk hosten sollt, hat der schönere Sonnenuntergang verloren.
Die Zugangsrealität mit Stand Juli 2026: allgemein verfügbar für zahlende ChatGPT-Abonnenten mit öffentlich einsehbaren Sites; Preview für Business und Enterprise, standardmäßig aktiv für Business, per RBAC admin-gesteuert für Enterprise. „Öffentlich einsehbar" leistet in diesem Satz stille Arbeit — prüft das, bevor ihr Kundenmaterial deployt.
Auf der Anthropic-Seite deckt Cowork die Workflow-Hälfte ab — Dateizugriff, mehrstufige Ausführung, MCP-Konnektoren, Plugins, inzwischen mit voller Parität unter Windows und Cloud-Tasks vom Smartphone. Ich lasse meine eigene Morning-Briefing-Pipeline darauf laufen und habe aufgeschrieben, was im Cowork-Cloud-Update tatsächlich funktioniert und was kaputtgeht. Es ist ein starkes Arbeitssystem. Es ist kein öffentliches Ein-Befehl-Deploy-Ziel, und so zu tun, als wären das dieselben Features, hilft niemandem.
GPT-5.6 vs Grok 4.5 vs Fable 5: Welches solltet ihr tatsächlich nutzen?
Keinen Universalsieger — diesen Teil hat der Test richtig hinbekommen, auch wenn er teils durch Glück dorthin gelangt ist. Hier ist das Framework, das ich tatsächlich anwenden würde, mit dem Preis darin:
Greift zu GPT-5.6 Luna, wenn ihr iteriert. Frühe Exploration, Wegwerf-Prototypen, zwölf Variationen derselben Szene. Bei ~0,26 $ pro Build ist es der günstigste Weg herauszufinden, ob eure Idee etwas taugt. Es ist außerdem — noch einmal zum Mitschreiben — beim Input günstiger als das Modell, das der Test zum günstigsten erklärt hat.
Greift zu GPT-5.6 Terra, wenn es echte Arbeit mit Budget ist. Das Arbeitstier für den Alltag, konkurrenzfähig mit GPT-5.5 zum halben Preis und der Standard, mit dem ich für die meisten Produktions-Workloads starten würde. Steigt erst auf, wenn ihr benennen könnt, woran Terra gescheitert ist.
Greift zu GPT-5.6 Sol, wenn ihr Mechaniken braucht, die zusammenhalten, und am Ende ein Deployment. Die beste Kombination aus Stabilität plus Ausliefern im Test, ~91,9 % auf Terminal-Bench 2.1 über die parallelen Subagenten des Ultra-Modus, und @Sites schließt den Loop. Ungefähr ein Drittel der Kosten von Fable.
Greift zu Grok 4.5, wenn die Arbeit wortreich und repetitiv ist — lange Agent-Läufe, gecachter Kontext, all das, wo sich Token-Effizienz aufsummiert. Seine 4,2-fache Output-Token-Effizienz tut mehr für eure Rechnung als jeder Listenpreis. Plant nur mit 500K Kontext und lest die Data-Sharing-Bedingungen.
Greift zu Fable 5, wenn der Output das Produkt ist. Kundengerichtet, portfoliotauglich, der Werbespot, der aussehen muss, als hätte ihn ein Studio gemacht. Wenn Spitzenqualität den Preis wirklich schlägt — und seid ehrlich damit, wie oft das zutrifft. Und dann lasst es zuerst auf medium oder high laufen und lasst es beweisen, dass es mehr braucht.
Der Meta-Zug — und der, der mir mehr gebracht hat als jede Treue zu einem einzelnen Modell: günstig iterieren, teuer finalisieren. Findet die Idee auf Luna. Baut die Struktur auf Terra oder Sol. Wenn es an jemanden ausgeliefert wird, der dafür bezahlt, macht den finalen Durchgang auf Fable. Das Framing des Tests — wähle deinen Kämpfer, einer gewinnt — hat die falsche Form für die Art, wie diese Arbeit tatsächlich läuft. Ihr wählt kein Modell. Ihr wählt ein Modell pro Phase, und die Phase, in der ihr 50 $/M Output-Tokens braucht, ist meistens die letzte.
Was ich sehen müsste, bevor ich irgendetwas davon glauben würde
Richten wir die Skepsis auch auf meine eigene Analyse, nachdem ich sie 2.000 Wörter lang auf die von jemand anderem gerichtet habe.
Alles oben ruht auf Beobachtungen, die ich nicht selbst gemacht habe. Vier Offenlegungen würden meine Einschätzung verändern, und bis es sie gibt, kalibriert entsprechend:
- Die exakten Prompts. Ein Modell, das bei einem vagen Briefing „verloren" hat, hat es vielleicht nur anders interpretiert. Fables Zwei-Sterne-Fahndungssystem gegenüber GPTs Fünf-Sterne-System ist nicht offensichtlich eine Fähigkeitslücke — es könnte eine Lücke im Prompt-Verständnis sein.
- Die Iterationsanzahl. One-Shot gegenüber Best-of-Five ist eine komplett andere Behauptung. Wenn Fables Sonnenuntergang vier Versuche brauchte und GPTs flaches Licht einen, kehrt sich das Ranking auf jeder Achse um, die eure Zeit einschließt.
- Das Effort-Level. Wenn Fable auf
maxlief und GPT-5.6 auf Standard, ist das kein Modellvergleich. Das ist ein Einstellungsvergleich mit einer Modellvergleichs-Überschrift. - Die Token-Rechnung pro Build. Ohne sie bedeutet „Fable gewinnt" nur „Fable gewinnt zu unbekannten Kosten", und das ist kein Ergebnis. Das ist eine Vorliebe.
Ich würde außerdem einen erneuten Durchlauf mit einem frischen Briefing sehen wollen. Jedes Modell dieser Klasse wurde auf einem Planeten voller Minecraft-Klone, GTA-Diskussionen und Apple-Werbespot-Frames trainiert. „Bau einen Minecraft-Klon" ist sehr nah an einer Memorierungs-Sonde. Fragt nach einem Spiel, das es nicht gibt — irgendeine Mechanik ohne Stack-Overflow-Antwort — und ich vermute, die Abstände sähen anders aus. Möglicherweise viel kleiner. Möglicherweise viel größer. Das ist der Test, den ich wirklich sehen wollte, und der, den ich selbst bauen müsste, bevor ich meinen Namen unter ein Urteil setze.
Der Dreifach-Kreativvergleich, dem ich vertrauen würde, wurde noch nicht durchgeführt. Dieser hier ist eine gute Skizze davon.
Der Teil, den ihr mitnehmen solltet
Zurück zum Anfang: Das Modell, das gewonnen hat, existierte nicht — und das Preis-Ranking auch nicht.
Das ist kein Seitenhieb gegen einen einzelnen Creator. Es ist die Textur dieses ganzen Moments. Modelle erscheinen inzwischen wöchentlich. Namen verschwimmen. Eine Demo wird geclippt, der Clip bekommt eine Schlagzeile, die Schlagzeile bekommt einen Spitznamen, und drei Wochen später wählen Leute Infrastruktur auf Basis einer Stille-Post-Kette, die damit begann, dass jemand einen Sonnenuntergang nach Augenmaß beurteilt hat. Der Kreativtest darunter war eine wirklich gute Idee — besser als die Benchmark-Tabellen, mit denen er konkurriert, weil er Geschmack gemessen hat, und Geschmack ist das, was Benchmarks strukturell nicht sehen können. Er wurde nur ohne die vier Zahlen veröffentlicht, die aus einem Vibe ein Ergebnis gemacht hätten.
Hier also das, worum ich euch tatsächlich bitten würde — und es dauert zehn Minuten. Öffnet vor eurer nächsten Modellentscheidung die Preisseite — die echte, die des Anbieters — und schreibt für jedes Modell, das ihr in Betracht zieht, den Input-Preis, den Output-Preis und das Kontextfenster auf. Stufe für Stufe. Nicht Flaggschiff gegen Budget. Dann fragt euch, woraus eure Arbeit tatsächlich besteht: Ist sie input-lastig oder output-lastig? Iterativ oder One-Shot? Geht sie an einen Kunden oder stirbt sie in eurem Downloads-Ordner?
Zehn Minuten davon schlagen zehn Stunden Demos. Es hätte die Luna-Sache sofort aufgedeckt.
Die Modelle sind außergewöhnlich. Alle drei. Der GTA-Klon aus einem einzigen Prompt wäre vor achtzehn Monaten Science-Fiction gewesen, und heute langweilt er uns schon. Aber die Lücke zwischen „das ist beeindruckend" und „das sollte ich am Dienstag laufen lassen" ist komplett mit Arithmetik gefüllt, und niemand clippt die für YouTube.
Macht die Arithmetik. Sie ist der einzige Teil von alldem, der wirklich euch gehört.
GPT-5.6 vs Grok 4.5 vs Fable 5: Schnelle Antworten
Was ist günstiger, Grok 4.5 oder GPT-5.6?
GPT-5.6 Luna ist beim Input günstiger mit 1 $ pro Million Tokens gegenüber 2 $ bei Grok 4.5, und beide kosten 6 $ pro Million Output. Groks echter Vorteil ist Token-Effizienz — rund 4,2-mal weniger Output-Tokens bei langen Tasks — plus gecachter Input für 0,50 $/M. Die Rechnung Stufe für Stufe steht im Preisabschnitt oben.
Was sind die drei GPT-5.6-Modelle?
GPT-5.6 erscheint in drei Stufen: Sol (5 $/30 $ pro 1M Tokens, Flaggschiff-Reasoning), Terra (2,50 $/15 $, das ausgewogene Arbeitstier) und Luna (1 $/6 $, schnell und kosteneffizient). Alle drei gingen am 9. Juli 2026 mit 1M-Token-Kontextfenstern in die General Availability.
Ist Claude Fable 5 seinen Preis für kreative Arbeit wert?
Fable 5 kostet pro Build rund das 8-Fache von GPT-5.6 Luna (10 $/50 $ pro 1M Tokens), und beobachtete Tests geben ihm den Vorsprung bei visueller Detailtreue, Beleuchtung und Audio. Es lohnt sich, wenn das Ergebnis an einen Kunden geht — nicht fürs Iterieren. Lasst es mit medium- oder high-Effort laufen, bevor ihr zu max greift.
Was sind die Effort-Level von Claude Fable 5?
Die API akzeptiert genau fünf Werte: low, medium, high, xhigh und max. Effort ist keine Preisstufe — der Preis von 10 $/50 $ ist fix. Höherer Effort verbrennt mehr Denk-Tokens, die alle als Output abgerechnet werden — so kommt ein einzelner Task auf 22 $.
Kann GPT-5.6 ein Spiel auf eine Live-URL deployen?
Ja — das @Sites-Plugin von Codex (kein /sites-Befehl) baut, hostet und liefert eine teilbare URL auf OpenAI-Infrastruktur zurück. Es ist allgemein verfügbar für zahlende ChatGPT-Abonnenten mit öffentlich einsehbaren Sites und in der Preview für Business- und Enterprise-Workspaces.
Der Teil, den ihr mitnehmen solltet
Zieht das Leaderboard-Theater ab, und eine Sache bleibt stehen: Alle drei Modelle sind außergewöhnlich, und der echte Unterschied ist nicht, welches einen Benchmark gewinnt — sondern welches seine Kosten bei der Arbeit verdient, die ihr tatsächlich macht. Ein Game-Build legt offen, was ein Datenblatt verbirgt, und das Kosten-Ranking kippte genau dort, wo die Namensverwirrung saß.
Also fahrt euren eigenen Test auf eurem eigenen Task, bevor ihr irgendeinem Vergleich vertraut — meinem eingeschlossen. Das Modell, das bei eurer Arbeit gewinnt, ist das einzige Ranking, das eure Rechnungen bezahlt.
Wenn ihr Hilfe dabei wollt, das richtige Modell auszuwählen und in ein echtes Produkt einzubauen — das mache ich über Ramlit. Der Kreativtest oben ist mein ehrlicher Versuch, durch die Namen hindurch Klarheit zu schaffen.