Het model dat deze vergelijking zogenaamd won, bestaat niet. Twee van de drie namen die iedereen blijft herhalen trouwens ook niet.
Dat is geen muggenzifterij — het is precies de reden dat ik ben gaan zitten om dit te schrijven. Een creator deed een oprecht interessant experiment: geef drie frontier-modellen dezelfde creatieve briefing, bouw een open wereld in GTA-stijl, een Minecraft-kloon en een iPhone-advertentie van 30 seconden, allemaal browser-native in Three.js, en kijk wie er wint. Goede test. Beter dan wéér een SWE-bench-grafiek, eerlijk gezegd. Maar de write-up noemde ze "GPT 5.6", "Codeex" en "Claude's Fable", en tegen de tijd dat die framing drie keer is gedeeld, nemen mensen echte budgetbeslissingen op basis van modelnamen die niet bestaan en een kostenrangschikking die compleet omgekeerd is.
Dit is dus een GPT-5.6 vs Grok 4.5 vs Fable 5-vergelijking waarbij de bonnetjes zijn gecontroleerd. Dezelfde creatieve invalshoek — want dat is de juiste invalshoek, en pagina één voor deze zoekopdracht bestaat uit niets dan benchmarktabellen — maar met de echte productnamen, de echte tarieven van juli 2026 en de echte rekensom van wat een creatieve build je kost.
Eerlijke waarschuwing bij een van die getallen: het "goedkoopste" model in die test is niet het goedkoopste model. Niet eens in de buurt. Ik kom erop terug.
Even eerlijk over wiens test dit is
Voordat ik ook maar één frame van iemands Minecraft-kloon analyseer, eerst de disclosure — want ik heb te veel mensen een YouTube-demo zien witwassen tot "ik heb dit getest" en daar doe ik niet aan mee.
Ik heb de game-builds niet zelf gedraaid. Ik heb Neon Burrow, Apex City en Metro Rush niet gebouwd. Dat zijn de outputs van een creator, met de prompts van een creator, op de machine van een creator, en ik heb precies wat jij hebt: de beelden. Wat ik je niet kan vertellen, is wat er in de prompts stond, hoeveel iteraties er liepen vóór de take die de montage haalde, welk effort-niveau was ingesteld of hoe de tokenrekening eruitzag. Die vier onbekenden zijn toevallig precies de vier variabelen die de uitkomst van zo'n test bepalen. Houd dat in je achterhoofd.
Waar ik wél uit eerste hand over kan spreken, is het deel dat de demo overleeft: de modellen zelf, de tarieven en wat ze kosten als je ze echt draait. Ik draai de meeste dagen multi-model-agentpipelines. Ik heb de pijnlijke versie van de Fable 5-kostenles al achter de rug — ik zag één enkele taak $22 verbranden en moest mijn hele effort-level-strategie eromheen herbouwen, wat ik uitgebreid heb beschreven in mijn analyse van het terugdringen van Fable 5-gebruikskosten. Ik heb Grok 4.5 in mijn stack opgenomen en in kaart gebracht waarom het efficiënte model vaker wint van het slimme dan iemand wil toegeven. Dat is mijn ground truth. De builds zijn van iemand anders.
Lees dit dus als wat het is: een analyselaag bovenop een test van derden, plus de geverifieerde cijfers die de test wegliet. Dat is minder spannend dan "ik heb alle drie getest!". Het is ook waar, en de ware versie is nuttiger voor jou, want in de correcties zit het geld.
Te beginnen bij de namen.
GPT-5.6 vs Grok 4.5 vs Fable 5: de echte namen en de echte tarieven
Hier is de correctietabel. Alles hieronder komt uit vendor- en prijsdocumentatie per juli 2026, niet uit de video.
| De video noemde het | Het is eigenlijk | Input / output per 1M | Context |
|---|---|---|---|
| "GPT 5.6" (één model, drie "breinen") | GPT-5.6 Sol — vlaggenschip, diepste redenering | $5 / $30 | 1M |
| ↳ "gebalanceerde middenmoot" | GPT-5.6 Terra — het werkpaard voor alledag | $2,50 / $15 | 1M |
| ↳ "lichte versie" | GPT-5.6 Luna — snel, high-volume, latency-gevoelig | $1 / $6 | 1M |
| "Codeex" | Codex — de coding-agent van OpenAI | — | — |
"het /sites-commando" |
@Sites — een plugin die je in de thread aanroept |
— | — |
| "Claude's Fable" | Claude Fable 5 — Anthropics model uit de Mythos-klasse | $10 / $50 | — |
| "effort: extra of max" | Effort accepteert low, medium, high, xhigh, max | — | — |
| "Grok 4.5" ✓ | Grok 4.5 (xAI — niet SpaceX, wat de berichtgeving ook zegt) | $2 / $6 | 500K |
| "3.js" | Three.js — de WebGL-library | — | — |
Een paar hiervan doen er meer toe dan spelling.
GPT-5.6 is een familie, geen model. De hele Sol/Terra/Luna-splitsing ging op 9 juli 2026 in GA met een venster van 1M tokens over alle drie de tiers — het staartje van een gated, geopolitiek rommelige uitrol die ik heb nagetrokken in mijn lezing van de GPT-5.6-serie en de gated AI-frontier. Als de test zegt "GPT 5.6 bouwde een strakke open wereld", is de enige vraag die ertoe doet welke tier — want dat is een prijsverschil van 5x tussen Sol en Luna, en dat is het verschil tussen een build die centen kost en een die dat niet doet. De framing van de video — "drie breinen waaruit je kiest" — is niet per se fout. Er ontbreken alleen de namen die je nodig hebt om er daadwerkelijk een te bestellen.
De effort-niveaus van Fable 5 kennen geen "extra". De API accepteert low, medium, high, xhigh, max. Als je dit ergens in verwerkt, gooit "extra" een error. Klein detail. Kost je twintig minuten.
@Sites is geen slash-commando. Het is een plugin die je in een Codex-thread aanroept wanneer een taak moet eindigen in een deployment. Codex bouwt het project, draait het, deployt naar OpenAI-infrastructuur en geeft je een live URL terug. Het lanceerde op 2 juni 2026 en is sindsdien GA voor betalende abonnees, waarbij Business- en Enterprise-workspaces nog in preview zitten achter admin-toggles. /sites typen levert je niets op.
En nu — de correctie die daadwerkelijk een beslissing verandert.
De kostenrangschikking in die test is omgekeerd
De samenvattende tabel van de video zet Grok 4.5 op "Cost: Lowest" en noemt het de goedkoopste instapoptie. Dat is de meest herhaalde claim over deze vergelijking en hij overleeft het contact met de prijslijst niet.
Grok 4.5 kost $2 in / $6 uit. GPT-5.6 Luna kost $1 in / $6 uit.
Luna is de helft van de prijs op input en identiek op output. Er is geen lezing van die twee regels waarin Grok "de goedkoopste" is. Als je workload input-zwaar is — lange context, grote bestanden, veel herlezen, wat zo'n beetje elke agentic build beschrijft — is Luna wezenlijk goedkoper dan het model dat de test tot budgetkeuze kroonde. Zelfs Terra zit met $2,50/$15 binnen een afrondingsfout van Grok op input.
Hoe kreeg de test dit omgekeerd? Vrijwel zeker door Grok te vergelijken met Sol en het daarbij te laten. Tegenover Sols $5/$30 oogt Grok inderdaad goedkoop. Maar dat is het budgetmodel vergelijken met het vlaggenschip van de ander en een prijsoverwinning uitroepen — dat is alsof je een Civic goedkoper noemt dan een 911 en concludeert dat Honda het waardemerk is. Vergelijk tier met tier en het verhaal kantelt.
Groks echte prijsvoordeel zit ergens anders, en het is reëel — het is alleen niet het stickertarief:
- Gecachte input voor $0,50/M (75% korting) — sterk als je herhaaldelijk op dezelfde context blijft hameren.
- Tot $175/maand aan gratis API-credits via het data-sharing-programma van xAI, de royaalste gratis tier die een grote aanbieder op dit moment levert.
- Tokenefficiëntie. Dit is degene die er echt toe doet en die niemand in een grafiek zet. xAI rapporteerde dat Grok 4.5 op lange codeertaken grofweg 4,2x minder output-tokens gebruikt dan Opus 4.8 — ongeveer 15.954 gemiddelde output-tokens per taak tegenover 67.020. Het stickertarief is het belastingtarief. Het tokenaantal is het inkomen. Een model dat per token nominaal duurder is, kan verliezen van een model dat simpelweg minder zegt.
Er zit een addertje aan de gratis credits dat je wilt kennen voordat je enthousiast wordt: het is een data-sharing-programma. Jouw verkeer traint hun model. Voor een wegwerp-Three.js-game: wie maalt erom. Voor klantwerk onder een NDA is dat een gesprek met juridische zaken, geen gratis lunch.
En Groks contextvenster ging de verkeerde kant op — 500K, omlaag ten opzichte van de 1M van de vorige generatie. Berichten wijzen erop dat xAI weer richting 1M uitbreidt, maar ontwerp op 500K, want dat is wat vandaag geleverd wordt.
Dus: goedkoopste input is Luna. Goedkoopste effectieve kosten op breedsprakig agentic werk is waarschijnlijk Grok, zodra tokenefficiëntie gaat samengestelde rente opleveren. Goedkoopst voor herhaalde identieke context is Grok met caching. "Goedkoopste" was nooit één getal, en de test perste drie verschillende vragen samen tot één fout antwoord.
Wat ons bij het interessantste deel van dit experiment brengt — het deel dat het volgens mij goed had.
Waarom een game bouwen blootlegt wat benchmarks verbergen
Pagina één voor deze vergelijking is een muur van SWE-bench Pro- en Terminal-Bench-cijfers. Hier is de gerapporteerde stand van zaken, en ik zeg er meteen bij dat dit grotendeels vendorcijfers op vendor-harnassen zijn, wat betekent: behandel ze als marketing met een methodologiesectie:
| Benchmark | Fable 5 | Grok 4.5 | GPT-5.6 |
|---|---|---|---|
| SWE-Bench Pro | ~80,4% | ~64,7% | ~58,6% (5.5) |
| Terminal-Bench 2.1 | ~84% | ~83,3% | ~91,9% (Sol, ultra mode) |
Kijk naar die tabel en probeer de vraag te beantwoorden die je eigenlijk hebt: welke maakt een betere advertentie?
Dat kan niet. Niets daarin meet het. SWE-bench vraagt of een model een echt GitHub-issue kan oplossen. Terminal-Bench vraagt of het een shell kan plannen en aansturen. Beide zijn oprecht nuttig en beide zwijgen volledig over de vraag of een model weet dat een zonsondergang warm randlicht nodig heeft, dat de afgeschuinde rand van een iPhone langs één kant een speculaire highlight vangt, of dat een wereld zonder omgevingsgeluid dood aanvoelt, zelfs als elke mechaniek werkt.
Dat is het pleidooi voor de creatieve test, en daarom denk ik dat de creator iets echts te pakken had. Een GTA-kloon in Three.js is een genadeloze enkele prompt. Hij eist, tegelijkertijd: ruimtelijk 3D-redeneren, physics, state management voor een wanted-systeem, een render-loop die niet instort, én smaak. Mis er één en het is binnen vier seconden footage zichtbaar. Er zijn geen gedeeltelijke punten en er valt niets te faken in de write-up. Een benchmark geeft je een percentage. Een speelbare build geeft je een oordeel dat je kunt zien.
Dit is wat er bij de drie briefings werd waargenomen, gerapporteerd als observatie — niet als mijn eigen meting:
De open wereld in GTA-stijl. Groks Metro Rush had het skelet — auto's, politie, een wanted level — maar draaide traag en voelde onaf. GPT-5.6's Neon Burrow leverde een oprecht stabiele open wereld met loop/rij-mechanics en een vijfsterren-wanted-systeem; strak en speelbaar, geen dynamische sfeerbelichting. Fables Apex City pakte het op atmosfeer — dynamische zonsondergangbelichting, betere autobesturing, een wereld die bewoond aanvoelde — tegen zwaardere resourcekosten en met slechts een tweesterren-wanted-systeem.
Lees die laatste tegenstelling nog eens, want daar zit de tell. Fable leverde beter licht en minder features. GPT-5.6 leverde meer systeem en vlakker licht. Dat is niet één model dat slimmer is. Dat zijn twee modellen die verschillende gokken doen over wat "bouw een game in GTA-stijl" betekent als de briefing het niet zegt. Fable optimaliseerde voor de screenshot; GPT-5.6 optimaliseerde voor de spec. Beide verdedigbaar. Geen van beide is een benchmarkresultaat.
De Minecraft-kloon. Groks Vauilcraft zag er correct uit en was hol — mobs aanwezig maar beperkt, geen water. GPT-5.6 zette de kernloop perfect neer: lopen, bomen hakken, een werkend weersysteem met realtime regenbediening. Fable was de enige die geluid leverde — mobs die hoorbaar reageren, plus water en zand.
Geluid is het sleeper-resultaat van de hele test. Geen enkele briefing zei "voeg audio toe". Elke scoringsrubriek in elke model-eval die ik ooit heb gezien negeert het. En het is het ene ding dat "tech demo" in de eerste drie seconden het meest onderscheidt van "game". Als je wilt weten wat een model gelooft dat de opdracht is, kijk dan naar wat het doet als niemand erom vroeg.
De iPhone-advertentie. Grok vervormde de behuizing en gaf de poort een andere vorm — een degelijke poging, geen Apple-advertentie. GPT-5.6 kwam dichtbij: lens en behuizing nauwkeurig gerepliceerd, frames gesynchroniseerd, herkenbaar het echte ding. Fable produceerde reflecties, belichting en materialen die aanvoelen als werk van een motion-studio.
Consistent patroon over alle drie: Fable wint op fideliteit, GPT-5.6 wint op mechanics en stabiliteit, Grok geeft je een fundament om op te itereren. Dat is een coherente bevinding. Het strookt met de algemene reputatie van de modellen. En het is precies zoveel waard als je vertrouwen in vier onbekenden — prompts, iteratieaantal, effort-niveau en kosten — waarvan er geen enkele werd bekendgemaakt.
Vooral die laatste.
Het getal dat de test je nooit liet zien
Aan elk van die builds hangt een rekening en geen enkele werd genoemd. Laat mij dus de rekensom doen die de demo oversloeg, want die verandert het oordeel.
Neem een realistische single-shot creatieve build: een complexe Three.js-game vanuit een gedetailleerde briefing. Zeg 15K input-tokens (briefing, context, misschien wat referentiecode) en 40K output (een grote single-file-build plus redenering). Ruw, maar directioneel eerlijk.
| Model | Input (15K) | Output (40K) | Per build |
|---|---|---|---|
| GPT-5.6 Luna | $0,015 | $0,24 | ~$0,26 |
| Grok 4.5 | $0,03 | $0,24 | ~$0,27 |
| GPT-5.6 Terra | $0,038 | $0,60 | ~$0,64 |
| GPT-5.6 Sol | $0,075 | $1,20 | ~$1,28 |
| Claude Fable 5 | $0,15 | $2,00 | ~$2,15 |
Fable 5 kost grofweg 8x wat Luna kost voor dezelfde build. En hier is wat de demo je niet kan laten zien: niemand krijgt de GTA-kloon in één keer. Fable niet, niemand. Echt creatief werk is iteratief — je bouwt, je kijkt, je zegt "de belichting is vlak", je gaat opnieuw. Vermenigvuldig die tabel met acht iteraties en Fables $2,15 per build wordt $17, terwijl Luna op $2 uitkomt.
Reken daar nu bij wat ik op de dure manier heb geleerd: effort-niveau is een tokenvermenigvuldiger, geen prijstier. Het tokentarief van Fable 5 ligt vast op $10/$50, ongeacht effort. Wat effort verandert, is hoeveel tokens het verbrandt met denken voordat het antwoordt — en elk van die denk-tokens wordt gefactureerd als output, tegen de duurste tokenklasse die Anthropic levert. Zet max aan op een taak die het niet nodig had en je betaalt $50/M voor redenering die je weggooit. Zo raakt één taak $22.
Het advies van de video is om Fable op "extra of max" te draaien voor complexe builds. Los van het feit dat dat niet allebei echte waarden zijn — dat advies, toegepast door iemand die net een spannende demo heeft gezien, is hoe je wakker wordt met een rekening die je niet had gemodelleerd. Anthropics eigen documentatie merkt op dat de lagere effort-niveaus van Fable 5 vaak de xhigh-prestaties van eerdere modellen overtreffen. Standaard alles op max is geen kwaliteitsstrategie. Het is een belasting waar je vrijwillig voor tekent.
Dus de eerlijke kostenlezing: Fables fideliteitsoverwinning is echt en ze is duur, en of ze 8x waard is hangt er volledig van af of de output naar een klant gaat of sterft in je downloadmap. De test riep een winnaar uit op een dimensie waarin prijs geen variabele was. Prijs is altijd een variabele.
Wil je de volledige hendel-voor-hendel-versie van hoe je die rekening omlaag krijgt zonder terug te vallen op een dommer model, dan is de vijf aanpassingen die mijn Fable 5-kosten tot 80% verlaagden het stuk waar ik je als eerste naar zou verwijzen.
En deployment dan — beslist @Sites het?
De test geeft GPT-5.6 hier een echte voorsprong en ik denk dat het de meest onderschatte bevinding van het hele verhaal is.
@Sites betekent dat Codex een Three.js-game kan bouwen, hosten en een live deelbare URL kan teruggeven — geen hostingaccount, geen deploy-pipeline, geen DevOps-ticket. Het draait op OpenAI-infrastructuur met Cloudflare Workers-compatibele techniek. Voor creatief werk is die lus oprecht anders: prompt → speelbare link die je iemand kunt sturen. De feedbackcyclus krimpt van uren naar minuten.
Dat is geen modelcapaciteit. Dat is een productcapaciteit, en het loont om precies te zijn over dat onderscheid, want dit is het ding dat het meest waarschijnlijk je daadwerkelijke keuze bepaalt. Fable 5 rendert misschien een mooiere zonsondergang. Als GPT-5.6 jouw build in negentig seconden bij een klant krijgt terwijl jij nog uitzoekt waar je Fables meesterwerk moet hosten, heeft de mooiere zonsondergang verloren.
De toegangsrealiteit per juli 2026: GA voor betalende ChatGPT-abonnees met publiek zichtbare sites; preview voor Business en Enterprise, standaard aan voor Business, admin-gated achter RBAC voor Enterprise. "Publiek zichtbaar" doet stil werk in die zin — controleer het voordat je klantmateriaal deployt.
Aan de Anthropic-kant dekt Cowork de workflow-helft — bestandstoegang, meerstaps-uitvoering, MCP-connectors, plugins, nu met volledige pariteit op Windows en cloudtaken vanaf mobiel. Ik draai er mijn eigen ochtendbriefing-pipeline op en schreef op wat er echt werkt en wat er breekt in de Cowork-cloudupdate. Het is een sterk werksysteem. Het is geen publiek deploy-doel met één commando, en doen alsof dat dezelfde feature is, helpt niemand.
GPT-5.6 vs Grok 4.5 vs Fable 5: welke moet je nu echt gebruiken?
Geen universele winnaar — dat deel had de test goed, ook al kwam hij er deels per ongeluk. Dit is het kader dat ik daadwerkelijk zou toepassen, mét prijs erin:
Grijp naar GPT-5.6 Luna wanneer je aan het itereren bent. Vroege verkenning, wegwerp-prototypes, twaalf variaties van dezelfde scène. Voor ~$0,26 per build is het de goedkoopste manier om erachter te komen of je idee wat waard is. Het is ook — zeg het nog maar eens — goedkoper op input dan het model dat die test het goedkoopst noemde.
Grijp naar GPT-5.6 Terra wanneer het echt werk met een budget is. Het werkpaard voor alledag, competitief met GPT-5.5 tegen de halve prijs, en de default waarmee ik zou beginnen voor de meeste productieworkloads. Ga alleen omhoog als je kunt benoemen waar Terra op faalde.
Grijp naar GPT-5.6 Sol wanneer je mechanics nodig hebt die overeind blijven en een deploy aan het eind. Beste combinatie van stabiliteit plus shippen in de test, ~91,9% op Terminal-Bench 2.1 via de parallelle subagents van ultra mode, en @Sites sluit de lus. Ongeveer een derde van Fables kosten.
Grijp naar Grok 4.5 wanneer het werk breedsprakig en repetitief is — lange agent-runs, gecachte context, het soort werk waar tokenefficiëntie zich opstapelt. Zijn 4,2x output-tokenefficiëntie doet meer voor je rekening dan welk stickertarief dan ook. Plan alleen rond 500K context en lees de data-sharing-voorwaarden.
Grijp naar Fable 5 wanneer de output het product is. Klantgericht, portfoliowaardig, de advertentie die eruit moet zien alsof een studio hem maakte. Wanneer piekkwaliteit oprecht boven prijs gaat — en wees eerlijk over hoe vaak dat waar is. Draai hem dan eerst op medium of high en laat hem bewijzen dat hij meer nodig heeft.
De meta-zet, en degene die mij meer heeft opgeleverd dan trouw aan welk enkel model dan ook: itereer goedkoop, maak duur af. Vind het idee op Luna. Bouw de structuur op Terra of Sol. Gaat het naar iemand die betaalt, draai dan de laatste pass op Fable. De framing van de test — kies je vechter, één wint — heeft de verkeerde vorm voor hoe dit werk echt gaat. Je kiest geen model. Je kiest een model per fase, en de fase waarin je $50/M aan output-tokens nodig hebt is meestal de laatste.
Wat ik zou moeten zien voordat ik hier iets van vertrouw
Laat me de scepsis ook op mijn eigen analyse richten, nu ik er 2.000 woorden lang mee op die van iemand anders heb gemikt.
Alles hierboven rust op observaties die ik niet zelf heb gedaan. Vier disclosures zouden mijn lezing veranderen, en tot ze bestaan: kalibreer daarnaar:
- De exacte prompts. Een model dat "verloor" op een vage briefing heeft hem misschien gewoon anders geïnterpreteerd. Fables tweesterren-wanted-systeem tegenover GPT's vijf sterren is niet vanzelfsprekend een capaciteitsverschil — het kan een verschil in promptlezing zijn.
- Het iteratieaantal. One-shot versus best-of-five is een compleet andere claim. Als Fables zonsondergang vier pogingen kostte en GPT's vlakke belichting één, kantelt de rangschikking op elke as waar jouw tijd in zit.
- Het effort-niveau. Als Fable op
maxdraaide en GPT-5.6 op default, is dat geen modelvergelijking. Dat is een instellingenvergelijking met een modelvergelijking als kop. - De tokenrekening per build. Zonder die betekent "Fable wint" "Fable wint tegen onbekende kosten", en dat is geen bevinding. Dat is een voorkeur.
Ik zou ook een herhaling willen op een verse briefing. Elk model in deze klasse is getraind op een planeet vol Minecraft-klonen, GTA-discussies en Apple-advertentieframes. "Bouw een Minecraft-kloon" zit heel dicht bij een memorisatieproef. Vraag om een game die niet bestaat — een mechaniek zonder Stack Overflow-antwoord — en ik vermoed dat de verschillen er anders uitzien. Mogelijk veel kleiner. Mogelijk veel groter. Dat is de test die ik echt zou willen zien, en het is degene die ik zelf zou moeten bouwen voordat ik mijn naam onder een oordeel zet.
De driewegsvergelijking op creatief werk die ik zou vertrouwen, is nog niet uitgevoerd. Deze is er een goede schets van.
Het deel dat je moet meenemen
Ga terug naar waar we begonnen: het model dat won bestond niet, en de prijsrangschikking evenmin.
Dat is geen sneer naar één creator. Het is de textuur van dit hele moment. Modellen verschijnen nu wekelijks. Namen vervagen. Een demo wordt geknipt, de clip krijgt een kop, de kop krijgt een bijnaam, en drie weken later kiezen mensen infrastructuur op basis van een doorfluisterspelletje dat begon met iemand die een zonsondergang op het oog beoordeelde. De creatieve test eronder was een oprecht goed idee — beter dan de benchmarktabellen waarmee hij concurreert, omdat hij smaak mat, en smaak is het ding dat benchmarks structureel niet kunnen zien. Hij werd alleen gepubliceerd zonder de vier getallen die er een bevinding van zouden maken in plaats van een vibe.
Dus dit is wat ik je echt zou willen vragen, en het kost tien minuten. Open vóór je volgende modelbeslissing de prijspagina — de echte, die van de vendor — en schrijf voor elk model dat je overweegt het inputtarief, het outputtarief en het contextvenster op. Tier tegenover tier. Niet vlaggenschip-tegenover-budget. Vraag je vervolgens af waar je werk echt uit bestaat: is het input-zwaar of output-zwaar? Iteratief of one-shot? Gaat het naar een klant of sterft het in je downloadmap?
Tien minuten daarvan verslaan tien uur aan demo's. Het had het Luna-punt direct opgemerkt.
De modellen zijn buitengewoon. Alle drie. De GTA-kloon in één prompt was achttien maanden geleden sciencefiction geweest en nu vervelen we ons erbij. Maar de kloof tussen "dit is geweldig" en "dit is wat ik dinsdag moet draaien" is volledig gevuld met rekenwerk, en niemand knipt dát voor YouTube.
Doe het rekenwerk. Het is het enige deel hiervan dat echt van jou is.
GPT-5.6 vs Grok 4.5 vs Fable 5: snelle antwoorden
Welke is goedkoper, Grok 4.5 of GPT-5.6?
GPT-5.6 Luna is goedkoper op input met $1 per miljoen tokens tegenover $2 voor Grok 4.5, en beide kosten $6 per miljoen output. Groks echte voordeel is tokenefficiëntie — grofweg 4,2x minder output-tokens op lange taken — plus gecachte input voor $0,50/M. Zie de prijssectie hierboven voor de rekensom per tier.
Wat zijn de drie GPT-5.6-modellen?
GPT-5.6 verschijnt in drie tiers: Sol ($5/$30 per 1M tokens, vlaggenschip-redenering), Terra ($2,50/$15, het gebalanceerde werkpaard) en Luna ($1/$6, snel en kostenefficiënt). Alle drie gingen op 9 juli 2026 in GA met contextvensters van 1M tokens.
Is Claude Fable 5 zijn prijs waard voor creatief werk?
Fable 5 kost ongeveer 8x GPT-5.6 Luna per build ($10/$50 per 1M tokens), en geobserveerde tests geven het de voorsprong op visuele fideliteit, belichting en audio. Het is het waard wanneer de output naar een klant gaat — niet om te itereren. Draai eerst op medium- of high-effort voordat je naar max grijpt.
Wat zijn de effort-niveaus van Claude Fable 5?
De API accepteert precies vijf waarden: low, medium, high, xhigh en max. Effort is geen prijstier — het tarief van $10/$50 ligt vast. Hogere effort verbrandt meer denk-tokens, allemaal gefactureerd als output, en zo bereikt één taak $22.
Kan GPT-5.6 een game naar een live URL deployen?
Ja — de @Sites-plugin van Codex (geen /sites-commando) bouwt, host en levert een deelbare URL op OpenAI-infrastructuur. Het is GA voor betalende ChatGPT-abonnees met publiek zichtbare sites, en in preview voor Business- en Enterprise-workspaces.
Het deel dat je moet meenemen — de kern
Strip het leaderboard-theater weg en één ding blijft overeind: alle drie de modellen zijn buitengewoon, en de echte onderscheidende factor is niet welke een benchmark wint — het is welke zijn kosten terugverdient op het werk dat jij daadwerkelijk doet. Een game-build legt bloot wat een spec sheet verbergt, en de kostenrangschikking kantelde precies daar waar de naamsverwarring zat.
Draai dus je eigen test op je eigen taak voordat je welke vergelijking dan ook vertrouwt, de mijne incluis. Het model dat wint op jouw werk is de enige rangschikking die jouw rekeningen betaalt.
Wil je hulp bij het kiezen en inbouwen van het juiste model in een echt product, dan is dat iets wat ik doe via Ramlit. De creatieve test hierboven is mijn eerlijke poging om door de namen heen te snijden.