GPT-5.6-serie en de vergrendelde AI-grens: de blik van een bouwer
Ik kwam terug van twee weken reizen met de verwachting bij te praten in een rustige nieuwscyclus. In plaats daarvan opende ik mijn feed en ontdekte dat OpenAI stilletjes een hele GPT-5.6-serie had voorgeprogrammeerd — Sol, Terra, Luna — twee dagen voordat iemand er klaar voor was, en de luidste reactie ging niet over benchmarks. Het ging over wie het ding überhaupt mag aanraken.
Hier is het deel dat de manier waarop ik over dit hele moment nadenk overhoop heeft gegooid. Drie jaar lang betekende een frontier-launch één ding: een blogpost, een benchmark-grafiek en een API-sleutel die je diezelfde middag in je terminal kon plakken. De GPT-5.6-serie brak dat ritueel. Het vlaggenschip zit vergrendeld achter goedkeuring van de Amerikaanse overheid. Anthropics krachtigste model werd ronduit verbannen voor twee weken. En China's volgende codeermodel evenaart naar verluidt het beste westerse cybermodel op het gebied van kwetsbaarhedenonderzoek. De grens werd deze maand niet alleen slimmer. Ze werd vergrendeld.
Ik wil eerlijk tegen je zijn voordat we verder gaan, want de helft van de posts die je hierover leest, gaan doen alsof dit niet zo is. Toen deze preview voor het eerst opdook, had ik GPT-5.6 Sol niet gedraaid — ik was buiten de VS toen hij verscheen, en zelfs binnen het land was hij beperkt tot een korte lijst vooraf goedgekeurde partners. (Die drempel viel weg op 9 juli 2026, toen OpenAI Sol na een brede overheidsgoedkeuring openstelde voor het publiek.) De persoon die de preview naar buiten bracht, kon er zelf ook geen volledige toegang toe krijgen. Dus dit is geen hands-on review. Het is iets wat volgens mij op dit moment nuttiger is: een bouwer die elke claim in de preview neemt, scheidt wat bevestigd is van wat gerucht is, de verifieerbare delen tegen echte data legt, en de ene rode draad eruit haalt die er voor de rest van ons echt toe doet.
Die rode draad is dit: het spel is niet langer "wie heeft de hoogste benchmark" maar "wie mag het model gebruiken, waar mag het draaien, en in wiens workflow zit het al ingebakken". Laat me je meenemen langs alles wat is verschoven, en waarom.
Wat is de GPT-5.6-serie? De opsplitsing in drie modellen
De GPT-5.6-serie is OpenAI's eerste frontier-release die als een gelaagde familie van drie modellen wordt uitgebracht — Sol, Terra en Luna — in plaats van als één model met redeneer-schakelaars, met het vlaggenschip vergrendeld achter goedkeuring van de Amerikaanse overheid. Die structuur is het nieuws, meer dan welk afzonderlijk cijfer dan ook.
Volgens de preview ziet de opsplitsing er zo uit. Behandel de prijzen als voorlopige cijfers, niet als een gepubliceerde tarievenkaart — OpenAI had geen officiële prijspagina online staan toen dit opdook, dus ik neem de cijfers over zoals ze zijn opgegeven en markeer ze als zodanig.
Sol is het vlaggenschip. De preview presenteert het als een stapsgewijze sprong boven GPT-5.5 — geen polish-release, maar een echte generatie-sprong. Gerapporteerde prijs: ongeveer $5 per miljoen inputtokens en $30 per miljoen outputtokens. Het introduceert twee nieuwe redeneerniveaus boven de normale ladder — een "max reasoning"-modus en een "ultra"-modus die meerdere sub-agents op één taak inzet. Het is ook de beperkte tier. Alleen goedgekeurde partners.
Terra is het gebalanceerde werkpaard. De preview zet de prestaties neer als grofweg vergelijkbaar met GPT-5.5, gericht op dagelijks efficiënt werk, tegen een adviesprijs die naar verluidt rond de helft van die van GPT-5.5 ligt. Dit is degene die de meeste teams eigenlijk elke dag zouden pakken — als ze hem kunnen krijgen.
Luna is de volumespeler. Snel, goedkoop, bescheiden. Gerapporteerde prijs: ongeveer $1 per miljoen inputtokens en $6 per miljoen outputtokens. Gebouwd voor high-throughput, lager-risico workloads waar je meer geeft om kosten per call dan om rauwe intelligentie — classificatie, bulk-extractie, de onspectaculaire ruggengraat van de meeste productie-AI.
Alle drie delen naar verluidt een contextvenster van rond de 1,5 miljoen tokens. Als dat klopt, is dat een betekenisvolle sprong, en het plaatst de GPT-5.6-serie in hetzelfde long-context terrein waarin ik dook toen ik Opus 4.6's contextvenster van een miljoen tokens testte — het punt waarop "gooi gewoon de hele codebase in de prompt" ophoudt een truc te zijn en een workflow wordt.
| Variant | Rol | Gerapporteerde input / output | Opmerkelijk | Beschikbaarheid |
|---|---|---|---|---|
| Sol | Vlaggenschip | ~$5 / ~$30 per M tokens | Max + Ultra reasoning, multi-sub-agent | Beperkt — goedgekeurde partners |
| Terra | Gebalanceerd dagelijks | ~2x goedkoper dan GPT-5.5 | ~GPT-5.5-prestaties | Verwacht breed |
| Luna | Hoog volume | ~$1 / ~$6 per M tokens | Goedkope throughput | Verwacht als eerste GA |
Let op de strategie in die tabel. OpenAI levert geen een model meer. Het levert een ladder: een slim, gereguleerd, duur model bovenaan voor een klein goedgekeurd publiek; een praktische middencategorie; en een goedkope throughput-motor onderaan voor iedereen. Dat is een bewuste hedge, en aan het eind zullen we zien waarom die logisch is.
Maar de line-up is niet het ongewone deel. De vergrendelde deur is dat wel.
Waarom GPT-5.6 Sol bij de lancering achter slot en grendel bleef
Hier stopt de GPT-5.6-serie eruit te zien als een normale lancering.
De timing van de preview was vreemd — bredere verwachtingen wezen op een release in juni of juli, en in plaats daarvan verscheen hij abrupt, met alleen een beperkte preview beschikbaar via de API en Codex, en alleen voor een klein aantal door de Amerikaanse overheid goedgekeurde partners. OpenAI verwees mensen naar verluidt naar een dashboard om hun geschiktheid te checken, met bredere toegang verwacht binnen twee tot drie weken. Sol zelf wordt stilletjes uitgerold naar geselecteerde gebruikers in plaats van aangekondigd met de gebruikelijke fanfare.
Lees die volgorde nog eens, want de vorm ervan vertelt je meer dan welke officiële verklaring dan ook. Een frontier-lab duwde zijn krachtigste model vervroegd de deur uit, naar een gescreende lijst, onder het soort toegangscontroles dat je normaal ziet rond exportbeperkte hardware, niet chatmodellen. Dat is geen marketingkeuze. Dat is een model dat een reguleringsomgeving in gelanceerd wordt die fundamenteel is veranderd.
Ik behandelde de eerste voortekenen hiervan toen de GPT-5.6-vermelding voor het eerst lekte in Codex-sessie-logs weken voor er enig officieel woord was, en toen exportcontrole-druk begon te herschikken wie wat mag verschepen. Het lek was het gerucht. De vergrendelde preview is het gerucht dat beleid wordt. Frontier-modellen worden nu, door de Amerikaanse overheid en steeds meer door de labs zelf, behandeld als dual-use technologie — dezelfde categorie als de chips die ze trainen.
De eerste weken, als je een bouwer was die wachtte om Sol in een echte pipeline te zetten, was de praktische conclusie onsentimenteel: je kon er niet omheen plannen. Dat veranderde op 9 juli, toen Sol openging voor het publiek — maar de episode is het herinneren waard, want het volgende vlaggenschip zal misschien niet zo snel worden ontgrendeld. Voor de diepere dissectie van Sols specifieke claims tegen verifieerbare data, ging ik uitgebreid in op mijn GPT-5.6 Sol preview-analyse — deze post is de bredere kaart.
Nu, wat wordt Sol eigenlijk verondersteld te doen dat de kluis heeft opgeleverd?
De capaciteiten van GPT-5.6 Sol: bevestigd versus geclaimd
Korte versie: OpenAI claimt dat Sol zijn sterkste model tot nu toe is, met een nieuwe state-of-the-art op Terminal-Bench 2.1 en dat het GPT-5.5, Claude Mythos 5, Claude Fable 5 en Gemini 3.1 Pro verslaat over de hele benchmark-suite — maar niets daarvan is nog onafhankelijk geverifieerd, want het model is effectief offline voor het publiek.
Laat me de lagen scheiden, want dit is belangrijk.
Wat vandaag verifieerbaar is: Terminal-Bench is echt, en het is een serieuze benchmark. Het komt uit het Laude Institute en werd gepubliceerd op ICLR 2026. Het zet een agent in een Docker-container met een taak, een tijdslimiet en een set pytest-validaties — en het is een alles-of-niets scoring, geen deelscores, over 89 handmatig gebouwde taken die software engineering, security, sysadmin en data science bestrijken. Versie 2.1 is de opgeschoonde revisie die dubbelzinnige taken uit de 2.0-release oploste. Halverwege juni 2026 had het publieke leaderboard Codex gekoppeld aan GPT-5.5 op 83,4% en Claude Code met Fable 5 daar vlak achter op 83,1%. Dus als de preview zegt dat Sol een nieuwe SOTA op Terminal-Bench 2.1 zet, weet ik precies welk getal hij claimt te verslaan, en het is een getal uit een geloofwaardig, reproduceerbaar harnas. Dat is het sterkste deel van de claim.
Wat geclaimd is maar niet geverifieerd: alles wat vergelijkend is. "Verslaat Mythos 5, Fable 5, Gemini 3.1 Pro." Misschien. Op het moment van de preview konden we het niet checken, want Sol was niet toegankelijk voor onafhankelijke benchmarking — hij leek volledig offline te zijn, wat precies het publieke testen vertraagde dat de cijfers zou bevestigen of doorprikken. Dat testen werd pas mogelijk toen Sol op 9 juli publiek ging. Ik heb genoeg lanceringen meegemaakt om allergisch te zijn voor een benchmark die je niet kunt reproduceren. Zet deze onder "OpenAI claimt", niet "OpenAI gedemonstreerd".
De twee capaciteitsdraden die me oprecht interesseren:
Ten eerste, cybersecurity en harde wetenschappen. De preview noemt grote winsten in biologie en cybersecurity, en één specifieke, in principe checkbare claim: Sol evenaart naar verluidt Mythos op geavanceerd kwetsbaarhedenonderzoek terwijl hij ruwweg een derde van de outputtokens gebruikt. Als dat klopt, is het een big deal — niet vanwege de capaciteit alleen, maar omdat token-efficiëntie op offensive-security taken precies het soort ding is dat een model zowel nuttiger als gevaarlijker maakt. Wat, niet toevallig, de reden is dat hij vergrendeld zit.
Ten tweede, de nieuwe redeneermodi. "Max reasoning" en "ultra" — die laatste die meerdere sub-agents opstart op een enkel probleem. De preview beschrijft ook een groter intern redeneerbudget op hogere redeneerniveaus. Ik wil hier eerlijk iets aanstippen: de originele bron gooide een specifiek tokencijfer voor dat budget in het rond dat niet standhoudt bij toetsing — het leest als een verhaspeld getal, dus ik ga het niet als feit herhalen. De richtinggevende claim is het geloofwaardige deel: op hogere redeneerinstellingen denkt Sol langer en harder na, en "ultra" ziet eruit als OpenAI dat het multi-agent orchestratiepatroon productiseert dat je tot nu toe zelf moest bouwen. Als je hebt gevolgd hoe agent-teams zich daadwerkelijk gedragen in echte tests, weet je dat dat het lastige, waardevolle deel is — en het inbakken in een redeneer-schakelaar is een echte zet.
Claims zijn goedkoop, echter. De preview leunde op demo's. Laten we daar naar kijken.
De demo's: indrukwekkend, maar lees ze zorgvuldig
De preview duwde een handvol one-shot builds naar buiten, en de eerlijke samenvatting is: oprecht indrukwekkend, duidelijk een sprong ten opzichte van GPT-5.5, en niet zo strak als de highlight-reel doet uitschijnen.
De standouts, zoals gepresenteerd:
- Een Minecraft-achtige kloon in ongeveer 90 minuten — landingspagina, game-modus selectors, woestijnbiomen en mobs, wolk- en block-breaking-animaties, een dag/nacht-cyclus. De catch, in de preview zelf gemeld: sommige interacties, zoals het oppakken van blokken, werkten niet volledig. Levensechter dan wat Fable produceerde, maar de bron was openhartig dat het Fable 5 niet overtrof in algehele verfijning.
- Een SpaceX Starship booster-catch simulatie — realistische klemmechaniek en een geloofwaardig begrip van de fysica en robotica. De "chopsticks catch" is een oprecht moeilijk ding om overtuigend te simuleren, dus deze verdiende mijn aandacht.
- Een Pokémon-achtige RPG in ongeveer 31 minuten — emulator-achtig, meerdere gyms, acht badges, starter-selectie, een endgame League. Gebouwd om copyright-problemen te vermijden.
- Een voxel 3D-wereldgenerator in ongeveer 44,5 minuten.
De preview beschreef de sprong van 5.5 naar Sol als "absurd", vooral op coding, front-end, full-stack en simulatiewerk. Ik geloof de richting. Ik ben sceptisch over de framing. Hier is waarom die "sommige interacties werkten niet"-regel meer telt dan de demo-glans: een model dat een prachtige Minecraft-kloon bouwt waarin je geen blokken kunt oppakken is een model dat spectaculair is in het genereren van plausibele structuur en nog steeds imperfect in het sluiten van de loop op interactieve correctheid. Dat is precies het gat dat ik constant tegenkom bij echte agent-loops — het ding lijkt af en is het niet, en de laatste 10% is waar de echte engineering leeft.
Dus mijn interpretatie: de GPT-5.6-serie is een echte capaciteitssprong, de demo's zijn richtinggevend eerlijk over het niet verslaan van Fable 5, en iedereen die je vertelt "Sol one-shot nu productie-apps" verkoopt je de trailer, niet de film. We zullen het niet weten tot hij open is voor testen — en dat is ook vergrendeld.
Wat ons bij het model brengt dat het hardst vergrendeld werd.
De Fable 5-ban: wanneer een model een probleem voor de nationale veiligheid wordt
Anthropics Fable 5 werd verbannen. Niet rate-limited, niet op een wachtlijst gezet — getrokken, voor ongeveer twee weken, op basis van nationale veiligheid, naar verluidt vanwege het vermogen om te replicaeren hoe je in Amerikaanse overheidssecuritysystemen kunt hacken.
Laat het bezinken hoe ongebruikelijk dat is. We hebben modellen taken zien weigeren. We hebben labs lanceringen zien uitstellen. We hebben nooit, in het publieke tijdperk van frontier AI, gehad dat een staat effectief een commercieel vlaggenschip-model beveelt te stoppen vanwege wat het in de verkeerde handen zou kunnen doen. Dat is een nieuwe categorie gebeurtenis, en het is het duidelijkste signaal tot nu toe dat de meest capabele modellen nu worden bestuurd als aan wapens grenzende technologie in plaats van als softwareproducten.
Hier is wat bevestigd is versus gerapporteerd, want de nuance is het hele verhaal:
Bevestigd (per Anthropics eigen verklaring): Sinds 12 juni werkt Anthropic samen met Amerikaanse ambtenaren om Mythos 5 en Fable 5 weer in te schakelen. Mythos 5 werd hersteld voor een beperkte groep kritieke-infrastructuurorganisaties — naar verluidt in de orde van 100 organisaties — waarbij de toegang geleidelijk werd verbreed, niet weer open werd gezet. Publieke toegang blijft sterk beperkt, onder strakke controles en veiligheidsprotocollen.
Gerapporteerd / gerucht: dat de Trump-administratie dichtbij het herstellen van bredere toegang was na de ongeveer twee weken durende storing, mogelijk binnen die week, met onderhandelingen bijna afgerond — en dat het herstelde model waarschijnlijk afgezwakt zou zijn: strengere veiligheid, verminderde capaciteit in de meest gevoelige cybersecuritydomeinen. Behandel dat als berichtgeving, niet als feit. De richtinggevende claim — "komt terug, maar strakker" — is consistent over bronnen; de specifieke timing is het zachte deel.
Ik traceerde de mechanica van hoe een verbannen frontier-model zich terugklauwt in beperkte dienst in mijn analyse van Fable 5's terugkeer, en het patroon daar geldt hier: herstel is geen schakelaar, het is een onderhandeling, en het model dat terugkomt is niet het model dat vertrok. Als je bouwt op Anthropics frontier-tier, is dat de operationele realiteit om te internaliseren — capaciteit op dit niveau komt nu met een governance-laag die je niet controleert.
En nee, dit is niet één CEO die de overheid ergens toe overhaalt. Laat me dat argument direct behandelen, want het is overal.
Heeft Dario Amodei de grens "de bangmakerij" ingepraat tot lockdown?
Er is een luid online narratief dat Anthropic-CEO Dario Amodei de Amerikaanse overheid heeft overgehaald om frontier-modellen te beperken — dat de hele nationale-veiligheidsframing bangmakerij is van een CEO die profiteert van regelgevende slotgrachten. Ik geloof het niet, en ik wil zo helder mogelijk uitleggen waarom.
De Amerikaanse overheid verbiedt geen model op basis van het woord van één executive. Een beslissing als het trekken van Fable 5 loopt via meerdere agentschappen — de NSA, de inlichtingengemeenschap, toegewijde cybersecurity-experts — die elk hun eigen onafhankelijke risicobeoordeling doen. Wanneer een model geloofwaardig kan helpen bij het compromitteren van overheidssystemen, is dat geen vibe die een CEO in een podcast kan fabriceren. Het is een bevinding, geëvalueerd door mensen wier hele werk het is precies dat soort dreiging te evalueren.
De waarschijnlijke motivatie gaat niet eens primair over binnenlands misbruik. Het gaat over tegenstanders — het buiten de handen van rivaliserende staten houden van frontier offensive-cyber capaciteit, met China voorop. Dat is een strategische berekening die bestaat of een AI-executive nu ooit in het openbaar een woord zegt of niet.
Er waren naar verluidt wat communicatietekortkomingen aan Anthropics kant vroeg in de episode — maar dat is een aparte operationele kwestie, niet de oorzaak van de ban. "Anthropic handelde de comms imperfect af" verwarren met "Anthropic engineerde het beleid" is precies het soort gemotiveerd redeneren dat goed is voor engagement en slecht voor analyse.
Ik zal eerlijk zijn over waar ik uitkom, want het is geen comfortabele plek. Ik wil brede publieke toegang tot frontier-modellen — dat is waar de innovatie waar ik om geef vandaan komt, het spul waar ik mijn werk op bouw. En ik erken ook dat een model dat oprecht in staat is kritieke infrastructuur aan te vallen een ander object is dan een chatbot, en doen alsof dit niet zo is om een online argument te winnen helpt niemand. Dit is mij die de feiten leest, niet die een politiek team kiest. De beperkingen zien eruit als de output van echte institutionele risicobeoordeling, niet als de lobby van één man.
Als het doel is deze capaciteit uit handen van tegenstanders te houden, hier is het probleem: de tegenstanders bouwen het ook.
China's GLM-5.2: de cybersecurity-race heeft geen remmen
China's Z.ai bracht GLM-5.2 uit als een open-weight, MIT-gelicentieerd model in juni 2026 — één dag nadat de exportbeperkingen Fable 5 troffen — en de claim die er toe doet is deze: het evenaart Claude op kwetsbaarhedenonderzoek. Dat is niet alleen het woord van Z.ai: Semgreps onafhankelijke IDOR-benchmark scoorde GLM-5.2 op 39% F1, voor Claude op ~32% — precies de capaciteit die westerse frontier-modellen in de eerste plaats deed vergrendelen.
Of die claim real-world is of alleen benchmark, is oprecht niet geverifieerd, en ik wil het daarbij houden. "Evenaart op een benchmark" en "evenaart in een live engagement tegen een gehard doel" zijn heel verschillende dingen, en het gat daartussen is precies waar veel modelhype naartoe gaat om te sterven. Dus: onbevestigd, houd het scherp in de gaten.
Maar het signaal is onmiskenbaar ongeacht of de exacte pariteitsclaim standhoudt. Cybersecurity is het centrale slagveld geworden van de VS-China AI-race, en er is geen bewijs van een vertraging aan Chinese kant. Ik volg de trajectorie van GLM al een tijdje — toen ik GLM benchmarkte tegen Qwen en Opus, was de conclusie dat de open-weight Chinese modellen de kloof sneller dichtten dan het comfortabele westerse narratief wilde toegeven. GLM-5.2 die frontier-klasse kwetsbaarhedenonderzoek bereikt, als het echt is, is die trend die de meest strategisch gevoelige capaciteit die er is raakt.
Hier is de ongemakkelijke strategische lus. De VS vergrendelt Fable 5 om offensive-cyber capaciteit uit China te houden. China levert GLM-5.2, open-weight en MIT-gelicentieerd, met onafhankelijk geteste vergelijkbare capaciteit hoe dan ook. De vergrendeling beschermt de VS tegen het versnellen van een tegenstander die het misschien niet daadwerkelijk kan afremmen. Die spanning heeft geen schone oplossing, en elke analyse die doet alsof dat wel zo is, is niet eerlijk tegen je. Voor de diepere duik in waarom cybercapaciteit specifiek het brandpunt is, ontvouwde ik dat in mijn stuk over Mythos en cybersecurity.
Terwijl de grens vergrendeld en betwist raakt, gebeurde er iets rustigers en aantoonbaar belangrijkers in de business eronder.
Anthropics enterprise-surge: het spel verhuisde naar workflows
Hier is de ontwikkeling waar bouwers zich volgens mij daadwerkelijk omheen moeten reorganiseren: Anthropics enterprise-business steeg vanaf eind 2025 tot begin 2026, en volgens meerdere onafhankelijke metingen heeft het OpenAI overtroffen in het deel van de markt dat betaalt — bedrijfsuitgaven aan AI-developer tools.
Deze kan ik onderbouwen met verifieerbare data, en het is opvallend. Volgens enterprise-uitgaven-tracking heeft Claude Code ongeveer 54% van de enterprise-coding-uitgaven in 2026 tegen OpenAI's 21% — en coding is nu goed voor meer dan de helft van al het generatieve-AI enterprise-gebruik. De AI Index van Ramp toonde dat Anthropic meer dan 73% van de uitgaven vastlegde onder bedrijven die voor het eerst AI-tools kopen. En in april 2026 kantelde de business-adoptie over een grens die eerder niet was overschreden: Anthropic op 34,4% tegenover OpenAI op 32,3% — de eerste keer dat Anthropic OpenAI leidde in enterprise-adoptie. Menlo Ventures zette enterprise-LLM-uitgaven op ongeveer 40% Anthropic tegen 27% OpenAI. De bronnen zijn het oneens over de exacte magnitude. Ze zijn het eens over de richting.
Dus wat is er veranderd? De concurrentie ging niet meer over welk lab het beste model heeft, maar over wiens model is ingebed in de dagelijkse workflow. Ik blijf terugkomen bij de Windows/Office-analogie uit de jaren '90. Microsoft won niet omdat het altijd de beste individuele applicatie leverde — het won omdat zijn software het ding werd dat je elke ochtend zonder erover na te denken opende. Anthropic draait dat playbook op engineeringteams: Claude Code leeft in de terminal, in de reviewcyclus, op de plek waar het werk daadwerkelijk gebeurt. Zodra een tool dragend is in de dagelijkse loop van een team, wordt overstapkosten — niet benchmark-score — de doorslaggevende factor.
Dat is de echte verschuiving waarin de GPT-5.6-serie wordt gelanceerd. De wapenwedloop gaat nu over workflow-economie: frictievermindering, governance, integratie en aantoonbare waardelevering — snellere coding, minder bugs, kortere code-review cycli — niet over een twee-punts bump op een eval. Een model dat je kunt demoen en een model dat verweven is in het spiergeheugen van tienduizend engineers zijn heel verschillende assets, en de tweede is veel moeilijker te verdringen.
Twee eerlijke voorbehouden, want de triomfalistische versie van dit verhaal klopt niet. Ten eerste, een surge is geen kroning — dit is geen nederlaag voor OpenAI. OpenAI blijft sterk competitief, vooral in bredere productiviteit en aan de lager geprijsde kant van de markt, wat precies is waarom de Luna-tier bestaat. Ten tweede, de enterprise-AI-markt is complex en gesegmenteerd; "Anthropic leidt coding-uitgaven" en "OpenAI leidt consumentenbereik" zijn beide waar tegelijk. Iedereen die dat platslaat tot "X won" verkoopt een narratief, geen marktbeschrijving.
Nog een deelnemer stapte net het veld op, en die draagt een Tesla-badge.
Grok 4.5: Musks coding-zet, in private bèta
Elon Musk zegt dat Grok 4.5 in private bèta is binnen SpaceX en Tesla, en naar verluidt Claude Opus-niveau capaciteit benadert — hoewel welke Opus-versie oprecht onzeker is.
De interessante technische claim: Grok 4.5 is naar verluidt gebouwd op xAI's ongeveer 1,5-biljoen-parameter "V9" foundational model, daarna verder getraind met Cursors data om de coding aan te scherpen. Als dat detail klopt, is het een aanwijzing over strategie — xAI schaalt niet alleen een basemodel, het richt zich specifiek op de coding-agent-markt en traint op het soort echte edit-data dat een model goed maakt in de loop die ontwikkelaars daadwerkelijk draaien. Dat is een directe schot op het segment dat Anthropic momenteel domineert.
Houd het scepticisme wel gekalibreerd. "In private bèta bij SpaceX en Tesla" betekent dat Musks eigen bedrijven de testers zijn, wat ongeveer zo'n vriendelijke evaluatieomgeving is als er bestaat. "Benadert Opus-niveau" met een onzeker versienummer is een zachte claim gewikkeld rond een hard klinkend parameter-aantal. Ik zou Grok 4.5 stevig in de "kijk naar de publieke benchmarks, negeer de founder-tweets" kolom zetten totdat er iets reproduceerbaars is. Maar de intentie is helder en geloofwaardig: xAI wil een serieuze coding-concurrent zijn, en het traint specifiek voor dat gevecht.
Dus waar laat dit alles een bouwer die echte beslissingen probeert te nemen?
Wat hier echt toe doet (de blik van de bouwer)
Stap weg van de modelnamen en de benchmark-claims, en drie dingen zijn tegelijk waar deze maand — en alle drie zijn duurzamer dan welke afzonderlijke release dan ook.
Een: de top van de grens wordt bestuurd door nationale veiligheid, en dat is geen tijdelijke glitch. GPT-5.6 Sol dat eerst lanceert voor goedgekeurde partners voordat het op 9 juli opengaat, Fable 5 dat wordt verbannen en gedeeltelijk hersteld onder strengere controles, Mythos 5 dat druppelsgewijs terugkomt naar ~100 kritieke-infrastructuurorganisaties — dit zijn geen aparte verhalen. Het is hetzelfde verhaal. De meest capabele modellen worden bestuurd als dual-use strategische technologie. Als je roadmap aanneemt dat je same-day API-toegang krijgt tot wat het sterkste is, herbouw die aanname nu.
Twee: het competitieve spel verschoof van benchmark-suprematie naar workflow-integratie. Anthropic haalde OpenAI niet in in enterprise-coding-uitgaven door een benchmark te winnen — het deed het door de tool te worden die engineers zonder erover na te denken openen. Voor degenen onder ons die producten op deze modellen bouwen, is dat de les om te stelen: de slotgracht is niet het model, het is hoe diep jouw ding leeft binnen iemands dagelijkse loop. Ik heb dit betoogd vanuit de bouwerskant in mijn stuk over agent-native gaan, en de enterprise-data heeft het net bevestigd met geld.
Drie: geopolitiek is nu een modelselectie-variabele. GLM-5.2 dat naar verluidt Mythos evenaart op kwetsbaarhedenonderzoek betekent dat de vergrendeling die de VS beschermt de wereldwijde verspreiding van de capaciteit misschien niet daadwerkelijk vertraagt. Voor bouwers vertaalt dat zich naar een praktische realiteit: welk model je kunt gebruiken, waar het legaal kan draaien, en wat het mag doen wordt net zo belangrijk als hoe slim het is.
Als ik de hele maand moest comprimeren tot één zin voor een drukke engineer: stop met puur optimaliseren voor het slimste model, en begin te optimaliseren voor het slimste model dat je daadwerkelijk kunt inzetten, in jouw jurisdictie, binnen de workflow die je al bezit. Dat is een minder opwindende zin dan "Sol one-shot een Minecraft-kloon". Het is ook de zin die volgend kwartaal nog steeds waar zal zijn.
Ik kwam terug van twee weken weg, denkend dat ik een benchmark-oorlog had gemist. Wat ik daadwerkelijk binnenliep was het moment waarop de regels veranderden — toen de vraag stopte hoe goed is het model en werd wie mag het gebruiken, en is het al onderdeel van hoe je werkt. De labs die het komende jaar winnen, zullen niet degene zijn met het hoogste getal op een grafiek die niemand buiten een lijst met goedgekeurde partners kan reproduceren. Het zullen die zijn wiens modellen stilletjes dragend zijn in jouw dag voordat je zelfs merkt dat je bent gestopt ze te kiezen.
Dus hier is de vraag waar ik vanavond bij zou blijven zitten, wat je ook aan het bouwen bent: als het sterkste model ter wereld vergrendeld raakt achter een overheidsgoedkeuring die je nooit zult hebben, is jouw product dan ontworpen om te winnen op rauwe intelligentie — of op hoe diep het leeft binnen het werk? Want een van die twee is nu vergrendeld. De andere kun je nog steeds verdienen.
Veelgestelde vragen
Wat is de GPT-5.6-serie?
De GPT-5.6-serie is OpenAI's gelaagde frontier-release bestaande uit drie modellen — Sol (vlaggenschip), Terra (gebalanceerd) en Luna (hoog volume) — elk afgestemd op een ander prijs-prestatiepunt. De vlaggenschip Sol-tier is beperkt tot door de Amerikaanse overheid goedgekeurde partners. Zie de volledige opsplitsing in het model-sectie hierboven.
Waarom werd Anthropics Fable 5 verbannen?
Fable 5 werd naar verluidt ongeveer twee weken teruggetrokken op basis van nationale veiligheid, vanwege het vermogen om te replicaeren hoe je in Amerikaanse overheidssecuritysystemen kunt hacken. Volgens Anthropics eigen verklaring werkt het bedrijf sinds 12 juni samen met Amerikaanse ambtenaren om Fable 5 en Mythos 5 opnieuw in te schakelen onder strengere controles en beperkte toegang.
Is GPT-5.6 Sol beschikbaar voor het publiek?
Ja, sinds 9 juli 2026. Sol bracht zijn eerste weken door in beperkte release via de API en Codex uitsluitend voor vooraf goedgekeurde Amerikaanse partners, maar de Amerikaanse overheid keurde op 9 juli een brede release goed en OpenAI stelde Sol open voor het publiek naast Terra en Luna.
Heeft Anthropic OpenAI ingehaald in enterprise?
Volgens meerdere onafhankelijke metingen, ja — in het developer-tools segment. Enterprise-data van 2026 laat zien dat Claude Code ongeveer 54% van de enterprise-coding-uitgaven heeft versus OpenAI's 21%, en april 2026 markeerde de eerste maand dat Anthropic OpenAI leidde in algehele business-adoptie. OpenAI blijft sterk in consumentenbereik en lager geprijsde tiers.
Is China's GLM-5.2 echt zo capabel als Claude op cybersecurity?
Op kwetsbaarhedenonderzoek zegt onafhankelijk testen ja: Semgreps IDOR-benchmark scoorde het open-weight GLM-5.2 op 39% F1, voor Claude's ~32%. Benchmarks zijn niet het hele verhaal, maar dit is niet alleen een vendor-claim. Het bredere signaal is hoe dan ook helder: China's frontier-AI-ontwikkeling toont geen vertraging, met cybersecurity als centraal slagveld.
Bouw je op een grens die blijft bewegen?
Wanneer modeltoegang, prijzen en exportregels van maand tot maand verschuiven, is de duurzame zet een architectuur die modellen kan verwisselen zonder je stack te herschrijven. Het ontwerpen van die portabiliteit — en de routing en guardrails eromheen — is het werk dat ik op me neem. Als dat een probleem is dat je liever uit handen geeft, hier vind je me.