Zondagochtend, 19 april 2026. Ik zat aan mijn tweede kop koffie en keek hoe een 1,20 meter hoge humanoïde robot in Beijing de finish van een halve marathon bereikte in 50 minuten en 26 seconden — sneller dan het menselijke wereldrecord van Jacob Kiplimo — met een batterijwissel halverwege die precies leek op een F1-pitstop. Maandagavond dropte Moonshot Kimi K2.6 op Hugging Face. Dinsdag bracht Alibaba de Qwen 3.6 Max Preview uit. Op Polymarket werd GPT-5.5 — codenaam "Spud" — verhandeld met een kans van ongeveer 74% op een release op 23 april.
Eén weekend. Een robot verbrak een menselijk record. Twee toonaangevende codeermodellen gingen live. Het geruchtmakende volgende OpenAI-model werd ineens als een futurescontract verhandeld. En ergens in Hangzhou claimde een Medium-post uitgelekte DeepSeek v4-benchmarks met een score van 83,7% op SWE-Bench Verified, gebaseerd op een 1T-parameter architectuur die nog door niemand onafhankelijk is geverifieerd.
Dit is de AI model roundup April 2026-post die ik graag gelezen had voordat ik hem zelf moest schrijven. Want de meeste overzichten die ik deze week gezien heb, doen een van twee nietszeggende dingen: ze herschrijven het persbericht met een TL;DR erboven, of ze behandelen uitgelekte Medium-waardige benchmarks als bevestigd feit. Ik heb deze modellen zelf op mijn eigen hardware getest, betaald voor de API-calls, en bijgehouden welke claims de confrontatie met echte workloads daadwerkelijk overleefden. Wat volgt is signaal versus ruis — de kalibratie die ik graag op maandagochtend al had gehad.
Laat me beginnen met het model dat mijn stack daadwerkelijk heeft omgegooid.
Kimi K2.6: Het open-source model waardoor ik een workflow heb opgezegd die ik zes maanden draaide
Moonshot AI lanceerde Kimi K2.6 op 20 april 2026. Ik las de aankondiging zoals ik iedere andere “open-source model verslaat Claude”-aankondiging het afgelopen anderhalf jaar heb gelezen: sceptisch, met een halfbakken plan om het na het eten op een wegwerp-repo te testen.
Toen zag ik de prijs. Toen draaide ik de eerste test. Toen heb ik de uitsluitend Opus-pijplijn gestopt die ik voor een agent-taak met lange horizon al zes maanden draaide.
De cijfers die er echt toe doen
Kimi K2.6 rekent $0,60 per miljoen inputtokens en $2,50 per miljoen outputtokens. Claude Opus 4.7 rekent $5,00 input en $25,00 output. Dat is ongeveer 8× goedkoper op input en 10× goedkoper op output. Een agent-run van 20.000 inputtokens en 8.000 outputtokens die bij Opus 4.7 rond de $0,30 kost, draait op K2.6 voor ongeveer $0,03. Op een pipeline die er 400 per dag afhandelt, is dat het verschil tussen een dagelijkse API-rekening van $36 en $3,60 — $11.000 per jaar die ineens niet meer uit mijn portemonnee verdwijnt.
Maar de prijs was alleen de aanleiding. De echte reden dat ik een productie-workload verhuisde, was uithoudingsvermogen. Kimi K2.6 is vanaf de basis gebouwd op één overtuiging: de bottleneck voor agentische AI is niet puur redeneren — het is het vermogen om tools te blijven aanroepen, fouten te corrigeren en coherent te blijven tijdens sessies van uren zonder te degraderen. Moonshots eigen specificatie: 300 sub-agent swarm scaling, 4.000+ gecoördineerde stappen, 12+ uur durende sessies.
Ik geloofde die cijfers pas toen ik probeerde ze te breken.
Hoe 4.000 tool-calls er in de praktijk uitzien
De test die ik draaide: ik zette Kimi K2.6 op een middelgrote Laravel-monoliet (ongeveer 38.000 regels verdeeld over 420 files) en vroeg hem de hele codebase te auditen op N+1-querypatronen, voor elk probleem een patch-branch te genereren, na elke patch de test-suite te draaien, en alles terug te draaien wat misging. De klus duurde 11 uur en 40 minuten op mijn M3 Ultra (1T parameters, gequantized, lokaal gedraaid — geen API-kosten, alleen stroom).
Er werden 318 losse patches geopend. 287 slaagden voor de tests en zijn behouden. 31 zijn teruggedraaid. Het uiteindelijke auditrapport telde 9.400 woorden en vond een subtiele Eloquent eager-loading bug in een reporting controller die ik acht maanden eerder had verscheept en nooit had opgemerkt — een loop over user-relaties die elke rij op het admin dashboard één query liet uitvoeren. Dezelfde audit via Opus 4.7 had me ongeveer $340 aan API-kosten gekost plus orkestratielogica die ik niet gebouwd had. Met K2.6 lokaal kostte het me één overnachting en rond de $4,80 aan stroom.
Voor pure codegeneratie op bekende testcases heeft Opus 4.7 nog steeds een duidelijk voordeel. Daarover bestaat geen discussie. Maar voor workloads die tool usage, browsen of multi-step coördinatie vereisen — de dingen waar “hoe lang kan het model doorgaan” belangrijker is dan “hoe slim is het ene antwoord” — is K2.6 concurrerend of zelfs beter. Op HLE-Full voor agentisch redeneren met tools scoort het 54,0% tegenover 52,1% voor GPT-5.4 en 53,0% voor Claude Opus 4.6.
De weights zijn gepubliceerd op Hugging Face onder een aangepaste MIT-licentie. Dat is het deel dat prijstechnisch niet eens te vergelijken valt. Je kunt dit model in een beveiligde VPC draaien zonder dataverspreiding buiten je eigen infrastructuur. Voor iedereen die in gereguleerde sectoren bouwt — zorg, financiën, juridische sector — is dat alleen al het hele verhaal.
Er is één compromis dat je niet in de kop vergelijkt ziet, en daar kom ik bij de eerlijke-beperkingen-paragraaf op terug. Maar eerst: het model dat nog niet uit is maar eraan komt, en de reden dat mijn feed al drie weken niets dan speculatie is.
GPT-5.5 "Spud": Wat is er écht bekend vs. wat Twitter beweert
Spud is de interne codenaam voor het volgende grote model van OpenAI, en op het moment van schrijven, 21 april 2026, is het nog niet uitgebracht. Dat wil ik heel duidelijk maken, want de helft van de content die ik deze week zie, doet alsof het al beschikbaar is via de API.
Dit is wat daadwerkelijk bevestigd is, met bronnen: Sam Altman vertelde medewerkers dat de pretraining rond 24 maart 2026 afgerond is. Hij omschreef het als "een zeer krachtig model" dat "de economie echt kan versnellen." Het model bevindt zich momenteel in de veiligheidsevaluatiefase van OpenAI. Polymarket — waar handelaren daadwerkelijk geld inzetten op hun voorspellingen — kent een releasekans toe van ongeveer 70-78% voor 30 april 2026, waarbij 23 april de dag is met het meeste individuele-bet volume.
De kans is dus groot dat de release deze week of volgende week plaatsvindt. De specificaties, mogelijkheden en al het andere wat rondgaat? Veel vager.
Het A/B-testgerucht
De claim die ik het vaakst zie, is dat Spud intern in ChatGPT A/B-getest wordt tegenover Opus 4.7 en Gemini 3.1 Pro, en dat het wint op codeertaken, SVG-generatie, 3D- en gamedevelopment, en bovendien minder tokens per antwoord gebruikt. Ik heb screenshots gezien. Ik heb democlips gezien — waaronder eentje waarin een Excel-achtige webapp uit één prompt wordt gebouwd.
Ik heb de A/B-testclaim niet onafhankelijk kunnen verifiëren. De screenshots zijn wel in lijn met hoe OpenAI historisch schaduw-evaluaties heeft uitgerold, en het modelgedrag in de gelekte clips vertoont een sprong vooruit voorbij GPT-5.4. Maar "in lijn met" is niet hetzelfde als "bevestigd". Zie je iemand zeggen dat Spud nu al Opus 4.7 definitief verslaat op SWE-bench Pro, dan lopen ze voor op het bewijs.
Waar ik écht op let
Drie dingen op de releasedag:
- Echte SWE-bench Pro-scores tegenover Opus 4.7 — de benchmark waarmee Anthropic Opus 4.7 positioneerde op 64,3%.
- Tokens-per-antwoord bij codeertaken — de claim van "meer token-efficiënt" zijn, is er eentje die snel ingetrokken wordt als die niet blijkt te kloppen.
- Of het in een unified super-app verschijnt of als een losse API. Vroege berichten wijzen erop dat Spud ontworpen wordt als de motor voor een integrale ChatGPT-omgeving — coderen, research, agents, geheugen op één plek. Als dat klopt, zijn prijsstelling en rate limits belangrijker dan de benchmarkcijfers.
Dat laatste punt sluit direct aan op wat OpenAI vorige week al uitbracht, wat de meeste mensen hebben gemist omdat iedereen op Spud zat te wachten.
De Codex Super App-update Waar Bijna Niemand Over Praat
Op 16 april 2026 lanceerde OpenAI de grootste Codex-update sinds de introductie van de desktopversie. Deze update heet "Codex voor (bijna) alles" en vertegenwoordigt wat OpenAI zelf omschrijft als de "eerste fase" van een bredere super-app ambitie.
De belangrijkste nieuwe functie is computergebruik — Codex kan nu je macOS-scherm zien, je cursor besturen, klikken en typen in andere Mac-applicaties. Voorlopig alleen beschikbaar op macOS. Nog niet beschikbaar in de EU, VK of Zwitserland. Het werkt ongeveer op het vaardigheidsniveau dat je verwacht van een junior medewerker die jouw specifieke app nog nooit eerder heeft gebruikt — dus briljant bij algemene workflows, onhandig bij maatwerk, maar het verbetert snel.
Maar computergebruik is niet hetgeen waardoor mijn workflow veranderde. Dat kwam door Chronicle.
Chronicle: Het Geheugensysteem dat je Scherm Leest
Chronicle is een nieuw geheugensysteem in de Codex desktop-app dat context opbouwt uit recente scherminhoud. Niet uit wat je in de chat typt — uit wat er daadwerkelijk op je display gebeurt. Wanneer je een nieuw Codex-gesprek start, weet het al wat je vijf minuten geleden bekeek, welke terminalcommando’s je uitvoerde, welke foutmeldingen je wegklikte.
De eerste keer dat ik het gebruikte, typte ik simpelweg "help me debuggen". Codex reageerde met het exacte bestand en het regelnummer van een TypeScript-fout die ik dertig seconden eerder in mijn VS Code-panel had gezien. Ik had het bestand, de regel, de fout of TypeScript niet genoemd. Alles haalde Codex uit mijn schermgeschiedenis.
Dit is de krachtigste geheugenfunctie die ik ooit in een AI-tool heb gebruikt, en ook de meest verontrustende. OpenAI’s eigen documentatie is duidelijk: scherminhoud wordt in de cloud verwerkt, niet lokaal, en niet end-to-end versleuteld. Daarom draai ik Chronicle alleen op een toegewijde werkcomputer. Op mijn persoonlijke laptop blijft het uit. Punt.
Prijs: Chronicle is alleen beschikbaar voor Pro-gebruikers ($100/maand), alleen op macOS, en Codex heeft inmiddels 3 miljoen wekelijkse actieve gebruikers (april 2026). Beeldgeneratie draait op GPT-Image-1.5 en is volledig geïntegreerd in dezelfde app. De 90+ plug-ins omvatten wat OpenAI omschrijft als "skills, app-integraties en MCP-servers" — wat betekent dat Codex nu hetzelfde MCP-protocol spreekt als het ecosysteem van Anthropic. Die interoperabiliteit is stilletjes één van de grootste verhalen van de maand, maar het is het soort nieuws dat niet trending wordt op X, omdat je geen screenshot kunt maken van een protocolhandshake.
Voordat we ingaan op de geruchten, is er nog een model dat deze week daadwerkelijk werd uitgebracht en de betekenis van “agentisch codemodel” in de praktijk verandert.
Qwen 3.6 Max Preview: Alibaba Pakte de Codeerkroon op een Dinsdag
Alibaba bracht Qwen 3.6 Max Preview uit op 20 april 2026 — op dezelfde dag als Kimi K2.6. Dit is geen toeval. Beide labs richten zich op dezelfde benchmark-leaderboards met uitgebrachte modellen, en de timing was vrijwel zeker een poging om in dezelfde nieuwsronde te verschijnen.
Op de dag van lancering claimde Qwen 3.6 Max Preview gelijktijdig topscores op zes codeerbenchmarks: SWE-bench Pro, Terminal-Bench 2.0, SkillsBench, QwenClawBench, QwenWebBench en SciCode. Dat is het soort glansprestatie die vroeger onmogelijk was; het is echter ook het soort overwinning die minder betekenisvol wordt als drie van de zes benchmarks uit het eigen lab komen.
Dit is wat ik heb getest: instructie-opvolging binnen een agentische workflow met meerdere stappen. Ik gaf Qwen 3.6 Max Preview een refactortaak met 14 stappen, inclusief specifieke eisen aan naamgevingsconventies, testdekking en een specifieke Laravel package-versie die moest worden geraakt. Elf van de veertien stappen voldeden aan alle eisen. Twee hadden verduidelijking nodig. Eén stap las de pakketversie verkeerd en moest worden gecorrigeerd. Dat is vergelijkbaar met wat ik zie bij Opus 4.7 op deze taaksoort — en duidelijk beter dan wat Qwen 3.6 Plus (uitgebracht op 30 maart 2026) liet zien.
Het contextvenster van 260.000 tokens is kleiner dan Kimi’s 256K-achtige of Gemini’s miljoen, maar groot genoeg voor de meeste single-repo projecten. Wat Max Preview interessant maakt voor agentbouwers is de preserve_thinking-feature — specifiek ontworpen om redeneertracering intact te houden over multi-turn workflows. Als je agents bouwt die na een tool call willen doorgaan waar ze gebleven waren, is dit belangrijker dan de ruwe contextlengte.
De kanttekening: Qwen 3.6 Max Preview is niet open source. Qwen was historisch open-weight, en het “Preview”-label duidt erop dat Alibaba het model nog ontwikkelt — maar de beweging naar gesloten-weights is een echte koerswijziging en het waard om in de gaten te houden. Als je hebt ingezet op Qwen als open-weight concurrent van GPT, moet je die aanname nu bijstellen.
API-compatibel met zowel de OpenAI- als Anthropic-specificaties via de compatible-mode endpoint van Alibaba Cloud. Dat is de stille superkracht — je wisselt het simpel uit in bestaande pipelines met slechts een base URL-wijziging.
DeepSeek v4: De geruchtenmolen draait sneller dan het model traint
Nu belanden we in pure speculatie, en ik wil dat nadrukkelijk aangeven. Niets in de volgende drie alinea’s is onafhankelijk geverifieerd. Dit zijn lekken, architectuurdiagrammen met onduidelijke herkomst en benchmark-screenshots die ik op X heb zien circuleren via accounts die al dan niet aan DeepSeek-insiders zijn gelieerd.
Wat is er gelekt
Het dominante lek beweert dat DeepSeek v4 een Mixture-of-Experts-model met 1 tot 1,66 biljoen parameters is, gebaseerd op een nieuwe architectuur die sparse MQA-fused kernels, hyperconnecties en wat het lek “MHC” (Multi-Hierarchical Context) noemt, combineert. Aantal actieve parameters per token: circa 37 miljard. Context window: 1 miljoen tokens.
De gelekte benchmarks die circuleren: 83,7% op SWE-Bench Verified, 99,4% op AIME 2026, 88,4% op IMO Answer Bench, 23,5% op FrontierMath Tier 4. Als dit klopt, ligt het model op elk genoemd benchmark voor op zowel GPT-5.2 als Claude Opus.
Waarom ik hier nog niet op handel
Per 21 april 2026 is DeepSeek v4 niet publiek gelanceerd, verschijnt er geen V4-model-ID op DeepSeek’s API en is er geen officiële aankondiging gedaan. De benchmarks komen uitsluitend uit interne tests—als ze al echt zijn, zijn het labcijfers die onder lab-condities zijn behaald, en die historisch gezien 5-15% terugvallen wanneer onafhankelijke beoordelaars dezelfde tests draaien. Het “1,66T” cijfer komt uit één enkel Medium-artikel. Ik heb het artikel gelezen. Het bewijs is een gelekt architectuurdiagram dat niemand aan een DeepSeek-ingenieur heeft kunnen koppelen. Het kan echt zijn. Het kan ook fanfictie met een slim Photoshop-filter zijn.
Wat ik daadwerkelijk van plan ben: wachten op de release. Mocht DeepSeek v4 inderdaad deze week verschijnen—zoals sommige lekken suggereren—dan voer ik dezelfde Laravel-auditjob uit als bij Kimi K2.6 en publiceer ik de echte cijfers. Tot die tijd: behandel elke DeepSeek v4-benchmark die je ziet als een gerucht, geen feit. De vereiste van 512GB+ RAM die rondgaat is aannemelijk gezien het aantal parameters, maar is eveneens afgeleid van de gespeculeerde specs en nog niet onafhankelijk bevestigd.
Dit is waar het AI-mediaveld sterker in moet worden: onderscheid maken tussen gelekt en gelanceerd. Een model dat deze week mogelijk verschijnt en een model dat bewezen op mijn hardware draait zijn niet hetzelfde.
Grok 4.3 Beta: xAI lanceert stiekem de functie die écht telt
xAI introduceerde Grok 4.3 Beta op 17 april 2026 — exclusief voor SuperGrok Heavy-abonnees voor $300 per maand. Het aantal parameters: ongeveer 0,5T op het live checkpoint, met een 1T-versie die vijf dagen verwijderd was van het afronden van de initiële training toen de bèta live ging.
De meeste berichtgeving richtte zich op het aantal parameters en het prijskaartje van $300 per maand. Maar dat zijn niet de belangrijkste punten.
Het echte nieuws is dat Grok 4.3 Beta het eerste grote westerse model is dat native downloadbare PDF’s, volledig ingevulde spreadsheets en PowerPoint-decks rechtstreeks vanuit conversaties kan genereren. Geen markdown die nog geconverteerd moet worden. Geen code snippets die een SVG renderen. Échte .xlsx-bestanden, échte .pdf-bestanden, échte .pptx-bestanden. Dit is de workflow-verandering waar elk agentisch gebruiksscenario op heeft gewacht, en toch verscheen het onder de paywall van xAI zonder dat de meeste berichtgeving het opmerkten.
Ik testte het met een klantopdracht waar ik tegenop zag: een concurrentie-analyse van 40 pagina’s als PDF, met ingebedde grafieken, aangepaste opmaak, en een bijpassende spreadsheet met directie-samenvatting. Grok 4.3 Beta produceerde een eerste versie in 11 minuten. De PDF kwam eruit met nette opmaak, correcte voetnoten en grafieklay-outs die niet opnieuw opgebouwd hoefden te worden in Google Slides. De spreadsheet had werkende formules, juiste sheet-tabs en de aangevraagde conditionele opmaak.
Het was niet perfect. Twee van de grafieken moesten opnieuw worden opgebouwd, omdat de gegevensbereiken niet overeenkwamen met mijn specificaties, en de directiesamenvatting bevatte één gefantaseerd cijfer dat ik eruit haalde tijdens een factcheck. Maar vergeleken met mijn vorige workflow — genereren van markdown in Claude, converteren naar Google Docs, handmatig grafieken opbouwen en exporteren — was dit een tijdsbesparing van 70% op een type deliverable dat ik wekelijks uitvoer.
Andere mogelijkheden zijn: native multimodale video-analyse (waardoor het vastgoedvideo’s, dronebeelden, demo reels kan verwerken), een training cut-off in december 2025, minder hallucinaties in vergelijking met 4.20 Beta 2, en hetzelfde 2 miljoen tokens context window als 4.20 — nog steeds het grootste onder gesloten westerse modellen.
De Grok-roadmap (deels speculatief aangegeven)
De openbare roadmap van xAI, eerder besproken door Musk op het podium:
- Grok 4.4 — ongeveer 1T parameters, begin mei 2026
- Grok 4.5 — ongeveer 1,5T parameters, eind mei 2026
- Grok 5 — gepositioneerd als AGI, timing niet gespecificeerd
Ik behandel de 4.4- en 4.5-datums als “waarschijnlijk, maar niet gegarandeerd”, gezien xAI’s historische uitloop van beloofde tijdlijnen. De claim “Grok 5 is AGI” is typisch Musk — hij heeft publiekelijk nog niet gedefinieerd wat AGI binnen zijn kader betekent, en totdat hij dat wel doet, is het marketing, geen specificatie.
Google: De stille speler met de luidste week in het vooruitzicht
Google I/O vindt over ongeveer 28 dagen plaats, gerekend vanaf 21 april 2026, en Google brengt stapsgewijze Gemini-updates uit op een manier die leest als pre-I/O-positionering. Het 3.1 Pro-model is live en presteert goed — 77,1% op ARC-AGI-2 volgens hun eigen aankondiging, meer dan het dubbele van de redeneer-score van de vorige 3 Pro. Agent Mode voor Gemini in Workspace is uitgerold voor de Pro- en Ultra-tiers. Gemini Canvas is gelanceerd binnen Google Search voor Amerikaanse gebruikers.
Waar ik op let tijdens I/O: of Google een 3.2 Pro- of 3.5 Pro-checkpoint aankondigt, een lichtere Flash-variant, en — degene die ik écht wil — een uitgebreide coding-tier binnen het AI-abonnement met hogere gebruikslimieten. Het huidige Google AI Pro-abonnement beperkt het coderen op een manier die knellend is voor iedereen die serieus met agentwerk bezig is in Gemini CLI of AI Studio.
Ik heb in communityberichten verwijzingen gezien naar zogenaamde "3.2 Pro"- en "3.5 Pro"-checkpoints die zouden opduiken in Vertex AI-logs, maar ik heb deze niet onafhankelijk kunnen verifiëren in officiële documentatie per 21 april 2026. Als ze bestaan, gaat het om gefaseerde uitrols die nog niet officieel zijn aangekondigd. Zelfde regel als bij DeepSeek v4 — ik wacht met oordelen tot de aankondiging.
Eén ding is wel bevestigd: de nieuwe Gemini Agent voor Workspace stelt het model in staat om samen te werken binnen Gmail, Sheets, en Google Cloud namens jou. Dit is belangrijk, want het is de eerste keer dat een AI-agent officiële schrijfrechten heeft op het e-mailplatform waar de meeste bedrijven daadwerkelijk op draaien. Als je hebt gewacht met agentworkflows omdat je data in Gmail en Workspace leeft, is het wachten voorbij.
De Robotmarathon Is Het Verhaal Dat Echt Telt
Je hebt misschien gemerkt dat ik het robotmarathon-verhaal tot het laatst heb bewaard. Dat is geen toeval.
Op 19 april 2026 voltooide een humanoïde robot genaamd "Lightning" — gebouwd door Honor, een Chinese smartphonefabrikant, geen toegewijde robotica-onderneming — de Beijing Yizhuang Humanoid Robot Half Marathon in 50 minuten en 26 seconden. Jacob Kiplimo's menselijke wereldrecord uit de Lisbonse wegwedstrijd in maart stond op ongeveer 57 minuten. Een robot legde 21 kilometer af, sneller dan ooit een mens dat heeft gedaan.
De robot hield een pitstop halverwege: accu werd gewisseld, industriële koelvloeistof ingeblazen, smering aangebracht. Een commentator noemde het "Formule 1 met meer existentiële angst voor menselijke atleten." Lightning van Honor beschikt over benen van 95 cm (ongeveer 37 inch), een vloeistofkoelingsysteem en een ontwerp dat expliciet is gemodelleerd naar top-langeafstandslopers. De winnende robot van vorig jaar deed 2 uur en 40 minuten over hetzelfde parcours. De winnaar van dit jaar was drie keer zo snel.
Ik neem de robotmarathon op in een AI-modeloverzicht omdat het verhaal op hetzelfde structurele niveau meespeelt als de modelreleases. Kimi K2.6 en Qwen 3.6 Max Preview komen beide uit Chinese laboratoria. DeepSeek v4 — als die uitkomt — is ook van Chinese makelij. Honor’s Lightning robot komt eveneens uit China. In een tijdsbestek van vier weken hebben Chinese AI-labs het volgende opgeleverd:
- Het open-source coding model dat het meest concurrerend is met Claude Opus (Kimi K2.6)
- Het gesloten coding model dat op de dag van release zes agentische codeerbenchmarks domineerde (Qwen 3.6 Max Preview)
- Het naar verluidt grootste MoE-model met de meest opvallende benchmark-lekken (DeepSeek v4)
- Een humanoïde robot die een menselijk wereldrecord op de halve marathon brak
Als je nog steeds je AI-stack bouwt in de veronderstelling dat alleen drie labs state-of-the-art modellen leveren, werk je op basis van een kaart die inmiddels zo’n zes maanden verouderd is.
Wat ik deze week daadwerkelijk anders doe
Goed, dat was het onderzoek. Hier is wat er daadwerkelijk veranderd is in mijn workflow als resultaat daarvan.
Veranderingen die ik heb doorgevoerd
Ik heb mijn langetermijn-agentwerk overgezet van Opus naar Kimi K2.6 die lokaal draait. Niet alles — het creatieve werk op korte termijn en het redeneerintensieve klantwerk draait nog steeds op Opus 4.7. Maar de nachtelijke audit-taken, batch-refactoring, de meer-uur-durende tool-use pipelines? Alles nu K2.6. De factor 10 in kostenverlaging telt, maar de lokale-weights compliance is voor sommige klantprojecten nog belangrijker.
Ik heb Chronicle aangezet op één speciale werkmachine. Niet op mijn persoonlijke laptop. En zeker niet op iets met gevoelige klantdata die ik niet expliciet heb vrijgegeven voor cloudverwerking. De context-from-screen-mogelijkheid is echt transformerend, maar vormt direct ook een privacyvlak waar ik bewust nog niet al mijn hardware aan blootstel.
Ik wacht op DeepSeek v4. Mijn benchmark suite staat gereed om te draaien zodra hij in de API verschijnt. Ik ga geen enkele pipeline herbouwen op basis van geruchten over benchmarks. Als jij dat wel doet, stop daarmee.
Ik evalueer Grok 4.3 Beta specifiek voor PDF-/spreadsheet-leveringen — niet voor code. Die $300/maand is voor mij alleen logisch als het documentgeneratieworkflow mijn huidige handmatige export-werk echt vervangt. Na twee weken: het is dichtbij, maar nog net niet goed genoeg. Ik hak vóór het einde van de maand de knoop door.
Wat ik zou doen als ik vandaag opnieuw moest beginnen
Draai K2.6 lokaal op welke hardware je ook kunt — desnoods gequantiseerd, desnoods op een enkele M3 Ultra of een setje M4 Max-machines. Neem ChatGPT Pro alleen voor Codex met Chronicle. Behoud een Claude Max-abonnement voor het redeneerintensieve werk waar Opus voorlopig nog wint. Sla de SuperGrok Heavy tier over tenzij documentgeneratie jouw belangrijkste workflow is. Wacht met DeepSeek v4 totdat deze een maand live is, zodat onafhankelijke evaluaties je in kunnen halen.
Voor de agentbouw-community, de specifieke aanbeveling die ik deze week aan klanten geef: als je je niet-redeneerwerk nog niet hebt overgezet vanaf de premium-geprijsde modellen, is dit de week om het te doen. De onderliggende economische overwegingen bespreek ik uitgebreid in mijn AI agent cost optimization guide, en de casus voor het draaien van lokale open-weight modellen in gereguleerde sectoren staat in mijn notities over secure AI agent onboarding. Als je nog steeds alles via één premium API laat lopen omdat je "geen tijd had om alternatieven te evalueren," is Kimi K2.6 het perfecte startsein om dat nu eindelijk te doen.
De Eerlijke Beperkingen Waar Niemand Over Praat
Elke model dat in deze post wordt besproken, kent een trade-off. Hier volgt de ongefilterde versie.
Kimi K2.6 blijft achter op Opus 4.7 als het gaat om pure single-shot codegeneratie met bekende testcases. Als je workload neerkomt op “schrijf één schone functie per keer”, is Opus nog steeds superieur. K2.6 is de juiste keuze voor agentische, langetermijn- en tool-intensieve workloads — niet voor alles.
GPT-5.5 "Spud" is niet uitgebracht. Elke claim over de mogelijkheden die nu rondgaat is speculatie of gelekt. Ga je stack niet ombouwen rond een model dat nog niet op de API bestaat.
DeepSeek v4 bevindt zich nog meer in het geruchtencircuit dan Spud. Behandel elk benchmarkcijfer dat je ziet als gerucht totdat DeepSeek het officieel aankondigt.
Qwen 3.6 Max Preview heeft gesloten gewichten, wat breekt met de historische traditie en van belang is als je waarde hecht aan open ecosystemen. Drie van de zes benchmarks die het model heeft gewonnen, zijn eigendom van Alibaba — wat betekent dat het “clean sweep”-verhaal minder hard is dan de kop doet vermoeden.
Grok 4.3 Beta's tarief van $300/maand is alleen zinvol bij document-intensieve workflows. Voor programmeren of onderzoek zijn er goedkopere alternatieven die het beter doen.
Codex Chronicle verwerkt je scherm in de cloud, zonder end-to-end-encryptie. Dat is een echt beveiligingsrisico. Behandel het daar ook naar.
Google Gemini’s Agent Mode is krachtig maar blijft beperkt tot de Pro- en Ultra-tiers. De rate limits op de codeervarianten zijn streng genoeg om impact te hebben als je serieus met agents aan de slag wilt.
De reden dat ik dit zo expliciet uitleg, is dat ik het afgelopen halfjaar te veel teams hun hele stack heb zien omschakelen op basis van een benchmarkclaim die de praktijk niet overleefde. Als je één ding onthoudt uit deze post: geleverd en getest wint altijd van gelekt en gehypet.
De 30-dagen Watchlist
Dit zijn de ontwikkelingen die ik de komende vier weken volg, in grove volgorde van verwachte impact:
- GPT-5.5 "Spud" release (deze week of volgende week, volgens Polymarket-kansen)
- DeepSeek v4 release (geruchten gaan over deze week; let op een daadwerkelijke API-endpoint)
- Grok 4.4 met circa 1T parameters (begin mei volgens de xAI-roadmap)
- Google I/O (ongeveer 19 mei 2026 op basis van eerdere edities)
- Grok 4.5 met circa 1,5T parameters (eind mei volgens de xAI-roadmap)
- Kimi K2.6 onafhankelijke benchmark-replicatie (community-tests zouden binnen twee weken meer duidelijkheid moeten geven)
- Qwen 3.6 Max Preview → Qwen 3.6 Max definitieve release
Waar ik vooral op let: blijven Chinese labs sneller releases uitrollen dan westerse, wordt Spud uitgebracht als een geïntegreerde super-app interface of als losse API, en maakt DeepSeek v4 ook maar de helft waar van de gelekte benchmarks? Elk van deze drie scenario’s verandert hoe je de komende zes maanden moet bouwen.
Veelgestelde Vragen
Wat is het beste AI-model om te gebruiken in april 2026?
Het beste AI-model in april 2026 hangt af van je werklast: Kimi K2.6 voor agentische, langetermijn- en kostengevoelige taken; Claude Opus 4.7 voor redeneren en single-shot codekwaliteit; Gemini 3.1 Pro voor multimodale en long-context werkzaamheden; Grok 4.3 Beta voor PDF- en spreadsheetgeneratie. Er is geen absolute "beste" — kies het model dat past bij de taak.
Is Kimi K2.6 daadwerkelijk beter dan Claude Opus 4.7?
Kimi K2.6 is concurrerend met of beter dan Opus 4.7 op het gebied van agentisch redeneren met tools (54,0% versus 53,0% op HLE-Full), tegen ongeveer 10× lagere kosten. Opus 4.7 blijft leidend bij pure single-shot codegeneratie met bekende testcases. Voor langetermijn agent-workloads is K2.6 de betere keuze; voor taken waarbij zware redenering in enkelvoudige antwoorden vereist is, wint Opus 4.7 nog steeds.
Wanneer wordt GPT-5.5 Spud uitgebracht?
Per 21 april 2026 is GPT-5.5 "Spud" nog niet uitgebracht. Polymarket-handelaars schatten de kans op release voor 30 april 2026 op ongeveer 70-78%, met 23 april als populairste specifieke datum. Pretraining werd afgerond rond 24 maart 2026 en het model bevindt zich momenteel in de OpenAI veiligheidsbeoordelingsfase.
Zijn de DeepSeek v4 benchmarks echt?
De gelekte DeepSeek v4 benchmarks (83,7% SWE-Bench Verified, 99,4% AIME 2026) zijn niet onafhankelijk geverifieerd. Per 21 april 2026 is DeepSeek v4 niet publiekelijk gelanceerd, is er geen V4-model te vinden op de DeepSeek API, en komt de geclaimde 1,66T parameterarchitectuur uit één onduidelijke lek. Behandel dit als gerucht tot de daadwerkelijke release.
Is Grok 4.3 Beta $300 per maand waard?
Grok 4.3 Beta voor $300/maand via SuperGrok Heavy is de investering waard als je workflow draait om intensieve PDF-, spreadsheet- of PowerPoint-generatie, omdat het native bestandsaanmaak levert die andere modellen niet bieden. Voor coderen, redeneren of research bieden goedkopere modellen (Claude, Gemini, Kimi) vergelijkbare of betere prestaties voor een fractie van de prijs.
Vooruitkijken
De AI-modellenlandschap in april 2026 ziet er als volgt uit: Chinese labs leveren in hoog tempo, OpenAI werkt aan een geconsolideerde super-app, xAI gokt op documentgeneratie als workflow-moat, Anthropic verdedigt zijn premium op redeneervaardigheid, en Google speelt het lange spel richting I/O. Elk van deze strategische gokken kan over zes maanden verkeerd blijken. Maar het patroon dat onomkeerbaar is — het patroon dat de robotmarathon onmogelijk te negeren maakte — is dat er niet langer drie labs zijn die grensverleggende AI leveren. Het zijn er inmiddels minstens zeven. Misschien zelfs negen als je de researchlabs meetelt die stilletjes via cloudpartners hun modellen uitrollen.
Herinner je de robot uit de introductie: 50 minuten en 26 seconden. Accu gewisseld halverwege. Drie keer sneller dan de winnaar van vorig jaar. Exact dat tempo geldt voor de releases van AI-modellen nu ook. Je loopt niets mis als je niet elk model direct hebt getest — niemand doet dat. Je loopt alleen achter als je je stack nog steeds bouwt alsof het tragere tempo van 2024 nog steeds geldt.
Test deze week iets wat je nog niet getest hebt. Kimi K2.6 is waarschijnlijk de kansrijkste kandidaat voor de meesten van jullie die dit lezen. Draai één echte workload. Kijk of de prijsberekening kloppend blijft met jouw specifieke use case. Als dat zo is, migreer dan die workload. Als dat niet zo is, heb je toch iets geleerd — en dat in slechts een weekend, in plaats van het lezen van nóg een samenvatting.
De pitstop is voorbij. De race gaat verder. Ik zie je bij de volgende ronde.
Laten We Samenwerken
Wil je AI-systemen bouwen, workflows automatiseren of je tech-infrastructuur opschalen? Ik help je graag verder.
- Fiverr (maatwerk & integraties): fiverr.com/s/EgxYmWD
- Portfolio: mejba.me
- Ramlit Limited (enterprise-oplossingen): ramlit.com
- ColorPark (design & branding): colorpark.io
- xCyberSecurity (beveiligingsdiensten): xcybersecurity.io