Ik had het artikel half geschreven toen het dinsdag was.
Het was de bedoeling dat het een rustig voorproefje zou zijn. De Gemini 3.x AB-testvarianten lekken via de iOS-app. Een paar geruchten over een Omni-videomodel. Standaard anticipatie vóór de keynote. Ik had mijn koffie, mijn aantekeningen, mijn schets. En toen, op 5 mei 2026 – dezelfde dinsdag – vuurden drie bedrijven drie geladen wapens af in ongeveer zes uur.
Een Miami-startup genaamd Subquadratic verliet de stealth met een contextvenster van 12 miljoen tokens en de bewering dat hun architectuur minder dan 5% van de rekenkracht van Claude Opus gebruikt. OpenAI heeft stilletjes het standaardbrein van ChatGPT vervangen door een nieuw model dat 52,5% minder hallucineert op medische, juridische en financiële vragen. Anthropic heeft tien productieklare Claude financiële agenten en een volledige Microsoft 365-integratie geleverd. Perplexity lanceerde op dezelfde dag een concurrerende financiële agent met 35 vooraf gebouwde workflows en live datafeeds van Morningstar, PitchBook, Daloopa en Carbon Arc.
Ik heb de omtrek geschrapt.
Wat u nu gaat lezen, is hoe mei 2026 er veertien dagen vóór Google I/O feitelijk uitziet – niet als een overzicht van persberichten, maar als een veldrapport van iemand die productie AI heeft ingezet voor daadwerkelijk betalende klanten terwijl dit allemaal aan het landen was. Sommige van deze aankondigingen zullen de komende twaalf maanden een nieuwe vorm geven aan de manier waarop ik bouw. Sommigen van hen zijn lawaai verkleed als nieuws. En een daarvan – waar niemand op Twitter over schreeuwde – is, naar mijn mening, het belangrijkste AI-moment van 2026 tot nu toe. Het is niet degene die je denkt.
Laat me je vertellen waar ik op gok, waar ik voor terughoud en wat elke ontwikkelaar die dit leest deze week moet doen voordat I/O het kaartspel opnieuw herschikt.
Waarom deze specifieke dinsdag er toe deed
Ik schrijf al twee jaar over de wekelijkse roundups van AI. De meeste weken vervagen in elkaar over. Een nieuw model. Een prijswijziging. Een functiedaling. Ze landen, ze krijgen een krantenkop, jij blijft werken.
Deze dinsdag was anders op een manier die me een dag kostte om volledig te verwerken.
Wat op 5 mei arriveerde, waren geen drie productlanceringen. Het waren drie architecturale weddenschappen die in dezelfde week samenkwamen, vier dagen na de zonsondergang van Google, Project Mariner – het langlopende onderzoeksproject voor browseragenten – en de technologie samenvoegden in de persoonlijke assistent Gemini Agent in de Gemini-app. Die zonsondergang was geen voetnoot. Het gaf aan dat Google zich aan het herpositioneren is vóór I/O, weg van ‘experimentele browseragenten’ en in de richting van ‘de 24/7-agent die woont waar jij woont’. Twee weken voor de keynote.
Zoom nu dus uit. Binnen één week:
- De rekenvloer is verschoven. De sub-kwadratische, spaarzame aandachtsarchitectuur van SubQ heeft benchmarkcijfers opgeleverd die – als ze standhouden onder onafhankelijke beoordeling – de veronderstelling ondermijnen dat frontier-intelligentie frontier-compute vereist. - Het standaard ChatGPT-model is slimmer geworden op de dingen die er het meest toe doen. De hallucinatiereductie van 52,5% van GPT-5.5 Instant op domeinen met een hoge inzet is het soort release-opmerking dat OpenAI gebruikte om te bewaren voor volledige releases. - De AI-oorlog in de financiële dienstverlening werd heet. Anthropic en Perplexity lieten op dezelfde dag concurrerende suites voor financiële analisten vallen, beide gericht op de exacte workflows van junior-analisten die al tientallen jaren legers MBA's in dienst hebben. - Google heeft de landingsbaan vrijgemaakt. Project Mariner is stopgezet.
Omni-model gelekt in de Gemini UI. I/O 2026 keynote op 19 mei met een modelonthulling die bijna universeel wordt verwacht.
Ik heb mijn mentale model van het veld in veertien dagen drie keer opnieuw opgebouwd. Als u momenteel productie AI uitvoert, zou u dat ook moeten doen. Laat ik beginnen met de aankondiging die volgens mij het belangrijkst is – en die bijna niemand als krantenkop behandelt.
Subkwadratisch en de vraag van 12 miljoen token
De Subquadratic-lancering werd begraven onder de GPT-5.5-nieuwscyclus. Dat is een vergissing.
Hier is de korte versie. Een in Miami gevestigde startup genaamd Subquadratic verliet stealth op 5 mei met $29 miljoen aan startfinanciering, een grensmodel genaamd SubQ en een contextvenster van 12 miljoen tokens gebouwd op wat zij Subquadratic Sparse Attention (SSA) noemen. Volgens hun technische blog bereikt SSA een 7,2x prefill-snelheid boven dichte aandacht bij 128.000 tokens, oplopend tot 52,2x bij 1 miljoen tokens, en bij de volledige context van 12 miljoen tokens gebruikt het model minder dan 5% van de rekenkracht van vergelijkbare grenssystemen – wat zij beschrijven als een reductie van bijna 1.000x.
Lees die cijfers langzaam. Lees ze dan opnieuw.
De dominante aanname sinds GPT-3 is dat schaalgrootte rekenkracht kost en rekenkracht geld kost en dat geld de intelligentie binnendringt. Elke release van grensmodellen van de afgelopen drie jaar heeft die muur versterkt. Opus 4.6 is uitstekend en duur. Gemini 3 Pro is uitstekend en duur. GPT-5 is uitstekend en duur. De prijsniveaus waarover we ruzie hebben gehad, hebben allemaal betrekking op die computervloer.
Als de claims van SSA de verificatie door derden overleven, wordt die verdieping verplaatst.
De benchmarks die zij posten zijn niet bescheiden. Op RULER op 128K scoort SubQ 97,1 tegen Opus 4.6's 94,8. Op SWE-Bench Verified rapporteert SubQ 82,4% versus 81,4% van Opus 4.6 en 80,6% van Gemini 3.1 Pro. Bij evaluaties met een lange context, het soort taken waarbij de meeste modellen uit elkaar vallen na 200.000 tokens, blijft SubQ blijkbaar bij elkaar tot 12 miljoen.
Ik wil voorzichtig zijn. Eerlijk lezen is voorzichtiger dan de kop.
Het scepticismekamp heeft geen ongelijk. Subquadratic heeft nog geen openbaar technisch document waarin de architectuur voldoende diep wordt beschreven om te reproduceren. De benchmarkcijfers zijn zelfgerapporteerd. De beweringen over complexiteit zijn niet onafhankelijk geverifieerd. We hebben dit patroon allemaal eerder gezien: een laboratorium publiceert magische getallen, de gemeenschap beheert de evaluatiesuite, de magie krimpt.
Dus waarom leid ik hiermee het artikel in plaats van GPT-5.5 of de financiële agenten? Omdat de richting van de weddenschap belangrijker is dan de exacte nauwkeurigheid van de lanceringsnummers.
De toezichthouders op de financiële sector zijn niet de enigen die hier op moeten letten. Als sub-kwadratische aandacht op grensschaal werkt – zelfs met de helft van de efficiëntie die zij beweren – verandert dit wat mogelijk is om in een contextvenster te plaatsen voor normale toepassingen. Een 12M-context is geen iets grotere 1M-context. Het is de volledige codebasis van een middelgroot SaaS-product, in één keer, tegen computerkosten die dichter bij een huidig Flash-model lijken dan een huidig Opus-model. Dat is een andere categorie hulpmiddelen.
Ik voer deze week mijn eerste productietest van SubQ uit. Ik ga nergens aan vast totdat ik mijn eigen nummers op mijn eigen gegevens heb. Maar ik gok ook niet tegen architecturale innovatie die zulke agressieve resultaten boekt op een benchmarksuite die zo competitief is. Ik heb het al te vaak mis gehad met die weddenschap.
Als u de productie AI in mei 2026 implementeert, is dit de praktische stap: migreer nog niet, maar ontwerp een wereld waarin de prijzen voor contextvensters instorten. Stop met het optimaliseren van strategieën voor het chunken van 200.000 tokens die ervan uitgaan dat de limiet blijft gelden. Bouw ophaalpijplijnen die elastisch kunnen worden opgeschaald als de komende twaalf maanden de 1M-contextlaag wordt omgezet in de nieuwe Flash-laag. (Voor het praktische draaiboek over het vandaag de dag beheren van 1M-token-sessies, zie mijn Claude Code 1M context management notes – dezelfde patroonschaal.) De toolingbeslissingen die u nu neemt, zullen er heel anders uitzien als de SSA-weddenschap loont.
GPT-5.5 Instant en de stille standaardschakelaar
Terwijl SubQ onderzoeker Twitter in de war bracht, maakte OpenAI een ander soort zet: een stillere, meer ondernemingsgerichte stap.
Op 5 mei introduceerde OpenAI GPT-5.5 Instant als het nieuwe standaardmodel voor ChatGPT, ter vervanging van de GPT-5.3 Instant die sinds eerder dit jaar standaard was. De kopnummers in de releasepost van het bedrijf:
- 52,5% minder hallucinaties bij medische, juridische en financiële vragen met hoge inzet bij interne evaluaties
- 37,3% minder onnauwkeurige claims op een afzonderlijke reeks prompts die gebruikers eerder hadden gemarkeerd vanwege feitelijke fouten
- HealthBench-score van 51,4 uit 100, een stijging ten opzichte van 49,6 (GPT-5.3 Instant)
- HealthBench Professional (klinisch) op 38,4, een stijging ten opzichte van 32,9
- AIME 2025 op 81,2, versus 65,4 voor GPT-5.3
- MMMU-Pro op 76,0, versus 69,2
Als je voorbij die cijfers bladert, mis je het eigenlijke verhaal.
Het verhaal is niet dat het model beter werd. Modellen worden beter. Het verhaal is op welke assen het beter is geworden. OpenAI optimaliseerde GPT-5.5 Instant expliciet voor de dingen die er juridisch en financieel toe doen: medisch, juridisch, financieel. Het model dat miljoenen mensen standaard zullen gebruiken als ze ChatGPT openen, is nu aanzienlijk betrouwbaarder op de vragen waarbij het hebben van fouten echte gevolgen heeft.
Dat is een strategische keuze, geen technisch ongeluk. En het volgt het bredere patroon van 5 mei. Zowel OpenAI als Anthropic – op exact dezelfde dinsdag – richtten hun releases met de hoogste hefboomwerking op professionele domeinen met hoge inzet.
Dit is wat dat voor mij in de praktijk betekent.
Ik heb GPT-5.5 Instant getest op het soort taken dat ik doorgaans om veiligheidsredenen naar Opus stuur: juridische contractbeoordeling voor klantwerk, financiële analyse voor SaaS-prijsaudits, fundamenteel medisch aangrenzend onderzoek waarbij ik expliciet probeer het model dat iets verzint te vermijden. Het vroege signaal is reëel. Het is geen kwaliteit van het Opus-op-onderzoeksmodel. Maar voor snelle, standaardreacties op die domeinen is de daling van het aantal hallucinaties merkbaar op een manier die bij GPT-5.3 niet het geval was.
Betaalde gebruikers behouden de komende drie maanden toegang tot GPT-5.3 Instant voor het geval de nieuwe standaard zich anders gedraagt voor hun specifieke workflows. Dat detail is belangrijk. OpenAI geeft aan dat ze verwachten dat sommige gebruikers de verandering als regressie zullen ervaren - waarschijnlijk omdat GPT-5.5 Instant bepaald stilistisch gedrag inruilt voor nauwkeurigheidswinst. Als u een snelle steiger heeft die is afgestemd op de eigenaardigheden van GPT-5.3, controleer deze dan voordat de periode van drie maanden sluit.
De onderbelichte implicatie: dit is OpenAI die stilletjes toegeeft dat het standaardmodel belangrijker is dan het vlaggenschip. De meeste ChatGPT-gebruikers zullen nooit kiezen voor het duurste niveau. Het model waarmee de meeste AI-vragen ter wereld worden beantwoord, is het standaardmodel. Het optimaliseren ervan voor nauwkeurigheid met hoge inzet heeft een veel grotere maatschappelijke impact dan nog een tiende van een procent op AIME.
Ik behoud mijn Opus-abonnement vanwege de lange contextredenering en de agentintegraties die ik rond Claude Code heb gebouwd. Maar voor een betekenisvol deel van mijn eenmalige vragen, vooral het soort waarbij ik voorheen het antwoord dubbel zou hebben gecontroleerd in een tweede tool, is GPT-5.5 Instant nu het eerste telefoontje dat ik doe. Dat is sinds GPT-4 niet meer het geval.
De Anthropic Finance Agent-drop – en waarom Microsoft 365 het echte verhaal is
De aankondiging van Anthropic van 5 mei was de drukste van de week, en het deel ervan dat de meeste aandacht kreeg – de tien sjablonen voor financiële agenten – was niet het belangrijkste deel.
Laat me eerst de sjablonen bespreken, omdat ze echt zijn. Anthropic heeft tien kant-en-klare agentsjablonen voor financiële dienstverlening uitgebracht, opgesplitst in twee categorieën:
Onderzoek en klantdekking (5 agenten):
- Pitchbouwer
- Vergadervoorbereider
- Inkomstenrecensent
- Modelbouwer
- Marktonderzoeker
Financiën en bedrijfsvoering (5 agenten):
- Waarderingsbeoordelaar
- Grootboekafstemming
- Maandafsluiting
- Verklaring accountant
- KYC-screener (Know Your Customer).
Elke agent is wat Anthropic een ‘referentiearchitectuur’ noemt: een pakketcombinatie van vaardigheden (instructies en domeinkennis voor de taak), connectors (beheerde toegang tot de gegevens waarop de taak draait) en subagents (aanvullende Claude-modellen voor subtaken). Ze kunnen worden uitgevoerd als plug-ins binnen Claude Cowork en Claude Code naast menselijke analisten, of ze kunnen worden ingezet als door Anthropic beheerde agenten waarbij Anthropic de productie-infrastructuur afhandelt.
Dat is het soort publicatie dat een serieuze paragraaf verdient van iedereen die financiële AI bespreekt. Maar hier is wat begraven werd.
Dezelfde aankondiging. Dezelfde dag. Anthropic geleverd volledige Microsoft 365-integratie — Claude functioneert als een enkele agent voor Excel, PowerPoint, Word en Outlook, met context voor alle vier applicaties tegelijk.
Als u niet in de financiële wereld werkt, wordt deze zin mogelijk niet geregistreerd. Als je dat doet, zou het moeten landen als een vallende piano.
De standaardworkflow voor junior-analisten ziet er als volgt uit: gegevens in Excel ophalen, deze modelleren, een kaartspel bouwen in PowerPoint, de voorbladmemo opstellen in Word, deze via Outlook verzenden met drie vervolg-e-mails. Elke tool-break betekende vroeger een context-break: een plek waar informatie handmatig tussen applicaties moest worden overgedragen, waar fouten binnenslopen, waar junior-analisten de weinig glamoureuze uren doorbrachten die hun instapsalarissen rechtvaardigden.
Eén enkele agent die context bevat voor alle vier Microsoft 365-apps is geen ‘AI-productiviteitstool’. Het is de structurele verdwijning van een functiecategorie op instapniveau. Gecombineerd met het datapartnerschap Anthropic dat dezelfde dag werd aangekondigd, is de boodschap ondubbelzinnig: Anthropic bouwt geen chatgenoten voor analisten. Ze bouwen aan het digitale personeelsbestand dat vroeger de analisten waren.
Voor de parallelle strategie gaan mijn veldnotities over de uitrol van Anthropic's beheerde agenten dieper in op het model van de "veilige productie-infrastructuur" - dat is hetzelfde loodgieterswerk dat nu deze financiële sjablonen aanstuurt.
Dit is ook waar het Perplexity-verhaal binnenkomt.
De Perplexity Counterpunch – en wie er daadwerkelijk wint
Precies dezelfde dinsdag lanceerde Perplexity Computer for Professional Finance.
De structurele gelijkenis is niet subtiel:
- 35 speciale financiële workflows die het werk automatiseren dat analisten elke week herhalen
- Gelicentieerde data-integraties met Morningstar, PitchBook, Daloopa en Carbon Arc
- Een PitchBook Essential MCP serverintegratie die Perplexity native toegang geeft tot de firmagrafische intelligentie van PitchBook
- Uitvoerformaten die tearsheets, geannoteerde aandelengrafieken en vergelijkingen van aandelenonderzoek bevatten, waarbij elk cijfer teruggekoppeld is naar de bron
Als de pitch van Anthropic "een AI-personeelsbestand is dat opereert binnen uw bestaande Microsoft 365-stack", is de pitch van Perplexity "het financiële besturingssysteem zelf" - een bestemmingstool, geen integratie. Waar Anthropic bedrijven vraagt om Claude in hun bestaande toolchain te pluggen, vraagt Perplexity hen om te migreren naar een nieuw werkoppervlak waar de gegevens native leven.
Beide weddenschappen kunnen winnen. Ze zullen waarschijnlijk niet allebei op dezelfde accounts winnen.
Eerlijk gezegd: Anthropic heeft momenteel de overhand, om een reden die niets met modelkwaliteit te maken heeft. De Microsoft 365-integratie is de slotgracht. De meeste grote financiële dienstverleners werken met Excel en PowerPoint. Hen vragen om de workflows van analisten te migreren naar een nieuwe bestemmingstool is wrijving. Hen vragen om Claude te toevoegen als een laag over de tools die ze al gebruiken, is bijna gratis. Dat is een structureel voordeel dat niet afhangt van welk model een iets beter winstoverzicht schrijft.
Maar Perplexity heeft iets dat Anthropic niet heeft: native datapartnerschappen ingebouwd in het productoppervlak zelf. Vooral de PitchBook MCP-integratie is een ander voordeel. Als de vraag luidt: 'vind mij elke Series B SaaS-deal in de afgelopen 18 maanden die is gesloten op meer dan 12x ARR', heeft het model waarin de PitchBook-gegevens al zijn vastgelegd een structurele voorsprong op het model waarvan moet worden verteld waar het moet zoeken.
De eerlijke voorspelling is dat dit een workflow-voor-workflow-splitsing zal zijn. KYC-screening en maandafsluiting gaan naar Anthropic vanwege de operationele integratie. Marktonderzoek en dealsourcing gaan naar Perplexity vanwege de datalaag. De komende achttien maanden wordt er gevochten om het opbouwen van een pitchbook en het beoordelen van de inkomsten.
Als u AI dit kwartaal in de context van de financiële dienstverlening implementeert, kies er dan niet één. Voer beide uit, gericht op specifieke workflows. De concurrentiedruk tussen de twee zal de prijzen en capaciteit sneller doen stijgen dan elk van hen alleen zou zijn gegaan.
Gemini 3.2 Flash, AB-tests en de pre-I/O Scramble
Nu naar het deel dat ik oorspronkelijk had gepland om mee te leiden – en dat door alles hierboven is gedegradeerd.
Google is al wekenlang AB bezig met het testen van meerdere Gemini 3.x-varianten voorafgaand aan I/O.. De namen die in de iOS Gemini-app-verkeerslogboeken voorkomen, zijn onder meer Gemini 3.2 Flash, Ajax, Hercules, Hector en Orpheus. Het lijkt erop dat de varianten elkaar opvolgen: een Reddit-gebruiker meldde dat zijn iOS Gemini-app in een periode van 24 uur van Gemini 3 Flash naar 3.1 naar 3.2 verschoof.
De gelekte prijzen voor Gemini 3.2 Flash, gebaseerd op AI Studio API-logboeken, bedragen $0,25 per 1 miljoen invoertokens en $2 per 1 miljoen uitvoertokens. Als deze cijfers standhouden bij de lancering van I/O, bereikt Gemini 3.2 Flash een flash-tier-prijsstelling met mogelijkheden die dicht bij Gemini 3.1 Pro liggen – wat de voorsprong van Google op het gebied van prijs versus kwaliteit in het middensegment zou vergroten.
Eén belangrijke correctie die het vermelden waard is, aangezien ik dit deze week in razzia's heb zien rondgaan. Het kennislimiet voor Gemini 3-modellen is januari 2025, niet januari 2026. Ik zag het getal voor 2026 aangehaald in een paar samenvattende discussies. Het is niet wat de modeldocumentatie van Google zegt. Het is de moeite waard om gelijk te krijgen voordat je de logica voor het ophalen van de architect rond een aanname brengt die niet overeenkomt.
Het grotere Google-verhaal is het Omni-modellek. Een UI-string die deze week in de Gemini-interface voor videogeneratie werd opgemerkt, toont de regel "Begin met een idee of probeer een sjabloon. Powered by Omni" naast "Toucan" - de interne naam voor het bestaande door Veo-3.1 aangedreven videopad. De plaatsing van "Omni" in de consumentenversie UI, en niet alleen in codelogboeken, zorgt ervoor dat waarnemers denken dat dit groter is dan een hernoeming.
Er zijn drie plausibele interpretaties:
- Omni is een publieke naam voor hetzelfde Veo-traject. Mogelijk maar niet spannend.
- Omni is naast Veo een nieuw Gemini-getraind videomodel. Mogelijk.
- Omni is een uniform Gemini omni-model dat zowel beeld als video in één systeem verwerkt. De architectonisch meest significante mogelijkheid – en degene die het hardst zou landen op I/O.
Als interpretatie drie geldt, levert Google het eerste omni-model van het hoogste niveau dat video en afbeeldingen in één enkel systeem verwerkt. Gecombineerd met de Project Mariner-zonsondergang op 4 mei en opgevouwen in de Gemini Agent persoonlijke assistent, wordt het I/O-verhaal zorgvuldig in scène gezet: een vlaggenschipmodel onthulling, een uniform multimodaal generatiesysteem en een 24/7-agent die in de Gemini-app leeft en het experimentele browser-agentwerk vervangt dat Mariner aan het doen was.
Drie plausibele modelonthullingen op I/O 2026 (maandag 19 mei - dinsdag 20 mei):
- Gemini 3.5 Pro / 3.5 Flash — hoogstwaarschijnlijk vorm van de headline-lancering
- Gemini 4.0 — Polymarket-traders staan op 94,5% op 'nee' voor de release van 4.0 op 30 juni, maar I/O heeft eerder verrast
- Omni als vlaggenschip van de multimodale generatie, gecombineerd met wat de nieuwe kop van Gemini ook is
Waar ik specifiek naar uitkijk: prijzen op de nieuwe Flash-laag, of de agent in de Gemini-app een aparte naam en prijsmodel krijgt van de chatervaring, en of Google iets aankondigt dat de agentic coding gap aanpakt met Codex en Claude Code – want dat is de plek waar Google het snelst terrein heeft verloren.
Voor de bredere racecontext heb ik vorige week verslag gedaan van de AI-superagentrace in mei 2026 - de zij-aan-zij-test van Codex, Cowork en Gemini die eindigde met slechts één die mijn ochtendtaak netjes afrondde. Spoiler: het was niet Gemini. I/O is de kans van Google om daar verandering in te brengen.
Gemma 4 MTP Drafters — De nuttigste release waar niemand over sprak
Terwijl SubQ de krantenkoppen haalde, heeft het open-sourceteam van Google iets uitgebracht waar bijna elke ontwikkelaar die dit leest zich meer zorgen over zou moeten maken dan ze momenteel doen.
Eerst een snelle verduidelijking, omdat dit door de war raakte in de bronnotities waar ik mee werkte. De release voor het opstellen van multi-token voorspellingen was voor Gemma 4 – de open-source modelfamilie van Google – en niet voor Gemini 4. Twee verschillende producten, twee verschillende releasetracks. Gemma 4 is degene die je daadwerkelijk kunt gebruiken.
Dit is wat er is verzonden. MTP (Multi-Token Prediction) drafters voor de Gemma 4-familie met behulp van een gespecialiseerde speculatieve decoderingsarchitectuur. De tekenaar koppelt met een zwaar doelmodel – bijvoorbeeld Gemma 4 31B – en gebruikt inactieve rekenkracht om meerdere toekomstige tokens tegelijk te voorspellen met de lichtgewicht tekenaar, in minder tijd dan het doelmodel nodig heeft om één token te verwerken. Het doelmodel verifieert vervolgens alle concepttokens parallel.
Het resultaat: tot 3x sneller zonder enige verslechtering van de uitvoerkwaliteit.
De MTP-drafters worden uitgebracht onder dezelfde Apache 2.0-licentie als Gemma 4, met modelgewichten beschikbaar op Hugging Face en Kaggle, en standaard ondersteuning voor Transformers, MLX, vLLM, SGLang en Ollama.
Voor ontwikkelaars die lokale Gemma 4-modellen op consumenten-GPU's of Apple Silicon gebruiken, is dit gratis een serieuze latentie-upgrade. Als u een realtime chattoepassing, een agentische workflow of een spraakproduct heeft waarbij de door de gebruiker waargenomen latentie van belang is, zijn MTP-tekenaars een integratie van één avond die de responstijden merkbaar verkort zonder het model zelf te veranderen.
Dit is het soort release dat geen discussiecycli genereert, maar stilletjes de productie-ervaring verbetert van iedereen die open modellen gebruikt. De moeite waard om tien minuten van je week te evalueren.
Pomelli-catalogus en de AI-marketingtool eten stilletjes MKB-workflows op
Nog een Google-release die past in het patroon van "stil schip, echte impact."
Pomelli — Google Labs en DeepMind's AI marketingtool voor kleine en middelgrote bedrijven — hebben een functie toegevoegd met de naam Pomelli Catalog. De stroom is: u uploadt uw producten of diensten, Pomelli slaat ze op in uw catalogus en de tool genereert op aanvraag gepersonaliseerde marketingcampagnes en door AI gemaakte productfoto's. Gratis, wereldwijd beschikbaar waar Pomelli wordt gelanceerd (VS, Canada, Australië, Nieuw-Zeeland, terwijl Europa zich uitbreidt).
Pomelli analyseert uw website om een Bedrijfs-DNA-profiel te creëren (uw toon, aangepaste lettertypen, afbeeldingen, kleurenpalet) en genereert vervolgens campagnes die daarbij aansluiten. Met de toevoeging van de catalogus wordt de cirkel gesloten: producten gaan erin, merkcampagne-advertentiemateriaal komt naar buiten, downloadbaar voor Instagram, TikTok, Facebook, YouTube en LinkedIn.
Dankzij de toevoeging in januari 2026 van Pomelli Animate, mogelijk gemaakt door Veo 3.1, kan de tool statische marketinginhoud transformeren in video-animaties op het merk. Gecombineerd met de Photoshoot-functie van Catalog, die Nano Banana 2 gebruikt om elke productfoto om te zetten in professionele afbeeldingen van studiokwaliteit, beschikt u over een volledige MKB-marketingworkflow – merkfoto, merkvideo, merkcampagne – in één gratis tool.
Voor solo-exploitanten en MKB-bedrijven die e-commerce exploiteren, is dit de versie van het AI-verhaal over marketingautomatisering waarover ik vrienden blijf vertellen en die zij blijven onderschatten. Het is niet zo opzichtig als een armada van financiële agenten. Het is voor meer mensen nuttiger. Als je een Shopify-winkel hebt met minder dan vijftig SKU's, zou je Pomelli Catalog vrijdag moeten hebben getest.
De Boston Dynamics-zijbalk die het waard is om te archiveren
Een opmerking die niet past in het AI-softwareverhaal, maar thuishoort in het plaatje van mei 2026.
De mensachtige robot Atlas van Boston Dynamics gaat in productie. Op CES 2026 in januari onthulde het bedrijf de productieklare versie. Vanaf mei 2026 zijn alle Atlas-implementaties in 2026 volledig vastgelegd. De vloot zal naar Hyundai's Robotics Metaplant Application Center worden verzonden en – aanzienlijk – naar Google DeepMind, dat zijn Gemini Robotics AI funderingsmodellen integreert in het Boston Dynamics-systeem.
Het relevante detail zijn niet de dansvideo's. Het is de samenwerking met DeepMind. Hetzelfde bedrijf dat Gemini 3.x-varianten en een Omni-multimodaal model verzendt, is degene die grens AI in humanoïde robots plaatst. De convergentie van taalmodellen, multimodale generatie en belichaamde AI vindt plaats in mei 2026, op de routekaart van Google, met het chassis van Boston Dynamics. Sla dit op voor het post-I/O-gesprek. In de tweede helft van 2026 gaan we veel meer lezen over Gemini Robotics.
Waar ik eigenlijk op zou wedden als ik deze maand productie AI zou inzetten
Achtduizend woorden, hier is het veldrapport van de destillatie. Als u in mei 2026 productie-AI-workflows implementeert, is dit wat ik deze week eigenlijk zou doen.
Architecteer voor het samenvouwen van het contextvenster. Migreer nog niet naar SubQ – wacht op onafhankelijke verificatie – maar stop met het bouwen van chunking-strategieën die ervan uitgaan dat 200K het plafond is. De komende twaalf maanden zullen de 1M-context waarschijnlijk veranderen in tafelinzetten en 10M+ in een reële mogelijkheid. Bouw ophaalpijplijnen die elastisch kunnen worden geschaald.
Gebruik GPT-5.5 Instant als de nieuwe standaard voor eenmalige feitelijke vragen in domeinen waar veel op het spel staat. Behoud uw Opus-abonnement voor redeneren in een lange context en voor agentwerk. Maar voor snelle medische, juridische of financiële zoekopdrachten is GPT-5.5 Instant nu het eerste telefoontje dat ik doe.
Voer Anthropic Claude financiële agenten en Perplexity Computer naast elkaar uit, afgestemd op verschillende workflows. Anthropic voor alles wat zich in Microsoft 365 bevindt. Perplexity voor alles dat native PitchBook-, Morningstar-, Daloopa- of Carbon Arc-gegevens nodig heeft. Kies er pas één als het gevecht negentig dagen heeft geduurd.
Wacht tot I/O voordat u zich engageert voor een Gemini-integratie. Gemini 3.2 Flash-prijzen zijn op papier uiterst concurrerend, maar het lanceren van productiewerk aan een model twee weken voordat de opvolger wordt aangekondigd, is een recept voor een migratie die u niet had gepland. Bekijk de keynote op 19 mei en meld je dan aan.
Integreer Gemma 4 MTP-tekenaars in elke workflow met lokaal model die u gebruikt. Het is een gratis latentiewinst.
Als u een MKB- of e-commercebedrijf heeft met minder dan vijftig SKU's, test dan de Pomelli-catalogus deze week. Het is de versie van het AI-verhaal over marketingautomatisering dat consequent meer oplevert in verhouding tot de publiciteit.
Let op de agentische coderingsreactie van Google op I/O. Dat is het gat dat Google moet dichten, en het gat dat het meest direct van invloed zal zijn op elke ontwikkelaar die dit leest. Als ze iets leveren dat concurreert met Claude Code of Codex op het soort langlopende agentische coderingsworkflows die we hebben besproken in de uitsplitsing van de superagentrace van mei, verandert je toolstack.
Het enige dat ik bijna heb gemist
Ik schrijf al lang genoeg AI-overzichten om te weten dat de aankondigingen die in week één het grootst aanvoelen, vaak niet de aankondigingen zijn die er in maand zes toe doen. Als ik terugkijk op de aankondigingen die ik ongeveer een jaar geleden ademloos schreef, zijn de helft ervan nu voetnoten. Dezelfde voorzichtigheid was van toepassing op de opschudding in de sector van april 2026 – de helft van die paniekverhalen normaliseerde binnen dertig dagen, en het duurzame signaal werd begraven in de stillere releases.
Dus dwing ik mezelf om elke dinsdag als deze af te vragen: over welke van deze zal ik het in november nog hebben?
GPT-5.5 Instant is een stille, duurzame release. De hallucinatiedaling op domeinen met een hoge inzet is het soort verbetering dat voor miljarden gebruikers elke week, voor altijd, van belang is. Dat is duurzaam.
Het gevecht tussen financiële agenten is duurzaam. Of het nu Anthropic of Perplexity is die meer workflows binnenhaalt, het verdwijnen van de ingangspunten voor junior-analisten is nu in beweging. Tegen 2027 zullen we het hebben over hoe dit de aanwerving in de financiële dienstverlening heeft veranderd.
Gemma 4 MTP-tekenaars zijn duurzaam op een saaie, nuttige manier. Snellere lokale gevolgtrekking is niet glamoureus, maar het levert een echte verbetering op voor iedereen die lokaal open modellen gebruikt. Dat blijft in mijn stapel.
De Gemini 3.2 Flash AB-testvarianten – Ajax, Hercules, Hector, Orpheus – zijn niet duurzaam. Het zijn pre-lanceringsgeluiden. In juni wordt dit allemaal vervangen door wat Google daadwerkelijk aankondigt op I/O.. Als je vandaag mentale cycli besteedt aan de varianten, stuur die cycli dan door naar de I/O keynote op 19 mei.
En SubQ. SubQ is de jokerteken. Als de architectonische claims overleven, is dit de belangrijkste release van 2026 – groter dan alles wat ik verwacht dat Google zal aankondigen op I/O.. Als ze het niet overleven, voegt het zich bij het lange kerkhof van ‘magische getallen in lanceerposten die zich niet hebben voortgeplant’. Ik kijk uit naar de benchmarkreplicatiethreads van derden die in de komende twee weken zullen verschijnen. Als ze overeenkomen met de beweringen van het bedrijf, zitten we tegen de herfst in een nieuw computerregime. Als ze dat niet doen, blijven we bouwen op de verdieping die we hebben.
I/O is over twee weken. Het beeld van vandaag, op 6 mei 2026, zal er op 21 mei anders uitzien. Maar de richting van de weddenschappen – richting modellen met een hogere context, goedkopere modellen, nauwkeurigheid van professionele domeinen, automatisering van financiële diensten en belichaamde AI-partnerschappen – zal niet omkeren. De komende twaalf maanden zullen worden bepaald door welke van deze weddenschappen worden uitbetaald en hoe snel.
Het artikel dat ik ging schrijven zou een rustige preview zijn geweest van Google I/O 2026. Dat is het niet meer. Het is een momentopname van het moment waarop het veld werkelijk onder ieders voeten verschoof – en een werktheorie over welke positie als eerste moet worden genomen.
Als je na het sluiten van dit tabblad nog maar één ding doet: bekijk de I/O keynote op 19 mei met bovenstaand raamwerk in je hoofd. Kijk welke gaten Google dicht, welke ze trappen en welke aankondigingen ze doen die niemand zag aankomen. Het verschil tussen wat ze verzenden en wat de rest van deze week is verzonden, zal je precies vertellen waar de komende twaalf maanden naartoe gaan.
Ik zal de keynote live bijwonen. Tot ziens aan de andere kant ervan.
Veelgestelde vragen
Wat is subkwadratische schaarse aandacht en waarom is het belangrijk?
Subquadratic Sparse Attention (SSA) is de architectuur achter SubQ, het grensmodel van de in Miami gevestigde startup dat op 5 mei 2026 werd gelanceerd. Het berekent selectief de aandacht alleen over tokenposities die er toe doen, in plaats van elk token met elk ander token te vergelijken. Het bedrijf claimt een contextvenster van 12 miljoen tokens tegen minder dan 5% van de computerkosten van Claude Opus. Als dit onafhankelijk wordt geverifieerd, vervalt de veronderstelling dat grensintelligentie grenscomputing vereist.
Wanneer werd GPT-5.5 Instant uitgebracht en wat is er veranderd?
OpenAI heeft GPT-5.5 Instant uitgebracht als het nieuwe standaardmodel van ChatGPT op 5 mei 2026. De belangrijkste verandering is een vermindering van 52,5% in hallucinaties op medische, juridische en financiële aanwijzingen vergeleken met GPT-5.3 Instant, waarbij de HealthBench-scores stijgen van 49,6 naar 51,4 en AIME 2025 van 65,4 tot 81,2. Betaalde gebruikers behouden GPT-5.3 Instant toegang gedurende drie maanden.
Wat zijn de 10 sjablonen voor financiële agenten van Anthropic?
Anthropic heeft op 5 mei 2026 10 kant-en-klare Claude financiële agenten vrijgegeven, opgesplitst in twee categorieën: Research/Client Coverage (pitchbuilder, vergaderingsvoorbereider, winstbeoordelaar, modelbouwer, marktonderzoeker) en Finance/Operations (waarderingsbeoordelaar, GL-afsteller, maandafsluiting, verklaringsauditor, KYC-screener). Ze draaien binnen Claude Cowork en Claude Code of als door Anthropic beheerde agenten, met volledige Microsoft 365-integratie.
Wanneer is Google I/O 2026 en wat wordt er verwacht?
Google I/O 2026 loopt van 19 tot 20 mei 2026, met de keynote op 19 mei. Verwachte aankondigingen omvatten een grote onthulling van het Gemini-model (waarschijnlijk Gemini 3.5, mogelijk Gemini 4.0), het geruchten Omni-multimodale generatiemodel, agentupdates na de Project Mariner zonsondergang op 4 mei, en waarschijnlijk Veo- en Nano Banana-updates. Het belangrijkste om naar te kijken is of Google de kloof in de codeertechniek dicht met Codex en Claude Code.
Wat is het verschil tussen Gemini 4 en Gemma 4?
Het zijn aparte productlijnen. Gemini is de vlaggenschipfamilie van gesloten source-modellen van Google. Gemma is de open-source modelfamilie van Google. De release van de multi-token voorspellingsontwerper uit mei 2026 die 3x snellere gevolgtrekkingen opleverde, was voor Gemma 4 (open source, beschikbaar op Hugging Face en Kaggle onder Apache 2.0), niet voor Gemini 4. De twee worden vaak verward, maar worden op verschillende routes verzonden.
Laten we samenwerken
Wilt u AI-systemen bouwen, workflows automatiseren of uw technische infrastructuur schalen? Ik help je graag.
- Fiverr (aangepaste builds en integraties): fiverr.com/s/EgxYmWD
- Portfolio: mejba.me
- Ramlit Limited (ondernemingsoplossingen): ramlit.com
- ColorPark (ontwerp en branding): colorpark.io
- xCyberSecurity (beveiligingsdiensten): xcybersecurity.io