Een model van 295 miljard parameters nam het net op tegen open-weight-reuzen die drie tot vijf keer zo groot zijn — en versloeg de meeste van hen overal, op één plek na. Dat is de zin waar ik steeds op terugkwam terwijl ik de Tencent Hy3-release uit elkaar trok, en hij zet de hele "groter is beter"-aanname op zijn kop waar de open-weight-race op draait sinds DeepSeek V4 Pro zijn 1,6 biljoen parameters uitbracht.
Hier is het cijfer dat ertoe doet. Hy3 activeert slechts 21 miljard van die 295 miljard parameters per token. GLM 5.2 — het model dat de meeste mensen die ik volg momenteel als het open-source-plafond beschouwen — draagt ruwweg 744B in totaal en verbrandt zo'n 40B actieve parameters per token. Tencent stapte dus de arena van codeermodellen binnen met een model dat minder dan de helft van de omvang en ruwweg de helft van de compute per token van de regerend kampioen heeft, en het eerlijke oordeel uit de benchmarks is: het verliest de codeerkroon met een paar punten en wint vrijwel al het andere. De kop van VentureBeat zei het strakker dan ik kan — Hy3 "neemt het op tegen GLM-5.2 op de helft van de omvang, en wint overal behalve bij coderen."
Deze Tencent Hy3 review is mijn poging om de enige vraag te beantwoorden die ertoe doet als je een builder bent: moet je dit ding daadwerkelijk in je toolkit opnemen voordat het gratis venster op 21 juli sluit, en zo ja, waarvoor? Want het leaderboard-verhaal en het gebruik-het-op-een-dinsdag-verhaal zijn twee heel verschillende dingen, en het meeste wat ik deze week las vertelde alleen het eerste.
Wat ik heb geverifieerd, en wat ik uit tweede hand doorgeef
Voor het leuke gedeelte eerst één regel over hoe je dit stuk moet lezen, want dat bepaalt hoeveel gewicht je aan elke claim moet geven.
De harde feiten heb ik gecheckt tegen primaire bronnen. De 295B/21B-architectuur en de Apache-2.0-licentie haalde ik uit Tencents tencent/Hy3-modelkaart; het gratis venster en de prijzen na de promo uit de OpenRouter-listing; de benchmarkcijfers uit Tencents eigen tabellen en de externe artikelen die ik gaandeweg citeer. Die zal ik gewoon stellen — met de kanttekening dat Tencents benchmarks zelfgerapporteerd zijn en nog wachten op brede onafhankelijke replicatie.
De hands-on buildtests zijn een ander verhaal. De browsergebaseerde macOS-kloon, de fysicademo's, de 3D-stad — ik vat een gedocumenteerde testbatterij samen en analyseer die, een reeks die na de launch circuleerde; ik beweer niet dat ik persoonlijk elke prompt zelf heb ingetypt. Waar een cijfer providerafhankelijk is of uit die walkthrough komt in plaats van uit een primaire tabel, zeg ik "gerapporteerd" in plaats van het te verkopen als vaststaand feit. Houd me aan dat onderscheid; het is de hele reden om de ene modelreview meer te vertrouwen dan de andere.
Het model zelf is echt, geen vaporware. Tencent maakte Hy3 open source op 6 juli 2026 — de productie-opvolger van de Hy3-preview die het in april liet zien. De weights staan op Tencent-Hunyuan/Hy3 op GitHub en tencent/Hy3 op Hugging Face (met een Hy3-FP8-build ernaast), het staat nu op OpenRouter, en het is Apache-2.0. Dit is geen gelekte benchmark-screenshot — het is een uitgebracht, downloadbaar model dat je vandaag met een API-call kunt aanroepen.
De architectuur van Hy3, en de MoE-truc die het goedkoop maakt
Laat ik de spec-dump even afhandelen, want je hebt deze cijfers waarschijnlijk al verspreid over een dozijn nieuwsberichten gezien, waarvan de helft het lab "Tenset" noemde of iets vergelijkbaar verhaspelds. Het is Tencent — de Chinese gigant achter WeChat — en Hy3 is het nieuwste lid van hun Hunyuan-modelfamilie.
Hier is de architectuur, geverifieerd tegen Tencents eigen modelkaart:
- 295 miljard parameters in totaal, met 21 miljard actief per token
- 192 gerouteerde experts per MoE-laag, plus één altijd actieve gedeelde expert, met top-8 routing — wat betekent dat slechts 8 van die 192 experts afgaan op één enkele token
- Een aparte 3.8B multi-token-prediction (MTP)-laag waarmee het model meer dan één token per decodeerstap kan voorspellen — een echte snelheidshefboom, geen versiering op de spec-sheet
- 256K token contextvenster (262.144 tokens, om precies te zijn)
- Apache 2.0-licentie — volledig commercieel gebruik, en Tencent hief expliciet de geografische beperkingen op die de preview van april nog inperkten
Die MoE-structuur is de hele truc. Als mensen "295 miljard parameters" horen, stellen ze zich een model voor dat 295 miljard parameters aan compute kost om te draaien. Dat is niet zo. De router maakt een smalle plak wakker — 8 experts, ~21B parameters — voor jouw specifieke token, en de andere 171 experts blijven slapen. Je betaalt voor de plak, niet voor het hele brein. Daarom kan een model met deze capaciteiten geprijsd worden als een veel kleiner model, en het is dezelfde architecturale gok die DeepSeek, GLM, MiniMax en Kimi allemaal hebben genomen. Wil je de diepere mechaniek van hoe sparse routing de inferentiekosten laat instorten, dan heb ik dat in detail behandeld in mijn DeepSeek V4 Pro review — het routingverhaal daar geldt hier vrijwel één-op-één, alleen op een fractie van de totale omvang.
Tencent bouwde ook iets in waarvan ik zou willen dat meer labs het leverden: configureerbare reasoning-inspanning. Hy3 staat standaard in een snelle "no-think"-modus, en biedt daarnaast lage en hoge reasoning-modi die je aanzet voor het zware werk — een taaie refactor, een wiskundig bewijs, een meerstaps agent-keten. Je betaalt geen reasoning-token-overhead op een prompt die gewoon een snel antwoord nodig heeft. Anthropic, OpenAI en Google zijn allemaal op een variant hiervan uitgekomen, en dit zien in een open-weight-model voor deze prijs is een echte quality-of-life-winst.
De gestelde ontwerpdoelen zijn reasoning, meerstaps- en agentische workflows, coderen, en — de frase die Tencent blijft herhalen — "real-world production deployment." Tencent claimt daarnaast meetbare winst op anti-hallucinatie, betrouwbaardere tool-calling, post-trainingdata van hogere kwaliteit en meer RL-stappen dan de vorige generatie. Die laatste vier zijn het soort claims dat je niet uit een spec-sheet kunt verifiëren; ze komen (al dan niet) naar voren in hoe het model zich gedraagt bij echt werk. En daar komen de tests om de hoek kijken.
Maar eerst het cijfer waarvoor iedereen deze artikelen eigenlijk opent.
Wat kost het om Tencent Hy3 te draaien?
Niets. Tot en met 21 juli 2026 draait Hy3 voor $0 op OpenRouters tencent/hy3:free-route, en Nous Research opende binnen enkele uren na de launch gratis toegang in zijn portal. Dat is het korte, snippet-waardige antwoord.
Nadat het promovenster sluit, blijft het goedkoop — en hier wil ik een cijfer corrigeren dat ik overal op het web herhaald zag. Sommige vroege berichtgeving noemde een hogere losse prijs, maar de OpenRouter-listing zelf prijst Hy3 op ruwweg $0,14 per miljoen input-tokens en $0,58 per miljoen output-tokens, waarbij de verschillende inference-providers op de marktplaats oplopen tot ongeveer $0,20 op input. OpenRouter is een marktplaats: het exacte bedrag dat je betaalt hangt af van welke provider je verzoek afhandelt en welke routing-modus je kiest. Maar elke route die ik daadwerkelijk kon checken zat in diezelfde goedkope buurt, dus beschouw $0,14/$0,58 als het gangbare tarief en je zit er niet ver naast.
Zet dat naast het huidige tarief van Claude Opus 4.8 — $5 per miljoen input, $25 per miljoen output — en het verschil is enorm. Hy3's output-tokens komen ergens rond de 40x goedkoper uit dan Opus. Het kwaliteitsverschil aan de absolute top is reëel en ik ga niet doen alsof dat niet zo is. Maar "40x goedkoper en grotendeels net zo goed" verandert de rekensom voor veel workloads, vooral de hoogvolume-, laag-risicoklussen waarvoor je toch nooit frontier-prijzen ging betalen.
Er is ook een gratis route buiten OpenRouter om — Hy3 was uit te proberen via het Nous-benchmarkportal op gratis accounts, een laagdrempelige manier om het even te testen voordat je een API-sleutel aansluit. Draai je al modellen via OpenRouter, dan behandelt mijn gids voor het draaien van gratis modellen in Claude Code via OpenRouter precies die setup — Hy3 past in diezelfde workflow zolang het gratis venster open is.
Nu: rechtvaardigt de prestatie de opwinding? Deels. Laat me je de eerlijke tweedeling laten zien.
De benchmarks: waar Hy3 wint, en de ene plek waar het dat niet doet
Ik wil hier voorzichtig zijn, want benchmarktabellen zijn precies de plek waar dit soort launches zichzelf overschat. Dus ik scheid wat Tencent en derden rapporteerden, en ik markeer de ene vergelijking die daadwerkelijk beslist of dit model in je codeerstack thuishoort. Eerst een algemene kanttekening: alles hieronder is door Tencent gerapporteerd of gerapporteerd door vroege externe berichtgeving, en onafhankelijke replicatie loopt nog achter.
Op wetenschap en reasoning is Hy3 echt sterk. Het rapporteert 90,4 op GPQA Diamond en 72,0 op USAMO 2026, met IMOAnswerBench op 90,0 en HLE-met-tools op 53,2. De berichtgeving van Gigazine noteerde Tencents claim dat Hy3 vergelijkbaar is met GLM-5.2 en DeepSeek-V4 in zijn gewichtsklasse en GPT-5.5 overtreft op wetenschappelijke taken. In een gerapporteerde blinde evaluatie met 270 menselijke experts scoorde Hy3 2,67 uit 4, nipt boven GLM-5.1 met 2,51. Voor een model dat half zo groot is als de open-weight-koploper zijn dat geen bescheiden cijfers.
Op agentisch zoeken ligt het voor op zijn hele gewichtsklasse. Gerapporteerde cijfers zetten Hy3 op 84,2 op BrowseComp en 91,0 op DeepSearchQA — vóór elk ander open model in Tencents eigen tabel, en competitief met Claude Opus 4.8 en GPT-5.5. Als jouw workload uit research-agents, tool-intensief browsen of long-horizon retrieval bestaat, is dit het deel van het verhaal waar je van rechtop moet gaan zitten.
En dan is er coderen — de ene plek waar het verliest. Hier is de directe vergelijking met GLM 5.2, dat de meeste mensen als de open-source codeer-SOTA beschouwen:
| Benchmark | Hy3 (gerapporteerd) | GLM 5.2 (gerapporteerd) |
|---|---|---|
| SWE-bench Verified | 78.0 | 84.2 |
| SWE-bench Multilingual | 75.8 | 83.0 |
| Terminal-Bench 2.1 | 71.7 | 81.0 |
| DeepSWE | 28.0 | 46.2 |
GLM 5.2 wint de codeersuite, overtuigend, en met een ruime marge op specifiek DeepSWE. De bronvideo die ik analyseerde schetste een iets rooskleuriger beeld — Hy3 dat DeepSeek V4 Pro nipt voorbijgaat op een "Swaybench Pro"-metriek met 57,9 tegen 55,4, en bijna-gelijkspel op multilingual met 75,8 tegen 76,2. Ik lees "Swaybench" als een verkeerd verstaan SWE-bench, en die specifieke één-op-één-cijfers tegenover DeepSeek zou ik behandelen als gerapporteerd-uit-de-bron in plaats van onafhankelijk bevestigd. Wat ik wél naast de primaire tabellen kan leggen, is de grote lijn: Hy3 concurreert respectabel met DeepSeek V4 op coderen, en blijft achter op GLM 5.2. Die multilingual-score van 75,8 duikt op in zowel de video als de gepubliceerde data, dus dat ankerpunt houdt in elk geval stand.
Hier is de herkadering die het voor mij deed klikken. Dat Hy3 achterblijft op GLM 5.2 bij coderen terwijl het er voorligt op reasoning, wetenschap en agentisch zoeken — op 40% van het parameteraantal — is geen verlies. Het is een model dat een andere gok waagt. GLM 5.2 is de pure codeerspecialist. Hy3 is de efficiënte generalist die toevallig ook heel goed is in code. Of die ruil voor jou de juiste is, hangt volledig af van wat je bouwt. Wil je de volledige analyse van hoe GLM 5.2 zich verhoudt tot de frontier, dan heb ik het door vijf one-shot builds gehaald in mijn GLM 5.2 vs Qwen 3.7 Max vs Claude Opus 4.8 test — het lezen waard naast dit stuk als coderen je primaire use case is.
Maar benchmarks zijn de kaart, niet het terrein. Het terrein is wat er gebeurt als je een model op een echte build richt en op enter drukt.
De echte kracht waar niemand mee opent: front-end en SVG
Hier werd de gerapporteerde testbatterij echt interessant, en hier begroef het merendeel van de launch-berichtgeving volgens mij de kern van het verhaal. Hy3's uitblinker is niet zijn GPQA-score. Het is front-end scaffolding.
Door de gedocumenteerde tests heen produceerde Hy3 front-end UI die goed gestructureerd en visueel aantrekkelijk was op een manier die nog altijd ongebruikelijk is voor open-weight-modellen. Niet "functioneel maar lelijk", de gebruikelijke open-weight front-end-uitkomst. Echt mooi — het greep naar echte animatiepackages, scroll-getriggerde interacties, achtergrondeffecten, custom cursor-ontwerpen, doordachte typografie. Het soort afwerking waar je een model normaal drie of vier keer naartoe moet prompten, en dat je vaak moet overdragen aan Claude of een frontier-model om het goed te krijgen.
Dat is belangrijk, want front-end is waar een groot deel van het dagelijkse werk van shippen daadwerkelijk zit, en het is historisch gezien de plek waar open-weight-modellen zichzelf voor schut zetten. Een model dat in één keer een echt goed ogende landingspagina of componentbibliotheek kan opzetten, bespaart je het meest saaie deel van de build. Op deze as plaatsen de gerapporteerde tests Hy3 in hetzelfde gesprek als GLM 5.2 als front-end scaffolding-tool — wat, gezien het verschil in omvang en kosten, een serieuze claim is.
De macOS-kloon. De vlaggenschip-demo was een browsergebaseerde macOS-kloon met apps die native aanvoelden — Finder, Safari, Terminal, Notes, Settings, App Store, Maps — geanimeerde SVG-iconen, en zelfs een ingebedde 3D FPS-minigame. De eerlijke lezing: schieten en bewegen werkten, de besturing was houterig, sommige systeembalken boven- en onderin waren niet volledig aangesloten, en het Settings-paneel kon de wallpaper en dock-positie visueel wijzigen maar sloeg de wijziging niet daadwerkelijk op. Dus — indrukwekkende scaffolding, imperfecte uitvoering. Het is een "kijk wat één prompt produceerde"-demo, geen shipbaar product. Maar als stresstest van hoeveel coherente structuur het model in zijn hoofd kan houden over een hele nep-besturingssysteem heen, is het een sterke prestatie.
Het SVG-werk is waar het stilletjes excelleert. In de gedocumenteerde tests genereerde Hy3 een realistische schilderscène met vuurvliegjes en atmosferische diepte, en een geanimeerde, symmetrische vlinder-SVG met correcte gradiënten — animatie waar de prompt niet eens expliciet om vroeg. Schone SVG-codegeneratie met smaakvolle animatie is een specifieke, moeilijk te faken vaardigheid, en het is een van de betrouwbaarste rode draden in de hele batterij. Genereer je veel iconografie, illustraties of lichte motion, dan is dit een echte reden om het model te testen.
Evalueer je open-weight-modellen voor precies dit soort front-end- en designintensief werk, dan is het de moeite waard om Hy3 naast de andere recente kanshebbers te leggen — ik deed een eerste blik op MiniMax M3 als open-weight-model die voor dezelfde klus een nuttig vergelijkingspunt vormt.
De 3D- en gametests: snel, netjes, net geen frontier
De gerapporteerde batterij ging verder de 3D en simulatie in, en hier komt het eerlijke beeld van Hy3's plafond scherp in beeld. Het is snel en netjes. Het is niet top-tier op rauwe generatiekwaliteit. Beide dingen zijn waar.
De 3D-visualizers hielden goed stand. Een draaiende-aarde HTML-visualizer werd vergeleken met Opus 4.8 en Fable 5. Fable 5 kwam als meest fotorealistisch uit de bus — geen verrassing, dat is precies zijn ding — maar Hy3 zag er naar verluidt visueel aantrekkelijker uit dan Opus 4.8, en dat is geen zin die ik verwachtte te typen over een model dat zó goedkoop is. Een 3D-zonnestelselverkenner leverde een echt sterrenveld, geloofwaardige planeetschaduwen en -belichting, een werkende camera en herkenbare planeten — Neptunus, Jupiter en Saturnus allemaal identificeerbaar. Focussen op een planeet vergde herhaalde klikken om te triggeren, dus de interactie was ruw, maar de rendering zelf was solide.
De fysicademo's zijn het efficiëntieverhaal in het klein. In een vergelijking over drie HTML5-canvas-fysicademo's — bowlen, airhockey en een poolbreak — werd Hy3 tegenover Gemini 3.5 Flash, GLM 5.2 en DeepSeek V4 gezet. Het gerapporteerde resultaat: Hy3 gebruikte ruwweg 30k tokens voor een fractie van een cent en evenaarde de kwaliteit van Gemini 3.5 voor een klein deel van de kosten. Gemini haalde vergelijkbare kwaliteit met ~23k tokens maar veel duurder; GLM 5.2 (~25k tokens) produceerde de sterkste pure logica en code; DeepSeek V4 gebruikte ~50k tokens en kwam als zwakste van de vier uit de bus. Hy3's botsingen waren netjes, zijn spin en momentum geloofwaardig, de simulatie gepolijst. Die regel "vergelijkbare kwaliteit voor een fractie van de kosten" is de hele waardepropositie samengeperst in één test.
Op de zware 3D-taken toonde het plafond zich. Een laatste ronde zette Hy3 tegenover Fable 5, Opus 4.8 en Sonnet 5 op drie veeleisende builds: een oceaangolf die een zandkasteel laat afbrokkelen, een fabriekslopende band, en een interactieve 3D-stad op een moderne Three.js-setup. Hy3 was naar verluidt als snelste klaar met schone, gepolijste output — Fable 5 was het meest fotorealistisch, Sonnet 5 hoge kwaliteit maar trager, en Opus 4.8 eindigde als laatste en was, opvallend genoeg, visueel minder aantrekkelijk dan Hy3. Maar de snelheid kwam met compromissen: Hy3 gebruikte benaderende fysica in plaats van een volledige simulatie, de fabriekslogica had kleine bugs, en de 3D-stad zag er overtuigend uit maar was niet zwaar geoptimaliseerd. Competitief op snelheid en efficiëntie; een stap achter de top op rauwe kwaliteit.
Dat is de eerlijke vorm ervan. Hy3 brengt je het grootste deel van de weg, sneller en goedkoper dan bijna al het andere, en vraagt je vervolgens het laatste stuk zelf af te maken. Voor een enorm aantal echte workloads is dat een fantastische ruil.
Wil je deze evaluatie en setup liever niet zelf aan elkaar knopen — het juiste open-weight-model kiezen voor een gegeven workload, het in een agent-harnas hangen, en weten waar elk model breekt — dan hoeft dat niet. Dat soort AI-bouw- en integratiewerk doe ik regelmatig met klanten.
Eerlijk gezegd: de beperkingen, en voor wie dit echt is
Elke modelreview die de beperkingen overslaat, is marketing. Hier zou ik terugduwen op de hype.
Het 256K contextvenster is de echte beperking. In een wereld waarin GLM 5.2 en DeepSeek V4 adverteren met een miljoen tokens, is 256K voor bepaalde klussen echt beperkend. Voer je een model een complete grote codebase, een boeklang document of een uitgestrekte multi-file agenttaak, dan raak je het plafond op Hy3 sneller dan op zijn grotere rivalen. Voor het meeste dagelijkse prompten — een feature, een component, een afgebakende refactor, een researchtaak — is 256K ruim voldoende. Maar ken je workload. Is long-context jouw bottleneck, dan is dit niet jouw model, en geen enkele kostenbesparing verandert daar iets aan.
Coderen is een echte, gemeten zwakte ten opzichte van GLM 5.2. Ik zei het bij de benchmarks en ik zeg het hier onomwonden: als jouw allerhoogste prioriteit rauw agentisch coderen is en je de beste open-weight-optie wilt, wint GLM 5.2 dat specifieke gevecht nog steeds. Hy3 is competitief — het gaat gelijk op met DeepSeek V4 op code — maar "competitief" is niet "de beste". Kies Hy3 voor coderen wanneer kostenbesparing en snelheid voor jou zwaarder wegen dan de laatste paar punten correctheid eruit persen. Kies GLM 5.2 wanneer correctheid alles is.
De demo's zijn demo's. De macOS-kloon, de games, de 3D-stad — het zijn scaffolding-showcases, en stuk voor stuk hadden ze ruwe randjes zodra je er echt aan zat. Besturing die half werkte, instellingen die niet bewaard bleven, fysica die benaderd was. Dit is normaal voor one-shot-generatie en het is geen verwijt dat uniek is aan Hy3. Verwar alleen een indrukwekkende screenshot niet met een afgewerkt product. Je zult moeten opruimen.
Voor wie is Hy3 dan eigenlijk? Als ik de aanbeveling op een post-it moest schrijven: het is voor front-end- en designintensief werk, agentisch zoeken, reasoning- en wetenschapstaken, en hoogvolume-workloads waar kosten en snelheid zwaarder wegen dan de laatste paar punten codeerprecisie. Het is een uitstekend tweede model in een multi-model-setup — de goedkope, snelle generalist waar je het meeste werk naartoe routeert, terwijl je een frontier-model stand-by houdt voor de klussen die het echt nodig hebben. Modellen op precies die hybride manier draaien is iets wat ik eerder heb uitgeschreven, in mijn hybride AI-codeerworkflow met DeepSeek V4 en Claude Code — Hy3 past in datzelfde patroon als het goedkope werkpaard.
Wat je echt moet verwachten als je het test
Laat me realistische verwachtingen scheppen, want ik heb je liever gekalibreerd dan teleurgesteld.
Richt Hy3 op een front-end-scaffold, een SVG-illustratie, een landingspagina, een reasoning-intensieve of researchtaak, of een 3D- of fysicademo van gemiddelde complexiteit, en verwacht output die schoon, snel en oprecht mooi is — vaak in één keer goed, af en toe met een duwtje. Verwacht dat de kosten zo laag zijn dat ze geen rol meer spelen in je beslissingen. Verwacht dat de snelheid de meeste frontier-modellen glansrijk verslaat.
Richt het op een gigantische codebase, een subtiele multi-file agentische refactor, of een taak waar correctheid perfect moet zijn, en verwacht dat je óf het 256K-plafond raakt, óf jezelf betrapt op de wens dat je GLM 5.2 of een frontier-model had gebruikt. Verwacht dat de demo's die je bouwt opgeschoond moeten worden voordat iemand anders dan jij ze aanraakt.
Het patroon in alles wat ik heb bekeken is consistent: Hy3 slaat dramatisch boven zijn parameteraantal, levert bruikbare code en betrouwbare reasoning, en laat zijn omvang pas zien op het allerhoogste moeilijkheidsniveau. Voor een 295B-model dat geprijsd is als speelgoed is dat niet alleen indrukwekkend — het is een signaal over waar de open-weight-race naartoe gaat. Tencent bracht niet het grootste model uit. Ze brachten een van de meest efficiënte uit, en efficiëntie is de as die daadwerkelijk je portemonnee bereikt.
Het venster sluit op 21 juli
Terug naar die openingszin — een model dat minder dan half zo groot is als de open-weight-koploper en vrijwel overal wint behalve bij coderen. Een maand geleden had dat als een persberichtfantasie gelezen. Deze week is het een downloadbare, Apache-2.0, gratis-te-testen realiteit met de benchmarks en de repo's om het merendeel ervan te onderbouwen.
Het ene concrete ding dat ik de komende dagen zou doen: zet Hy3 aan zolang het gratis is — via OpenRouters gratis route of het Nous-portal — en gooi je echte werk ernaartegen. Niet de demo's. Jouw echte front-end-scaffold, jouw echte research-agent, jouw echte SVG-batch. Twintig minuten testen op taken die je al begrijpt, vertelt je meer dan elke benchmarktabel in dit stuk, de mijne incluis. De promotionele gratis periode eindigt op 21 juli, en daarna betaal je — nog steeds bijna niets, maar je betaalt.
Want de hele open-weight-golf blijft hetzelfde bewijzen, release na release: het model dat je workflow verandert is meestal niet het grootste of het hoogst genoteerde op een leaderboard. Het is het model dat goed genoeg, snel genoeg en goedkoop genoeg is dat je stopt met nadenken over de kosten en gewoon bouwt. Hy3 maakt een serieuze kans om dat model voor jou te zijn. Je hebt ongeveer twee weken om daar gratis achter te komen.
Veelgestelde vragen
Wat is Tencent Hy3?
Tencent Hy3 is een open-weight Mixture-of-Experts AI-model van 295 miljard parameters, uitgebracht op 6 juli 2026 onder de Apache 2.0-licentie. Het activeert 21B parameters per token via 192 experts met top-8 routing, ondersteunt een contextvenster van 256K, en richt zich op reasoning-, agentische en codeerworkloads. Zie de spec-analyse hierboven voor alle details.
Is Tencent Hy3 gratis te gebruiken?
Tencent Hy3 is gratis tot en met 21 juli 2026, via OpenRouters tencent/hy3:free-route en het portal van Nous Research. Na afloop van de promo rekent de OpenRouter-listing ruwweg $0,14 per miljoen input-tokens en $0,58 per miljoen output-tokens, waarbij sommige providers op de marktplaats tot ongeveer $0,20 op input rekenen.
Is Hy3 beter dan GLM 5.2?
Dat hangt van de taak af. Op de gerapporteerde benchmarks wint GLM 5.2 bij coderen — SWE-bench Verified 84,2 tegen Hy3's 78,0 — maar Hy3 ligt voor op reasoning, wetenschap en agentisch zoeken terwijl het minder dan de helft van de parameters gebruikt. Voor puur coderen is GLM 5.2 sterker; voor efficiënt algemeen gebruik concurreert Hy3 stevig mee. Zie de benchmarktabel hierboven.
Waar is Tencent Hy3 het beste in?
Hy3's sterkste gerapporteerde use cases zijn front-end scaffolding, SVG-generatie en -animatie, agentisch zoeken, en reasoning- of wetenschapstaken — plus 3D- en fysicademo's van gemiddelde complexiteit, waar het naar verluidt duurdere modellen evenaarde voor een klein deel van de kosten. Het is het zwakst op zeer lange context en top-tier agentisch coderen.
Hoe groot is Hy3 vergeleken met DeepSeek V4 Pro?
Hy3 is veel kleiner — 295B parameters in totaal tegenover de 1,6 biljoen van DeepSeek V4 Pro. Op codeerbenchmarks gaan de twee ondanks dat groottegat gelijk op, wat een groot deel verklaart van waarom Hy3's parameterefficiëntie zoveel aandacht trok. Mijn volledige DeepSeek V4 Pro review behandelt dat model in de diepte.
Werk met mij samen hieraan
Wil je liever niet zelf een wisselende stoet open-weight-modellen benchmarken, aansluiten en babysitten, dan is dat een flink deel van wat ik doe — teams helpen het juiste model voor elke workload te kiezen (Hy3 incluis), het in een agent-harnas te zetten dat in productie overeind blijft, en de scherpe randjes te vinden voordat zij jou vinden. Is dat het soort hulp dat je nodig hebt, hier kun je me bereiken.