Ein Modell mit 295 Milliarden Parametern hat sich gerade mit Open-Weight-Giganten angelegt, die drei- bis fünfmal so groß sind — und die meisten von ihnen überall geschlagen, außer an einer einzigen Stelle. Das ist der Satz, zu dem ich immer wieder zurückkam, während ich das Tencent-Hy3-Release auseinandergenommen habe, und er stellt die gesamte "größer ist besser"-Annahme infrage, auf der das Open-Weight-Rennen läuft, seit DeepSeek V4 Pro mit seinen 1,6 Billionen Parametern erschienen ist.
Hier ist die Zahl, auf die es ankommt. Hy3 aktiviert pro Token nur 21 Milliarden dieser 295 Milliarden Parameter. GLM 5.2 — das Modell, das die meisten Leute, denen ich folge, derzeit als Open-Source-Obergrenze betrachten — bringt insgesamt rund 744B mit und verbrennt etwa 40B aktive Parameter pro Token. Tencent ist also mit einem Modell in die Arena der Coding-Modelle marschiert, das weniger als halb so groß ist und ungefähr die Hälfte des Per-Token-Computes des amtierenden Champions benötigt, und das ehrliche Urteil der Benchmarks lautet: Es verliert die Coding-Krone um ein paar Punkte und gewinnt fast alles andere. Die Schlagzeile von VentureBeat hat es klarer formuliert, als ich es könnte — Hy3 "tritt gegen GLM-5.2 mit halber Größe an und gewinnt überall außer beim Coding."
Dieser Tencent-Hy3-Test ist mein Versuch, die einzige Frage zu beantworten, die zählt, wenn man selbst baut: Sollte man dieses Ding wirklich in den Werkzeugkasten aufnehmen, bevor das Gratis-Fenster am 21. Juli schließt — und wenn ja, wofür? Denn die Leaderboard-Story und die Nutz-es-an-einem-Dienstag-Story sind zwei sehr verschiedene Dinge, und die meisten Berichte, die ich diese Woche gelesen habe, erzählten nur die erste.
Was ich verifiziert habe — und was ich aus zweiter Hand weitergebe
Bevor es zum spannenden Teil geht, eine Zeile dazu, wie dieser Artikel zu lesen ist, denn das verändert, wie viel Gewicht man jeder Aussage geben sollte.
Die harten Fakten habe ich gegen Primärquellen geprüft. Die 295B/21B-Architektur und die Apache-2.0-Lizenz stammen aus Tencents tencent/Hy3-Model-Card; das Gratis-Fenster und die Preise nach der Promo aus dem OpenRouter-Listing; die Benchmark-Zahlen aus Tencents eigenen Tabellen und den Drittanbieter-Berichten, die ich unterwegs zitiere. Diese Punkte nenne ich ohne Umschweife — mit dem Hinweis, dass Tencents Benchmarks selbst gemeldet sind und eine breite unabhängige Replikation noch aussteht.
Die praktischen Build-Tests sind eine andere Baustelle. Der browserbasierte macOS-Klon, die Physik-Demos, die 3D-Stadt — ich fasse hier eine dokumentierte Testreihe zusammen und analysiere sie, die nach dem Launch kursierte; ich behaupte nicht, dass ich persönlich jeden Prompt selbst eingetippt habe. Wo eine Zahl providerabhängig ist oder aus diesem Walkthrough statt aus einer Primärtabelle stammt, schreibe ich "berichtet", statt sie als gesicherte Tatsache zu verkleiden. Nehmt mich bei dieser Unterscheidung beim Wort; sie ist der ganze Grund, einem Modell-Review mehr zu vertrauen als einem anderen.
Das Modell selbst ist real, keine Vaporware. Tencent hat Hy3 am 6. Juli 2026 als Open Source veröffentlicht — der Produktionsnachfolger der Hy3-Preview, die im April auftauchte. Die Gewichte liegen unter Tencent-Hunyuan/Hy3 auf GitHub und tencent/Hy3 auf Hugging Face (mit einem Hy3-FP8-Build daneben), das Modell ist jetzt gerade auf OpenRouter verfügbar, und es steht unter Apache-2.0. Das ist kein geleakter Benchmark-Screenshot — es ist ein ausgeliefertes, herunterladbares Modell, das man heute per API-Call ansprechen kann.
Hy3s Architektur — und der MoE-Trick, der es günstig macht
Bringen wir den Spec-Dump hinter uns, denn diese Zahlen habt ihr vermutlich schon in einem Dutzend News-Posts verstreut gesehen, von denen die Hälfte das Labor "Tenset" oder ähnlich verstümmelt genannt hat. Es ist Tencent — der chinesische Riese hinter WeChat — und Hy3 ist das neueste Mitglied ihrer Hunyuan-Modellfamilie.
Hier ist die Architektur, verifiziert gegen Tencents eigene Model-Card:
- 295 Milliarden Gesamtparameter, mit 21 Milliarden aktiven pro Token
- 192 geroutete Experten pro MoE-Layer, plus ein immer aktiver Shared Expert, mit Top-8-Routing — das heißt, nur 8 dieser 192 Experten feuern auf ein einzelnes Token
- Ein separater 3,8B-Multi-Token-Prediction-Layer (MTP), mit dem das Modell mehr als ein Token pro Decoding-Schritt vorhersagen kann — ein echter Geschwindigkeitshebel, kein Spec-Sheet-Ornament
- 256K Token Kontextfenster (262.144 Tokens, um genau zu sein)
- Apache-2.0-Lizenz — volle kommerzielle Nutzung, und Tencent hat die geografischen Beschränkungen, die die April-Preview eingeschränkt hatten, ausdrücklich aufgehoben
Diese MoE-Struktur ist der ganze Trick. Wenn Leute "295 Milliarden Parameter" hören, stellen sie sich ein Modell vor, dessen Betrieb 295 Milliarden Parameter an Rechenleistung kostet. Tut er nicht. Der Router weckt für euer konkretes Token nur einen schmalen Ausschnitt auf — 8 Experten, ~21B Parameter — und die anderen 171 Experten schlafen weiter. Ihr bezahlt für den Ausschnitt, nicht für das ganze Gehirn. Deshalb kann ein derart fähiges Modell wie ein viel kleineres bepreist werden, und es ist dieselbe Architektur-Wette, die DeepSeek, GLM, MiniMax und Kimi alle eingegangen sind. Wer die tiefere Mechanik verstehen will, wie Sparse Routing die Inferenzkosten einbrechen lässt: Ich habe das in meinem DeepSeek V4 Pro Test im Detail durchgespielt — die Routing-Story dort lässt sich fast eins zu eins hierher übertragen, nur bei einem Bruchteil der Gesamtgröße.
Tencent hat außerdem etwas eingebaut, das ich mir von mehr Laboren wünsche: konfigurierbaren Reasoning-Aufwand. Hy3 startet standardmäßig in einem schnellen "No-Think"-Modus und bietet dann Low- und High-Reasoning-Modi, die man für die harten Fälle zuschaltet — ein fieses Refactoring, einen mathematischen Beweis, eine mehrstufige Agenten-Kette. Man zahlt keinen Reasoning-Token-Overhead für einen Prompt, der nur eine schnelle Antwort braucht. Anthropic, OpenAI und Google sind alle bei irgendeiner Variante davon gelandet, und das in einem Open-Weight-Modell zu diesem Preis zu sehen, ist ein echter Quality-of-Life-Gewinn.
Die erklärten Designziele sind Reasoning, mehrstufige und agentische Workflows, Coding und — die Formulierung, die Tencent ständig wiederholt — "Real-World Production Deployment". Tencent behauptet außerdem messbare Fortschritte bei der Halluzinationsvermeidung, zuverlässigeres Tool-Calling, hochwertigere Post-Training-Daten und mehr RL-Schritte als in der Vorgängergeneration. Diese letzten vier Punkte sind die Art von Behauptungen, die man aus einem Spec-Sheet nicht verifizieren kann; sie zeigen sich (oder eben nicht) darin, wie sich das Modell bei echter Arbeit verhält. Womit wir bei den Tests wären.
Aber zuerst die Zahl, für die alle diese Artikel wirklich öffnen.
Was kostet der Betrieb von Tencent Hy3?
Nichts. Bis zum 21. Juli 2026 läuft Hy3 für 0 $ über OpenRouters tencent/hy3:free-Route, und Nous Research hat innerhalb weniger Stunden nach dem Launch kostenlosen Zugang in seinem Portal freigeschaltet. Das ist die kurze, snippet-taugliche Antwort.
Nach Ende des Promo-Fensters bleibt es billig — und hier möchte ich eine Zahl korrigieren, die ich im Netz mehrfach gesehen habe. Einige frühe Berichte nannten einen höheren Einzelpreis, aber das OpenRouter-Listing selbst bepreist Hy3 mit rund 0,14 $ pro Million Input-Tokens und 0,58 $ pro Million Output-Tokens, wobei die verschiedenen Inferenz-Provider auf dem Marktplatz beim Input bis auf etwa 0,20 $ hochgehen. OpenRouter ist ein Marktplatz: Die exakte Zahl, die ihr zahlt, hängt davon ab, welcher Provider eure Anfrage bedient und welchen Routing-Modus ihr wählt. Aber jede Route, die ich tatsächlich prüfen konnte, lag in derselben günstigen Nachbarschaft — behandelt 0,14 $/0,58 $ also als den gängigen Kurs, und ihr liegt nicht weit daneben.
Stellt man das gegen die aktuelle Rate von Claude Opus 4.8 — 5 $ pro Million Input, 25 $ pro Million Output — ist der Abstand frappierend. Hy3s Output-Tokens landen irgendwo bei rund 40x günstiger als Opus. Die Qualitätslücke ganz oben ist real, und ich werde nicht so tun, als gäbe es sie nicht. Aber "40x billiger und den Großteil des Weges genauso gut" verändert die Rechnung für viele Workloads — besonders für die hochvolumigen mit geringem Risiko, bei denen man ohnehin nie Frontier-Preise gezahlt hätte.
Es gibt auch einen Gratis-Weg außerhalb von OpenRouter — Hy3 war über das Nous-Benchmark-Portal mit kostenlosen Accounts ausprobierbar, ein reibungsarmer Weg, das Modell zu testen, bevor man einen API-Key anschließt. Wer ohnehin schon Modelle über OpenRouter betreibt: Mein Guide zum Betrieb kostenloser Modelle in Claude Code via OpenRouter beschreibt exakt dieses Setup — Hy3 fügt sich in denselben Workflow ein, solange das Gratis-Fenster offen ist.
Nun: Rechtfertigt die Performance die Aufregung? Teilweise. Lasst mich euch die ehrliche Aufteilung zeigen.
Die Benchmarks: wo Hy3 gewinnt — und die eine Stelle, wo nicht
Ich will hier vorsichtig sein, denn Benchmark-Tabellen sind genau der Ort, an dem sich solche Launches selbst überverkaufen. Also trenne ich, was Tencent und Dritte berichtet haben, und markiere den einen Vergleich, der tatsächlich entscheidet, ob dieses Modell in euren Coding-Stack gehört. Vorab ein pauschaler Vorbehalt: Alles Folgende ist von Tencent gemeldet oder aus früher Drittberichterstattung, und die unabhängige Replikation hinkt noch hinterher.
Bei Wissenschaft und Reasoning ist Hy3 wirklich stark. Es meldet 90,4 auf GPQA Diamond und 72,0 auf USAMO 2026, dazu IMOAnswerBench mit 90,0 und HLE-with-tools mit 53,2. Gigazines Bericht verwies auf Tencents Behauptung, Hy3 sei in seiner Größenklasse mit GLM-5.2 und DeepSeek-V4 vergleichbar und übertreffe GPT-5.5 bei wissenschaftlichen Aufgaben. In einer berichteten Blind-Evaluation mit 270 menschlichen Experten erzielte Hy3 2,67 von 4 Punkten und lag damit knapp vor GLM-5.1 mit 2,51. Für ein Modell, das halb so groß ist wie der Open-Weight-Spitzenreiter, sind das keine bescheidenen Zahlen.
Bei agentischer Suche liegt es vor seiner gesamten Gewichtsklasse. Berichtete Zahlen sehen Hy3 bei 84,2 auf BrowseComp und 91,0 auf DeepSearchQA — vor jedem anderen offenen Modell in Tencents eigener Tabelle und konkurrenzfähig mit Claude Opus 4.8 und GPT-5.5. Wenn euer Workload aus Research-Agenten, tool-lastigem Browsing oder Retrieval über lange Horizonte besteht, ist das der Teil der Geschichte, bei dem ihr aufhorchen solltet.
Und dann ist da das Coding — die eine Stelle, an der es verliert. Hier der direkte Vergleich mit GLM 5.2, das die meisten als Open-Source-Coding-SOTA betrachten:
| Benchmark | Hy3 (berichtet) | GLM 5.2 (berichtet) |
|---|---|---|
| SWE-bench Verified | 78,0 | 84,2 |
| SWE-bench Multilingual | 75,8 | 83,0 |
| Terminal-Bench 2.1 | 71,7 | 81,0 |
| DeepSWE | 28,0 | 46,2 |
GLM 5.2 gewinnt die Coding-Suite, klar, und speziell bei DeepSWE mit großem Abstand. Das Quellvideo, das ich analysiert habe, zeichnete ein etwas rosigeres Bild — Hy3 knapp vor DeepSeek V4 Pro auf einer "Swaybench Pro"-Metrik mit 57,9 zu 55,4 und nahezu Gleichstand bei Multilingual mit 75,8 zu 76,2. Ich lese "Swaybench" als verhörtes SWE-bench, und ich würde diese konkreten Kopf-an-Kopf-Zahlen gegen DeepSeek als aus-der-Quelle-berichtet behandeln, nicht als unabhängig bestätigt. Was ich mit den Primärtabellen abgleichen kann, ist die Grundform: Hy3 hält beim Coding respektabel mit DeepSeek V4 mit und liegt hinter GLM 5.2. Die 75,8 bei Multilingual taucht sowohl im Video als auch in den veröffentlichten Daten auf, dieser Anker hält also zumindest.
Hier ist der Perspektivwechsel, mit dem es bei mir klick gemacht hat. Dass Hy3 beim Coding hinter GLM 5.2 liegt, es aber bei Reasoning, Wissenschaft und agentischer Suche anführt — bei 40 % der Parameterzahl — ist keine Niederlage. Es ist ein Modell, das eine andere Wette eingeht. GLM 5.2 ist der reine Coding-Spezialist. Hy3 ist der effiziente Generalist, der zufällig auch sehr gut in Code ist. Ob dieser Tausch für euch der richtige ist, hängt ganz davon ab, was ihr baut. Wer die vollständige Analyse will, wie sich GLM 5.2 gegen die Frontier schlägt: Ich habe es in meinem GLM 5.2 vs Qwen 3.7 Max vs Claude Opus 4.8 Test durch fünf One-Shot-Builds gejagt — lesenswert neben diesem Artikel, wenn Coding euer primärer Anwendungsfall ist.
Aber Benchmarks sind die Landkarte, nicht das Gelände. Das Gelände ist das, was passiert, wenn man ein Modell auf einen echten Build ansetzt und Enter drückt.
Die echte Stärke, mit der niemand aufmacht: Frontend und SVG
Hier wurde die berichtete Testreihe wirklich interessant, und hier hat meiner Meinung nach die meiste Launch-Berichterstattung die eigentliche Nachricht vergraben. Hy3s Aushängeschild ist nicht sein GPQA-Score. Es ist Frontend-Scaffolding.
Über die dokumentierten Tests hinweg produzierte Hy3 Frontend-UI, die gut strukturiert und visuell ansprechend war — auf eine Art, die für Open-Weight-Modelle noch immer ungewöhnlich ist. Nicht "funktional, aber hässlich", was das übliche Open-Weight-Frontend-Ergebnis ist. Wirklich schön — es griff zu echten Animations-Paketen, scroll-getriggerten Interaktionen, Hintergrundeffekten, eigenen Cursor-Designs, durchdachter Typografie. Die Art von Politur, zu der man ein Modell normalerweise drei- oder viermal prompten muss und die man oft an Claude oder ein Frontier-Modell abgeben muss, damit sie sitzt.
Das ist wichtig, weil im Frontend ein großer Teil der täglichen Mühsal des Auslieferns tatsächlich stattfindet — und weil es historisch der Ort ist, an dem sich Open-Weight-Modelle blamieren. Ein Modell, das eine wirklich gut aussehende Landingpage oder Komponentenbibliothek in einem Schuss aufsetzen kann, erspart einem den mühsamsten Teil des Builds. Auf dieser Achse stellen die berichteten Tests Hy3 als Frontend-Scaffolding-Werkzeug in dieselbe Liga wie GLM 5.2 — was angesichts der Größen- und Kostendifferenz eine ernstzunehmende Aussage ist.
Der macOS-Klon. Die Flaggschiff-Demo war ein browserbasierter macOS-Klon mit nativ wirkenden Apps — Finder, Safari, Terminal, Notes, Settings, App Store, Maps — animierten SVG-Icons und sogar einem eingebetteten 3D-FPS-Minispiel. Die ehrliche Lesart: Schießen und Bewegung funktionierten, die Steuerung war hakelig, einige der oberen und unteren Systemleisten waren nicht vollständig verdrahtet, und das Settings-Panel konnte Wallpaper und Dock-Position zwar visuell ändern, hat die Änderung aber nicht wirklich gespeichert. Also — beeindruckendes Scaffolding, unvollkommene Ausführung. Es ist eine "Schaut, was ein einziger Prompt produziert hat"-Demo, kein auslieferbares Produkt. Aber als Stresstest dafür, wie viel kohärente Struktur das Modell über ein ganzes künstliches Betriebssystem hinweg im Kopf behalten kann, ist es eine starke Vorstellung.
Bei SVG glänzt es still und leise. In den dokumentierten Tests generierte Hy3 eine realistische Gemälde-Szene mit Glühwürmchen und atmosphärischer Tiefe sowie ein animiertes, symmetrisches Schmetterlings-SVG mit sauberen Verläufen — eine Animation, nach der der Prompt nicht einmal explizit gefragt hatte. Saubere SVG-Code-Generierung mit geschmackvoller Animation ist eine spezifische, schwer vorzutäuschende Fähigkeit, und sie ist einer der verlässlicheren roten Fäden der gesamten Testreihe. Wer viele Icons, Illustrationen oder leichte Bewegungsgrafiken erzeugt, hat hier einen echten Grund, das Modell zu testen.
Wer Open-Weight-Modelle genau für diese Art von Frontend- und designlastiger Arbeit evaluiert, sollte Hy3 neben die anderen aktuellen Kandidaten stellen — ich habe einen First Look auf MiniMax M3 als Open-Weight-Modell geschrieben, der für denselben Job ein nützlicher Vergleichspunkt ist.
Die 3D- und Spiele-Tests: schnell, sauber, nicht ganz Frontier
Die berichtete Testreihe ging weiter in Richtung 3D und Simulation, und hier kommt das ehrliche Bild von Hy3s Obergrenze in den Fokus. Es ist schnell und sauber. Es ist bei der reinen Generierungsqualität nicht Spitzenklasse. Beides stimmt.
Die 3D-Visualisierer hielten sich gut. Ein HTML-Visualisierer mit rotierender Erde wurde gegen Opus 4.8 und Fable 5 verglichen. Fable 5 war am fotorealistischsten — keine Überraschung, das ist dessen Kernkompetenz — aber Hy3 sah Berichten zufolge optisch besser aus als Opus 4.8, was kein Satz ist, den ich über ein so günstiges Modell zu tippen erwartet hätte. Ein 3D-Sonnensystem-Explorer lieferte ein echtes Sternenfeld, glaubwürdige Planetenschattierung und Schatten, eine funktionierende Kamera und erkennbare Planeten — Neptun, Jupiter, Saturn allesamt identifizierbar. Der Fokus auf einen Planeten brauchte mehrere Klicks, um auszulösen, die Interaktion war also holprig, aber das Rendering selbst war solide.
Die Physik-Demos sind die Effizienz-Story im Miniaturformat. In einem Vergleich über drei HTML5-Canvas-Physik-Demos — Bowling, Airhockey und ein Pool-Break — trat Hy3 gegen Gemini 3.5 Flash, GLM 5.2 und DeepSeek V4 an. Das berichtete Ergebnis: Hy3 verbrauchte rund 30k Tokens für den Bruchteil eines Cents und erreichte die Qualität von Gemini 3.5 zu einem kleinen Bruchteil der Kosten. Gemini erreichte ähnliche Qualität mit ~23k Tokens, aber deutlich teurer; GLM 5.2 (~25k Tokens) produzierte die stärkste reine Logik und den stärksten Code; DeepSeek V4 verbrauchte ~50k Tokens und schnitt von den vieren am schwächsten ab. Hy3s Kollisionen waren sauber, Spin und Impuls glaubwürdig, die Simulation poliert. Diese Zeile "vergleichbare Qualität für einen Splitter der Kosten" ist das gesamte Wertversprechen, komprimiert in einen einzigen Test.
Bei den schweren 3D-Aufgaben zeigte sich die Obergrenze. Eine letzte Runde ließ Hy3 gegen Fable 5, Opus 4.8 und Sonnet 5 auf drei anspruchsvollen Builds antreten: eine Meereswelle, die eine Sandburg zerfallen lässt, ein Fabrik-Fließband und eine interaktive 3D-Stadt auf einem modernen Three.js-Setup. Hy3 wurde Berichten zufolge als Schnellstes fertig, mit sauberem, poliertem Output — Fable 5 war am fotorealistischsten, Sonnet 5 hochwertig, aber langsamer, und Opus 4.8 kam als Letztes ins Ziel und war, bemerkenswerterweise, optisch weniger ansprechend als Hy3. Aber die Geschwindigkeit kam mit Kompromissen: Hy3 verwendete approximierte Physik statt einer vollständigen Simulation, die Fabriklogik hatte kleinere Bugs, und die 3D-Stadt sah überzeugend aus, war aber nicht stark optimiert. Konkurrenzfähig bei Geschwindigkeit und Effizienz; einen Schritt hinter der Spitze bei der reinen Qualität.
Das ist die ehrliche Form des Ganzen. Hy3 bringt euch den Großteil des Weges, schneller und billiger als fast alles andere, und bittet euch dann, das letzte Stück selbst zu schließen. Für eine riesige Zahl echter Workloads ist das ein fantastischer Tausch.
Wenn ihr diese Evaluation und das Setup lieber nicht selbst zusammenstöpseln wollt — das richtige Open-Weight-Modell für einen gegebenen Workload auswählen, es in einen Agenten-Harness verdrahten und wissen, wo jedes einzelne bricht — müsst ihr das nicht. Genau diese Art von KI-Build- und Integrationsarbeit mache ich regelmäßig mit Kunden.
Klartext: die Grenzen — und für wen das hier wirklich ist
Jeder Modell-Test, der die Einschränkungen auslässt, ist Marketing. Hier ist, wo ich beim Hype gegenhalten würde.
Das 256K-Kontextfenster ist die echte Einschränkung. In einer Welt, in der GLM 5.2 und DeepSeek V4 mit einer Million Tokens werben, ist 256K für bestimmte Jobs wirklich limitierend. Wer einem Modell eine ganze große Codebasis, ein buchlanges Dokument oder eine weitläufige Multi-File-Agentenaufgabe füttert, stößt bei Hy3 schneller an die Decke als bei seinen größeren Rivalen. Für das meiste alltägliche Prompting — ein Feature, eine Komponente, ein begrenztes Refactoring, eine Recherche-Aufgabe — reichen 256K locker. Aber kennt euren Workload. Wenn Long-Context euer Flaschenhals ist, ist das nicht euer Modell, und keine Kostenersparnis der Welt ändert daran etwas.
Coding ist eine reale, gemessene Schwäche gegenüber GLM 5.2. Ich habe es bei den Benchmarks gesagt und sage es hier noch einmal deutlich: Wenn eure einzige höchste Priorität rohes agentisches Coding ist und ihr die beste Open-Weight-Option wollt, gewinnt GLM 5.2 diesen spezifischen Kampf weiterhin. Hy3 ist konkurrenzfähig — es liefert sich beim Code einen Schlagabtausch mit DeepSeek V4 — aber "konkurrenzfähig" ist nicht "am besten". Wählt Hy3 fürs Coding, wenn euch Kostenersparnis und Geschwindigkeit wichtiger sind als die letzten paar Punkte Korrektheit. Wählt GLM 5.2, wenn Korrektheit alles ist.
Die Demos sind Demos. Der macOS-Klon, die Spiele, die 3D-Stadt — sie sind Scaffolding-Schaufenster, und jede einzelne hatte raue Kanten, sobald man wirklich daran herumstocherte. Steuerungen, die halb funktionierten, Einstellungen, die nicht gespeichert wurden, Physik, die approximiert war. Das ist normal für One-Shot-Generierung und kein Kritikpunkt, der nur Hy3 trifft. Verwechselt nur keinen beeindruckenden Screenshot mit einem fertigen Produkt. Ihr werdet nacharbeiten müssen.
Für wen ist Hy3 also wirklich? Wenn ich die Empfehlung auf einen Post-it schreiben müsste: Es ist für Frontend- und designlastige Arbeit, agentische Suche, Reasoning- und Wissenschaftsaufgaben sowie hochvolumige Workloads, bei denen Kosten und Geschwindigkeit wichtiger sind als die letzten paar Punkte Coding-Genauigkeit. Es ist ein hervorragendes Zweitmodell in einem Multi-Modell-Setup — der billige, schnelle Generalist, an den ihr den Großteil der Arbeit routet, während ihr ein Frontier-Modell für die Jobs in Bereitschaft haltet, die es wirklich brauchen. Modelle genau auf diese hybride Art zu betreiben, habe ich schon einmal aufgeschrieben, in meinem hybriden AI-Coding-Workflow mit DeepSeek V4 und Claude Code — Hy3 fügt sich in dasselbe Muster als kostengünstiges Arbeitspferd ein.
Was ihr realistisch erwarten solltet, wenn ihr es testet
Lasst mich realistische Erwartungen setzen, denn ich möchte lieber, dass ihr kalibriert hineingeht statt enttäuscht heraus.
Setzt Hy3 auf ein Frontend-Scaffold, eine SVG-Illustration, eine Landingpage, eine reasoning-lastige oder Recherche-Aufgabe oder eine mittelkomplexe 3D- oder Physik-Demo an, und ihr solltet Output erwarten, der sauber, schnell und wirklich gut aussieht — oft im ersten Anlauf, gelegentlich mit einem Schubs. Erwartet Kosten, die so niedrig sind, dass sie in euren Entscheidungen keine Rolle mehr spielen. Erwartet eine Geschwindigkeit, die die meisten Frontier-Modelle glatt schlägt.
Setzt es auf eine riesige Codebasis, ein subtiles agentisches Multi-File-Refactoring oder eine Aufgabe an, bei der Korrektheit perfekt sein muss, und erwartet, entweder an die 256K-Decke zu stoßen oder euch zu wünschen, ihr hättet GLM 5.2 oder ein Frontier-Modell genommen. Erwartet, dass die Demos, die ihr baut, Nacharbeit brauchen, bevor sie außer euch jemand anfasst.
Das Muster über alles hinweg, was ich mir angesehen habe, ist konsistent: Hy3 schlägt dramatisch über seiner Parameterklasse, liefert brauchbaren Code und verlässliches Reasoning und zeigt seine Größe erst am obersten Ende der Schwierigkeit. Für ein 295B-Modell, das wie ein Spielzeug bepreist ist, ist das nicht nur beeindruckend — es ist ein Signal, wohin das Open-Weight-Rennen steuert. Tencent hat nicht das größte Modell ausgeliefert. Sie haben eines der effizientesten ausgeliefert, und Effizienz ist die Achse, die tatsächlich euren Geldbeutel erreicht.
Das Fenster schließt am 21. Juli
Zurück zu diesem Eröffnungssatz — ein Modell, weniger als halb so groß wie der Open-Weight-Spitzenreiter, das fast überall gewinnt, außer beim Coding. Vor einem Monat hätte sich das wie eine Pressemitteilungs-Fantasie gelesen. Diese Woche ist es eine herunterladbare, Apache-2.0-lizenzierte, kostenlos testbare Realität mit den Benchmarks und den Repos, die das meiste davon stützen.
Die eine konkrete Sache, die ich in den nächsten Tagen tun würde: Hy3 hochfahren, solange es kostenlos ist — über OpenRouters Free-Route oder das Nous-Portal — und eure tatsächliche Arbeit darauf werfen. Nicht die Demos. Euer echtes Frontend-Scaffold, euren echten Research-Agenten, euren echten SVG-Batch. Zwanzig Minuten Tests auf Aufgaben, die ihr bereits versteht, verraten euch mehr als jede Benchmark-Tabelle in diesem Beitrag, meine eingeschlossen. Der Promotions-Gratiszeitraum endet am 21. Juli, und danach zahlt ihr — immer noch fast nichts, aber ihr zahlt.
Denn die gesamte Open-Weight-Welle beweist immer wieder dasselbe, ein Release nach dem anderen: Das Modell, das euren Workflow verändert, ist meist nicht das größte oder das höchste auf einem Leaderboard. Es ist das, das gut genug, schnell genug und billig genug ist, dass ihr aufhört, über die Kosten nachzudenken, und einfach baut. Hy3 hat eine echte Chance, dieses Modell für euch zu sein. Ihr habt rund zwei Wochen, um das kostenlos herauszufinden.
Häufig gestellte Fragen
Was ist Tencent Hy3?
Tencent Hy3 ist ein Open-Weight-Mixture-of-Experts-KI-Modell mit 295 Milliarden Parametern, veröffentlicht am 6. Juli 2026 unter der Apache-2.0-Lizenz. Es aktiviert 21B Parameter pro Token über 192 Experten mit Top-8-Routing, unterstützt ein 256K-Kontextfenster und zielt auf Reasoning-, Agenten- und Coding-Workloads. Die vollständige Spec-Aufschlüsselung findet ihr oben.
Ist Tencent Hy3 kostenlos nutzbar?
Tencent Hy3 ist bis zum 21. Juli 2026 kostenlos — über OpenRouters tencent/hy3:free-Route und das Nous-Research-Portal. Nach Ende der Promo liegt das OpenRouter-Listing bei rund 0,14 $ pro Million Input-Tokens und 0,58 $ pro Million Output-Tokens, wobei einige Provider auf dem Marktplatz beim Input bis zu etwa 0,20 $ verlangen.
Ist Hy3 besser als GLM 5.2?
Das hängt von der Aufgabe ab. Auf den berichteten Benchmarks gewinnt GLM 5.2 beim Coding — SWE-bench Verified 84,2 gegenüber Hy3s 78,0 — aber Hy3 führt bei Reasoning, Wissenschaft und agentischer Suche, mit weniger als der Hälfte der Parameter. Für reines Coding ist GLM 5.2 stärker; für effiziente Allround-Nutzung hält Hy3 kräftig mit. Siehe die Benchmark-Tabelle oben.
Worin ist Tencent Hy3 am besten?
Hy3s stärkste berichtete Anwendungsfälle sind Frontend-Scaffolding, SVG-Generierung und -Animation, agentische Suche sowie Reasoning- oder Wissenschaftsaufgaben — plus mittelkomplexe 3D- und Physik-Demos, bei denen es Berichten zufolge teurere Modelle zu einem kleinen Bruchteil der Kosten erreichte. Am schwächsten ist es bei sehr langem Kontext und Spitzen-Coding auf Agentenniveau.
Wie groß ist Hy3 im Vergleich zu DeepSeek V4 Pro?
Hy3 ist deutlich kleiner — 295B Gesamtparameter gegenüber den 1,6 Billionen von DeepSeek V4 Pro. Auf Coding-Benchmarks liefern sich die beiden trotz dieser Größendifferenz einen Schlagabtausch, was ein großer Teil des Grundes ist, warum Hy3s Parametereffizienz so viel Aufmerksamkeit bekam. Mein vollständiger DeepSeek V4 Pro Test behandelt dieses Modell in der Tiefe.
Arbeitet mit mir daran
Wenn ihr eine rotierende Riege von Open-Weight-Modellen lieber nicht selbst benchmarken, verdrahten und babysitten wollt: Genau das ist ein Teil dessen, was ich mache — Teams dabei helfen, für jeden Workload das richtige Modell auszuwählen (Hy3 eingeschlossen), es in einen Agenten-Harness einzubauen, der in Produktion standhält, und die scharfen Kanten zu finden, bevor sie euch finden. Wenn ihr diese Art von Unterstützung braucht, hier erreicht ihr mich.