Um modelo de 295 mil milhões de parâmetros acabou de medir forças com gigantes open-weight três a cinco vezes maiores — e venceu a maioria deles em todo o lado, exceto num único ponto. Foi a esta frase que voltei vezes sem conta enquanto desmontava o lançamento do Tencent Hy3, e ela reformula por completo a premissa de que "maior é melhor", sobre a qual a corrida dos modelos open-weight tem assentado desde que o DeepSeek V4 Pro chegou com os seus 1,6 biliões de parâmetros.
Eis o número que interessa. O Hy3 ativa apenas 21 mil milhões desses 295 mil milhões de parâmetros em cada token. O GLM 5.2 — o modelo que a maioria das pessoas que sigo trata atualmente como o teto do open source — carrega cerca de 744B no total e consome à volta de 40B ativos por token. Ou seja, a Tencent entrou na arena dos modelos de programação com um modelo com menos de metade do tamanho e sensivelmente metade do custo computacional por token do campeão em título, e o veredicto honesto dos benchmarks é este: perde a coroa da programação por poucos pontos e ganha em praticamente tudo o resto. O título da VentureBeat resumiu-o melhor do que eu conseguiria — o Hy3 "enfrenta o GLM-5.2 com metade do tamanho e vence em todo o lado exceto na programação."
Esta análise do Tencent Hy3 é a minha tentativa de responder à única pergunta que interessa se és alguém que constrói coisas: vale mesmo a pena pôr isto na tua caixa de ferramentas antes de a janela gratuita fechar a 21 de julho e, em caso afirmativo, para quê? Porque a história das tabelas classificativas e a história do usar-numa-terça-feira-qualquer são duas coisas muito diferentes, e a maior parte da cobertura que li esta semana só contou a primeira.
O que verifiquei e o que estou a relatar em segunda mão
Antes da parte divertida, uma linha sobre como ler este artigo, porque muda o peso a dar a cada afirmação.
Os factos concretos, confirmei-os junto de fontes primárias. A arquitetura 295B/21B e a licença Apache-2.0 retirei-as da model card tencent/Hy3 da Tencent; a janela gratuita e os preços pós-promoção, da listagem no OpenRouter; os números de benchmark, das tabelas da própria Tencent e das análises de terceiros que vou citando pelo caminho. Esses, afirmo-os sem rodeios — assinalando, ainda assim, que os benchmarks da Tencent são autorreportados e continuam à espera de uma replicação independente alargada.
Os testes práticos de construção são outra história. O clone do macOS no browser, as demos de física, a cidade 3D — estou a resumir e a analisar uma bateria de testes documentada que circulou após o lançamento, não a afirmar que fui eu que estive pessoalmente a escrever cada prompt. Sempre que um valor depender do fornecedor ou vier desse passo a passo em vez de uma tabela primária, direi "reportado" em vez de o vestir como facto assente. Cobra-me essa distinção; é toda a razão para confiar mais numa análise de um modelo do que noutra.
O modelo em si é real, não é vaporware. A Tencent tornou o Hy3 open source a 6 de julho de 2026 — o sucessor de produção do preview do Hy3 que tinha lançado em abril. Os pesos vivem em Tencent-Hunyuan/Hy3 no GitHub e em tencent/Hy3 no Hugging Face (com uma build Hy3-FP8 ao lado), está neste momento no OpenRouter e tem licença Apache-2.0. Isto não é uma captura de ecrã de um benchmark que alguém deixou fugir — é um modelo publicado e descarregável, a que podes chamar via API hoje mesmo.
A arquitetura do Hy3 e o truque MoE que o torna barato
Deixa-me despachar a lista de especificações, porque provavelmente já viste estes números espalhados por uma dúzia de artigos noticiosos, metade dos quais chamou ao laboratório "Tenset" ou algo igualmente trocado. É a Tencent — o gigante chinês por trás do WeChat — e o Hy3 é o mais recente membro da família de modelos Hunyuan.
Eis a arquitetura, verificada contra a model card da própria Tencent:
- 295 mil milhões de parâmetros totais, com 21 mil milhões ativos por token
- 192 experts encaminhados por camada MoE, mais um expert partilhado sempre ativo, com routing top-8 — o que significa que apenas 8 desses 192 experts disparam em cada token
- Uma camada separada de multi-token-prediction (MTP) de 3,8B que permite ao modelo prever mais do que um token por passo de descodificação — uma alavanca de velocidade real, não um enfeite de ficha técnica
- Janela de contexto de 256K tokens (262 144 tokens, para ser exato)
- Licença Apache 2.0 — uso comercial pleno, e a Tencent levantou explicitamente as restrições geográficas que tinham limitado o preview de abril
Essa estrutura MoE é todo o truque. Quando as pessoas ouvem "295 mil milhões de parâmetros", imaginam um modelo que custa 295 mil milhões de parâmetros de computação para correr. Não custa. O router acorda apenas uma fatia estreita — 8 experts, ~21B parâmetros — para o teu token específico, e os outros 171 experts continuam a dormir. Pagas a fatia, não o cérebro inteiro. É por isso que um modelo com esta capacidade pode ter o preço de um muito mais pequeno, e é a mesma aposta arquitetural que a DeepSeek, a GLM, a MiniMax e a Kimi têm todas feito. Se quiseres a mecânica mais profunda de como o routing esparso faz colapsar o custo de inferência, expliquei-a em detalhe na minha análise do DeepSeek V4 Pro — a história do routing aplica-se aqui quase um-para-um, só que a uma fração do tamanho total.
A Tencent também incluiu algo que gostava que mais laboratórios lançassem: esforço de raciocínio configurável. O Hy3 arranca por omissão num modo rápido "no-think", e depois oferece modos de raciocínio baixo e alto que ativas para os problemas difíceis — um refactor complicado, uma demonstração matemática, uma cadeia agêntica de vários passos. Não estás a pagar o custo extra de tokens de raciocínio num prompt que só precisa de uma resposta rápida. A Anthropic, a OpenAI e a Google convergiram todas para alguma versão disto, e vê-lo num modelo open-weight a este preço é uma verdadeira melhoria de qualidade de vida.
Os objetivos de design declarados são raciocínio, fluxos de trabalho multi-passo e agênticos, programação e — a expressão que a Tencent não se cansa de repetir — "implementação em produção no mundo real." A Tencent afirma ainda ganhos mensuráveis em anti-alucinação, tool-calling mais fiável, dados de pós-treino de maior qualidade e mais passos de RL do que a geração anterior. Estas últimas quatro são o tipo de afirmações que não se verificam numa ficha técnica; aparecem (ou não) na forma como o modelo se comporta em trabalho real. E é aí que entram os testes.
Mas primeiro, o número pelo qual toda a gente abre estes artigos.
Quanto custa correr o Tencent Hy3?
Nada. Até 21 de julho de 2026, o Hy3 corre a 0 $ na rota tencent/hy3:free do OpenRouter, e a Nous Research abriu acesso gratuito no seu portal poucas horas após o lançamento. Esta é a resposta curta, pronta a citar.
Depois de a janela promocional fechar, continua barato — e é aqui que quero corrigir um número que vi repetido pela web. Alguma cobertura inicial avançou uma cotação avulsa mais alta, mas a própria listagem do OpenRouter põe o Hy3 a cerca de 0,14 $ por milhão de tokens de entrada e 0,58 $ por milhão de tokens de saída, com os diferentes fornecedores de inferência do marketplace a chegarem até cerca de 0,20 $ na entrada. O OpenRouter é um marketplace: o valor exato que pagas depende do fornecedor que serve o teu pedido e do modo de routing que escolhes. Mas todas as rotas que consegui efetivamente verificar ficaram nessa mesma vizinhança barata, por isso trata 0,14 $/0,58 $ como a tarifa corrente e não andarás longe.
Compara isso com a tarifa atual do Claude Opus 4.8 — 5 $ por milhão na entrada, 25 $ por milhão na saída — e a diferença é gritante. Os tokens de saída do Hy3 saem qualquer coisa como 40x mais baratos do que os do Opus. A diferença de qualidade no topo absoluto é real e não vou fingir o contrário. Mas "40x mais barato e quase tão bom" muda as contas para muitos workloads, sobretudo os de alto volume e baixo risco, em que nunca ias pagar preços de fronteira de qualquer forma.
Há também um caminho gratuito fora do OpenRouter — o Hy3 tem estado disponível para experimentar através do portal de benchmarks da Nous em contas gratuitas, uma forma sem fricção de dar umas voltas antes de configurares uma chave de API. Se já corres modelos através do OpenRouter, o meu guia para correr modelos gratuitos no Claude Code via OpenRouter cobre a configuração exata — o Hy3 encaixa nesse mesmo fluxo de trabalho enquanto a janela gratuita estiver aberta.
Agora, será que o desempenho justifica o entusiasmo? Em parte. Deixa-me mostrar-te a divisão honesta.
Os benchmarks: onde o Hy3 ganha, e o único sítio onde não ganha
Quero ser cuidadoso aqui, porque as tabelas de benchmarks são exatamente o sítio onde estes lançamentos se vendem acima do valor. Por isso vou separar o que a Tencent e terceiros reportaram, e vou assinalar a única comparação que decide de facto se este modelo pertence à tua stack de programação. Primeiro, uma ressalva geral: tudo o que se segue foi reportado pela Tencent ou pela cobertura inicial de terceiros, e a replicação independente ainda está a recuperar terreno.
Em ciência e raciocínio, o Hy3 é genuinamente forte. Reporta 90,4 no GPQA Diamond e 72,0 no USAMO 2026, com 90,0 no IMOAnswerBench e 53,2 no HLE com ferramentas. A cobertura da Gigazine destacou a afirmação da Tencent de que o Hy3 é comparável ao GLM-5.2 e ao DeepSeek-V4 na sua classe de tamanho e ultrapassa o GPT-5.5 em tarefas científicas. Numa avaliação cega reportada com 270 especialistas humanos, o Hy3 obteve 2,67 em 4, batendo por pouco o GLM-5.1, com 2,51. Para um modelo com metade do tamanho do líder open-weight, não são números modestos.
Em pesquisa agêntica, está à frente de toda a sua categoria de peso. Os valores reportados colocam o Hy3 em 84,2 no BrowseComp e 91,0 no DeepSearchQA — à frente de todos os outros modelos abertos na tabela da própria Tencent, e competitivo com o Claude Opus 4.8 e o GPT-5.5. Se o teu workload são agentes de investigação, navegação intensiva em ferramentas ou retrieval de longo horizonte, esta é a parte da história que te deve fazer prestar atenção.
E depois há a programação — o único sítio onde perde. Eis o frente a frente com o GLM 5.2, que a maioria trata como o SOTA open source em programação:
| Benchmark | Hy3 (reportado) | GLM 5.2 (reportado) |
|---|---|---|
| SWE-bench Verified | 78,0 | 84,2 |
| SWE-bench Multilingual | 75,8 | 83,0 |
| Terminal-Bench 2.1 | 71,7 | 81,0 |
| DeepSWE | 28,0 | 46,2 |
O GLM 5.2 ganha a suite de programação, de forma clara, e por larga margem no DeepSWE em particular. O vídeo-fonte que analisei citava um quadro ligeiramente mais cor-de-rosa — o Hy3 a superar o DeepSeek V4 Pro numa métrica "Swaybench Pro" por 57,9 contra 55,4, e quase empate no multilingue, 75,8 contra 76,2. Leio "Swaybench" como SWE-bench mal ouvido, e trataria esses números específicos do frente a frente com o DeepSeek como reportados-pela-fonte e não confirmados de forma independente. O que consigo alinhar com as tabelas primárias é a forma geral: o Hy3 compete respeitavelmente com o DeepSeek V4 em programação e fica atrás do GLM 5.2. Aquele 75,8 no multilingue aparece tanto no vídeo como nos dados publicados, por isso pelo menos essa âncora aguenta.
Eis o reenquadramento que fez isto encaixar para mim. O Hy3 ficar atrás do GLM 5.2 em programação e, ao mesmo tempo, liderar em raciocínio, ciência e pesquisa agêntica — com 40% da contagem de parâmetros — não é uma derrota. É um modelo a fazer uma aposta diferente. O GLM 5.2 é o especialista puro em programação. O Hy3 é o generalista eficiente que, por acaso, também é muito bom a escrever código. Se essa troca te convém depende inteiramente do que estás a construir. Se quiseres a análise completa de como o GLM 5.2 se compara com a fronteira, pu-lo à prova em cinco builds one-shot no meu teste GLM 5.2 vs Qwen 3.7 Max vs Claude Opus 4.8 — vale a pena ler em conjunto com este se a programação for o teu caso de uso principal.
Mas os benchmarks são o mapa, não o território. O território é o que acontece quando apontas um modelo a um build real e carregas em Enter.
A verdadeira força de que ninguém fala primeiro: front-end e SVG
É aqui que a bateria de testes reportada ficou genuinamente interessante, e onde acho que a maior parte da cobertura do lançamento enterrou o essencial. O ponto forte do Hy3 não é a pontuação no GPQA. É o scaffolding de front-end.
Ao longo dos testes documentados, o Hy3 produziu UI de front-end bem estruturada e visualmente apelativa de uma forma que ainda é rara em modelos open-weight. Não "funcional mas feia", que é o resultado habitual de front-end em open-weight. Mesmo bonita — recorreu a pacotes de animação a sério, interações acionadas pelo scroll, efeitos de fundo, cursores personalizados, tipografia pensada. O tipo de polimento que normalmente tens de arrancar a um modelo em três ou quatro tentativas, e que muitas vezes acabas por entregar ao Claude ou a um modelo de fronteira para ficar bem feito.
Isso importa porque o front-end é onde vive grande parte do trabalho quotidiano de pôr coisas em produção, e é historicamente onde os modelos open-weight passam vergonhas. Um modelo capaz de montar de uma só vez uma landing page ou uma biblioteca de componentes com aspeto genuinamente bom poupa-te a parte mais entediante do build. Neste eixo, os testes reportados colocam o Hy3 na mesma conversa que o GLM 5.2 enquanto ferramenta de scaffolding de front-end — o que, dado o fosso de tamanho e custo, é uma afirmação séria.
O clone do macOS. A demo de bandeira foi um clone do macOS no browser, com apps de aspeto nativo — Finder, Safari, Terminal, Notas, Definições, App Store, Mapas — ícones SVG animados e até um mini-jogo FPS 3D embutido lá dentro. A leitura honesta: disparar e mover funcionavam, os controlos eram toscos, algumas das barras de sistema superior e inferior não estavam totalmente ligadas, e o painel de Definições conseguia mudar visualmente o wallpaper e a posição da dock, mas não persistia de facto a alteração. Portanto — scaffolding impressionante, execução imperfeita. É uma demo de "olha o que um único prompt produziu", não um produto pronto a lançar. Mas, como teste de stress de quanta estrutura coerente o modelo consegue manter na cabeça ao longo de um sistema operativo falso inteiro, é uma prestação forte.
O trabalho em SVG é onde brilha discretamente. Nos testes documentados, o Hy3 gerou uma cena pictórica realista com pirilampos e profundidade atmosférica, e um SVG de uma borboleta simétrica e animada com gradientes bem feitos — animação que o prompt nem sequer pedia explicitamente. Gerar código SVG limpo com animação de bom gosto é uma competência específica e difícil de fingir, e é um dos fios condutores mais fiáveis de toda a bateria. Se geras muita iconografia, ilustrações ou movimento ligeiro, esta é uma razão real para testar o modelo.
Se estás a avaliar modelos open-weight precisamente para este tipo de trabalho de front-end e design, vale a pena pôr o Hy3 ao lado dos outros candidatos recentes — fiz uma primeira análise do MiniMax M3 como modelo open-weight que serve de ponto de comparação útil para o mesmo trabalho.
Os testes 3D e de jogos: rápido, limpo, mas não exatamente de fronteira
A bateria reportada foi mais longe em 3D e simulação, e é aqui que o retrato honesto do teto do Hy3 ganha nitidez. É rápido e limpo. Não é de topo em qualidade bruta de geração. As duas coisas são verdade.
Os visualizadores 3D aguentaram-se bem. Um visualizador HTML de uma Terra em rotação foi comparado com o Opus 4.8 e o Fable 5. O Fable 5 saiu o mais fotorrealista — sem surpresa, é a especialidade dele — mas o Hy3, segundo o reportado, superou o Opus 4.8 em apelo visual, o que não é uma frase que eu esperasse escrever sobre um modelo assim tão barato. Um explorador 3D do sistema solar conseguiu um campo de estrelas a sério, sombreamento e sombras credíveis nos planetas, uma câmara funcional e planetas reconhecíveis — Neptuno, Júpiter e Saturno todos identificáveis. O foco num planeta precisava de cliques repetidos para disparar, por isso a interação era rude, mas o rendering em si era sólido.
As demos de física são a história da eficiência em miniatura. Numa comparação com três demos de física em canvas HTML5 — bowling, air hockey e uma tacada de abertura de bilhar — o Hy3 foi posto contra o Gemini 3.5 Flash, o GLM 5.2 e o DeepSeek V4. O resultado reportado: o Hy3 usou cerca de 30 mil tokens por uma fração de cêntimo e igualou a qualidade do Gemini 3.5 por uma pequena fração do custo. O Gemini atingiu qualidade semelhante com ~23 mil tokens, mas muito mais caro; o GLM 5.2 (~25 mil tokens) produziu a lógica e o código puros mais fortes; o DeepSeek V4 usou ~50 mil tokens e saiu o mais fraco dos quatro. As colisões do Hy3 eram limpas, o efeito e o momento credíveis, a simulação polida. Aquela linha do "qualidade comparável por uma nesga do custo" é toda a proposta de valor comprimida num único teste.
Nas tarefas 3D pesadas, o teto apareceu. Uma ronda final pôs o Hy3 contra o Fable 5, o Opus 4.8 e o Sonnet 5 em três builds exigentes: uma onda do mar a desfazer um castelo de areia, uma linha de montagem fabril e uma cidade 3D interativa numa configuração moderna de Three.js. O Hy3, segundo o reportado, terminou mais depressa, com output limpo e polido — o Fable 5 foi o mais fotorrealista, o Sonnet 5 de alta qualidade mas mais lento, e o Opus 4.8 ficou em último e, curiosamente, menos apelativo visualmente do que o Hy3. Mas a velocidade veio com compromissos: o Hy3 usou física aproximada em vez de uma simulação completa, a lógica da fábrica tinha pequenos bugs e a cidade 3D parecia convincente mas não estava muito otimizada. Competitivo em velocidade e eficiência; um degrau abaixo do topo em qualidade bruta.
Este é o contorno honesto da coisa. O Hy3 leva-te a maior parte do caminho, mais depressa e mais barato do que quase tudo o resto, e depois pede-te que feches tu o último troço. Para uma quantidade enorme de workloads reais, é uma troca fantástica.
Se preferires não montar sozinho esta avaliação e configuração — escolher o modelo open-weight certo para cada workload, ligá-lo a um harness de agentes e saber onde cada um se parte — não tens de o fazer. Esse tipo de trabalho de construção e integração de IA é o que faço regularmente com clientes.
Conversa franca: os limites, e para quem isto serve de facto
Toda a análise de um modelo que salta as limitações é marketing. Eis onde eu travaria o entusiasmo.
A janela de contexto de 256K é a verdadeira restrição. Num mundo em que o GLM 5.2 e o DeepSeek V4 anunciam um milhão de tokens, 256K é genuinamente limitador para certos trabalhos. Se estás a alimentar um modelo com uma codebase grande inteira, um documento do tamanho de um livro ou uma tarefa agêntica extensa e multi-ficheiro, vais bater no teto do Hy3 mais depressa do que nos rivais maiores. Para a maioria do prompting do dia a dia — uma funcionalidade, um componente, um refactor delimitado, uma tarefa de investigação — 256K chega e sobra. Mas conhece o teu workload. Se o contexto longo é o teu gargalo, este não é o teu modelo, e nenhuma poupança de custos muda isso.
A programação é uma fraqueza real e medida face ao GLM 5.2. Disse-o nos benchmarks e repito-o aqui sem rodeios: se a tua prioridade máxima é programação agêntica pura e queres a melhor opção open-weight, o GLM 5.2 continua a ganhar esse combate específico. O Hy3 é competitivo — troca golpes com o DeepSeek V4 em código — mas "competitivo" não é "o melhor". Escolhe o Hy3 para programar quando a poupança e a velocidade te importam mais do que espremer os últimos pontos de correção. Escolhe o GLM 5.2 quando a correção é tudo.
As demos são demos. O clone do macOS, os jogos, a cidade 3D — são montras de scaffolding, e absolutamente todas tinham arestas por limar quando se mexia nelas a sério. Controlos que funcionavam a meio gás, definições que não persistiam, física aproximada. Isto é normal em geração one-shot e não é um defeito exclusivo do Hy3. Só não confundas uma captura de ecrã impressionante com um produto acabado. Vais ter trabalho de limpeza.
Então, para quem é o Hy3, afinal? Se tivesse de escrever a recomendação num post-it: é para trabalho de front-end e design, pesquisa agêntica, tarefas de raciocínio e ciência, e workloads de alto volume em que o custo e a velocidade valem mais do que espremer os últimos pontos de precisão em programação. É um segundo modelo soberbo numa configuração multimodelo — o generalista barato e rápido para onde encaminhas a maior parte do trabalho, mantendo um modelo de fronteira de prevenção para os trabalhos que precisam mesmo dele. Correr modelos exatamente nesse formato híbrido é algo sobre que já escrevi, no meu fluxo de trabalho híbrido de programação com IA com DeepSeek V4 e Claude Code — o Hy3 encaixa nesse mesmo padrão como o cavalo de trabalho de baixo custo.
O que esperar de facto se o testares
Deixa-me definir expectativas realistas, porque prefiro que entres calibrado a que saias desiludido.
Aponta o Hy3 a um scaffold de front-end, a uma ilustração SVG, a uma landing page, a uma tarefa pesada em raciocínio ou investigação, ou a uma demo 3D ou de física de complexidade média, e deves esperar output limpo, rápido e com um aspeto genuinamente bom — muitas vezes à primeira, ocasionalmente com um empurrão. Espera que o custo seja tão baixo que deixe de pesar nas tuas decisões. Espera que a velocidade bata a maioria dos modelos de fronteira sem discussão.
Aponta-o a uma codebase gigante, a um refactor agêntico subtil e multi-ficheiro, ou a uma tarefa em que a correção tem de ser perfeita, e espera ou bater no teto dos 256K ou dar por ti a desejar ter usado o GLM 5.2 ou um modelo de fronteira. Espera que as demos que construíres precisem de limpeza antes de alguém além de ti lhes tocar.
O padrão em tudo o que analisei é consistente: o Hy3 bate dramaticamente acima da sua contagem de parâmetros, entrega código utilizável e raciocínio fiável, e só mostra o seu tamanho no topo absoluto da dificuldade. Para um modelo de 295B com preço de brinquedo, isso não é só impressionante — é um sinal de para onde vai a corrida do open-weight. A Tencent não lançou o maior modelo. Lançou um dos mais eficientes, e a eficiência é o eixo que chega de facto à tua carteira.
A janela fecha a 21 de julho
De volta àquela frase de abertura — um modelo com menos de metade do tamanho do líder open-weight, a ganhar em quase todo o lado exceto na programação. Há um mês, isto ler-se-ia como fantasia de comunicado de imprensa. Esta semana é uma realidade descarregável, Apache-2.0 e gratuita para testar, com os benchmarks e os repositórios para sustentar a maior parte.
A única coisa concreta que eu faria nos próximos dias: põe o Hy3 a correr enquanto é gratuito — pela rota free do OpenRouter ou pelo portal da Nous — e atira-lhe o teu trabalho a sério. Não as demos. O teu scaffold de front-end real, o teu agente de investigação real, o teu lote de SVG real. Vinte minutos de testes em tarefas que já dominas dir-te-ão mais do que todas as tabelas de benchmarks deste artigo, incluindo as minhas. O período promocional gratuito termina a 21 de julho, e depois disso passas a pagar — quase nada, mas a pagar.
Porque toda esta vaga do open-weight continua a provar a mesma coisa, lançamento após lançamento: o modelo que muda o teu fluxo de trabalho raramente é o maior ou o mais alto numa tabela classificativa. É aquele que é suficientemente bom, suficientemente rápido e suficientemente barato para deixares de pensar no custo e simplesmente construíres. O Hy3 tem hipóteses reais de ser esse modelo para ti. Tens cerca de duas semanas para o descobrir de graça.
Perguntas Frequentes
O que é o Tencent Hy3?
O Tencent Hy3 é um modelo de IA open-weight Mixture-of-Experts de 295 mil milhões de parâmetros, lançado a 6 de julho de 2026 sob licença Apache 2.0. Ativa 21B parâmetros por token usando 192 experts com routing top-8, suporta uma janela de contexto de 256K e visa workloads de raciocínio, agênticos e de programação. Consulta a descrição das especificações acima para todos os detalhes.
O Tencent Hy3 é gratuito?
O Tencent Hy3 é gratuito até 21 de julho de 2026, através da rota tencent/hy3:free do OpenRouter e do portal da Nous Research. Terminada a promoção, a listagem do OpenRouter cobra cerca de 0,14 $ por milhão de tokens de entrada e 0,58 $ por milhão de tokens de saída, com alguns fornecedores do marketplace a cobrar até cerca de 0,20 $ na entrada.
O Hy3 é melhor do que o GLM 5.2?
Depende da tarefa. Nos benchmarks reportados, o GLM 5.2 ganha em programação — 84,2 no SWE-bench Verified contra 78,0 do Hy3 — mas o Hy3 lidera em raciocínio, ciência e pesquisa agêntica usando menos de metade dos parâmetros. Para programação pura, o GLM 5.2 é mais forte; para uso geral eficiente, o Hy3 compete a sério. Vê a tabela de benchmarks acima.
Em que é que o Tencent Hy3 é melhor?
Os casos de uso mais fortes reportados do Hy3 são scaffolding de front-end, geração e animação de SVG, pesquisa agêntica e tarefas de raciocínio ou ciência — além de demos 3D e de física de complexidade média, onde, segundo o reportado, igualou modelos mais caros por uma pequena fração do custo. É mais fraco em contexto muito longo e em programação agêntica de topo.
Qual é o tamanho do Hy3 face ao DeepSeek V4 Pro?
O Hy3 é muito mais pequeno — 295B parâmetros totais contra os 1,6 biliões do DeepSeek V4 Pro. Nos benchmarks de programação, os dois trocam golpes apesar dessa diferença de tamanho, o que explica em grande parte por que razão a eficiência de parâmetros do Hy3 atraiu tanta atenção. A minha análise completa do DeepSeek V4 Pro cobre esse modelo em profundidade.
Trabalha comigo nisto
Se preferires não ser tu a fazer benchmarks, ligações e manutenção de um elenco rotativo de modelos open-weight, é uma boa parte do que eu faço — ajudar equipas a escolher o modelo certo para cada workload (Hy3 incluído), integrá-lo num harness de agentes que aguenta produção e encontrar as arestas afiadas antes que elas te encontrem a ti. Se é desse tipo de ajuda que precisas, é aqui que me podes contactar.