O momento em que soube que esta configuração ia ser um problema para a minha fatura do Opus foi por volta das 02h14 de uma quarta-feira. Eu tinha uma instância do Hermes Agent a correr num VPS de $14 por mês, apontada para o DeepSeek V4 através do nível gratuito do News Portal, e estava a meio de uma tarefa de investigação que lhe tinha atribuído antes de dormir. Doze fontes rastreadas. Notas estruturadas. Um relatório em markdown a ser montado em /output. Um segundo skill — um que o Hermes tinha escrito sozinho no dia anterior — estava na fila para pegar no markdown e redigir uma versão HTML do mesmo relatório para o meu blog.
Verifiquei o meu painel de controlo. Gasto total da noite até ao momento: $0,00.
Não "insignificante." Não "arredondado para zero." Efetivamente zero. A mesma carga de trabalho a correr pelo Claude Opus 4.7 teria queimado aproximadamente $9 de crédito API até aquele momento. No GPT-5.5 Pro teria sido mais perto de $30. O que me surpreendeu profundamente foi que o trabalho não era pior. Não era nível de brinquedo. A investigação era real, as citações estavam intactas, o markdown estava limpo. O rascunho HTML precisava de polimento — vou chegar ao ponto onde exatamente falhou — mas o trabalho estrutural estava feito, executado por um agente a correr num modelo gratuito num VPS que me custa menos do que uma sandes.
Este é o título. A integração do Hermes Agent + DeepSeek V4 grátis via News Portal não é um brinquedo. É a primeira vez que vi um stack de agente completamente open-source, com licença MIT e memória persistente, a correr num modelo gratuito de nível frontier e a produzir trabalho que eu realmente usaria. Os bugs são reais. As arestas são reais. O facto de o nível gratuito poder voltar a ser pago é real. Mas o momento chegou, e passei uma semana a testar para que não tenhas de descobrir da maneira difícil que partes aguentam.
Este é o relatório completo. O que o Hermes Agent realmente é. O que o DeepSeek V4 realmente pontua. Como a peça do News Portal se encaixa. O fluxo de configuração que me levou cerca de nove minutos a partir de uma máquina limpa. Os cinco casos de uso que passei pelo stack — incluindo os dois que genuinamente me surpreenderam — e os pontos onde tive de trazer o Opus de volta para limpar. No final deste artigo saberás se esta combinação vale o teu fim de semana e exatamente o que esperar quando te sentares para instalar.
Porque é que esta combinação importa agora
A história da infraestrutura de agentes em 2026 tem sido uma história de compromissos. Podias ter memória persistente, mas só na cloud de outra pessoa (a via ChatGPT Memory, a via Claude Projects). Podias ter controlo local, mas ficavas preso a montar tudo sozinho com LangGraph e uma instância de Postgres da qual te esqueceste de fazer backup. Podias ter inferência barata, mas o loop do agente por cima era artesanal e frágil. Podias ter um agente polido, mas a fatura do modelo destruía a economia para tudo exceto um produto pago orientado ao cliente.
O que mudou nos últimos sessenta dias é que três peças do puzzle encaixaram simultaneamente.
Primeiro, a Nous Research lançou o Hermes Agent — um runtime de agente completamente open-source, com licença MIT, com memória persistente a longo prazo, um sistema de skills reutilizável, integração nativa de browser e um design de infraestrutura local 24/7 que não depende da cloud de ninguém estar a funcionar. Segundo as notas de lançamento da Nous e o README do GitHub, o projeto alcançou 60.000 estrelas em dois meses após o lançamento, tornando-o o projeto de agente de IA open-source com crescimento mais rápido do ano.
Segundo, a DeepSeek lançou o V4 — e não o V4 educado e incremental. A linha completa, incluindo V4 Flash com raciocínio. Segundo os benchmarks da Artificial Analysis, o DeepSeek V4 Flash (esforço máximo de raciocínio) opera a aproximadamente 121 tokens por segundo e pontua 47 no Artificial Analysis Intelligence Index, enquanto o V4 Pro (raciocínio máximo) pontua 52. A janela de contexto de 1M de tokens é a especificação principal, e ao contrário de algumas alegações de contexto de 1M que testei no passado, esta aguenta-se maioritariamente para além de 128K — mais sobre isto abaixo.
Terceiro — e esta é a peça de que ninguém fora da comunidade Nous está a falar ainda — o News Portal abriu um nível gratuito que faz proxy do DeepSeek V4 através do mesmo endpoint compatível com OpenAI que o Hermes espera. Sem cartão de crédito. Sem filtro de email empresarial. Registas-te, selecionas o nível gratuito, e o Hermes encaminha a sua inferência por ele.
Empilha estes três e obténs algo que não existia há sessenta dias: um agente autónomo 24/7 com memória persistente, a correr num modelo de nível frontier, com $0 em custos mensais de inferência. A armadilha — e existe uma armadilha, vou ser honesto sobre isso — é que "nível frontier" ainda significa "DeepSeek V4 Flash via um proxy gratuito", não Opus 4.7. Essa lacuna importa em locais específicos que te vou mostrar. Mas importa em menos locais do que pensarias, e os locais onde não importa são exatamente as cargas de trabalho de agentes que mais gostarias de correr sem supervisão às 2 da manhã.
Antes de entrarmos na configuração, precisas de entender cada peça. Salta as próximas duas secções se já estás profundamente no Discord do Hermes — mas eu diria que a maioria dos leitores vai querer lê-las, porque a documentação oficial assume mais contexto do que deveria.
O que o Hermes Agent realmente é (e o que não é)
Vou ser direto: entrei no Hermes Agent à espera de mais um clone do AutoGPT. Essa impressão durou cerca de dez minutos depois de ler o README. Isto é uma categoria diferente.
O padrão tradicional de runtime de agente funciona assim: escreves um script Python, ligas-o a um modelo, dás-lhe ferramentas, executas, faz algo, termina, voltas ao IDE. O estado vive na tua cabeça. A "memória" é o que metes no próximo prompt. Se o agente faz uma descoberta útil na terça, na quarta não faz ideia.
O Hermes inverte isso. O Hermes é um daemon. Instalas, corre e continua a correr. Tem a sua própria base de dados SQLite com indexação de texto completo FTS5 para memória entre sessões. Tem uma estrutura de diretórios em ~/.hermes onde armazena persistentemente skills que escreveu. Oferece uma CLI (hermes chat, hermes model, hermes setup) e um painel web. Liga-se a gateways de mensagens (Telegram, Discord, Slack) para que possas falar com ele a partir do telemóvel enquanto corre num servidor algures. Segundo a documentação oficial da Nous Research, o comando de instalação puxa tudo de uma só vez:
curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash
Essa única linha, numa máquina Linux ou macOS limpa, configura o agente, o seu armazém de memória, o seu gateway de ferramentas, o painel e a configuração de arranque automático. No Windows é ligeiramente diferente — o suporte nativo do Windows está em beta inicial segundo as notas de lançamento, e o instalador puxa um ambiente portátil de Git Bash juntamente com Python 3.11, Node.js 22, ripgrep e ffmpeg. O painel baseado em browser corre nativamente. A CLI corre nativamente. Os gateways de mensagens correm como processos PowerShell em segundo plano. Não é tão fluido como o fluxo Linux ainda, mas funciona.
A parte que mais me surpreendeu foi o sistema de skills. O Hermes não tem só ferramentas — tem memória procedimental. Quando lhe pedes algo complexo e ele descobre uma cadeia de chamadas a ferramentas que funciona, pode persistir essa cadeia como um skill reutilizável, dar-lhe um nome e chamá-lo mais tarde. Segundo o repositório comunitário awesome-hermes-agent, já existem várias centenas de skills contribuídos por utilizadores que cobrem padrões de web scraping, fluxos de trabalho de organização de ficheiros, rascunhos de conteúdo, rotinas de análise de código e dezenas de casos de uso verticais.
A superfície de ferramentas integrada, segundo a documentação oficial, inclui:
- Pesquisa web via integração Firecrawl
- Geração de imagens via FAL (texto para imagem)
- Texto para voz via o endpoint TTS da OpenAI
- Browser na cloud via Browser Use — sessões persistentes, cookies, gestão de perfis
- Browser local controlado diretamente via a ferramenta de terminal
- Operações de ficheiros — ler, escrever, organizar, renomear em lote
- Agendamento — estilo cron com linguagem natural ("todas as segundas às 9h")
- Gestão de objetivos — objetivos multi-passo com acompanhamento de progresso
- Módulos de skills — o sistema de memória procedimental acima
- Ponte inter-agente — múltiplas instâncias Hermes a comunicar entre si
- Seleção de modelo — troca em tempo de execução entre fornecedores
- Controlo de custos — limites de orçamento por skill
Conto 19+ ferramentas/superfícies de skills de primeira parte, dependendo de como divides as categorias, e isso é antes de tocares nos plugins da comunidade. A decisão de design interessante é que todas estas ferramentas passam pelo que a Nous chama de Tool Gateway — uma camada de encaminhamento unificada que trata autenticação, limites de taxa e abstração de fornecedores. Não precisas de ligar cada ferramenta a cada fornecedor. O gateway trata disso.
O que o Hermes não é, e quero ser honesto sobre isto antes que alguém fique com a impressão errada: não é um produto de consumo polido. A documentação assume que estás confortável na linha de comandos. O painel é funcional em vez de bonito. Alguns skills falham de formas subtis e só descobres quando o agente silenciosamente produz um relatório meio acabado. Há um Discord onde a equipa central é responsiva, e o rastreador de issues do GitHub move-se rápido, mas estás numa fase inicial. Se não estás confortável em ser um utilizador inicial, dá-lhe mais seis meses.
Se estás confortável em ser inicial, a combinação de memória persistente + sistema de skills é o mais próximo de uma "camada de infraestrutura pessoal de IA" que realmente possuis que alguma vez vi. E isso é antes de vermos o que ligar ao DeepSeek V4 grátis faz à equação de custos.
DeepSeek V4 e a questão de velocidade que ninguém fez
Os títulos de benchmarks sobre o DeepSeek V4 estão corretos mas ligeiramente enganadores, e quero corrigir isso antes de avançarmos.
Segundo a Artificial Analysis no momento do lançamento do V4, eis como as variantes se posicionam:
- DeepSeek V4 Pro (raciocínio, esforço máximo): 52 no AA Intelligence Index, ~40 tokens/seg
- DeepSeek V4 Flash (raciocínio, esforço máximo): 47 no AA Intelligence Index, ~121 tokens/seg
- DeepSeek V4 Pro (sem raciocínio): 39 no AA Intelligence Index, ~32 tokens/seg
- DeepSeek V4 Flash (Max): 97,6 tokens/seg em consultas gerais
Para comparação, onde importa: o V4 Pro fica por volta do 10.º lugar em inteligência bruta entre os 87 modelos frontier que a Artificial Analysis acompanha, e o V4 Flash por volta do 8.º lugar em velocidade. Esse é o enquadramento que verás na maioria das páginas de marketing. A realidade para uma carga de trabalho de agente é mais interessante do que ambos os rankings.
Para trabalho autónomo de agentes, a variante que queres é o V4 Flash com raciocínio, e a razão é que tarefas de agentes são intensivas em tokens. Um fluxo de investigação que toca doze URLs e produz um relatório estruturado pode processar entre 200K e 400K tokens numa única execução. A 30 tokens/seg no V4 Pro (raciocínio), isso é uma execução de quatro horas. A 121 tokens/seg no V4 Flash (raciocínio), é menos de uma hora para a mesma carga. A diferença de inteligência entre Pro e Flash para esse tipo de tarefa de output estruturado é real mas pequena — talvez 5-8% de qualidade de output mensuravelmente pior nos meus testes — e a diferença de tempo torna a diferença de produtividade enorme quando o agente está a correr sem supervisão.
A janela de contexto de 1M de tokens é a spec em que todos se fixam. Na prática, o teto manteve-se limpo até cerca de 128K tokens — resumos de investigação sobre doze a quinze fontes extensas mantiveram-se coerentes, sem degradação na precisão de citações. Entre 128K e cerca de 300K comecei a ver casos limite: o agente perdia ocasionalmente o rasto de que fonte correspondia a uma afirmação específica. Para além de 300K-400K fica visivelmente pior, e algures por volta de 700K a degradação de qualidade é grave o suficiente para não confiar no output sem revisão manual.
Portanto, quando a página principal diz "1M de contexto", lê como "janela de contexto de 1M, com utilidade real até ~128K e um declive suave após 300K." Isso continua a ser excelente. Simplesmente não é o modelo de atenção ilimitada que o marketing implica.
Aqui está a parte que realmente importa para a integração com o Hermes: a superfície API do DeepSeek V4 é compatível com OpenAI. O Hermes pode encaminhar para ela através de qualquer fornecedor que envolva essa superfície. O que nos leva ao News Portal.
News Portal: a camada gratuita que fecha o círculo
O News Portal é a camada de encaminhamento que transforma a combinação teórica "Hermes + DeepSeek grátis" numa realidade de um clique. É um gateway API multi-modelo com um nível gratuito generoso que inclui DeepSeek V4 Flash e Pro de série. Registas-te com um email, não precisas de cartão de crédito, selecionas o nível gratuito e recebes uma chave API que o comando hermes model do Hermes pode apontar diretamente.
O aviso honesto: esta é a peça de que menos tenho certeza a longo prazo. O acesso gratuito a API tem um historial de funcionar muito bem durante seis a nove meses e depois silenciosamente apertar ou mover-se para trás de uma barreira de pagamento assim que a utilização escala. A equipa do Hermes foi transparente que o nível gratuito pode eventualmente exigir uma subscrição paga, e eu planearia para isso. Mas no momento de escrita, está aberto, funciona, e os limites de taxa são altos o suficiente para que tenha corrido o meu agente durante uma semana completa com várias horas de uso diário sem bater numa parede.
Se o nível gratuito fechar, tens três caminhos alternativos e o Hermes suporta todos: apontar diretamente para a API oficial da DeepSeek (variável de ambiente DEEPSEEK_API_KEY, $0,27/M entrada / $0,42/M saída para V4 Pro a tarifas atuais, ainda dramaticamente mais barato que Opus); encaminhar via OpenRouter onde as variantes V4 estão disponíveis num plano de consumo; ou auto-alojar DeepSeek V4 se tiveres o orçamento de GPU (que para a variante Pro de 1,6T parâmetros quase certamente não tens, mas a variante Flash mais pequena é mais razoável numa única H100).
Este é o panorama. Agora entremos na parte que me importava — a instalação real, configuração e a semana que passei a correr trabalho real.
O fluxo de configuração que me levou nove minutos
Cronometrei. VPS limpo com Ubuntu 22.04, nível de $14/mês num fornecedor económico, nada instalado exceto um utilizador não-root com sudo.
Passo um: instalar o Hermes. Um comando curl, do repo oficial da Nous Research:
curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash
O instalador correu cerca de três minutos. Puxou Python 3.11, configurou um virtualenv, instalou Node.js 22 para o painel, clonou o repo do Hermes para ~/.hermes/hermes-agent, inicializou o armazém de memória SQLite e criou unidades systemd para arranque automático. O output é verboso mas legível — se algo falhar, podes ver exatamente que passo. No meu caso não falhou nada.
Passo dois: criar uma conta no News Portal. Browser aberto, news-portal.ai (verifica o URL atual na documentação do Hermes antes de te registares), email + password, sem pedido de cartão de crédito. A criação de conta levou cerca de noventa segundos incluindo a verificação por email.
Passo três: selecionar o nível gratuito. Um clique no painel. O nível gratuito mostra DeepSeek V4 Flash e V4 Pro como modelos disponíveis. Copiei a minha chave API.
Passo quatro: configurar o Hermes para o usar. De volta ao terminal do VPS:
hermes model
Isto leva-te a um seletor de modelos interativo. A primeira opção na lista — opção 1 no menu — é a integração gratuita do News Portal com DeepSeek V4. Selecionei-a, colei a minha chave API quando pedida, e a CLI confirmou que o modelo estava ativo com uma mensagem de sucesso de uma linha.
Passo cinco: iniciar o agente. Um único comando:
hermes chat
O agente arrancou, o URL do painel apareceu no terminal, e eu estava a falar com um agente persistente a correr num modelo frontier com $0 de custo de inferência. Nove minutos desde o comando curl até à primeira resposta.
Se estás em macOS, o fluxo é idêntico. Se estás em Windows nativo, espera uma instalação ligeiramente mais longa (mais perto de sete ou oito minutos para o passo de instalação em si) porque o instalador puxa uma distribuição portátil de Git Bash juntamente com as outras dependências. Os passos de configuração depois disso são os mesmos.
Duas dicas de configuração que não são óbvias na documentação e me pouparam tempo real:
Primeiro, configura o gateway de mensagens cedo. O Hermes tem um comando hermes gateway que liga o agente ao Telegram ou Discord. Uma vez ligado, podes dar tarefas ao agente a partir do telemóvel enquanto estás longe da secretária e ele executá-las-á no VPS em segundo plano. Esta é a funcionalidade que transformou o Hermes de "brinquedo interessante" para "realmente útil para mim diariamente." Envio-lhe uma tarefa de investigação às 23h, corre durante a noite no DeepSeek V4 grátis, e o relatório em markdown está na minha pasta de output de manhã.
Segundo, configura limites de custos mesmo estando num nível gratuito. O plugin de controlo de custos do hermes permite definir limites de orçamento por skill. A razão para os definir agora: se alguma vez mudares para um modelo pago (Opus para trabalho de polimento, por exemplo), os limites que definiste no nível gratuito serão transferidos. Não queres que um agente queime acidentalmente o teu orçamento Anthropic às 3 da manhã porque te esqueceste de adicionar um limite.
Isso é a instalação. Agora falemos sobre o que o stack realmente faz.
Cinco cargas de trabalho que executei (e onde cada uma falhou)
Escolhi cinco casos de uso representativos do trabalho que realmente gostaria que um agente sem supervisão fizesse. Executei cada um através do stack Hermes + DeepSeek V4 grátis, registei o que produziu e anotei os pontos onde tive de trazer um modelo pago de volta.
Carga de trabalho 1: investigação autónoma e relatório em markdown
A tarefa: "Investiga o estado das implementações de servidores MCP em maio de 2026, encontra as cinco mais amplamente adotadas e produz um relatório em markdown com passos de instalação, prós/contras e links para os repositórios fonte."
O agente fez isto lindamente. Doze URLs visitados, corretamente citados, estruturados num relatório markdown de 2.400 palavras com hierarquia H2/H3, blocos de código para comandos de instalação e uma tabela comparativa no final. Tempo total de execução: 47 minutos. Custo total: $0.
O único ponto onde tropeçou: puxou estatísticas de algumas fontes que eram na verdade páginas de marketing disfarçadas de artigos técnicos. Tive de verificar manualmente dois dos números de adoção antes de confiar neles. Isso não é um problema do Hermes nem do DeepSeek — é um problema de LLM-a-puxar-da-web que afeta todos os sistemas de agentes igualmente. A solução é usar o plugin de gestão de objetivos para exigir explicitamente verificação de dupla fonte em afirmações numéricas. Fiz isso na execução seguinte e o problema desapareceu.
Carga de trabalho 2: agregação de pesquisa web e resumo diário
A tarefa: todas as manhãs às 8h, verificar cinco URLs de publicações específicas à procura de notícias de IA, deduplicar histórias que aparecem em múltiplas fontes e produzir um resumo matinal de 400 palavras.
Esta é exatamente a carga de trabalho para a qual o Hermes foi construído. Escrevi-o como um skill, agendei-o através do plugin de agendamento e deixei-o correr a semana toda. Os resumos foram consistentemente fortes — tipicamente 90% do caminho para qualidade de publicação. Na manhã do dia quatro puxou um artigo que se revelou ser uma republicação de um artigo mais antigo que uma das fontes tinha empurrado para a primeira página. O Hermes não detetou a desatualização. Fácil de corrigir do meu lado (adicionar um passo de filtro por data ao skill), mas vale a pena mencionar se construíres algo semelhante.
Custo ao longo da semana: $0. Tempo poupado face a ler as fontes manualmente todas as manhãs: cerca de quarenta minutos por dia.
Carga de trabalho 3: geração de rascunho de blog em HTML
A tarefa: pegar no relatório markdown da carga de trabalho 1 e produzir uma versão HTML pronta para inserir num CMS.
Aqui é onde as limitações do nível gratuito do DeepSeek V4 se tornam visíveis. A estrutura HTML estava tecnicamente correta — markup válido, tags semânticas, a hierarquia correta. Mas o gosto do output estava desafinado. Aninhamento desajeitado de <div> em sítios que não precisavam. Estilos inline em vez de hooks de classe. Uma secção hero que parecia markup de 2022. O agente produziu algo que eu poderia enviar, mas que não enviaria realmente sem rever.
Este é o momento onde a resposta honesta é: emparelha Hermes + DeepSeek para o trabalho pesado, e depois passa a última revisão pelo Claude Opus 4.7 para o polimento. A economia continua a funcionar — a maior parte do custo de tokens (investigação + redação estruturada) vai pelo nível gratuito, e apenas os últimos 10% (o HTML sensível ao design) vão pelo modelo pago. A minha análise completa do Opus 4.7 cobre porque é que esse modelo ainda merece o seu lugar no topo do pipeline de polimento apesar do custo.
Carga de trabalho 4: organização de ficheiros e análise de folhas de cálculo
A tarefa: limpar uma pasta de Downloads com 312 ficheiros, categorizar por tipo e propósito inferido, mover para subpastas organizadas e produzir um inventário CSV.
O Hermes tratou disto perfeitamente. A ferramenta de operações de ficheiros mais o DeepSeek V4 Flash para a lógica de classificação é uma combinação forte. O agente identificou os tipos de ficheiro, inferiu propósitos a partir de nomes e conteúdos de ficheiros quando apropriado, organizou-os numa estrutura limpa e produziu um CSV com o caminho original, novo caminho, categoria inferida e pontuação de confiança. Vinte e três ficheiros marcou como "pouco claros" para a minha revisão manual. Desses vinte e três, quatro eram genuinamente ambíguos e os outros dezanove classifiquei em cerca de noventa segundos.
Custo: $0. Tempo gasto numa tarefa que andava a adiar há dois meses: cerca de oito minutos do meu tempo, principalmente durante o passo de revisão manual. A conclusão honesta é que este é o tipo de trabalho que um agente sem supervisão deveria fazer para toda a gente, e o facto de agora custar literalmente nada a executar é o ponto a que continuo a voltar.
Carga de trabalho 5: automatização de browser multi-ferramenta
A tarefa: fazer login num painel específico, extrair as analíticas dos últimos 30 dias, formatar os números num relatório de estado semanal e enviá-lo por email a um stakeholder.
Esta é a carga de trabalho onde genuinamente não sabia o que esperar. Automatização de browser é difícil. Logins persistentes são mais difíceis. Orquestração multi-ferramenta com checkpoints entre meio — ainda mais difícil.
O Hermes conseguiu. A integração browser-use tratou do login através de um perfil guardado. A extração de analíticas funcionou à primeira tentativa. O passo de formatação usou um skill que eu tinha escrito previamente para relatórios de estado, com o agente a recuperá-lo corretamente da memória procedimental. O passo de email foi encaminhado via o gateway de mensagens. Tempo de execução de ponta a ponta: cerca de onze minutos. Custo: $0.
A ressalva honesta: o agente ficou preso uma vez durante a semana na mesma carga de trabalho, quando o painel lançou uma atualização de UI que moveu o botão de exportação de analíticas. O Hermes passou oito minutos a tentar clicar na localização antiga antes de fazer timeout de forma limpa e dizer-me o que tinha acontecido. Esse comportamento de recuperação — falhar honestamente e informar o utilizador — é significativamente melhor do que metade das ferramentas de automatização comerciais que usei.
Onde este stack ganha (e onde o Opus ainda justifica o seu custo)
Depois de uma semana a correr esta combinação nas cinco cargas de trabalho acima mais algumas experiências mais pequenas, aqui está o mapa honesto de onde cada camada do stack ganha o seu lugar.
Hermes + DeepSeek V4 grátis ganha em: agregação de investigação, redação estruturada, operações de ficheiros, análise de folhas de cálculo, automatização de browser para interfaces previsíveis, fluxos de trabalho agendados em segundo plano, perseguição de objetivos multi-passo, tudo onde o output se trata mais de correção e estrutura do que de gosto estético.
Hermes + DeepSeek V4 grátis perde em: output front-end que requer gosto de design, texto que precisa de voz (a voz do DeepSeek em textos longos em inglês é competente mas reconhecivelmente "IA" de uma forma que não me agrada), raciocínio matizado em contextos extremamente longos além de 300K tokens, tudo onde precisas que o modelo recuse com confiança em vez de produzir uma resposta plausível-mas-errada.
Para a coluna de perdas, o Claude Opus 4.7 continua a ser o meu modelo preferido. O fluxo de trabalho interessante que está a emergir — e que agora uso diariamente — é o padrão de transferência. O Hermes corre sem supervisão no DeepSeek grátis para a maior parte de uma carga de trabalho de agente. Quando atinge um passo que precisa de gosto, voz ou julgamento cuidadoso, encaminha esse passo específico para o Opus via uma chave API paga, captura o resultado e continua. O custo total de um pipeline completo desce de "$30-50 se tudo corresse no Opus" para "$1-3 porque apenas o passo de polimento correu no Opus." O meu guia de otimização de custos de agentes IA aprofunda este padrão híbrido se quiseres desenhar o teu próprio. E se tens seguido a história mais ampla do DeepSeek, a minha análise aprofundada do DeepSeek V4 Pro cobre a arquitetura do modelo com mais detalhe do que este artigo necessita.
As limitações honestas que ninguém citou no Twitter
Espalhei-as por todo o artigo mas merecem a sua própria secção porque te vão poupar tempo real.
O Hermes tem bugs. É open source, é jovem, move-se rápido. Encontrei dois problemas na minha semana de testes: uma consulta ao armazém de memória que deu timeout num thread de conversa particularmente longo (resolvido limpando a cache FTS5, mas a correção ainda não está documentada), e uma condição de corrida no plugin de agendamento onde dois skills agendados a disparar simultaneamente fizeram com que um perdesse o seu output. Nenhum foi um impedimento. Ambos exigiram que mergulhasse no código fonte para perceber o que aconteceu. Se não estás confortável a ler Python e esquemas SQLite quando algo corre mal, espera seis meses.
O nível gratuito do News Portal pode não durar. Vou continuar a dizer isto porque é o maior risco individual para toda esta configuração. Planeia a tua arquitetura para que mudar de fornecedor de inferência seja uma única alteração de configuração. O Hermes torna isto fácil — o comando hermes model suporta todos os fornecedores principais — mas cabe-te a ti testar a mudança antes do dia em que precisares dela.
A voz do DeepSeek V4 em output criativo não é a do Opus. Esta é uma lacuna real. Para investigação, rascunhos estruturados, código e qualquer output avaliado pela correção, o V4 aguenta-se. Para texto avaliado pelo gosto, sentirás a diferença. Emparelha os modelos para as cargas de trabalho onde isto importa.
Windows nativo é beta. Os fluxos de instalação em Linux e macOS são fluidos. O fluxo nativo do Windows funciona mas tem arestas. Se estás no Windows e o teu trabalho depende disto funcionar de forma fiável, considera correr o Hermes dentro do WSL2 — a documentação oficial continua a recomendar isso como o caminho mais estável no Windows.
O agente vai ocasionalmente alucinar capacidades de ferramentas. Uma vez durante a minha semana de testes, o Hermes tentou usar um skill que não existia (tinha referenciado um nome de skill de documentação que tinha lido, não um que tivesse realmente escrito). O modo de falha foi elegante — disse-me que o skill não foi encontrado e perguntou se eu queria que escrevesse um — mas é um lembrete de que mesmo agentes com memória procedimental podem confundir "li sobre isto" com "tenho isto." Verifica antes de confiar.
Nenhuma destas é razão para não correr o stack. São razões para o correr com os olhos abertos.
O que acontece nos próximos seis meses
Quero fechar com uma previsão, porque penso que esta combinação é genuinamente um sinal de para onde a infraestrutura de agentes se está a dirigir.
Ao longo de 2025, a conversa sobre runtimes de agentes foi dominada por frameworks (LangGraph, AutoGen, CrewAI) que ajudavam a construir agentes mas assumiam que os correrias tu próprio, na tua própria infraestrutura, com a tua própria fatura de modelos. A camada de memória persistente era faz-tu-mesmo. O sistema de skills era algo que escrevias de raiz cada vez. O custo era o que a tua fatura API dissesse.
O que o Hermes + DeepSeek V4 grátis demonstra é que todo o stack pode comprimir-se. Memória persistente, incluída. Sistema de skills, incluído. Orquestração multi-ferramenta, incluída. Gateways de mensagens, incluídos. Inferência de modelo de nível frontier, grátis. Tudo corre num VPS de $14.
Os próximos seis meses vão ver muito mais disto. Outros runtimes de agentes open-source (e já há vários em desenvolvimento que estou a seguir) vão copiar o padrão de memória persistente + sistema de skills. Outros fornecedores de modelos vão copiar o padrão de "nível gratuito compatível com OpenAI como líder de perdas." Outras camadas de encaminhamento vão competir com o News Portal na generosidade do nível gratuito. E o custo médio de correr um agente autónomo para um pequeno negócio vai colapsar de "algumas centenas de dólares por mês" para "o preço de um VPS."
Se és desenvolvedor ou fundador a solo, a jogada agora é começar a desenvolver músculo neste stack. Configura-o. Corre cargas de trabalho reais. Constrói alguns skills. Aprende onde se parte. Quando a infraestrutura estiver madura o suficiente para cargas de trabalho críticas de produção, terás um ano de experiência operacional enquanto todos os outros estão apenas a abrir a documentação.
O mundo onde cada pequena equipa tem um assistente de investigação autónomo 24/7 a correr em infraestrutura gratuita já não é uma previsão de 2027. É um projeto de fim de semana de 2026. Eu tinha o meu a correr em nove minutos. A questão que vale a pena considerar esta noite: o que atribuirias a um agente que custa $0 a correr e nunca dorme?
Perguntas frequentes
O Hermes Agent é mesmo grátis com o DeepSeek V4?
Sim — a inferência do modelo em si é gratuita quando encaminhas o Hermes através do nível gratuito do News Portal com DeepSeek V4. Continuas a pagar pelo VPS ou máquina local onde corres o Hermes (tipicamente $5-15/mês por um VPS utilizável, ou $0 se auto-alojares em hardware existente). O nível gratuito pode eventualmente tornar-se pago, por isso planeia para essa contingência. Para o guia completo de configuração, consulta "O fluxo de configuração que me levou nove minutos" acima.
Como se compara o Hermes Agent com o AutoGPT ou CrewAI?
O Hermes é um daemon persistente com memória entre sessões incorporada (SQLite com índice FTS5), um sistema de skills procedimental, gateways de mensagens nativos e um gateway de ferramentas unificado. O AutoGPT e o CrewAI são frameworks para construir agentes — tu forneces a persistência, a memória e o deployment. O Hermes está mais próximo de um sistema operativo para agentes do que de uma biblioteca. Para a análise arquitetural completa, consulta "O que o Hermes Agent realmente é" acima.
O DeepSeek V4 tem mesmo uma janela de contexto de 1 milhão de tokens?
A janela de contexto anunciada de 1M de tokens mantém-se limpa na prática até cerca de 128K tokens, com qualidade utilizável até aproximadamente 300K. Para além de 300K-400K verás degradação na precisão de citações e fiabilidade de referências cruzadas. Considera o número 1M como o limite superior, não como o teto de trabalho.
Posso correr o Hermes Agent no Windows?
Sim — Windows nativo está em beta inicial e funciona para a CLI, o painel e os gateways de mensagens. O instalador puxa uma distribuição portátil de Git Bash juntamente com as outras dependências. Se queres estabilidade máxima, a documentação da Nous Research continua a recomendar o WSL2 como o caminho mais fiável no Windows.
O que acontece se o nível gratuito do News Portal fechar?
O Hermes suporta vários caminhos de inferência alternativos: a API oficial da DeepSeek diretamente (atualmente $0,27/$0,42 por M entrada/saída para V4 Pro), OpenRouter num plano de consumo, ou DeepSeek V4 auto-alojado se tiveres o orçamento de GPU. Mudar de fornecedor é uma alteração de configuração de uma linha via o comando hermes model, por isso desenha os teus fluxos de trabalho para que a mudança seja trivial.
Vamos trabalhar juntos
Procuras construir sistemas de IA, automatizar fluxos de trabalho ou escalar a tua infraestrutura tecnológica? Adoraria ajudar.
- Fiverr (builds e integrações personalizadas): fiverr.com/s/EgxYmWD
- Portfolio: mejba.me
- Ramlit Limited (soluções enterprise): ramlit.com
- ColorPark (design e branding): colorpark.io
- xCyberSecurity (serviços de segurança): xcybersecurity.io