El momento en que supe que esta configuración iba a ser un problema para mi factura de Opus fue alrededor de las 2:14 de la madrugada de un miércoles. Tenía una instancia de Hermes Agent ejecutándose en un VPS de $14 al mes, apuntando a DeepSeek V4 a través del nivel gratuito de News Portal, y estaba a medio camino de una tarea de investigación que le había asignado antes de dormir. Doce fuentes rastreadas. Notas estructuradas. Un informe en markdown siendo ensamblado en /output. Un segundo skill — uno que Hermes había escrito por sí mismo el día anterior — estaba en cola para tomar el markdown y redactar una versión HTML del mismo informe para mi blog.
Revisé mi panel de control. Gasto total de la noche hasta el momento: $0,00.
No "insignificante". No "redondeado a cero". Literalmente cero. La misma carga de trabajo ejecutada a través de Claude Opus 4.7 habría consumido aproximadamente $9 de crédito API hasta ese momento. En GPT-5.5 Pro habría sido cercano a $30. Lo que me rompió la cabeza fue que el trabajo no era peor. No era nivel de juguete. La investigación era real, las citas estaban intactas, el markdown estaba limpio. El borrador HTML necesitaba pulirse — ya llegaré a dónde falló exactamente — pero el trabajo estructural estaba hecho, ejecutado por un agente corriendo en un modelo gratuito en un VPS que me cuesta menos que un sándwich.
Ese es el titular. La integración de Hermes Agent + DeepSeek V4 gratis vía News Portal no es un juguete. Es la primera vez que he visto un stack de agente completamente open-source, con licencia MIT y memoria persistente, ejecutándose en un modelo gratuito de nivel frontier y produciendo trabajo que realmente usaría. Los bugs son reales. Las asperezas son reales. El hecho de que el nivel gratuito pueda volver a ser de pago es real. Pero el momento ha llegado, y pasé una semana probándolo para que tú no tengas que descubrir por las malas qué partes resisten.
Este es el análisis completo. Qué es realmente Hermes Agent. Qué puntúa realmente DeepSeek V4. Cómo encaja la pieza de News Portal. El flujo de configuración que me tomó unos nueve minutos desde una máquina limpia. Los cinco casos de uso que ejecuté a través del stack — incluidos los dos que genuinamente me sorprendieron — y los puntos donde tuve que traer de vuelta a Opus para limpiar los resultados. Al final de este artículo sabrás si esta combinación vale tu fin de semana y exactamente qué esperar cuando te sientes a instalarla.
Por qué esta combinación importa ahora mismo
La historia de la infraestructura de agentes en 2026 ha sido una historia de compromisos. Podías tener memoria persistente, pero solo en la nube de otro (la ruta ChatGPT Memory, la ruta Claude Projects). Podías tener control local, pero estabas atascado conectando todo tú mismo con LangGraph y una instancia de Postgres de la que olvidaste hacer respaldo. Podías tener inferencia barata, pero el bucle del agente encima era artesanal y frágil. Podías tener un agente pulido, pero la factura del modelo destruía la economía para cualquier cosa excepto un producto de pago orientado al cliente.
Lo que cambió en los últimos sesenta días es que tres piezas del rompecabezas encajaron simultáneamente.
Primero, Nous Research lanzó Hermes Agent — un runtime de agente completamente open-source, con licencia MIT, con memoria persistente a largo plazo, un sistema de skills reutilizable, integración nativa de navegador y un diseño de infraestructura local 24/7 que no depende de que la nube de nadie esté funcionando. Según las notas de lanzamiento de Nous y el README de GitHub, el proyecto alcanzó 60.000 estrellas en dos meses desde su lanzamiento, lo que lo convierte en el proyecto de agente de IA open-source de mayor crecimiento del año.
Segundo, DeepSeek lanzó V4 — y no el V4 cortés e incremental. La línea completa, incluyendo V4 Flash con razonamiento. Según los benchmarks de Artificial Analysis, DeepSeek V4 Flash (esfuerzo máximo de razonamiento) opera a aproximadamente 121 tokens por segundo y puntúa 47 en el Artificial Analysis Intelligence Index, mientras que V4 Pro (razonamiento máximo) puntúa 52. La ventana de contexto de 1M de tokens es la especificación estrella, y a diferencia de algunas afirmaciones de contexto de 1M que he probado en el pasado, esta se mantiene mayormente más allá de 128K — más sobre esto abajo.
Tercero — y esta es la pieza de la que nadie fuera de la comunidad Nous está hablando aún — News Portal abrió un nivel gratuito que hace proxy de DeepSeek V4 a través del mismo endpoint compatible con OpenAI que Hermes espera. Sin tarjeta de crédito. Sin filtro de correo empresarial. Te registras, seleccionas el nivel gratuito, y Hermes enruta su inferencia a través de él.
Apila estos tres y obtienes algo que no existía hace sesenta días: un agente autónomo 24/7 con memoria persistente, ejecutándose en un modelo de nivel frontier, con $0 en costes mensuales de inferencia. La trampa — y hay una trampa, voy a ser honesto al respecto — es que "nivel frontier" todavía significa "DeepSeek V4 Flash vía un proxy gratuito", no Opus 4.7. Esa brecha importa en lugares específicos que te mostraré. Pero importa en menos lugares de los que pensarías, y los lugares donde no importa son exactamente las cargas de trabajo de agentes que más querrías ejecutar sin supervisión a las 2 de la madrugada.
Antes de entrar en la configuración, necesitas entender cada pieza. Salta las siguientes dos secciones si ya estás metido de lleno en el Discord de Hermes — pero yo diría que la mayoría de los lectores las querrán, porque la documentación oficial asume más contexto del que debería.
Qué es realmente Hermes Agent (y qué no es)
Seré directo: entré a Hermes Agent esperando otro clon de AutoGPT. Esa impresión duró unos diez minutos después de leer el README. Esto es una categoría diferente.
El patrón tradicional de runtime de agente funciona así: escribes un script en Python, lo conectas a un modelo, le das herramientas, lo ejecutas, hace algo, termina, vuelves a tu IDE. El estado vive en tu cabeza. La "memoria" es lo que metas en el siguiente prompt. Si el agente hace un descubrimiento útil el martes, el miércoles no tiene ni idea.
Hermes invierte eso. Hermes es un daemon. Lo instalas, se ejecuta y sigue ejecutándose. Tiene su propia base de datos SQLite con indexación de texto completo FTS5 para memoria entre sesiones. Tiene una estructura de directorios bajo ~/.hermes donde almacena de forma persistente los skills que ha escrito. Ofrece una CLI (hermes chat, hermes model, hermes setup) y un panel web. Se conecta a pasarelas de mensajería (Telegram, Discord, Slack) para que puedas hablarle desde tu teléfono mientras se ejecuta en un servidor. Según la documentación oficial de Nous Research, el comando de instalación descarga todo lo necesario de una sola vez:
curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash
Esa única línea, en una máquina Linux o macOS limpia, configura el agente, su almacén de memoria, su gateway de herramientas, el panel de control y la configuración de inicio automático. En Windows es ligeramente diferente — el soporte nativo de Windows está en beta temprana según las notas de lanzamiento, y el instalador descarga un entorno portable de Git Bash junto con Python 3.11, Node.js 22, ripgrep y ffmpeg. El panel basado en navegador funciona nativamente. La CLI funciona nativamente. Las pasarelas de mensajería se ejecutan como procesos de PowerShell en segundo plano. No es tan fluido como el flujo en Linux todavía, pero funciona.
La parte que más me sorprendió fue el sistema de skills. Hermes no solo tiene herramientas — tiene memoria procedimental. Cuando le pides algo complejo y descubre una cadena de llamadas a herramientas que funciona, puede persistir esa cadena como un skill reutilizable, nombrarlo y llamarlo de vuelta más tarde. Según el repositorio comunitario awesome-hermes-agent, ya hay varios cientos de skills contribuidos por usuarios que cubren patrones de web scraping, flujos de trabajo de organización de archivos, borradores de contenido, rutinas de análisis de código y docenas de casos de uso verticales.
La superficie de herramientas integrada, según la documentación oficial, incluye:
- Búsqueda web vía integración con Firecrawl
- Generación de imágenes vía FAL (texto a imagen)
- Texto a voz vía el endpoint TTS de OpenAI
- Navegador en la nube vía Browser Use — sesiones persistentes, cookies, gestión de perfiles
- Navegador local controlado directamente a través de la herramienta de terminal
- Operaciones de archivos — leer, escribir, organizar, renombrar en lote
- Programación — estilo cron con lenguaje natural ("cada lunes a las 9")
- Gestión de objetivos — objetivos multi-paso con seguimiento de progreso
- Módulos de skills — el sistema de memoria procedimental descrito arriba
- Puente inter-agente — múltiples instancias de Hermes comunicándose entre sí
- Selección de modelo — cambio en tiempo de ejecución entre proveedores
- Control de costes — límites de presupuesto por skill
Cuento 19+ herramientas/superficies de skills de primera parte, dependiendo de cómo dividas las categorías, y eso es antes de tocar los plugins de la comunidad. La decisión de diseño interesante es que todas estas herramientas pasan por lo que Nous llama el Tool Gateway — una capa de enrutamiento unificada que maneja autenticación, límites de velocidad y abstracción de proveedores. No tienes que conectar cada herramienta con cada proveedor tú mismo. El gateway se encarga.
Lo que Hermes no es, y quiero ser honesto sobre esto antes de que alguien se lleve una impresión equivocada: no es un producto de consumo pulido. La documentación asume que te sientes cómodo en la línea de comandos. El panel es funcional más que bonito. Algunos skills fallan de maneras sutiles y solo te enteras cuando el agente produce silenciosamente un informe a medio terminar. Hay un Discord donde el equipo central es receptivo, y el rastreador de incidencias de GitHub avanza rápido, pero estás en una etapa temprana. Si no te sientes cómodo siendo un adoptante temprano, dale seis meses más.
Si sí te sientes cómodo siendo temprano, la combinación de memoria persistente + sistema de skills es lo más cercano a una "capa de infraestructura personal de IA" que realmente posees que he visto jamás. Y eso es antes de ver lo que conectarlo a DeepSeek V4 gratis hace con la ecuación de costes.
DeepSeek V4 y la pregunta sobre velocidad que nadie hizo
Los titulares de benchmarks de DeepSeek V4 son correctos pero ligeramente engañosos, y quiero corregir eso antes de continuar.
Según Artificial Analysis en el momento del lanzamiento de V4, así quedan las variantes:
- DeepSeek V4 Pro (razonamiento, esfuerzo máximo): 52 en el AA Intelligence Index, ~40 tokens/seg
- DeepSeek V4 Flash (razonamiento, esfuerzo máximo): 47 en el AA Intelligence Index, ~121 tokens/seg
- DeepSeek V4 Pro (sin razonamiento): 39 en el AA Intelligence Index, ~32 tokens/seg
- DeepSeek V4 Flash (Max): 97,6 tokens/seg en consultas generales
Para comparar donde importa: V4 Pro queda alrededor del puesto 10 en inteligencia bruta entre los 87 modelos frontier que Artificial Analysis rastrea, y V4 Flash alrededor del puesto 8 en velocidad. Ese es el marco que verás en la mayoría de las páginas de marketing. La realidad para una carga de trabajo de agente es más interesante que ambos rankings.
Para trabajo autónomo de agentes, la variante que quieres es V4 Flash con razonamiento, y la razón es que las tareas de agentes son intensivas en tokens. Un flujo de investigación que toca doce URLs y produce un informe estructurado puede procesar entre 200K y 400K tokens en una sola ejecución. A 30 tokens/seg en V4 Pro (razonamiento), eso es una ejecución de cuatro horas. A 121 tokens/seg en V4 Flash (razonamiento), es menos de una hora para la misma carga. La diferencia de inteligencia entre Pro y Flash para ese tipo de tarea de salida estructurada es real pero pequeña — quizás un 5-8% de calidad de salida mediblemente peor en mis pruebas — y la diferencia de tiempo hace que la diferencia de productividad sea enorme cuando el agente está ejecutándose sin supervisión.
La ventana de contexto de 1M de tokens es la especificación en la que todos se fijan. En la práctica, el techo se mantuvo limpiamente hasta unos 128K tokens — los resúmenes de investigación sobre doce a quince fuentes extensas se mantuvieron coherentes, sin degradación en la precisión de citas. Entre 128K y unos 300K empecé a ver casos límite: el agente perdía ocasionalmente el rastro de qué fuente correspondía a una afirmación específica. Más allá de 300K-400K se vuelve notablemente peor, y en algún punto alrededor de 700K la degradación de calidad es lo suficientemente severa como para no confiar en la salida sin revisión manual.
Así que cuando la página principal dice "1M de contexto", léelo como "ventana de contexto de 1M, con utilidad real hasta ~128K y un declive suave después de 300K". Eso sigue siendo excelente. Simplemente no es el modelo de atención ilimitada que el marketing implica.
Aquí está la parte que realmente importa para la integración con Hermes: la superficie API de DeepSeek V4 es compatible con OpenAI. Hermes puede enrutar hacia ella a través de cualquier proveedor que envuelva esa superficie. Lo que nos lleva a News Portal.
News Portal: la capa gratuita que cierra el círculo
News Portal es la capa de enrutamiento que convierte la combinación teórica "Hermes + DeepSeek gratis" en una realidad de un solo clic. Es una pasarela API multi-modelo con un nivel gratuito generoso que incluye DeepSeek V4 Flash y Pro de serie. Te registras con un correo electrónico, no necesitas tarjeta de crédito, seleccionas el nivel gratuito y obtienes una clave API que el comando hermes model de Hermes puede apuntar directamente.
La advertencia honesta: esta es la pieza de la que menos seguro estoy a largo plazo. El acceso gratuito a API tiene un historial de funcionar genial durante seis a nueve meses y luego endurecerse silenciosamente o moverse detrás de un muro de pago una vez que el uso escala. El equipo de Hermes ha sido transparente en que el nivel gratuito podría eventualmente requerir una suscripción de pago, y yo planificaría para eso. Pero al momento de escribir, está abierto, funciona, y los límites de velocidad son suficientemente altos como para que ejecuté mi agente durante una semana completa con varias horas de uso diario sin chocar contra un muro.
Si el nivel gratuito cierra, tienes tres caminos alternativos y Hermes los soporta todos: apuntar directamente a la API oficial de DeepSeek (variable de entorno DEEPSEEK_API_KEY, $0,27/M entrada / $0,42/M salida para V4 Pro a tarifas actuales, todavía dramáticamente más barato que Opus); enrutar a través de OpenRouter donde las variantes V4 están disponibles en plan de consumo; o auto-alojar DeepSeek V4 si tienes el presupuesto de GPU (que para la variante Pro de 1,6T parámetros casi seguro no tienes, pero la variante Flash más pequeña es más razonable en una sola H100).
Ese es el panorama. Ahora entremos en la parte que me importaba — la instalación real, configuración y la semana que pasé ejecutando trabajo real.
El flujo de configuración que me tomó nueve minutos
Lo cronometré. VPS limpio con Ubuntu 22.04, nivel de $14/mes en un proveedor económico, nada instalado excepto un usuario no-root con sudo.
Paso uno: instalar Hermes. Un comando curl, sacado del repo oficial de Nous Research:
curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash
El instalador corrió unos tres minutos. Descargó Python 3.11, configuró un virtualenv, instaló Node.js 22 para el panel, clonó el repo de Hermes a ~/.hermes/hermes-agent, inicializó el almacén de memoria SQLite y creó unidades systemd para el inicio automático. La salida es verbosa pero legible — si algo falla, puedes ver exactamente qué paso. En mi caso no falló nada.
Paso dos: crear una cuenta en News Portal. Abrir el navegador, news-portal.ai (verifica la URL actual en la documentación de Hermes antes de registrarte), correo + contraseña, sin solicitud de tarjeta de crédito. La creación de cuenta tomó unos noventa segundos incluyendo la verificación por correo.
Paso tres: seleccionar el nivel gratuito. Un clic en el panel. El nivel gratuito muestra DeepSeek V4 Flash y V4 Pro como modelos disponibles. Copié mi clave API.
Paso cuatro: configurar Hermes para usarlo. De vuelta en la terminal del VPS:
hermes model
Esto te lleva a un selector de modelos interactivo. La primera opción de la lista — opción 1 en el menú — es la integración gratuita de News Portal con DeepSeek V4. La seleccioné, pegué mi clave API cuando se pidió, y la CLI confirmó que el modelo estaba activo con un mensaje de éxito de una línea.
Paso cinco: iniciar el agente. Un solo comando:
hermes chat
El agente arrancó, la URL del panel apareció en la terminal, y estaba hablando con un agente persistente ejecutándose en un modelo frontier con $0 de coste de inferencia. Nueve minutos transcurridos desde el comando curl hasta la primera respuesta.
Si estás en macOS, el flujo es idéntico. Si estás en Windows nativo, espera una instalación ligeramente más larga (más cerca de siete u ocho minutos para el paso de instalación en sí) porque el instalador descarga una distribución portable de Git Bash junto con las otras dependencias. Los pasos de configuración después de eso son los mismos.
Dos consejos de configuración que no son obvios en la documentación y me ahorraron tiempo real:
Primero, configura la pasarela de mensajería temprano. Hermes tiene un comando hermes gateway que conecta el agente a Telegram o Discord. Una vez conectado, puedes dar tareas al agente desde tu teléfono mientras estás lejos de tu escritorio y las ejecutará en el VPS en segundo plano. Esta es la función que convirtió a Hermes de "juguete interesante" a "realmente útil para mí a diario". Le envío una tarea de investigación a las 23:00, se ejecuta durante la noche en DeepSeek V4 gratis, y el informe en markdown está en mi carpeta de salida por la mañana.
Segundo, configura límites de costes incluso si estás en un nivel gratuito. El plugin de control de costes de hermes te permite establecer límites de presupuesto por skill. La razón para establecerlos ahora: si alguna vez cambias a un modelo de pago (Opus para trabajo de pulido, por ejemplo), los límites que definiste en el nivel gratuito se transferirán. No quieres que un agente queme accidentalmente tu presupuesto de Anthropic a las 3 de la madrugada porque olvidaste agregar un límite.
Eso es la instalación. Ahora hablemos de lo que el stack realmente hace.
Cinco cargas de trabajo que ejecuté (y dónde falló cada una)
Elegí cinco casos de uso representativos del trabajo que realmente querría que un agente sin supervisión hiciera. Ejecuté cada uno a través del stack Hermes + DeepSeek V4 gratis, registré lo que produjo y anoté los puntos donde tuve que traer un modelo de pago de vuelta.
Carga de trabajo 1: investigación autónoma e informe en markdown
La tarea: "Investiga el estado de las implementaciones de servidores MCP en mayo de 2026, encuentra las cinco más ampliamente adoptadas y produce un informe en markdown con pasos de instalación, pros/contras y enlaces a los repositorios fuente."
El agente hizo esto de maravilla. Doce URLs visitadas, correctamente citadas, estructuradas en un informe markdown de 2.400 palabras con jerarquía H2/H3, bloques de código para comandos de instalación y una tabla comparativa al final. Tiempo total de ejecución: 47 minutos. Coste total: $0.
El único punto donde tropezó: extrajo estadísticas de un par de fuentes que en realidad eran páginas de marketing disfrazadas de artículos técnicos. Tuve que verificar manualmente dos de los números de adopción antes de confiar en ellos. Eso no es un problema de Hermes ni de DeepSeek — es un problema de LLM-extrayendo-de-la-web que afecta a todo sistema de agentes por igual. La solución es usar el plugin de gestión de objetivos para requerir explícitamente verificación de doble fuente en afirmaciones numéricas. Lo hice en la siguiente ejecución y el problema desapareció.
Carga de trabajo 2: agregación de búsqueda web y resumen diario
La tarea: cada mañana a las 8, escanear cinco URLs de publicaciones específicas en busca de noticias de IA, deduplicar historias que aparecen en múltiples fuentes y producir un resumen matutino de 400 palabras.
Esta es exactamente la carga de trabajo para la que Hermes fue construido. Lo escribí como un skill, lo programé a través del plugin de planificación y lo dejé correr toda la semana. Los resúmenes fueron consistentemente sólidos — típicamente al 90% del camino hacia calidad de publicación. La mañana del día cuatro extrajo un artículo que resultó ser una republicación de un artículo más antiguo que una de las fuentes había movido a la portada. Hermes no detectó la obsolescencia. Fácil de corregir de mi lado (agregar un paso de filtro por fecha al skill), pero vale la pena señalarlo si construyes algo similar.
Coste durante la semana: $0. Tiempo ahorrado frente a leer las fuentes manualmente cada mañana: unos cuarenta minutos al día.
Carga de trabajo 3: generación de borrador de blog en HTML
La tarea: tomar el informe markdown de la carga de trabajo 1 y producir una versión HTML lista para insertar en un CMS.
Aquí es donde las limitaciones del nivel gratuito de DeepSeek V4 se hacen visibles. La estructura HTML era técnicamente correcta — markup válido, etiquetas semánticas, la jerarquía correcta. Pero el gusto de la salida estaba desafinado. Anidación torpe de <div> en lugares que no lo necesitaban. Estilos en línea en lugar de hooks de clase. Una sección hero que parecía markup de 2022. El agente produjo algo que podría enviar, pero que no enviaría realmente sin revisarlo.
Este es el momento donde la respuesta honesta es: empareja Hermes + DeepSeek para el trabajo pesado, y luego pasa la última revisión por Claude Opus 4.7 para el pulido. La economía sigue funcionando — la mayor parte del coste de tokens (investigación + redacción estructurada) va por el nivel gratuito, y solo el último 10% (el HTML sensible al diseño) va por el modelo de pago. Mi análisis completo de Opus 4.7 cubre por qué ese modelo todavía gana su lugar en la cima del pipeline de pulido a pesar del coste.
Carga de trabajo 4: organización de archivos y análisis de hojas de cálculo
La tarea: limpiar una carpeta de Descargas con 312 archivos, categorizarlos por tipo y propósito inferido, moverlos a subcarpetas organizadas y producir un inventario CSV.
Hermes manejó esto perfectamente. La herramienta de operaciones de archivos más DeepSeek V4 Flash para la lógica de clasificación es una combinación potente. El agente identificó los tipos de archivo, infirió propósitos de los nombres y contenidos de archivo donde fue apropiado, los organizó en una estructura limpia y produjo un CSV con la ruta original, la nueva ruta, la categoría inferida y la puntuación de confianza. Veintitrés archivos los marcó como "poco claros" para mi revisión manual. De esos veintitrés, cuatro eran genuinamente ambiguos y los otros diecinueve los clasifiqué en unos noventa segundos.
Coste: $0. Tiempo dedicado a una tarea que llevaba posponiendo dos meses: unos ocho minutos de mi tiempo, principalmente durante el paso de revisión manual. La conclusión honesta es que este es el tipo de trabajo que un agente sin supervisión debería hacer para todos, y el hecho de que ahora cuesta literalmente nada ejecutarlo es el punto al que sigo volviendo.
Carga de trabajo 5: automatización de navegador multi-herramienta
La tarea: iniciar sesión en un panel específico, extraer las analíticas de los últimos 30 días, formatear los números en un informe de estado semanal y enviarlo por correo a un stakeholder.
Esta es la carga de trabajo donde genuinamente no sabía qué esperar. La automatización de navegador es difícil. Los logins persistentes son más difíciles. La orquestación multi-herramienta con puntos de control entre medio — aún más difícil.
Hermes lo hizo. La integración de browser-use manejó el inicio de sesión a través de un perfil guardado. La extracción de analíticas funcionó al primer intento. El paso de formateo usó un skill que había escrito previamente para informes de estado, con el agente recuperándolo correctamente de la memoria procedimental. El paso de correo se enrutó a través de la pasarela de mensajería. Tiempo de ejecución de extremo a extremo: unos once minutos. Coste: $0.
La advertencia honesta: el agente se atascó una vez durante la semana en la misma carga de trabajo, cuando el panel lanzó una actualización de UI que movió el botón de exportación de analíticas. Hermes pasó ocho minutos intentando hacer clic en la ubicación antigua antes de dar un timeout limpiamente y decirme qué había pasado. Ese comportamiento de recuperación — fallar honestamente y decirle al usuario — es significativamente mejor que la mitad de las herramientas de automatización comerciales que he usado.
Dónde gana este stack (y dónde Opus todavía justifica su coste)
Después de una semana ejecutando esta combinación en las cinco cargas de trabajo anteriores más algunos experimentos más pequeños, aquí está el mapa honesto de dónde cada capa del stack gana su lugar.
Hermes + DeepSeek V4 gratis gana en: agregación de investigación, redacción estructurada, operaciones de archivos, análisis de hojas de cálculo, automatización de navegador para interfaces predecibles, flujos de trabajo programados en segundo plano, persecución de objetivos multi-paso, todo donde la salida se trata más de corrección y estructura que de gusto estético.
Hermes + DeepSeek V4 gratis pierde en: salida front-end que requiere gusto por el diseño, texto que necesita voz (la voz de DeepSeek en textos largos en inglés es competente pero reconociblemente "IA" de una manera que no me gusta), razonamiento matizado en contextos extremadamente largos más allá de 300K tokens, todo donde necesitas que el modelo rechace con confianza en lugar de producir una respuesta plausible-pero-incorrecta.
Para la columna de pérdidas, Claude Opus 4.7 sigue siendo mi modelo preferido. El flujo de trabajo interesante que está emergiendo — y que ahora uso a diario — es el patrón de traspaso. Hermes ejecuta sin supervisión en DeepSeek gratis para la mayor parte de una carga de trabajo de agente. Cuando alcanza un paso que necesita gusto, voz o juicio cuidadoso, enruta ese paso específico a Opus a través de una clave API de pago, captura el resultado y continúa. El coste total de un pipeline completo baja de "$30-50 si todo corriera en Opus" a "$1-3 porque solo el paso de pulido corrió en Opus." Mi guía de optimización de costes de agentes IA profundiza en este patrón híbrido si quieres diseñar el tuyo. Y si has seguido la historia más amplia de DeepSeek, mi análisis profundo de DeepSeek V4 Pro cubre la arquitectura del modelo con más detalle del que necesita este artículo.
Las limitaciones honestas que nadie citó en Twitter
Las he ido esparciendo por todo el artículo pero merecen su propia sección porque te ahorrarán tiempo real.
Hermes tiene bugs. Es open source, es joven, se mueve rápido. Me encontré con dos problemas en mi semana de pruebas: una consulta del almacén de memoria que dio timeout en un hilo de conversación particularmente largo (resuelto limpiando la caché FTS5, pero la solución aún no está documentada), y una condición de carrera en el plugin de planificación donde dos skills programados disparándose simultáneamente causaron que uno perdiera su salida. Ninguno fue un impedimento. Ambos requirieron que buceara en el código fuente para entender qué pasaba. Si no te sientes cómodo leyendo Python y esquemas SQLite cuando algo sale mal, espera seis meses.
El nivel gratuito de News Portal podría no durar. Voy a seguir diciendo esto porque es el mayor riesgo individual para toda esta configuración. Planifica tu arquitectura para que cambiar de proveedor de inferencia sea un solo cambio de configuración. Hermes lo hace fácil — el comando hermes model soporta todos los proveedores principales — pero depende de ti probar el cambio antes del día que lo necesites.
La voz de DeepSeek V4 en salida creativa no es la de Opus. Esta es una brecha real. Para investigación, borradores estructurados, código y cualquier salida que se evalúe por corrección, V4 se defiende. Para texto que se evalúa por gusto, sentirás la diferencia. Empareja los modelos para las cargas de trabajo donde esto importa.
Windows nativo es beta. Los flujos de instalación en Linux y macOS son fluidos. El flujo nativo de Windows funciona pero tiene bordes ásperos. Si estás en Windows y tu trabajo depende de que esto funcione de manera fiable, considera ejecutar Hermes dentro de WSL2 — la documentación oficial todavía lo recomienda como la ruta más estable en Windows.
El agente ocasionalmente alucinará capacidades de herramientas. Una vez durante mi semana de pruebas, Hermes intentó usar un skill que no existía (había referenciado un nombre de skill de documentación que había leído, no uno que realmente hubiera escrito). El modo de fallo fue elegante — me dijo que el skill no se encontró y preguntó si quería que escribiera uno — pero es un recordatorio de que incluso agentes con memoria procedimental pueden confundir "leí sobre esto" con "tengo esto". Verifica antes de confiar.
Ninguna de estas es razón para no ejecutar el stack. Son razones para ejecutarlo con los ojos abiertos.
Qué pasa en los próximos seis meses
Quiero cerrar con una predicción, porque creo que esta combinación es genuinamente una señal de hacia dónde se dirige la infraestructura de agentes.
A lo largo de 2025, la conversación sobre runtimes de agentes estuvo dominada por frameworks (LangGraph, AutoGen, CrewAI) que te ayudaban a construir agentes pero asumían que los ejecutarías tú mismo, en tu propia infraestructura, con tu propia factura de modelos. La capa de memoria persistente era hazlo-tú-mismo. El sistema de skills era algo que escribías desde cero cada vez. El coste era lo que dijera tu factura de API.
Lo que Hermes + DeepSeek V4 gratis demuestra es que todo el stack puede comprimirse. Memoria persistente, incluida. Sistema de skills, incluido. Orquestación multi-herramienta, incluida. Pasarelas de mensajería, incluidas. Inferencia de modelo de nivel frontier, gratis. Todo funciona en un VPS de $14.
Los próximos seis meses van a ver mucho más de esto. Otros runtimes de agentes open-source (y ya hay varios en desarrollo que estoy siguiendo) copiarán el patrón de memoria persistente + sistema de skills. Otros proveedores de modelos copiarán el patrón de "nivel gratuito compatible con OpenAI como líder de pérdidas". Otras capas de enrutamiento competirán con News Portal en generosidad del nivel gratuito. Y el coste promedio de ejecutar un agente autónomo para un pequeño negocio colapsará de "unos pocos cientos de dólares al mes" a "el precio de un VPS."
Si eres desarrollador o fundador en solitario, la jugada ahora es empezar a desarrollar músculo con este stack. Configúralo. Ejecuta cargas de trabajo reales. Construye algunos skills. Aprende dónde se rompe. Para cuando la infraestructura sea lo suficientemente madura para cargas de trabajo críticas de producción, tendrás un año de experiencia operativa mientras todos los demás apenas están abriendo la documentación.
El mundo donde cada equipo pequeño tiene un asistente de investigación autónomo 24/7 ejecutándose en infraestructura gratuita ya no es una predicción de 2027. Es un proyecto de fin de semana de 2026. Yo tenía el mío funcionando en nueve minutos. La pregunta que vale la pena considerar esta noche: ¿qué le asignarías a un agente que cuesta $0 ejecutar y nunca duerme?
Preguntas frecuentes
¿Es Hermes Agent realmente gratis con DeepSeek V4?
Sí — la inferencia del modelo en sí es gratuita cuando enrutas Hermes a través del nivel gratuito de News Portal con DeepSeek V4. Sigues pagando por el VPS o la máquina local donde ejecutas Hermes (típicamente $5-15/mes por un VPS utilizable, o $0 si lo auto-alojas en hardware existente). El nivel gratuito podría eventualmente pasar a ser de pago, así que planifica para esa contingencia. Para el recorrido completo de configuración, consulta "El flujo de configuración que me tomó nueve minutos" arriba.
¿Cómo se compara Hermes Agent con AutoGPT o CrewAI?
Hermes es un daemon persistente con memoria entre sesiones incorporada (SQLite con índice FTS5), un sistema de skills procedimental, pasarelas de mensajería nativas y un gateway de herramientas unificado. AutoGPT y CrewAI son frameworks para construir agentes — tú proporcionas la persistencia, la memoria y el despliegue. Hermes está más cerca de un sistema operativo para agentes que de una biblioteca. Para el desglose arquitectónico completo, consulta "Qué es realmente Hermes Agent" arriba.
¿Tiene DeepSeek V4 realmente una ventana de contexto de 1 millón de tokens?
La ventana de contexto anunciada de 1M de tokens se mantiene limpiamente en la práctica hasta unos 128K tokens, con calidad utilizable hasta aproximadamente 300K. Más allá de 300K-400K verás degradación en la precisión de citas y la fiabilidad de referencias cruzadas. Considera el número de 1M como el límite superior, no como el techo de trabajo.
¿Puedo ejecutar Hermes Agent en Windows?
Sí — Windows nativo está en beta temprana y funciona para la CLI, el panel y las pasarelas de mensajería. El instalador descarga una distribución portable de Git Bash junto con las otras dependencias. Si quieres máxima estabilidad, la documentación de Nous Research todavía recomienda WSL2 como la ruta más fiable en Windows.
¿Qué pasa si el nivel gratuito de News Portal cierra?
Hermes soporta varias rutas de inferencia alternativas: la API oficial de DeepSeek directamente (actualmente $0,27/$0,42 por M entrada/salida para V4 Pro), OpenRouter en plan de consumo, o DeepSeek V4 auto-alojado si tienes el presupuesto de GPU. Cambiar de proveedor es un cambio de configuración de una línea vía el comando hermes model, así que diseña tus flujos de trabajo para que el cambio sea trivial.
Trabajemos juntos
¿Buscas construir sistemas de IA, automatizar flujos de trabajo o escalar tu infraestructura tecnológica? Me encantaría ayudar.
- Fiverr (builds e integraciones a medida): fiverr.com/s/EgxYmWD
- Portfolio: mejba.me
- Ramlit Limited (soluciones enterprise): ramlit.com
- ColorPark (diseño y branding): colorpark.io
- xCyberSecurity (servicios de seguridad): xcybersecurity.io