Proxy gratuito de Claude Code: NVIDIA, OpenRouter y Ollama probados
El fin de semana pasado creé una aplicación de seguimiento de hábitos llamada Habitual. Tres iteraciones, dos rediseños, una base de datos real, lógica de rachas de trabajo. Todo, de principio a fin, me costó menos que el precio de una barra de chicle.
Si lo hubiera construido como lo hago normalmente, en mi suscripción Claude Max con Opus 4.7 haciendo el trabajo pesado, el mismo proyecto habría consumido entre cinco y diez dólares de crédito API además de mi suscripción mensual de $200. No es una fortuna. Pero para un proyecto paralelo que podría eliminar la próxima semana, es exactamente el tipo de costo que me hace pensar dos veces antes de abrir la terminal a medianoche.
Esto es lo que cambió. Mantuve Claude Code (la CLI, agent, la ejecución de la herramienta, todo) exactamente igual. No cambié a un IDE diferente. No aprendí un nuevo flujo de trabajo. Simplemente deslicé un pequeño proxy de código abierto debajo, y ese proxy redirigió silenciosamente cada llamada API a un modelo gratuito o casi gratuito en una infraestructura diferente. NVIDIA NIM. OpenRouter. Ollama ejecutándose en mi MacBook. Tres backends, un proxy, la misma interfaz Claude Code que ya conozco.
El resultado no es perfecto. Llegaré a donde se rompe. Pero para la creación de prototipos, el aprendizaje, los proyectos paralelos y la larga cola de "Quiero probar algo pero no quiero pensar en el costo", esto es lo más parecido a un código de trampa que encontré en 2026.
Por qué fui a buscar esto en primer lugar
Mi plan Claude Max cuesta $200/month.. No me quejo: lo quemo todas las semanas en el trabajo del cliente y pagaría el doble por la confiabilidad. Según el [desglose de precios actual] de Anthropic (https://support.claude.com/en/articles/11049741-what-is-the-max-plan), Max 20x me da aproximadamente 20 veces la ventana de uso del nivel Pro, lo que equivale a aproximadamente 220,000 tokens cada cinco horas en el equivalente de API. Para el trabajo Opus 4.7 de día completo, ese es el umbral donde los límites de tarifas dejan de ser una molestia diaria.
Pero hay una matemática diferente que me molesta. El plan Pro a $20/month es el punto de entrada por el que comienzan la mayoría de los desarrolladores. El Max 5x a $100 es la actualización que obtienes cuando Pro comienza a engañarte a mitad de la tarea. Ambos vienen con límites de uso semanal (uno para todos los modelos, otro solo para Sonnet) que se reinician siete días desde el inicio de la sesión. Si estás creando un proyecto paralelo en Pro y superas tu cuota semanal un martes por la tarde, esperas hasta el próximo martes. O paga otros $ 80 para actualizar.
¿Para el trabajo del cliente? Pagalo. La confiabilidad vale cada dólar.
¿Para aprender, crear prototipos y los proyectos personales que tal vez nunca envíe? Ese mismo dinero podría comprarme un año de experimentación en proyectos paralelos si simplemente canalizara las cosas baratas a través de modelos más baratos. El problema: Claude Code es la mejor herramienta de codificación agentic que he usado. La edición de archivos, el sub-agents, el sistema de habilidades, la forma en que maneja tareas de larga duración: ninguna de las alternativas de código abierto lo iguala todavía. Así que cambiar de herramientas para ahorrar dinero estaba fuera de la mesa.
El enfoque de proxy es la solución más limpia que he visto. Guarde la herramienta. Cambia el motor. Tres líneas en un archivo .env.
Si ya ha seguido la ruta OpenRouter con Claude Code usando una configuración personalizada, el proxy que estoy a punto de recorrer es el primo más flexible: maneja tres backends, no uno, y normaliza las peculiaridades del proveedor que la configuración manual omite.
Cómo funciona realmente el proxy (y por qué es importante)
El modelo mental es más simple de lo que parece.
Claude Code, de forma predeterminada, habla con Anthropic en api.anthropic.com. Cada mensaje, cada llamada a una herramienta, cada fragmento de transmisión va allí y regresa. El apoderado interrumpe esa conversación. Usted activa un pequeño servidor FastAPI en su propia máquina, generalmente localhost:8082, que expone las mismas rutas compatibles con Anthropic que Claude Code espera (/v1/messages, /v1/messages/count_tokens, /v1/models). Cuando Claude Code envía una solicitud a esa dirección local en lugar de a Anthropic, el proxy traduce la carga útil al formato que desee el backend real, la activa y traduce la respuesta nuevamente a la forma que Claude Code sabe analizar.
El representante está haciendo el trabajo de traductor en una cumbre de la ONU. Claude Code habla Anthropic. NVIDIA NIM habla con sabor a OpenAI. OpenRouter habla su propio dialecto. Ollama habla algo parecido a OpenAI pero con peculiaridades. El proxy escucha uno y habla con todos los demás, sobre la marcha, en tiempo real, incluidos los tokens de transmisión, los bloques de uso de herramientas, los bloques de razonamiento /thinking y los metadatos de uso que Claude Code utiliza para realizar un seguimiento de los costos.
El repositorio específico que probé es [código claude gratuito de Ali Sharer] (https://github.com/Alishahryar1/free-claude-code) en GitHub. El vídeo fuente con el que trabajé lo llamaba "código de nube libre": es un artefacto de transcripción. El nombre real del proyecto es free-claude-code, de Alishahryar1. Quiero señalarlo desde el principio porque el nombre incorrecto lo enviará a una madriguera de bifurcaciones y proyectos no relacionados cuando busque.
Hay una segunda cosa que hace el proxy que es fácil pasar por alto: normaliza los errores del proveedor. Cuando DeepSeek genera una respuesta de límite de velocidad 429, o NVIDIA NIM devuelve un bloque de llamada de herramienta con formato incorrecto, o Ollama trunca silenciosamente una respuesta larga, el error sin formato bloquearía Claude Code o lo enviaría a un bucle de reintento confuso. El proxy los detecta, los transforma en errores de estilo Anthropic y Claude Code los maneja con elegancia. Esa única capa de normalización de errores es la razón por la que el enfoque de proxy funciona en la práctica y una configuración ingenua de "sólo apuntar a OpenRouter" falla en diez minutos.
Ahora, la parte que importa es cuando realmente intentas esto. Cada uno de los tres backends se comporta de manera diferente y las compensaciones no son simétricas.
Los tres backends, uno al lado del otro
Antes de pasar a través de la configuración, esto es lo que realmente estás eligiendo. Probé los tres con el mismo proyecto (Habitual, el rastreador de hábitos) y así es como funcionaron.
NVIDIA NIM: Gratis, pero te registras
NVIDIA NIM es el ganador sorpresa del juego de nivel gratuito. A partir de abril de 2026, la [plataforma build.nvidia.com] de NVIDIA (https://build.nvidia.com/) alberga más de 100 modelos con acceso gratuito a API para cualquier persona en NVIDIA Developer Program. Sin tarjeta de crédito. Sin plan pago. Te registras, obtienes una clave y obtienes 1000 créditos de inferencia gratuitos con un límite de velocidad de 40 solicitudes por minuto en el nivel gratuito.
El modelo principal en NIM en este momento es GLM-5 (744 mil millones de parámetros), el modelo MoE de frontera de Z.ai que fue de código abierto en febrero de 2026. Las cifras de referencia son reales: GLM-4.7 (la generación anterior) alcanza el 73,8% en SWE-bench y el 41% en Terminal Bench 2.0, según el anuncio de Cerebras GLM-4.7. GLM-5 y el más reciente GLM-5.1 son pasos notables por encima de eso. Para tareas de codificación dirigidas a través de Claude Code, los modelos GLM superan con creces su clase de costo.
La desventaja: NIM es más lento que OpenRouter. La transmisión está bien. Los arranques en frío en los modelos más grandes pueden tardar entre 8 y 12 segundos antes de la primera señal. Para un bucle Claude Code agentic con docenas de llamadas a herramientas por minuto, esos segundos se suman.
OpenRouter: barato, rápido y extenso
OpenRouter es la puerta de enlace que utilizo de forma predeterminada. Es un agregador: obtienes un API key, un punto final y acceso a casi todos los modelos comerciales y de código abierto a través de una única cuenta de facturación. El precio es lo más cerca que está el mundo LLM de un mercado de productos básicos.
Números reales de la página de precios de OpenRouter a mayo de 2026:
- DeepSeek V4 Flash: 0,14 USD por millón de tokens de entrada, 0,28 USD por millón de tokens de salida
- DeepSeek V3.2: $0,252 de entrada / $0,378 de salida por millón de tokens
- DeepSeek V4 Pro: $0,435 de entrada / $0,87 de salida por millón de tokens (tasa promocional que aumentará a $1,74 / $3,48 después del 5 de mayo de 2026)
- DeepSeek R1: $0,70 de entrada / $2,50 de salida por millón de tokens
Compare esos números con los [precios de API] publicados por Anthropic (https://platform.claude.com/docs/en/about-claude/pricing): Opus 4.7 tiene una entrada de $5 y una salida de $25 por millón de tokens. Sonnet 4.6 tiene una entrada de $3 y una salida de $15. Incluso Haiku 4.5 a $1/$5 es más caro que DeepSeek V4 Flash por un amplio margen.
Para Habitual, quemé aproximadamente 850.000 tokens en toda la construcción: planificación, andamiaje, tres iteraciones, depuración y pulido. En Opus 4.7 eso me habría costado entre $ 7 y 9 en el costo de API. En DeepSeek V4 Flash a OpenRouter, me costó 23 centavos. Veintitrés centavos. Tengo que seguir diciéndolo porque cada vez que hago los cálculos todavía me quedo un poco aturdido.
Una corrección que vale la pena hacer: el vídeo fuente a partir del cual creé esta publicación hacía referencia a "DeepSeek Flash V4 de Anthropic". DeepSeek V4 Flash es un modelo de DeepSeek, no Anthropic. DeepSeek y Anthropic son empresas completamente independientes: DeepSeek es un laboratorio chino AI, Anthropic es la empresa que fabrica Claude. Los nombres se vuelven borrosos en el contenido que se mueve rápidamente, pero la distinción es importante porque cambia la forma de pensar sobre el flujo de datos y los términos de servicio que se aplican.
Ollama: gratuito, privado, vinculado al hardware
Ollama ejecuta modelos completamente en su máquina local. Ninguna llamada API sale de su computadora portátil. Ningún tercero ve su código. Para trabajos confidenciales o de acuerdo de confidencialidad, esta es la única opción de la lista que es realmente privada.
El problema es el hardware. La generación actual incluye Llama 4 (el buque insignia de Meta) y Gemma 4 (la serie de peso abierto de Google). En Apple Silicon, Ollama v0.19+ utiliza automáticamente el marco MLX de Apple para una inferencia más rápida; ese es el desbloqueo que hace que los modelos locales sean realmente utilizables en un MacBook. Según la [documentación Gemma 4 de Unsloth] (https://unsloth.ai/docs/models/gemma-4), las variantes más pequeñas, E2B y E4B, alcanzan aproximadamente 95 y 57 tokens por segundo respectivamente en una Mac de generación actual. Se recomienda la variante de 26B para más de 24GB de memoria unificada.
Ejecuté Gemma 4 12B localmente en un MacBook de la serie M con 32 GB de RAM. Las ediciones de un solo archivo y las pequeñas refactorizaciones funcionaron bien. En el momento en que Claude Code intentó cargar cuatro archivos en contexto para un cambio de varios archivos, el modelo comenzó a ralentizarse: de 8 a 12 segundos entre llamadas a la herramienta, y la calidad de salida disminuyó en cualquier cosa que requiriera tener más de dos archivos en mente a la vez.
Si tiene una estación de trabajo con un NVIDIA GPU discreto, esta historia cambia por completo. En una computadora de escritorio con un 4090 o mejor, Llama 4 70B es realmente rápido y la calidad se mantiene en tareas complejas. ¿En un MacBook sin ese GPU? Utilice Ollama para tareas breves y específicas en las que la privacidad sea importante. Utilice OpenRouter o NIM para cualquier otra cosa. También hay un error de transmisión en Ollama v0.20.3 conocido que maneja mal las respuestas de llamada de herramientas de Gemma 4: fije a v0.19.x o espere la solución si lo logra.
Ahora, la configuración real.
Paso a paso: cómo ejecutar el proxy
Esta es la sección que me gustaría si empezara desde cero. Supongo que ya tienes instalado Claude Code. Si no lo hace, instálelo primero mediante las [instrucciones oficiales de Anthropic] (https://docs.claude.com/en/docs/claude-code): el proxy no reemplaza a Claude Code, se encuentra debajo de él.
Paso 1: Instalar los requisitos previos
Necesita Python 3.14 y uv (el rápido administrador de paquetes de Python). En MacOS:
curl -LsSf https://astral.sh/uv/install.sh | sh
# Install Python 3.14 via uv
uv python install 3.14
En Windows PowerShell:
powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"
uv python install 3.14
El motivo de uv en lugar de pip: es aproximadamente entre 10 y 100 veces más rápido para resolver dependencias, y el repositorio proxy pyproject.toml está configurado para ello. Puedes usar pip si insistes, pero uv hace que la instalación sea instantánea.
Paso 2: clonar el repositorio
git clone https://github.com/Alishahryar1/free-claude-code.git
cd free-claude-code
cp .env.example .env
Ese paso .env.example → .env es donde la mayoría de la gente se equivoca. El archivo .env está oculto de forma predeterminada en macOS. Si no puede verlo en Finder, presione Cmd+Shift+. (punto) para alternar archivos ocultos. En la terminal, ls -la lo muestra. En VS Code, se muestra de forma predeterminada. Esto suena trivial, pero la primera vez perdí diez minutos preguntándome por qué mis ediciones no se mantenían: estaba editando un archivo en un directorio diferente.
Paso 3: Obtenga sus claves API
Elija un servidor. Puede configurar los tres más adelante, pero comience con uno para confirmar que el proxy funciona.
OpenRouter: Regístrese en openrouter.ai, agregue $5 de crédito (le durará semanas) y obtenga un API key desde el tablero. Cinco dólares en OpenRouter son suficientes para crear varias aplicaciones completas a través de DeepSeek V4 Flash.
NVIDIA NIM: Regístrese en build.nvidia.com, únase a NVIDIA Developer Program (gratis) y genere un API key. Obtienes 1000 créditos gratis de inmediato. No se requiere tarjeta de crédito.
Ollama: Instale desde ollama.com, luego extraiga un modelo. Para codificar en un MacBook con 16-32 GB de RAM, comience con ollama pull gemma4:e4b. Para una estación de trabajo con GPU, ollama pull llama4:70b serios. No se necesita API key: Ollama se ejecuta localmente.
Paso 4: Editar .env
Abra .env en el editor de su elección. El archivo tiene bloques comentados para cada backend. Descomentas el que quieras y rellenas la clave y el nombre del modelo. Aquí hay una configuración OpenRouter que funciona:
# Backend selection
PROVIDER=openrouter
# OpenRouter
OPENROUTER_API_KEY=sk-or-v1-xxxxxxxxxxxxxxxxx
OPENROUTER_MODEL=deepseek/deepseek-v4-flash
# Proxy port
PORT=8082
Para NVIDIA NIM, cambie a:
PROVIDER=nvidia_nim
NVIDIA_API_KEY=nvapi-xxxxxxxxxxxxxxxxx
NVIDIA_MODEL=zai-org/glm-5
PORT=8082
Para Ollama (no se necesita clave):
PROVIDER=ollama
OLLAMA_MODEL=gemma4:e4b
OLLAMA_HOST=http://localhost:11434
PORT=8082
Paso 5: Iniciar el proxy
Desde el directorio del repositorio:
uv run main.py
Deberías ver algo como Uvicorn running on http://0.0.0.0:8082. Deje esta terminal abierta: el proxy debe seguir ejecutándose mientras usa Claude Code.
Paso 6: Apunte Claude Code al Proxy
En una nueva terminal, configure la variable de entorno que le indica a Claude Code dónde enviar las solicitudes y luego inicie:
export ANTHROPIC_BASE_URL=http://localhost:8082
export ANTHROPIC_API_KEY=anything
claude
El valor de ANTHROPIC_API_KEY no importa: el proxy lo ignora y usa la clave real de .env para autenticarse con el backend real. Pero Claude Code se niega a comenzar sin algún valor en esa variable, así que configúrelo en cualquier valor que no esté vacío.
Si desea que este sea el valor predeterminado para un proyecto, coloque esas exportaciones en un archivo .envrc (con direnv) o en un script de inicio local del proyecto. Mantengo un alias de shell claude-cheap que exporta ambas variables y lanza Claude Code de una sola vez.
Esa es toda la configuración. Seis pasos, tal vez diez minutos si te mueves con cuidado. La primera vez que lo revisé me tomó alrededor de veinte; la mayor parte fue la confusión del archivo .env oculto y un nombre de modelo incorrecto en la configuración OpenRouter que devolvió un 404 confuso.
Si ha seguido alguna de mis otras guías de flujo de trabajo Claude Code, este es el mismo Claude Code que ya usa: cada comando, cada comando de barra diagonal, cada habilidad. La única diferencia es qué modelo está haciendo la inferencia bajo el capó.
Cómo fue construir realmente Habitual
Quiero hablar sobre la construcción real, no porque la aplicación importe, sino porque las asperezas solo aparecen cuando impulsas un proyecto real. Habitual es un rastreador de hábitos: controles diarios, conteo de rachas, un mapa de calor del calendario, todo lo estándar. Así es como sucedió en cada backend.
DeepSeek V4 Flash a través de OpenRouter
Este fue el caballo de batalla. Comencé con un mensaje de un párrafo: "Constrúyame un rastreador de hábitos mínimos, usuario único, aplicación web, Tailwind, Vanilla JS, registro diario con contador de rachas y una cuadrícula de calendario de 30 días". Claude Code (que se ejecuta a través del proxy en DeepSeek V4 Flash) planificó la estructura, organizó los archivos, escribió HTML y JavaScript y lo ejecutó.
La primera iteración fue difícil: la lógica de la racha estaba fuera de uno y la cuadrícula del calendario tenía un error entre UTC y la hora local. Le pedí que arreglara ambos. Los arregló. Le pedí que agregara una opción de "saltar días" que no rompa la racha (días de descanso para hábitos sostenibles). Refactorizó limpiamente el cálculo de la racha.
Tres iteraciones después, aplicación funcional. Gasto total de tokens: 850.000 tokens, divididos aproximadamente en partes iguales entre entrada y salida. Costo total: alrededor de $0,21. La calidad de salida estuvo notablemente por debajo de lo que produciría Opus 4.7 (los nombres de las variables eran un poco genéricos, los comentarios eran más escasos, el manejo de errores fue mínimo), pero para un proyecto paralelo en el que voy a refactorizar todo lo que conservo, está bien.
El único lugar donde DeepSeek V4 Flash tuvo problemas visibles fue cuando le pedí que agregara persistencia IndexedDB con la lógica de migración adecuada. Opus 4.7 habría escrito el esquema, el ejecutor de migración y el manejo de la versión en una sola pasada. DeepSeek escribió bien el esquema, se perdió la migración por completo y tuve que preguntar dos veces antes de implementar algo que sobreviviera a un cambio de esquema. Para la mayoría de los trabajos CRUD, la brecha es invisible. Para cualquier cosa que requiera un pensamiento sistémico cuidadoso, sentirá la diferencia.
GLM-5 vía NVIDIA NIM
Una vez que la aplicación funcionó, reconstruí el mismo proyecto desde cero en NIM con GLM-5 para comparar. GLM-5 es, en papel, un modelo mucho más grande que DeepSeek V4 Flash: 744B de parámetros MoE frente a la variante flash más pequeña de DeepSeek. Y la calidad de salida lo demostró. Los nombres de las variables eran mejores. Los comentarios fueron más reflexivos. La implementación de IndexedDB fue correcta en la primera pasada.
La compensación fue la velocidad. Cada llamada a la herramienta tomó notablemente más tiempo: llámelo de 4 a 8 segundos versus 2 a 3 en OpenRouter. Para un flujo de trabajo agentic con más de 40 llamadas a herramientas en una sesión, eso se agrava. La construcción completa tomó aproximadamente el doble de tiempo, aunque el modelo necesitó menos cambios porque el resultado fue de mayor calidad la primera vez.
NIM también es gratuito en el nivel de crédito de desarrollador, lo que hace que la compensación de velocidad sea más fácil de aceptar. Si fuera a hacer una inferencia de peso abierto de nivel de producción, GLM-5 en NIM sería mi opción predeterminada. Para una iteración rápida en proyectos secundarios desechables, OpenRouter gana solo en capacidad de respuesta.
Gemma 4 12B vía Ollama
Aquí es donde las compensaciones se hicieron ruidosas. En mi MacBook con 32 GB de memoria unificada, Gemma 4 12B se cargó bien y ejecutó las cosas pequeñas (ediciones de un solo archivo, refactorizaciones simples, nombres de cosas) a aproximadamente 30-40 tokens por segundo. Realmente utilizable.
En el momento en que Claude Code intentó cargar cuatro o cinco archivos en contexto para una refactorización de múltiples archivos, las cosas fallaron. La transmisión se ralentizó dramáticamente. Las llamadas a herramientas comenzaron a agotarse. Uno de ellos truncó silenciosamente la respuesta a mitad de camino, que es el modo de falla que el proxy no puede solucionar por completo: Ollama simplemente devuelve menos de lo que debería y Claude Code cree que la tarea está terminada.
Específicamente para Habitual, Gemma 4 12B superó el andamio inicial pero no pudo manejar la refactorización lógica de rachas sin que yo lo alimentara manualmente, un archivo a la vez. En una estación de trabajo con 4090, esto no sería un problema. En un MacBook sin un GPU discreto, trate el Ollama local como una herramienta para tareas breves y específicas en lugar de un controlador diario Claude Code.
Hay una conversación más profunda sobre el desarrollo local de AI que vale la pena tener; profundicé en ello en [mi publicación de configuración local de Gemma 4] (https://www.mejba.me/gemma-chat-offline-vibe-coding-mac), pero la versión corta es: Apple Silicon es realmente impresionante para la inferencia local y todavía no es un sustituto de los modelos de nivel de nube en los flujos de trabajo de codificación agentic.
El verdadero movimiento de poder: orquestación multimodelo
Aquí es donde esto se vuelve interesante más allá de ahorrar dinero. Una vez que tenga un proxy que pueda enrutar a diferentes modelos, estará a un paso del patrón de orquestación que silenciosamente se está convirtiendo en el predeterminado para el desarrollo serio de AI.
La idea: utilizar Opus 4.6 (o 4.7) en su suscripción paga Anthropic como planificador y orquestador. Haga que divida una tarea compleja en subtareas discretas. Luego, delega cada subtarea a un modelo económico (DeepSeek V4 Flash, GLM-5, lo que sea) a través del proxy. Opus revisa los resultados, los integra y sólo quema su costoso contexto en el pensamiento de alto apalancamiento.
En la práctica, esto parece ejecutar dos instancias Claude Code una al lado de la otra. Una es su sesión principal en Anthropic-direct, realizando la orquestación y las decisiones arquitectónicas. La otra es la sesión de proxy que se ejecuta en un backend económico, ejecutando el trabajo de implementación de rutina: generar el archivo de prueba, escribir el texto estándar, actualizar los documentos, refactorizar esta función. Entregas subtareas de la primera a la segunda y luego vuelves a la primera para integrarlas.
He estado haciendo variaciones de esto durante algunos meses. La matemática simbólica se vuelve convincente rápidamente. Un día típico en el que podría quemar entre 3 y 4 millones de tokens de Opus al suscribirme se convierte en quizás 800K de Opus (la planificación, la integración, las partes difíciles) y 3M de DeepSeek a través del proxy (la ejecución, el texto estándar, los refactores de rutina). La calidad de salida es indistinguible del producto terminado. El tiempo empleado es similar. La diferencia de costos es dramática.
Este patrón hace eco de lo que cubrí en la guía del SDK agent de Anthropic: el futuro de la codificación agentic no es "un modelo gigante que lo hace todo", sino "un buen modelo organiza muchos modelos baratos". El proxy es la pieza que falta y que hace que esto sea práctico sin escribir código de orquestación personalizado.
En qué se equivoca este enfoque (la parte honesta)
Mentiría si dijera que se trata de un reemplazo directo del Claude Code pago. Existen limitaciones reales y debes conocerlas antes de comprometer un proyecto real con esta pila.
Los modelos baratos pierden detalles finos en los límites de tareas complejas. Mencioné esto con la migración de IndexedDB. Se muestra más en: razonamiento async/concurrency complejo, implicaciones de seguridad sutiles, refactorizaciones profundas que tocan muchos archivos a la vez y cualquier cosa que requiera una sólida comprensión de las compensaciones arquitectónicas. Durante el 70-80% del trabajo de codificación típico, no lo notarás. Para el 20% difícil, sentirás la brecha.
Algunas características de Claude Code suponen Anthropic-direct. El modo rápido (el nuevo nivel de baja latencia en Claude Code 2.x) produce errores en backends que no son Anthropic porque depende de optimizaciones de transmisión específicas de Anthropic. Algunas habilidades y complementos que utilizan formatos de uso de herramientas específicos de Claude pueden comportarse de manera extraña. La mayoría de las funciones principales (edición de archivos, sub-agents, comandos de barra diagonal, el sistema de habilidades) funcionan bien. Los casos extremos te harán tropezar.
Las sesiones largas se degradan más rápido en modelos baratos que en Opus. Descubrí que alrededor de 50,000 tokens en una sesión, la calidad de salida en DeepSeek V4 Flash comienza a disminuir notablemente. El modelo pierde la noción de decisiones anteriores, se contradice y comienza a alucinar firmas de funciones anteriores en la conversación. La solución es mecánica: cuando llegue a esa pared, salga de Claude Code, reinicie con un contexto nuevo y vuelva a cargar los archivos relevantes. En la ventana contextual de 1M de Opus 4.7, esto rara vez es necesario hasta que la sesión está mucho más avanzada.
Los modelos locales en un MacBook sin un GPU son realmente lentos. Cubrí esto en la sección Ollama pero vale la pena repetirlo. Trate a Ollama-on-MacBook como una herramienta de privacidad, no como una herramienta de productividad. Para obtener un rendimiento real de inferencia local, necesita el hardware NVIDIA GPU.
Cambio de privacidad y flujo de datos. Cuando enrutas a través de OpenRouter o NIM, tus indicaciones y código pasan a través de su infraestructura. OpenRouter tiene políticas de privacidad razonables y no se entrena con sus datos de forma predeterminada, pero es un salto adicional y una empresa adicional que ve su código. Para trabajo con clientes, trabajo de NDA o cualquier cosa sensible: permanezca en Anthropic-direct o vaya a Ollama-local completo. Sin término medio.
Los ahorros en suscripciones tienen un límite. Si ya estás pagando por Max ($100-200/month), no vas a ahorrar toda la suscripción enrutando proyectos personales a través del proxy; aún querrás Max para el trabajo de cliente y de producción. Los ahorros aparecen como "Ya no compraré créditos API además de mi suscripción para experimentos personales", lo cual es real pero limitado.
La gama de modelos también avanza rápidamente. Los nombres en esta publicación (DeepSeek V4 Flash, GLM-5, GLM-5.1, Gemma 4) estaban actualizados en mayo de 2026. Para cuando lea esto, es posible que haya productos emblemáticos más nuevos a precios más bajos. Consulte la página de precios de OpenRouter y el catálogo de modelos NVIDIA NIM antes de comprometerse con un modelo específico en su .env.
Lo que le diría a alguien a partir de hoy
Si estás pensando en probar esto, este es el camino que tomaría si comenzara de nuevo.
Dedique diez minutos a la configuración de OpenRouter con DeepSeek V4 Flash. Deposite $5 en crédito. Ejecute el proxy. Cree algo pequeño: un script, una aplicación pequeña, cualquier cosa en la que de otro modo gastaría unos minutos de cuota de suscripción. Note cómo se siente. La fricción es casi nula y el costo es casi nulo.
Si esa experiencia te engancha (a mí me enganchó), configura NVIDIA NIM como tu segundo backend. El nivel gratuito con GLM-5 es realmente bueno y le brinda un respaldo de mayor calidad cuando DeepSeek V4 Flash no es suficiente. Cambiar de backend es una línea en .env y un reinicio del proxy.
No se moleste con Ollama a menos que tenga una estación de trabajo con un GPU real o necesite específicamente privacidad solo local. En un MacBook, la experiencia lo decepcionará y esa es la primera impresión equivocada para lo que de otro modo sería una gran cadena de herramientas.
Una vez que se sienta cómodo, pruebe el patrón de orquestación. Ejecute Opus en Anthropic-direct para la planificación y la arquitectura. Ejecute DeepSeek a través del proxy para la ejecución. El ahorro de costos se acumula rápidamente y el flujo de trabajo se siente sorprendentemente natural después de unos días.
Y sigue pagando a Max por el trabajo que importa. Este enfoque de proxy no reemplaza lo que Anthropic le cobra: confiabilidad, soporte y el mejor modelo de su clase para los problemas difíciles. Es una forma de ampliar su presupuesto de experimentación en un orden de magnitud sin renunciar a la interfaz Claude Code que ya ama.
La aplicación Habitual todavía está en mi teléfono. Lo reviso todas las mañanas. Me costó 23 centavos construirlo, se ejecuta completamente en mi navegador y realmente lo uso. Si la próxima semana quiero agregar categorías de hábitos o informes semanales o un sistema de notificación, encenderé el proxy, señalaré Claude Code en OpenRouter y repetiré para obtener otro puñado de centavos. Ese es el desbloqueo.
El resto de 2026 será un viaje salvaje para las herramientas AI. Los modelos son cada vez más baratos. Las opciones de peso abierto están alcanzando a los modelos de frontera cerrada más rápido de lo que nadie predijo. El enfoque proxy es la forma adecuada para este momento: mantenga la mejor UX, diríjase a cualquier modelo que tenga sentido para la tarea y deje que el mercado de inferencia haga lo suyo.
Construya el proyecto paralelo. Constrúyalo a través del proxy. Gasta el dólar que ahorraste en café.
Preguntas frecuentes
¿Cuánto cuesta ejecutar Claude Code a través del Claude Code proxy gratuito?
Para la mayoría de los proyectos personales, los costos van desde absolutamente gratuitos (créditos NVIDIA NIM o Ollama local) hasta menos de $1 por compilación de aplicación (DeepSeek V4 Flash en OpenRouter a $0,14 tokens de entrada /M). El mismo proyecto en Anthropic API directo costaría entre 5 y 10 dólares. La configuración es gratuita; su único gasto es la inferencia en cualquier backend que elija.
¿El proxy funciona con todas las funciones de Claude Code?
La mayoría de las funciones funcionan: edición de archivos, sub-agents, comandos de barra diagonal, habilidades, MCP servers, flujos de trabajo de varios archivos. La excepción notable es el modo rápido, que depende de optimizaciones de transmisión específicas de Anthropic y errores en backends que no son Anthropic. Algunos complementos que utilizan formatos de uso de herramientas específicos de Anthropic también pueden comportarse de manera extraña. Consulte el tutorial de implementación anterior para conocer la configuración completa.
¿Es seguro enviar mi código a través de OpenRouter o NVIDIA NIM?
Para proyectos personales y trabajos de código abierto, ambos proveedores tienen políticas de privacidad razonables y no se entrenan con sus datos de forma predeterminada. Para trabajo de cliente, código vinculado a NDA o cualquier cosa con credenciales, permanezca en Anthropic-direct o use Ollama localmente; su código nunca sale de su máquina con Ollama. No existe un término medio seguro para el trabajo delicado.
¿Cuál es el mejor modelo gratuito para usar con el proxy?
Para codificar, GLM-5 en NVIDIA NIM es la opción gratuita más sólida: parámetros 744B, calidad de primera clase y gratis con el registro de desarrollador. DeepSeek V4 Flash en OpenRouter es el más barato con tokens de entrada /M de $ 0,14 (no es gratis, pero está cerca), y es más rápido que NIM. Solo para local, Gemma 4 E4B en Ollama funciona en Apple Silicon pero tiene límites de hardware.
¿Puedo cambiar entre servidores sin reinstalar?
Sí. Cambie el valor PROVIDER en su archivo .env, reinicie el proxy con uv run main.py y Claude Code utilizará el nuevo backend en su próxima solicitud. No es necesario reiniciar Claude Code. Muchos usuarios conservan varios archivos .env (.env.openrouter, .env.nim, .env.ollama) y vinculan simbólicamente el activo.
Trabajemos juntos
¿Quiere crear sistemas AI, automatizar flujos de trabajo o ampliar su infraestructura tecnológica? Me encantaría ayudar.
- Fiverr (compilaciones e integraciones personalizadas): fiverr.com/s/EgxYmWD
- Cartera: mejba.me
- Ramlit Limited (soluciones empresariales): ramlit.com
- ColorPark (diseño y marca): colorpark.io
- xCyberSecurity (servicios de seguridad): xcybersecurity.io