Skip to main content
📝 Claude Code

Proxy Claude Code gratuit : NVIDIA, OpenRouter et Ollama testés

J'ai testé un Claude Code proxy gratuit qui redirige vers NVIDIA NIM, OpenRouter et Ollama. Construit un outil de suivi des habitudes pour quelques centimes

30 min

Temps de lecture

5,819

Mots

May 02, 2026

Publié

Engr Mejba Ahmed

Écrit par

Engr Mejba Ahmed

Partager l'article

Proxy Claude Code gratuit : NVIDIA, OpenRouter et Ollama testés

Proxy Claude Code gratuit : NVIDIA, OpenRouter et Ollama testés

J'ai créé une application de suivi des habitudes appelée Habitual le week-end dernier. Trois itérations, deux refontes, une vraie base de données, une logique de séquences de travail. Le tout – du début à la fin – m’a coûté moins cher que le prix d’un chewing-gum.

Si je l'avais construit comme je le fais habituellement, sur mon abonnement Claude Max avec Opus 4.7 faisant le gros du travail, le même projet aurait consommé entre cinq et dix dollars de crédit API en plus de mon abonnement mensuel de 200 $. Pas une fortune. Mais pour un projet parallèle que je pourrais supprimer la semaine prochaine, c'est exactement le genre de coût qui me fait réfléchir à deux fois avant d'ouvrir le terminal à minuit.

Voici ce qui a changé. J'ai gardé Claude Code - la CLI, le agent, l'exécution de l'outil, tout cela - exactement le même. Je ne suis pas passé à un autre IDE. Je n'ai pas appris un nouveau flux de travail. Je viens de glisser un petit proxy open source en dessous, et ce proxy a redirigé discrètement chaque appel API vers un modèle gratuit ou quasi-gratuit sur une infrastructure différente. NVIDIA NIM. OpenRouter. Ollama exécuté sur mon MacBook. Trois backends, un proxy, la même interface Claude Code que je connais déjà froidement.

Le résultat n'est pas parfait. Je vais voir où ça craque. Mais pour le prototypage, l'apprentissage, les projets parallèles et la longue traîne de « Je veux essayer quelque chose mais je ne veux pas penser au coût » — c'est la chose la plus proche d'un code de triche que j'ai trouvé en 2026.

Pourquoi je suis allé chercher ça en premier lieu

Mon forfait Claude Max coûte 200 $/month.. Je ne me plains pas : je le brûle chaque semaine pour le travail d'un client et je paierais le double pour la fiabilité. Selon la [répartition actuelle des prix] de Anthropic (https://support.claude.com/en/articles/11049741-what-is-the-max-plan), Max 20x me rapporte environ 20 fois la fenêtre d'utilisation du niveau Pro, ce qui équivaut à environ 220 000 jetons toutes les cinq heures sur l'équivalent API. Pour un travail d'une journée complète avec Opus 4.7, c'est le seuil à partir duquel les limites de débit cessent d'être une nuisance quotidienne.

Mais il y a un calcul différent qui me dérange. Le plan Pro à 20 $/month est le point d'entrée par lequel la plupart des développeurs commencent réellement. Le Max 5x à 100 $ est la mise à niveau que vous obtenez lorsque Pro commence à vous fantôme en cours de tâche. Les deux sont livrés avec des limites d’utilisation hebdomadaires – une pour tous les modèles, une pour Sonnet uniquement – ​​qui sont réinitialisées sept jours à compter du début de votre session. Si vous créez un projet parallèle sur Pro et que vous dépassez votre quota hebdomadaire un mardi après-midi, vous attendez mardi prochain. Ou vous déboursez 80 $ supplémentaires pour mettre à niveau.

Pour le travail du client ? Payez-le. La fiabilité vaut chaque dollar.

Pour l'apprentissage, le prototypage et les projets personnels que je ne pourrais jamais livrer ? Ce même argent pourrait m'acheter un an d'expérimentation sur des projets parallèles si je me contentais d'acheminer les produits bon marché vers des modèles moins chers. Le hic : Claude Code est le meilleur outil de codage agentic que j'ai jamais utilisé. L'édition de fichiers, le sous-agents, le système de compétences, la façon dont il gère les tâches de longue durée - aucune des alternatives open source ne lui correspond encore. Il n’était donc pas envisageable de changer d’outil pour économiser de l’argent.

L'approche proxy est la solution de contournement la plus simple que j'ai vue. Gardez l'outil. Changez le moteur. Trois lignes dans un fichier .env.

Si vous avez déjà emprunté la route OpenRouter avec Claude Code en utilisant une configuration personnalisée, le proxy que je suis sur le point de parcourir est le cousin le plus flexible : il gère trois backends, pas un, et il normalise les bizarreries du fournisseur que la configuration manuelle manque.

Comment fonctionne réellement le proxy (et pourquoi c'est important)

Le modèle mental est plus simple qu’il n’y paraît.

Claude Code, par défaut, communique avec API de Anthropic à api.anthropic.com. Chaque invite, chaque appel d'outil, chaque morceau de streaming y va et revient. Le proxy interrompt cette conversation. Vous démarrez un petit serveur FastAPI sur votre propre machine – généralement localhost:8082 – qui expose les mêmes routes compatibles Anthropic que Claude Code attend (/v1/messages, /v1/messages/count_tokens, /v1/models). Lorsque Claude Code envoie une requête à cette adresse locale au lieu de celle de Anthropic, le proxy traduit la charge utile dans le format souhaité par le backend, la déclenche et retraduit la réponse dans la forme que Claude Code sait analyser.

Le mandataire fait le travail d’un traducteur lors d’un sommet de l’ONU. Claude Code parle Anthropic. NVIDIA NIM parle au goût OpenAI. OpenRouter parle son propre dialecte. Ollama parle quelque chose de proche de OpenAI mais avec des bizarreries. Le proxy en écoute un et parle de tous les autres, à la volée, en temps réel, y compris les jetons de streaming, les blocs d'utilisation des outils, les blocs de raisonnement /thinking et les métadonnées d'utilisation que Claude Code utilise pour suivre les coûts.

Le dépôt spécifique que j'ai testé est [le code libre-claude d'Ali Sharer] (https://github.com/Alishahryar1/free-claude-code) sur GitHub. La vidéo source sur laquelle j'ai travaillé l'appelait « free-cloud-code » – c'est un artefact de transcription. Le nom réel du projet est free-claude-code, par Alishahryar1. Je tiens à le signaler dès le départ, car un mauvais nom vous enverra dans un terrier de fourchettes et de projets sans rapport lorsque vous effectuerez une recherche.

Il y a une deuxième chose que fait le proxy et qu'il est facile de manquer : il normalise les erreurs du fournisseur. Lorsque DeepSeek renvoie une réponse de limite de débit 429, ou que NVIDIA NIM renvoie un bloc d'appel d'outil mal formé, ou que Ollama tronque silencieusement une longue réponse, l'erreur brute ferait planter Claude Code ou l'enverrait dans une boucle de nouvelle tentative confuse. Le proxy les détecte, les remodèle en erreurs de style Anthropic et Claude Code les gère avec élégance. Cette seule couche de normalisation des erreurs est la raison pour laquelle l'approche proxy fonctionne dans la pratique et une configuration naïve "il suffit de pointer sur OpenRouter" tombe en dix minutes.

Maintenant, la partie qui compte lorsque vous essayez réellement ceci. Les trois backends se comportent chacun différemment et les compromis ne sont pas symétriques.

Les trois backends, côte à côte

Avant de passer en revue la configuration, voici ce que vous choisissez réellement. J'ai testé les trois avec le même projet – Habitual, le suivi des habitudes – et voici comment ils se sont déroulés.

NVIDIA NIM : gratuit, mais vous vous inscrivez

NVIDIA NIM est le gagnant surprise du jeu gratuit. Depuis avril 2026, la [plate-forme build.nvidia.com] (https://build.nvidia.com/) de NVIDIA héberge plus de 100 modèles avec un accès gratuit à API pour toute personne appartenant au NVIDIA Developer Program. Pas de carte de crédit. Pas de forfait payant. Vous vous inscrivez, récupérez une clé et vous obtenez 1 000 crédits d'inférence gratuits avec une limite de débit de 40 requêtes par minute sur le niveau gratuit.

Le modèle phare sur NIM à l'heure actuelle est GLM-5 (744 milliards de paramètres), le modèle MoE frontière de Z.ai qui était open source en février 2026. Les chiffres de référence sont réels : GLM-4.7 (la génération précédente) atteint 73,8 % sur SWE-bench et 41 % sur Terminal Bench 2.0, selon le Cerebras Annonce GLM-4.7. GLM-5 et le plus récent GLM-5.1 sont des étapes notables au-dessus. Pour les tâches de codage acheminées via Claude Code, les modèles GLM dépassent largement leur catégorie de coût.

L'inconvénient : NIM est plus lent que OpenRouter. Le streaming, c'est bien. Les démarrages à froid sur les plus gros modèles peuvent prendre 8 à 12 secondes avant le premier jeton. Pour une boucle Claude Code agentic avec des dizaines d'appels d'outils par minute, ces secondes s'additionnent.

OpenRouter : pas cher, rapide, tentaculaire

OpenRouter est la passerelle par défaut. Il s'agit d'un agrégateur : vous obtenez un API key, un point de terminaison et un accès à presque tous les modèles commerciaux et open source via un seul compte de facturation. Le prix est le plus proche que le monde LLM se rapproche d'un marché de matières premières.

Chiffres réels de la page de tarification de OpenRouter en mai 2026 :

  • DeepSeek V4 Flash : 0,14 $ par million de jetons d'entrée, 0,28 $ par million de jetons de sortie
  • DeepSeek V3.2 : 0,252 $ d'entrée / 0,378 $ de sortie par million de jetons
  • DeepSeek V4 Pro : 0,435 $ d'entrée / 0,87 $ de sortie par million de jetons (taux promotionnel, passant à 1,74 $ / 3,48 $ après le 5 mai 2026)
  • DeepSeek R1 : 0,70 $ d'entrée / 2,50 $ de sortie par million de jetons

Comparez ces chiffres aux [tarifications API] publiées par Anthropic (https://platform.claude.com/docs/en/about-claude/pricing) : Opus 4.7 représente une entrée de 5 $ et une sortie de 25 $ par million de jetons. Sonnet 4.6 représente une entrée de 3 $ et une sortie de 15 $. Même Haiku 4.5 à 1 $/5 $ est largement plus cher que DeepSeek V4 Flash.

Pour Habitual, j'ai brûlé environ 850 000 jetons sur l'ensemble de la version : planification, échafaudage, trois itérations, débogage, polissage. Sur Opus 4.7, cela m'aurait coûté environ 7 à 9 $ en coût API. De DeepSeek V4 Flash à OpenRouter, cela m'a coûté 23 cents. Vingt-trois centimes. Je dois continuer à le dire parce qu'à chaque fois que je fais le calcul, je suis encore un peu abasourdi.

Une correction qui mérite d'être apportée : la vidéo source à partir de laquelle j'ai construit ce message faisait référence à "DeepSeek Flash V4 de Anthropic". DeepSeek V4 Flash est un modèle DeepSeek, pas un modèle Anthropic. DeepSeek et Anthropic sont des sociétés complètement distinctes — DeepSeek est un laboratoire chinois AI, Anthropic est la société qui fabrique Claude. Le nom devient flou dans le contenu à évolution rapide, mais la distinction est importante car elle change la façon dont vous percevez le flux de données et les conditions de service qui s'appliquent.

Ollama : gratuit, privé, lié au matériel

Ollama exécute les modèles entièrement sur votre ordinateur local. Aucun appel API ne quitte votre ordinateur portable. Aucun tiers ne voit votre code. Pour les travaux sensibles ou NDA, c'est la seule option de la liste qui est réellement privée.

Le problème est le matériel. La génération actuelle comprend Llama 4 (le produit phare de Meta) et Gemma 4 (la série à poids ouvert de Google). Sur Apple Silicon, Ollama v0.19+ utilise automatiquement le framework MLX d'Apple pour une inférence plus rapide — c'est le déverrouillage qui rend les modèles locaux véritablement utilisables sur un MacBook. Selon la [documentation Gemma 4 d'Unsloth] (https://unsloth.ai/docs/models/gemma-4), les variantes plus petites – E2B et E4B – atteignent respectivement environ 95 et 57 jetons par seconde sur un Mac de la génération actuelle. La variante 26B est recommandée pour plus de 24 Go de mémoire unifiée.

J'ai exécuté Gemma 4 12B localement sur un MacBook de série M avec 32 Go de RAM. Les modifications de fichiers uniques et les petits refactors ont bien fonctionné. Au moment où Claude Code a essayé de charger quatre fichiers dans leur contexte pour une modification multi-fichiers, le modèle a commencé à ralentir considérablement - 8 à 12 secondes entre les appels de l'outil, et la qualité de sortie a chuté pour tout ce qui nécessitait de conserver plus de deux fichiers à l'esprit à la fois.

Si vous disposez d'un poste de travail avec un NVIDIA discret GPU, cette histoire change complètement. Sur un ordinateur de bureau équipé d'un 4090 ou supérieur, le Llama 4 70B est véritablement rapide et la qualité est maintenue dans les tâches complexes. Sur un MacBook sans ce GPU ? Utilisez Ollama pour des tâches courtes et ciblées où la confidentialité est importante. Utilisez OpenRouter ou NIM pour toute autre chose. Il existe également un bug de streaming connu dans Ollama v0.20.3 qui gère mal les réponses aux appels d'outils de Gemma 4 : épinglez la version 0.19.x ou attendez le correctif si vous l'atteignez.

Maintenant, la configuration réelle.

Étape par étape : faire fonctionner le proxy

C’est la section que je voudrais si je partais de zéro. Je suppose que Claude Code est déjà installé. Si vous ne le faites pas, installez-le d'abord via les [instructions officielles de Anthropic] (https://docs.claude.com/en/docs/claude-code) — le proxy ne remplace pas Claude Code, il se trouve en dessous.

Étape 1 : Installer les prérequis

Vous avez besoin de Python 3.14 et de uv (le gestionnaire de packages Python rapide). Sur macOS :

curl -LsSf https://astral.sh/uv/install.sh | sh

# Install Python 3.14 via uv
uv python install 3.14

Sous Windows PowerShell :

powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"
uv python install 3.14

La raison pour laquelle uv au lieu de pip : il est environ 10 à 100 fois plus rapide pour résoudre les dépendances, et pyproject.toml du dépôt proxy est configuré pour cela. Vous pouvez utiliser pip si vous insistez, mais uv rend l'installation instantanée.

Étape 2 : Cloner le dépôt

git clone https://github.com/Alishahryar1/free-claude-code.git
cd free-claude-code
cp .env.example .env

Cette étape .env.example.env est l'endroit où la plupart des gens se trompent. Le fichier .env est masqué par défaut sur macOS. Si vous ne le voyez pas dans le Finder, appuyez sur Cmd+Shift+. (point) pour basculer les fichiers cachés. Dans le terminal, ls -la l'affiche. Dans VS Code, il s'affiche par défaut. Cela semble trivial, mais j'ai perdu dix minutes la première fois en me demandant pourquoi mes modifications ne tenaient pas : j'éditais un fichier dans un répertoire différent.

Étape 3 : Obtenez vos clés API

Choisissez un back-end. Vous pouvez configurer les trois plus tard, mais commencez par un pour confirmer que le proxy fonctionne.

OpenRouter : Inscrivez-vous sur openrouter.ai, ajoutez 5 $ de crédit (cela vous durera des semaines) et récupérez un API key depuis le tableau de bord. Cinq dollars sur OpenRouter suffisent pour créer plusieurs applications complètes via DeepSeek V4 Flash.

NVIDIA NIM : Inscrivez-vous sur build.nvidia.com, rejoignez le NVIDIA Developer Program (gratuit) et générez un API key. Vous obtenez immédiatement 1 000 crédits gratuits. Aucune carte de crédit requise.

Ollama : Installez depuis ollama.com, puis extrayez un modèle. Pour coder sur un MacBook avec 16 à 32 Go de RAM, commencez par ollama pull gemma4:e4b. Pour un poste de travail avec GPU sérieux, ollama pull llama4:70b. Aucun API key n'est nécessaire : Ollama s'exécute localement.

Étape 4 : Modifier .env

Ouvrez .env dans l'éditeur de votre choix. Le fichier contient des blocs commentés pour chaque backend. Vous décommentez celui que vous souhaitez et renseignez la clé et le nom du modèle. Voici une configuration OpenRouter fonctionnelle :

# Backend selection
PROVIDER=openrouter

# OpenRouter
OPENROUTER_API_KEY=sk-or-v1-xxxxxxxxxxxxxxxxx
OPENROUTER_MODEL=deepseek/deepseek-v4-flash

# Proxy port
PORT=8082

Pour NVIDIA NIM, remplacez par :

PROVIDER=nvidia_nim
NVIDIA_API_KEY=nvapi-xxxxxxxxxxxxxxxxx
NVIDIA_MODEL=zai-org/glm-5
PORT=8082

Pour Ollama (aucune clé nécessaire) :

PROVIDER=ollama
OLLAMA_MODEL=gemma4:e4b
OLLAMA_HOST=http://localhost:11434
PORT=8082

Étape 5 : Démarrez le proxy

Depuis le répertoire du dépôt :

uv run main.py

Vous devriez voir quelque chose comme Uvicorn running on http://0.0.0.0:8082. Laissez ce terminal ouvert : le proxy doit continuer à fonctionner pendant que vous utilisez Claude Code.

Étape 6 : Pointez Claude Code sur le proxy

Dans un nouveau terminal, définissez la variable d'environnement qui indique à Claude Code où envoyer les requêtes, puis lancez :

export ANTHROPIC_BASE_URL=http://localhost:8082
export ANTHROPIC_API_KEY=anything
claude

La valeur ANTHROPIC_API_KEY n'a pas d'importance : le proxy l'ignore et utilise la vraie clé de .env pour s'authentifier auprès du backend réel. Mais Claude Code refuse de démarrer sans une valeur dans cette variable, alors définissez-la sur quelque chose qui n'est pas vide.

Si vous souhaitez que ce soit la valeur par défaut pour un projet, déposez ces exportations dans un fichier .envrc (avec direnv) ou dans un script de démarrage local du projet. Je garde un alias de shell claude-cheap qui exporte les deux variables et lance Claude Code en une seule fois.

C'est toute la configuration. Six pas, peut-être dix minutes si vous avancez prudemment. La première fois que je l'ai parcouru, il m'en a fallu environ vingt - la plupart étaient la confusion du fichier .env caché et un mauvais nom de modèle dans la configuration OpenRouter qui renvoyait un 404 déroutant.

Si vous avez suivi l'un de mes autres [guides de workflow Claude Code] (https://www.mejba.me/claude-code-32-power-user-hacks), il s'agit du même Claude Code que vous utilisez déjà : chaque commande, chaque commande slash, chaque compétence. La seule différence réside dans le modèle qui effectue l’inférence sous le capot.

À quoi ça ressemblait de construire réellement Habitual

Je veux parler de la version réelle, non pas parce que l'application est importante, mais parce que les aspérités n'apparaissent que lorsque vous avancez dans un projet réel. Habitual est un outil de suivi des habitudes : enregistrements quotidiens, comptage de séquences, carte thermique de calendrier, les éléments standard. Voici comment cela s'est passé sur chaque backend.

DeepSeek V4 Flash via OpenRouter

C’était le cheval de bataille. J'ai commencé avec une invite d'un paragraphe : "Créez-moi un suivi d'habitudes minimal, un utilisateur unique, une application Web, Tailwind, Vanilla JS, un enregistrement quotidien avec compteur de séquences et une grille de calendrier de 30 jours." Claude Code (exécutant via le proxy sur DeepSeek V4 Flash) a planifié la structure, échafaudé les fichiers, écrit le code HTML et JavaScript et l'a exécuté.

La première itération a été difficile : la logique des séquences était décalée et la grille du calendrier présentait un bug UTC par rapport à l'heure locale. Je lui ai demandé de réparer les deux. Cela les a réparés. Je lui ai demandé d'ajouter une option « sauter un jour » qui n'interrompt pas la séquence (jours de repos pour des habitudes durables). Il a refactorisé proprement le calcul des séquences.

Trois itérations plus tard, application fonctionnelle. Dépense totale en jetons : 850 000 jetons, répartis à peu près également entre l'entrée et la sortie. Coût total : environ 0,21 $. La qualité de sortie était nettement inférieure à celle que Opus 4.7 produirait - les noms de variables étaient un peu génériques, les commentaires étaient plus rares, la gestion des erreurs était minime - mais pour un projet parallèle dans lequel je vais refactoriser tout ce que je garde, c'est bien.

Le seul endroit où DeepSeek V4 Flash a visiblement eu du mal, c'est lorsque je lui ai demandé d'ajouter la persistance IndexedDB avec une logique de migration appropriée. Opus 4.7 aurait écrit le schéma, l'exécuteur de migration et la gestion des versions en une seule passe. DeepSeek a bien écrit le schéma, a complètement raté la migration et j'ai dû demander deux fois avant d'implémenter quelque chose qui survivrait à un changement de schéma. Pour la plupart des travaux CRUD, l'écart est invisible. Pour tout ce qui nécessite une réflexion systémique approfondie, vous sentirez la différence.

GLM-5 via NVIDIA NIM

Une fois l'application fonctionnelle, j'ai reconstruit le même projet à partir de zéro sur NIM avec GLM-5 pour comparer. GLM-5 est, sur le papier, un modèle beaucoup plus grand que DeepSeek V4 Flash — paramètres 744B MoE par rapport à la variante flash plus petite de DeepSeek. Et la qualité du résultat l’a montré. Les noms de variables étaient meilleurs. Les commentaires étaient plus réfléchis. L'implémentation d'IndexedDB était correcte dès le premier passage.

Le compromis était la vitesse. Chaque appel d'outil prenait sensiblement plus de temps : appelez-le 4 à 8 secondes contre 2 à 3 sur OpenRouter. Pour un flux de travail agentic avec plus de 40 appels d'outils dans une session, cela s'aggrave. La construction complète a pris environ deux fois plus de temps, même si le modèle a nécessité moins d'allers-retours car le résultat était de meilleure qualité la première fois.

NIM est également gratuit au niveau de crédit développeur, ce qui rend le compromis de vitesse plus facile à accepter. Si je devais faire une inférence de poids ouvert de qualité production, GLM-5 sur NIM serait ma valeur par défaut. Pour une itération rapide sur des projets parallèles jetables, OpenRouter gagne uniquement en termes de réactivité.

Gemma 4 12B via Ollama

C’est là que les compromis sont devenus bruyants. Sur mon MacBook avec 32 Go de mémoire unifiée, Gemma 4 12B s'est bien chargé et a exécuté les petites choses (éditions de fichiers uniques, refactorisations simples, noms d'éléments) à environ 30 à 40 jetons par seconde. Vraiment utilisable.

Au moment où Claude Code a essayé de charger quatre ou cinq fichiers dans leur contexte pour un refactor multi-fichiers, les choses sont tombées en panne. Le streaming a considérablement ralenti. Les appels d’outils ont commencé à expirer. L'un d'eux a silencieusement tronqué la réponse intermédiaire, qui est le mode de défaillance que le proxy ne peut pas complètement corriger - Ollama renvoie simplement moins qu'il ne le devrait et Claude Code pense que la tâche est terminée.

Pour Habitual en particulier, Gemma 4 12B a traversé l'échafaudage initial mais n'a pas pu gérer le refactoring logique de séquence sans que je l'alimente manuellement un fichier à la fois. Sur un poste de travail avec un 4090, ce ne serait pas un problème. Sur un MacBook sans GPU discret, traitez le Ollama local comme un outil pour des tâches courtes et ciblées plutôt que comme un pilote quotidien Claude Code.

Il y a une conversation plus profonde sur le développement local de AI qui vaut la peine d'être menée - j'en ai parlé plus en détail dans [mon article de configuration locale Gemma 4] (https://www.mejba.me/gemma-chat-offline-vibe-coding-mac) - mais la version courte est la suivante : Apple Silicon est vraiment impressionnant pour l'inférence locale, et il ne remplace toujours pas les modèles de niveau cloud sur les flux de travail de codage agentic.

Le véritable pouvoir : l'orchestration multimodèle

C'est ici que cela devient intéressant, au-delà des économies. Une fois que vous disposez d'un proxy capable d'acheminer vers différents modèles, vous n'êtes plus qu'à un pas du modèle d'orchestration qui devient discrètement la valeur par défaut pour le développement sérieux de AI.

L'idée : utiliser Opus 4.6 (ou 4.7) sur votre abonnement payant Anthropic en tant que planificateur et orchestrateur. Demandez-lui de diviser une tâche complexe en sous-tâches distinctes. Déléguez ensuite chaque sous-tâche à un modèle bon marché – DeepSeek V4 Flash, GLM-5, peu importe – via le proxy. Opus examine les résultats, les intègre et ne brûle son contexte coûteux que sur une réflexion à fort effet de levier.

En pratique, cela revient à exécuter deux instances Claude Code côte à côte. La première est votre session principale sur Anthropic-direct, effectuant l'orchestration et les décisions architecturales. L'autre est la session proxy exécutée sur un backend bon marché, exécutant le travail d'implémentation de routine - générer le fichier de test, écrire le passe-partout, mettre à jour la documentation, refactoriser cette fonction. Vous confiez les sous-tâches de la première à la seconde, puis revenez au premier pour les intégrer.

J'en fais des variantes depuis quelques mois. Le calcul symbolique devient rapidement convaincant. Une journée typique où je pourrais graver 3 à 4 millions de jetons Opus sur abonnement devient peut-être 800 Ko d'Opus (la planification, l'intégration, les parties difficiles) et 3 Mo de DeepSeek via le proxy (l'exécution, le passe-partout, les refactors de routine). La qualité de sortie est indiscernable sur le produit fini. Le temps passé est similaire. La différence de coût est dramatique.

Ce modèle fait écho à ce que j'ai couvert dans Guide du SDK agent de Anthropic : l'avenir du codage agentic n'est pas "un modèle géant qui fait tout", c'est "un bon modèle orchestre de nombreux modèles bon marché". Le proxy est la pièce manquante qui rend cela pratique sans écrire de code d'orchestration personnalisé.

Ce qui ne va pas dans cette approche (la partie honnête)

Je mentirais si je disais qu'il s'agissait d'un remplacement immédiat du Claude Code payant. Il existe de réelles limites et vous devez les connaître avant de vous engager dans un vrai projet dans cette pile.

Les modèles bon marché manquent de détails précis aux bords des tâches complexes. J'ai mentionné cela avec la migration IndexedDB. Cela apparaît le plus souvent dans : un raisonnement async/concurrency complexe, des implications subtiles en matière de sécurité, des refactorisations approfondies qui touchent de nombreux fichiers à la fois et tout ce qui nécessite une solide compréhension des compromis architecturaux. Pour 70 à 80 % du travail de codage typique, vous ne le remarquerez pas. Pour les 20 % difficiles, vous ressentirez l’écart.

Certaines fonctionnalités de Claude Code supposent Anthropic-direct. Le mode rapide (le nouveau niveau à faible latence dans Claude Code 2.x) génère des erreurs sur les backends non Anthropic, car il dépend des optimisations de streaming spécifiques à Anthropic. Certaines compétences et plugins qui utilisent des formats d'utilisation d'outils spécifiques à Claude peuvent se comporter de manière étrange. La plupart des fonctionnalités de base (édition de fichiers, sous-agents, commandes slash, système de compétences) fonctionnent correctement. Les cas extrêmes vous feront trébucher.

Les longues sessions se dégradent plus rapidement sur les modèles bon marché que sur Opus. J'ai constaté qu'environ 50 000 jetons dans une session, la qualité de sortie sur DeepSeek V4 Flash commence à chuter sensiblement. Le modèle perd la trace des décisions antérieures, se contredit et commence à halluciner les signatures de fonctions du début de la conversation. Le correctif est mécanique : lorsque vous heurtez ce mur, quittez Claude Code, redémarrez avec un nouveau contexte et rechargez les fichiers concernés. Dans la fenêtre contextuelle 1M de Opus 4.7, cela est rarement nécessaire jusqu'à ce que la session soit beaucoup plus profonde.

Les modèles locaux sur un MacBook sans GPU sont véritablement lents. J'en ai parlé dans la section Ollama, mais cela vaut la peine de le répéter. Traitez Ollama-on-MacBook comme un outil de confidentialité et non comme un outil de productivité. Pour de réelles performances d'inférence locale, vous avez besoin du matériel NVIDIA GPU.

La confidentialité et le flux de données changent. Lorsque vous passez par OpenRouter ou NIM, vos invites et votre code transitent par leur infrastructure. OpenRouter a des politiques de confidentialité raisonnables et ne s'entraîne pas sur vos données par défaut, mais c'est un saut supplémentaire et une entreprise supplémentaire qui voit votre code. Pour le travail client, le travail NDA ou tout ce qui est sensible : restez sur Anthropic-direct ou optez pour Ollama-local complet. Pas de juste milieu.

Les économies sur les abonnements ont un plafond. Si vous payez déjà pour Max (100-200 $/month), vous n'allez pas économiser la totalité de l'abonnement en acheminant vos projets personnels via le proxy : vous aurez toujours besoin de Max pour le travail client et de production. Les économies apparaissent sous la forme « Je n'achète plus de crédits API en plus de mon abonnement pour des expériences personnelles », ce qui est réel mais limité.

La gamme de modèles évolue également rapidement. Les noms dans cet article – DeepSeek V4 Flash, GLM-5, GLM-5.1, Gemma 4 – étaient à jour en mai 2026. Au moment où vous lirez ceci, il pourrait y avoir de nouveaux produits phares à des prix inférieurs. Consultez la page de tarification de OpenRouter et le catalogue de modèles NVIDIA NIM avant de vous engager sur un modèle spécifique dans votre .env.

Ce que je dirais à quelqu'un à partir d'aujourd'hui

Si vous envisagez d'essayer ceci, voici le chemin que je prendrais si je recommençais.

Passez dix minutes sur la configuration OpenRouter avec DeepSeek V4 Flash. Déposez 5 $ de crédit. Faites fonctionner le proxy. Créez quelque chose de petit : un script, une petite application, tout ce sur quoi vous consacreriez autrement quelques minutes de quota d'abonnement. Remarquez ce que vous ressentez. La friction est quasi nulle et le coût est quasiment nul.

Si cette expérience vous accroche (elle m'a accroché), configurez NVIDIA NIM comme deuxième backend. Le niveau gratuit avec GLM-5 est vraiment bon et vous offre une solution de secours de meilleure qualité lorsque DeepSeek V4 Flash ne suffit pas. Le changement de backend est une ligne dans .env et un redémarrage du proxy.

Ne vous embêtez pas avec Ollama, sauf si vous disposez d'un poste de travail avec un vrai GPU ou si vous avez spécifiquement besoin d'une confidentialité locale uniquement. Sur un MacBook, l'expérience va vous décevoir et c'est une mauvaise première impression pour ce qui est par ailleurs une excellente chaîne d'outils.

Une fois que vous êtes à l'aise, essayez le modèle d'orchestration. Exécutez Opus sur Anthropic-direct pour la planification et l'architecture. Exécutez DeepSeek via le proxy pour l'exécution. Les économies de coûts s’accumulent rapidement et le flux de travail semble étonnamment naturel après quelques jours.

Et continuez à payer Max pour le travail qui compte. Cette approche proxy ne remplace pas ce que Anthropic vous facture : fiabilité, support, le meilleur modèle absolu de sa catégorie pour les problèmes difficiles. C'est un moyen d'étendre votre budget d'expérimentation d'un ordre de grandeur sans renoncer à l'interface Claude Code que vous aimez déjà.

L'application Habitual est toujours sur mon téléphone. Je le vérifie tous les matins. Cela m'a coûté 23 cents à construire, fonctionne entièrement dans mon navigateur et je l'utilise réellement. Si la semaine prochaine je souhaite ajouter des catégories d'habitudes, des rapports hebdomadaires ou un système de notification, je lancerai le proxy, je pointerai Claude Code sur OpenRouter et j'itérerai pour une autre poignée de centimes. C'est le déverrouillage.

Le reste de l’année 2026 s’annonce comme une aventure folle pour les outils AI. Les modèles deviennent moins chers. Les options à poids ouvert rattrapent les modèles à frontière fermée plus rapidement que prévu. L'approche proxy est la bonne solution pour le moment : conserver la meilleure UX, s'orienter vers le modèle qui convient le mieux à la tâche et laisser le marché de l'inférence faire son travail.

Construisez le projet parallèle. Construisez-le via le proxy. Dépensez le dollar que vous avez économisé en café.

Questions fréquemment posées

Combien coûte l'exécution de Claude Code via le logiciel gratuit Claude Code proxy ?

Pour la plupart des projets personnels, les coûts vont de la gratuité absolue (crédits NVIDIA NIM ou Ollama local) à moins de 1 $ par version d'application (DeepSeek V4 Flash sur OpenRouter à 0,14 $ de jetons d'entrée /M). Le même projet sur Anthropic direct API coûterait entre 5 et 10 $. L'installation est gratuite ; votre seule dépense est l'inférence quel que soit le backend que vous choisissez.

Le proxy fonctionne-t-il avec toutes les fonctionnalités de Claude Code ?

La plupart des fonctionnalités fonctionnent : édition de fichiers, sous-agents, commandes slash, compétences, MCP servers, flux de travail multi-fichiers. L'exception notable est le mode rapide, qui dépend des optimisations de streaming spécifiques à Anthropic et des erreurs sur les backends non Anthropic. Certains plugins qui utilisent des formats d'utilisation d'outils spécifiques à Anthropic peuvent également se comporter de manière étrange. Consultez la procédure pas à pas de mise en œuvre ci-dessus pour la configuration complète.

Est-il sécuritaire d'envoyer mon code via OpenRouter ou NVIDIA NIM ?

Pour les projets personnels et les travaux open source, les deux fournisseurs ont des politiques de confidentialité raisonnables et ne s'entraînent pas sur vos données par défaut. Pour le travail client, le code lié à la NDA ou tout ce qui comporte des informations d'identification, restez sur Anthropic-direct ou utilisez Ollama localement : votre code ne quitte jamais votre machine avec Ollama. Il n’existe pas de juste milieu pour les travaux sensibles.

Quel est le meilleur modèle gratuit à utiliser avec le proxy ?

Pour le codage, GLM-5 sur NVIDIA NIM est l'option gratuite la plus puissante : paramètres 744B, qualité de première classe, gratuite avec inscription du développeur. DeepSeek V4 Flash sur OpenRouter est le moins cher à 0,14 $ de jetons d'entrée /M (pas gratuit, mais proche), et il est plus rapide que NIM. En local uniquement, Gemma 4 E4B sur Ollama fonctionne sur Apple Silicon mais présente des limites matérielles.

Puis-je basculer entre les backends sans réinstaller ?

Oui. Modifiez la valeur PROVIDER dans votre fichier .env, redémarrez le proxy avec uv run main.py et Claude Code utilisera le nouveau backend lors de sa prochaine requête. Vous n'avez pas besoin de redémarrer Claude Code lui-même. De nombreux utilisateurs conservent plusieurs fichiers .env (.env.openrouter, .env.nim, .env.ollama) et créent un lien symbolique avec celui actif.

Travaillons ensemble

Vous cherchez à créer des systèmes AI, à automatiser les flux de travail ou à faire évoluer votre infrastructure technologique ? J'aimerais aider.

Publicité
Coffee cup

Vous avez apprécié cet article ?

Votre soutien m'aide à créer davantage de contenu technique approfondi, d'outils open source et de ressources gratuites pour la communauté des développeurs.

Sujets connexes

Engr Mejba Ahmed

À propos de l'auteur

Engr Mejba Ahmed

Engr. Mejba Ahmed builds AI-powered applications and secure cloud systems for businesses worldwide. With 10+ years shipping production software in Laravel, Python, and AWS, he's helped companies automate workflows, reduce infrastructure costs, and scale without security headaches. He writes about practical AI integration, cloud architecture, and developer productivity.

Discussion

Comments

0

No comments yet

Be the first to share your thoughts

Leave a Comment

Your email won't be published

9  x  2  =  ?

Continuer l'apprentissage

Articles connexes

Tout parcourir

Comments

Leave a Comment

Comments are moderated before appearing.

Learning Resources

Expand Your Knowledge

Accelerate your growth with structured courses, verified certificates, interactive flashcards, and production-ready AI agent skills.

Sample Certificate of Completion

Sample certificate — complete any course to earn yours

Engr Mejba Ahmed

Engr Mejba Ahmed

Claude Code Expert · Online

👋

Hey there!

Quick Actions

WhatsApp Instant reply

Chat on WhatsApp

+880 1723 741224 · Instant reply

Popular Questions

Engr Mejba Ahmed is connected
Engr Mejba Ahmed is typing...
Engr Mejba Ahmed avatar

✉ Want me to follow up? Drop your email

Engr Mejba Ahmed avatar

📞 Connect Directly

Choose how you'd like to reach me

WhatsApp

+880 1723 741224

Email

[email protected]

✓ Details sent! I'll get back to you shortly.

Powered by OpenAI

335+

Blog Posts

25

AI Courses

63

Projects

Services & Expertise

Pricing & Process

Learning & Resources

Connect & Support