Skip to main content
Modèles d'IA

Test du DeepSeek V4 Pro : L’open source à 1,6T passé au banc d’essai

Test du modèle open-source DeepSeek V4 Pro : points forts, faiblesses détectées en usage réel, et analyse honnête du rapport qualité-prix.

30 min
Temps de lecture
5,995
Mots
Publié
Engr Mejba Ahmed

Écrit par

Engr Mejba Ahmed

Partager l'article

Test du DeepSeek V4 Pro : L’open source à 1,6T passé au banc d’essai

Le moment où j'ai compris que DeepSeek V4 Pro comptait vraiment, il était 23h47 un jeudi soir. J'avais quatre fenêtres de terminal ouvertes, chacune exécutant une instance séparée du modèle via Open Code, et toutes quatre résolvaient simultanément différentes parties d’un projet personnel sur lequel je procrastinais depuis des semaines. Un visualiseur 3D. Une landing page. Un pipeline de données en Python. Une extension navigateur. Mon tableau de bord Open Code affichait une dépense totale de 0,19 $ pour la puissance de calcul jusqu'à présent.

Dix-neuf centimes.

La même charge de travail sur Claude Opus 4.7 m’aurait coûté environ 42 $ de crédits API à ce moment-là. Sur GPT-5.5 Pro, on serait plus près de 160 $. J'ai vérifié les chiffres à trois reprises parce que le calcul me paraissait impossible. Pourtant non. Les calculs étaient justes. C’est l’industrie qui avait bougé sous mes pieds pendant que je ne faisais pas attention.

C’est le point clé sur lequel je veux insister, car si vous ne lisez que le premier paragraphe de cette revue de DeepSeek V4 Pro, c’est le message que je veux que vous reteniez : l’IA open-source vient d’égaliser le coût d’une façon qui va changer la donne pour chaque développeur indépendant, chaque petite agence, et chaque fondateur qui redoute en silence sa facture Anthropic mensuelle. Les benchmarks ne sont pas tout à fait au sommet. Le contexte long vacille plus que ce que laisse entendre la fiche technique. La censure est bien réelle. Mais l’effondrement des coûts est l’histoire, et la plupart des analyses que j’ai pu lire passent à côté, trop occupées à débattre de tableaux de benchmarks.

J’ai passé un week-end entier à faire tourner le modèle de 1,6 trillion de paramètres sur du vrai boulot : pas des benchmarks triviaux, pas des démos choisies, mais du code que j’allais réellement livrer. Voici ce que j’ai découvert.

Ce qu’est réellement DeepSeek V4 Pro

Permettez-moi de commencer par un tour d’horizon des spécifications, car vous les avez probablement déjà vues éclatées sur une dizaine de sites depuis la sortie du 24 avril.

DeepSeek V4 Pro est un modèle Mixture-of-Experts de 1,6 mille milliards de paramètres, avec environ 49 milliards de paramètres actifs par jeton. Ce chiffre “actif” est celui qui importe pour les coûts d’inférence : vous ne payez pas pour faire tourner la totalité des 1,6T de calcul à chaque prompt, mais uniquement pour la fraction d’experts que le routeur active en fonction de votre requête précise. C’est environ 60 % plus grand que la précédente plus grosse release open source sérieuse, et c’est le premier modèle à poids ouverts pour lequel l’affirmation “au niveau du frontier” me paraît vraiment défendable et pas juste du marketing.

La fenêtre de contexte est annoncée à un million de tokens. Nous reviendrons sur ce chiffre, car la réalité est un peu plus nuancée que la communication officielle. Lors de mes tests, la limite pratique frôlait plutôt les 128 000 tokens avant que la qualité ne se dégrade de façon visible, la chute s’accentuant nettement au-delà de 180–200K. Cela reste excellent — simplement, ce n’est pas le “un million de tokens” promis sur la page d’accueil.

Architecturalement, le modèle introduit une attention hybride nommée Compressed Sparse Attention (CSA), couplée à la Heavily Compressed Attention (HCA). Résultat : la configuration 1M-token du V4 Pro n’utilise qu’environ 27 % du FLOPs d’inférence pour un seul jeton et seulement 10 % du cache KV par rapport à V3.2. C’est le tour de force d’ingénierie derrière le faible coût. DeepSeek n’a pas simplement fait du scale-up — ils ont réécrit la pile d’attention pour que chaque jeton coûte radicalement moins à traiter, puis ils ont transféré presque toutes ces économies directement sur le prix public de l’API.

Côté entraînement, c’est le pan de l’histoire qui va alimenter des articles pendant des années. V4 Pro a été entraîné sur un mix de puces Huawei Ascend 950PR et de vieux GPU Nvidia (A100, et apparemment quelques H100 passés à travers les contrôles à l’export). L’ensemble a duré environ 14 à 16 mois, incluant un redémarrage complet après un plantage majeur en cours de route. Reuters a confirmé en avril que le modèle final a été validé à la fois sur les plateformes Nvidia et Ascend NPU. Le coût total du calcul se situe autour de 5,6 millions de dollars avec un cluster de 16 000 GPU. Pour situer, c’est une goutte d’eau comparé à ce que dépensent les laboratoires américains de pointe par génération, et cela a été rendu possible, en partie, grâce à des puces chinoises faute d’alternative viable à cause des contrôles d’ASML.

Je ne vais pas transformer cet article en blog de géopolitique, mais il serait impossible de juger honnêtement DeepSeek V4 Pro sans reconnaître que toute l’existence de ce modèle est une réponse directe aux restrictions matérielles des trois dernières années. Les astuces d’efficacité dans l’architecture, le pipeline d’entraînement hybride, l’agressivité sur les prix — tout s’explique par le fait que DeepSeek ne pouvait pas juste acheter cent mille H200 et tout balancer dessus. Il a fallu être malin. Et maintenant, l’ingéniosité pourrait bien prendre le dessus sur la débauche de moyens.

Voilà dans quel esprit j’ai attaqué les tests.

La configuration : comment j’ai réellement testé tout ça

Je vais être précis concernant ma configuration, car je souhaite que vous puissiez reproduire chacune de ces étapes si la curiosité vous prend.

J’ai testé DeepSeek V4 Pro via trois points d’accès différents tout au long du week-end :

Premièrement, l’abonnement Open Code Go. Cinq dollars pour le premier mois, dix par mois ensuite, avec accès à V4 Pro, V4 Flash, et une poignée d’autres modèles open-weights. C’est l’offre que je recommande à quiconque lit ceci et souhaite tester sans toucher à l’API brute. Quatre instances parallèles pouvant tourner simultanément, bascule d’effort de raisonnement faible/moyen/élevé/maximum, et un agent harness exploitable qui gère correctement les appels d’outils.

Deuxièmement, l’API DeepSeek en direct. C’est l’option “bare metal” : vous avez comme interface uniquement ce que vous développez vous-même, vous payez à la token, et vous êtes responsable du scaffolding d’agent. C’est ici que naissent les comparaisons tarifaires “7x moins cher qu’Opus 4.7” et “40x moins cher que GPT-5.5 Pro”. Decrypt évalue l’écart de prix du V4 Pro à près de 98 % moins cher que GPT-5.5 Pro pour des tâches comparables, ce qui confirme mes propres mesures.

Troisièmement, l’inférence locale via Ollama, en utilisant la variante V4 Flash 284B plutôt que le modèle Pro complet. Le modèle Pro complet 1,6T est techniquement téléchargeable mais pratiquement impossible à faire tourner sur le matériel d’un développeur solo : il s’agit ici de plusieurs centaines de gigaoctets de poids et d’une quantité de VRAM à faire pleurer un petit datacenter. Flash est celui que vous pouvez réellement exécuter en local si vous disposez d’une station de travail sérieuse, et je l’ai inclus car la vraie question “est-ce utilisable ?” pour les modèles open-weights dépend énormément de la solution de repli lorsque l’API tombe.

Ma charge de test comportait quatre volets. Je voulais des tâches qui représentent un vrai travail, pas des pièges à leaderboard.

La première tâche : un explainer interactif de l’architecture DeepSeek — une webapp mono-page qui visualise la façon dont les couches Compressed Sparse Attention routent les tokens à travers le mixture of experts. J’ai choisi exprès cet exercice, car expliquer sa propre architecture est typiquement un terrain où un modèle devrait avoir un avantage à domicile. Si V4 Pro n’était pas capable de produire un schéma correct de ses propres entrailles, ce serait un indicateur révélateur.

La deuxième tâche : une animation SVG de croissance végétale, trame par trame, avec un contrôleur de timeline. Étonnamment, c’est un excellent test pour évaluer la capacité d’un modèle à maintenir une cohérence visuelle à travers de nombreuses petites décisions de géométrie.

La troisième tâche : un jeu de kart HTML5 avec commandes clavier, compteur de tours et adversaires IA basiques. La logique de jeu est souvent le point de rupture silencieux pour de nombreux modèles, car elle nécessite une gestion d’état cohérente à travers tous les événements.

La quatrième tâche : un visualiseur d’exoplanètes, récupérant les données en direct depuis la NASA Exoplanet Archive et rendant graphiquement les distances orbitales à l’échelle. Ce cas mettait à l’épreuve l’intégration d’API, la manipulation de données et la capacité du modèle à raisonner avec de vrais nombres issus de sources réelles.

J’ai exécuté ces quatre tâches sur V4 Pro, et en parallèle sur Claude Opus 4.7 via Claude Code avec les mêmes instructions. J’ai également relancé les deux premières sur GPT-5.5 via Codex pour un troisième point de comparaison, car mon comparatif GPT-5.5 vs Opus 4.7 constituait ma référence pour définir ce qu’est le “haut niveau” à la frontière.

Temps total d’exécution cumulé : environ quatre heures. Dépense totale sur Open Code : environ vingt centimes. Ces vingt centimes, c’est le chiffre qui ne me sort plus de la tête.

Test Un : L’explicateur d’architecture

La première chose qui m’a surpris avec V4 Pro, c’est qu’il a quasiment réussi du premier coup à produire le diagramme de routage. J’ai demandé « un explicateur interactif illustrant comment l’Attention Sparse Compressed route les tokens à travers les couches mixture-of-experts — cliquable, avec un compteur de tokens en direct, et une visualisation en temps réel des experts activés pour un input donné ». Je n’ai fourni aucun code de référence.

Le résultat était un composant React fonctionnel, incluant une simulation de tokenizer, une visualisation du router, et une animation plutôt soignée montrant quels experts s’activaient pour chaque token. Ce n’était pas parfait : le nombre d’experts affiché était erroné d’un facteur deux, et l’animation buguait légèrement si l’on mettait en pause en cours de token — mais ça marchait, et l’architecture était correcte.

Opus 4.7 a livré une version visuellement plus aboutie de la même application. Typographie plus propre, arbre de composants mieux organisé, état par défaut plus intelligent. Mais Opus a aussi pris plus de temps (environ 3x plus long) et coûté environ 1,80 $ en crédits Claude Code, contre quatre centimes pour Open Code.

La vraie question n’est pas « lequel est meilleur », mais « quelle est la valeur marginale de ce degré de finition ? ». Si vous livrez ceci à un client, la finition Opus vaut sans doute le supplément. Si vous prototypez un outil interne, ou que vous êtes un développeur indie itérant vite, la sortie de DeepSeek est parfaitement acceptable et l’économie est tout simplement d’un autre ordre de grandeur.

Un point concret à signaler : le code généré par V4 Pro était moins dogmatique sur la structure. Il produisait des composants fonctionnels mais sans anticiper de modifications futures, contrairement à Opus. Si vous comptez maintenir ce code sur deux ans, la sortie d’Opus sera plus facile à faire évoluer. Si le fichier doit disparaître dans deux semaines, V4 Pro vous fera gagner de l’argent sans compromis sur ce qui importe vraiment.

Test Deux : L’Animation de Plante en SVG

C’est ici que V4 Pro a rencontré son premier obstacle dont je souhaite parler franchement.

L’animation en elle-même fonctionnait. La plante poussait, le curseur de la timeline était opérationnel, les chemins SVG étaient mathématiquement cohérents. Mais lorsque j’ai demandé « une seconde espèce avec un mode de ramification différent — quelque chose de plus fractal, moins symétrique », la seconde proposition du modèle a partiellement endommagé la première. Il a réécrit certaines sections de la logique de croissance de l’espèce d’origine, introduisant ainsi des régressions subtiles.

Opus 4.7, confronté à la même demande, a produit un diff additif propre. Il a ajouté la seconde espèce sans toucher à la première, exactement comme le ferait un ingénieur confirmé.

C’est le motif qui s’est répété tout au long du week-end. V4 Pro est un excellent codeur « one-shot » : vous décrivez un besoin, il construit l’élément, et ça fonctionne. Mais il s’avère nettement moins sophistiqué sur l’itération. Quand il s’agit de garder en tête une architecture complexe de code existant et d’effectuer des modifications chirurgicales sans perturber les systèmes adjacents, il se rapproche plus d’un débutant que d’un ingénieur principal. Pour donner du contexte, c’est à peu près la performance de Kimi K2.6 lors de tests similaires dans mon test open-source de Kimi K2.6 — le palier open-source converge visiblement vers un profil « très solide en one-shot, plus faible sur l’itératif ».

Je ne veux pas exagérer ce point faible. Sur deux des quatre tâches, l’approche itérative de V4 Pro était correcte. Mais sur l’animation SVG et le jeu de karting, c’était nettement moins performant qu’Opus. Le schéma semble être le suivant : plus les fichiers sont volumineux, plus il y a d’état et de systèmes parallèles à suivre — c’est là que V4 Pro commence à bâcler les choses.

Test Trois : Le Jeu de Karting

C'était le test le plus amusant à concevoir et le plus instructif pour effectuer des comparaisons.

V4 Pro a produit un jeu de kart fonctionnel en un seul prompt. Contrôle au clavier, trois tours, un chronomètre, trois adversaires IA avec un comportement raisonnable, un écran de fin. Le code comptait environ 900 lignes de HTML, CSS et JavaScript dans un seul fichier. Il tournait sans problème. C'était plaisant à jouer pendant environ quatre-vingt-dix secondes.

Puis j'ai demandé deux modifications supplémentaires : « ajoute une mécanique de drift avec une traînée visuelle de dérapage » et « les adversaires IA devraient devenir plus difficiles à chaque tour ». C’est typiquement le genre de fonctionnalité incrémentale que l’on retrouve dans le développement réel d’un jeu.

V4 Pro a parfaitement implémenté la mécanique de drift dès la première tentative — la physique était même meilleure que prévu, avec une préservation de la dynamique qui semblait naturelle. Mais la progression de la difficulté de l’IA s’est retrouvée mêlée à la logique IA existante. Le modèle a introduit une nouvelle variable de difficulté, l’a intégrée au code de direction, puis, de façon inexplicable, a également modifié le compteur de tours pour utiliser cette même variable, ce qui a cassé la détection des tours.

Je lui ai demandé de corriger le compteur de tours. Il l’a fait, mais a réintroduit le bug sur la difficulté de l’IA. C’est le genre de problème courant avec les modèles qui ne construisent pas une représentation interne cohérente de l’ensemble du code — chaque modification locale est correcte, mais tout devient instable à l’échelle globale.

Opus 4.7, sur les mêmes prompts, a généré moins de diffs mais de façon plus réfléchie. Il a aussi réussi la mécanique de drift, et sa gestion de la difficulté de l’IA fonctionnait sans casser le reste. Au total, cela a coûté environ 3,40 $ pour la séquence complète, contre huit centimes pour V4 Pro.

Huit centimes contre trois dollars quarante. Pour un jeu de kart avec drift. En 2026. J’ai encore du mal à m’y habituer.

Test Quatre : Le Visualiseur d’Exoplanètes

C’est lors de cette tâche que V4 Pro m’a agréablement surpris. Récupérer des données en direct depuis la NASA Exoplanet Archive, parser le format de requête TAP, afficher une vue du système solaire à l’échelle avec des distances orbitales précises — voilà typiquement le genre de mission où j’imaginais qu’un modèle open-weights pourrait trébucher, car cela exige de connaître à la fois des conventions API réelles et des unités astronomiques concrètes.

V4 Pro a parfaitement réussi. La requête TAP était correctement formatée. Les conversions d’unités (UA en pixels, passage à l’échelle logarithmique pour la lisibilité) étaient cohérentes. Il a même ajouté un détail que je n’avais pas demandé : un filtre pour masquer les planètes avec des estimations de masse peu fiables, le modèle ayant apparemment compris que l’archive NASA regorge de données spéculatives.

C’est précisément ce dernier détail qui a marqué, pour moi, la bascule : ce moment où un modèle cesse de n’être qu’un simple générateur de code pour devenir un véritable collaborateur, qui réfléchit à la finalité de ce que l’on veut construire. J’ai vécu cette expérience des dizaines de fois avec Opus 4.7. C’était la première fois que cela m’arrivait avec un modèle open-weights. C’est ce changement de paradigme que j’essaie de faire passer à travers tout ce test de DeepSeek V4 Pro.

La réalité du contexte long

Voici la partie de l’analyse où je dois signaler le plus grand écart entre la fiche technique et la réalité.

Le contexte d’un million de tokens de DeepSeek V4 Pro est techniquement réel. Vous pouvez effectivement coller un million de tokens et le modèle générera une réponse. Mais la qualité de cette réponse s’effondre brutalement au-delà de 180 000 à 200 000 tokens, et le déclin est suffisamment net pour que je ne fasse pas confiance à ce modèle pour des tâches nécessitant un raisonnement cohérent sur des entrées vraiment longues.

J’ai testé ce point avec un dump de codebase de 340 000 tokens — un projet réel, pas du texte synthétique. V4 Pro était capable de répondre précisément à des questions sur les 150 000 premiers tokens. Aux alentours de 200 000 tokens, les réponses ont commencé à faire référence à des fichiers inexistants mais « crédibles » selon les motifs repérés plus haut dans le texte. À mesure que je posais des questions sur des extraits proches de la fin du dump, le modèle commençait purement à inventer.

Opus 4.7, sur ce même dump de 340 000 tokens, l’a traité proprement de bout en bout. J’ai documenté exactement ce type de charge dans mon analyse du contexte million de tokens d’Opus 4.6 — les modèles propriétaires de pointe exploitent réellement leur contexte long, ils ne se contentent pas de le supporter.

C’est une vraie limitation. Si votre flux de travail consiste à injecter de larges codebases dans le contexte pour demander une analyse architecturale globale, V4 Pro n’est pas le modèle qu’il vous faut. Utilisez-le pour des tâches plus courtes et punchy. Préférez Opus ou Gemini pour le travail sur contexte long.

Plafond pratique : je prévoirais environ 128 000 tokens de contexte de travail fiable. C’est déjà énorme — bien suffisant pour la plupart des besoins concrets — mais ce n’est pas un million.

La question de la censure

Je dois aborder ce point directement, car chaque critique d’un modèle chinois le contourne, alors que les lecteurs méritent la vérité.

DeepSeek V4 Pro applique un filtrage très strict sur les sujets sensibles pour le PCC. Je l’ai testé délibérément. Demandez le statut politique de Taïwan : vous obtiendrez des réponses diplomatiques évasives. Parlez de la place Tiananmen : le modèle refuse catégoriquement ou répond strictement selon la ligne du Parti. Pour le Xinjiang, il élude systématiquement.

Si votre travail touche à la politique chinoise, aux droits humains, aux événements historiques que le gouvernement chinois juge sensibles, ou à l’analyse géopolitique impliquant la Chine, ce n’est pas le modèle qu’il vous faut. Point final.

Pour la majorité des usages en programmation, ce filtre ne pose aucun problème. On ne demande pas à son autocompléteur de commenter Tiananmen. Mais je tiens à ce que ce soit bien clair dans ce test, car trop d’analyses minimisent ce point comme s’il s’agissait d’une simple particularité. Ce n’est pas anodin. Il s’agit d’un alignement de valeurs avec un gouvernement précis, et il est essentiel de le savoir avant d’utiliser ce modèle pour des analyses critiques en entreprise.

Il existe cependant une parade en inférence locale : si vous exécutez V4 Flash via Ollama sur votre propre matériel, la couche de censure est nettement moins présente, car vous ne passez pas par l’API hébergée qui impose les filtres les plus stricts. Les pondérations du modèle restent marquées par les biais des données d’entraînement, mais le comportement de refus explicite tient surtout à la couche API. Pour la majorité des utilisateurs cette nuance n’aura aucune incidence. Pour certains, ce sera déterminant.

Où V4 Pro S’impose Réellement

Soyons précis sur les tâches pour lesquelles je choisirais V4 Pro avant Opus 4.7 ou GPT-5.5 :

Automatisation à grand volume. Si vous exécutez un agent devant traiter des milliers de documents, refactoriser des centaines de fichiers par lot ou générer de grandes quantités de texte standardisé, l’avantage économique de V4 Pro est tel que l’écart de qualité importe à peine. On échange une légère différence de qualité contre une réduction de coût par un facteur de 40. Saisissez l’opportunité.

Prototypage jetable. Pour tout ce qui relève de l’itération rapide sur du code temporaire, de la création d’outils internes voués à être peu maintenus, ou de l’exploration de pistes de conception avant de fixer une direction. Pour les tâches ponctuelles, la rapidité de V4 Pro rivalise vraiment avec Opus, et le tarif permet d’explorer nettement plus d’options.

Workflows d’agent orientés terminal. V4 Pro s’avère très performant sur les tâches via terminal — il surpasse Opus au Terminal Bench et n’accuse qu’un léger retard sur SWE Pro. Si votre agent passe l’essentiel de son temps à exécuter des commandes shell, lire des fichiers et appeler des outils, c’est une option parfaitement adaptée.

Développeur solo, petite agence, fondateur indépendant. Si vous dépensez actuellement 5 000 à 6 000 $ par mois en crédits Anthropic ou OpenAI, il vous est possible de descendre à 500–1 000 $ avec V4 Pro, en conservant la quasi-totalité de votre workflow, et en ne réorientant que quelques tâches spécifiques vers les modèles d’avant-garde. À l’échelle business, c’est une vraie optimisation. J’ai aidé plusieurs petites agences à réaliser précisément cet audit de coût pour des clients étranglés par les tarifs des modèles premium.

Travail parallèle multi-instance. L’offre Open Code à 10 $/mois, avec quatre instances en parallèle, est franchement imbattable. J’ai déployé quatre agents sur quatre projets distincts, simultanément pendant plusieurs heures, et ma dépense totale a été inférieure au prix d’un café.

Où le V4 Pro montre ses limites

Voici avec la même précision dans quels cas je n’utiliserais pas ce modèle :

Analyse architecturale sur long contexte. Voir la limite des 180K tokens évoquée plus haut. Si vous avez besoin d’un modèle capable de raisonner de façon cohérente à travers l’ensemble d’une grosse base de code, V4 Pro n’est pas fait pour ça.

Refactoring chirurgical de code existant complexe. La faiblesse en itérations est bien réelle. Pour un travail incrémental minutieux dans un vaste codebase, Opus reste nettement meilleur.

Déploiement en production d’agents sans outils DSML. V4 Pro ne propose pas l’ergonomie plug-and-play pour l’usage d’outils qu’offrent Claude ou les modèles OpenAI. Il impose un format d’appel d’outils DSML ressemblant à du XML, que la plupart des frameworks d’agents ne supportent pas encore nativement. Open Code gère cet aspect, mais si vous créez votre propre harness, il faudra prévoir une phase d’intégration.

Tout ce qui touche à la politique chinoise. Déjà évoqué plus haut, mais il fallait le rappeler pour que ce test soit exhaustif.

Applications nécessitant une faible latence. Avec 1,6T paramètres, même avec une activation sparse, V4 Pro reste plus lent à l’inférence que les modèles fermés de pointe. Si votre application exige des réponses en moins d’une seconde, ce n’est pas le modèle adapté.

L’histoire matérielle dont personne ne parle correctement

Il y a un point que je tiens à clarifier dans cette revue de DeepSeek V4 Pro, car la plupart des analyses que j’ai lues tendent à exagérer ou à minimiser ce sujet.

V4 Pro a été en partie entraîné sur des puces Huawei Ascend 950PR. C’est réellement inédit. Il y a un an, l’idée dominante dans le monde occidental de l’IA était que l’entraînement à l’échelle frontier nécessitait absolument du matériel Nvidia, point final. DeepSeek a démontré que cette hypothèse était erronée, ou du moins qu’elle ne tenait plus totalement. Ils ont également utilisé des Nvidia H100 et A100 pour certaines phases — la répartition exacte est floue, et DeepSeek ne l’a pas totalement dévoilée — mais les puces Ascend ont assuré une part significative, notamment lors de l’étape d’apprentissage par renforcement.

Concrètement, cela signifie que les laboratoires d’IA chinois disposent désormais d’une filière domestique de matériel qui fonctionne. Moins efficace que Blackwell, mais viable. Les contrôles à l’export d’ASML, censés limiter le développement des modèles chinois, ont en réalité forcé l’apparition d’une pile de calcul alternative. Et cette pile progresse à toute vitesse.

Ce que cela ne veut pas dire : DeepSeek n’a pas rattrapé OpenAI ou Anthropic en matière de capacité de recherche globale. V4 Pro est excellent et c’est la meilleure release open-weights que j’aie testée, mais sur les benchmarks les plus exigeants, il reste légèrement derrière GPT-5.4 Extra High et Opus 4.6. L’écart subsiste sur les tout premiers benchmarks. Il est aussi plus étroit qu’il ne l’a jamais été depuis trois ans, et il se réduit, il ne s’élargit pas.

Pour la lecture géopolitique, si c’est ce que vous cherchez, la stratégie de contrôle des exportations de puissance de calcul a accéléré l’indépendance chinoise en IA au lieu de la freiner. C’est un débat pour un autre article, mais il est impossible de traiter honnêtement V4 Pro sans en tenir compte.

Le calcul des coûts, une fois de plus

Permettez-moi de boucler la boucle sur la question des tarifs, car c’est vraiment ce qui me revient toujours à l’esprit.

Voici les prix API approximatifs pour des tâches comparables, basés sur ce que j’ai réellement consommé pendant le week-end :

  • DeepSeek V4 Pro via l’API directe : quelques centimes par tâche pour l’essentiel des usages. Mon week-end entier — quatre builds complexes plus le test de contexte 340K — m’a coûté environ 1,80 $ sur l’API directe.
  • DeepSeek V4 Pro via Open Code Go : 10 $/mois, forfaitaire, avec quatre instances parallèles et des quotas très généreux. C’est l’option que j’utilise au quotidien.
  • Claude Opus 4.7 via Claude Code : environ 60-80 $ pour la même charge de travail sur le week-end, à payer en crédits API.
  • GPT-5.5 Pro via Codex : entre 180 et 220 $ pour un usage équivalent.

L’écart d’un ordre de grandeur est bien réel. L’affirmation de Decrypt selon laquelle V4 Pro est « 98 % moins cher que GPT-5.5 Pro » n’a rien du marketing — c’est ce que j’ai mesuré moi-même. Pour de nombreux usages concrets, l’écart de qualité ne compense tout simplement plus la différence de coût.

C’est ce que je veux que chaque développeur indépendant et petite agence retienne de cet article. Vous n’avez pas besoin d’exécuter tout votre pipeline sur les modèles de pointe. Gardez les 20 % de vos tâches les plus stratégiques — réflexion architecturale, analyse contextuelle approfondie, finition client — pour Opus ou GPT-5.5, et confiez les 80 % restants à V4 Pro. Votre facture fond de 70 à 80 % et votre qualité globale reste stable, car la valeur ajoutée du « frontier » intervient là où elle est réellement perceptible.

C’est exactement ce que j’ai commencé à faire. Mon workflow est maintenant structuré en deux volets : Opus pour ce qui nécessite de la réflexion, V4 Pro pour l’exécution de volume. Mes dépenses en IA ont diminué de près des deux tiers, et je n’ai constaté aucune baisse de qualité sur ce que je livre.

Le verdict honnête

Si vous ne devez retenir qu’une chose de cette revue de DeepSeek V4 Pro, la voici : c’est le premier modèle open-weights que je déploierais en toute confiance dans un workflow de production pour petite entreprise, avec les réserves mentionnées précédemment.

Ce n’est pas le meilleur modèle disponible. Opus 4.7 reste supérieur. GPT-5.5 Pro fait encore mieux sur les tâches les plus ardues. Si votre budget vous permet d’accéder aux modèles de frontière et que votre travail exige leur niveau d’excellence, continuez de les utiliser.

Mais si votre budget ne le permet pas, ou si une grande partie de votre charge de travail n’exige pas vraiment une qualité de frontière, V4 Pro marque une avancée radicale par rapport à tout ce qui existe dans la catégorie open-weights. Il surpasse Kimi K2.6 sur la plupart de mes tests. Il fait mieux que Qwen 3.6 pour le codage agentique, et de manière significative sur les tâches longues. Il prend le dessus sur Gemma 4 pour du travail sérieux, même si Gemma reste mon premier choix pour un usage totalement hors ligne.

La vérité qui dérange pour les laboratoires de pointe, c’est que « suffisamment bon, dix fois moins cher », est une position concurrentielle dévastatrice, et DeepSeek V4 Pro est le premier modèle open-weights à véritablement l’occuper. Les pages de tarification des labs américains vont devoir évoluer. Je ne sais pas à quelle vitesse, mais elles y seront obligées.

Et voici ce qui me revient sans cesse en tête depuis ce jeudi soir, à 23h47, avec quatre terminaux actifs et une addition de vingt centimes : le futur que je croyais être à cinq ans d’ici — une IA open source performante que l’on pourrait exécuter quatre fois en parallèle pour le prix d’un café — n’est plus à cinq ans. C’est déjà un abonnement hébergé avec un bouton « 5 $ pour votre premier mois » sur la page d’accueil.

Si vous attendiez encore de prendre l’IA open source au sérieux parce qu’elle n’était pas tout à fait au niveau, l’attente est terminée. Téléchargez-la. Lancez-la. Déléguez-lui vos tâches secondaires et gardez votre budget de pointe pour ce qui l’exige vraiment. Vous serez stupéfait de voir à quel point les modèles coûteux ne vous manqueront pas pour 80 % de ce que vous produisez.

Voilà le véritable scoop. Tout le reste n’est que commentaire.

Foire Aux Questions

DeepSeek V4 Pro est-il réellement open source ?

DeepSeek V4 Pro est distribué sous une licence open-weights, ce qui signifie que les poids du modèle sont téléchargeables et exécutables en local, bien que les données d'entraînement et l'intégralité du code d'entraînement ne soient pas publiées. Pour la plupart des usages — auto-hébergement, fine-tuning, inférence locale — il fonctionne comme un modèle open source. Les poids Pro 1,6T sont inexploitables sur du matériel grand public, mais la variante 284B V4 Flash est exécutable via Ollama sur des stations de travail sérieuses.

Comment DeepSeek V4 Pro se compare-t-il à GPT-5.5 et Opus 4.7 pour le code ?

V4 Pro est légèrement en retrait par rapport à Opus 4.7 et GPT-5.5 Pro sur les benchmarks de codage les plus complexes, mais il dépasse Opus sur Terminal Bench et n'est qu'à peine derrière GPT-5.4 sur SWE Pro. Pour les tâches de codage one-shot, il reste compétitif ; pour le refactoring itératif et complexe à grande échelle sur des bases de code étendues, les modèles propriétaires de pointe conservent une avance significative. Voir les walkthroughs de tests ci-dessus pour des comparaisons détaillées.

Quelle est la véritable performance de DeepSeek V4 Pro sur du long contexte ?

En dépit du contexte annoncé d'un million de tokens, la qualité pratique chute sensiblement au-delà de 180 000-200 000 tokens. J'ai mesuré en testant sur des bases de code une limite fiable tournant autour de 128K tokens avant l'apparition de confabulations. Pour l'analyse architecturale sur de longs contextes, Opus 4.7 ou Gemini restent de meilleurs choix.

DeepSeek V4 Pro est-il moins cher que Claude et GPT ?

Oui, de façon spectaculaire. Les tarifs API sont environ 7 fois inférieurs à ceux d'Opus 4.7 et à peu près 40 fois moins chers que ceux de GPT-5.5 Pro pour des volumes de travail équivalents. Le plan Open Code Go à 10 $/mois avec quatre instances parallèles est la solution la plus économique pour la majorité des développeurs solo. Mon week-end complet de tests m'a coûté moins de 2 $ au total.

DeepSeek V4 Pro applique-t-il une censure ?

Oui. L’API hébergée applique un filtrage de contenu conforme à la ligne du PCC sur des sujets comme le statut politique de Taïwan, la place Tian’anmen ou le Xinjiang. Pour le travail de codage, cela n’intervient pratiquement jamais, mais pour toute analyse touchant à la politique chinoise ou aux droits humains, il vaut mieux passer par un autre modèle. L’inférence locale via Ollama présente un filtrage nettement plus faible puisqu’elle contourne la couche API.

Travaillons ensemble

Vous souhaitez construire des systèmes d’IA, automatiser vos workflows ou faire évoluer votre infrastructure technologique ? Je serais ravi de vous accompagner.

Publicité
Coffee cup

Vous avez apprécié cet article ?

Votre soutien m'aide à créer davantage de contenu technique approfondi, d'outils open source et de ressources gratuites pour la communauté des développeurs.

Sujets connexes

Engr Mejba Ahmed

Engr Mejba Ahmed

Engr. Mejba Ahmed builds AI-powered applications and secure cloud systems for businesses worldwide. With 8+ years shipping production software in Laravel, Python, and AWS, he's helped companies automate workflows, reduce infrastructure costs, and scale without security headaches. He writes about practical AI integration, cloud architecture, and developer productivity.

Articles connexes

Tout parcourir

Comments

Leave a Comment

Comments are moderated before appearing.

Learning Resources

Expand Your Knowledge

Accelerate your growth with structured courses, verified certificates, interactive flashcards, and production-ready AI agent skills.

Sample Certificate of Completion

Sample certificate — complete any course to earn yours

Engr Mejba Ahmed

Engr Mejba Ahmed

AI assistant · trained on my work

👋

Hey there!

Quick Actions

WhatsApp Direct line to me

Chat on WhatsApp

+880 1723 741224 · Replies within the hour on working days

Popular Questions

Engr Mejba Ahmed is connected
Engr Mejba Ahmed is typing...
Engr Mejba Ahmed avatar

✉ Want me to follow up? Drop your email

Engr Mejba Ahmed avatar

📞 Connect Directly

Choose how you'd like to reach me

WhatsApp

+880 1723 741224

Email

mejba.13@gmail.com

✓ Details sent! I'll get back to you shortly.

Powered by OpenAI

335+

Blog Posts

25

AI Courses

63

Projects

Services & Expertise

Pricing & Process

Learning & Resources

Connect & Support