Nex N2 : L'IA agentique open-source à surveiller
Un laboratoire chinois dont je n'avais jamais entendu parler a publié un modèle open-weight de 397 milliards de paramètres le 2 juin 2026, a prétendu qu'il battait Claude Opus 4.7 sur un benchmark de programmation, et l'a distribué gratuitement sous Apache 2.0. Mon premier instinct a été le même que chaque fois qu'un nouveau « tueur de GPT » apparaît dans mon fil : lever les yeux au ciel et continuer à défiler.
Puis j'ai lu la model card plus attentivement. Nex N2 — le modèle d'IA agentique open-source d'une équipe appelée Nex AGI — ne se présente pas comme un chatbot plus intelligent. Il est construit autour de quelque chose de plus spécifique : fusionner la programmation, la recherche, l'utilisation d'outils, le débogage et l'auto-vérification dans une seule boucle de raisonnement continu au lieu de les boulonner comme des compétences séparées. C'est un pari de conception réellement différent, et c'est la partie qui mérite attention.
Voici donc ce qu'est réellement cet article. Je n'ai pas fait tourner Nex N2 en production contre la base de code d'un client payant, et je ne vais pas prétendre l'avoir fait. Ce que j'ai fait, c'est lire les spécifications publiées, les revendications officielles de benchmarks, les évaluations indépendantes et les retours pratiques — puis filtrer tout cela à travers des années d'exécution locale de modèles ouverts et d'observation de chiffres de benchmarks qui s'effondrent dès que le vrai travail les frappe. Les chiffres phares des benchmarks sont incroyables. La réalité indépendante est plus compliquée. Ces deux choses sont vraies en même temps, et vous devez comprendre pourquoi avant de connecter cette chose à quoi que ce soit d'important.
Ce qu'est réellement Nex N2 (et pourquoi « agentique » n'est pas du marketing ici)
La plupart des modèles que vous avez utilisés traitent le comportement agentique comme une réflexion après coup. Le modèle de base apprend le langage, puis quelqu'un l'enveloppe dans un échafaudage — une boucle qui dit « maintenant appelle cet outil, maintenant lis le résultat, maintenant décide la suite ». Le raisonnement et l'action vivent dans des boîtes séparées, cousues ensemble par du prompt engineering et un framework comme LangChain ou le Claude Agent SDK.
Nex N2 inverse cela. Nex AGI l'appelle Agentic Thinking — une seule boucle fermée où le modèle comprend une exigence, planifie la tâche, écrit l'implémentation, lit le retour de l'environnement, évalue si ça a marché, débogue et itère. Tout cela se passe au sein d'un même paradigme de raisonnement plutôt qu'à travers une chaîne d'appels séparés. On ne dit pas au modèle d'agir ; agir fait partie de sa façon de penser.
Il y a deux composantes de ce framework qui méritent d'être nommées. Adaptive Thinking permet au modèle de décider par lui-même quand raisonner en profondeur et quand simplement avancer — exécuter instantanément une simple commande shell, mais ralentir et réfléchir sérieusement avant une décision coûteuse à annuler. Coherent Thinking maintient un style de raisonnement cohérent entre les questions générales et les tâches agentiques, pour que le modèle n'oscille pas entre « assistant bavard » et « robot appeleur d'outils » selon ce qu'on lui demande.
Pourquoi cela compte pour vous ? Parce que les workflows qui cassent la plupart des agents sont les mixtes. La tâche qui est à 40% écrire du code, 30% chercher de la documentation, 20% exécuter des commandes terminal et 10% attraper sa propre erreur — et basculer entre ces modes une douzaine de fois avant d'en finir. Un modèle avec raisonnement et action fusionnés dans une boucle a un avantage structurel pour cela. Un modèle avec un échafaudage d'agent boulonné a tendance à perdre le fil.
C'est la théorie. Les spécifications nous disent si le labo a réellement construit quelque chose capable de l'exécuter.
Mini vs Pro : les deux modèles, et lequel tourne sur votre matériel
Nex N2 est disponible en deux tailles, les deux avec des poids ouverts et des versions quantifiées pour le déploiement local.
Nex N2 Mini est un modèle Mixture-of-Experts de 35 milliards de paramètres (une base Qwen3.5-35B-A3B) avec environ 3 milliards de paramètres actifs par token. Le design MoE est tout le sens du nombre de « paramètres actifs » — le modèle contient 35B de connaissances totales mais n'active qu'un petit sous-ensemble d'experts sur chaque token, donc il tourne bien plus léger qu'un modèle dense de 35B. Avec une build quantifiée, Mini est la variante que vous pouvez de façon réaliste installer sur une station de travail avec un GPU correct et faire tourner hors ligne.
Nex N2 Pro est le vaisseau amiral : un MoE de 397 milliards de paramètres construit sur Qwen3.5-397B-A17B, activant 17 milliards de paramètres par token. Il accepte du texte et des images en entrée, produit du texte en sortie, et supporte le raisonnement, le function calling et les sorties structurées — la boîte à outils complète qu'on voudrait pour un vrai dispositif agentique. Le chiffre phare qui attire l'attention est la fenêtre de contexte.
La fenêtre de contexte de Nex N2 Pro est de 262 000 tokens, avec une sortie allant jusqu'à 256 000 tokens. C'est assez pour maintenir simultanément une base de code substantielle, un long historique de tâches et une pile de documentation en mémoire de travail — exactement ce dont un agent à long horizon a besoin quand il est à douze étapes dans une construction et ne peut pas se permettre d'oublier l'étape un.
Un détail que les propres sorties du modèle révèlent : il produit des résultats dans le style GPT, une empreinte d'un entraînement distillé sur des modèles de type GPT. Vous le remarquerez dans l'interface qu'il génère et dans la façon dont il structure le code. Pas un défaut, juste un marqueur — et un utile quand vous essayez de comprendre d'où viennent les instincts d'un modèle. Si vous avez passé du temps avec le comportement de différents modèles ouverts, c'est le même type d'identification de lignée sur lequel je me suis appuyé dans mon review de DeepSeek V4 Pro open-source, où l'héritage d'entraînement façonne silencieusement tout en aval.
La lignée Qwen compte aussi. Construire sur la base Qwen3.5 d'Alibaba signifie que Nex N2 hérite d'une fondation éprouvée au combat plutôt que de repartir de zéro — ce qui explique en partie pourquoi un labo dont la plupart des gens n'ont jamais entendu parler a pu livrer quelque chose d'aussi performant aussi vite.
Les spécifications sont des promesses. Les benchmarks sont l'endroit où les promesses sont testées — et où l'histoire se scinde en deux.
Les revendications de benchmarks : ce que Nex AGI dit que Nex N2 peut faire
Laissez-moi d'abord exposer les chiffres officiels, clairement attribués à l'équipe, car ce sont la raison pour laquelle quiconque parle de ce modèle. Ce sont les résultats rapportés par Nex AGI, pas une vérification indépendante — gardez cette distinction à l'esprit.
Sur Terminal-Bench 2.1, qui teste la capacité d'un modèle à opérer réellement dans un terminal et à accomplir de vraies tâches d'ingénierie, Nex N2 Pro obtient prétendument 75,3 — devant Claude Opus 4.7 à 69,7, DeepSeek-V4-Pro à 72,0 et GLM-5.1 à 58,7. Qu'un modèle open-weight revendique la première place en exécution terminal contre Opus est le genre de résultat qu'on capture en screenshot et qu'on partage.
Sur SWE-Bench Pro, la variante plus difficile du benchmark d'ingénierie logicielle qui demande à un modèle de corriger de vrais bugs dans de vrais dépôts, Nex N2 Pro atteint prétendument 58,8 — juste au-dessus de GPT-5.5 à 58,6. Sur le plus courant SWE-Bench Verified, l'équipe rapporte 80,8, ce qui est solidement en territoire de frontière.
Quelques autres de la feuille officielle. Sur GDPval — une évaluation à long horizon économiquement ancrée qui note la capacité d'un modèle à gérer du travail professionnel réaliste en plusieurs étapes — Nex N2 Pro se situe prétendument autour de 1585. Sur des tâches agentiques basées sur navigateur, Nex AGI revendique des résultats devant DeepSeek V4 Pro et GLM 5.1. Sur les évaluations de tool-calling, l'équipe rapporte des chiffres solides sur toute la ligne.
Pris au pied de la lettre, c'est un modèle gratuit, open-weight, exécutable localement, qui rivalise avec les systèmes propriétaires les plus chers du marché. Si vous avez suivi la vague open-source — la même vague que j'ai couverte quand Kimi K2.6 est arrivé comme un modèle de programmation ouvert sérieux — vous savez que c'est la trajectoire que tout le monde avait prédite. L'écart entre ouvert et fermé continue de se réduire.
Voici le détail que personne ne capture en screenshot.
Pourquoi les tests indépendants classent Nex N2 bien plus bas que les gros titres
Les chiffres de benchmarks du labo qui a construit le modèle sont du marketing tant que quelqu'un d'autre ne les reproduit pas. Et quand des évaluateurs indépendants soumettent Nex N2 à des conditions plus dures et réalistes, l'histoire change.
Le schéma qui a émergé dans les tests indépendants : Nex N2 se classe autour du #12 au classement général — nulle part près du top cinq que les benchmarks officiels impliquent. Sa performance est constante, mais constamment bonne n'est pas la même chose que leader de catégorie. Dans les conditions contrôlées d'un benchmark publié, le modèle brille. Dans des évaluations plus désordonnées du monde réel avec des tâches adversariales et des cas limites, il se stabilise dans la moitié supérieure du peloton.
Ce n'est pas un scandale propre à Nex. C'est le schéma le plus fiable de tout le cycle de sortie de modèles, et je l'ai vu se produire une douzaine de fois. Les labos rapportent des scores dans leur configuration optimale, avec leurs prompts, sur leur sélection de tâches. Puis le modèle rencontre votre vrai workflow — votre structure de dépôt bizarre, votre API interne à moitié documentée, votre ticket ambigu — et le chiffre qui comptait sur la diapositive cesse de compter. J'ai creusé exactement cet écart entre les scores du classement et le vrai comportement de programmation sur plusieurs modèles dans mon analyse de DeepSeek V4, GLM5 et l'autonomie, et la leçon s'applique proprement ici : faites confiance aux exécutions indépendantes, pas au deck de lancement.
Il y a un deuxième problème structurel. Nex N2 est lent. Cette même boucle d'Agentic Thinking — la planification, l'auto-vérification, l'itération pendant la génération — est exactement ce qui rend le modèle réfléchi, et c'est aussi ce qui lui fait prendre son temps. Chaque passe d'auto-vérification, ce sont plus de tokens générés avant que vous obteniez une réponse. Quand le modèle raisonne, planifie, débogue et revérifie son propre travail en pleine génération, vous attendez. Pour une session de programmation interactive où vous voulez une réponse en deux secondes, cette latence est un vrai coût. Pour une construction autonome nocturne où vous vous souciez de la correction plus que de la vitesse, c'est un échange équitable. Sachez lequel vous exécutez avant de juger le modèle.
Alors comment décidez-vous réellement si cette chose vaut votre temps ? Vous regardez ce qu'elle construit.
Ce que Nex N2 construit : les démos qui tiennent et celles qui ne tiennent pas
Le signal le plus honnête sur tout modèle de génération de code n'est pas son benchmark — c'est ce qu'il produit quand vous lui donnez une vraie demande de construction. Les démonstrations qui circulent pour Nex N2 racontent une histoire agréablement mitigée, ce qui est exactement ce qui les rend crédibles.
Du côté des réussites : Nex N2 a généré une interface front-end fonctionnelle avec des éléments dynamiques et des animations qui avait l'air genuinement polie — l'empreinte du style GPT transparaissant dans un design propre et moderne. Il a construit un jeu de tower defence entièrement fonctionnel, le type de projet interactif avec état qui expose rapidement les faiblesses d'un modèle si sa logique est bancale. Il a produit une simulation de lampe à lave basée sur SVG avec de la vraie physique et du mouvement, pas un dégradé statique faisant semblant d'être de l'animation. Quand vous le nourrissez avec des prompts détaillés et descriptifs et des demandes spécifiques par élément, il s'adapte bien et respecte les détails.
Le plus impressionnant et le plus révélateur : Nex N2 a construit des clones de systèmes d'exploitation — Windows 95 et Mac OS — complets avec des menus Démarrer, des applications fonctionnelles, un outil Paint, une calculatrice, un navigateur et une invite de commande MS-DOS. C'est une quantité énorme d'état coordonné et d'interface à générer de manière cohérente.
Mais les fissures apparaissent exactement là où on les attend. La barre supérieure du clone Mac OS était non fonctionnelle — les éléments se rendaient magnifiquement et ne faisaient rien. Un jeu de course demandé est revenu avec des fonctions qui ne marchaient pas — l'échafaudage était là, le comportement non. C'est la signature d'un modèle de code fort mais pas impeccable : il cloue la structure et la surface, puis laisse tomber le câblage sur les parties interactives plus difficiles. Vous obtenez quelque chose qui a l'air terminé à 95% et qui est fonctionnellement terminé à 70%, et combler cette dernière lacune est votre responsabilité.
Cette lacune est tout le jeu quand vous évaluez un modèle de programmation pour du vrai travail. Une démo qui a l'air terminée est facile. Une démo qui est terminée est la partie difficile, et Nex N2 — comme presque tous les modèles à ce niveau — vous emmène la majeure partie du chemin et vous demande de finir le travail. Si vous voulez un sens plus profond de la façon dont je sépare « a l'air terminé » de « est terminé » en jugeant des interfaces construites par IA, j'ai travaillé exactement cette distinction dans mon review du workflow design vers site web avec Claude.
Si vous avez lu jusqu'ici, vous en savez déjà plus sur Nex N2 que la plupart des gens qui partagent ses captures de benchmarks. Voici comment mettre la main dessus.
Comment essayer Nex N2 maintenant (gratuitement, trois façons)
Vous n'avez pas besoin de croire quiconque sur parole — moi compris. Nex N2 est suffisamment ouvert et accessible pour que vous puissiez vous forger votre propre opinion cet après-midi. Voici les trois chemins réalistes, ordonnés du moindre au plus grand effort.
1. OpenRouter (zéro configuration, tier gratuit). Nex N2 Pro est disponible sur OpenRouter, et pendant la fenêtre de lancement de juin 2026, il est listé sur le tier gratuit à 0,000 $ par million de tokens d'entrée et de sortie. Si vous routez déjà des modèles via OpenRouter, c'est un changement d'ID de modèle en une ligne. J'ai parcouru ce schéma exact de gateway — pointer votre outillage existant vers OpenRouter et permuter le modèle en dessous — dans mon guide Claude Code avec OpenRouter, et la même configuration s'applique ici. Pointez votre agent vers nex-agi/nex-n2-pro:free et c'est parti.
2. Fournisseurs hébergés (promos de lancement gratuites). Au-delà d'OpenRouter, plusieurs fournisseurs d'inférence — SiliconFlow et d'autres — ont adopté Nex N2 Pro et offert un accès gratuit ou illimité pendant la fenêtre de lancement. Le vaisseau amiral a été promu comme gratuit avec utilisation illimitée pour une période d'introduction via des plateformes de benchmark et d'évaluation. Ces promos sont limitées dans le temps, donc la fenêtre « gratuit illimité » ne durera pas éternellement — si vous voulez stress-tester le modèle Pro sans payer, c'est maintenant.
3. Déploiement local (Mini, quantifié). C'est là que les poids ouverts prouvent leur valeur. Mini et Pro ont tous deux des poids ouverts et des builds quantifiés, et Nex N2 Mini est celui qui tourne de façon réaliste sur du matériel local grâce à ses 3B de paramètres actifs. Téléchargez un GGUF quantifié ou équivalent, chargez-le dans LM Studio ou Ollama, et vous avez un modèle agentique qui tourne entièrement hors ligne — pas de clé API, pas de limite de débit, pas de données quittant votre machine. Si vous n'avez jamais configuré un modèle local, mon guide d'installation locale de Gemma 4 dans LM Studio couvre exactement le même workflow étape par étape ; échangez le fichier du modèle et le processus est identique.
Une note pratique sur les promos gratuites : traitez-les comme exactement ce qu'elles sont. L'accès gratuit de lancement est une fonctionnalité, pas un engagement. Construisez votre workflow pour qu'il ne dépende pas d'un tier gratuit qui s'évapore dans trois semaines — gardez l'option locale Mini comme solution de repli, car celle-là est gratuite pour toujours sous Apache 2.0.
Cette clause d'utilisation commerciale mérite qu'on s'y arrête un instant, car elle change entièrement le calcul.
Le détail Apache 2.0 qui compte vraiment pour les développeurs
Voici la partie où tout fondateur solo ou petite agence devrait prêter attention. Nex N2 est livré sous Apache 2.0 — Mini et Pro. Cela signifie que vous pouvez l'utiliser commercialement, le modifier, le fine-tuner et l'auto-héberger sans payer de frais de licence ni demander la permission à quiconque.
Comparez cela avec la frontière propriétaire. Opus et GPT-5.5 sont extraordinaires, et je paie pour eux quand la fiabilité n'est pas négociable. Mais vous ne les possédez pas. Votre accès est un abonnement, vos coûts augmentent avec l'utilisation, et vos données transitent par les serveurs de quelqu'un d'autre. Pour un projet client soumis à des exigences strictes de résidence des données, ou un produit où les coûts par token mangeraient votre marge, un modèle auto-hébergé Apache 2.0 n'est pas un downgrade — c'est la seule architecture viable.
C'est la vraie histoire derrière le drame des benchmarks. Que Nex N2 soit classé #5 ou #12 est presque hors sujet. Un modèle open-weight, sous licence commerciale, agentique, qui est constamment bon et tourne sur votre propre matériel, est une catégorie d'utilité différente d'un modèle propriétaire marginalement meilleur et entièrement hors de votre contrôle. La même logique a motivé la migration que j'ai documentée quand des équipes ont commencé à construire des workflows sérieux sur des modèles gratuits et ouverts au lieu de choisir par défaut l'option la plus chère.
Où Nex N2 s'intègre dans votre vrai workflow
Laissez-moi être précis sur qui devrait s'y intéresser, parce que « modèle open-source prometteur » n'aide personne à prendre une décision.
Utilisez Nex N2 si vous construisez des workflows agentiques autonomes à long horizon où la correction compte plus que la vitesse, vous avez besoin d'une grande fenêtre de contexte pour contenir une base de code entière, vous avez des contraintes de résidence des données ou de coûts qui excluent les API propriétaires, ou vous voulez un modèle performant tournant entièrement hors ligne. La boucle fusionnée raisonnement-et-action est un choix genuien pour des tâches mixtes à plusieurs étapes qui cassent les agents plus simples.
Ne vous tournez pas vers Nex N2 si vous avez besoin de réponses interactives en moins d'une seconde (la boucle d'auto-vérification le rend lent), vous faites un travail où les 5% supérieurs de capacité font la différence entre livrer et ne pas livrer, ou vous ne pouvez pas tolérer la lacune « a l'air terminé, n'est pas terminé » sur des composants interactifs complexes. Pour ceux-là, la frontière propriétaire mérite encore son premium.
Et quoi que dise le classement officiel, ancrez votre jugement aux résultats indépendants et à vos propres tests. La réalité du #12 vous est plus utile que la revendication du top cinq, parce que #12-mais-constant-et-gratuit-et-à-vous est un outil sur lequel vous pouvez réellement construire un business.
Il y a une question qui mérite réflexion pendant que vous décidez si vous téléchargez les poids ce soir : si un modèle que vous possédez entièrement et que vous faites tourner gratuitement vous amène à 85% de la capacité de frontière, combien valent vraiment ces derniers 15% — la partie que vous louez, la partie qui peut changer ses prix ou ses conditions sans vous demander — pour ce que vous construisez ?
Questions fréquemment posées
Nex N2 est-il vraiment gratuit à utiliser ?
Oui — Nex N2 est open-weight sous la licence Apache 2.0, donc il est gratuit pour toujours à télécharger, auto-héberger, modifier et utiliser commercialement. En plus, Nex N2 Pro a été proposé gratuitement pendant sa fenêtre de lancement de juin 2026 via le tier gratuit d'OpenRouter et plusieurs fournisseurs hébergés, bien que ces fenêtres promotionnelles soient limitées dans le temps.
Comment Nex N2 se compare-t-il à Claude Opus 4.7 ?
Selon les propres benchmarks de Nex AGI, Nex N2 Pro obtient prétendument 75,3 sur Terminal-Bench 2.1 contre 69,7 pour Opus 4.7. Mais les tests indépendants classent Nex N2 autour du #12 au classement général, bien en dessous du tier supérieur où se trouve Opus — traitez donc les victoires directes de benchmarks avec prudence et fiez-vous aux évaluations indépendantes.
Puis-je faire tourner Nex N2 sur mon propre ordinateur ?
Oui, Nex N2 Mini est conçu pour tourner sur du matériel local. Son design Mixture-of-Experts de 35 milliards de paramètres avec seulement 3 milliards de paramètres actifs, plus les builds quantifiés, lui permettent de tourner sur un GPU de station de travail capable via des outils comme Ollama ou LM Studio — entièrement hors ligne. Le modèle Pro de 397B nécessite du matériel sérieux ou un fournisseur hébergé.
Pourquoi Nex N2 est-il plus lent que d'autres modèles ?
Nex N2 est lent parce qu'il raisonne, planifie, débogue et auto-vérifie pendant la génération au lieu de répondre immédiatement. Cette boucle itérative d'Agentic Thinking produit des résultats à long horizon plus fiables mais génère bien plus de tokens avant de retourner une réponse, ce qui est un échange équitable pour du travail autonome et un vrai coût pour la programmation interactive.
Qu'est-ce qui rend Nex N2 « agentique » par rapport aux autres modèles ?
Nex N2 fusionne la programmation, la recherche, l'utilisation d'outils, le débogage et la vérification dans une seule boucle de raisonnement continu au lieu de les boulonner comme un échafaudage séparé. Son framework Agentic Thinking, avec Adaptive et Coherent Thinking, permet au raisonnement et à l'action de se produire au sein du même paradigme — un avantage structurel pour les workflows du monde réel mixtes et à plusieurs étapes.
Travaillons ensemble
Vous cherchez à construire des systèmes d'IA, automatiser des workflows ou faire évoluer votre infrastructure technologique ? Je serais ravi de vous aider.
- Fiverr (builds sur mesure et intégrations) : fiverr.com/s/EgxYmWD
- Portfolio : mejba.me
- Ramlit Limited (solutions entreprise) : ramlit.com
- ColorPark (design et branding) : colorpark.io
- xCyberSecurity (services de sécurité) : xcybersecurity.io