Un phénomène étrange s'est produit dans le secteur de l'IA au cours des huit dernières semaines.
En juin, Z.ai a lancé GLM-5.2 et est discrètement devenu le premier modèle à poids ouvert à dépasser les 801 TP3T sur Terminal-Bench. En juillet, Moonshot AI a lancé Kimi K3 — 2,8 billions de paramètres, le plus grand modèle à poids ouvert jamais publié — et les actions chinoises du secteur de l’IA ont chuté en cascade dans la foulée. Puis, le 3 août, Alibaba a riposté avec Qwen3.8-Max, doté de 2 400 milliards de paramètres, et a mis en open source un modèle de niveau « Max » pour la première fois de son histoire.
Trois modèles proches de la frontière. Trois philosophies différentes en matière de licences. Trois gammes de prix radicalement différentes. Et une multitude d'articles confus qui les traitent comme s'ils étaient interchangeables.
Ils ne sont pas interchangeables. L’un d’entre eux ne peut pas afficher d’images. L’autre n’est en réalité pas encore téléchargeable, bien qu’une centaine d’articles le qualifient d“” open source ». Et l’un d’entre eux coûte cinq fois plus cher par jeton généré qu’un autre, tout en affichant de moins bons résultats dans plusieurs tests de performance de programmation.
C'est cette comparaison qui permet de trancher.
TL;DR — Le verdict en 30 secondes
Si vous recherchez les performances brutes les plus élevées et que vous en avez les moyens : Kimi K3. Il occupe la #4e place de l’indice d’intelligence artificielle d’analyse et la #1e place sur Frontend Code Arena ; c’est le seul des trois à rivaliser avec les modèles phares de Claude et GPT. Pour bénéficier de ce privilège, il vous en coûtera $3/$15 par million de jetons.
Si vous recherchez le meilleur rapport coût/performances en matière de codage : GLM-5.2. À $1,40/$4,40, son prix représente moins d’un tiers de celui du K3, il est bel et bien sous licence MIT, et ses poids sont disponibles sur Hugging Face depuis juin. Il ne peut tout simplement pas traiter d’images.
Si vous avez besoin d'entrées multimodales et d'agents à long terme dans un même modèle : Qwen 3.8 - Max. Texte, image et une entrée vidéo, ainsi que les meilleurs résultats publiés en matière de vision artificielle parmi les trois. Cependant, à l'heure où nous écrivons ces lignes, les poids ne sont encore qu'une promesse et ne peuvent pas être téléchargés.
Si vous vous lancez dans un projet sérieux : N'en utilisez pas qu'un seul. La section consacrée au routage ci-dessous explique pourquoi ce n'est pas une réponse évasive.
Table des matières
- Pourquoi cette comparaison est-elle importante en ce moment ?
- Découvrez les candidats
- Comparaison des caractéristiques techniques
- Analyse approfondie des tests de performance
- Le benchmark Asterisk dont personne ne parle
- Tarification : le calcul du coût réel
- Que signifie réellement l'expression “ poids libres ” dans ce contexte ?
- Peut-on réellement les héberger soi-même ?
- Les trois fenêtres de contexte de 1M ne sont pas identiques
- Quel modèle choisir ?
- La stratégie de routage multimodèle
- Risques, mises en garde et signaux d'alerte
- À venir
- Foire aux questions
- Verdict final
Pourquoi cette comparaison est-elle importante en ce moment ?
Pendant la majeure partie des années 2024 et 2025, le débat sur les poids libres s'est résumé à un tournoi de consolation. On choisissait un modèle « Western Frontier » pour les tâches difficiles et un modèle « open » pour les productions bon marché et à grand volume. L'écart était bien réel et tout le monde le savait.
Ce cadre s'est brisé cet été.
Lorsque Moonshot a lancé Kimi K3 à la mi-juillet, la réaction du marché en a dit plus long que n’importe quel tableau comparatif. Les actions de Z.ai, cotées à Hong Kong, ont chuté de pas moins de 30%. MiniMax a perdu jusqu’à 16%. Alibaba a reculé de 4%. Les investisseurs ne réagissaient pas à un article de recherche, mais à un modèle que les développeurs, lors d’évaluations comparatives à l’aveugle, préféraient aux principaux systèmes américains pour le codage front-end.
Le lancement de Qwen3.8-Max par Alibaba a ensuite fait bondir le cours de son action de 71 TP3T à Hong Kong. La même semaine, le chiffre d’affaires quotidien de Moonshot aurait été multiplié par au moins six après le lancement du K3, l’entreprise ayant atteint $300 millions de chiffre d’affaires récurrent annuel en juin — contre $200 millions en avril — tout en cherchant à lever des fonds sur la base d’une valorisation de $50 milliards.
Il ne s'agit plus ici de solutions bon marché. La question est de savoir si le prix des capacités de pointe vient de s'effondrer et, si tel est le cas, laquelle de ces trois options vous devriez réellement intégrer dans votre production.
Découvrez les candidats
Kimi K3 (Moonshot AI)
Date de sortie : 16 juillet 2026 (API) · 27 juillet 2026 (poids)
Kimi K3 est un modèle à grande échelle. Avec un total de 2,8 billions de paramètres, il est environ 75% plus grand que le V4 Pro de DeepSeek, qui détenait jusqu’alors le titre de “ plus grand modèle ouvert largement utilisé ”. Mais le chiffre qui importe pour quiconque s'intéresse au coût d'inférence est celui de la structure clairsemée : K3 utilise une architecture de type « mixture-of-experts » comprenant 896 experts, dont seulement 16 sont actifs par token, ce qui signifie qu'environ 50 milliards de paramètres sont mis à contribution lors de chaque passage en avant.
Deux œuvres architecturales sont la création de Moonshot : Kimi Delta Attention, un mécanisme d'attention linéaire hybride, et Attention : résidus, que l'entreprise décrit comme une solution de remplacement directe des connexions résiduelles standard, dont les avantages se concrétisent à mesure que vous évoluez. Ces deux projets avaient été publiés sous forme de recherche ouverte sur GitHub avant la sortie de K3.
Le positionnement est sans ambiguïté : Moonshot a conçu cette solution pour l’ingénierie à long terme. L’approche de l’entreprise vise à permettre des sessions de plusieurs heures, à naviguer dans de vastes référentiels et à orchestrer des outils de terminal avec un minimum de supervision. La solution intègre une compréhension visuelle native et un mode de raisonnement toujours actif ; elle est compatible avec le SDK d’OpenAI, ce qui signifie que l’intégration se résume essentiellement à remplacer l’URL de base.
Qwen3.8-Max (Alibaba)
Date de sortie : 19 juillet 2026 (avant-première au WAIC de Shanghai) · 3 août 2026 (lancement officiel)
Qwen3.8-Max compte 2,4 billions de paramètres au total, dont environ 95 milliards sont actifs par jeton — soit près du double du nombre de paramètres actifs de K3, ce qui a des implications concrètes sur le coût de traitement, sur lesquelles nous reviendrons.
Ce qui est véritablement nouveau ici, ce n’est pas l’échelle, mais la modalité. Il s’agit du premier modèle Qwen dépassant le billion de paramètres à devenir multimodal, capable de traiter du texte et des images et vidéo en entrée. C'est d'ailleurs la première fois qu'Alibaba s'engage à mettre en open source un modèle phare de la gamme Max. Tous les modèles Max précédents — Qwen3.7-Max, Qwen3.6-Max-Preview — restaient accessibles uniquement via l'API, tandis que la gamme « open-weight » se développait séparément avec des tailles plus réduites.
Les démonstrations à long terme d’Alibaba constituent la stratégie marketing la plus marquante des trois. Dans l’une d’elles, le modèle aurait passé plus de dix jours à construire de manière autonome un ensemble logiciel auto-évolutif, en intégrant des retours d’expérience et en itérant à travers le code, les aperçus et les journaux, sans aucune intervention humaine. Dans une autre, il a reproduit de toutes pièces un article de recherche sur l’apprentissage automatique : 33 cycles d’entraînement sur GPU répartis sur environ 125 heures, 7 600 lignes de code, puis 18 idées d’amélioration générées automatiquement qui ont surpassé la méthode décrite dans l’article original. Participant à un concours en direct face à 526 équipes humaines, il s’est classé devant 87% des participants.
Considérez-les comme des démonstrations de fournisseurs, car c'est bien de cela qu'il s'agit. Mais ce sont des démonstrations de fournisseurs particulièrement détaillées.
GLM-5.2 (Z.ai / Zhipu AI)
Date de sortie : 13 juin 2026 (aperçu du plan de développement) · mi-juin 2026 (lancement officiel)
Le GLM-5.2 est de loin le plus petit modèle de cette sélection et celui qui offre la plus grande précision. Avec un total de 744 à 753 milliards de paramètres, dont environ 40 milliards actifs par token, il a été conçu dans un seul but : le codage agentique à long terme.
Cette orientation se traduit par une omission délibérée. Le GLM-5.2 ne dispose pas d'encodeur visuel. Il accepte le texte et le code. Si vous lui fournissez une capture d’écran, un PDF ou une maquette d’interface utilisateur, il renvoie une erreur. Jie Tang, cofondateur de Z.ai, a publiquement expliqué son raisonnement : selon lui, c’est le raisonnement basé sur le texte, et non les données visuelles, qui constitue la capacité permettant de repousser les limites de l’intelligence artificielle. Un sondage communautaire réalisé en juin sur les fonctionnalités de la prochaine version a enregistré plus de 466 000 vues, et la reconnaissance visuelle est arrivée en tête des demandes avec une large majorité. Cette fonctionnalité n’a toujours pas été mise en ligne.
Le GLM-5.2 se distingue par les conditions de licence les plus claires de ce comparatif et, de loin, par son prix le plus bas. Il a été publié sous une licence MIT sans restriction, avec des poids disponibles en ligne sur Hugging Face, et a bénéficié dès le premier jour d’une prise en charge dans plus de vingt environnements de programmation tiers.
Comparaison des caractéristiques techniques
| Kimi K3 | Qwen 3.8-Max | GLM-5.2 | |
|---|---|---|---|
| Développeur | Moonshot AI | Alibaba | Z.ai (Zhipu AI) |
| Nombre total de paramètres | 2,8 T | 2,4 T | ~744-753 av. J.-C. |
| Actif par jeton | ~50 milliards (16 experts sur 896) | ~95 milliards | ~40 milliards |
| Architecture | Attention « MoE clairsemé + Kimi Delta » | MoE clairsemé | MoE clairsemé + Attention partagée entre les indices |
| Fenêtre de contexte | 1 million de jetons | 1 million de jetons (991 000 au maximum) | 1 million de jetons |
| Puissance maximale | — | 131 000 jetons | 128 000 à 131 000 jetons |
| Saisie de texte | ✅ | ✅ | ✅ |
| Saisie d'images | ✅ | ✅ | ❌ |
| Entrée vidéo | ❌ | ✅ | ❌ |
| Modes de raisonnement | Une réflexion permanente | Standard / réflexion (budget de 262 000) | Élevé / Max. |
| Poids disponibles | ✅ 27 juillet 2026 | ⏳ Semaine prévue : celle du 10 août | ✅ Depuis juin 2026 |
| Licence | MIT modifié (sous certaines conditions) | Pas encore annoncé | MIT (sans restriction) |
| Entrée API / 1M | $3.00 | $2.00 | $1.40 |
| Sortie API / 1M | $15.00 | $6.00 | $4.40 |
| Données d'entrée mises en cache / 1 Mo | $0.30 | $0.25 | $0.26 |
Trois éléments ressortent clairement de ce tableau.
Tout d'abord, Le GLM-5.2 en fait plus avec moins. Sa taille correspond à peu près à un quart de celle de K3 et il se montre compétitif dans les tests de performance de codage — ce qui montre bien qu’en 2026, la taille n’est pas le seul critère qui compte.
Deuxièmement, Le nombre de paramètres actifs de Qwen3.8-Max est une valeur aberrante.. Avec environ 95 milliards de paramètres actifs, il en compte près de deux fois plus que le K3, bien que son nombre total soit inférieur. Les paramètres actifs déterminent le coût de fonctionnement ; par conséquent, toute personne envisageant un hébergement autonome doit garder à l’esprit que le modèle phare de Qwen revient plus cher à l’unité que ce qu’il en coûterait pour un modèle comportant 400 milliards de paramètres supplémentaires.
Troisièmement, l'écart de prix est énorme. Le coût des jetons générés par K3 est 3,4 fois supérieur à celui de GLM-5.2. Sur un mois d’utilisation intensive de l’agent, ce n’est pas une erreur d’arrondi.
Analyse approfondie des tests de performance
Codage et performance agentique
C'est là que les trois modèles visent, c'est donc là que la comparaison prend tout son sens.
| Référence | Kimi K3 | Qwen 3.8-Max | GLM-5.2 |
|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 86.6 | 81.0 |
| SWE-bench Pro | — | 67.7 | 62.1 |
| FrontierSWE | 81.2 | 73.5 | 74.4 |
| Marathon SWE | 42.0 (#1) | — | — |
| Banc de programme | 77.8 (#1) | — | — |
| DeepSWE | 67.5 | 56.6 | — |
| MCP-Atlas (utilisation d'outils) | ~Fable 5 −0,5 | — | 77.0 |
Pour replacer ces chiffres de Terminal-Bench dans leur contexte : GPT-5.6 Sol atteint un score maximal de 88,8 en raisonnement, tandis que Claude Opus 4.8 et Claude Fable 5 obtiennent tous deux 84,6 dans le tableau publié par Alibaba. Avec un score de 88,3, Kimi K3 se place à un demi-point de la première place. Le score de 86,6 de Qwen3.8-Max lui permet de devancer les deux modèles Claude dans ce même tableau. Le score de 81,0 de GLM-5.2 était, à l’époque, le premier score en catégorie ’ open-weight ’ à franchir la barre des 80.
La victoire la plus marquante du GLM-5.2 est précisément celle remportée face au GPT-5.5 : 62,1 contre 58,6 sur SWE-bench Pro, et 74,4 contre 72,6 sur FrontierSWE — ce dernier résultat le plaçant pratiquement à égalité avec Claude Opus 4.8, qui affiche 75,1. Sur le benchmark MCP-Atlas consacré à l’utilisation des outils, il a atteint 77,0 contre 75,3 pour le GPT-5.5 et 77,8 pour l’Opus 4.8.
Raisonnement et culture générale
| Référence | Kimi K3 | Qwen 3.8-Max | GLM-5.2 |
|---|---|---|---|
| GPQA Diamond | 93.5 | 92.6 | 89.5 |
| Indice d'analyse par intelligence artificielle | 57,11 (#4 sur 189) | — | 51.09 |
| BrowseComp | 91.2 (#1) | — | — |
| PaperBench | — | 93,0 (pistes) | — |
| IFBench | — | 82,8 (avances) | — |
Le score de 93,5 obtenu par K3 sur le benchmark GPQA Diamond était, au moment de son lancement, le meilleur score jamais publié par un modèle de poids ouvert sur ce benchmark. Sur l’indice indépendant Artificial Analysis Intelligence Index, il a obtenu un score de 57,11, se classant quatrième sur les 189 modèles suivis — derrière Claude Fable 5 (59,86) et les deux configurations de GPT-5.6 Sol (58,89 et 57,65), mais à venir de Claude Opus 4.8 à 55,69.
Le GLM-5.2 se situe nettement plus bas sur cet indice composite, à 51,09. Cet écart reflète fidèlement le coût de son avantage en termes de prix dans le domaine du raisonnement général — même s'il se réduit considérablement lorsqu'il s'agit de travail de programmation à proprement parler.
Multimodal et vision
C'est dans cette catégorie que le GLM-5.2 n'est tout simplement pas à la hauteur, et que le Qwen3.8-Max s'impose le plus clairement.
| Référence | Qwen 3.8-Max | Notes |
|---|---|---|
| Certifié par OSWorld | 86.1 | Tâches liées à l'utilisation d'un ordinateur |
| Banc de CAO paramétrique | 91.5 | Raisonnement structuré en matière de conception |
| OmniDocBench 1.5 | 92.1 | Compréhension de documents |
| Vision Arena | #2 à l'échelle mondiale | Juste derrière une variante de Fable 5 |
Qwen 3.8-Max arrive en tête de la plupart des rubriques liées à la vision dans le tableau publié par Alibaba, et sa deuxième place au classement Vision Arena constitue un indicateur indépendant véritablement solide. Kimi K3 dispose d’une compréhension visuelle native et afficherait de bonnes performances dans les tâches liées aux graphiques, aux documents et aux données multimodales, mais c’est Qwen qui domine cette catégorie parmi les trois.
Classements des préférences humaines
Les résultats « à l'aveugle » issus d'une consultation participative méritent d'être examinés séparément des tableaux de référence, car ils mettent en évidence des éléments que ces derniers ne reflètent pas.
- Frontend Code Arena : Kimi K3 s'est classé #1 avec 1 679 points Elo, devant Claude Fable 5 qui totalise 1 631 points. Qwen3.8-Max s'est classé #4 avec 1 668 points, soit 37 points derrière Claude Opus 5.
- Text Arena : Qwen3.8-Max s'est classé en tête des modèles chinois, même s'il reste derrière plusieurs modèles d'Anthropic.
- Code Arena : Le modèle GLM-5.2 s'est classé deuxième parmi les modèles de codage dans le classement « à l'aveugle ».
La victoire sans appel de Kimi K3 au Frontend Code Arena — devant Fable 5 — est sans doute le résultat le plus impressionnant de tout cet article.
Le benchmark Asterisk dont personne ne parle
Chaque tableau ci-dessus mérite un avertissement sanitaire, et une comparaison honnête doit le préciser clairement.
Les effets du harnais sont considérables. Un test de performance utilisant un agent de codage ne mesure pas un modèle. Il mesure un modèle et aussi l'environnement d'exécution qui l'entoure : accès aux outils, droits d'accès aux fichiers, logique de compactage du contexte, comportement en cas de nouvelle tentative, règles d'arrêt. Kimi Code, Claude Code, Codex, Terminus et mini-SWE-agent sont tous des harnais différents dotés de capacités distinctes. Un résultat intitulé “ Kimi K3 + Kimi Code ” n’est pas directement comparable à un résultat obtenu avec l’API seule.
La table de lancement propre à Moonshot combine plusieurs harnais : KimiCode et Claude Code pour K3, Claude Code pour les lignes Claude et GLM, et Codex pour GPT. Certains scores des concurrents proviennent des fournisseurs de ces derniers. Dans certaines évaluations, les requêtes Fable 5 rejetées en vertu de la politique d’utilisation ont été redirigées vers Opus 4.8. Les données recèlent toutefois un test de cohérence utile : le K3 a obtenu un score de 67,5 sur DeepSWE avec KimiCode et de 67,3 avec le harnais mini-SWE-agent propre au benchmark. Un écart de 0,2 point suggère que l’effet du harnais sur cette tâche particulière est faible.
Les stands des exposants mettent leurs auteurs en valeur. Les tests comparatifs multimodaux d'Alibaba opposent Qwen3.8-Max à Qwen3.7-Et en plus, et non Qwen3.7-Max — ce qui donne l'impression que le saut générationnel est plus important qu'il ne l'est en réalité. Il faut toutefois reconnaître qu'Alibaba a également publié une courbe d'évolution de l'apprentissage par renforcement qui ne Pour en dire plus : les performances atteignent un pic de 0,725 avec environ 4 000 environnements d'entraînement, puis baissent à 0,719 et 0,689. C'est une entreprise qui affiche publiquement ses rendements décroissants, ce qui va bien au-delà de ce que font la plupart des laboratoires.
La vérification indépendante accuse un retard. Le GLM-5.2 a été commercialisé sans aucun tableau de performances ; les chiffres qui circulent proviennent de données fournies par le fabricant et de tests réalisés par des tiers. Les cinq scores publiés pour le Qwen3.8-Max proviennent du fabricant ; aucune évaluation indépendante n’était disponible début août. Le Kimi K3 est celui qui bénéficie du plus grand nombre de données provenant de tiers — Artificial Analysis, Vals, Arena — mais même là, les résultats divergent les uns des autres. Le 17 juillet, Vals a classé le K3 en deuxième position au classement général, entre le Fable 5 et le GPT-5.6 Sol, tout en plaçant Sol devant le K3 spécifiquement sur les benchmarks Terminal-Bench 2.1 et SWE-bench Verified.
Le test indépendant le plus pertinent que j'ai trouvé a été réalisé par Fireworks AI, qui a comparé K3 à Claude Fable 5 sur environ 1 000 tâches de type « agentic ». Le résultat n'a pas permis de désigner un vainqueur incontestable. K3 s'est montré plus performant dans les domaines de la sécurité, de la cryptographie et des boucles terminales longues. Fable 5 s’est imposé dans les tâches multilingues et la visualisation de données/Web. Aucun des deux n’a dominé.
Ce qu'il faut retenir concrètement : Effectuez votre propre évaluation sur vos propres tâches avant de vous engager. Ces modèles sont tous suffisamment proches les uns des autres pour que le classement ne permette pas de prédire vos résultats.
Tarification : le calcul du coût réel
Tarifs de l'API par jeton
| Modèle | Entrée / 1M | Sortie / 1M | Données d'entrée mises en cache / 1 Mo |
|---|---|---|---|
| GLM-5.2 | $1.40 | $4.40 | $0.26 |
| Qwen 3.8-Max | $2.00 | $6.00 | $0.25 |
| Kimi K3 | $3.00 | $15.00 | $0.30 |
| Claude Sonnet 5 | $2.00 | $10.00 | — |
| Claude, opus 5 | $5.00 | $25.00 | $0.50 |
| Claude Fable 5 | $10.00 | $50.00 | — |
Deux remarques qui ont plus d'importance que les chiffres bruts.
Le Kimi K3 est proposé à un prix comparable à celui d'un modèle occidental de milieu de gamme, et non à celui d'une alternative économique. Avec un rapport $3/$15, son coût par jeton généré est supérieur à celui de Claude Sonnet 5 et 3,4 fois supérieur à celui de GLM-5.2. Si vous pensiez que “ modèle chinois à poids ouvert ” rimait avec “ bon marché ”, K3 vient contredire cette hypothèse.
C'est la mise en cache qui est le véritable levier, et non le prix affiché. Les entrées mises en cache par Qwen à $0,25 sont huit fois moins coûteuses que les entrées non mises en cache, et la documentation d’Alibaba souligne elle-même que la stabilité du préfixe influe davantage sur le coût que la longueur de la consigne. Pour les charges de travail d’agent avec une invite système stable et une conversation qui s’allonge, une mise en cache intensive aura un impact plus important sur votre facture que le choix du modèle. Qwen propose également la création explicite de cache à $2,50 et des lectures explicites à $0,17 pour les charges de travail que vous pouvez planifier en conséquence.
Formules d'abonnement
Si vous êtes un développeur indépendant ou une petite équipe, il se peut que la tarification au jeton ne corresponde pas du tout à votre mode d'achat.
Plan de codage GLM comporte trois niveaux. Les tarifs mensuels de base sont les suivants : $18 (Lite), $72 (Pro) et $160 (Max), avec des réductions selon le cycle de facturation : 10% pour la facturation mensuelle, 20% pour la facturation trimestrielle et 30% pour la facturation annuelle. Avec une facturation annuelle, cela revient à environ $12,60, $50,40 et $112 par mois. Chaque niveau vous offre un pool de suggestions actualisé toutes les cinq heures, et le forfait est compatible d’emblée avec Claude Code, Cline, Kilo Code et OpenClaw.
Il y a toutefois un point important à comprendre : la consommation du forfait est soumise à des coefficients multiplicateurs. Dans le cadre d’une offre promotionnelle, la consommation hors heures de pointe du forfait GLM-5.2 est facturée au coefficient 1× jusqu’en septembre 2026. Passé cette date, les coefficients reviendront à 2× en heures creuses et 3× en heures de pointe — ce qui signifie que votre forfait effectif dépend fortement de quand la manière dont vous travaillez, et pas seulement la quantité de travail que vous effectuez.
Qwen propose un abonnement « Token Plan » à partir d'environ $6 par mois (39 CNY) dans la formule « Lite », comme alternative à la facturation au jeton.
Moonshot propose différents niveaux d'abonnement pour les applications Kimi, nommés d'après des indications de tempo — Moderato, Allegro, Allegretto et Vivace —, les applications elles-mêmes étant gratuites dans la limite des quotas généraux.
Coût par tâche vs coût par jeton
Voici le piège : le prix par jeton ne correspond pas au coût par tâche accomplie.
Un modèle qui résout votre problème en un seul passage avec un débit de $15/1M peut facilement s'avérer moins coûteux qu'un modèle nécessitant quatre itérations à un débit de $4,40/1M. Les jetons de raisonnement sont facturés selon les taux de sortie de ces trois modèles, et le K3, en particulier, fonctionne en mode continu : une analyse a montré que le K3 avait effectué la suite d’analyses artificielles à un coût total légèrement inférieur à celui du GPT-5.6 Sol. malgré générant ainsi un nombre nettement plus élevé de jetons de sortie, car cela a nécessité moins de tentatives.
Mesurez le coût par ticket résolu, et non le coût par million de jetons. C'est le seul chiffre qui reflète la réalité.
Que signifie réellement l'expression “ poids libres ” dans ce contexte ?
C'est sur ce point que la plupart des analyses consacrées à ces trois modèles présentent des lacunes, car le terme “ ouvert ” occupe une place prépondérante dans de nombreux titres.
Trois états différents sont regroupés en un seul mot :
- Disponible via l'API — tu peux bien le réclamer, tu ne l'auras pas
- Poids libres — vous pouvez télécharger les paramètres
- Logiciel libre sous licence permissive — vous pouvez le télécharger, le modifier, le redistribuer et le commercialiser librement
Voici où se situe réellement chaque modèle.
GLM-5.2 : véritablement ouvert
Licence MIT, sans restriction, les modèles sont disponibles en ligne sur Hugging Face sous zai-org/GLM-5.2. Téléchargez, adaptez, hébergez vous-même, vendez des produits développés à partir de cette licence. Aucun seuil de chiffre d’affaires, aucune obligation d’attribution, aucune négociation. C’est ce qu’il y a de plus simple en matière de licence à accès libre, et c’est un véritable avantage concurrentiel dont on parle trop peu, car les licences MIT ne font pas la une des journaux.
Kimi K3 : ouverture sous certaines conditions
Les poids ont été publiés le 27 juillet sous une licence personnalisée que Moonshot appelle la « licence Kimi K3 ». Une utilisation commerciale à grande échelle est autorisée, mais deux conditions s'appliquent :
- Toute entreprise disposant de chiffre d'affaires annuel supérieur à $20 millions doit négocier un contrat avec Moonshot avant de proposer K3 à des clients externes sous forme de service
- Toute entreprise disposant de un chiffre d'affaires mensuel supérieur à $20 millions ou plus de 100 millions d'utilisateurs actifs par mois Il est obligatoire d'indiquer la mention « Kimi K3 » sur tout produit intégrant ce modèle.
Pour un développeur indépendant ou une start-up, aucune de ces deux conditions n'est contraignante. En revanche, pour une entreprise SaaS bien établie qui envisage de revendre des services d'inférence basés sur K3, la première condition s'applique sans aucun doute. Lisez attentivement la licence avant de baser votre modèle économique sur celle-ci.
Qwen3.8-Max : pas encore disponible
C'est un point qu'il faut aborder sans détours, car de très nombreux titres ont déjà qualifié Qwen3.8-Max d'open source.
Au 5 août 2026, les poids de Qwen3.8-Max ne sont pas disponibles au téléchargement. Lors du lancement, Alibaba s'était engagé à publier les poids “ la semaine prochaine ” — c'est-à-dire la semaine du 10 août — sur Hugging Face et ModelScope, tant pour Qwen3.8-Max que pour un checkpoint plus petit, Qwen3.8-27B. Aucune licence n'a été mentionnée. Une recherche sur Hugging Face portant sur « Qwen3.8 » au 4 août n’a donné aucun résultat correspondant à une fiche de modèle officielle d’Alibaba, mais uniquement des fichiers mis en ligne par la communauté portant des noms tels que Qwen3.8_4B_Distilled — il s’agit de distillats de marques tierces, et non du produit phare, et on peut facilement les confondre avec l’original si on jette un coup d’œil rapide.
Il y a lieu d’afficher un optimisme prudent : Alibaba a fait ses preuves en matière d’open source, les versions Qwen3 et Qwen3.5 étant distribuées sous licence Apache 2.0. Mais on observe également une tendance inverse : tous les produits phares de la gamme « Max » depuis Qwen3-Max ont été propriétaires. Si les poids sont publiés sous une licence permissive, cela rompra complètement avec cette tendance et constituera sans doute un événement plus marquant que le nombre de paramètres. Tant qu’il n’y a pas de dépôt ni de fichier de licence, il convient de s’organiser en fonction de l’API.
Peut-on réellement les héberger soi-même ?
Les poids ouverts ne sont utiles que si l'on peut les utiliser, et c'est là que le marketing et la réalité matérielle divergent fortement.
Kimi K3 Il s'agit d'un fichier à télécharger de 1,56 To, fourni au format MXFP4 pour une compatibilité matérielle plus étendue. Malgré tout, un modèle comportant 2,8 billions de paramètres nécessite une infrastructure de type « supernœud » : il est recommandé de disposer d’au moins 64 accélérateurs. Pour la grande majorité des équipes, ces poids constituent un artefact de recherche et une garantie de souveraineté, et non un plan de déploiement. Vous utiliserez l’API.
Qwen 3.8-Max Avec un total de 2,4 T, il s'agit là aussi d'un élément propre aux centres de données à plusieurs nœuds. Le plus petit d'Alibaba Qwen3.8-27B Checkpoint représente la solution la plus réaliste en environnement sur site, et c'est celle qui devrait intéresser toute personne envisageant réellement de gérer elle-même son hébergement.
GLM-5.2 Avec environ 753 milliards au total et environ 40 milliards d'utilisateurs actifs, c'est le plus facile à gérer des trois, mais “ le plus facile à gérer ” implique tout de même une infrastructure GPU importante. Les petites entreprises n'en disposent généralement pas.
Alors, pourquoi la pondération ouverte est-elle importante si presque personne ne peut participer à ces épreuves ? Pour deux raisons, toutes deux bien réelles.
Le premier est souveraineté. Les pays qui investissent des milliards dans leurs infrastructures nationales d’IA possèdent généralement le matériel, mais louent les modèles auprès de fournisseurs américains. Un modèle « open-weight frontier » bouleverse cette donne : un gouvernement peut l’exploiter sur son propre territoire, le réentraîner pour l’adapter à sa langue et à son contexte juridique, et conserver les données de ses citoyens à l’intérieur de ses frontières.
Le deuxième est le marché des inférences. Les poids ouverts permettent à n'importe quel fournisseur d'hébergement de proposer le modèle, ce qui fait baisser les prix par jeton grâce à la concurrence plutôt qu'à la bonne volonté du fournisseur. C’est en grande partie pour cette raison que le GLM-5.2 est disponible à un coût d’entrée compris entre $1,00 et $1,20 via des routeurs tiers, soit un tarif inférieur à celui de Z.ai, qui est de $1,40.
Les trois fenêtres de contexte de 1M ne sont pas identiques
Ces trois modèles annoncent une fenêtre de contexte d'un million de tokens. Cela correspond à environ 750 000 mots, soit l'intégralité d'une base de code volumineuse ou environ 400 pages de documents, en une seule requête.
Les détails présentent des différences qui ont une incidence sur le plan opérationnel :
- Qwen 3.8-Max limite le nombre réel de tokens en entrée à 991 000, ce chiffre passant à 983 000 lorsque la fonction de réflexion est activée, avec un budget de raisonnement distinct plafonné à 262 000 tokens. Le nombre maximal de tokens en sortie est de 131 000 dans les deux modes. Les limites de débit sont fixées à 2 millions de tokens par minute et à 15 000 requêtes par minute.
- GLM-5.2 prend en charge jusqu’à 128 000 à 131 000 tokens de sortie, ce qui est suffisant pour traiter d’un seul coup des comparaisons de fichiers volumineuses portant sur plusieurs fichiers. Sa fenêtre de 1 million représentait un bond d’environ 5 fois par rapport aux quelque 200 000 tokens de GLM-5.1, et c’est cette amélioration qui a le plus transformé les capacités du modèle.
- Kimi K3 offre un contexte d'un million de mots et présente, parmi les trois, les signaux de récupération de contexte à long terme les plus marqués, son architecture ayant été spécialement conçue pour les sessions à long terme.
La question la plus pertinente, plutôt que “ quelle est la taille de la fenêtre ? ”, est “ le modèle reste-t-il cohérent à l'extrémité de celle-ci ? ”. Le contexte annoncé et utilisable Les contextes divergent, et aucun de ces trois systèmes n’a fait l’objet de tests de résistance indépendants sur toute sa longueur, d’une manière que je jugerais concluante. Si votre charge de travail repose sur une véritable récupération de 800 000 tokens, testez-la avant de concevoir votre architecture en fonction de celle-ci.
Quel modèle choisir ?
Pour les développeurs indépendants ou les « indie hackers » → GLM-5.2
L'aspect économique est déterminant. Un forfait « Lite Coding » à $12.60 par mois avec une facturation annuelle vous permet de bénéficier d’un agent de codage véritablement performant au sein de Claude Code ou Cline, avec un essai gratuit de cinq jours disponible via ZCode (3 millions de jetons GLM-5.2 plus 2 millions de jetons GLM-5-Turbo par jour) afin de vous forger une opinion avisée avant de payer quoi que ce soit.
Vous perdez en qualité visuelle. Si vous travaillez sur le backend, en ligne de commande (CLI), sur des scripts ou au développement d’API, vous ne vous en rendrez que rarement compte. En revanche, si vous travaillez sur le front-end à partir de maquettes de conception, vous le remarquerez immédiatement.
Pour l'équipe d'ingénierie de la start-up → GLM-5.2 (prioritaire), Kimi K3 en cas d'escalade
Confiez les tâches courantes — corrections de bogues, refactorisations, génération de tests, code standard — à GLM-5.2 et réservez K3 aux tâches pour lesquelles ces capacités supplémentaires se traduisent réellement par un ticket clôturé. L'écart de 7 points au SWE-bench Pro entre les deux est bien réel, mais il n'a d'importance que sur les parcours difficiles.
Pour les entreprises et les secteurs réglementés → GLM-5.2 en auto-hébergement, ou Qwen3.8-27B dès sa sortie
Le détail essentiel : L'API cloud de Z.ai transite par une infrastructure située en Chine. Pour les projets personnels et la plupart des start-ups, cela ne pose aucun problème. Pour une entreprise soumise à une réglementation, cela nécessite soit un examen juridique, soit le passage à l'auto-hébergement. La licence MIT rend l'auto-hébergement véritablement viable, contrairement aux conditions de seuil de chiffre d'affaires imposées par K3.
Pour les flux de travail multimodaux et impliquant l'utilisation d'un ordinateur → Qwen3.8-Max
Si votre agent doit analyser des captures d’écran, examiner visuellement des documents ou traiter des vidéos, le GLM-5.2 est exclu de la course et Qwen devance Kimi selon les résultats publiés en matière de vision. Les scores de 86,1 à OSWorld-Verified et de 92,1 à OmniDocBench constituent des indicateurs solides en matière d’utilisation informatique et de compréhension des documents. Prévoyez simplement un budget pour l’accès à l’API plutôt que pour l’auto-hébergement jusqu’à ce que les pondérations et la licence soient effectivement disponibles.
Pour les chercheurs et les déploiements axés sur la souveraineté → Kimi K3
Il s'agit du plus grand modèle à poids ouverts jamais publié, accompagné d'un rapport technique couvrant sa conception, son apprentissage et la méthodologie utilisée pour les tests de performance. Si vous étudiez les architectures MoE à grande échelle, Kimi Delta Attention ou Attention Residuals, c'est le modèle le plus performant que vous puissiez réellement examiner.
Pour des performances optimales, quel que soit le prix → Kimi K3
Quatrième sur Artificial Analysis, deuxième sur l’indice Vals, premier sur Frontend Code Arena, et le seul modèle parmi les trois à rivaliser régulièrement avec les modèles phares de Claude et GPT. Son prix est à la hauteur.
La stratégie de routage multimodèle
La réponse honnête à la question “ lequel devrais-je utiliser ? ” est que choisir l'un ou l'autre revient généralement à se tromper de perspective.
Ces trois modèles sont compatibles avec l'OpenAI-SDK. Le GLM-5.2 propose en outre des points de terminaison compatibles avec Anthropic, tandis que Qwen prend en charge à la fois les spécifications OpenAI et DashScope. Pour passer de l'un à l'autre, il suffit d'indiquer une URL de base et un identifiant de modèle. Le coût lié à la dépendance vis-à-vis d'un fournisseur est quasi nul.
Cela rend une architecture de routage peu coûteuse à mettre en place, mais coûteuse à ignorer :
- Une formule économique pour les travaux à grand volume et à faible enjeu. Classification, synthèse, modifications simples. Le GLM-4.7, avec des paramètres de $0,60/$2,20, est plus performant que ce à quoi on pourrait s'attendre : il affiche tout de même un score de 73,8% sur le benchmark SWE-bench Verified.
- Niveau par défaut pour l'essentiel du travail concret. GLM-5.2 ou Qwen3.8-Max, selon que vous ayez besoin ou non de la fonction « vision ».
- Niveau d'escalade pour le vélo à fourche rigide. Kimi K3, ou un produit phare occidental, pour les tâches où l'échec coûte cher et où le coût des itérations dépasse celui des jetons.
- Routage spécialisé par type de tâche. Les données de Fireworks sont révélatrices à cet égard : K3 s'est démarqué en matière de sécurité et de boucles terminales longues, tandis que Fable 5 s'est imposé dans les domaines du multilinguisme et de la visualisation des données. Il s'agit là de différences significatives, et non de détails insignifiants.
Les équipes qui tirent le meilleur parti du paysage des modèles de 2026 ne sont pas celles qui ont fait les bons choix. Ce sont celles qui ont mis en place le système de basculement.
Risques, mises en garde et signaux d'alerte
L'allégation relative à la distillation. Michael Kratsios, directeur du Bureau de la politique scientifique et technologique de la Maison Blanche, a publiquement accusé Moonshot d’avoir développé Kimi K3 en adaptant le modèle « Claude Fable » d’Anthropic. Moonshot n’a pas reconnu ces faits. Il s’agit d’un litige non résolu pouvant avoir des implications juridiques et en matière de marchés publics ; si vous évoluez dans un contexte où la provenance des modèles revêt une importance particulière — les marchés publics, par exemple —, ce litige doit figurer dans votre registre des risques.
Acheminement des données et juridiction. Ces trois entreprises opèrent principalement sous la juridiction chinoise. Les appels API transitent par leur infrastructure. L'auto-hébergement résout ce problème ; l'utilisation des API, en revanche, ne le résout pas. Il s'agit d'une question de conformité, et non d'une question politique, et il existe une réponse technique claire si vos exigences l'imposent.
La vérification des résultats des tests de performance est vraiment sommaire. Le tableau des performances de référence de Qwen3.8-Max repose entièrement sur les données fournies par le fabricant, sans qu'aucune reproduction indépendante n'ait été publiée. Les chiffres concernant GLM-5.2 ont été communiqués après son lancement par des sources diverses. Seul K3 a fait l'objet d'évaluations approfondies menées par des tiers, mais ces évaluations se contredisent les unes les autres.
Incertitude concernant la licence de Qwen. Un précédent n'est pas un engagement. Tant qu'il n'existe pas de dépôt Hugging Face contenant un fichier de licence à proprement parler, tout projet reposant sur les poids de Qwen3.8-Max n'est qu'un projet fondé sur un communiqué de presse.
Modification du fonctionnement des quotas. La promotion de GLM avec un multiplicateur de 1× en heures creuses prend fin en septembre 2026 ; après cette date, la consommation de quota doublera environ en heures creuses et triplera en heures de pointe. Si vous déterminez le volume de votre abonnement en fonction du débit effectif actuel, modélisez également les chiffres après la fin de la promotion.
Le rythme des sorties est effréné. La version GLM-5 a été livrée en février, la 5.1 en avril et la 5.2 en juin. Kimi est passé à la version K2.5 en janvier, à la K2.6 en avril, à la K2.7 Code en juin, puis à la K3 en juillet. Toute conclusion tirée aujourd’hui n’aura qu’une durée de vie de quelques semaines.
À venir
Le prochain produit phare de Z.ai Il s'agit de la sortie la plus attendue à court terme. Une note de recherche de JPMorgan, relayée par Reuters et CGTN, évoque une fenêtre de lancement en août 2026. Des fuites issues de la communauté décrivent un modèle comptant plus d'un billion de paramètres, doté d'une fenêtre de contexte de 1 million de caractères reportée et de poids ouverts, axé sur des agents de codage à exécution longue. Même le nom fait l’objet de débats : GLM-5.3, GLM-5.5 et GLM-6 apparaissent tous dans les discussions actuelles, certains rapports suggérant que Z.ai pourrait passer complètement outre les versions 5.3 et 5.4. Au 4 août, la documentation de Z.ai mentionnait toujours le GLM-5.2 comme dernière version disponible. La prise en charge de la vision est, de loin, la demande la plus pressante de la communauté.
Qwen 3.8 - Poids maximaux Il s'agit de l'événement concret le plus proche, prévu pour la semaine du 10 août parallèlement à la version Qwen3.8-27B. La version 27B est celle à surveiller pour un déploiement pratique sur site.
Rapport technique complet sur la Kimi K3 Il était prévu que les aspects relatifs à la conception, à la méthodologie de formation et à la reproduction des tests de référence suivent la publication des pondérations.
Je mettrai à jour ce comparatif au fur et à mesure que chacun d'entre eux sortira.
Foire aux questions
Quel est actuellement le meilleur modèle d'IA « open-weight » ?
En termes de performances brutes, Kimi K3 se classe quatrième sur 189 modèles selon l’Artificial Analysis Intelligence Index et premier sur Frontend Code Arena. En termes de rapport qualité-prix pour le travail de codage, le GLM-5.2, dont le coût de production est inférieur à un tiers de celui du K3, bénéficie d’une licence MIT véritablement sans restriction. La notion de ’ meilleur “ dépend entièrement de votre objectif : optimiser les performances ou le coût par tâche résolue.
Qwen3.8-Max est-il réellement open source ?
Pas encore. Au 5 août 2026, l'accès se fait uniquement via l'API. Alibaba s'est engagé à publier les poids au cours de la semaine du 10 août sur Hugging Face et ModelScope, mais aucun dépôt ni aucune licence n'ont encore été mis en ligne. Les titres de presse qui parlent d'« open source » font référence à un engagement, et non à un téléchargement.
Le GLM-5.2 permet-il de traiter des images ?
Non. GLM-5.2 ne dispose pas de système de reconnaissance visuelle : il n'accepte que du texte et du code. Il s'agit d'un choix architectural délibéré, et non d'un oubli. La reconnaissance visuelle est d'ailleurs la fonctionnalité la plus demandée par la communauté pour la prochaine version.
Combien coûte la Kimi K3 ?
$3 par million de jetons d'entrée et $15 par million de jetons de sortie, avec une entrée mise en cache à $0,30. Cela en fait de loin le plus coûteux de ces trois modèles, même s’il reste bien en deçà de Claude Opus 5 ($5/$25) et de Claude Fable 5 ($10/$50).
Puis-je exécuter ces modèles sur mon propre matériel ?
Concrètement, ce ne sont pas les modèles phares. Kimi K3 représente un téléchargement de 1,56 To nécessitant au moins 64 accélérateurs. Qwen3.8-Max, à 2,4 T, correspond à un déploiement dans un centre de données à plusieurs nœuds. GLM-5.2, avec environ 753 milliards de nœuds au total et environ 40 milliards de nœuds actifs, est le plus gérable, mais nécessite tout de même une infrastructure GPU importante. Le futur Qwen3.8-27B constitue l’option sur site la plus réaliste.
Quel est le meilleur modèle pour les agents de codage ?
Kimi K3 arrive en tête sur Terminal-Bench 2.1 (88,3), Program Bench et SWE Marathon. GLM-5.2 offre le meilleur rapport coût/performances avec un score de 81,0 sur Terminal-Bench et de 62,1 sur SWE-bench Pro. Qwen3.8-Max se situe entre les deux, avec des scores de 86,6 et 67,7, tout en prenant en charge les entrées multimodales. Les trois fonctionnent avec Claude Code, Cline et des frameworks similaires.
Ces modèles surpassent-ils Claude et GPT ?
Dans certains tests de performance spécifiques, parfois. Kimi K3 arrive en tête du classement Frontend Code Arena devant Claude Fable 5 et obtient un score supérieur à celui de Claude Opus 4.8 sur l'indice Artificial Analysis. Mais Moonshot reconnaît lui-même que K3 reste globalement derrière Fable 5 et GPT-5.6 Sol, et des tests indépendants montrent des résultats mitigés selon les catégories de tâches, sans qu'il y ait de vainqueur incontestable.
Laquelle offre la meilleure licence pour une utilisation commerciale ?
GLM-5.2, sans ambiguïté. Licence MIT sans restriction, sans seuil de chiffre d’affaires ni obligation d’attribution. La licence personnalisée de Kimi K3 autorise une utilisation commerciale étendue, mais impose des conditions aux entreprises dont le chiffre d’affaires dépasse $20M et qui la revendent sous forme de service. Qwen3.8-Max ne dispose d’aucune licence officielle.
Peut-on utiliser en toute sécurité des modèles d'IA chinois pour traiter des données d'entreprise ?
Les appels API transitent par une infrastructure relevant de la juridiction chinoise. Pour les projets personnels et la plupart des start-ups, cela ne pose aucun problème. En revanche, pour les secteurs soumis à une réglementation, cela nécessite soit un examen juridique, soit un hébergement en propre — et c’est précisément pour cette raison que, pour certaines organisations, la licence MIT de GLM-5.2 revêt davantage d’importance que ses résultats aux tests de performance.
Quelle est la différence entre les paramètres totaux et les paramètres actifs ?
Les modèles de type « mélange d’experts » n’activent qu’une fraction de leurs paramètres par token. Kimi K3 en compte 2,8 T au total, mais n’en active qu’environ 50 milliards (16 experts sur 896). Qwen3.8-Max en compte 2,4 T au total, dont environ 95 milliards sont actifs. GLM-5.2 en compte environ 753 milliards, dont environ 40 milliards sont actifs. Les paramètres actifs déterminent le coût de l’inférence — c’est pourquoi le modèle phare de Qwen est plus coûteux à exécuter que le K3, pourtant plus volumineux.
Verdict final
Ce que cette comparaison met surtout en évidence, ce n'est pas quel modèle l'emporte, mais le fait que la question a changé.
Il y a deux ans, la question intéressante concernant les modèles “ open-weight ” était de savoir dans quelle mesure ils étaient à la traîne. Cette question n’a plus d’intérêt aujourd’hui, car la réponse est : « suffisamment proches pour que cela dépende de la tâche à accomplir ». Kimi K3 a battu Claude Fable 5 dans un classement à l’aveugle basé sur les préférences humaines pour le code front-end. GLM-5.2 a battu GPT-5.5 sur des corrections de bugs réels, pour un coût six fois moindre. Ce ne sont pas là des résultats de consolation.
La question intéressante qui se pose désormais est la suivante : ce que vous achetez réellement. Et la réponse diffère pour chacun de ces trois éléments, pour des raisons qui n'ont rien à voir avec leur position dans le classement :
- GLM-5.2 vous vend indépendance. Critères d'évaluation du MIT, aucune condition, aucune négociation, le prix le plus bas du comparatif. Vous achetez le droit de ne plus dépendre d'un fournisseur.
- Kimi K3 vous vend capacité. Les meilleures performances dans ce domaine, à un prix qui en tient compte, avec des conditions de licence qui ne deviennent contraignantes que si votre entreprise prend de l'ampleur.
- Qwen 3.8-Max vous vend étendue. Du texte, des images et des vidéos dans un seul modèle, des capacités d’agent fortes, soutenues par l’engagement d’Alibaba en matière d’infrastructure à hauteur de $53 milliards — et, pour l’instant, une promesse concernant les poids plutôt que les poids eux-mêmes.
Si je devais résumer cela en une seule ligne pour chaque option : optez pour le GLM-5.2 si vous payez vous-même la facture, pour le Kimi K3 si ses performances justifient son prix plus élevé, et pour le Qwen3.8-Max si votre agent a besoin d’yeux.
Et quel que soit votre choix, construisez le routeur. Dans un contexte où trois modèles proches de la pointe de la technologie ont été commercialisés en huit semaines, la capacité à changer d’avis vaut plus que celle de faire le bon choix.
Dernière mise à jour : 5 août 2026. Les tarifs, les performances de référence et les conditions de licence dans ce domaine évoluent chaque semaine — veuillez vérifier les chiffres actuels à l'aide de la documentation officielle avant de prendre toute décision d'achat. Les sources comprennent VentureBeat, MarkTechPost, Fortune, SCMP, Quartz, Artificial Analysis, Northflank ainsi que la documentation des fournisseurs Moonshot AI, Alibaba Qwen et Z.ai.



