Il existe un type très particulier de « fatigue décisionnelle » qui vous envahit vers 23 heures, après avoir bu trois cafés, alors que vous fixez le sélecteur de modèles d’OpenCode.
Vous disposez d’une clé Z.ai. Vous disposez d’une clé MiniMax. Ces deux modèles prétendent traiter un million de tokens de contexte. Tous deux sont de type « open-weight ». Tous deux ne coûtent pratiquement rien par rapport aux modèles fermés de pointe. Tous deux affichent des résultats supérieurs à la concurrence dans les tests de performance. Et vous souhaitez simplement savoir lequel définir comme modèle par défaut afin de pouvoir vous remettre au travail.
Cet article apporte la réponse à cette question — la version longue, car la version courte (“ GLM-5.3-Flash, probablement ”) cache environ six points à prendre en compte qui pourraient vous jouer des tours si vous les ignorez.
J'ai rassemblé les détails techniques, les tests de performance des fournisseurs, les évaluations indépendantes, les tarifs réels par jeton (y compris le piège lié à la tarification échelonnée en fonction de la longueur du contexte), les données de télémétrie d'utilisation publiées par OpenCode lui-même, ainsi que les fichiers de configuration réels des deux solutions. J'ai ensuite calculé les coûts pour un mois de travail normal, plutôt que pour un scénario de type « communiqué de presse ».
Voici le résultat.
TL;DR — Le verdict en 30 secondes
Définissez GLM-5.3-Flash comme modèle OpenCode par défaut. Il est plus performant dans presque tous les benchmarks importants en matière d'agentique et de programmation, son coût par token est environ deux fois moins élevé, il est véritablement sous licence MIT, et c'est vers lui que s'est effectivement orientée la communauté OpenCode.
Faites du MiniMax M3 votre voie rapide. Il génère du code environ trois fois plus vite et répond environ deux fois plus rapidement dès le premier token. Pour les boucles à nombre élevé d'itérations et à faible difficulté — renommage de fichiers, création de structures de test, génération de documentation, passes de vérification et de correction, refactorisations mécaniques de grande envergure —, cette différence de vitesse est plus perceptible que l'écart d'intelligence.
La phrase qui résume tout en un mot : GLM-5.3-Flash réfléchit mieux, MiniMax M3 tape plus vite. Le codage agentique est avant tout une question de réflexion ; c'est pourquoi GLM s'impose par défaut. Mais si vous n'utilisez pas les deux, vous passez à côté d'un gain de débit, et OpenCode permet de les faire fonctionner ensemble en toute simplicité.
Tableau comparatif rapide
| GLM-5.3-Flash | MiniMax M3 | |
|---|---|---|
| Créateur | Z.ai (Zhipu AI) | MiniMax |
| Publié | 26 août 2026 | 1er juin 2026 |
| Nombre total de paramètres | 320B | ~428B |
| Actif par jeton | 18B | ~23 milliards |
| Architecture | Hybride KDA avec attention linéaire + NoPE avec MLA clairsemé, MoE (8 experts sur 288 + 1 expert partagé) | Architecture de base GQA + MiniMax Sparse Attention (MSA), MoE clairsemé |
| Fenêtre de contexte | 1 M (1 048 576) | 1 M (seuil garanti de 512 K) |
| Puissance maximale | 131 072 jetons | jusqu'à 262 144 jetons |
| Saisie multimodale | Texte, image, vidéo, fichier | Texte, image, vidéo |
| Licence | MIT | Licence communautaire MiniMax |
| Prix d'entrée de l'API | $0,15 / 1M ($0,03 en cache) | $0,30 / 1M ($0,06 en cache) |
| Prix de vente de l'API | $0,50 / 1M | $1.20 / 1M |
| Supplément pour contexte long | Aucune publication | 2× au-delà de 512 Ko en entrée |
| Vitesse de sortie | ~48,6 tok/sec | ~147,9 tok/sec |
| Temps écoulé jusqu'au premier jeton | environ 1,51 s | ~0,99 s |
| Terminal-Bench 2.1 | 84.3 | 66.0 |
| Analyse par intelligence artificielle | 57 | 45 |
| Partage des jetons OpenCode | 10.3% | 1.12% |
| Mode réflexion | Toujours activé (ne peut pas être désactivé) | Configurable |
| Prix d'entrée de l'abonnement | $18/mois (Plan de codage GLM Lite) | $20/mois (MiniMax Plus) |
Les prix indiqués correspondent aux prix catalogue officiels de chaque fournisseur. Les passerelles de routage telles qu’OpenRouter affichent souvent des prix effectifs plus bas, car elles répartissent la charge entre des serveurs tiers — nous y reviendrons plus en détail ci-dessous, car c’est un point important.
Pourquoi cette comparaison est celle qui compte le plus en ce moment

Il y a douze mois, le débat autour des modèles de codage à poids ouvert portait sur la question de savoir si ces modèles étaient réellement utilisables. Cette question est désormais tranchée. Le débat qui animera le second semestre de 2026 est plus ciblé et plus intéressant : Sur quel modèle à poids ouvert orientez-vous le harnais de votre agent, et quel est le coût d'une erreur ?
OpenCode a mis cette question en évidence. Il ne s’agit pas d’une fenêtre de discussion, mais d’un agent natif du terminal qui planifie, lit des fichiers, les modifie, exécute des commandes, lit les résultats et itère. Cette charge de travail met les modèles à rude épreuve d’une manière que les tests de performance sur le chat ne révèlent jamais. Un modèle capable d'écrire de belles fonctions isolées peut tout de même s'avérer inutile dans OpenCode s'il perd le fil après vingt appels d'outils, s'il invente un chemin d'accès à un fichier ou s'il gaspille 90 000 jetons à se demander quoi faire.
Le GLM-5.3-Flash et le MiniMax M3 sont les deux modèles sans limite de poids qui s'imposent le plus clairement dans ce débat à l'heure actuelle. Lancés à trois mois d'intervalle, ils visent la même utilisation, leur prix se situe dans le même ordre de grandeur et leurs concepteurs ont fait des choix techniques presque diamétralement opposés.
C'est cette dernière partie qui est intéressante.
Qu'est-ce que le GLM-5.3-Flash, au juste ?
Le lancement de GLM-5.3-Flash a été l'un des plus réussis de l'année, et ce n'était pas un hasard.
Avant que Z.ai n'appose son nom sur quoi que ce soit, le modèle était présent sur OpenRouter sous le nom de code “ Ox Alpha. ” Aucune mention de laboratoire à l'origine, accès quasi gratuit, aucune promotion commerciale. Il s'est discrètement hissé en tête des classements d'utilisation d'OpenRouter et d'OpenCode, où il est resté pendant environ une semaine, tandis que la communauté débattait pour savoir qui l'avait développé. Le 26 août 2026, Z.ai a confirmé qu'il s'agissait de sa création et a publié les poids sous licence MIT.

Lancer un modèle sur le marché et lui laisser le temps de gagner en crédibilité avant de l'annoncer comme une véritable réussite, c'était une bonne stratégie, et ça a fonctionné : le modèle s'appuyait déjà sur de véritables données d'utilisation avant même que quiconque ait pu consulter un graphique de référence.
L'architecture, en termes simples
GLM-5.3-Flash est un modèle de type “ mixture-of-experts ” comptant 320 milliards de paramètres, qui n’active qu’environ 18 milliards de paramètres par token. Il achemine chaque token via 8 experts sélectionnés parmi 288, plus un expert partagé — ce qui correspond à environ 2,81 TP3T des poids d'experts activés lors de chaque passage en avant. C'est de là que provient l'intérêt économique de « Flash » : des connaissances à l'échelle de la frontière, pour un coût d'inférence propre à un petit modèle.
La conception du système d'attention est la véritable nouveauté. Au lieu d'un mécanisme d'attention unique et uniforme, elle en entremêle deux :
- 34 couches d'attention linéaire KDA. Leur temps d'exécution est linéaire par rapport à la longueur de la séquence, et non quadratique. Elles gèrent les dépendances locales de manière peu coûteuse et empêchent le débit de s'effondrer à mesure que le contexte s'étoffe.
- 11 couches MLA clairsemées sans NoPE. Un système d’attention latente multi-têtes de type DeepSeek, sans embeddings positionnels, précédé d’un “ indexeur éclair ” qui sélectionne les 2 048 tokens les plus pertinents parmi l’ensemble du contexte. C’est ce qui permet de préserver la qualité de la recherche à longue portée.
Il y a également un IndexPool étape de compression qui regroupe les vecteurs de clés de l'indexeur afin de réduire la surcharge mémoire lorsque la longueur du contexte est très importante, et une module de prédiction multi-token pour le décodage spéculatif — l'implémentation vLLM utilise par défaut 5 tokens spéculatifs par étape de décodage, ce qui permet de multiplier le débit par 2 à 3 pour les petits lots.
Résultat net par rapport au modèle GLM-5.3 complet : une charge de calcul liée à l'attention environ 3 fois inférieure et un cache KV plus de 4 fois plus petit. C'est pourquoi un contexte de 1 million de tokens est réellement utilisable, et non simplement théoriquement disponible.
Pourquoi est-ce important pour les agents de codage ?
Trois choses, plus précisément.
Il est multimodal de par sa conception, et ce n'est pas un simple gadget. Les anciens modèles de codage GLM présentaient une lacune face à tout ce qu'ils ne pouvaient pas lire sous forme de texte. Si votre agent perturbe la mise en page, un modèle exclusivement textuel n'a aucun moyen de s'en rendre compte. GLM-5.3-Flash prend en charge nativement les images, les vidéos et les fichiers, ce qui ouvre la voie au débogage à partir de captures d’écran, à la conversion de la conception en code et aux boucles de vérification du type “ est-ce que cela rend bien ? ”.
Il faut absolument réfléchir. Vous ne pouvez pas le désactiver. Vous pouvez configurer effort_de_raisonnement à faible, élevéou max (la valeur par défaut indiquée est max), mais le modèle réfléchit toujours avant d’agir. Pour les tâches impliquant une action autonome, c’est le bon choix par défaut : le risque majeur des modèles de codage simplistes réside dans une action prise avec assurance mais sans planification, et Z.ai a supprimé cette possibilité.
Le saut générationnel est bien réel, et il trouve son origine dans la période post-formation. GLM-5.3 réutilise le même modèle de base que GLM-5.2. Tous les gains proviennent d’un ajustement à l’échelle après l’entraînement — apparemment dix fois plus d’environnements de tâches à long terme, avec des tâches d’entraînement simulant des cycles de vie logiciels complets, de l’identification des bogues jusqu’aux tests et au déploiement, certaines étant calibrées pour correspondre à “ la charge de travail d’un ingénieur senior sur plusieurs jours ”. Le score DeepSWE v1.1 est passé de 46,2 à 63,4. Celui de Terminal-Bench 3.0 est passé de 4,6 à 28,3. Il ne s’agit pas là de variations dues au réglage.
Qu'est-ce que le MiniMax M3, au juste ?
MiniMax M3 a fait son apparition le 1er juin 2026 et a fait un choix différent : plutôt que de viser l'optimisation du raisonnement de pointe, il a opté pour l'économie des boucles d'agents durables.
Il s’agit d’un modèle MoE clairsemé comptant environ 428 milliards de paramètres, avec environ 23 milliards de paramètres actifs par token, construit sur une architecture de base de type « grouped-query-attention » et intégrant la méthode propre à MiniMax. MSA (MiniMax Sparse Attention) par-dessus.
Le pari de la MSA
L'attention traditionnelle suit une loi quadratique : doubler le contexte quadruple la charge de calcul. C'est la raison pour laquelle la plupart des modèles dits “ à 1 million de contextes ” affichent 1 million de contextes sur le papier, mais n'en exploitent en réalité que 150 000 : techniquement, il est possible de remplir la fenêtre, mais cela n'en vaut pas la peine.
La MSA remplace la « pleine attention » par Sélection du bloc KV. Il effectue un préfiltrage du contexte pour ne retenir que les blocs pertinents et ne s'intéresse qu'à ceux-ci, en utilisant des paires clé-valeur non compressées afin que la qualité de la recherche ne soit pas altérée par le filtrage. MiniMax présente le résultat sous la forme approximative suivante : 1/20e de la puissance de calcul par jeton de la génération précédente dans un contexte de 1M, avec Un préremplissage 9,7 fois plus rapide et un décodage 15,6 fois plus rapide par rapport à M2.
Il s’agit là d’une véritable prouesse technique, qui se reflète dans les chiffres que l’on peut constater : un débit d’environ 148 jetons par seconde et un temps de production du premier jeton inférieur à la seconde. Comparé aux quelque 49 jetons par seconde et au temps de production du premier jeton (TTFT) d’environ 1,5 seconde du GLM-5.3-Flash, le M3 apparaît comme un outil d’une tout autre catégorie. Dans une longue boucle d’agent comportant des dizaines de tours, cela se traduit par plusieurs minutes de différence en temps réel par tâche.
MiniMax présente également le M3 comme capable d“” au moins 8 heures d’autonomie en codage ». Considérez cela comme une affirmation et non comme une spécification technique : cette affirmation n’a pas été validée par un organisme indépendant.
Les domaines dans lesquels le M3 excelle véritablement
L'aspect multimodal et l'agent de bureau de M3 sont sous-estimés. Certifié par OSWorld à 70,061 TP3T C'est un résultat très important pour les tâches effectuées par les agents sur ordinateur de bureau ou via une interface graphique. MCP Atlas à 74,21 TP3T affirme que le fonctionnement de son outil est fiable. GPQA Diamond à 92,91 TP3T se situe à la limite de ce qui relève du raisonnement rigoureux. Et SWE-bench vérifié à 80,51 TP3T c'est un chiffre d'affiche impressionnant.
Si votre charge de travail consiste à “ lancer un navigateur, visionner une vidéo, utiliser une interface utilisateur et lancer douze outils MCP à la suite ”, M3 n'est pas un compromis. C'est sans doute le meilleur outil.
Les tests de performance — et ce qu'ils cachent
C'est là que je dois faire preuve de prudence, car les deux fabricants publient leurs propres chiffres et ces deux modèles sont principalement évalués sur différents ensembles de tests de performance. Ce n'est pas un hasard. Les laboratoires choisissent les évaluations qu'ils remportent.
Là où ils se recoupent directement
| Référence | GLM-5.3-Flash | MiniMax M3 | Ce qu'il mesure |
|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 66.0 | Tâches de l'agent shell/terminal |
| Indice d'analyse par intelligence artificielle | 57 | 45 | Intelligence collective |
| Indice de raisonnement (llm-stats) | 50.3 (#13) | 41.8 (#39) | Raisonnement en plusieurs étapes |
| Index de codage (llm-stats) | 37.8 (#22) | 34.4 (#30) | Génération de code |
| Index des agents (llm-stats) | 39.1 (#9) | 27.8 (#38) | Réalisation de tâches par l'agent |
| Indice d'utilisation des outils (llm-stats) | 34.2 (#4) | 22.8 (#42) | Appel de fonctions/outils |
| Index de vision (llm-stats) | 32.0 (#21) | 25.6 (#37) | Compréhension multimodale |
Terminal-Bench 2.1 est l'élément qui pèse le plus dans l'évaluation d'OpenCode, car c'est l'indicateur public qui se rapproche le plus de ce que fait réellement OpenCode : un agent dans un terminal, exécutant des commandes, lisant les résultats et effectuant des itérations. Un écart de 18 points dans ce domaine n'est pas une erreur d'arrondi.
Le classement « Utilisation des outils » est l'autre que je ne manquerais pas. GLM-5.3-Flash à l'adresse #4 au total contre le M3 à #42 C'est la phrase la plus déterminante pour la prise de décision dans tout cet article. Un « agent harness » est une machine qui appelle des outils. Un modèle dont le score d'utilisation des outils est de #42 produira davantage d'appels mal formés, davantage de tentatives, davantage de tours gaspillés — et chaque tour gaspillé vous coûte des jetons. et le temps au chronomètre, qui annule discrètement l'avantage de la M3 en termes de vitesse.
Ce qui distingue GLM-5.3-Flash des autres solutions
- Terminal-Bench 2.1 : 84,3 — face à Claude Opus 4.8 à 85,0. À moins d'un point d'un modèle à frontière fermée, pour environ 1/30e du prix.
- DeepSWE v1.1 : 63,4 — soit une hausse par rapport aux 46,2 de la version GLM-5.2.
- AutomationBench v1.0.6 : 48,8 — contre l'Opus 4.8 à 41,0. Il s'agit de son plus grand écart par rapport à un modèle « frontier ».
- Z.ai Code Bench v1.0 : 29,0 — Opus 4.8 obtient une note de 29,5.
- GDPval-AA v2 : 1773 — Meilleur score parmi les modèles comparés en matière de capacité à traiter les tâches intellectuelles.
- Toolathlon : 78,4 · OfficeQA Pro : 62,4 · CharXiv-R : 89.4% · MMVU : 80,5 · Cartographie : 78,0
Ce qui distingue le MiniMax M3 de ses concurrents
- Vérifié par SWE-bench : 80,51 TP3T
- SWE-bench Pro : 59,01 TP3T — des dépôts plus complexes, exécutés à l'aide de l'infrastructure Claude Code
- Atlas MCP : 74.2% · Certifié OSWorld : 70.06% · GPQA Diamond : 92,91 TP3T
- KernelBench Hard : 28,81 TP3T · SWE-fficiency : 34,81 TP3T
La mise en garde que vous devriez réellement respecter
Les chiffres de lancement de ces deux laboratoires sont fournis par eux-mêmes. La suite de tests de performance de MiniMax, en particulier, n’avait pas encore fait l’objet d’évaluations indépendantes au moment de sa sortie, et les analystes de Z.ai ont eux-mêmes souligné que les redirections automatiques depuis d’anciennes versions des modèles sur la plateforme de Z.ai rendaient véritablement difficiles les comparaisons A/B fiables.
Lorsque les agrégateurs neutres — Artificial Analysis et llm-stats — ont mené leurs propres évaluations, Le GLM-5.3-Flash remporte toutes les catégories. C'est l'argument auquel j'accorde le plus de poids, car aucun des deux fournisseurs n'a choisi ces tests de performance.
Le signal dont personne ne parle : les données d'utilisation d'OpenCode
C'est la partie qui m'a le plus convaincu, et c'est celle que la plupart des articles comparatifs omettent complètement.
OpenCode publie des données télémétriques d'utilisation concernant les modèles qui y sont exécutés. Il ne s'agit ni d'allégations des éditeurs, ni de suites de tests de performance. Ce sont de vrais développeurs, qui effectuent un travail concret, et qui choisissent les outils qu'ils souhaitent continuer à utiliser.
| Métrique | GLM-5.3-Flash | MiniMax M3 |
|---|---|---|
| Utilisateurs uniques | 566 000 | 436 000 |
| Part des jetons traités | 10.3% | 1.12% |
| Jetons sur deux mois | 46T (+100%) | 5T (−51%) |
| Utilisateurs fidèles de la première semaine | en attente | 66% (32 000 semaines-utilisateur) |
Relisez ces deux chiffres concernant la part de marché symbolique. Le nombre d'utilisateurs est à peu près comparable — GLM-5.3-Flash compte environ 30% d'utilisateurs supplémentaires qui l'ont essayé — mais plus de neuf fois le débit de jetons.
Cette différence ne tient pas à savoir qui a essayé quoi. Elle tient au fait de savoir qui s'est vraiment tenu à quoi pour travailler concrètement. Il y a des gens qui ouvrent une session avec M3, et d'autres qui… en direct lors de sessions avec GLM-5.3-Flash.
La courbe de tendance le montre encore plus clairement : GLM-5.3-Flash a doublé son volume de jetons en deux mois, tandis que M3 a perdu la moitié du sien.
Deux réserves de bon sens. Premièrement, GLM-5.3-Flash est plus récent de trois mois, et les nouveaux modèles bénéficient d’un effet de nouveauté ; sa courbe va s’aplatir. Deuxièmement, le taux de rétention de 66% de M3 au cours de la première semaine est un chiffre encourageant : les utilisateurs qui l’ont choisi ne l’abandonnent pas, mais ils sont simplement moins nombreux et l’utilisent de manière plus occasionnelle. Enfin, le déclin de M3 s’explique en partie par la cannibalisation due à ses propres successeurs et au rythme plus soutenu des sorties de modèles chinois en catégorie ’ open-weight ’, et non par un rejet pur et simple.
Mais si vous vous demandez “ qu'est-ce que les utilisateurs expérimentés d'OpenCode font réellement toute la journée ? ”, les données y répondent sans ambiguïté.
Configuration du MiniMax M3 dans OpenCode
Il faut rendre à César ce qui appartient à César : MiniMax est plus simple à configurer, car OpenCode intègre un moteur MiniMax. Pas de fichier de configuration, pas de JSON, pas d'URL de base.
bash
# 1. Installez OpenCode (ignorez cette étape si vous l'avez déjà)
curl -fsSL https://opencode.ai/install | bash
# ou : npm i -g opencode-ai
# 2. Authentifiez-vous
opencode auth login
# Sélectionnez : " MiniMax Token Plan (minimax.io) "
# Collez votre clé d'abonnement (commençant par sk-cp-...)
# 3. C'est parti
opencode
Ensuite /modèles au cours de la session et choisir MiniMax-M3.
Le piège de type « clé »
Celui-là prend presque tout le monde au dépourvu. Les clés du plan MiniMax Token (abonnement) et les clés API en paiement à l'utilisation ne sont pas interchangeables. Leur acheminement et leur facturation fonctionnent différemment. Si vous vous authentifiez avec une clé PAYG auprès du fournisseur du Token Plan, vous obtiendrez des erreurs d’authentification ou de solde qui ressemblent à une panne, mais qui sont en réalité dues à une incompatibilité.
Les clés d'abonnement commencent par sk-cp- et nécessitent une place attribuée ou des crédits. Procurez-vous les vôtres depuis la page « Token Plan » du centre d'utilisateur MiniMax, et non depuis la page générale des clés API.
Si vous avez besoin d'un bloc de prestataires manuel
Si votre version d'OpenCode est antérieure à l'intégration du fournisseur, ou si vous souhaitez spécifier explicitement une clé PAYG :
json
{
"$schema" : "https://opencode.ai/config.json",
"provider": {
"minimax": {
"npm": "@ai-sdk/openai-compatible",
"name": "MiniMax",
"options": {
"baseURL": "https://api.minimax.io/v1",
"apiKey": "{env:MINIMAX_API_KEY}"
},
"models": {
"MiniMax-M3": {
"name": "MiniMax M3",
"limit": {
"context": 1000000,
"output": 262144
}
}
}
}
}
}
Notez que le limit.context. Ce n'est pas de la décoration — voir la section suivante.
Le piège de la fenêtre contextuelle MiniMax (à lire avant de valider)
Si vous acheminez MiniMax M3 via un harnais compatible avec Anthropic — Claude Code, ou une configuration OpenCode utilisant @ai-sdk/anthropic contre https://api.minimax.io/anthropic — il existe un bug signalé et toujours non résolu dont vous devez être informé.
Le /anthropique Endpoint indique une fenêtre de contexte de 200 000 au lieu du 1 million réel de M3.
La couche de compatibilité semble hériter des métadonnées de Claude Sonnet plutôt que de refléter les spécifications réelles de M3. Les agents de codage se fient à ces métadonnées et adaptent leur budget contextuel en conséquence — ce qui signifie que L'auto-compactage se déclenche à environ 167 000 jetons même si ce modèle peut facilement en contenir cinq fois plus.
Il s’agit là d’un mode de défaillance particulièrement agaçant, car il est invisible. Votre agent ne signale aucune erreur. Il commence simplement, sans crier gare, à oublier des informations bien plus tôt qu’il ne le devrait, et vous passez un après-midi à vous demander pourquoi un modèle doté d’une fenêtre d’un million de tokens ne cesse de perdre le fil dès le deuxième fichier d’une refactorisation. Le ticket correspondant a été ouvert le jour même de la sortie de la version M3 et reste en cours.
Trouver une solution
Dans OpenCode : utiliser le fournisseur MiniMax intégré (voie compatible avec OpenAI) plutôt que la voie Anthropic, et définir limit.context de manière explicite si vous définissez un bloc de fournisseur manuel.
Dans Claude Code, modifiez directement la fenêtre de compaction :
json
{
"env": {
"ANTHROPIC_BASE_URL": "https://api.minimax.io/anthropic",
"ANTHROPIC_AUTH_TOKEN": "",
"CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1000000",
"ANTHROPIC_MODEL": "MiniMax-M3[1m]",
"ANTHROPIC_DEFAULT_SONNET_MODEL" : "MiniMax-M3[1m]",
"ANTHROPIC_DEFAULT_OPUS_MODEL" : "MiniMax-M3[1m]",
"ANTHROPIC_DEFAULT_HAIKU_MODEL" : "MiniMax-M3[1m]"
}
}
Deux détails importants : le [1 m] le suffixe ajouté à l'identifiant du modèle indique qu'il s'agit de la variante « contexte complet », et Priorité des variables d'environnement du shell settings.json dans le comportement documenté de MiniMax. Si vous disposez d’un fichier obsolète ANTHROPIC_BASE_URL exporté dans votre .zshrc, il l'emporte en silence et tu tourneras en rond.
Par ailleurs, ne définissez pas les identifiants du fournisseur comme des exportations globales. ANTHROPIC_BASE_URL Il s'agit d'une variable globale ; si vous l'exportez de manière permanente, tous les outils utilisant le langage Anthropic installés sur votre machine seront redirigés vers MiniMax sans avertissement. Limitez sa portée à un projet ou à une exécution.
Configuration de GLM-5.3-Flash dans OpenCode
OpenCode intègre également un fournisseur Z.AI, ce qui rend la procédure presque aussi simple — à une petite différence près.
bash
# 1. Obtenez une clé auprès de Z.ai — soit une clé API standard, soit une clé du plan de codage GLM
# 2. Authentifiez-vous
opencode auth login
# Sélectionnez " Z.AI " pour une clé API standard
# Sélectionnez " Z.AI Coding Plan " pour une clé d’abonnement au Coding Plan
# 3. Lancez OpenCode, puis choisissez votre modèle
opencode
/models # sélectionnez GLM-5.3-Flash
Associez le fournisseur au type de clé. Les clés API standard et les clés du forfait « Coding Plan » utilisent des routes différentes et sont soumises à des modalités de facturation distinctes. Choisir la mauvaise clé entraîne des erreurs d'authentification ou de solde qui peuvent donner l'impression que le compte ne fonctionne pas correctement.
Les points d'arrivée du plan de codage
Si vous effectuez le câblage manuellement ou si vous configurez un autre outil, le pack développeur de Z.ai met à disposition trois options :
| Protocole | URL de base |
|---|---|
| Messages anthropiques | https://api.z.ai/api/anthropic |
| Compléments de conversation OpenAI | https://api.z.ai/api/coding/paas/v4 |
| Réponses d'OpenAI | https://api.z.ai/api/v1 |
Une restriction qu'il convient de souligner : le plan de codage GLM est limité par contrat aux outils officiellement pris en charge — Claude Code, OpenCode, Cline, Roo Code, Kilo Code, Cursor, Goose, Crush, OpenClaw et quelques autres. Si vous envisagez d’associer une clé Coding Plan à votre propre harnais développé en interne, lisez d’abord les conditions d’utilisation. Utilisez l’API standard prévue à cet effet.
Bloc de prestataires manuel
json
{
"$schema" : "https://opencode.ai/config.json",
"provider": {
"zai": {
"npm": "@ai-sdk/openai-compatible",
"name": "Z.AI",
"options": {
"baseURL": "https://api.z.ai/api/coding/paas/v4",
"apiKey": "{env:ZAI_API_KEY}"
},
"models": {
"glm-5.3-flash": {
"name": "GLM-5.3-Flash",
"limit": {
"context": 1048576,
"output": 131072
},
"options": {
"reasoning_effort": "high",
"temperature": 1,
"top_p": 0.95
}
}
}
}
},
"model": "zai/glm-5.3-flash"
}
Paramètres d'échantillonnage recommandés
Les recommandations officielles de Z.ai concernant le GLM-5.3-Flash, auxquelles je ne m'écarterais pas sans raison valable :
température : 1top_p : 0,95effort_de_raisonnement : max(défaut documenté)thinking.clear_thinking : falsestream : trueettool_stream : truepour les demandes de streaming
effort_de_raisonnement C'est votre principal réglage permettant de trouver le bon compromis entre qualité et latence. faible pour les tâches sensibles à la latence, élevé pour un travail de programmation important, max pour les problèmes les plus complexes. Étant donné que GLM-5.3-Flash est déjà le plus lent des deux modèles, avec environ 49 tok/sec, élevé est un réglage judicieux pour un usage quotidien et max c'est ce vers quoi on se tourne lorsqu'une tâche nous a véritablement mis en difficulté élevé.
La configuration que je recommanderais vraiment : utiliser les deux

C'est là que l'opposition “ l'un contre l'autre ” perd tout son sens, car OpenCode ne vous oblige pas à choisir entre les deux. Sa configuration prend en charge les modèles par agent, ce qui signifie que vous pouvez affecter le modèle « intelligent » aux tâches complexes et le modèle « rapide » aux tâches routinières.
json
{
"$schema" : "https://opencode.ai/config.json",
"model": "zai/glm-5.3-flash",
"small_model": "minimax/MiniMax-M3",
"agent": {
"build": {
"model": "zai/glm-5.3-flash",
"options": { "reasoning_effort": "high" }
},
"plan" : {
"model" : "zai/glm-5.3-flash",
"options" : { "reasoning_effort" : "max" }
},
"grunt" : {
"description" : "Modifications mécaniques à grande échelle : renommages, création de structures de test, chaînes de documentation, corrections de lint",
"model" : "minimax/MiniMax-M3"
}
}
}
La logique :
- La planification permet de
effort_de_raisonnement : maxsur GLM-5.3-Flash. C'est lors de la phase de planification qu'une mauvaise décision vous coûtera le plus de jetons en aval. Investissez autant que vous pouvez vous le permettre à cette étape. - Le bâtiment est
élevé. Un bon équilibre entre qualité et latence pour l'essentiel du travail. - Les travaux mécaniques sont confiés à M3. Pour renommer un symbole dans 40 fichiers, pas besoin d’un modèle d’utilisation des outils classé #4. Ce qu’il faut, c’est du débit, et M3 est trois fois plus rapide.
petit_modèles'occupe de la gestion administrative interne d'OpenCode — génération de titres, résumés, petits appels d’utilitaires. Optez pour la solution rapide et économique.
Vous ne choisissez pas un gagnant. Vous construisez une boîte de vitesses à deux rapports.
Le calcul des coûts, avec des chiffres concrets
Les indices de référence sont abstraits. Les factures, elles, ne le sont pas. Je vais modéliser une tâche agentique réaliste et l'appliquer aux deux grilles tarifaires.
Le scénario
Une fonctionnalité de taille moyenne, réalisée de manière autonome dans OpenCode : en gros 60 cycles d'appel d'outils, soit en moyenne 45 000 jetons d'entrée par tour à mesure que le contexte s'étoffe, et 2 000 jetons de sortie par tour.
- Total des données saisies : 2,7 millions de jetons
- Production totale : 120 000 jetons
- Taux supposé de réussite des accès au cache des invites : 80% (2,16 millions en cache, 540 000 récents)
GLM-5.3-Flash
| Composant | Jetons | Taux | Coût |
|---|---|---|---|
| Nouvelles informations | 540 000 | $0,15/M | $0.081 |
| Données mises en cache | 2,16 millions | $0.03/M | $0.065 |
| Résultat | 120 000 | $0,50/M | $0.060 |
| Total | ≈ $0,21 |
MiniMax M3 (niveau standard, ≤ 512 Ko d'entrée)
| Composant | Jetons | Taux | Coût |
|---|---|---|---|
| Nouvelles informations | 540 000 | $0,30/M | $0.162 |
| Données mises en cache | 2,16 millions | $0,06/M | $0.130 |
| Résultat | 120 000 | $1.20/M | $0.144 |
| Total | ≈ $0,44 |
GLM-5.3-Flash revient environ 2,1 fois moins cher pour un travail identique. Ce chiffre correspond à l'estimation indépendante selon laquelle le coût serait environ 2,2 fois moins élevé, sur la base d'un rapport entrées/sorties de 3 pour 1.
Conversion à l'échelle mensuelle
Quatre tâches de ce type par jour, vingt jours ouvrés — soit 80 exécutions :
- GLM-5.3-Flash : ≈ $16,50/mois
- MiniMax M3 : ≈ $35/mois
La majoration liée au contexte étendu dont personne ne parle
Voici le hic. Le prix du MiniMax M3 est de classés par longueur des données d'entrée, et dès qu'une requête dépasse 512 Ko de tokens en entrée, le débit double :
| Niveau | Saisie | Résultat | Lecture du cache |
|---|---|---|---|
| Entrée ≤ 512 Ko | $0,30/M | $1.20/M | $0,06/M |
| >512 Ko d'entrée | $0,60/M | $2,40/M | $0.12/M |
| Niveau de priorité | 1,5 fois la norme | 1,5 fois la norme | 1,5 fois la norme |
Le titre “ Contexte 1M ” s’accompagne donc d’une note de bas de page : la seconde moitié de cette fenêtre coûte deux fois plus cher. Si votre workflow implique réellement de charger d’énormes référentiels dans le contexte, M3 passe de deux fois plus cher que GLM-5.3-Flash à environ 4 fois plus cher justement au moment où vous en avez le plus besoin.
Z.ai n'applique aucun supplément équivalent pour GLM-5.3-Flash. Le prix de ses millions de tokens est fixe.
Abonnements ou paiement à l'utilisation
| Plan de codage GLM | Plan de jetons MiniMax | |
|---|---|---|
| Entrée | Lite $18/mois (environ 80 demandes/5 h, environ 400/semaine, 100 appels MCP/mois) | Plus 1 TP 4 T 20/mois (environ 3 à 4 agents) |
| Milieu | Pro $72/mois (environ 400 invites/5 h, environ 2 000/semaine, 1 000 appels MCP) | Max. 1 TP4T50/mois (environ 4 à 5 agents, 3 vidéos par jour) |
| Haut de la page | Max. 1 TP4T160/mois (environ 1 600 requêtes/5 h, environ 8 000/semaine, 4 000 appels MCP) | Ultra $120/mois (environ 6 à 7 agents, 5 vidéos par jour) |
| Remise annuelle | ~30% désactivé | Non publié |
| Modèles inclus | GLM-5.3, GLM-5.3-Flash, GLM-5.2, GLM-5-Turbo | Gamme de modèles MiniMax |
Deux détails qui changent la donne.
GLM-5.3-Flash bénéficie d'un quota multiplié par 3 dans le cadre du plan de codage par rapport au GLM-5.3, et l’utilisation hors heures de pointe consomme 50% de points standard. Opter pour Flash plutôt que pour le GLM-5.3 complet triple de fait la valeur de votre abonnement, et le fait de décaler les exécutions gourmandes en ressources en dehors de la plage horaire de pointe de 14 h 00 à 18 h 00 (UTC+8) permet de l’étirer encore davantage.
Le quota MiniMax n'est pas reporté. Le crédit non utilisé expire à la fin de chaque cycle de facturation, et MiniMax recommande lui-même le modèle de paiement à l'utilisation pour les déploiements en production plutôt que le forfait « Token Plan ».
Selon mon estimation d'utilisation (~$16–35 jetons par mois), le paiement à l'utilisation et les abonnements d'entrée de gamme se situent à peu près au seuil de rentabilité. Au-delà d'environ 6 à 8 heures de travail quotidien avec l'agent, les abonnements s'imposent nettement : le forfait GLM Coding Plan Lite à $18, qui couvre environ 400 requêtes hebdomadaires, est vraiment difficile à battre.
Remarque concernant la tarification des passerelles
Les chiffres varient considérablement selon la source consultée. OpenRouter indique pour le GLM-5.3-Flash environ $0,05/M en entrée et $0,17/M en sortie ; les données du modèle d’OpenCode indiquent quant à elles $0,07/M et $0,25/M. Ces deux valeurs sont inférieures à celles officielles de Z.ai, qui sont de $0,15/$0,50.
Ce n’est pas une contradiction. Les passerelles routées répartissent la charge entre plus de 20 hébergeurs tiers — Baseten, DeepInfra, Novita, Cloudflare et d’autres — et ces hébergeurs se font concurrence sur les prix. Il est tout à fait possible d’obtenir GLM-5.3-Flash à un prix inférieur au prix catalogue via une passerelle. En contrepartie, vous sacrifiez la cohérence : le débit sur OpenRouter varie entre 8 et 111 jetons/seconde selon le fournisseur sur lequel vous vous connectez, ce qui, pour une boucle d’agent longue, fait la différence entre une tâche de deux minutes et une de quinze minutes.
Pour les tâches exécutées par des agents, je préfère payer le prix affiché au fournisseur direct et bénéficier d'une latence prévisible. J'utilise les passerelles pour le traitement par lots et les expérimentations.
Licences et auto-hébergement : la partie que les entreprises européennes devraient lire à deux fois
Si vous dirigez une entreprise au sein de l’UE, cette licence n’est pas un détail mineur. Il s’agit d’une question liée aux marchés publics.
GLM-5.3-Flash : MIT
Les poids sont disponibles sur Hugging Face à l'adresse suivante : zai-org/GLM-5.3-Flash sous le Licence MIT. On ne peut guère trouver de licence logicielle plus permissive : vous pouvez l'utiliser à des fins commerciales, la modifier, la redistribuer, l'intégrer dans un produit, sans seuil de chiffre d'affaires, sans annexe relative à l'utilisation acceptable, ni restrictions quant au domaine d'utilisation. Il suffit de conserver la mention de droits d'auteur, et le tour est joué.
Pour une entreprise allemande ou de l’UE, la solution MIT associée à des poids auto-hébergés vous permet d’intégrer l’ensemble au sein de votre propre infrastructure et de faire en sorte que la résidence des données ne soit plus un problème : pas d’évaluation des transferts transfrontaliers, pas d’accord de sous-traitance avec un fournisseur chinois, pas de dépendance vis-à-vis de la disponibilité d’un tiers.
MiniMax M3 : Licence communautaire MiniMax
Les poids du modèle M3 sont également disponibles sur Hugging Face, mais sous la licence Licence communautaire MiniMax — une licence sur mesure, et non une licence standard permissive. Elle a été globalement bien accueillie par la communauté (elle est plus permissive que la licence M2.7 sous laquelle le logiciel a été commercialisé), et plusieurs sources indiquent que, dans la pratique, son utilisation commerciale n’est soumise à aucune restriction.
Mais “ décrite comme sans restriction ” et “ vérifiée par votre conseiller juridique ” sont deux choses différentes. Si MiniMax M3 doit être intégré à un produit commercial, lisez attentivement le texte de la licence avant de le commercialiser. Une licence personnalisée implique une charge de travail supplémentaire liée à la vérification, ce qui n’est tout simplement pas le cas avec celle du MIT.
La réalité de l'auto-hébergement : retour sur terre
Ces deux modèles sont de type « open-weight ». Aucun des deux ne fonctionne sur votre ordinateur portable.
GLM-5.3-Flash :
- Point de contrôle FP8 : 331 Go répartis sur 62 shards (environ 306 GiB de poids avant le cache KV)
- Variante BF16 : 640 Go répartis sur 120 fragments
- FP8 à TP=4 sur un seul GB200 : ~386 Go de mémoire vidéo
- BF16 à TP=8 : environ 772 Go de mémoire vidéo
- Conditions requises Génération « Hopper » ou plus récente — H100/H200/B200/B300/GB200/GB300, ou AMD MI300X/MI325X/MI355X
- Pile : vLLM 0.29.0+, FlashInfer 0.6.17+ ; ainsi que SGLang, TokenSpeed, KTransformers, Transformers, Unsloth
MiniMax M3 :
- Environ 214 Go avec une quantification à 4 bits — plus petit, mais toujours résolument de classe serveur
L'infrastructure hébergée par Z.ai affiche un débit d'environ 48,7 tokens par seconde avec un temps de traitement total (TTFT) de 1,52 s. Avec un TP = 4 sur GB200, un pool KV de 14,92 millions de tokens prend en charge une concurrence maximale de 113,81 fois avec un contexte de 128 000. Voilà la configuration matérielle nécessaire pour assurer correctement ce service.
Traduction concrète : L'auto-hébergement, quel que soit le modèle choisi, implique de louer ou d'acheter plusieurs GPU dans un centre de données. Pour la plupart des équipes — y compris la plupart de mes clients —, la solution idéale est l'API, les poids ouverts servant de assurance. Si le fournisseur augmente ses prix, dégrade la qualité du modèle ou disparaît, vous disposez d'une porte de sortie. Cette possibilité a une réelle valeur, même si vous ne l'utilisez jamais.
Où chaque modèle présente réellement des failles
Pas de section « battage médiatique ». Voici les points faibles, en toute honnêteté.
GLM-5.3 - Vulnérabilités de Flash
C'est lent. Un débit d’environ 48,6 jetons/seconde et environ 1,51 seconde avant le premier jeton. Comparé aux environ 148 jetons/seconde et aux environ 0,99 seconde du M3, on ressent vraiment la lenteur de chaque génération. Dans une boucle d’agent de 40 tours, cela représente plusieurs minutes à se tourner les pouces.
On ne peut pas cesser de réfléchir. Le raisonnement obligatoire est justifié pour les tâches complexes nécessitant une forte intervention humaine, mais constitue un gaspillage pour les demandes banales. Chaque demande du type “ ajoutez une chaîne de documentation à cette fonction ” entraîne un surcoût lié au raisonnement. C’est précisément pour cette raison qu’il est préférable d’utiliser M3 ou un modèle plus petit pour les tâches répétitives.
Les jetons de raisonnement sont des jetons facturés. Avec effort_de_raisonnement : max Comme le montrent les données, le coût réel par tâche est supérieur aux estimations simplistes basées uniquement sur le nombre d'entrées et de sorties. Définissez-le sur élevé à moins que la tâche ne rapporte max.
C'est nouveau. Publié le 26 août 2026. Les bogues d'intégration à long terme présents dans l'écosystème des harnais ne sont pas encore tous apparus, et les connaissances de la communauté sont encore limitées. Si vous rencontrez un cas de défaillance peu courant, vous serez peut-être le premier à le signaler.
À ne pas confondre avec le GLM-5.3. Il s'agit de modèles différents dotés de capacités différentes — notamment, le modèle GLM-5.3 (sans Flash) ne prend en charge que le texte. L'envoi d'images à un identifiant de modèle incorrect est une erreur courante commise par les débutants.
Points faibles du MiniMax M3
C'est le classement en matière d'utilisation d'outils qui pose véritablement problème. #42 selon l’indice d’utilisation des outils de llm-stats, comparé à GLM-5.3-Flash à #4. Pour un harnais d’agent, il s’agit de la capacité de charge. Attendez-vous à davantage d’appels d’outils mal formés, à davantage de tentatives, à davantage de tours perdus en récupération — ce qui annule l’avantage de vitesse pour lequel vous avez payé.
Le bug lié au rapport de contexte n'est toujours pas résolu. Problème présent depuis la sortie du produit. Il est possible de le contourner, mais cela reste un petit désagrément récurrent.
Les éléments permettant de vérifier ces informations de manière indépendante sont rares. Les résultats des tests de performance de lancement de MiniMax n'ont pas été publiés sur des sites indépendants, et lorsque des agrégateurs neutres ont procédé à des mesures, M3 se classe en milieu de tableau plutôt qu'en tête. L'écart entre la présentation faite par le fournisseur et les mesures effectuées par des tiers est ici plus important que pour Z.ai.
Le prix des contextes longs double au-delà de 512K. L'accès à la fonctionnalité phare donne lieu à un supplément.
Permis personnalisé. Examen juridique supplémentaire avant la mise en service commerciale.
Baisse de l'utilisation. Une baisse de 51% du volume de jetons OpenCode sur deux mois est un indicateur de la dynamique de l'écosystème, quelle qu'en soit la cause. Moins d'utilisateurs signifie moins de personnes susceptibles de rencontrer et de corriger les mêmes bugs que ceux que vous rencontrerez.
Le cadre décisionnel : cinq scénarios
1. “ Je veux un seul modèle : je le configure une fois, et je n’ai plus à m’en occuper. ”
GLM-5.3-Flash. Meilleur sur tous les tests de performance neutres, deux fois moins cher, sous licence MIT, et c’est là que la communauté s’est orientée. Définir effort_de_raisonnement : élevé, ajoutez le GLM Coding Plan Lite à 1 TP4T18 par mois si vous effectuez des codages quotidiennement, et passez à autre chose.
2. “ Je réalise d’importantes refactorisations mécaniques sur d’énormes bases de code. ”
MiniMax M3 pour les passes mécaniques, GLM-5.3-Flash pour le plan. Le MSA rend le M3 véritablement économique sur le long terme, et le triplement de la vitesse de génération se ressent surtout lors des modifications à grand volume et de faible complexité. Il suffit de surveiller le seuil de prix à 512 Ko et de laisser le GLM planifier la refactorisation avant que le M3 ne l'exécute.
3. “ Mon travail est d’ordre visuel : interface utilisateur, passage de la conception au code, débogage à partir de captures d’écran. ”
GLM-5.3 : Flash arrive en tête, suivi de près par M3. La multimodalité native de GLM est précisément conçue à cet effet et surpasse M3 en termes d’indice de vision (32,0 contre 25,6). Cependant, le score OSWorld-Verified de M3, qui s’élève à 70,06%, en fait le meilleur choix notamment pour agent de bureau et agent GUI le travail — utiliser des applications réelles plutôt que de regarder des captures d'écran.
4. “ Je dois opter pour l’auto-hébergement pour des raisons de localisation des données ou de conformité. ”
GLM-5.3-Flash, sans aucun doute. Le choix entre le MIT et une licence communautaire personnalisée ne fait aucun doute lorsque votre équipe juridique est impliquée, et l'auto-hébergement MIT élimine complètement la question du transfert transfrontalier de données. Prévoyez un budget pour du matériel de classe Hopper ou un hébergeur GPU européen.
5. “ Je dirige une petite équipe avec un budget serré. ”
Plan de codage GLM Lite à $18/mois, avec GLM-5.3-Flash par défaut. Le multiplicateur de quota de 3× pour Flash inclus dans cette formule en fait l’option offrant le meilleur rapport qualité-prix actuellement disponible. Planifiez vos exécutions par lots intensives en dehors de la plage horaire de pointe comprise entre 14 h 00 et 18 h 00 (UTC+8) afin de bénéficier de la remise de 50% points. Ajoutez MiniMax ultérieurement si le débit devient un goulot d’étranglement.
Ce que je vais suivre au cours du prochain trimestre
Les versions « Independent Terminal-Bench » et « SWE-bench Pro » fonctionnent avec GLM-5.3-Flash. Les chiffres avancés par le fournisseur sont excellents. Les agrégateurs neutres les confirment globalement. Cependant, l'affirmation spécifique selon laquelle “ le résultat se situe à moins d'un point de celui de Claude Opus 4.8 sur Terminal-Bench 2.1 ” mérite d'être validée par un tiers avant que quiconque ne s'en serve pour élaborer une analyse de rentabilité.
Que le MiniMax /anthropique Le bug lié au contexte est corrigé. C'est un petit projet, il est bien documenté et il est accessible depuis juin. La rapidité avec laquelle il sera fermé en dit long sur la cadence de maintenance.
Courbe de rétention du GLM-5.3-Flash dans OpenCode. Le nombre de jetons par action est spectaculaire, mais ce phénomène est encore récent. La question intéressante est de savoir s'il se maintiendra à 10%+ une fois l'effet de nouveauté passé. Si c'est le cas, il ne s'agit pas d'un phénomène passager, mais d'une nouvelle norme.
Rythme de publication des laboratoires chinois spécialisés dans la catégorie « poids libre ». Qwen3.8-Flash-Next a été lancé à peu près en même temps que GLM-5.3-Flash. Kimi K3 surpasse déjà GLM-5.3 sur DeepSWE (67,5 contre 66,9) et Toolathlon (76,5 contre 73,0). L'écart entre le “ meilleur modèle de codage open-weight actuel ” et le “ deuxième meilleur ” se mesure désormais en semaines. Configurez votre système de manière à ce que le remplacement de la chaîne de modèle ne nécessite qu'une seule ligne de code, car vous devrez effectuer cette modification à nouveau.
Z.ai publie-t-il ou non une tarification forfaitaire pour l'API autonome de la version complète de GLM-5.3 ?. Au moment où nous écrivons ces lignes, la ligne correspondant au prix par jeton pour le GLM-5.3 n'apparaissait toujours pas sur la page officielle des tarifs, alors que celle du GLM-5.3-Flash était entièrement renseignée. Il s'agit là d'une asymétrie étrange qui mérite d'être suivie de près.
Foire aux questions
GLM-5.3-Flash est-il plus performant que MiniMax M3 pour le codage ? D’après les données disponibles, oui. GLM-5.3-Flash arrive en tête sur Terminal-Bench 2.1 (84,3 contre 66,0), sur l’indice d’intelligence d’Artificial Analysis (57 contre 45), ainsi que sur tous les indices de capacité de llm-stats, notamment en matière de codage, d’agents et d’utilisation d’outils. Son prix par token est également environ deux fois moins élevé. MiniMax M3 est plus rapide — sa vitesse de production est environ trois fois supérieure — mais le codage agentique privilégie la qualité du raisonnement plutôt que la vitesse brute de génération.
Lequel est le moins cher, le GLM-5.3-Flash ou le MiniMax M3 ? GLM-5.3-Flash, d'environ 2 fois. Les tarifs officiels sont de $0,15/M en entrée et $0,50/M en sortie pour GLM-5.3-Flash, contre $0,30/M et $1,20/M pour MiniMax M3. L'écart se creuse jusqu'à environ 4 fois pour les requêtes dépassant 512 K de jetons en entrée, où MiniMax double ses tarifs tandis que Z.ai n'applique aucun supplément.
Puis-je exécuter GLM-5.3-Flash en local ? Uniquement sur du matériel de classe serveur. Le point de contrôle FP8 occupe 331 Go et nécessite environ 386 Go de VRAM à TP=4, sur des GPU de génération Hopper ou plus récents. Il ne s'agit pas d'un modèle destiné au grand public. La licence MIT facilite juridiquement l'auto-hébergement ; c'est le matériel qui rend cette solution coûteuse.
OpenCode prend-il en charge ces deux modèles de manière native ? Oui. OpenCode intègre des fournisseurs pour Z.AI et MiniMax. Exécutez Connexion à OpenCode via l'authentification, sélectionnez le fournisseur correspondant à votre type de clé, puis /modèles pour choisir votre modèle. Non opencode.json modifications nécessaires pour une configuration standard.
Pourquoi MiniMax M3 n'affiche-t-il que 200 000 contextes dans Claude Code ? Un bug connu et toujours non résolu dans le point de terminaison compatible avec Anthropic de MiniMax : il renvoie les métadonnées de Claude Sonnet au lieu de la spécification réelle de M3, ce qui déclenche la compaction automatique à environ 167 000 tokens. Définir CLAUDE_CODE_AUTO_COMPACT_WINDOW à 1000000 dans vos paramètres, ou optez plutôt pour la solution compatible avec OpenAI.
Quelle est la différence entre GLM-5.3 et GLM-5.3-Flash ? Différents modèles. GLM-5.3, lancé le 14 août 2026, est un modèle exclusivement textuel qui partage son modèle de base avec GLM-5.2. GLM-5.3-Flash, lancé le 26 août, est multimodal de manière native, utilise une architecture MoE à attention hybride 320B/18B, est sous licence MIT avec des poids ouverts, et coûte environ dix fois moins cher. Dans le cadre du GLM Coding Plan, Flash bénéficie également d'un quota trois fois supérieur.
MiniMax M3 est-il vraiment open source ? Les poids peuvent être téléchargés librement sur Hugging Face, mais ils sont soumis à la licence personnalisée « MiniMax Community License » plutôt qu'à une licence permissive standard telle que la licence MIT ou Apache 2.0. L'utilisation commerciale est généralement considérée comme illimitée, mais il est recommandé de lire attentivement le texte de la licence avant de commercialiser un produit qui s'appuie sur ces données.
Dois-je opter pour les formules d'abonnement ou pour le paiement à l'utilisation ? En dessous d'environ $20–30 par mois de dépenses en jetons, ils sont proches du seuil de rentabilité. Au-delà de 6 à 8 heures de codage par agent par jour, les abonnements s’avèrent clairement plus avantageux : le forfait GLM Coding Plan Lite, à $18 par mois et couvrant environ 400 prompts hebdomadaires, est l’offre d’entrée de gamme la plus intéressante du marché. Notez que le quota MiniMax n’est pas reportable, et que MiniMax recommande lui-même le paiement à l’utilisation pour les charges de travail de production.
En résumé
Si vous ne devez retenir qu'une seule chose de tout cela : GLM-5.3-Flash est le meilleur choix par défaut pour OpenCode à la fin de l'année 2026, et la question n'est pas tranchée en ce qui concerne les critères qui déterminent les résultats du codage agentique : la qualité du raisonnement, la fiabilité de l'utilisation des outils et le coût par tâche accomplie.
MiniMax M3 n'est pas un mauvais modèle. Il s'agit d'un modèle optimisé différemment, et son architecture MSA apporte une réponse véritablement élégante au problème économique lié aux contextes longs. Il existe des charges de travail réelles — modifications mécaniques à grand volume, tâches d’agents de bureau et d’interface graphique, tout ce où la vitesse de génération multipliée par 3 est déterminante — pour lesquelles c’est l’outil idéal.
Mais le codage agentique est avant tout un problème de prise de décision, et non un problème de vitesse de frappe. Le modèle qui planifie mieux, fait appel aux outils de manière plus fiable et se remet plus facilement des échecs accomplira davantage de tâches par euro, même s’il génère des tokens trois fois plus lentement.
L'approche pragmatique repose sur une boîte de vitesses à deux rapports : le GLM-5.3-Flash pour la planification et la construction, et le MiniMax M3 pour le travail de fond, petit_modèle a mis l'accent sur la solution la plus rapide. Avec OpenCode, cela se résume à une modification de configuration de quinze lignes, et vous bénéficiez ainsi des informations pertinentes là où cela compte, tout en conservant le débit là où cela n'a pas d'importance.
Et rédigez cette configuration de manière à ce que les identifiants des modèles puissent être facilement remplacés. Sur ce marché, la réponse qui semble évidente aujourd’hui n’a qu’une durée de vie de quelques semaines.
Avez-vous déjà utilisé l'un de ces outils comme outil principal pour OpenCode au quotidien ? Je suis particulièrement curieux de savoir si les résultats obtenus par GLM-5.3-Flash sur Terminal-Bench se confirment dans des référentiels réels, et si quelqu'un a trouvé une solution de contournement plus élégante pour le bug de MiniMax lié au rapport de contexte. N’hésitez pas à me contacter : les corrections et les contre-exemples sont les bienvenus, et cet article sera mis à jour si la situation évolue.
Dernière mise à jour : 30 août 2026.



