Ir al contenido
LUNES, 31 DE AGOSTO DE 2026NOTICIAS TECNOLÓGICAS INDEPENDIENTES, Reseñas y guías prácticas
ACERCA DE
ÚLTIMAS NOTICIAS /

GLM-5.3-Flash frente a MiniMax M3: ¿Cuál deberías ejecutar realmente en OpenCode?

LEE LA GUÍA
AGENTES DE IAGM / 769

GLM-5.3-Flash frente a MiniMax M3: ¿Cuál deberías ejecutar realmente en OpenCode?

Tarjeta comparativa entre el GLM-5.3-Flash y el MiniMax M3 que muestra 1 M de contexto en ambos modelos, una puntuación de 84,3 frente a 66,0 en Terminal-Bench y una diferencia de coste de 2,1 veces.

Hay un tipo muy concreto de fatiga por tomar decisiones que te invade sobre las 23:00 h, después de tres cafés, mientras te quedas mirando el selector de modelos de OpenCode.

Tienes una clave de Z.ai. Tienes una clave de MiniMax. Ambos modelos afirman tener un millón de tokens de contexto. Ambos son de peso abierto. Ambos cuestan prácticamente nada en comparación con los modelos cerrados de vanguardia. Ambos cuentan con un gráfico de referencia en el que salen ganando. Y tú solo quieres saber cuál debes establecer como predeterminado para poder volver al trabajo.

Este artículo es la respuesta a esa pregunta —la versión larga, porque la versión corta (“GLM-5.3-Flash, probablemente”) oculta unas seis advertencias que te pueden pasar factura si las pasas por alto.

He recopilado los detalles de la arquitectura, las comparativas de los proveedores, las evaluaciones independientes, los precios reales por token —incluida la trampa del contexto largo por niveles—, los datos de telemetría de uso publicados por la propia OpenCode y los archivos de configuración reales de ambos. A continuación, he calculado los costes para un mes laboral normal, en lugar de basarme en un escenario de nota de prensa.

Esto es lo que ha salido.


En resumen — El veredicto en 30 segundos

Ejecuta GLM-5.3-Flash como tu modelo predeterminado de OpenCode. Obtiene mejores resultados en casi todas las pruebas de referencia relevantes en materia de agentes y programación, cuesta aproximadamente la mitad por token, cuenta con una licencia MIT auténtica y es hacia donde se ha dirigido realmente la comunidad de OpenCode.

Utiliza el MiniMax M3 como tu vía rápida. Genera aproximadamente tres veces más rápido y responde aproximadamente el doble de rápido al primer token. En los bucles de muchos turnos y baja dificultad —cambio de nombre de archivos, creación de estructuras de pruebas, generación de documentación, pasadas de detección y corrección de errores, grandes refactorizaciones mecánicas—, esa diferencia de velocidad se nota más que la diferencia de inteligencia.

La frase concisa y sincera: GLM-5.3-Flash piensa mejor, MiniMax M3 escribe más rápido. La programación agentica es, sobre todo, una cuestión de razonamiento, por lo que GLM se lleva el puesto por defecto. Pero si no ejecutas ambos, estás dejando de aprovechar todo el rendimiento posible, y OpenCode hace que ejecutarlos a la vez sea muy sencillo.


Tabla de comparación rápida

GLM-5.3-FlashMiniMax M3
FabricanteZ.ai (Zhipu AI)MiniMax
Publicado26 de agosto de 20261 de junio de 2026
Parámetros totales320B~428B
Activo por token18B~23B
ArquitecturaAtención lineal híbrida KDA + MLA dispersa NoPE, MoE (8 de 288 expertos + 1 compartido)Estructura GQA + MiniMax Sparse Attention (MSA), MoE disperso
Ventana de contexto1 millón (1 048 576)1 millón (mínimo garantizado de 512 mil)
Potencia máxima131 072 tokenshasta 262 144 tokens
Entrada multimodalTexto, imagen, vídeo, archivoTexto, imagen, vídeo
LicenciaMITLicencia comunitaria de MiniMax
Precio de entrada de la API$0,15 / 1M ($0,03 en caché)$0,30 / 1M ($0,06 en caché)
Precio de salida de la API$0,50 / 1M$1.20 / 1M
Recargo por contexto extensoNo se ha publicado nada2× por encima de 512 K de entrada
Velocidad de salida~48,6 tok/seg.~147,9 tok/seg.
Tiempo hasta el primer token~1,51 s~0,99 s
Terminal-Bench 2.184.366.0
Inteligencia Artificial Analítica5745
Participación en tokens de OpenCode10.3%1.12%
Modo de reflexiónSiempre activo (no se puede desactivar)Configurable
Precio de entrada de la suscripción$18/mes (Plan de codificación GLM Lite)$20/mes (MiniMax Plus)

Los precios son los precios oficiales de catálogo de cada proveedor. Las pasarelas de enrutamiento, como OpenRouter, suelen presentar precios efectivos más bajos porque distribuyen la carga entre servidores de terceros; más adelante se explica esto con más detalle, ya que es importante.


Por qué esta comparación es la que importa ahora mismo

Gráfico de barras que compara GLM-5.3-Flash y MiniMax M3 en los índices de capacidad de llm-stats para el uso de herramientas, los agentes, el razonamiento, la programación y la visión
GLM-5.3-Flash lidera todos los índices de capacidad evaluados de forma independiente. La diferencia en el uso de herramientas —puesto n.º 4 frente al n.º 42— es lo más importante para un conjunto de agentes.

Hace doce meses, el debate sobre la programación de peso abierto giraba en torno a si estos modelos eran realmente utilizables. Esa cuestión ya está zanjada. El debate en la segunda mitad de 2026 es más específico y más interesante: ¿A qué modelo de peso abierto diriges tu sistema de agentes, y cuánto te cuesta equivocarte?

OpenCode ha puesto de relieve esa cuestión. No se trata de una ventana de chat, sino de un agente nativo de terminal que planifica, lee archivos, los edita, ejecuta comandos, lee los resultados y repite el proceso. Esa carga de trabajo pone a prueba a los modelos de formas que una prueba de rendimiento de chat nunca pone de manifiesto. Un modelo que escriba funciones aisladas perfectas puede resultar inútil en OpenCode si pierde el hilo tras veinte llamadas a herramientas, si se equivoca con la ruta de un archivo o si gasta 90 000 tokens decidiendo qué hacer.

El GLM-5.3-Flash y el MiniMax M3 son los dos modelos de peso libre que más peso tienen en ese debate en estos momentos. Salieron al mercado con tres meses de diferencia, están destinados al mismo uso, tienen un precio del mismo orden de magnitud y han apostado por enfoques de ingeniería casi opuestos.

Esa última parte es lo más interesante.


Qué es realmente GLM-5.3-Flash

GLM-5.3-Flash tuvo uno de los mejores lanzamientos del año, y no fue por casualidad.

Antes de que Z.ai le pusiera su nombre a nada, el modelo apareció en OpenRouter con el nombre en clave “Ox Alpha”.” Sin atribución a ningún laboratorio, acceso prácticamente gratuito, sin fines comerciales. Ascendió discretamente hasta lo más alto de las listas de uso de OpenRouter y OpenCode, y se mantuvo allí durante aproximadamente una semana, mientras la comunidad debatía sobre quién lo había creado. El 26 de agosto de 2026, Z.ai confirmó que era suyo y publicó los pesos bajo la licencia MIT.

Diagrama comparativo de la arquitectura del KDA híbrido GLM-5.3-Flash y la atención MLA dispersa frente a la atención dispersa MiniMax M3 con selección de bloques KV
Dos soluciones de ingeniería distintas para el mismo problema: conseguir que un contexto de un millón de tokens sea económicamente viable, en lugar de estar únicamente disponible en teoría.

Lanzar un modelo al mercado y dejar que se gane credibilidad antes de afirmar que es una buena apuesta funcionó: el modelo contaba con datos reales de uso antes de que nadie hubiera visto un gráfico comparativo.

La arquitectura, en un lenguaje sencillo

GLM-5.3-Flash es un modelo de “mezcla de expertos” con 320 000 millones de parámetros que solo activa unos 18 000 millones de parámetros por token. Dirige cada token a través de 8 de los 288 expertos asignados, más un experto compartido; aproximadamente el 2,81 TP3T de los pesos de los expertos se activan en cada pasada hacia adelante. De ahí proviene la ventaja económica de «Flash»: conocimiento a escala de vanguardia, coste de inferencia de un modelo pequeño.

El diseño del mecanismo de atención es la parte verdaderamente novedosa. En lugar de un único mecanismo de atención uniforme, intercala dos:

  • 34 capas de atención lineal KDA. Estas funciones se ejecutan en tiempo lineal en relación con la longitud de la secuencia, en lugar de en tiempo cuadrático. Gestionan las dependencias locales de forma eficiente y evitan que el rendimiento se reduzca drásticamente a medida que aumenta el contexto.
  • 11 capas MLA dispersas sin PE. Atención latente multicanal al estilo DeepSeek sin incrustaciones posicionales, precedida por un “indexador relámpago” que selecciona los 2.048 tokens más relevantes de todo el contexto. Esto es lo que permite mantener la calidad de la recuperación a largo alcance.

También hay un IndexPool etapa de compresión que agrega los vectores de clave del indexador para reducir la sobrecarga de memoria cuando la longitud del contexto es extrema, y una módulo de predicción multitóken para la decodificación especulativa: la implementación de vLLM establece por defecto 5 tokens especulativos por paso de decodificación, lo que supone un rendimiento entre 2 y 3 veces mayor con lotes de tamaño reducido.

Efecto neto en comparación con el GLM-5.3 completo: un consumo de recursos de atención aproximadamente tres veces menor y una caché KV más de cuatro veces más pequeña. Por eso, un contexto de 1 millón de tokens es realmente utilizable, y no solo está disponible en teoría.

Por qué es importante para los agentes de programación

Tres cosas, concretamente.

Es multimodal de por sí, y en este caso no se trata de un simple truco publicitario. Los modelos de programación GLM anteriores tenían un punto ciego para todo aquello que no pudieran leer como texto. Si tu agente altera un diseño, un modelo basado únicamente en texto no tiene forma de saberlo. GLM-5.3-Flash admite imágenes, vídeos y archivos de forma nativa, lo que significa que ahora son posibles la depuración basada en capturas de pantalla, la conversión de diseño a código y los bucles de verificación del tipo “¿se ve esto realmente bien?”.

Pensar es obligatorio. No se puede desactivar. Se puede configurar esfuerzo_de_razonamiento a bajo, altoo máx. (el valor predeterminado documentado es máx.), pero el modelo siempre razona antes de actuar. Para el trabajo autónomo, esta es la configuración predeterminada adecuada: el modo de fallo de los modelos de codificación económica es la acción segura sin planificación, y Z.ai ha eliminado esa opción.

El salto generacional es real, y se produjo tras el entrenamiento. GLM-5.3 reutiliza el mismo modelo base que GLM-5.2. Todas las mejoras se debieron al escalado posterior al entrenamiento: según se informa, se multiplicaron por diez los entornos de tareas de horizonte largo, con tareas de entrenamiento que simulaban ciclos de vida completos del software, desde la identificación de errores hasta las pruebas y la implementación, algunas de ellas con un volumen equivalente a “la carga de trabajo de un ingeniero sénior durante varios días”. La puntuación en DeepSWE v1.1 pasó de 46,2 a 63,4. En Terminal-Bench 3.0, pasó de 4,6 a 28,3. No se trata de variaciones insignificantes debidas al ajuste del modelo.


Qué es realmente el MiniMax M3

MiniMax M3 se lanzó el 1 de junio de 2026 y apostó por algo diferente: en lugar de optimizar para el razonamiento en momentos de máxima intensidad, se centró en optimizar para la economía de los bucles de agentes sostenidos.

Se trata de un modelo MoE disperso con unos 428 mil millones de parámetros y aproximadamente 23 mil millones de parámetros activos por token, construido sobre una estructura base de atención por consultas agrupadas con el propio MiniMax. MSA (Atención dispersa MiniMax) encima.

La apuesta de la MSA

La atención tradicional es cuadrática: si se duplica el contexto, se cuadruplica la potencia de cálculo. Esa es la razón por la que la mayoría de los modelos de “1 millón de contexto” tienen 1 millón de contexto sobre el papel y 150.000 en la práctica: técnicamente se puede llenar la ventana, pero no merece la pena el esfuerzo.

MSA sustituye «atención plena» por Selección de bloques KV. Filtra previamente el contexto hasta quedarán solo los bloques relevantes y se centra únicamente en ellos, utilizando pares clave-valor sin comprimir para que la calidad de la recuperación no se vea afectada por el filtrado. MiniMax muestra el resultado aproximadamente como 1/20 de la potencia de cálculo por token de la generación anterior en un contexto de 1M, con Un rellenado previo 9,7 veces más rápido y una decodificación 15,6 veces más rápida frente a M2.

Se trata de una obra de ingeniería realmente ingeniosa, y eso se refleja en las cifras que se perciben: una producción de unos 148 tokens por segundo y un tiempo hasta el primer token inferior a un segundo. En comparación con los aproximadamente 49 tokens por segundo y el tiempo hasta el primer token (TTFT) de aproximadamente 1,5 s de GLM-5.3-Flash, M3 parece pertenecer a una categoría de herramientas totalmente distinta. En un bucle de agente largo con docenas de turnos, eso se traduce en minutos de diferencia en tiempo real por tarea.

MiniMax también promociona el M3 como un dispositivo capaz de ofrecer “sesiones de codificación autónomas de más de 8 horas”. Tómalo como una afirmación, no como una especificación técnica, ya que no ha sido validado de forma independiente.

En qué aspectos destaca realmente el M3

Se subestima la faceta multimodal y de agente de escritorio de M3. Verificado por OSWorld en 70,061 TP3T Es una puntuación muy alta para las tareas de los agentes de escritorio/GUI. MCP Atlas a 74,21 TP3T afirma que el funcionamiento de la ejecución de herramientas es fiable. GPQA Diamond a 92,91 TP3T se acerca a los límites del razonamiento riguroso. Y Verificado por SWE-bench a 80,51 TP3T es una cifra destacada.

Si tu trabajo consiste en “abrir un navegador, reproducir un vídeo, manejar una interfaz de usuario y ejecutar doce herramientas de MCP de forma secuencial”, M3 no es una solución de compromiso. Se podría decir que es la mejor herramienta.


Los índices de referencia… y lo que ocultan

Aquí es donde tengo que tener cuidado, porque ambos fabricantes publican sus propias cifras y los dos modelos se evalúan en gran medida en función de diferentes conjuntos de pruebas de rendimiento. Eso no es casualidad. Los laboratorios eligen las evaluaciones que ganan.

En los casos en que se solapan directamente

ReferenciaGLM-5.3-FlashMiniMax M3Qué mide
Terminal-Bench 2.184.366.0Tareas del agente de shell/terminal
Índice de Análisis de Inteligencia Artificial5745Inteligencia colectiva
Índice de razonamiento (llm-stats)50.3 (#13)41.8 (#39)Razonamiento en varias etapas
Índice de codificación (llm-stats)37.8 (#22)34.4 (#30)Generación de código
Índice de agentes (llm-stats)39.1 (#9)27.8 (#38)Realización de tareas por parte de agentes
Índice de uso de herramientas (llm-stats)34.2 (#4)22.8 (#42)Llamada a funciones/herramientas
Índice de visión (llm-stats)32.0 (#21)25.6 (#37)Comprensión multimodal

Terminal-Bench 2.1 es el que más peso tiene para OpenCode, ya que es el indicador público que mejor refleja lo que realmente hace OpenCode: un agente en un terminal que ejecuta comandos, lee los resultados y repite el proceso. Una diferencia de 18 puntos en este caso no es un error de redondeo.

La clasificación sobre el uso de herramientas es la otra que yo no me saltaría. GLM-5.3-Flash en #4 en general frente a M3 en #42 Es la frase más relevante para la toma de decisiones de todo este artículo. Un «agent harness» es una máquina que solicita herramientas. Un modelo con una puntuación de #42 en el uso de herramientas generará más solicitudes erróneas, más reintentos y más turnos desperdiciados —y cada turno desperdiciado te cuesta fichas— y el tiempo real, lo que anula discretamente la ventaja de velocidad del M3.

En qué aspectos destaca el GLM-5.3-Flash por sí mismo

  • Terminal-Bench 2.1: 84,3 — frente a Claude Opus 4.8 a 85,0. A un punto de un modelo de frontera cerrada, por aproximadamente una trigésima parte del precio.
  • DeepSWE v1.1: 63,4 — lo que supone un aumento respecto a los 46,2 de la versión GLM-5.2.
  • AutomationBench v1.0.6: 48,8 — frente a Opus 4.8, con un 41,0. Esta es su mayor ventaja respecto a un modelo de frontera.
  • Z.ai Code Bench v1.0: 29,0 — Opus 4.8 obtiene una puntuación de 29,5.
  • GDPval-AA v2: 1773 — la mejor puntuación entre los modelos comparados en cuanto a capacidad para el trabajo intelectual.
  • Toolathlon: 78,4 · OfficeQA Pro: 62,4 · CharXiv-R: 89,41 TP3T · MMVU: 80,5 · Cartografía: 78,0

En qué aspectos destaca el MiniMax M3

  • Verificado por SWE-bench: 80,51 TP3T
  • SWE-bench Pro: 59,01 TP3T — repositorios más complejos, ejecutados con la estructura de Claude Code
  • Atlas MCP: 74.2% · Verificado por OSWorld: 70.06% · GPQA Diamond: 92,91 TP3T
  • KernelBench Hard: 28,81 TP3T · SWE-ficiencia: 34,81 TP3T

La salvedad que deberías tener en cuenta

Las cifras de lanzamiento de ambos laboratorios son datos facilitados por ellos mismos. En concreto, la suite de pruebas comparativas de MiniMax no había aparecido en paneles de evaluación independientes en el momento de su lanzamiento, y los propios analistas de Z.ai señalaron que las redirecciones automáticas desde versiones anteriores del modelo en la plataforma de Z.ai dificultan enormemente la realización de comparaciones A/B fiables.

En los casos en que los agregadores neutrales —Artificial Analysis e llm-stats— han llevado a cabo sus propias evaluaciones, GLM-5.3-Flash gana en todas las categorías. Esa es la prueba a la que doy más importancia, porque ninguno de los dos proveedores eligió esas pruebas de rendimiento.


La señal de la que nadie habla: los datos de uso propios de OpenCode

Esta es la parte que me pareció más convincente, y es la que la mayoría de los artículos comparativos omiten por completo.

OpenCode publica datos de telemetría de uso de los modelos que se ejecutan en su plataforma. No se trata de afirmaciones de los fabricantes ni de pruebas de rendimiento. Son desarrolladores reales, que realizan un trabajo real y eligen qué seguir utilizando.

MétricaGLM-5.3-FlashMiniMax M3
Usuarios únicos566 000436 000
Porcentaje de tokens procesados10.3%1.12%
Fichas a lo largo de dos meses46T (+100%)5T (−51%)
Usuarios que vuelven en la primera semanapendiente66% (32 000 semanas-usuario)

Vuelve a fijarte en esas dos cifras de participación de tokens. El número de usuarios es más o menos similar —GLM-5.3-Flash cuenta con unos 30% más de personas que lo han probado—, pero más de nueve veces el rendimiento de los tokens.

Esa diferencia no tiene que ver con quién probó qué, sino con quién se mantuvo fiel a qué a la hora de trabajar de verdad. Hay gente que abre una sesión con M3, y hay gente que... en directo en sesiones con GLM-5.3-Flash.

La línea de tendencia lo deja aún más claro: GLM-5.3-Flash duplicó su volumen de tokens en dos meses, mientras que M3 perdió la mitad del suyo.

Dos salvedades que hay que tener en cuenta. En primer lugar, GLM-5.3-Flash es tres meses más reciente, y los nuevos modelos suelen experimentar un repunte inicial debido a la novedad; su curva se irá aplanando. En segundo lugar, la tasa de retención de la primera semana del M3 66% es una cifra positiva: las personas que lo eligieron no lo están abandonando, simplemente son menos y lo utilizan con menos frecuencia. Y el descenso de M3 se debe en parte a la canibalización por parte de sus propios sucesores y a la mayor frecuencia de lanzamiento de modelos chinos de peso abierto, no a un rechazo puro y simple.

Pero si lo que te preguntas es “¿qué es lo que realmente utilizan todo el día los usuarios experimentados de OpenCode?”, los datos lo responden sin lugar a dudas.


Configuración de MiniMax M3 en OpenCode

Hay que reconocer lo que hay que reconocer: MiniMax es más fácil de configurar, ya que OpenCode incluye un proveedor MiniMax integrado. Sin archivo de configuración, sin JSON, sin URL base.

bash

# 1. Instala OpenCode (omite este paso si ya lo tienes)
curl -fsSL https://opencode.ai/install | bash
# o bien: npm i -g opencode-ai

# 2. Autentícate
opencode auth login
# Selecciona: "MiniMax Token Plan (minimax.io)"
# Pega tu clave de suscripción (empieza por sk-cp-...)

# 3. Empieza
opencode

Entonces /modelos dentro de la sesión y selecciona MiniMax-M3.

La trampa tipo llave

Esto le pasa a casi todo el mundo. Las claves del plan MiniMax Token (suscripción) y las claves de la API de pago por uso no son intercambiables. El enrutamiento y la facturación son diferentes. Si te autentificas con una clave de pago por uso (PAYG) en el proveedor del Plan Token, aparecerán errores de autenticación o de saldo que parecen una interrupción del servicio, pero que en realidad se deben a una discrepancia.

Las claves de suscripción empiezan por sk-cp- y requieren una plaza asignada o créditos. Consigue la tuya en la página «Token Plan» del centro de usuarios de MiniMax, no en la página general de claves API.

Si necesitas un bloque de proveedores manual

Si tu compilación de OpenCode es anterior al proveedor integrado, o si quieres indicar explícitamente una clave PAYG:

json

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "minimax": {
 "npm": "@ai-sdk/openai-compatible",
      "name": "MiniMax",
 "options": {
 "baseURL": "https://api.minimax.io/v1",
 "apiKey": "{env:MINIMAX_API_KEY}"
      },
 "models": {
 "MiniMax-M3": {
 "name": "MiniMax M3",
 "limit": {
 "context": 1000000,
            "output": 262144
 }
 }
 }
    }
  }
}

Fíjate en lo explícito limit.context. Eso no es una decoración; consulta la siguiente sección.


La trampa de la ventana de contexto de MiniMax (lee esto antes de confirmar los cambios)

Si conectas el MiniMax M3 a través de un arnés compatible con Anthropic —como Claude Code o una configuración de OpenCode que utilice @ai-sdk/anthropic contra https://api.minimax.io/anthropic — Hay un error documentado y aún sin resolver que debes conocer.

En /antrópico Endpoint indica una ventana de contexto de 200 000, en lugar del 1 millón real de M3.

La capa de compatibilidad parece heredar los metadatos de Claude Sonnet en lugar de reflejar las especificaciones reales de M3. Los agentes de programación confían en esos metadatos y ajustan su presupuesto de contexto en consecuencia, lo que significa que La autocompactación se activa cuando se alcanzan unos 167 000 tokens aunque el modelo tiene capacidad para cinco veces más.

Se trata de un modo de fallo realmente molesto, porque es invisible. Tu agente no da ningún error. Simplemente empieza a olvidar cosas de forma silenciosa mucho antes de lo que debería, y te pasas toda una tarde preguntándote por qué un modelo con una ventana de un millón de tokens sigue perdiendo el hilo tras solo dos archivos de refactorización. El problema se notificó el mismo día del lanzamiento de la versión M3 y sigue abierto.

Buscar una solución alternativa

En OpenCode: utilizar el proveedor MiniMax integrado (vía compatible con OpenAI) en lugar de la vía de Anthropic, y configurar limit.context de forma explícita si defines un bloque de proveedor manual.

En Claude Code, modifica directamente la ventana de compactación:

json

{
  "env": {
    "ANTHROPIC_BASE_URL": "https://api.minimax.io/anthropic",
    "ANTHROPIC_AUTH_TOKEN": "",
    "CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1000000",
    "ANTHROPIC_MODEL": "MiniMax-M3[1m]",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "MiniMax-M3[1m]",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "MiniMax-M3[1m]",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "MiniMax-M3[1m]"
  }
}

Dos detalles importantes: el [1 m] el sufijo en el identificador del modelo indica la variante con contexto completo, y Las variables de entorno del shell tienen prioridad settings.json en el comportamiento documentado de MiniMax. Si tienes un archivo obsoleto ANTHROPIC_BASE_URL exportado en tu .zshrc, ganará en silencio y tú te darás vueltas en círculo.

Además, no configures las credenciales del proveedor como exportaciones globales. ANTHROPIC_BASE_URL Es una variable global; si la exportas de forma permanente, todas las herramientas que utilicen el lenguaje Anthropic en tu equipo se redirigirán de forma silenciosa a MiniMax. Limita su ámbito de aplicación a cada proyecto o a cada ejecución.


Configuración de GLM-5.3-Flash en OpenCode

OpenCode también incluye un proveedor Z.AI integrado, por lo que es casi igual de fácil, aunque hay una diferencia.

bash

# 1. Obtén una clave de Z.ai: puede ser una clave API estándar o una clave del plan de codificación GLM
# 2. Autentícate
opencode auth login
# Selecciona "Z.AI" si se trata de una clave API estándar
# Selecciona "Z.AI Coding Plan" para una clave de suscripción al Coding Plan

# 3. Inicia OpenCode y, a continuación, elige tu modelo
opencode
/models   # selecciona GLM-5.3-Flash

Asigna el proveedor al tipo de clave. Las claves API estándar y las claves del Plan de programación utilizan rutas y sistemas de facturación distintos. Si se elige la opción incorrecta, se producen errores de autenticación o de saldo que parecen indicar que la cuenta no funciona correctamente.

Los criterios de valoración del Plan de codificación

Si estás realizando la conexión manualmente o configurando otra herramienta, el paquete para desarrolladores de Z.ai ofrece tres opciones:

ProtocoloURL base
Mensajes antropicoshttps://api.z.ai/api/anthropic
Completados de OpenAI Chathttps://api.z.ai/api/coding/paas/v4
Respuestas de OpenAIhttps://api.z.ai/api/v1

Una restricción que conviene destacar: el Plan de Codificación GLM es limitado por contrato a las herramientas que cuentan con soporte oficial — Claude Code, OpenCode, Cline, Roo Code, Kilo Code, Cursor, Goose, Crush, OpenClaw y algunos más. Si tienes pensado utilizar una clave de Coding Plan con tu propio sistema de pruebas, lee primero las condiciones. Utiliza la API estándar para ello.

Bloque de proveedores manual

json

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "zai": {
 "npm": "@ai-sdk/openai-compatible",
 "name": "Z.AI",
      "options": {
 "baseURL": "https://api.z.ai/api/coding/paas/v4",
 "apiKey": "{env:ZAI_API_KEY}"
      },
 "models": {
 "glm-5.3-flash": {
 "name": "GLM-5.3-Flash",
          "limit": {
 "context": 1048576,
 "output": 131072
          },
 "options": {
 "reasoning_effort": "high",
 "temperature": 1,
 "top_p": 0.95
 }
 }
 }
    }
  },
  "model": "zai/glm-5.3-flash"
}

Las recomendaciones documentadas de Z.ai para GLM-5.3-Flash, de las que no me apartaría sin una razón de peso:

  • temperatura: 1
  • top_p: 0,95
  • esfuerzo_de_razonamiento: máximo (incumplimiento documentado)
  • thinking.clear_thinking: false
  • stream: true y tool_stream: true para solicitudes de streaming

esfuerzo_de_razonamiento Es el control principal que te permite ajustar la relación entre calidad y latencia. bajo para tareas en las que la latencia es un factor importante, alto para una programación de envergadura, máx. para los problemas más complejos. Dado que GLM-5.3-Flash ya es el más lento de los dos modelos, con unos 49 tok/seg., alto es una opción sensata para el día a día y máx. es a lo que recurres cuando una tarea te ha dejado realmente sin fuerzas alto.


La configuración que realmente recomendaría: ejecutar ambas

Diagrama de configuración de OpenCode que redirige los agentes de planificación y compilación a GLM-5.3-Flash, y el agente grunt y small_model a MiniMax M3
La configuración recomendada: inteligencia cuando influye en el resultado, y rendimiento cuando no lo hace.

Aquí es donde el planteamiento “o una cosa o la otra” deja de tener sentido, porque OpenCode no te obliga a elegir una opción. Su configuración admite modelos por agente, lo que significa que puedes asignar el modelo inteligente a las tareas más complejas y el modelo rápido a las tareas rutinarias.

json

{
  "$schema": "https://opencode.ai/config.json",
  "model": "zai/glm-5.3-flash",
  "small_model": "minimax/MiniMax-M3",
  "agent": {
    "build": {
 "model": "zai/glm-5.3-flash",
 "options": { "reasoning_effort": "high" }
    },
    "plan": {
 "model": "zai/glm-5.3-flash",
 "options": { "reasoning_effort": "max" }
    },
    "grunt": {
 "description": "Modificaciones mecánicas a gran escala: cambios de nombre, estructura de pruebas, cadenas de documentación, correcciones de lint",
 "model": "minimax/MiniMax-M3"
    }
  }
}

La lógica:

  • La planificación se convierte en esfuerzo_de_razonamiento: máximo en GLM-5.3-Flash. La fase de planificación es donde una mala decisión te cuesta más fichas más adelante. Compra lo mejor que te puedas permitir en esta fase.
  • El edificio recibe alto. Buen equilibrio entre calidad y latencia para la mayor parte del trabajo.
  • El trabajo mecánico se asigna a M3. Para cambiar el nombre de un símbolo en 40 archivos no hace falta un modelo de uso de herramientas clasificado como #4. Lo que se necesita es rendimiento, y M3 es tres veces más rápido.
  • modelo_pequeño se encarga de la gestión interna de OpenCode — Generación de títulos, resumen, pequeñas llamadas a utilidades. Elige la opción más rápida y económica.

No estás eligiendo un ganador. Estás construyendo una caja de cambios de dos velocidades.


El cálculo de los costes, con cifras reales

Los índices de referencia son abstractos. Las facturas no lo son. Voy a modelar una tarea realista con agentes y la voy a aplicar a ambas listas de precios.

El escenario

Una función de tamaño medio, implementada de forma autónoma en OpenCode: más o menos 60 turnos de selección de herramientas, con una media de 45 000 fichas de entrada por turno a medida que se va acumulando contexto, y 2 000 fichas de salida por turno.

  • Total de entradas: 2,7 millones de tokens
  • Producción total: 120 000 tokens
  • Tasa de aciertos estimada en la caché de comandos: 80% (2,16 millones en caché, 540 000 recientes)

GLM-5.3-Flash

ComponenteFichasTarifaCoste
Novedades540 000$0,15/M$0.081
Entrada almacenada en caché2,16 millones$0.03/M$0.065
Resultado120 000$0,50/M$0.060
Total≈ $0,21

MiniMax M3 (nivel estándar, ≤512 K de entrada)

ComponenteFichasTarifaCoste
Novedades540 000$0,30/M$0.162
Entrada almacenada en caché2,16 millones$0,06/M$0.130
Resultado120 000$1.20/M$0.144
Total≈ $0,44

GLM-5.3-Flash es aproximadamente 2,1 veces más barato para un trabajo idéntico. Esto concuerda con la estimación independiente de que resulta aproximadamente 2,2 veces más barato, calculado sobre una base combinada de 3:1 entre insumos y productos.

Calcular el importe mensual

Cuatro tareas de este tipo al día, veinte días laborables: 80 ejecuciones de agente:

  • GLM-5.3-Flash: ≈ $16,50 al mes
  • MiniMax M3: ≈ $35 al mes

El recargo por contexto extenso del que nadie habla

Aquí está el problema. El precio del MiniMax M3 es clasificado por longitud de entrada, y en cuanto una sola solicitud supere los 512 K de tokens de entrada, la tasa se duplica:

NivelEntradaResultadoLectura de caché
Entrada ≤512 K$0,30/M$1.20/M$0,06/M
>512 K de entrada$0,60/M$2,40/M$0.12/M
Nivel de prioridad1,5 veces el estándar1,5 veces el estándar1,5 veces el estándar

Así pues, el titular “contexto de 1M” viene acompañado de una nota al pie: la segunda mitad de ese intervalo cuesta el doble. Si tu flujo de trabajo implica realmente cargar repositorios enormes en el contexto, M3 pasa de ser dos veces más caro que GLM-5.3-Flash a costar aproximadamente 4 veces más caro justo cuando más necesitas el contexto.

Z.ai no aplica ningún recargo equivalente para GLM-5.3-Flash. Su precio por millón de tokens es fijo.

Suscripciones frente a pago por uso

Plan de codificación GLMPlan de tokens de MiniMax
EntradaLite $18/mes (aprox. 80 indicaciones/5 h, aprox. 400/semana, 100 llamadas MCP/mes)Más 1 TP4T20 al mes (~3-4 agentes)
MedioPro $72/mes (aprox. 400 indicaciones/5 h, aprox. 2.000/semana, 1.000 llamadas a MCP)Máximo $50 al mes (~4-5 agentes, 3 vídeos al día)
InicioMáx. $160/mes (aprox. 1.600 indicaciones/5 h, aprox. 8.000/semana, 4.000 llamadas al MCP)Ultra $120/mes (~6-7 agentes, 5 vídeos al día)
Descuento anual~30% desactivadoSin publicar
Modelos incluidosGLM-5.3, GLM-5.3-Flash, GLM-5.2, GLM-5-TurboFamilia de modelos MiniMax

Dos detalles que cambian las cuentas.

GLM-5.3-Flash obtiene una cuota tres veces mayor dentro del Plan de Codificación en comparación con el GLM-5.3, y el uso fuera de las horas punta consume 50% de puntos estándar. Elegir Flash en lugar del GLM-5.3 completo triplica, en la práctica, el valor de tu suscripción, y trasladar las ejecuciones más intensas fuera de la franja horaria de máxima demanda, de 14:00 a 18:00 UTC+8, te permite aprovecharla aún más.

La cuota de MiniMax no se acumula. El saldo no utilizado caduca al final de cada ciclo de facturación, y la propia MiniMax recomienda el modelo de pago por uso para las implementaciones en producción, en lugar del plan Token.

Según mi modelo de uso (~$16–35 tokens al mes), el pago por uso y las suscripciones básicas se equilibran más o menos. A partir de unas 6-8 horas diarias de trabajo con el agente, las suscripciones ganan por goleada: el plan GLM Coding Plan Lite a $18, que cubre unas 400 solicitudes semanales, es realmente difícil de superar.

Una nota sobre los precios de las pasarelas de pago

Verás cifras muy diferentes dependiendo de dónde busques. OpenRouter indica que el GLM-5.3-Flash tiene unos valores de entrada de alrededor de $0,05/M y de salida de $0,17/M; los datos del modelo propio de OpenCode indican $0,07/M y $0,25/M. Ambas cifras están por debajo de los valores oficiales de Z.ai, que son $0,15/$0,50.

Eso no es una contradicción. Las pasarelas enrutadas distribuyen la carga entre más de 20 servidores de terceros —Baseten, DeepInfra, Novita, Cloudflare y otros— y esos servidores compiten en precio. Sin duda, puedes conseguir GLM-5.3-Flash más barato que el precio de catálogo a través de una pasarela. A cambio, sacrificas la consistencia: el rendimiento en OpenRouter oscila entre 8 y 111 tokens/segundo dependiendo del proveedor que te toque, lo que, en el caso de un bucle de agente largo, supone la diferencia entre una tarea de dos minutos y una de quince.

En lo que respecta al trabajo de los agentes, prefiero pagar el precio de catálogo a la primera parte y obtener una latencia predecible. Utilizo las pasarelas para el procesamiento por lotes y la experimentación.


Licencias y autoalojamiento: la parte que las empresas europeas deberían leer dos veces

Si diriges una empresa dentro de la UE, la licencia no es un detalle sin importancia. Se trata de una cuestión de contratación pública.

GLM-5.3-Flash: MIT

Los pesos están disponibles en Hugging Face en zai-org/GLM-5.3-Flash bajo el Licencia MIT. Es lo más permisivo que puede ser una licencia de software: úsala con fines comerciales, modifícala, redistríbula, incorpórala a un producto; sin límites de ingresos, sin anexo de uso aceptable, sin restricciones de ámbito de uso. Basta con mantener el aviso de derechos de autor y ya está.

Para una empresa alemana o de la UE, MIT más los pesos autoalojables significa que puedes integrar todo el sistema en tu propia infraestructura y hacer que la residencia de datos deje de ser un problema: sin necesidad de evaluar las transferencias transfronterizas, sin acuerdo de encargado del tratamiento con un proveedor chino y sin depender del tiempo de actividad de terceros.

MiniMax M3: Licencia comunitaria de MiniMax

Los pesos de M3 también están disponibles en Hugging Face, pero en la sección Licencia comunitaria de MiniMax — una licencia personalizada, no una licencia permisiva estándar. La acogida por parte de la comunidad fue, en general, positiva (es más permisiva que la licencia M2.7 con la que se lanzó el producto), y varias fuentes describen que, en la práctica, el uso comercial no está sujeto a restricciones.

Pero “descrita como sin restricciones” y “auditada por tu asesor jurídico” son cosas diferentes. Si vas a incluir MiniMax M3 en un producto comercial, lee el texto de la licencia directamente antes de lanzarlo al mercado. Una licencia personalizada conlleva una carga administrativa de revisión que la del MIT simplemente no tiene.

La realidad del autoalojamiento

Ambos modelos son de peso libre. Ninguno de los dos funciona en tu ordenador portátil.

GLM-5.3-Flash:

  • Punto de control del 8.º Programa Marco: 331 GB repartidos en 62 fragmentos (unos 306 GiB de pesos antes de la caché KV)
  • Variante BF16: 640 GB en 120 fragmentos
  • FP8 a TP=4 en un solo GB200: ~386 GB de VRAM
  • BF16 con TP=8: ~772 GB de VRAM
  • Requisitos: Generación Hopper o posterior — H100/H200/B200/B300/GB200/GB300, o AMD MI300X/MI325X/MI355X
  • Pila: vLLM 0.29.0 o superior, FlashInfer 0.6.17 o superior; además de SGLang, TokenSpeed, KTransformers, Transformers y Unsloth

MiniMax M3:

  • Aproximadamente 214 GB con cuantificación de 4 bits — más pequeño, pero sigue siendo sin duda de clase servidor

La infraestructura alojada propia de Z.ai registra unos 48,7 tokens de salida por segundo con un TTFT de 1,52 s, y con un TP=4 en GB200, un conjunto clave-valor de 14,92 millones de tokens que admite una concurrencia máxima de 113,81 veces con un contexto de 128 000. Esa es la configuración de hardware necesaria para que esto funcione correctamente.

Traducción práctica: El autoalojamiento de cualquiera de los dos modelos implica alquilar o comprar varias GPU en un centro de datos. Para la mayoría de los equipos —incluidos la mayoría de mis clientes—, la respuesta adecuada es la API, en la que los pesos abiertos funcionan como seguro. Si el proveedor sube los precios, empeora las prestaciones del modelo o desaparece, tienes una salida. Esa flexibilidad tiene un valor real, aunque nunca llegues a hacer uso de ella.


Dónde falla realmente cada modelo

Sin exageraciones. Estas son las debilidades, sin más.

GLM-5.3: Vulnerabilidades de Flash

Es lento. Una producción de ~48,6 tokens/segundo y ~1,51 s hasta el primer token. En comparación con los ~148 tokens/segundo y los ~0,99 s de M3, se nota mucho cada generación larga. En un bucle de agente de 40 turnos, eso supone varios minutos de espera.

No se puede dejar de pensar. El razonamiento obligatorio es adecuado para tareas complejas que requieren un gran esfuerzo, pero supone un derroche en el caso de solicitudes triviales. Cada petición del tipo “añade una cadena de documentación a esta función” conlleva un coste de razonamiento. Precisamente por eso es recomendable utilizar M3 o un modelo más pequeño para el trabajo pesado.

Los tokens de razonamiento son tokens facturados. Con esfuerzo_de_razonamiento: máximo Tal y como se ha documentado, el coste real por tarea es superior a las estimaciones simplistas basadas únicamente en los recuentos de entradas y salidas. Establece el valor en alto a menos que la tarea genere máx..

Es nuevo. Publicado el 26 de agosto de 2026. Aún no han salido a la luz todos los errores de integración de larga duración presentes en el ecosistema de los harnesses, y los conocimientos de la comunidad siguen siendo escasos. Si te encuentras con un modo de fallo poco común, es posible que seas el primero en informar de él.

No lo confundas con el GLM-5.3. Son modelos diferentes con capacidades distintas; en particular, el GLM-5.3 sin Flash solo admite texto. Enviar imágenes al ID de modelo equivocado es un error habitual al principio.

Puntos débiles del MiniMax M3

El verdadero problema es la clasificación del uso de herramientas. #42 en el índice de uso de herramientas de llm-stats, frente a GLM-5.3-Flash en #4. Para un sistema de control de agentes, eso supone la capacidad de soportar la carga. Cabe esperar más llamadas a herramientas mal formadas, más reintentos y más turnos consumidos en la recuperación, lo que anula la ventaja de velocidad por la que has pagado.

El error relacionado con la generación de informes de contexto sigue sin resolverse. Está abierto desde el lanzamiento. Se puede sortear, pero es un pequeño inconveniente con el que tienes que lidiar.

La verificación independiente es escasa. Los resultados de las pruebas de rendimiento de lanzamiento de MiniMax no han aparecido en foros independientes, y en los casos en que los agregadores independientes han realizado mediciones, M3 se sitúa en la parte media de la tabla, en lugar de cerca de la cima. La diferencia entre la presentación del fabricante y las mediciones de terceros es mayor en este caso que en el de Z.ai.

El precio por contexto largo se duplica a partir de los 512K. La función destacada conlleva un recargo.

Licencia personalizada. Revisión jurídica adicional antes de la puesta en marcha comercial.

Uso en descenso. Una caída del 51% en el volumen de tokens de OpenCode a lo largo de dos meses es un indicio del impulso del ecosistema, sea cual sea la causa. Un menor número de usuarios significa que habrá menos gente que se encuentre con los mismos errores que tú y que los solucione.


El marco de decisión: cinco escenarios

1. “Quiero un solo modelo: configurarlo y olvidarme de él”.”

GLM-5.3-Flash. Mejor en todas las pruebas comparativas independientes, a la mitad de precio, con licencia del MIT y donde se ha decantado la comunidad. Establecer esfuerzo_de_razonamiento: alto, añade el plan de codificación GLM Coding Plan Lite a $18 al mes si codificas a diario, y sigue con tu vida.

2. “Llevo a cabo refactorizaciones mecánicas a gran escala en bases de código enormes”.”

MiniMax M3 para las pasadas mecánicas, GLM-5.3-Flash para el plano. MSA hace que M3 resulte realmente rentable a largo plazo, y el triplicado de la velocidad de generación se nota sobre todo en ediciones de gran volumen y baja complejidad. Solo hay que tener cuidado con el salto en el precio a partir de los 512K y dejar que GLM planifique la refactorización antes de que M3 la ejecute.

3. “Mi trabajo es de carácter visual: interfaz de usuario, diseño a código y depuración de capturas de pantalla”.”

GLM-5.3: Flash en primer lugar, M3 en un sólido segundo puesto. La multimodalidad nativa de GLM está diseñada precisamente para esto y supera a M3 en el índice de visión (32,0 frente a 25,6). Sin embargo, la puntuación de M3 en OSWorld-Verified, de 70,06%, lo convierte en la mejor opción específicamente para agente de escritorio y de interfaz gráfica de usuario trabajo: manejar aplicaciones reales en lugar de mirar capturas de pantalla.

4. “Necesito un alojamiento propio por motivos de residencia de datos o de cumplimiento normativo”.”

GLM-5.3-Flash, sin lugar a dudas. La elección entre MIT y una licencia comunitaria personalizada no es nada complicada cuando interviene tu equipo jurídico, y el autoalojamiento de MIT elimina por completo la cuestión de la transferencia transfronteriza de datos. Presupuesta hardware de la clase Hopper o un servidor de GPU europeo.

5. “Dirijo un equipo pequeño con un presupuesto ajustado”.”

Plan de codificación GLM Lite a $18 al mes, con GLM-5.3-Flash como opción predeterminada. El multiplicador de cuota de 3× para Flash incluido en el plan lo convierte en la opción con la mejor relación calidad-precio disponible en este momento. Programa las ejecuciones por lotes de gran volumen fuera de la franja horaria de máxima actividad, de 14:00 a 18:00 UTC+8, para beneficiarte del descuento de 50% puntos. Añade MiniMax más adelante si el rendimiento se convierte en el cuello de botella.


Lo que seguiría de cerca durante el próximo trimestre

Terminal-Bench independiente y SWE-bench Pro para GLM-5.3-Flash. Las cifras del proveedor son excelentes. Los agregadores neutrales las corroboran en líneas generales. Sin embargo, la afirmación concreta de que “se encuentra a menos de un punto del Claude Opus 4.8 en Terminal-Bench 2.1” merece una verificación independiente antes de que nadie elabore un análisis de viabilidad basado en ella.

Si el MiniMax /antrópico Se ha solucionado el error de contexto. Es pequeño, está documentado y lleva abierto desde junio. La rapidez con la que se cierra dice mucho de la velocidad de mantenimiento.

Curva de retención de GLM-5.3-Flash en OpenCode. La cifra de tokens por acción es espectacular, pero aún es muy reciente. Lo interesante es saber si se mantendrá en 10%+ una vez que pase la novedad. Si es así, no se trata de un momento pasajero, sino de una nueva norma.

Frecuencia de lanzamiento de los laboratorios chinos de peso libre. Qwen3.8-Flash-Next se lanzó más o menos al mismo tiempo que GLM-5.3-Flash. Kimi K3 ya supera a GLM-5.3 en DeepSWE (67,5 frente a 66,9) y en Toolathlon (76,5 frente a 73,0). La diferencia entre el “mejor modelo de codificación de peso abierto actual” y el “segundo mejor” se mide ahora en semanas. Configura tu sistema de tal forma que cambiar la cadena del modelo sea un cambio de una sola línea, porque volverás a realizar ese cambio.

Si Z.ai publica una tarifa plana independiente para la API de la versión completa de GLM-5.3. En el momento de redactar este artículo, la fila correspondiente al precio por token del GLM-5.3 aún no aparecía en la página oficial de precios, mientras que el GLM-5.3-Flash sí que figuraba con todos los precios. Se trata de una asimetría extraña que conviene seguir de cerca.


Preguntas frecuentes

¿Es GLM-5.3-Flash mejor que MiniMax M3 para la codificación? A juzgar por los datos disponibles, sí. GLM-5.3-Flash lidera el Terminal-Bench 2.1 (84,3 frente a 66,0), el Índice de Inteligencia de Artificial Analysis (57 frente a 45) y todos los índices de capacidad de llm-stats, incluidos los de programación, agentes y uso de herramientas. Además, su precio por token es aproximadamente la mitad. MiniMax M3 es más rápido —con una velocidad de salida unas tres veces superior—, pero la programación agencial valora más la calidad del razonamiento que la mera velocidad de generación.

¿Cuál es más barato, el GLM-5.3-Flash o el MiniMax M3? GLM-5.3-Flash, aproximadamente el doble. El precio oficial es de $0,15/M de entrada y $0,50/M de salida para GLM-5.3-Flash, frente a $0,30/M y $1,20/M para MiniMax M3. La diferencia se amplía hasta aproximadamente 4 veces para solicitudes superiores a 512 K de tokens de entrada, donde MiniMax duplica sus tarifas y Z.ai no aplica ningún recargo.

¿Puedo ejecutar GLM-5.3-Flash de forma local? Solo en hardware de clase servidor. El punto de control FP8 ocupa 331 GB y requiere aproximadamente 386 GB de VRAM con TP=4, en GPU de la generación Hopper o posteriores. No se trata de un modelo de hardware para el consumidor. La licencia del MIT facilita legalmente el autoalojamiento; el hardware lo encarece.

¿OpenCode es compatible de forma nativa con ambos modelos? Sí. OpenCode incluye proveedores integrados tanto para Z.AI como para MiniMax. Ejecuta Inicio de sesión en OpenCode Auth, selecciona el proveedor que se ajuste a tu tipo de clave y, a continuación, /modelos para elegir tu modelo. No opencode.json Es necesario realizar algunos ajustes para una configuración estándar.

¿Por qué MiniMax M3 solo muestra 200K de contexto en Claude Code? Un error conocido y aún sin resolver en el punto final compatible con Anthropic de MiniMax: muestra los metadatos de Claude Sonnet en lugar de la especificación real de M3, lo que activa la compactación automática al alcanzar unos 167 000 tokens. Configuración CLAUDE_CODE_AUTO_COMPACT_WINDOW a 1000000 en tu configuración, o bien utiliza la opción compatible con OpenAI.

¿Cuál es la diferencia entre GLM-5.3 y GLM-5.3-Flash? Diferentes modelos. GLM-5.3 se lanzó el 14 de agosto de 2026 y es solo de texto; comparte su modelo base con GLM-5.2. GLM-5.3-Flash, lanzado el 26 de agosto, es multimodal de forma nativa, utiliza una arquitectura MoE de atención híbrida de 320B/18B, cuenta con licencia del MIT con pesos abiertos y cuesta aproximadamente una décima parte. Dentro del Plan de Codificación de GLM, Flash también obtiene el triple de cuota.

¿Es MiniMax M3 realmente de código abierto? Los pesos se pueden descargar libremente desde Hugging Face, pero están sujetos a la licencia personalizada «MiniMax Community License», en lugar de una licencia permisiva estándar como la MIT o la Apache 2.0. Aunque se suele indicar que el uso comercial no tiene restricciones, es recomendable leer el texto de la licencia antes de comercializar un producto basado en ella.

¿Debería optar por los planes de suscripción o por el pago por uso? Por debajo de unos $20–30 al mes en gasto de tokens, se sitúan cerca del umbral de rentabilidad. Por encima de las 6-8 horas diarias de programación con agentes, las suscripciones resultan claramente más ventajosas: el plan GLM Coding Plan Lite, a $18 al mes y que cubre unas 400 solicitudes semanales, es la opción básica con mejor relación calidad-precio disponible. Ten en cuenta que la cuota de MiniMax no se acumula, y la propia MiniMax recomienda el pago por uso para las cargas de trabajo de producción.


Conclusión

Si hay algo que debas recordar de todo esto: GLM-5.3-Flash es la mejor opción predeterminada para OpenCode a finales de 2026, y la cuestión no está clara en los aspectos que determinan los resultados de la codificación agencial: la calidad del razonamiento, la fiabilidad en el uso de herramientas y el coste por tarea completada.

MiniMax M3 no es un mal modelo. Se trata de un modelo optimizado de forma diferente, y su arquitectura MSA es una respuesta verdaderamente elegante al problema de la rentabilidad en contextos largos. Hay cargas de trabajo reales —ediciones mecánicas de gran volumen, tareas de escritorio y de agentes de interfaz gráfica de usuario, cualquier cosa en la que predomine una velocidad de generación tres veces mayor— en las que es la herramienta adecuada.

Pero la codificación agencial es, en esencia, un problema de toma de decisiones, no un problema de velocidad de escritura. El modelo que planifique mejor, utilice las herramientas de forma más fiable y se recupere de los fallos con mayor agilidad completará más tareas por euro, incluso aunque genere tokens tres veces más despacio.

La estrategia pragmática consiste en utilizar una caja de cambios de dos velocidades: GLM-5.3-Flash para la planificación y la construcción, y MiniMax M3 para el trabajo pesado, modelo_pequeño señaló al más rápido. OpenCode lo convierte en un cambio de configuración de quince líneas, y te proporciona la inteligencia donde importa y el rendimiento donde no.

Y configura eso de manera que los ID de los modelos sean fáciles de cambiar. En este mercado, la respuesta que hoy parece obvia tiene una vigencia que se mide en semanas.


¿Has utilizado alguno de estos como tu herramienta habitual de OpenCode? Me interesa especialmente saber si los resultados de Terminal-Bench de GLM-5.3-Flash se mantienen en repositorios reales, y si alguien ha encontrado una solución alternativa más limpia para el error de MiniMax relacionado con los informes de contexto. Ponte en contacto conmigo: se aceptan correcciones y pruebas en contra, y este artículo se actualizará cuando la situación cambie.

Última actualización: 30 de agosto de 2026.

Añade tu señal.

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

es_ESEspañol