En las últimas ocho semanas ha ocurrido algo extraño en el sector de la inteligencia artificial.
En junio, Z.ai lanzó GLM-5.2 y, sin hacer mucho ruido, se convirtió en el primer modelo de peso abierto en superar los 801 TP3T en Terminal-Bench. En julio, Moonshot AI lanzó Kimi K3 —con 2,8 billones de parámetros, el modelo de peso abierto más grande jamás publicado— y, como consecuencia, las acciones chinas del sector de la IA se desplomaron. Posteriormente, el 3 de agosto, Alibaba respondió con Qwen3.8-Max, de 2,4 billones de parámetros, y publicó en código abierto un modelo de nivel «Max» por primera vez en la historia de la empresa.
Tres modelos relacionados con la frontera. Tres filosofías diferentes en materia de licencias. Tres niveles de precios totalmente distintos. Y una enorme cantidad de información confusa que los trata como si fueran intercambiables.
No son intercambiables. Uno de ellos no puede ver imágenes. Otro aún no se puede descargar, a pesar de que cientos de titulares lo califican de “de código abierto”. Y uno de ellos cuesta cinco veces más por token generado que otro, al tiempo que obtiene peores resultados en varias pruebas de rendimiento de programación.
Esta es la comparación que aclara la cuestión.
En resumen — El veredicto en 30 segundos
Si quieres la máxima potencia bruta y te lo puedes permitir: Kimi K3. Ocupa el puesto #4 en el Índice de Inteligencia Artificial de Análisis y el #1 en Frontend Code Arena, y es el único de los tres que puede plantar cara a los modelos insignia de Claude y GPT. Por este privilegio, tendrás que pagar $3/$15 por cada millón de tokens.
Si quieres la mejor relación calidad-precio en materia de codificación: GLM-5.2. Con un precio de $1,40/$4,40, cuesta menos de un tercio del precio de venta de K3, cuenta con una licencia auténtica del MIT y los pesos están disponibles en Hugging Face desde junio. Lo único es que no puede procesar imágenes.
Si necesitas entradas multimodales y agentes con horizonte temporal amplio en un mismo modelo: Qwen 3.8-Max. Texto, imagen y entrada de vídeo, además de los mejores resultados publicados en materia de visión artificial de los tres. Sin embargo, en el momento de redactar este artículo, los pesos siguen siendo solo una promesa, no están disponibles para su descarga.
Si estás creando algo serio: Utiliza más de uno. En la sección sobre enrutamiento que aparece a continuación se explica por qué esa respuesta no es una excusa.
Índice
- Por qué esta comparación es importante ahora mismo
- Conoce a los candidatos
- Comparativa de especificaciones
- Análisis en profundidad de los benchmarks
- El Asterisk de referencia del que nadie habla
- Precios: el cálculo del coste real
- Qué significa realmente “pesos abiertos” en este contexto
- ¿De verdad se pueden alojar uno mismo?
- Tres ventanas de contexto de 1M no son iguales
- ¿Qué modelo deberías elegir?
- La estrategia de enrutamiento multimodelo
- Riesgos, advertencias y señales de alerta
- Próximamente
- Preguntas frecuentes
- Veredicto final
Por qué esta comparación es importante ahora mismo
Durante la mayor parte de 2024 y 2025, el debate sobre el peso libre se reducía a una especie de «torneo de consolación». Se elegía un modelo «Western Frontier» para los trabajos duros y un modelo «open» para las tareas baratas y de gran volumen. La diferencia era real y todo el mundo lo sabía.
Esa estructura se rompió este verano.
Cuando Moonshot lanzó Kimi K3 a mediados de julio, la reacción del mercado lo dijo todo mejor que cualquier tabla comparativa. Las acciones de Z.ai, que cotizan en la bolsa de Hong Kong, cayeron hasta un 30%. MiniMax cayó hasta un 16%. Alibaba se desplomó un 4%. Los inversores no estaban reaccionando ante un artículo de investigación, sino ante un modelo que, en evaluaciones comparativas a ciegas, los desarrolladores preferían frente a los principales sistemas estadounidenses en tareas de programación front-end.
A continuación, el lanzamiento de Qwen3.8-Max por parte de Alibaba hizo que sus propias acciones subieran un 7% en Hong Kong. Esa misma semana, según se informa, los ingresos diarios de Moonshot se multiplicaron por seis como mínimo tras el lanzamiento de K3, y la empresa alcanzó los $300 millones en ingresos recurrentes anuales en junio —frente a los $200 millones de abril—, al tiempo que buscaba una ronda de financiación con una valoración de $50 mil millones.
Ya no se trata de una cuestión de alternativas baratas. Se trata de saber si el precio de la capacidad de vanguardia acaba de desplomarse y, de ser así, cuál de estas tres opciones deberías incorporar realmente a la producción.
Conoce a los candidatos
Kimi K3 (Moonshot AI)
Fecha de publicación: 16 de julio de 2026 (API) · 27 de julio de 2026 (pesos)
Kimi K3 es una apuesta por la escala. Con un total de 2,8 billones de parámetros, es aproximadamente un 75% mayor que el V4 Pro de DeepSeek, que hasta ahora ostentaba el título de “modelo abierto más grande de uso generalizado”. Pero la cifra que realmente importa para cualquiera que se plantee el coste de la inferencia es la de la dispersión: K3 utiliza un diseño de «mezcla de expertos» con 896 expertos, de los cuales solo 16 están activos por token, lo que supone que, en cada pasada hacia adelante, se utilizan aproximadamente 50 000 millones de parámetros.
Hay dos obras arquitectónicas que son propias de Moonshot: Atención: Kimi Delta, un mecanismo híbrido de atención lineal, y Atención: Residuos, que la empresa describe como un sustituto directo de las conexiones residuales estándar que sigue dando sus frutos a medida que se amplía la escala. Ambos se habían publicado como investigación abierta en GitHub antes de que K3 saliera al mercado.
El enfoque es claro: Moonshot ha creado esto para la ingeniería a largo plazo. El enfoque de la empresa consiste en mantener sesiones de varias horas, navegar por grandes repositorios y coordinar herramientas de terminal con una supervisión mínima. Incorpora comprensión visual nativa y un modo de razonamiento siempre activo, y es compatible con el SDK de OpenAI, por lo que la integración se reduce básicamente a cambiar la URL base.
Qwen3.8-Max (Alibaba)
Fecha de publicación: 19 de julio de 2026 (presentación previa en el WAIC de Shanghái) · 3 de agosto de 2026 (lanzamiento general)
Qwen3.8-Max cuenta con un total de 2,4 billones de parámetros, de los cuales aproximadamente 95 000 millones están activos por token —casi el doble que el número de parámetros activos de K3—, lo que tiene implicaciones reales en el coste de ejecución, tema al que volveremos más adelante.
Lo verdaderamente nuevo aquí no es la escala, sino la modalidad. Se trata del primer modelo Qwen con más de un billón de parámetros que adopta un enfoque multimodal, ya que admite texto, imágenes y vídeo como entrada. Y es la primera vez que Alibaba se ha comprometido a publicar en código abierto un modelo insignia de la gama Max. Todos los modelos Max anteriores —Qwen3.7-Max, Qwen3.6-Max-Preview— permanecieron restringidos a la API, mientras que la línea de peso abierto continuó por separado con tamaños más reducidos.
Las demostraciones a largo plazo de Alibaba son la estrategia de marketing más llamativa de las tres. En una de ellas, según se informa, el modelo dedicó más de diez días a crear de forma autónoma un conjunto de herramientas de software que evoluciona por sí mismo, incorporando comentarios e iterando a través del código, las vistas previas y los registros sin intervención humana. En otra, reprodujo desde cero un artículo de investigación sobre aprendizaje automático: 33 rondas de entrenamiento con GPU a lo largo de unas 125 horas, 7.600 líneas de código y, a continuación, 18 ideas de mejora autogeneradas que superaron el método del artículo original. Al participar en una competición en directo contra 526 equipos humanos, quedó por delante de 87% de los participantes.
Tómatelas como demostraciones de proveedores, porque eso es lo que son. Pero son demostraciones de proveedores inusualmente específicas.
GLM-5.2 (Z.ai / Zhipu AI)
Fecha de publicación: 13 de junio de 2026 (vista previa del plan de programación) · mediados de junio de 2026 (lanzamiento completo)
El GLM-5.2 es, con diferencia, el modelo más pequeño de todos y el que ofrece una mayor precisión. Con un total de entre 744 000 y 753 000 millones de parámetros, de los cuales unos 40 000 millones están activos por token, se ha diseñado con un único objetivo: la codificación agencial a largo plazo.
Ese enfoque se manifiesta en forma de una omisión deliberada. El GLM-5.2 no dispone de codificador visual. Acepta texto y código. Si le pasas una captura de pantalla, un PDF o una maqueta de interfaz de usuario, da error. El cofundador de Z.ai, Jie Tang, ha explicado públicamente el motivo: considera que el razonamiento basado en texto, y no la información visual, es la capacidad que eleva el techo de la inteligencia artificial. Una encuesta realizada en junio entre la comunidad sobre las características de la próxima versión obtuvo más de 466 000 visitas, y el reconocimiento visual fue, con diferencia, la petición más solicitada. Todavía no se ha lanzado.
Lo que sí tiene GLM-5.2 es la política de licencias más clara de esta comparativa y, con diferencia, el precio más bajo. Se lanzó bajo una licencia MIT sin restricciones, con los pesos disponibles en Hugging Face, y contó desde el primer día con compatibilidad con más de veinte entornos de programación de terceros.
Comparativa de especificaciones
| Kimi K3 | Qwen 3.8-Max | GLM-5.2 | |
|---|---|---|---|
| Desarrollador | Moonshot AI | Alibaba | Z.ai (Zhipu AI) |
| Parámetros totales | 2,8 T | 2,4 T | ~744-753 a. C. |
| Activo por token | ~50 mil millones (16 de 896 expertos) | ~95 mil millones | ~40 mil millones |
| Arquitectura | Atención con MoE disperso + Kimi Delta | MoE disperso | MoE disperso + Atención compartida al índice |
| Ventana de contexto | 1 millón de tokens | 1 millón de tokens (máximo de entrada: 991 000) | 1 millón de tokens |
| Potencia máxima | — | 131 000 tokens | Entre 128 000 y 131 000 tokens |
| Introducción de texto | ✅ | ✅ | ✅ |
| Entrada de imágenes | ✅ | ✅ | ❌ |
| Entrada de vídeo | ❌ | ✅ | ❌ |
| Modos de razonamiento | Pensamiento constante | Estándar / reflexión (presupuesto de 262 000) | Alto / Máximo |
| Peso disponible | ✅ 27 de julio de 2026 | ⏳ Semana prevista: del 10 de agosto | ✅ Desde junio de 2026 |
| Licencia | MIT modificado (con condiciones) | Aún no se ha anunciado | MIT (sin restricciones) |
| Entrada API / 1M | $3.00 | $2.00 | $1.40 |
| Salida de la API / 1M | $15.00 | $6.00 | $4.40 |
| Entrada almacenada en caché / 1M | $0.30 | $0.25 | $0.26 |
Hay tres cosas que llaman la atención en esa tabla.
En primer lugar, El GLM-5.2 hace más con menos. Ocupa aproximadamente una cuarta parte del tamaño total de K3 y compite en pruebas de rendimiento de programación, lo que demuestra que, en 2026, la escala no lo es todo.
En segundo lugar, El número de parámetros activos de Qwen3.8-Max es el valor atípico.. Con unos 95 mil millones de parámetros activos, casi duplica los de K3, a pesar de ser más pequeño en total. Los parámetros activos determinan el coste de funcionamiento, por lo que cualquiera que tenga previsto alojarlo por su cuenta debe tener en cuenta que el modelo insignia de Qwen resulta más caro de mantener por token que un modelo con 400 mil millones de parámetros más.
En tercer lugar, la diferencia de precios es enorme. Los tokens generados por K3 cuestan 3,4 veces más que los de GLM-5.2. Tras un mes de uso intensivo del agente, eso no es un error de redondeo.
Análisis en profundidad de los benchmarks
Codificación y rendimiento agénico
Este es el objetivo al que aspiran los tres modelos, por lo que es ahí donde la comparación realmente importa.
| Referencia | Kimi K3 | Qwen 3.8-Max | GLM-5.2 |
|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 86.6 | 81.0 |
| SWE-bench Pro | — | 67.7 | 62.1 |
| FrontierSWE | 81.2 | 73.5 | 74.4 |
| Maratón de SWE | 42.0 (#1) | — | — |
| Banco de entrenamiento | 77.8 (#1) | — | — |
| DeepSWE | 67.5 | 56.6 | — |
| MCP-Atlas (uso de herramientas) | ~Fable 5 −0,5 | — | 77.0 |
Para poner en contexto esas cifras de Terminal-Bench: GPT-5.6 Sol alcanza una puntuación máxima en razonamiento de 88,8, mientras que Claude Opus 4.8 y Claude Fable 5 se sitúan ambos en 84,6 según la tabla publicada por Alibaba. El 88,3 de Kimi K3 lo sitúa a medio punto del primer puesto. El 86,6 de Qwen3.8-Max supera a ambos modelos de Claude en esa misma tabla. El 81,0 de GLM-5.2 fue, en su momento, la primera puntuación de peso abierto en superar los 80 puntos.
La victoria más destacada del GLM-5.2 es precisamente frente al GPT-5.5: 62,1 frente a 58,6 en SWE-bench Pro, y 74,4 frente a 72,6 en FrontierSWE —en este último caso, queda prácticamente empatado con Claude Opus 4.8, que obtiene 75,1—. En cuanto al uso de herramientas en MCP-Atlas, alcanzó un 77,0 frente al 75,3 de GPT-5.5 y al 77,8 de Opus 4.8.
Razonamiento y cultura general
| Referencia | Kimi K3 | Qwen 3.8-Max | GLM-5.2 |
|---|---|---|---|
| GPQA Diamond | 93.5 | 92.6 | 89.5 |
| Índice de Análisis de Inteligencia Artificial | 57,11 (#4 de 189) | — | 51.09 |
| BrowseComp | 91.2 (#1) | — | — |
| PaperBench | — | 93,0 (ventajas) | — |
| IFBench | — | 82,8 (ventajas) | — |
La puntuación de 93,5 obtenida por K3 en el GPQA Diamond fue, en el momento de su lanzamiento, la mejor puntuación que cualquier modelo de peso abierto había publicado en ese banco de pruebas. En el índice independiente Artificial Analysis Intelligence Index obtuvo una puntuación de 57,11, lo que lo situó en cuarto lugar de los 189 modelos analizados, por detrás de Claude Fable 5 (59,86) y de las dos configuraciones de GPT-5.6 Sol (58,89 y 57,65), pero más adelante de Claude Opus 4.8 a 55,69.
El GLM-5.2 se sitúa notablemente por debajo en ese índice compuesto, con una puntuación de 51,09. Esa diferencia es el coste real de su ventaja en cuanto al razonamiento general, aunque se reduce drásticamente en lo que respecta al trabajo de programación puro.
Multimodal y visión
Esta es la categoría en la que GLM-5.2 simplemente no puede competir, y en la que Qwen3.8-Max destaca con mayor fuerza.
| Referencia | Qwen 3.8-Max | Notas |
|---|---|---|
| Verificado por OSWorld | 86.1 | Tareas del agente de uso de ordenadores |
| Banco de CAD paramétrico | 91.5 | Razonamiento estructurado en materia de diseño |
| OmniDocBench 1.5 | 92.1 | Comprensión de documentos |
| Vision Arena | #2 a nivel mundial | Solo por detrás de una variante de «Fable 5» |
Qwen 3.8-Max encabeza la mayoría de las categorías de visión en la tabla publicada por Alibaba, y su segundo puesto en la clasificación de Vision Arena constituye una señal independiente realmente sólida. Kimi K3 cuenta con comprensión visual nativa y, según se informa, ofrece un buen rendimiento en tareas relacionadas con gráficos, documentos y datos multimodales, pero Qwen es el líder indiscutible en esta categoría entre los tres.
Clasificaciones de preferencias humanas
Merece la pena leer los resultados de las pruebas en arena, obtenidos de forma anónima y mediante colaboración colectiva, al margen de las tablas de referencia, ya que reflejan aspectos que estas últimas no recogen.
- Frontend Code Arena: Kimi K3 ocupó el puesto #1 con 1.679 de Elo, por delante de Claude Fable 5, con 1.631. Qwen3.8-Max ocupó el puesto #4 con 1.668, 37 puntos por detrás de Claude Opus 5.
- Text Arena: Qwen3.8-Max se situó como el modelo chino mejor clasificado, aunque aún por detrás de varias propuestas de Anthropic.
- Code Arena: El GLM-5.2 quedó en segundo lugar entre los modelos de codificación en la clasificación a ciegas.
Que Kimi K3 haya ganado de forma indiscutible el Frontend Code Arena —por delante de Fable 5— es, sin duda, el resultado más impresionante de todo este artículo.
El Asterisk de referencia del que nadie habla
Todas las tablas anteriores merecen una advertencia sanitaria, y la versión honesta de esta comparación debe dejarlo claro sin rodeos.
Los efectos del arnés son enormes. Una prueba de rendimiento de un agente de codificación no mide un modelo. Mide un modelo además el entorno de ejecución que lo rodea: acceso a herramientas, permisos de archivos, lógica de compactación de contexto, comportamiento de reintentos, reglas de detención. Kimi Code, Claude Code, Codex, Terminus y mini-SWE-agent son todos entornos de prueba diferentes con capacidades distintas. Un resultado etiquetado como “Kimi K3 + Kimi Code” no es directamente comparable con un resultado de la API sin más.
La tabla de lanzamiento de Moonshot combina distintos marcos: KimiCode y Claude Code para K3, Claude Code para las filas de Claude y GLM, y Codex para GPT. Algunas puntuaciones de la competencia proceden de los propios proveedores de dichos competidores. En algunas evaluaciones, las solicitudes de Fable 5 rechazadas por incumplir la política de uso se redirigieron a Opus 4.8. Sin embargo, hay una útil comprobación de coherencia oculta en los datos: K3 obtuvo una puntuación de 67,5 en DeepSWE con KimiCode y de 67,3 con el propio conjunto de pruebas mini-SWE-agent del benchmark. Una diferencia de 0,2 puntos sugiere que el efecto del conjunto de pruebas en esa tarea concreta es pequeño.
Los puestos de venta halagan a sus autores. La comparación multimodal de Alibaba compara Qwen3.8-Max con Qwen3.7-Además, y no Qwen3.7-Max —lo que hace que el salto generacional parezca mayor de lo que es—. Hay que reconocer que Alibaba también publicó una curva de escalabilidad de RL que no Si lo miramos con buenos ojos: el rendimiento alcanza un máximo de 0,725 en torno a los 4.000 entornos de entrenamiento, para luego descender a 0,719 y 0,689. Se trata de una empresa que muestra públicamente sus rendimientos decrecientes, algo que la mayoría de los laboratorios no hacen.
La verificación independiente se está retrasando. El GLM-5.2 salió al mercado sin ninguna tabla de referencia; las cifras que circulaban procedían de datos del fabricante y de pruebas realizadas por terceros. Las cinco puntuaciones publicadas de Qwen3.8-Max proceden del propio fabricante, sin que haya ninguna evaluación independiente disponible a principios de agosto. Kimi K3 es el que cuenta con más datos de terceros —Artificial Analysis, Vals, Arena— e incluso en este caso los resultados no coinciden entre sí. Vals situó a K3 en segunda posición en la clasificación general el 17 de julio, entre Fable 5 y GPT-5.6 Sol, mientras que situó a Sol por delante de K3 específicamente en Terminal-Bench 2.1 y SWE-bench Verified.
La prueba independiente más útil que encontré fue la realizada por Fireworks AI, que comparó a K3 con Claude Fable 5 en unas 1.000 tareas de tipo «agentic». El resultado no supuso una victoria clara para ninguno de los dos. K3 se impuso en tareas de seguridad, criptografía y bucles terminales largos. Fable 5 se impuso en tareas multilingües y en visualización web y de datos. Ninguno de los dos dominó.
Conclusión práctica: Realiza tu propia evaluación de tus tareas antes de confirmar los resultados. Todos estos modelos son tan similares entre sí que la posición en la clasificación no te permitirá predecir tus resultados.
Precios: el cálculo del coste real
Tarifas de la API por token
| Modelo | Entrada / 1M | Salida / 1M | Entrada almacenada en caché / 1M |
|---|---|---|---|
| GLM-5.2 | $1.40 | $4.40 | $0.26 |
| Qwen 3.8-Max | $2.00 | $6.00 | $0.25 |
| Kimi K3 | $3.00 | $15.00 | $0.30 |
| Claude Soneto 5 | $2.00 | $10.00 | — |
| Claude, Op. 5 | $5.00 | $25.00 | $0.50 |
| Claude Fable 5 | $10.00 | $50.00 | — |
Dos observaciones que son más importantes que las cifras en sí.
El Kimi K3 tiene un precio similar al de un modelo occidental de gama media, no al de una alternativa económica. Con una configuración de $3/$15, el coste por token generado es mayor que el de Claude Sonnet 5 y 3,4 veces superior al de GLM-5.2. Si se daba por hecho que “modelo chino de peso abierto” significaba “barato”, K3 desmiente esa suposición.
El almacenamiento en caché es la verdadera clave, no el precio de venta. La entrada almacenada en caché de Qwen en $0,25 es ocho veces más barata que la entrada nueva, y la propia documentación de Alibaba señala que la estabilidad del prefijo influye más en el coste que la longitud del prompt. En el caso de las cargas de trabajo de agentes con una indicación del sistema estable y una conversación cada vez más extensa, un almacenamiento en caché agresivo influirá más en la factura que la elección del modelo. Qwen también ofrece la creación explícita de caché a $2,50 y lecturas explícitas a $0,17 para cargas de trabajo que se pueden planificar con antelación.
Planes de suscripción
Si eres un desarrollador independiente o formas parte de un equipo pequeño, es posible que el modelo de precios por token no se ajuste en absoluto a tu forma de comprar.
Plan de codificación GLM cuenta con tres niveles. Las tarifas mensuales básicas son $18 (Lite), $72 (Pro) y $160 (Max), con descuentos según el ciclo de facturación: 10% mensual, 20% trimestral y 30% anual. Con la facturación anual, esto equivale aproximadamente a $12,60, $50,40 y $112 al mes. Cada nivel te ofrece un conjunto de respuestas que se actualiza cada cinco horas, y el plan funciona de forma inmediata con Claude Code, Cline, Kilo Code y OpenClaw.
Hay un detalle que conviene tener en cuenta: el consumo de la cuota se calcula mediante multiplicadores. El consumo del plan GLM-5.2 en horas valle se aplica con un multiplicador de 1× hasta septiembre de 2026, como parte de una promoción. A partir de entonces, volverá a aplicarse un multiplicador de 2× en horas valle y de 3× en horas punta, lo que significa que tu cuota efectiva depende en gran medida de cuando cómo trabajas, no solo cuánto.
Qwen Ofrece una suscripción al «Token Plan» a partir de aproximadamente $6 al mes (39 CNY) en el nivel «Lite», como alternativa a la facturación por token.
Moonshot ofrece diferentes niveles de suscripción para las aplicaciones de Kimi, que llevan el nombre de indicaciones de tempo —Moderato, Allegro, Allegretto y Vivace—, aunque las propias aplicaciones son gratuitas dentro de los límites generales de tarifa.
Coste por tarea frente a coste por token
Aquí está el problema: el precio por token no es lo mismo que el coste por tarea completada.
Un modelo que resuelva tu problema en una sola pasada con un rendimiento de $15/1M puede resultar fácilmente más económico que uno que necesite cuatro iteraciones con un rendimiento de $4,40/1M. Los tokens de razonamiento se facturan según las tasas de salida en estos tres modelos, y K3, en particular, funciona en modo continuo: un análisis señaló que K3 completó el conjunto de pruebas de Artificial Analysis con un coste total ligeramente inferior al de GPT-5.6 Sol. a pesar de generaba un número considerablemente mayor de tokens de salida, ya que requería menos intentos.
Mide el coste por ticket resuelto, no el coste por millón de tokens. Es la única cifra que refleja la realidad.
Qué significa realmente “pesos abiertos” en este contexto
Esta es la sección en la que la mayor parte de la información sobre estos tres modelos se desmorona, ya que el término “abierto” está muy presente en muchos titulares.
Se están fusionando tres estados diferentes en una sola palabra:
- Disponible a través de la API — Puedes pedirlo, pero no te lo vas a llevar
- Peso libre — puedes descargar los parámetros
- Código abierto con una licencia permisiva — puedes descargarlo, modificarlo, redistribuirlo y comercializarlo libremente
Aquí es donde se sitúa realmente cada modelo.
GLM-5.2: verdaderamente abierto
Licencia MIT, sin restricciones; los modelos se alojan en Hugging Face bajo zai-org/GLM-5.2. Descárgalo, perfecciónalo, alójalo tú mismo y vende productos basados en él. Sin límites de ingresos, sin requisitos de atribución, sin negociaciones. Es lo más sencillo que puede ser una licencia de código abierto, y supone una auténtica ventaja competitiva de la que se habla muy poco, ya que las licencias MIT no suelen ser noticia.
Kimi K3: apertura sujeta a condiciones
Los datos se publicaron el 27 de julio bajo una licencia personalizada que Moonshot denomina «Licencia Kimi K3». Se permite su uso comercial generalizado, pero se aplican dos condiciones:
- Cualquier empresa que tenga ingresos anuales superiores a $20 millones Debe negociar un contrato con Moonshot antes de ofrecer K3 a clientes externos como servicio.
- Cualquier empresa que tenga ingresos mensuales superiores a $20 millones o más de 100 millones de usuarios activos al mes Se debe indicar la atribución «Kimi K3» en cualquier producto que incorpore el modelo.
Para un desarrollador independiente o una startup, ninguna de las dos condiciones es vinculante. Para una empresa de SaaS consolidada que tenga previsto revender la inferencia basada en K3, la primera sí lo es, sin lugar a dudas. Lee la licencia antes de basar tu modelo de negocio en ella.
Qwen3.8-Max: aún no está disponible
Esto es algo que hay que decir sin rodeos, porque ya son muchos los titulares que han calificado a Qwen3.8-Max de código abierto.
A fecha de 5 de agosto de 2026, los pesos de Qwen3.8-Max no se pueden descargar. Alibaba se comprometió, en el momento del lanzamiento, a publicar los pesos “la semana que viene” —es decir, la semana del 10 de agosto— en Hugging Face y ModelScope, tanto para Qwen3.8-Max como para un punto de control más pequeño, Qwen3.8-27B. No se ha especificado ninguna licencia. Una búsqueda de «Qwen3.8» en Hugging Face a fecha de 4 de agosto no arrojó ninguna ficha oficial del modelo de Alibaba, sino únicamente archivos subidos por la comunidad con nombres como Qwen3.8_4B_Distilled — Son productos de terceros, no el producto estrella, y es fácil confundirlos con el auténtico si los echas un vistazo rápido.
Hay motivos para un optimismo cauteloso: Alibaba cuenta con un historial genuino en materia de código abierto, ya que las líneas Qwen3 y Qwen3.5 se distribuyen bajo la licencia Apache 2.0. Pero también se observa una tendencia en sentido contrario: todos los productos estrella de la gama Max desde Qwen3-Max han sido de código cerrado. Si los pesos se publican con una licencia permisiva, se rompería por completo esa tendencia y podría decirse que sería una noticia más importante que el recuento de parámetros. Hasta que existan un repositorio y un archivo de licencia, planifica en función de la API.
¿De verdad se pueden alojar uno mismo?
Los pesos abiertos solo son útiles si puedes ejecutarlos, y ahí es donde el marketing y la realidad del hardware divergen notablemente.
Kimi K3 Es una descarga de 1,56 TB, que se distribuye con precisión MXFP4 para garantizar una mayor compatibilidad con el hardware. Aun así, un modelo de 2,8 billones de parámetros requiere una infraestructura de clase «supernodo»: se recomienda contar con 64 aceleradores o más. Para la inmensa mayoría de los equipos, los pesos son un artefacto de investigación y una garantía de soberanía, no un plan de implementación. Se utilizará la API.
Qwen 3.8-Max con un total de 2,4 T es, asimismo, un producto propio de un centro de datos con múltiples nodos. El más pequeño de Alibaba Qwen3.8-27B Checkpoint es la opción más realista para una instalación local, y es la que debería interesar a cualquiera que realmente tenga pensado alojar el servicio por su cuenta.
GLM-5.2 Con unos 753 mil millones en total y unos 40 mil millones activos, es el más manejable de los tres, pero “el más manejable” sigue implicando una infraestructura de GPU considerable. Las pequeñas empresas no suelen disponer de ella.
Entonces, ¿por qué es importante la ponderación abierta si casi nadie puede participar en estas pruebas? Por dos razones, ambas de peso.
La primera es soberanía. Los países que invierten miles de millones en infraestructura nacional de IA suelen ser propietarios del hardware, mientras que alquilan los modelos a proveedores estadounidenses. Un modelo de «frontera de peso abierto» cambia ese cálculo: un gobierno puede ejecutarlo en su propio territorio, reentrenarlo para su propio idioma y contexto jurídico, y mantener los datos de los ciudadanos dentro de sus fronteras.
La segunda es el mercado de inferencias. Los pesos abiertos permiten que cualquier proveedor de alojamiento pueda ofrecer el modelo, lo que hace que los precios por token bajen gracias a la competencia, en lugar de a la buena voluntad del proveedor. Esa es una de las principales razones por las que GLM-5.2 está disponible con una entrada de $1,00–$1,20 a través de routers de terceros, por debajo del propio precio de Z.ai, que es de $1,40.
Tres ventanas de contexto de 1M no son iguales
Los tres modelos anuncian una ventana de contexto de un millón de tokens. Eso equivale aproximadamente a 750 000 palabras: todo un código fuente extenso o unas 400 páginas de documentos, en una sola solicitud.
Los detalles difieren en aspectos que son importantes desde el punto de vista operativo:
- Qwen 3.8-Max Limita la entrada real a 991 000 tokens, que se reducen a 983 000 cuando se activa la función de razonamiento, con un presupuesto máximo independiente de 262 000 tokens para el razonamiento. La salida alcanza un máximo de 131 000 tokens en ambos modos. Los límites de velocidad son de 2 millones de tokens por minuto y 15 000 solicitudes por minuto.
- GLM-5.2 Admite hasta 128–131K tokens de salida, suficientes para comparar grandes diferencias entre múltiples archivos de una sola vez. Su ventana de 1M supuso un aumento de aproximadamente 5 veces con respecto a los ~200K de GLM-5.1, y es la mejora que más ha cambiado las capacidades del modelo.
- Kimi K3 Ofrece un contexto de 1M con las señales de recuperación de contexto largo más potentes de las tres, dado que su arquitectura se diseñó específicamente para sesiones de largo plazo.
Una pregunta más útil que “¿qué tamaño tiene la ventana?” es “¿se mantiene coherente el modelo en el extremo más alejado de la misma?”. El contexto anunciado y utilizable Los contextos difieren, y ninguno de estos tres ha sido sometido a pruebas de estrés independientes a plena capacidad de una forma que yo consideraría concluyente. Si tu carga de trabajo depende de una recuperación real de 800 000 tokens, pruébalo antes de diseñar tu arquitectura en torno a ello.
¿Qué modelo deberías elegir?
Para desarrolladores independientes o «indie hackers» → GLM-5.2
El aspecto económico es decisivo. Un plan de programación «Lite» a $12.60 al mes con facturación anual te permite disponer de un agente de codificación realmente competente dentro de Claude Code o Cline, con una prueba gratuita de cinco días disponible a través de ZCode (3 millones de tokens GLM-5.2 más 2 millones de tokens GLM-5-Turbo al día) para formarte una opinión real antes de pagar nada.
Pierdes visión. Si tu trabajo se centra en el backend, la CLI, la creación de scripts o el desarrollo de API, apenas lo notarás. Si te dedicas al front-end a partir de maquetas de diseño, lo notarás de inmediato.
Para el equipo de ingeniería de la startup → GLM-5.2 como contacto principal, Kimi K3 para casos de escalación
Dirige la mayor parte de tu trabajo —correcciones rutinarias de errores, refactorizaciones, generación de pruebas, código repetitivo— a GLM-5.2 y reserva K3 para aquellas tareas en las que esa capacidad adicional se traduzca realmente en un ticket completado. La diferencia de 7 puntos en el SWE-bench Pro entre ambos es real, pero solo es relevante en la parte final de la carrera.
Para empresas y sectores regulados → GLM-5.2 autohospedado, o Qwen3.8-27B cuando esté disponible
El detalle clave: La API en la nube de Z.ai se canaliza a través de una infraestructura ubicada en China. Para los proyectos personales y la mayoría de las startups, esto no supone ningún problema. Sin embargo, para una empresa sujeta a regulación, exige o bien un análisis jurídico o bien pasar al autoalojamiento. La licencia MIT hace que el autoalojamiento sea realmente viable, algo que no ocurre con las condiciones de umbral de ingresos de K3.
Para flujos de trabajo multimodales y con uso de ordenador → Qwen3.8-Max
Si tu agente necesita leer capturas de pantalla, analizar documentos visualmente o procesar vídeo, GLM-5.2 queda descartado y Qwen supera a Kimi en las puntuaciones publicadas en visión. Las puntuaciones de 86,1 en OSWorld-Verified y de 92,1 en OmniDocBench son indicios claros de un buen rendimiento en el uso de ordenadores y la comprensión de documentos. Limítate a presupuestar el acceso a la API en lugar de optar por el autoalojamiento hasta que se publiquen los pesos y la licencia.
Para investigadores y aplicaciones centradas en la soberanía → Kimi K3
El punto de control de peso abierto más grande jamás publicado, con un informe técnico que abarca el diseño, el entrenamiento y la metodología de evaluación comparativa. Si estás estudiando arquitecturas MoE a escala de vanguardia, Kimi Delta Attention o Attention Residuals, este es el modelo más potente que puedes examinar.
Para obtener el máximo rendimiento sin importar el coste → Kimi K3
Cuarto en Artificial Analysis, segundo en el Vals Index, primero en Frontend Code Arena y el único modelo de los tres que compite de forma constante con los modelos estrella de Claude y GPT. Su precio está a la altura.
La estrategia de enrutamiento multimodelo
La respuesta sincera a la pregunta “¿cuál debería usar?” es que, por lo general, elegir uno es un enfoque erróneo.
Estos tres modelos son compatibles con el SDK de OpenAI. Además, GLM-5.2 incluye puntos finales compatibles con Anthropic, y Qwen admite tanto las especificaciones de OpenAI como las de DashScope. Para cambiar de uno a otro basta con indicar una URL base y un ID de modelo. El coste de cambio de proveedor es prácticamente nulo.
Esto hace que una arquitectura de enrutamiento sea barata de construir y cara de ignorar:
- Nivel económico para trabajos de gran volumen y de baja importancia. Clasificación, resumen, ediciones sencillas. El GLM-4.7, con $0,60/$2,20, rinde más de lo que la gente espera: sigue alcanzando los 73,8% en SWE-bench Verified.
- Nivel predeterminado para la mayor parte del trabajo real. GLM-5.2 o Qwen3.8-Max, dependiendo de si necesitas funciones de visión.
- Nivel de escalada para la bicicleta rígida. Kimi K3, o un buque insignia occidental, para tareas en las que el fracaso sale caro y el coste de las iteraciones supera el coste de los tokens.
- Planificación especializada por tipo de tarea. Los datos de Fireworks resultan reveladores en este sentido: K3 destacó en seguridad y bucles terminales largos, mientras que Fable 5 se impuso en multilingüismo y visualización de datos. Se trata de diferencias significativas, no de detalles sin importancia.
Los equipos que están sacando el máximo partido al panorama de modelos de 2026 no son los que acertaron en su elección, sino los que crearon el conmutador.
Riesgos, advertencias y señales de alerta
La acusación de destilación. Michael Kratsios, director de la Oficina de Política Científica y Tecnológica de la Casa Blanca, ha acusado públicamente a Moonshot de desarrollar Kimi K3 a partir de una adaptación del modelo Claude Fable de Anthropic. Moonshot no ha admitido esta acusación. Se trata de una controversia sin resolver con posibles implicaciones legales y en materia de contratación pública, y si te encuentras en un contexto en el que la procedencia de los modelos es relevante —por ejemplo, en la contratación pública—, debe figurar en tu registro de riesgos.
Enrutamiento de datos y jurisdicción. Las tres empresas operan principalmente bajo la jurisdicción china. Las llamadas a la API pasan por su infraestructura. El autoalojamiento resuelve este problema; el uso de la API, no. Se trata de una cuestión de cumplimiento normativo, no política, y tiene una respuesta técnica clara si tus requisitos así lo exigen.
La verificación de los resultados de las pruebas de rendimiento es realmente escasa. La tabla de resultados de pruebas de rendimiento de Qwen3.8-Max procede íntegramente de datos facilitados por el propio fabricante, sin que se haya publicado ninguna réplica independiente. Las cifras de GLM-5.2 se dieron a conocer tras su lanzamiento a partir de fuentes diversas. Solo K3 cuenta con evaluaciones sustanciales realizadas por terceros, y dichas evaluaciones no coinciden entre sí.
Incertidumbre sobre la licencia de Qwen. Un precedente no es un compromiso. Hasta que exista un repositorio de Hugging Face con un archivo de licencia real, cualquier plan que dependa de los pesos de Qwen3.8-Max es un plan basado en un comunicado de prensa.
Cambios en el funcionamiento de las cuotas. La promoción de GLM con un multiplicador de 1× en horas valle finaliza en septiembre de 2026; a partir de entonces, el consumo de la cuota se duplicará aproximadamente en horas valle y se triplicará en horas punta. Si estás calculando una suscripción en función del rendimiento efectivo actual, ten en cuenta también las cifras posteriores a la promoción.
El ritmo de lanzamientos es brutal. GLM-5 se lanzó en febrero, 5.1 en abril y 5.2 en junio. Kimi pasó a K2.5 en enero, a K2.6 en abril, a K2.7 Code en junio y a K3 en julio. Cualquier conclusión a la que llegues hoy tiene una vigencia que se mide en semanas.
Próximamente
El próximo buque insignia de Z.ai es el lanzamiento a corto plazo más esperado. Una nota de investigación de JPMorgan, difundida por Reuters y CGTN, apunta a un plazo en agosto de 2026. Las filtraciones de la comunidad describen un modelo con más de un billón de parámetros, con una ventana de contexto de 1 millón que se mantiene y pesos abiertos, centrado en agentes de codificación de larga duración. Incluso el nombre es objeto de debate: GLM-5.3, GLM-5.5 y GLM-6 aparecen todos en el debate actual, y algunos informes sugieren que Z.ai podría saltarse por completo las versiones 5.3 y 5.4. A fecha de 4 de agosto, la documentación de Z.ai sigue indicando que GLM-5.2 es la última versión. La compatibilidad con el procesamiento de imágenes es, con diferencia, la petición más repetida por la comunidad.
Qwen 3.8: pesos máximos son el evento concreto más cercano, previsto para la semana del 10 de agosto junto con Qwen3.8-27B. El punto de control 27B es el que hay que tener en cuenta para una implementación práctica en las propias instalaciones.
Informe técnico completo del Kimi K3 Se esperaba que, tras la publicación de los pesos, se abordaran temas como el diseño, la metodología de entrenamiento y la reproducción de los resultados de referencia.
Actualizaré esta comparación a medida que vayan saliendo al mercado.
Preguntas frecuentes
¿Cuál es el mejor modelo de IA de código abierto en este momento?
En cuanto a capacidad bruta, Kimi K3 ocupa el cuarto puesto entre 189 modelos en el Índice de Inteligencia de Análisis Artificial y el primero en Frontend Code Arena. En cuanto a la relación calidad-precio del trabajo de programación, destaca el GLM-5.2, cuyo coste de producción es inferior a un tercio del del K3 y que cuenta con una licencia del MIT sin restricciones reales. Lo que se considere ’mejor“ depende totalmente de si se busca optimizar la capacidad o el coste por tarea resuelta.
¿Es Qwen 3.8-Max realmente de código abierto?
Todavía no. A fecha de 5 de agosto de 2026, solo está disponible a través de la API. Alibaba se comprometió a publicar los pesos la semana del 10 de agosto en Hugging Face y ModelScope, pero aún no ha aparecido ningún repositorio ni licencia. Los titulares que lo califican de código abierto se refieren a un compromiso, no a una descarga.
¿El GLM-5.2 puede procesar imágenes?
No. GLM-5.2 no cuenta con un codificador visual: solo admite texto y código. Se trata de una decisión arquitectónica deliberada, no de un descuido, y la función visual es la petición más solicitada por la comunidad para la próxima versión.
¿Cuánto cuesta el Kimi K3?
$3 por cada millón de tokens de entrada y $15 por cada millón de tokens de salida, con la entrada almacenada en caché a $0,30. Esto lo convierte, con diferencia, en el más costoso de estos tres, aunque sigue estando muy por debajo de Claude Opus 5, con $5/$25, y de Claude Fable 5, con $10/$50.
¿Puedo ejecutar estos modelos en mi propio equipo?
Siendo realistas, no los modelos estrella. Kimi K3 supone una descarga de 1,56 TB que requiere más de 64 aceleradores. Qwen3.8-Max, con 2,4 T, es una implementación en un centro de datos con múltiples nodos. GLM-5.2, con unos 753 mil millones en total y unos 40 mil millones activos, es el más manejable, pero aún así requiere una infraestructura de GPU considerable. El próximo Qwen3.8-27B es la opción realista para una implementación local.
¿Qué modelo es el más adecuado para los agentes de programación?
Kimi K3 lidera en Terminal-Bench 2.1 (88,3), Program Bench y SWE Marathon. GLM-5.2 ofrece la mejor relación coste-rendimiento, con una puntuación de 81,0 en Terminal-Bench y de 62,1 en SWE-bench Pro. Qwen3.8-Max se sitúa entre ambos, con puntuaciones de 86,6 y 67,7, al tiempo que incorpora entrada multimodal. Los tres funcionan con Claude Code, Cline y marcos similares.
¿Superan estos modelos a Claude y a GPT?
En pruebas de rendimiento específicas, a veces. Kimi K3 lidera el Frontend Code Arena por delante de Claude Fable 5 y obtiene una puntuación superior a la de Claude Opus 4.8 en el índice de Análisis Artificial. Sin embargo, la propia Moonshot reconoce que K3 sigue por detrás de Fable 5 y GPT-5.6 Sol en términos generales, y las pruebas independientes muestran resultados dispares según la categoría de tareas, en lugar de un ganador claro.
¿Cuál tiene la mejor licencia para uso comercial?
GLM-5.2, sin lugar a dudas. Licencia MIT sin restricciones, sin umbrales de ingresos ni requisitos de atribución. La licencia personalizada de Kimi K3 permite un amplio uso comercial, pero añade condiciones para las empresas con ingresos superiores a $20M que la revendan como servicio. Qwen3.8-Max no tiene ninguna licencia anunciada.
¿Es seguro utilizar modelos de IA chinos para los datos empresariales?
Las llamadas a la API se canalizan a través de una infraestructura bajo jurisdicción china. Para los proyectos personales y la mayoría de las startups, esto no supone ningún problema. Sin embargo, en el caso de los sectores regulados, requiere un análisis jurídico o el autoalojamiento, y esa es precisamente la razón por la que, para algunas organizaciones, la licencia MIT de GLM-5.2 es más importante que sus puntuaciones en las pruebas de rendimiento.
¿Cuál es la diferencia entre los parámetros totales y los activos?
Los modelos de «mezcla de expertos» activan solo una fracción de sus parámetros por token. Kimi K3 tiene un total de 2,8 T, pero activa aproximadamente 50 000 millones (16 de los 896 expertos). Qwen 3.8-Max tiene un total de 2,4 T, con unos 95 000 millones activos. GLM-5.2 tiene unos 753 000 millones, con unos 40 000 millones activos. Los parámetros activos determinan el coste de la inferencia, por lo que el modelo insignia de Qwen resulta más costoso de ejecutar que el K3, que es más grande.
Veredicto final
Lo más importante que revela esta comparación no es qué modelo sale ganando, sino que la pregunta ha cambiado.
Hace dos años, la pregunta interesante sobre los modelos de peso abierto era cuánto se quedaban atrás. Esa pregunta ya no tiene interés, porque la respuesta es “lo suficientemente cerca como para que dependa de la tarea en cuestión”. Kimi K3 superó a Claude Fable 5 en una clasificación ciega basada en las preferencias humanas para código front-end. GLM-5.2 superó a GPT-5.5 en la corrección de errores reales a una sexta parte del coste. Estos no son resultados de consolación.
La pregunta interesante ahora es lo que realmente estás comprando. Y la respuesta es diferente para cada uno de estos tres, por motivos que no tienen nada que ver con su posición en la clasificación:
- GLM-5.2 te vende independencia. Ponderaciones del MIT, sin condiciones, sin negociación, el precio más bajo de la comparativa. Estás comprando el derecho a dejar de depender de un proveedor.
- Kimi K3 te vende capacidad. Las mejores prestaciones en este ámbito, a un precio acorde con ellas, con condiciones de licencia que solo suponen un inconveniente si tu empresa crece mucho.
- Qwen 3.8-Max te vende amplitud. Texto, imagen y vídeo en un solo modelo, números de agente sólidos, respaldados por el compromiso de Alibaba de invertir $53 mil millones en infraestructura —y, por ahora, una promesa sobre los pesos más que sobre los pesos en sí.
Si tuviera que resumirlo en una sola línea para cada caso: elige el GLM-5.2 si vas a pagar la factura tú mismo, el Kimi K3 si las prestaciones justifican el sobreprecio, y el Qwen3.8-Max si tu agente necesita ojos.
Y elijas el que elijas, monta el router. En un panorama en el que tres modelos similares salieron al mercado en ocho semanas, la capacidad de cambiar vale más que la capacidad de elegir bien.
Última actualización: 5 de agosto de 2026. Los precios, los parámetros de referencia y las condiciones de licencia en este ámbito cambian cada semana; comprueba las cifras actuales con la documentación oficial antes de tomar decisiones de adquisición. Entre las fuentes se incluyen VentureBeat, MarkTechPost, Fortune, SCMP, Quartz, Artificial Analysis, Northflank y la documentación de los proveedores Moonshot AI, Alibaba Qwen y Z.ai.



