El panorama de la IA en 2026 se resume en tres acontecimientos que tuvieron lugar en los primeros ocho meses del año, y casi nadie los ha mencionado en la misma frase.
Se ha verificado que un modelo ha superado la prueba 96% en SWE-bench. No se trata del 96% en una prueba de rendimiento ficticia, sino del 96% aplicado a incidencias reales de GitHub relacionadas con Django, Flask y scikit-learn: la prueba de rendimiento que se suponía que llevaría años. Ahora está prácticamente terminada en lo que respecta al discriminador, y los tres modelos que encabezan la clasificación están separados por menos de un punto porcentual.
Las mejores pruebas disponibles sobre si las herramientas de programación basadas en IA permiten a los desarrolladores experimentados trabajar más rápido siguen indicando que no. El ensayo controlado aleatorio de METR reveló una ralentización de 19%. Su propio intento de repetirlo en 2026 fracasó porque los desarrolladores se negaron a trabajar sin IA, ni siquiera a un ritmo de $50 por hora. Las personas que utilizan estas herramientas creen que son tres veces más rápidas. Según las mediciones, no lo son.
Además, Microsoft ha integrado un modelo de razonamiento con 14.000 millones de parámetros directamente en Windows., una frase que en 2024 habría sido pura ciencia ficción y que ahora es una nota al pie en una ponencia de Build.
Esos tres hechos lo dicen todo El estado de la IA en 2026 en miniatura. Los modelos resultaron extraordinarios. Sin embargo, el aumento de productividad previsto no se materializó. Y la frontera de lo interesante se desplazó silenciosamente del centro de datos al dispositivo que tienes en la mano.
Esta es la versión extensa del informe «El estado de la IA en 2026». Está dirigida a quienes deben tomar decisiones que implican un gasto económico: qué modelo elegir, si permitir que los agentes escriban código de producción, qué adquirir y qué comunicar a un cliente o a un responsable de protección de datos. He diferenciado lo que ya se ha lanzado del mercado de lo que se ha anunciado y de los rumores, porque el error más costoso en este campo es planificar en torno a un modelo que aún no existe.
Última actualización: 3 de septiembre de 2026. Habrá que volver a actualizarlo antes de Navidad.
Resumen: «El estado de la IA en 2026» en 90 segundos
La carrera es una contienda entre cuatro competidores y, en estos momentos, Anthropic va en cabeza en la clasificación general. A fecha de 2 de septiembre de 2026, el Índice de Inteligencia v4.1.1 de Artificial Analysis sitúa a Claude Fable 5.1 en 65,7, a Claude Opus 5 en 63,0, Grok 4.6 en 60,9 y GPT-5.6 Sol en 58,9. Sin embargo, la media oculta lo más interesante: GPT-5.6 Sol lidera BrowseComp con 90,41 TP3T, Gemini 3.8 Flash alcanza 58,7 en $0,75 por millón de tokens de entrada, y los diez mejores modelos se sitúan en un rango de tan solo 8,2 puntos —un margen lo suficientemente estrecho como para que las diferencias en el entrenamiento y las indicaciones puedan hacer que un modelo suba o baje varias posiciones—.
Los pesos abiertos van aproximadamente una generación por detrás, pero están recortando distancias. GLM-5.3 (753B, abierto) se sitúa en el puesto 59,5 —sexto en la clasificación general—, por delante de GPT-5.6 Sol. DeepSeek V4 Pro se lanzó con 1,6 billones de parámetros bajo una licencia real del MIT. Ornith-1.5-397B alcanzó los 86 puntos en SWE-bench Verified y superó por poco a Claude Opus 4.8 en Terminal-Bench 2.1, con 86,1 frente a 85,0. La diferencia en cuanto a capacidad es ahora de unos seis meses. Lo que realmente importa es la diferencia en cuanto a la licencia.
“El ”código de la intuición» se impuso en el debate sobre la adopción, pero salió perdiendo en el debate sobre las pruebas. El 90% de los desarrolladores utiliza al menos una herramienta de programación basada en IA en el trabajo. El mercado de los agentes de programación para empresas mueve aproximadamente $10 mil millones anualizados. Y la confianza de los desarrolladores en los resultados de la IA ha caído de 40% a 29% en dos años. Las herramientas son universales, y las personas que las utilizan confían cada vez menos en ellas cada año. Ambas cosas son lógicas.
Ya ha llegado la factura de la seguridad y está desglosada. Veracode descubrió que 45% de ejemplos de código generados por IA presentan una vulnerabilidad incluida en la lista «OWASP Top 10». Apiiro calculó que los desarrolladores asistidos por IA realizan commits entre tres y cuatro veces más rápido y detectan problemas de seguridad diez veces más rápido. Aproximadamente 20% del código generado por IA hace referencia a paquetes que no existen. Esto no es un argumento en contra de las herramientas. Es una cuestión de dónde se establece el límite.
La IA sin conexión ha pasado a ser realmente útil este año, en el hardware que la gente ya tiene. Un modelo de 2.000 millones de parámetros funciona a una velocidad de 61 tokens por segundo en un iPhone. Microsoft ha integrado en Windows un motor de razonamiento de 14.000 millones de parámetros, con un requisito de 40 TOPS para la NPU. Google limita el acceso a su mejor modelo integrado en el dispositivo a 12 GB de RAM, y lo mismo hace Apple. El factor que determina qué se puede ejecutar sin conexión es la memoria, no la potencia de cálculo, y es precisamente la memoria la que ha empezado a escasear.
Una frase concisa y sincera sobre el estado de la IA en 2026: Este es el año en el que los modelos dejaron de ser el cuello de botella. La verificación se convirtió en el cuello de botella. Todas las decisiones importantes que se mencionan en este artículo —qué modelo, qué arnés, qué dispositivo, qué puerta— son consecuencia de ese único cambio.

Comparativa rápida: The Frontier, septiembre de 2026
El Índice de Inteligencia Artificial Analítica v4.1.1 agrupa nueve evaluaciones: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR. Las puntuaciones que figuran a continuación corresponden a la instantánea del 2 de septiembre de 2026.
| Modelo | Laboratorio | Índice AA | Pesos | Entradas/salidas por 1M |
|---|---|---|---|---|
| Claude Fable 5.1 | Antropico | 65.7 | Cerrado | $10.00 / $50.00 |
| Claude, Op. 5 | Antropico | 63.0 | Cerrado | $5.00 / $25.00 |
| Claude Fable 5 | Antropico | 62.1 | Cerrado | $10.00 / $50.00 |
| Grok 4.6 | xAI | 60.9 | Cerrado | — |
| Kimi K3 | Moonshot | 59.7 | Categoría de peso libre | — |
| GLM-5.3 | Z.ai | 59.5 | Categoría de peso libre | $1.40 / $4.40 |
| GPT-5.6 Sol | OpenAI | 58.9 | Cerrado | $5.00 / $30.00 |
| Gemini 3.8 Flash | 58.7 | Cerrado | $0.75 / $3.75 | |
| Qwen 3.8: vista previa de Max | Alibaba | 58.1 | Cerrado | — |
| GLM-5.3-Flash | Z.ai | 57.5 | Categoría de peso libre | $0.15 / $0.47 |
| Claude Opus 4.8 | Antropico | 57.3 | Cerrado | $5.00 / $25.00 |
| Muse Spark 1.2 | Meta | 56.8 | Cerrado | — |
| GPT-5.5 | OpenAI | 56.3 | Cerrado | — |
Lee la cuarta columna antes que la tercera. Dos de los diez mejores modelos tienen pesos descargables, y cada uno de ellos cuesta $0,15 por cada millón de tokens de entrada.
Comparación rápida: la frontera del peso libre
| Modelo | Total / Activos | Contexto | Licencia | Publicado |
|---|---|---|---|---|
| Kimi K3 | 2,8 T / 104 B | 1 millón | Por tramos de ingresos (personalizado) | Julio de 2026 |
| Qwen3.8-2.4T-A95B | 2,4 T / 95 B | 262 000 (1 millón a través de YaRN) | Apache 2.0 | 14 de agosto de 2026 |
| DeepSeek V4 Pro | 1,6 T / 49 B | 1 millón | MIT | 12 de agosto de 2026 |
| GLM-5.3 | 753B / ~40B | 1 millón | Personalizado (puerta $10B) | Agosto de 2026 |
| MiniMax M3 | 428B / 23B | 1 millón | Personalizado (atribución) | 1 de junio de 2026 |
| Ornith-1.5-397B | 397B Ministerio de Educación | 262 000 (1 millón a través de YaRN) | MIT | Agosto de 2026 |
| Gemma 4 31B | 31B denso | 256 K | Apache 2.0 | 6 de abril de 2026 |
| Qwen3.8-27B | 27B denso | 262 K | Apache 2.0 | 14 de agosto de 2026 |
| Gemma 4 E4B | ~8B | 128 K | Apache 2.0 | 6 de abril de 2026 |
Tres de esos nueve están realmente libres de dopaje según la OSI. Esa es la verdadera historia de las categorías de peso libre en 2026, y volveré sobre ella en la tercera parte.
ACTO I — LAS MODELOS
Primera parte: Lo que realmente se comercializó en 2026
Antes de entrar en discusiones, veamos las cuentas. Voy a dividir esto en tres niveles porque la diferencia entre ellos es precisamente donde se malgasta el dinero.
Confirmado y en envío
- 6 de abril de 2026 — Google lanza Gemma 4 bajo la licencia Apache 2.0, lo que supone un cambio respecto a las condiciones específicas de Gemma 3. Cuatro variantes: 31B densa, 26B con 4B activas (MoE), E4B con ~8B y E2B con un total de 5,1B, de las cuales 2,3B están activas. 256K de contexto en los modelos grandes, 128K en la serie E. Todos admiten entrada de texto, imágenes y vídeo; E2B y E4B añaden audio nativo.
- 1 de junio de 2026 — MiniMax M3. 428 mil millones en total / 23 mil millones activos, 1 millón de contextos, multimodalidad nativa, un nuevo operador de atención dispersa, pesos en Hugging Face. Trato este tema en profundidad en mi artículo anterior sobre hardware de IA local.
- 2 de junio de 2026 — Microsoft presenta Aion 1.0 en la conferencia Build. Una familia de modelos integrados en el propio dispositivo que se incluyen en Windows 11: Aion 1.0 Instruct (compatible con la CPU, disponible en Edge Canary a partir de la versión 150.0.4070) y Aion 1.0 Plan, un modelo de razonamiento y ejecución de herramientas con 14 000 millones de parámetros y una ventana de contexto de 32K.
- 9 de junio de 2026 — Claude Fable 5. El nivel superior de Anthropic: $10/$50 por millón, contexto de 1 millón, salida máxima de 128K.
- 9 de julio de 2026 — OpenAI lanza GPT-5.6 en tres variantes: Sol ($5/$30), Terra ($2,50/$15) y Luna ($1/$6). La funcionalidad cibernética está integrada en el modelo Sol, en lugar de venderse como un modelo independiente, y ofrece un acceso mejorado a través del programa «Trusted Access for Cyber» de OpenAI.
- Julio de 2026 — Moonshot desvela los pesos del Kimi K3. 2,8 billones de parámetros, 1 millón de contexto, MXFP4 nativo, bajo una licencia con niveles de ingresos.
- 24 de julio de 2026 — Claude Opus 5. $5/$25, sin cambios respecto a Opus 4.8. Anthropic afirma que “duplica con creces el rendimiento de Opus 4.8’ en Frontier-Bench v0.1 y obtiene una puntuación tres veces superior a la del siguiente mejor modelo en ARC-AGI 3.
- 12 de agosto de 2026 — DeepSeek V4 Pro sale de la fase de prueba con pesos bajo licencia MIT: 1,6 T en total (algunas fuentes lo redondean a 1,7 T), 49 000 millones activos, 1 millón de contexto, 893 GB de tensores BF16 y FP8, además de un módulo de decodificación especulativa DSpark. Terminal-Bench 2.1 con 87,9, HLE con herramientas con 60,0 y CyberGym con 83,3. Al mismo tiempo, DeepSeek subió los precios de la API.
- 14 de agosto de 2026 — Qwen 3.8, categorías de peso abiertas bajo la licencia Apache 2.0: un modelo multimodal denso de 27 mil millones y un gigante de 2,4 T-A95 mil millones, ambos disponibles en Hugging Face y ModelScope, con un contexto nativo de 262 mil ampliable a 1 millón con YaRN.
- Agosto de 2026 — Ponderaciones GLM-5.3 Se publicó en Hugging Face aproximadamente dos semanas después del lanzamiento de la API. 753B de MoE, 1M de contexto, 128K de salida, BF16 y FP8.
- Agosto de 2026 — Ornith-1.5. Tres modelos (397B MoE, 35B MoE con 3B activos, 9B denso), desarrollados a partir de Qwen3.5 y Gemma 4 con preentrenamiento continuado, con licencia del MIT, y que alcanzan una puntuación de 86 en SWE-bench Verified.
- 1 de septiembre de 2026 — Claude Fable 5.1 y Mythos 5.1. Pensamiento adaptativo activado por defecto, contexto de 1M, salida de 128K. El precio base se mantiene sin cambios en $10/$50, pero las lecturas de caché bajan a 75%, pasando de $1,00 a $0,25 por millón.
- 2 de septiembre de 2026 — Gemini 3.8 Flash a $0,75/$3,75, contexto de entrada de 1M, salida de 66K, fecha límite de actualización de conocimientos en marzo de 2026, con entradas de texto, imagen, vídeo, audio y PDF.
- 2 de septiembre de 2026 — Meta lanza el Muse Spark 1.3 y la CLI de Muse Code.
Noticia, fiable, sin confirmar
- Meta hará públicos “próximamente” los pesos de Muse Spark.” Se trata de Mark Zuckerberg en X, sin fecha, sin número de parámetros, sin detalles sobre la arquitectura y sin texto de licencia. Meta no ha revelado el tamaño del modelo en ninguna de sus versiones.
- Gemini Nano v4 Se ha anunciado que estará disponible para Android, aunque Nano v3 solo está disponible actualmente para la serie Pixel 10.
- Plan de Aion 1.0 estará disponible de forma general en los “próximos meses”; solo Instruct se encuentra en fase de vista previa.
Rumor, de una sola fuente; trátalo como corresponde.
- Todo lo que has leído sobre el próximo producto estrella de Anthropic, OpenAI o Google. En un mercado en el que cuatro laboratorios han lanzado un modelo que figura entre los diez mejores en un plazo de nueve semanas, los rumores sobre futuras novedades tienen una vida media de unas dos semanas.
Hay otra cosa que merece la pena destacar, porque es una novedad y casi nadie fuera del ámbito de la seguridad está hablando de ello. Claude Mythos 5.1 obtiene una puntuación de 60,9 en Terminal-Bench 4.0 —superior a los 55,8 de Fable 5.1— y 95,51 TP3T en SWE-bench Verified. No se puede comprar.
Anthropic describe Mythos como su “modelo más capaz para la investigación en ciberseguridad y biología”, y solo está disponible para defensores cibernéticos y científicos de las ciencias de la vida que hayan superado un proceso de selección a través de dos programas de acceso de confianza: el Programa de Verificación Cibernética y el Programa de Verificación de Ciencias de la Vida. Según las propias palabras de Anthropic, “solo podemos ponerlo a disposición de un grupo de organizaciones estadounidenses, aunque estamos trabajando para ampliar el acceso”. El Proyecto Glasswing, la iniciativa para ampliar el acceso, había alcanzado aproximadamente 150 organizaciones en más de quince países a partir de junio de 2026.
El razonamiento se basa en el doble uso —un modelo que es excelente para detectar vulnerabilidades también lo es para detectarlas en beneficio de cualquiera de las partes— y creo que es defendible. Pero hay que tener en cuenta la consecuencia estructural, ya que es realmente nueva: El modelo con mejor puntuación en una prueba de rendimiento pública de programación es ahora uno al que la mayor parte del mundo no puede acceder, por mucho que se pague. La restricción de capacidades por motivos de seguridad, en lugar de por motivos comerciales, va a ser cada vez más habitual, y no menos; y, si te encuentras fuera de EE. UU., es un argumento a favor de prestar atención a los pesos abiertos que no tiene nada que ver con el coste.
Mostrar imagen Nueve meses, doce lanzamientos importantes, cuatro de ellos de peso libre. Las barras continuas corresponden a pesos o al acceso a la API que ya se pueden adquirir; las líneas punteadas indican productos anunciados pero aún no disponibles.
Segunda parte: ¿Qué es lo que realmente diferencia a los modelos «Frontier» en la actualidad?
Esta es la incómoda verdad sobre los primeros puestos de esa clasificación: En la mayoría de los trabajos que vas a realizar, los ocho modelos principales son intercambiables.
No lo digo por llevar la contraria. Lo digo porque la diferencia entre el índice agregado de Claude Fable 5.1, que está en 65,7, y el de GLM-5.3-Flash, que está en 57,5, es de ocho puntos, y el GLM-5.3-Flash cuesta $0,15 por cada millón de tokens de entrada, frente a los $10,00 del Fable. Eso supone una Una diferencia de precio de 67 veces por una diferencia de 12% en la puntuación compuesta, y las puntuaciones combinadas minimizan precisamente las diferencias que te importan, mientras que exageran aquellas que no te importan.
Así pues, la pregunta útil no es “¿qué modelo es el mejor?”, sino “¿en qué destaca realmente cada uno de ellos y se ajusta eso a mi rutina semanal?”.”
Las cuatro cosas que realmente difieren
1. Fiabilidad agencial a largo plazo. Este es el verdadero factor diferenciador para 2026 y se mide de forma deficiente. Opus 5, de Anthropic, se posiciona explícitamente como “una mejora radical para el nivel Opus que impulsa a los agentes de larga duración”, no como un modelo más inteligente, sino como un modelo que no falla a la sexta hora. Las pruebas de este tipo de mejora se encuentran en pruebas de rendimiento de agentes (Terminal-Bench, OSWorld, Frontier-Bench) más que en pruebas de conocimiento, y dichas pruebas son recientes, presentan ruido y son sensibles a los andamios.
2. Economía de la caché. El cambio más destacado de Fable 5.1 no fue un salto cualitativo en cuanto a prestaciones. Consistió en reducir las lecturas de caché 75%, de $1,00 a $0,25 por millón de tokens, lo que, según MarkTechPost, supone un coste aproximadamente 25% menor para los flujos de trabajo típicos y de hasta 45% para los de tipo ’agentic». Para cualquier agente que vuelva a leer una indicación del sistema o un código fuente extenso en cada turno, el precio del almacenamiento en caché influye más en tu factura mensual que la elección del modelo. Nadie pone eso en una tabla de clasificación.
3. Navegación y uso de herramientas. GPT-5.6 Sol obtiene una puntuación de 90,41 TP3T en BrowseComp, y de 92,21 TP3T en la configuración de razonamiento «Ultra». Se trata de una fortaleza específica y publicada, y si tu carga de trabajo se centra en la investigación y la síntesis, en lugar de en la programación y la verificación, tiene un valor superior a dos puntos del índice agregado.
4. Precio por respuesta adecuada. El Gemini 3.8 Flash, con un índice de 58,7 para una entrada de $0,75, es el activo con el error de valoración más evidente del tablero en relación con la frontera cerrada. El GLM-5.3-Flash, con un índice de 57,5 para una entrada de $0,15, es, sin lugar a dudas, el activo con el error de valoración más evidente.
La tabla de precios, ya que es el factor decisivo
| Modelo | Entrada /1M | Salida /1M | Entrada almacenada en caché /1M | Contexto |
|---|---|---|---|---|
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | 1 M / 128 K de salida |
| Claude, Op. 5 | $5.00 | $25.00 | — | 1 M / 128 K de salida |
| GPT-5.6 Sol | $5.00 | $30.00 | — | — |
| GPT-5.6 Terra | $2.50 | $15.00 | — | — |
| Claude Soneto 5 | $2.00 | $10.00 | — | 1 M / 128 K de salida |
| GLM-5.3 | $1.40 | $4.40 | — | 1 M / 128 K de salida |
| GPT-5.6 Luna | $1.00 | $6.00 | — | — |
| Gemini 3.8 Flash | $0.75 | $3.75 | — | 1 millón / 66 000 salientes |
| GLM-5.3-Flash | $0.15 | $0.47 | — | — |
| MiniMax M3 | $0.30 | $1.20 | — | 1 millón |
| Muse Spark (Colaboradores) | $0.10 | $0.20 | $0.002 | — |
Vale la pena fijarse bien en esa última fila. El nivel «Contributors» de Meta es de $0,10 de entrada y $0,20 de salida, con posible acceso a tus datos para el entrenamiento. Eso no es un precio; es un intercambio. Además, por lo que yo veo, es la expresión más honesta del modelo de negocio real que se esconde tras muchas deducciones simplistas, y prefiero que se indique en una tabla de precios a que quede oculto en un acuerdo de procesamiento de datos (DPA).
Mostrar imagen La inteligencia en un eje y el precio en una escala logarítmica en el otro. Ocho puntos del índice separan la parte superior del gráfico de la inferior; 67× separa los precios. La frontera eficiente se encuentra en la parte inferior derecha, y casi nadie compra allí.

El cambio en la API del que nadie te avisó
La versión 5.1 de Fable incluye tres cambios que afectan a la compatibilidad: ya no se obliga a utilizar herramientas, los bloques de reflexión ahora son específicos de cada modelo y las modificaciones realizadas durante una conversación en los mensajes del sistema o en las herramientas ahora generan errores, en lugar de aceptarse sin aviso.
Ese tercero va a dar problemas. Un gran número de arneses de agentes modifican el mensaje del sistema o la lista de herramientas entre turnos: añaden una herramienta al iniciar una subtarea o recortan las instrucciones para ahorrar contexto. En Fable 5.1, eso ahora se considera un error. Si actualizas un ID de modelo en un archivo de configuración y tu agente empieza a dar errores 400 en el turno cuatro, ese es el motivo.
La lección general, que tiene más valor que la específica: En 2026, una actualización del modelo consistirá en una migración de la API. Escribe los ID de tus modelos de tal forma que cambiar uno suponga modificar solo una línea, y fíjalos. Tendrás que volver a hacer ese cambio en menos de un trimestre.
Tercera parte: La frontera del peso libre y la trampa de la licencia
Esta es la parte de la historia de 2026 que me parece realmente emocionante, y también la parte en la que el marketing resulta más engañoso.
La diferencia en cuanto a capacidades es de unos seis meses
Fíjate en los resultados que se obtuvieron en la categoría de peso libre entre junio y agosto de 2026:
- DeepSeek V4 Pro: 1,6 T en total, 49 B activos, licencia del MIT, Terminal-Bench 2.1 con un resultado de 87,9. Se trata de una puntuación en el Terminal-Bench superior a la de la mayoría de los modelos cerrados publicados este año.
- Ornith-1.5-397B: 86 en SWE-bench Verified, 86,1 en Terminal-Bench 2.1 frente a los 85,0 de Claude Opus 4.8, y 92,8 en GPQA Diamond. Con licencia del MIT, 262 000 de contexto nativo ampliable a aproximadamente 1 millón con YaRN. Desarrollado sobre la base de Qwen 3.5 y Gemma 4 con preentrenamiento y postentrenamiento continuos.
- GLM-5.3: sexto en el índice Artificial Analysis con una puntuación de 59,5, por delante de GPT-5.6 Sol.
- Qwen 3.8: un modelo de 2,4 billones de parámetros bajo licencia Apache 2.0, además de una versión multimodal densa de 27 000 millones de parámetros que, según Alibaba, supera al Qwen3.7-Plus —de mayor tamaño— en tareas de programación y ofimática.
Hace seis meses, la visión honesta era que “los pesos abiertos están una generación por detrás y son más baratos”. Esa visión ya no es cierta. La visión correcta es: En lo que respecta específicamente a la codificación y al trabajo de tipo «agente», los mejores modelos de peso abierto se encuentran dentro de los márgenes de error de la frontera cerrada de la última generación, y son entre 10 y 60 veces más baratos.
Ornith-1.5 es el modelo más interesante del año y casi nadie ha oído hablar de él
Quiero detenerme en este punto, porque se trata de algo realmente novedoso y no de un resultado derivado de la extrapolación.
Ornith describe la versión 1.5 como una ampliación del “autoandamiaje hacia un ciclo de superación personal de principio a fin”. En lenguaje sencillo: el sistema propone sus propias tareas de entrenamiento, genera andamios específicos para cada una de ellas, elabora soluciones y optimiza estos tres aspectos conjuntamente mediante GRPO. Los modelos más potentes le permiten proponer tareas más difíciles; unos andamios mejores descubren estrategias más eficaces; y unos resultados mejores proporcionan una señal de aprendizaje más clara.
Se ha entrenado sobre la base de Qwen 3.5 y Gemma 4 —es decir, utilizando los pesos abiertos de otros autores— y supera a Claude Opus 4.8 en Terminal-Bench 2.1, a pesar de contar con 397 mil millones de parámetros y estar bajo licencia del MIT.
Si ese bucle se generaliza, es el resultado más trascendental de este artículo., porque significa que el ecosistema abierto puede mejorar sin que ningún laboratorio tenga que gastar una fortuna en una ronda de preentrenamiento. Si no se generaliza —si lo que estamos viendo es un sobreajuste específico para las pruebas de referencia derivado de un plan de estudios autogenerado—, entonces es una advertencia sobre exactamente lo mismo. No sé cuál de las dos cosas es. Y, por lo que sé, tampoco lo sabe nadie fuera de Ornith. Lo que me gustaría ver antes de apostar por ello: una evaluación independiente en tareas que no estuvieran relacionadas con el plan de estudios autogenerado, y una referencia humana no incluida en el entrenamiento. Ninguna de las dos cosas existe todavía.
Ahora, las licencias, porque el “código abierto” está dando lugar a muchas prácticas deshonestas
Esto es lo que esas ponderaciones te suponen realmente en términos de obligaciones:
| Modelo | Licencia | El problema |
|---|---|---|
| DeepSeek V4 Pro | MIT | Ninguna. Auténtico software de código abierto. |
| Qwen 3.8 | Apache 2.0 | Ninguna. Auténtico software de código abierto. |
| Gemma 4 | Apache 2.0 | Ninguna — y supone una mejora real respecto a las condiciones personalizadas de Gemma 3. |
| Ornith-1.5 | MIT | No se indica. Comprueba tú mismo la tarjeta de modelo antes del envío. |
| GLM-5.3 | Personalizado | Empresas con más de Ingresos anuales de $10B deben superar la prueba de Z.ai’s revisión de seguridad antes de cualquier uso comercial. Z.ai se trasladó lejos del MIT para esta publicación. |
| Kimi K3 | Personalizado | Estructura basada en los ingresos; se requiere una atribución destacada para los proveedores de gran volumen. |
| MiniMax M3 | Personalizado | El uso comercial requiere que se incluya de forma destacada la mención “Creado con MiniMax M3”; se necesita una autorización por escrito independiente, tal y como se indica más arriba. $20M ingresos anuales. |
| Muse Spark | Desconocido | Se ha anunciado que “estará disponible próximamente”. No existe ningún texto de licencia. |
Tres observaciones. He analizado en detalle la letra pequeña de las tres primeras en Kimi K3 frente a Fable 5.1 frente a GLM-5.3, así que aquí me centraré en lo que ha cambiado desde entonces.
En primer lugar, estas puertas están dirigidas a los hiperescaladores, no a ti. Un umbral de ingresos de $10 mil millones excluye prácticamente a todos los lectores de este artículo. Si eres una empresa alemana del «Mittelstand», una agencia, una consultoría o un desarrollador autónomo, la respuesta práctica en lo que respecta a GLM-5.3 y Kimi K3 es: no tienes de qué preocuparte.
En segundo lugar, “estás bien” no es lo mismo que “tu revisión jurídica está bien”.” Una licencia a medida significa que alguien te cobra por leerla. Una licencia MIT o Apache 2.0 significa que alguien la lee en noventa segundos y sigue adelante. Para la adquisición empresarial, esa diferencia vale más de cuatro puntos en la evaluación comparativa, y es el argumento más sólido a favor de DeepSeek V4 Pro y Qwen3.8 frente a GLM-5.3 en un producto comercial.
En tercer lugar, presta atención a la dirección de la marcha. Z.ai pasó de la licencia MIT en GLM-5.2 a una licencia propia con un control de seguridad en GLM-5.3. DeepSeek hizo lo contrario y mantuvo la licencia MIT al tiempo que subió los precios de la API, lo cual es una estrategia coherente: cobrar por la comodidad, ceder los pesos y dejar que los proveedores de inferencia compitan en la prestación del servicio. Los pesos abiertos no son un movimiento. Son una estrategia comercial, y las estrategias cambian con cada lanzamiento. No diseñes una arquitectura de producto que dé por sentado que la versión del año que viene contará con la licencia de este año.
La expresión “código abierto” debería dejar de utilizarse para los modelos
Ninguna de ellas es de código abierto en el sentido que le da la OSI, salvo las licencias MIT y Apache 2.0; e incluso estas últimas publican los modelos sin divulgar los datos ni el código de entrenamiento, lo cual es algo significativamente distinto del software de código abierto.
El vocabulario que utilizo y que recomendaría:
- Categoría de peso libre — Puedes descargar y ejecutar los parámetros. No dice nada sobre las condiciones.
- Con licencia abierta — MIT, Apache 2.0 o equivalente. Sin restricciones de ingresos, sin obligación de atribución, sin restricciones de ámbito de uso.
- Código abierto — los pesos, el código de entrenamiento y la composición de los datos, bajo una licencia aprobada por la OSI. Casi nada de lo que hay en la vanguardia cumple los requisitos.
Si un proveedor habla de “modelo de código abierto” y se refiere al primero, eso no es exactamente una mentira, pero sí es el tipo de imprecisión que acaba apareciendo en un pliego de condiciones y, posteriormente, dando lugar a un litigio.
Mostrar imagen Las prestaciones se están equiparando. Las licencias, en cambio, se diferencian cada vez más. Para la mayoría de los compradores comerciales, lo que determina la compra es la columna de la derecha, no la puntuación.
Cuarta parte: El problema de los puntos de referencia
SWE-bench Verified ahora tiene este aspecto:
| Clasificación | Modelo | Puntuación |
|---|---|---|
| 1 | Claude, Op. 5 | 96% |
| 2 | Claude Mythos 5 | 95.5% |
| 3 | Claude Fable 5 | 95% |
| 4 | Claude Opus 4.8 | 88.6% |
| 5 | Claude Opus 4.7 (Adaptativo) | 87.6% |
| 6 | Ornith-1.5-397B | 86% |
| 7 | Claude Soneto 5 | 85.2% |
| 8 | GPT-5.3 Codex | 85% |
Tres modelos con una diferencia de un punto porcentual en lo más alto de la clasificación. Esa prueba comparativa ya ha quedado obsoleta. No aporta ninguna información útil sobre la diferencia entre el Opus 5, el Mythos 5 y el Fable 5, y cualquiera que la cite como referencia para una compra en septiembre de 2026 estará basándose en un instrumento saturado.
Esta es la situación general en la que se encuentra actualmente la evaluación de la IA, y presenta cuatro modos de fallo que merece la pena mencionar:
Saturación. Cuando las puntuaciones más altas se concentran por encima de 90%, las diferencias restantes se deben principalmente al ruido de las etiquetas y a los detalles del arnés, más que a la capacidad. SWE-bench Verified se encuentra ahí. GPQA Diamond está cerca.
Sensibilidad del andamio. El mismo modelo obtiene resultados distintos en función del bucle de agente que lo envuelve: la política de reintentos, el conjunto de herramientas, la gestión del contexto y el número de turnos que se le asignan. Los resultados de Terminal-Bench y OSWorld son especialmente sensibles a este factor. Es frecuente que dos laboratorios que publican los resultados de la misma prueba de rendimiento no estén realizando el mismo experimento.
Contaminación. Todos los conjuntos de datos de referencia públicos acaban filtrándose a los corpus de entrenamiento. La respuesta ha sido una carrera armamentística por crear conjuntos de datos de referencia privados cada vez más novedosos y complejos —Frontier-Bench, Agents’ Last Exam, GDPval, CritPt, Terminal-Bench-Science—, lo que resuelve el problema de la contaminación pero genera uno nuevo: no es posible verificar de forma independiente un conjunto de datos de referencia privado.
Selección. Los laboratorios publican las pruebas de rendimiento en las que obtienen los mejores resultados. Anthropic destacó con Frontier-Bench y ARC-AGI-3 para Opus 5. OpenAI destacó con ’Agents’ Last Exam» y un índice de agentes de programación para GPT-5.6. Z.ai destacó con CyberGym. Ninguno de ellos miente. Todos ellos están tomando una decisión.
En qué confío realmente en septiembre de 2026
Preferencia por los partidos de dobles frente a los de individuales. El índice de Artificial Analysis tiene la ventaja de que lo gestiona un tercero, siguiendo un marco fijo, a través de nueve evaluaciones y sobre 190 modelos. Sus cifras absolutas no significan gran cosa; su pedidos es la señal pública más defendible que existe.
Resultados normalizados en función de los costes. Las propias afirmaciones de Anthropic sobre el Opus 5 son un buen ejemplo de cómo informar sobre esto: “a menos de 0,51 TP3T de la puntuación máxima de Fable 5 a la mitad del coste’ en CursorBench 3.2, y superando a Fable 5 en OSWorld 2.0 ”a un tercio del coste“. Se trata de una afirmación útil porque especifica la compensación.
Eficiencia de los tokens. Artificial Analysis señaló que Gemma 4 31B utilizó solo 39 millones de tokens de salida para completar todo el Índice de Inteligencia. En el caso de una carga de trabajo de tipo «agente», un modelo que llega a la misma respuesta con un tercio de los tokens supone un tercio del coste y un tercio de la latencia. Este dato no se suele destacar lo suficiente y es una de las pocas métricas que se traduce directamente en dinero.
Tus propias evaluaciones. Veinte tareas de tu lista de trabajo pendiente real, aplicadas a tres modelos y puntuadas por ti mismo. Te llevará una tarde. Te dará más información que todas las clasificaciones de este artículo juntas, y es la única evaluación que, por definición, no está sesgada.
Y hay algo en lo que no confío: cualquier cifra de tokens por segundo o de pruebas de rendimiento que se cite sin un entorno de pruebas, una cuantificación y una fecha. Tómalas como estimaciones de orden de magnitud.
Quinta parte: El número que realmente se movió — El horizonte temporal agéntico
Si solo te quedas con una cifra de este artículo, que sea esta.
METR mide la duración de la tarea —en horas humanas— que un modelo puede completar de forma autónoma con éxito según el criterio 50%. Es un indicador más adecuado para responder a la pregunta “¿puede esto hacer mi trabajo?” que cualquier prueba de referencia basada en el conocimiento, ya que capta lo que realmente falla en la práctica: no es el hecho de no saber la respuesta, sino el de mantener la coherencia el tiempo suficiente para llegar a ella.
La trayectoria, según el propio trabajo de METR y el seguimiento realizado por AI Digest:
| Período | 50%: plazo para alcanzar el éxito |
|---|---|
| 2022 (la época del lanzamiento de ChatGPT) | unos 30 segundos |
| A mediados de 2024 (clase GPT-4o) | unos 4 minutos |
| A finales de 2025 (Claude Opus 4.5) | 320 minutos (aprox. 5,3 horas), IC [170, 729] |
| 2026: la frontera | Más de 14 horas |
El tiempo de duplicación es el aspecto más controvertido. La versión 1.1 de Time Horizon de METR, publicada el 29 de enero de 2026 —con 228 tareas, 31 de las cuales se estiman en ocho o más horas de trabajo humano, migradas al marco Inspect del Instituto de Seguridad de la IA del Reino Unido— informa de que 196 días (7 meses) basándose en una combinación de datos antiguos y nuevos, pero 131 días si nos limitamos a los modelos posteriores a 2023, lo que supone unos 20% más rápido que los 165 días que arrojaba la metodología anterior.
Extrapolar una función exponencial es la forma en que la gente queda en ridículo, así que permíteme señalar bien alto las salvedades antes de utilizar la cifra.
Las salvedades son importantes. Los propios intervalos de confianza de METR son enormes: el horizonte de 320 minutos de Opus 4.5 tiene un rango de entre 170 y 729 minutos. Solo 5 de sus 31 tareas largas cuentan con valores de referencia humanos medidos; el resto son estimaciones. La composición de las tareas altera la tendencia medida. Y ’el éxito de 50% en una tarea bien especificada con un entorno limpio“ dista mucho de ”el éxito de 50% en tu código fuente con tu conjunto de pruebas poco fiable y tu proceso de implementación sin documentar“.”
Dicho todo esto,, la tendencia no ofrece dudas y la magnitud es, más o menos, la correcta. Según la extrapolación, los agentes de vanguardia alcanzarán una duración de tareas autónomas de aproximadamente un día laborable en 2027 y de aproximadamente una semana laboral en 2028.
Por qué es esta cifra la que importa
Porque Es el único indicador que permite predecir qué cambios se producirán en tu trabajo.
Un modelo con un horizonte de 4 minutos es de autocompletado. Estás al tanto de todo en todo momento, y la calidad del modelo determina la calidad de las sugerencias.
Un modelo con un horizonte de 5 horas es como un compañero al que informas por la mañana y con el que haces un repaso a la hora de comer. No estás al tanto de lo que pasa; estás al final de la cadena. La calidad del modelo determina la frecuencia con la que ese repaso resulta doloroso.
No contamos con una estructura de gestión para un modelo con un horizonte de 40 horas. Tendrías que revisar una semana de trabajo que no has visto cómo se desarrollaba, en un código que ha cambiado mientras no mirabas, comparándolo con unas especificaciones que redactaste antes de saber cuáles eran los problemas.
Todos los argumentos que se exponen en el resto de este artículo —sobre la codificación de vibraciones, sobre la verificación, sobre dónde se encuentra el cuello de botella— son, en realidad, argumentos sobre lo que ocurre a medida que esa cifra aumenta. Los modelos han adquirido una perspectiva a largo plazo. Nuestros procesos de revisión, en cambio, no.
Mostrar imagen El horizonte temporal del éxito del 50%, con los intervalos de confianza de METR mostrados con total transparencia. Los intervalos son lo suficientemente amplios como para que tengan relevancia, y la tendencia se mantiene de todos modos.
ACTO II — EL FUTURO DE LA PROGRAMACIÓN VIBE
Sexta parte: Qué significa hoy en día el “Vibe Coding”
Andrej Karpathy acuñó el término en febrero de 2025 para describir algo concreto y un poco travieso: dejarse llevar por el momento, olvidarse de que el código existe, aceptar cambios sin leerlos y dejar que el modelo lleve las riendas. Era una descripción de un modo, dijo medio en broma, para proyectos de fin de semana sin mayor importancia.
Dieciocho meses después, la expresión ha completado todo su ciclo de vida. Se convirtió en un movimiento, luego en un puesto de trabajo, después en un término peyorativo, a continuación en la «palabra del año» según Collins, más tarde en una categoría de financiación de capital riesgo y ahora —en el único acontecimiento que realmente importa— un conjunto de prácticas de ingeniería que ya no se asemejan a lo que describió Karpathy.
Quiero ser preciso en cuanto a esta distinción, porque ambas cosas se confunden constantemente y presentan perfiles de riesgo opuestos.
Codificación de vibraciones, en su sentido original. Solicitar, aceptar, ejecutar, volver a solicitar. No leas el diff. El artefacto es desechable. Esto es realmente genial, y lo hago varias veces a la semana: para un script que reformatea un CSV, un rastreador puntual, una visualización que solo voy a mirar una vez, un prototipo cuya única función es concretar una conversación. Lo que la caracteriza no es la velocidad. Es que nadie dependerá nunca de ella.
Ingeniería agencial, detección de corriente. Redacta un pliego de condiciones. Proporciona al agente un conjunto de pruebas, un linter, un comprobador de tipos y un entorno aislado. Déjalo en marcha durante una hora. Revisa el diff como es debido. Realiza la fusión siguiendo los mismos criterios que se aplican a una solicitud de incorporación de cambios (PR) realizada por una persona. La característica que lo define es que el resultado del modelo se considera como el de un compañero con menos experiencia: útil, rápido y poco fiable.
Ambos comparten la misma tecnología, pero casi nada más. Si quieres la versión para profesionales del segundo, eso es lo que mi artículo anterior sobre la codificación de vibraciones en 2026 trata; esta sección aborda hacia dónde se dirige la práctica. Los resultados catastróficos descritos en la octava parte se deben, en su totalidad, a la aplicación de las prácticas del primer modo a los retos del segundo modo.
Las cifras de adopciones son enormes y, en su mayoría, no se discuten
- 90% de desarrolladores utilizan al menos una herramienta de IA en el trabajo, según la encuesta ’AI Pulse» de JetBrains (enero de 2026). La encuesta de Stack Overflow de 2025 reveló que 84% la utilizaban o tenían previsto utilizarla.
- Casi 80% de nuevos desarrolladores en GitHub adoptar Copilot durante su primera semana (GitHub Octoverse 2025).
- El 59% de los desarrolladores utiliza tres o más herramientas de programación basadas en IA de forma simultánea. Esa estadística dice más que la cifra de adopción: el mercado no se ha consolidado, sino que se ha fragmentado en herramientas específicas para cada tarea.
Las cifras del mercado
| Herramienta | Métrica | Fuente / fecha |
|---|---|---|
| GitHub Copilot | ~42%: cuota por número de usuarios; más de 20 millones de usuarios | Gartner / proveedor, 2026 |
| Cursor | $2B+ ARR; más de 1 millón de usuarios activos diarios; entre el 20 y el 25% del mercado por ingresos | Publicado en febrero de 2026 |
| Claude Code | ~$2,5B de ritmo de ejecución; 46% “los más populares” frente a los 19% de Cursor | Publicado en abril de 2026 |
| Mercado de agentes de codificación para empresas | ~$9,8–11B anualizado | Gartner, abril de 2026 |
Hay dos aspectos que llaman la atención. Copilot cuenta con el mayor número de usuarios y el índice de satisfacción más bajo de los tres principales. Claude Code tiene la base de usuarios más reducida y, con diferencia, el mayor grado de fidelidad. Esa es la característica propia de un mercado en plena transición: el líder consolidado se ha hecho con la distribución, el competidor se ha hecho con el flujo de trabajo y los usuarios aún no han terminado de cambiarse.
Y la cifra que lo echa todo por tierra
La confianza de los desarrolladores en los resultados generados por la IA descendió de unos 40% en 2024 a 29% en 2026. Una encuesta independiente de SonarSource reveló que el 96% de los desarrolladores no confía plenamente en que el código generado por IA sea funcionalmente correcto.
Reflexiona sobre esto. El uso aumentó. La confianza disminuyó. No es que sean cosas contradictorias; así es como se caracteriza la adopción madura de una herramienta. Nadie “confía” en una motosierra. La utilizan constantemente, con ambas manos, llevando equipo de protección, y nunca le dan la espalda.
Las personas que mejor conocen estas herramientas son las que las utilizan con mayor precaución. Esa es una señal positiva, y brilla por su ausencia en la mayoría de las campañas de marketing de los proveedores.
Séptima parte: ¿De verdad te hace más rápido? Las pruebas, con toda sinceridad
Aquí es donde pierdo a algunos lectores, y prefiero perderlos aquí antes que inducirlos a error.
El ensayo aleatorizado dice que no
METR llevó a cabo el estudio al que todo el mundo hace referencia, en julio de 2025: desarrolladores experimentados de código abierto, que trabajaban en sus propios repositorios consolidados (más de un millón de líneas de código), asignados aleatoriamente a nivel de tarea para utilizar o no las herramientas de IA de principios de 2025.
Resultado: 191 TP3T más lento con la IA.
Y la conclusión que importa más que el titular: Los desarrolladores creían que habían sido unas 20% más rápidos. Sobreestimaron el efecto de la IA en su tiempo en unos 40 puntos porcentuales.
El seguimiento de 2026 no lo resolvió; más bien reveló algo peor.
METR intentó repetir el experimento y, en febrero de 2026, publicó una entrada inusualmente sincera sobre por qué falló el diseño.
- El proceso de selección no ha tenido éxito. Los desarrolladores se niegan cada vez más a trabajar sin acceso a la IA, ni siquiera por $50 la hora.
- La selección de tareas se vio viciada. Entre el 30 y el 50% de los desarrolladores admitieron que evitaban las tareas que esperaban que la IA gestionara bien. Uno de los participantes lo expresó a la perfección: “Evito temas como que la IA pueda terminar las cosas en solo 2 horas, mientras que yo tengo que dedicarle 20 horas”.”
- El registro de horas ha dejado de funcionar En su momento, los desarrolladores ejecutaban varios agentes a la vez.
Sus cifras provisionales sin procesar para 2026 oscilaban entre −18% y −4% —aunque seguían siendo más lentas, si bien de forma menos acusada—, pero la propia METR lo describe como “una evidencia muy débil” debido al sesgo de selección.
Vuelve a leer el segundo punto, porque es el hallazgo más interesante de toda la bibliografía y está escondido en una nota metodológica. Si los desarrolladores asignan sistemáticamente las tareas aptas para la IA lejos Según un estudio que evalúa los beneficios de la IA, dicho estudio subestimará dichos beneficios. Además, da a entender que, en la práctica, los desarrolladores ya se encargan de la asignación de rutas, que es precisamente el comportamiento que hace que estas herramientas sean valiosas y que dificulta la realización de ensayos controlados aleatorios (ECA).
Las encuestas dicen que sí, por un amplio margen, y están infladas
La encuesta de METR de mayo de 2026 (n = 349: 87 ingenieros de software, 71 investigadores, 129 docentes universitarios y doctorandos, 48 fundadores y directivos; con una media de 12 años de experiencia en programación y 19 meses de uso de herramientas de IA) hizo algo ingenioso. Separó valor de velocidad.
El encuestado mediano indicó un Multiplicador de velocidad ×3 pero solo un Un aumento de entre 1,4 y 2 veces en el valor de su trabajo. En retrospectiva, estimaron un valor de 1,3 veces en marzo de 2025; prevén que alcance 2,5 veces para marzo de 2027.
METR deja claro que el valor es la cifra que realmente importa a los diseñadores de encuestas, y que los encuestados piensan, de forma natural, en términos de velocidad —que es precisamente el sesgo que el ensayo controlado aleatorio (ECA) de 2025 cuantificó en 40 puntos porcentuales—.
Así pues: según los datos autoinformados, el valor es de 3×. Según los datos autoinformados corregidos para reflejar lo que la gente realmente quiere decir, el valor oscila entre 1,4 y 2×. La única medición controlada de la que disponemos indica un valor de 0,81×.
Los datos de la organización indican que “depende de ti, no de la herramienta”
El informe de DORA de 2026 (Google Cloud, mayo de 2026) es lo más útil que se ha publicado sobre este tema en todo el año, y resulta útil porque deja de centrarse en la herramienta.
- Rentabilidad de la inversión (ROI) estimada para el primer año de 39% para una empresa de ingeniería de 500 personas, con aproximadamente un Amortización en 8 meses — Un valor de $11,6M frente a una inversión de $8,4M.
- A Curva en J: la productividad desciende antes de volver a aumentar, debido a la adaptación de los flujos de trabajo, al coste de la verificación de la revisión del código y a los cambios posteriores en las fases de pruebas y aprobación.
- La tasa de fallos en los cambios ha aumentado de 5% a 6% tras la adopción, con un coste de $344 000 en tiempo de inactividad según su ejemplo de cálculo.
- Y la tesis: “Los mayores beneficios de la inversión en IA no provienen de las herramientas en sí mismas, sino de un enfoque estratégico centrado en el sistema organizativo subyacente”.”
Esa última frase es el consenso para 2026, si es que hay alguno. La IA potencia cualquier práctica de ingeniería que ya tengas. Buenas pruebas, revisiones de código reales, reversiones rápidas, responsabilidades claras: la IA hace que esas organizaciones sean significativamente más rápidas. Pruebas deficientes, revisiones de mero trámite, implementaciones manuales, responsabilidades poco claras: la IA hace que esas organizaciones fracasen más rápido y en mayor número.
¿Cómo conciliar todo esto?
No creo que estos resultados sean realmente contradictorios. Esta es la interpretación a la que he llegado, aunque la mantengo sin demasiado convencimiento:
Las herramientas de programación basadas en IA suponen una gran ventaja en tareas con las que no estamos familiarizados y una pequeña desventaja en aquellas que conocemos a la perfección. En un código que conoces a la perfección, en un lenguaje que dominas, ante un problema que ya has resuelto antes, eres más rápido que el ciclo de revisión y corrección. En un marco de trabajo desconocido, un lenguaje que utilizas dos veces al año, código repetitivo, estructuras de pruebas, migraciones o un código fuente que no has abierto en ocho meses, el modelo resulta transformador.
METR estudió a desarrolladores con experiencia en sus propios repositorios maduros —el único escenario en el que cabría esperar la menor mejora—. Eso no significa que el resultado sea erróneo. Lo que significa es que es específico, y debería hacerte desconfiar de cualquiera que lo cite como un veredicto general, en cualquier sentido.
La segunda reconciliación: los beneficios son reales, pero se producen en un lugar distinto al que la gente espera. No es que “esta función llevó cuatro horas en lugar de seis”. Más bien: se completó la migración a la que nunca se iba a dar prioridad; la cobertura de pruebas, que siempre iba a quedarse en 40%, pasó a 75%; la documentación ya existe. Esos aspectos no aparecen en un estudio sobre el tiempo de finalización de las tareas, y son la mayor parte del valor real.
Octava parte: Ya ha llegado el proyecto de ley de seguridad, y está desglosado
Si la séptima parte resultaba incómoda, esta es la que la gente suele saltarse. Por favor, no te la saltes.
Las medidas
Veracode Se han evaluado más de 100 modelos de lenguaje a gran escala en 80 tareas de programación en Java, Python, C# y JavaScript:
- 45% de ejemplos de código generados por IA presentan una vulnerabilidad incluida en la lista «OWASP Top 10». La tasa de aprobados se mantuvo prácticamente sin cambios hasta principios de 2026: los modelos se volvieron mucho más inteligentes, pero no más seguros.
- Java fue el que obtuvo peores resultados, con una tasa de fallos de 721 TP3T.
- 86% no superó la prueba de defensa contra scripts entre sitios. 88% eran vulnerables a la inyección de registros.
Apiiro aplicó su motor de análisis profundo de código a los repositorios de empresas de la lista Fortune 50 entre diciembre de 2024 y junio de 2025:
- Los desarrolladores que utilizan la inteligencia artificial generan commits a de tres a cuatro veces la tasa de sus compañeros.
- Presentan los resultados de la evaluación de seguridad en diez veces la tasa.
- Las vías de escalada de privilegios aumentaron en 322%. Los fallos de diseño arquitectónico aumentaron en 153%.
USENIX Security 2025 analizó 576 000 ejemplos de código generados por IA:
- Aproximadamente 20% paquetes de referencia que no existen.
- Los 43% de nombres de paquetes imaginarios se reproducen de forma sistemática en indicaciones similares — que es la parte que convierte un error en una superficie de ataque. Una «alucinación predecible» es una ranura que un atacante puede registrar previamente en npm o PyPI.
El radar de seguridad «Vibe» de Georgia Tech rastreó los CVE a través del historial de Git para atribuirles su origen a herramientas de IA:
| Mes (2026) | Vulnerabilidades CVE atribuidas |
|---|---|
| Enero | 6 |
| Febrero | 15 |
| marzo | 35 |
Se han confirmado 74 en total, y los investigadores estiman que la cifra real en todo el ámbito del código abierto es de entre cinco y diez veces mayor.
RedAccess indexado de forma aproximada 380 000 aplicaciones codificadas por «vibe» de acceso público en Lovable, Base44, Replit y Netlify. Unas 5.000 de ellas filtraban datos confidenciales, tanto corporativos como personales.
Los incidentes, que tuvieron lugar el
| Fecha | Incidente |
|---|---|
| Julio de 2025 | Replit AI borra una base de datos de producción; 1.200 registros de ejecutivos se ven afectados y se generan 4.000 cuentas ficticias |
| Febrero de 2026 | Una aplicación de tecnología educativa desarrollada por Lovable ha filtrado 18 697 registros de usuarios, entre los que se incluyen 4 538 cuentas de estudiantes. |
| Abril de 2026 | La encantadora vulnerabilidad de BOLA: se puede acceder a todos los proyectos anteriores a noviembre de 2025 mediante cinco llamadas a la API |
| 26 de abril de 2026 | “Borrado en 9 segundos” por un error del cursor: se borró la base de datos de una empresa junto con sus copias de seguridad |
| 30 de abril de 2026 | Gemini CLI: vulnerabilidad CVSS-10 de ejecución remota de código en flujos de trabajo de CI, ya corregida |
El caso de Amazon, que voy a tratar con mucho cuidado
Seguro que ya habrás visto la noticia sobre Amazon. Cuatro incidentes de nivel Sev-1 entre diciembre de 2025 y marzo de 2026: una interrupción del servicio de AWS Cost Explorer de 13 horas en China; plazos de entrega incorrectos en los carritos de la compra el 2 de marzo, que, según se informó, supusieron la pérdida de unas 120 000 pedidos, y un incidente de 6 horas el 5 de marzo en el que, según se informa, los pedidos en Norteamérica se redujeron en un 99%.
Según informaciones publicadas por el Financial Times, Fortune y The Register, unos documentos internos de Amazon se relacionaron con lo que se describió como “cambios asistidos por IA generativa”, y se advirtió de que la generación rápida de código estaba dejando al descubierto vulnerabilidades. Amazon ha negado que exista una relación de causalidad directa y ha señalado en algunas respuestas que en ninguno de los incidentes se utilizó código escrito por IA.
Voy a destacar tres aspectos de esta historia, en lugar de repetirla como si fuera un hecho:
- La cifra sobre el impacto más citada (6,3 millones de pedidos perdidos) procede de una publicación en Medium, no de Amazon ni de un reportaje propio de ningún medio concreto. Considérala una estimación, no una cifra concreta.
- Según se ha informado, el despliegue del 5 de marzo se llevó a cabo sin documentación ni autorización oficial. Eso es un fallo del proceso. La velocidad de la IA hizo que posible para que se hiciera más rápido; no convirtió la fase de aprobación en algo opcional.
- Esa distinción es precisamente la clave, y es la razón por la que incluyo la historia. El motivo del fallo casi nunca es que “la IA haya escrito un código defectuoso”. Es que “la IA ha escrito el código más rápido de lo que tardaba el proceso que se suponía que debía revisarlo”.”
Qué implica esto realmente en la práctica
No se trata de “dejar de utilizar las herramientas”. Nadie sensato defiende eso, y la propia nota de investigación de la CSA —que recoge la mayor parte de lo anterior— se centra en la gobernanza más que en la abstinencia.
La forma práctica, tal y como yo la pondría en práctica:
- Considera cualquier herramienta de IA con acceso a credenciales como un sistema con privilegios. Es uno. Analiza sus tokens en consecuencia.
- SAST, análisis de dependencias y detección de datos confidenciales en cada confirmación. No cada noche. Con cada confirmación. La frecuencia de las confirmaciones se ha multiplicado por tres o por cuatro; en la práctica, un análisis nocturno equivale ahora a un ciclo de retroalimentación de tres días.
- Análisis de la composición del software, concretamente de los paquetes «alucinados». Este es el control más barato y con mejor relación calidad-precio de la lista, ya que la cifra del 20% es muy elevada y el fallo pasa totalmente desapercibido.
- Una política por escrito que establezca que no se utilizará asistencia de IA sin revisión previa en materia de autenticación, criptografía, autorización o código de pago. Estas son las cuatro áreas en las que es probable que se produzca un error sutil, que además puede tener consecuencias catastróficas, y en las que la atención del revisor resulta más valiosa.
- Amplía tu SBOM para registrar la procedencia de las herramientas de IA. Cuando el próximo estudio de atribución al estilo de Georgia Tech llegue a tu código fuente, querrás poder responder a esa pregunta por ti mismo.
- Considera las plataformas de codificación de vibraciones de terceros como proveedores de SaaS. Las cifras de RedAccess reflejan lo que ocurre cuando nadie hace nada.
Nada de eso tiene nada de extraordinario. La mayor parte es lo que hacía cualquier taller competente en 2019. El cambio radica en que el volumen se ha multiplicado por diez, por lo que los controles deben ser automáticos en lugar de basarse en la cultura empresarial.
Mostrar imagen Los datos de seguridad proceden de Veracode, Apiiro, USENIX y Georgia Tech. Fíjate en la tendencia: la velocidad de las confirmaciones se multiplicó por 3 o 4, mientras que los hallazgos de seguridad se multiplicaron por 10. La diferencia entre esos dos multiplicadores es el quid de la cuestión.
Nona parte: ¿Qué sustituyó a la codificación Vibe?
La práctica que realmente funciona en 2026 tiene un nombre —varios nombres que compiten entre sí, lo que demuestra que es real— y es, más o menos, lo contrario de las «vibes».
Llámalo desarrollo basado en especificaciones, ingeniería de agenteso ingeniería de contexto. La estructura habitual:
1. La especificación es ahora el código fuente
No es un ticket de Jira. Es un documento en toda regla: qué hace, qué no debe hacer, cuáles son las interfaces, cómo se define “terminado” y cuáles son los modos de fallo. Incorporado al repositorio, con control de versiones y revisado.
Esto parece un retroceso a 1998, pero no lo es. La diferencia es que, en 1998, la especificación era un dato de entrada para una persona que la reinterpretaba, y perdía su vigencia en cuanto se empezaba a programar. En 2026, la especificación es la base de un proceso que regenera la implementación de forma económica, lo que significa que, cuando cambian los requisitos, se modifica la especificación y se vuelve a derivar, en lugar de aplicar parches a un código que ya no se corresponde con ninguna descripción escrita del mismo.
La situación económica dio un giro radical. Cuando la implementación era cara y la especificación, barata, se definía de forma imprecisa y se invertía en el código. Cuando la implementación es barata y la especificación es el cuello de botella, se invierte en la especificación.
2. El conjunto de pruebas constituye el límite de confianza
Un agente capaz de ejecutar tus pruebas y realizar iteraciones con ellas es una herramienta fundamentalmente diferente de una que no puede hacerlo. Este es el cambio con mayor impacto que la mayoría de los equipos pueden llevar a cabo, y no tiene nada que ver con la IA: se trata de que la IA ha conseguido por fin que el retorno de la inversión en cobertura de pruebas resulte obvio para personas a las que nunca se habría podido convencer con argumentos técnicos.
Versión práctica: El agente dispone de un entorno de pruebas, un comando de prueba, un comando de lint y una comprobación de tipos, y no se da por finalizado hasta que los cuatro estén en verde. Todo lo demás es negociable.
3. La revisión pasó de las líneas a las diferencias y, finalmente, al comportamiento
La revisión línea por línea no es viable cuando se trata de un diff de mil líneas generado por un agente, y fingir lo contrario es lo que da pie a que se aprueben las cosas sin más.
Lo que sí funciona, por orden aproximado de importancia:
- Revisa las especificaciones, no la implementación. Si las especificaciones son correctas y las pruebas salen bien, la implementación es un detalle.
- Comprueba la forma del diferencial — qué archivos se han modificado, qué dependencias se han añadido y qué se ha eliminado. La mayoría de los fallos graves de los agentes se detectan a este nivel: un archivo inesperado, una nueva dependencia, una eliminación que nadie había solicitado.
- Revisa específicamente las líneas que afecten a la seguridad. Autenticación, criptomonedas, autorización, pagos, cualquier cosa relacionada con la información de carácter personal. Esto no es más que una pequeña parte de cualquier comparación.
- No revises el texto estándar. De todos modos, en realidad nunca lo estabas valorando.
4. El arnés es tan importante como el modelo
Esto no se valora lo suficiente. El mismo modelo, en dos bucles de agentes distintos, produce resultados de una calidad tremendamente diferente, y esa es precisamente la razón por la que las comparaciones de rendimiento entre laboratorios son tan engañosas.
Los aspectos que importan: cómo se gestiona el contexto a medida que la ejecución se alarga, si el agente puede ver sus propios fallos en las pruebas, si puede explorar el repositorio o solo lo que se le pegue, si cuenta con una fase de planificación separada de la de ejecución, y si sabe cuándo detenerse y solicitar información.
Las notas de la versión 1.3 de Muse Spark de Meta resultan interesantes precisamente en este aspecto: describen que el modelo ahora formula preguntas aclaratorias ante indicaciones ambiguas, solicita ayuda cuando se queda atascado y confirma antes de llevar a cabo acciones con consecuencias importantes. Eso no son mejoras en la inteligencia. Son cuestiones de modales., y son los modales los que permiten que un agente con una perspectiva a largo plazo pueda sobrevivir.
5. El enrutamiento por modelos es ahora una práctica habitual
Nadie que se tome en serio su trabajo utiliza un único modelo para todo; he explicado una versión con dos modelos de esto en GLM-5.3-Flash frente a MiniMax M3 en OpenCode. El patrón que se ha establecido:
json
{
"$schema": "https://opencode.ai/config.json",
"model": "anthropic/claude-opus-5",
"small_model": "ollama/qwen3.8:27b",
"agent": {
"plan": {
"description": "Arquitectura, causa raíz, cualquier cosa en la que equivocarse resulte costoso",
"model": "anthropic/claude-fable-5-1"
},
"build": {
"description": "La mayor parte de la implementación: a largo plazo y sensible al coste",
"model": "anthropic/claude-opus-5"
},
"bulk": {
"description": "Trabajo mecánico de gran volumen en el que predomina el precio",
"model": "zai/glm-5-3-flash"
},
"private": {
"description": "Todo lo relacionado con los datos de los clientes: se ejecuta en nuestro propio hardware",
"model": "mlx/gpt-oss-120b"
},
"grunt": {
"description": "Renombramientos, cadenas de documentación, correcciones de lint y estructura de pruebas",
"model": "ollama/gemma-4-26b-a4b"
}
}
}
El razonamiento, línea por línea:
- A la hora de planificar, opta por el modelo más performante que te puedas permitir. Un mal plan cuesta más tokens a largo plazo de lo que costó el plan en sí.
- La inversión se destina al mejor modelo a largo plazo a un precio razonable. El Opus 5, con una relación de $5/$25, está diseñado expresamente para esto y cuesta la mitad que el Fable.
- El trabajo mecánico a gran escala se asigna a GLM-5.3-Flash en $0.15/$0.47, porque a ese precio la cuestión no es si es igual de bueno, sino si es lo suficientemente bueno para esa tarea concreta. A menudo lo es.
- Todo lo privado se queda en casa, en un modelo que se adapte a tu máquina.
- El trabajo pesado recae en una pequeña agencia local, porque cambiar el nombre de un símbolo en cuarenta archivos no requiere un razonamiento complejo ni hace falta salir de tu ordenador portátil.
Anota los ID de los modelos de tal forma que cambiar uno de ellos solo suponga modificar una línea. Teniendo en cuenta que cuatro laboratorios lanzaron al mercado un modelo que se situó entre los diez primeros entre junio y septiembre, tendrás que volver a realizar ese cambio antes de que termine el trimestre.
Décima parte: El futuro de la programación intuitiva: seis predicciones, con un toque de confianza
Las predicciones sin niveles de confianza son solo entretenimiento. Estas son las mías, con la cantidad que apostaría.
1. La palabra muere; la práctica se divide para siempre. Alta confianza.
“El ”vibe coding» ya se está convirtiendo en un término despectivo en los entornos profesionales y en un motivo de orgullo solo en el ámbito del marketing. Lo que lo sustituye es una clara división en dos niveles: artefactos desechables generados por IA cuyo código nadie lee (está bien, es correcto, hay que hacer más de eso), y la ingeniería agentiva revisada, en la que el resultado del modelo pasa por los mismos filtros que el de un ser humano (también está bien, y es ahí donde se invierte todo el dinero de las empresas).
Esa zona intermedia peligrosa —el código de producción, sin revisar— es de lo que está compuesta la lista de incidentes de 2026, y acabará desapareciendo en los contextos comerciales debido a la regulación, los seguros o las auditorías. No porque nadie lo prohíba, sino porque, tarde o temprano, algún cuestionario de seguridad lo preguntará.
2. La verificación se convierte en el cuello de botella, y la inversión en herramientas se orienta hacia ella. Alta confianza.
Ya hemos llegado a ese punto y el mercado aún no se ha reajustado. Si los agentes pueden generar una semana de trabajo, la limitación radica en la capacidad humana para determinar si esa semana de trabajo es correcta.
Es de esperar que los productos más interesantes de 2027 tengan que ver con comprobación en lugar de generar: generación de pruebas basadas en propiedades, herramientas de comparación semántica que describen los cambios de comportamiento en lugar de los cambios en el código, comprobación automatizada del cumplimiento de las especificaciones, verificación en tiempo de ejecución de las acciones de los agentes y —esto es lo que yo desarrollaría— herramientas que te indican qué parte de un archivo «diff» extenso es la que realmente necesita leer una persona.
3. Los métodos formales tienen su momento de gloria, con veinte años de retraso. Confianza media.
La objeción histórica a la especificación formal era que redactar la especificación costaba más que escribir el código. Esa objeción ya no tiene sentido, porque escribir código es prácticamente gratis y, de todos modos, redactar las especificaciones es lo que frena el proceso.
Los sistemas de tipos, los contratos, los invariantes, las pruebas de propiedades y la verificación formal ligera tienen, de repente, un caso de uso que se amortiza por sí solo: son declaraciones de intenciones verificables por máquina con las que un agente puede iterar sin necesidad de intervención humana. Es de esperar que Rust, los modos más estrictos de TypeScript y las bibliotecas de contratos en Python sean los que más se beneficien de ello.
La razón por la que mi confianza es solo moderada es que, desde 1985, en este ámbito se ha vaticinado un renacimiento de los métodos formales aproximadamente cada siete años.
4. Los modelos locales se encargan por completo del nivel de trabajo pesado. Confianza media-alta.
Fíjate en lo que hace ahora un modelo 27B con Apache 2.0, añádele un año más y ponlo en una máquina con 64 GB de memoria unificada. Cambios de nombre, cadenas de documentación, estructura de pruebas, mensajes de commit, correcciones de lint, primeros borradores de traducciones, análisis de registros… Nada de eso requiere un modelo de vanguardia; todo ello supone un gran volumen de trabajo y es precisamente el tipo de tareas que preferirías no enviar a un tercero desde el repositorio de un cliente.
La frontera se mantiene en la nube en lo que respecta a la planificación y el razonamiento riguroso. El volumen se traslada al ámbito local. A partir de la parte once se explica por qué eso es ahora físicamente posible.
5. El puesto de desarrollador junior cambia de forma, en lugar de desaparecer. Confianza media, y esta es la que me parece más flexible.
El escenario pesimista es sencillo: si los agentes realizan el trabajo que antes hacían los jóvenes, nadie contrata a jóvenes y, dentro de diez años, no habrá veteranos.
Creo que lo más probable es que el trabajo de nivel inicial pase de “escribir el código” a “verificar el código y hacerse responsable de las especificaciones”, lo cual es un trabajo más difícil para empezar, no más fácil, y que va a exigir que el sector replantee la forma en que forma a sus profesionales. Los equipos que se den cuenta de esto tendrán una enorme ventaja a la hora de contratar personal frente a los equipos que simplemente dejen de contratar.
Una advertencia sincera: esta es la predicción en la que mis motivaciones y mi análisis apuntan en la misma dirección, que es precisamente el momento en el que hay que desconfiar de uno mismo.
6. A alguien le ocurre un fallo de programación de IA verdaderamente catastrófico, del que se le atribuye públicamente la responsabilidad. Tengo mucha confianza en el evento, pero poca en el momento en que se celebrará.
No se trata de una filtración de una base de datos. Es algo relacionado con un organismo regulador, con un impacto financiero de nueve cifras y un análisis de las causas fundamentales que indica que un agente hizo algo que ningún humano revisó.
La curva de atribución de CVE —6, luego 15 y después 35 en meses consecutivos de 2026, aunque los investigadores estiman que la tasa real es entre cinco y diez veces mayor— no es una curva que se aplane por sí sola. La cuestión es si el sector reforzará primero sus propias medidas de seguridad o esperará a que se produzca un incidente que le obligue a hacerlo.
Lo que haría con los seis, en una sola frase: invierte en pruebas, especificaciones y herramientas de revisión, en lugar de en la técnica de las indicaciones, porque esta última pierde valor cada vez que se lanza un modelo, mientras que la infraestructura de verificación se refuerza.
Mostrar imagen Ambas prácticas comparten la tecnología y nada más. El bucle de la izquierda es adecuado para trabajos puntuales, pero catastrófico para la producción; el bucle de la derecha es lo que faltaba en la lista de incidentes de la octava parte.
ACTO III — IA SIN CONEXIÓN EN DISPOSITIVOS DE CONSUMO
Parte XI: La IA sin conexión dejó de ser un pasatiempo este año
Durante unos dos años, “ejecutarlo localmente” fue una solución de compromiso basada en principios. Era posible hacerlo. El argumento sincero era: Aquí hay un modelo de 7.000 millones de parámetros que es peor que el nivel gratuito de cualquier servicio, en el hardware que ya tienes, y la razón para hacerlo es una cuestión de principios.
Eso cambió en 2026, y el cambio se debió a tres razones distintas que se dieron al mismo tiempo.
Los modelos pequeños han mejorado mucho. El modelo E4B de Gemma 4 cuenta con aproximadamente 8.000 millones de parámetros, admite 128 K de contexto, procesa texto, imágenes, vídeo y audio nativo, y está bajo licencia Apache 2.0. La variante densa de 31 mil millones obtiene una puntuación de 39 en el índice Artificial Analysis —dentro del rango que se consideraba puntero hace dieciocho meses— y completó toda la ejecución del índice con 39 millones de tokens de salida, lo que supone una fracción de lo que consumen modelos comparables. Qwen3.8-27B es un modelo multimodal denso bajo licencia Apache 2.0 con 262 000 de contexto nativo que, según Alibaba, supera al Qwen3.7-Plus —mucho más grande— en tareas de programación y ofimática.
Los sistemas operativos lo incluían de serie. Este es el cambio que realmente importa y se ha producido de forma discreta. Microsoft ha incorporado Aion 1.0 a Windows 11. Apple incluye en los iPhone un modelo denso de 3.000 millones de parámetros y un modelo disperso de 20.000 millones de parámetros. Google incorpora Gemini Nano en los dispositivos Pixel y Samsung. La IA integrada en los dispositivos dejó de ser algo que se instala y pasó a ser algo que ya está ahí, que es la diferencia entre una tecnología que utilizan los aficionados a la tecnología y una tecnología que utiliza todo el mundo.
Y, por fin, el hardware ya cuenta con la memoria. No es la potencia de cálculo, sino la memoria. Más adelante explicaré por qué esa distinción lo dice todo.
Qué te aporta realmente la “IA sin conexión”
Voy a ser más concreto, porque esto se explica muy mal.
Latencia. Un modelo 4B local responde en decenas de milisegundos. Una ida y vuelta a la nube tarda, en el mejor de los casos, cientos de milisegundos. Para cualquier tarea interactiva y continua —dictado, traducción en directo, autocompletado, resumen mientras se escribe—, la opción local gana en sensación, no en calidad, y la sensación es lo que la gente percibe.
Una privacidad que se basa en la arquitectura, más que en un contrato. Con una API, cada solicitud sale de tu infraestructura y necesitas un acuerdo de procesamiento, una evaluación del impacto de la transferencia, un mapa de flujo de datos y una respuesta para tu responsable de protección de datos. Con un modelo que se ejecuta en el dispositivo, La cuestión de la transferencia transfronteriza no se plantea, ya que no hay transferencia alguna. En el ámbito laboral alemán y de la UE, este suele ser el único argumento, y es lo que permite cerrar acuerdos que el precio por sí solo nunca lograría.
Disponibilidad. En un avión. En un lugar sin cobertura. En unas instalaciones donde el acceso a la red está prohibido. Durante una avería de tu operador.
Previsibilidad de los costes. No supone un ahorro de costes: haré esos cálculos en la parte quince y el resultado no es el que la gente espera. Pero un coste fijo de hardware con un coste marginal nulo por token supone una línea presupuestaria muy diferente a una factura basada en el uso que varía en función del entusiasmo del agente.
Fijación de versiones. En un modelo de API cerrada, las actualizaciones se realizan bajo un identificador de modelo estable y el comportamiento se va desviando. Un punto de control local sigue siendo idéntico, byte a byte, al cabo de un año. Si alguna vez te ha pasado que una indicación que funcionaba ha dejado de hacerlo sin previo aviso, ya sabes lo valioso que es eso.
Y lo que no te aporta
Capacidad de exploración. La diferencia entre un modelo 4B en tu móvil y el Claude Fable 5.1 no es pequeña y no va a desaparecer. Cualquiera que te diga lo contrario te está intentando vender algo.
Velocidad en modelos de gran tamaño. Un modelo 400B local genera tokens más lentamente que el mismo modelo en la API de un proveedor, ya que este último lo ejecuta en un hardware con un ancho de banda de memoria entre cuatro y seis veces superior al tuyo. A cambio de control, se sacrifica el rendimiento.
Duodécima parte: El móvil que llevas en el bolsillo
La característica que lo decide todo es la memoria RAM
Todas las plataformas importantes han establecido ya un límite de memoria, y ese límite es de 12 GB.
| Plataforma | Modelo integrado en el dispositivo | Puerta de memoria |
|---|---|---|
| Manzana | AFM 3 Core (3 mil millones denso) + AFM 3 Core Advanced (20 mil millones disperso, 1–4 mil millones activo) | 12 GB para dos funciones de iOS 27 |
| Gemini Nano v3 (solo para Pixel 10); Nano v2 para Pixel 9 y modelos anteriores; Nano v4 próximamente | 12 GB mínimo para Gemini Intelligence | |
| Qualcomm / Samsung | Snapdragon 8 Elite Gen 5 para Galaxy — CPU Oryon de tercera generación, NPU Hexagon, +39% Capacidad de la NPU | Depende del dispositivo |
La solución de Apple es la más interesante desde el punto de vista técnico. AFM 3 Core Advanced es un modelo disperso de 20.000 millones de parámetros que se aloja en un almacenamiento flash. Los expertos compartidos permanecen en la memoria; los expertos enrutados se cargan en la DRAM solo cuando se solicita su uso. Así es como se consigue integrar un modelo de 20 mil millones en un teléfono: se cambia el ancho de banda de lectura de la NAND por capacidad de la DRAM.
Pero para intercambiar los «experts» en la DRAM sigue siendo necesario disponer de un lugar donde hacerlo. en, además del sistema operativo, la aplicación en ejecución y el proceso de la cámara. La diferencia entre 9 GB y 12 GB no se debe a una segmentación del mercado de tres gigabytes. Se trata del conjunto de trabajo para el intercambio avanzado en situaciones de verdadera presión de memoria. Ming-Chi Kuo informa de que hay dos funciones de iOS 27 que requieren 12 GB: la expresividad de la voz de Siri y la personalización del ritmo, así como una mejora sustancial en la precisión de la conversión de voz a texto. El iPhone 18 básico, cuyo lanzamiento se ha retrasado hasta la primavera de 2027 y que, según se informa, contará con 9 GB, no alcanza el nivel exigido.
Google se enfrenta a la misma situación y a un problema de relaciones públicas aún mayor. Gemini Intelligence necesita Nano v3, pero Nano v3 solo está disponible actualmente en el Pixel 10 y en los dispositivos Pixel 9 —que se comercializan bajo una promesa de actualización cada siete años — utilizan Nano v2. La promesa se refería a las actualizaciones. Nunca se trató de las funcionalidades, y la distinción que tenía sentido para un gestor de producto en 2023 no tiene ningún sentido para un cliente en 2026.
Esta será, sin duda, la tendencia en IA para el consumidor de los próximos dos años: una promesa de soporte a largo plazo que proporciona parches de seguridad a un dispositivo que no puede ejecutar las funciones con las que se distribuyen dichos parches.
Lo que un teléfono es capaz de hacer realmente, medido
Pruebas de rendimiento independientes realizadas en un iPhone 17 Pro (A19 Pro) en cuatro escenarios de uso:
| Modelo | Duración | Decodificación (tok/s) | Memoria máxima |
|---|---|---|---|
| Gemma 4 E2B (4 bits) | LiteRT-LM | 55.4 | 641 MB |
| Gemma 4 E2B (4 bits) | MLX | 47.5 | 2.900 MB |
| Gemma 4 E2B (4 bits) | llama.cpp | 37.8 | 3.156 MB |
| Gemma 4 E2B (4 bits) | CoreML / ANE | 33.4 | 1.187 MB |
| Qwen 3.5 2B (4 bits) | MLX | 61.2 | 1.279 MB |
| Qwen 3.5 2B (4 bits) | llama.cpp | 39.1 | 1.479 MB |
| Qwen 3.5 2B (4 bits) | CoreML / ANE | 27.9 | 241 MB |
Hay dos conclusiones que llaman la atención.
El Neural Engine es la ruta más lenta y, con diferencia, la que menos memoria consume. 27,9 tok/s con 241 MB frente a los 61,2 tok/s de MLX con 1.279 MB: cinco veces más velocidad a cambio de cinco veces más memoria. Esa relación es precisamente la razón por la que Apple utiliza ANE para las funciones del sistema que están siempre activas y por la que las aplicaciones de terceros lo descartan para el chat interactivo.
Sesenta tokens por segundo en un modelo 2B que llevas en el bolsillo es más rápido de lo que la mayoría de la gente tarda en leer. Lo que significa que la limitación de la IA local en el móvil no es la velocidad. Es la capacidad; la capacidad depende de los parámetros; los parámetros dependen de la memoria… y la memoria es precisamente lo que todos los fabricantes acaban de restringir.
Parte XIII: El ordenador personal y la apuesta discreta de Microsoft
Microsoft hizo algo en la Build 2026, el 2 de junio, que creo que, en retrospectiva, cobrará más importancia de la que tuvo en su momento: incorporó modelos directamente en el propio Windows.
Guía de Aion 1.0 Es un pequeño modelo de lenguaje para la síntesis, la reescritura y la extracción. Requiere una CPU moderna y Windows 11; no necesita NPU ni GPU discreta. Ya está disponible en Edge Canary a partir de la compilación 150.0.4070, y los desarrolladores web pueden acceder a él a través de las API Prompt, Summarizer, Writer y Rewriter; además, sus pesos abiertos se publicaron en Hugging Face en julio de 2026.
Plan de Aion 1.0 es el más interesante: un Modelo de razonamiento y llamada a herramientas con 14 000 millones de parámetros y una ventana de contexto de 32K, diseñada para flujos de trabajo basados en agentes, gestión de archivos y coordinación de subagentes. “En los próximos meses”, en el momento de redactar este artículo.
El eslogan que utilizó Microsoft fue “inteligencia ilimitada para cada hogar y cada escritorio”. Dejando a un lado el marketing, analicemos la decisión arquitectónica: una API de JavaScript en el navegador que accede a un modelo local, sin clave, sin factura y sin conexión a la red. Si eso se convierte en la norma, una enorme categoría de pequeñas funciones de IA dejará de ser un producto SaaS para pasar a ser una capacidad de la plataforma. Eso tiene mucha más relevancia para la economía del sector de la IA que cualquier lanzamiento de un modelo concreto este año.
La planta de hardware existe de verdad y en ella no hay muchas máquinas.
La ruta NPU requiere un PC con Copilot+ que cuente con un un mínimo de 40 NPU de TOPS:
| Silicio | NPU | ¿Cumple los requisitos? |
|---|---|---|
| Qualcomm Snapdragon X Elite | 45 CAMISETAS | ✅ |
| Intel Lunar Lake | 45–48 CAMISETAS | ✅ |
| AMD Ryzen AI 300 / Max+ 395 | 50 LO MEJOR | ✅ hardware; software “coming later” |
| Intel Meteor Lake | ~10-11 COMBINAS | ❌ |
Y esta es la cifra que debería replantearnos nuestras expectativas: En una NPU de 45 TOPS, un modelo de 8B genera aproximadamente 5 tokens por segundo. El modelo del Plan 14B será más lento.
Cinco tokens por segundo no es una experiencia de chat. Está bien para un resumen en segundo plano, una reescritura, una clasificación o una extracción —es decir, las tareas para las que realmente está pensado Aion 1.0 Instruct—. Pero no sirve para nada que se vea en directo.
¿Por qué va tan lento en 45 TOPS? Porque la generación de tokens está limitada por el ancho de banda de la memoria, no por la potencia de cálculo bruta. La NPU puede realizar las multiplicaciones matriciales; el problema radica en transferir los pesos desde la memoria del sistema para cada uno de los tokens. Este es el mismo obstáculo al que se enfrentan todos los dispositivos mencionados en este artículo, y es por eso que el “TOPS” es una cifra prácticamente inútil a la hora de comprar.
Las cajas de sobremesa
Si quieres un equipo específico para la inferencia local, la gama de 128 GB se ha reducido a dos opciones y un caso atípico:
| NVIDIA DGX Spark | AMD Ryzen AI Max+ 395 (Strix Halo) | Mac Studio M5 Ultra | |
|---|---|---|---|
| Memoria | 128 GB unificados | 128 GB LPDDR5X-8000 | hasta 512 GB unificado |
| Ancho de banda | ~273 GB/s | ~256 GB/s | 1,2 TB/s |
| Precio | ~$3,999 | $2,300–$2,500 | desde $5.499 |
| Notas | Ecosistema CUDA | CPU potente (1,6 TFLOPS en Linpack frente a los 708 GFLOPS de Spark) | Versión de 512 GB, a finales de octubre; precio aún por determinar |
Esos precios y las cifras de Spark y Strix Halo proceden de pruebas publicadas a finales de diciembre de 2025, por lo que deben considerarse orientativos y no actuales, ya que los precios de la memoria han variado desde entonces. El DGX Spark y el Strix Halo están mucho más igualados en cuanto a generación de tokens de lo que sugieren sus cifras de rendimiento computacional, ya que ambos se sitúan en torno a los 256-273 GB/s de ancho de banda, y esa es la limitación determinante. El Spark gana de forma contundente en generación de imágenes (aprox. 120 TFLOPS frente a aprox. 46 en FLUX.1 Dev BF16) y en compatibilidad con CUDA. El Strix Halo gana en precio y en CPU.
El Mac Studio M5 Ultra se sitúa en una categoría totalmente diferente tanto en cuanto a memoria como a ancho de banda, y ya lo comenté en profundidad en el componente de hardware de IA local. En resumen: un sistema de 512 GB a 1,2 TB/s es el único equipo convencional capaz de albergar en memoria un modelo de clase 400B, y el precio de ese privilegio ronda entre $16 000 y $20 000, una vez configurado.
Los modelos que hay que ejecutar
| Modelo | Parámetros | Licencia | Se lleva muy bien en | Ideal para |
|---|---|---|---|---|
| Gemma 4 E2B | 5,1 mil millones / 2,3 mil millones activos | Apache 2.0 | 4 GB | Teléfonos, siempre encendidos, entrada de audio |
| Gemma 4 E4B | ~8B | Apache 2.0 | 8 GB | Tareas rutinarias con el portátil, resumen |
| Guía de Aion 1.0 | SLM pequeño | Categorías de peso abiertas (HF, julio de 2026) | Solo CPU | Tareas de texto nativas de Windows |
| Qwen3.8-27B | 27B denso | Apache 2.0 | 24-32 GB | El mejor modelo local general de menos de 32 GB |
| Gemma 4 26B-A4B | 26B / 4B activo | Apache 2.0 | 24 GB | MoE rápido, bajo coste de activación |
| Gemma 4 31B | 31B denso | Apache 2.0 | 32 GB | La mejor calidad local en formatos de hasta 32 GB |
| Ornith-1.5 35B | 35B / 3B activo | MIT | 32 GB | Codificación agente, huella activa mínima |
| gpt-oss-120b | 120 B / 5,1 B activos | Apache 2.0 | 128 GB | Los 128 GB: el punto óptimo |
| Ornith-1.5-397B | 397B Ministerio de Educación | MIT | 256 GB o más | Cerca de la frontera, necesita un contenedor grande |
| MiniMax M3 | 428B / 23B activos | Personalizado | 512 GB | Solo es compatible con el M5 Ultra |
| DeepSeek V4 Pro | 1,6 T / 49 B activos | MIT | Clúster | No es un modelo de dispositivo de consumo |
| Kimi K3 | 2,8 T / 104 B activos | Personalizado | Clúster | No es compatible con ningún modelo de Mac que venda Apple |
Si estás decidiendo qué modelo de ordenador de Apple comprar, he analizado en detalle los distintos niveles de memoria en Guía de IA local para el MacBook Pro M5 Pro de 64 GB — En resumen, 64 GB es el punto a partir del cual las renuncias dejan de ser molestas.
Si quieres una recomendación: En un equipo de 32 GB, ejecuta Qwen3.8-27B o Gemma 4 31B. Ambos con licencia Apache 2.0, ambos multimodales, ambos realmente útiles, ambos adecuados. Esa es la configuración predeterminada de 2026 y es una configuración predeterminada mucho mejor que la que tenía 2025.
Mostrar imagen Lo que realmente cabe, por niveles de memoria. Las líneas verticales representan los tamaños de memoria que los consumidores pueden adquirir realmente; los modelos que se salen de la línea de la derecha constituyen el límite máximo de la IA de vanguardia local en 2026.
Parte XIV: El muro de los recuerdos lo dice todo
Todo lo que ocurre en el acto III se reduce a una ecuación, así que aquí la tienes de forma explícita.
¿Me quedará bien?
pesos (GB) ≈ total_parámetros (B) × bytes_por_parámetro
4 bits → × 0,5
8 bits → × 1,0
BF16 → × 2,0
memoria_disponible ≈ (memoria del sistema × 0,75) − sobrecarga del SO y de las aplicaciones − caché KV
¿A qué velocidad se generará?
tokens/seg ≈ (ancho de banda de memoria × eficiencia) ÷ bytes_activos_por_token
Ten en cuenta que la segunda fórmula utiliza activo parámetros, no en total. Por eso los modelos de ’mezcla de expertos’ funcionan tan bien, de forma desproporcionada, en hardware de consumo. El modelo 26B-A4B de Gemma 4 tiene 26 000 millones de parámetros de capacidad y 4 000 millones de parámetros de coste por token. El modelo 35B de Ornith-1.5 activa 3B. MiniMax M3 tiene un total de 428B y 23B activos.
En la práctica, la eficiencia en esa fórmula oscila aproximadamente entre 0,5 y 0,8. dependiendo del tiempo de ejecución, la cuantificación y la cantidad de ancho de banda de memoria que esté utilizando el resto del sistema.
Ahora aplícalo. Un portátil con una NPU de 45 TOPS y LPDDR5X a, digamos, 120 GB/s, que ejecuta un modelo de 8B a 4 bits (4 GB de pesos activos): 120 × 0,6 ÷ 4 ≈ 18 fichas por segundo En teoría. La cifra medida es de aproximadamente 5. La diferencia se debe a la programación, los conflictos de memoria, los costes de precarga y al hecho de que las cadenas de herramientas de la NPU aún no están maduras. Esa diferencia entre los cálculos y las mediciones es precisamente donde radica la mayor parte de la decepción en este ámbito.
La escasez de DRAM es la variable oculta que se esconde detrás de cada cifra de este artículo.
Los fabricantes de memorias dedicaron los años 2025 y 2026 a reorientar su capacidad hacia los clientes de centros de datos de IA, que firman contratos más cuantiosos y con mejores márgenes que los fabricantes de dispositivos de consumo. Las consecuencias se notan en todas partes:
- Apple subió los precios de todos los modelos de Mac y iPad en junio de 2026.
- El modelo de Mac Studio de 512 GB se ha retrasado hasta finales de octubre por motivos de suministro y aún no se ha fijado su precio.
- El M6 de Apple tiene un límite de 32 GB de memoria unificada, y los modelos M6 Pro, Max y Ultra se cancelaron por completo.
- Ming-Chi Kuo informó de que Apple ha reducido los envíos de hardware para 2026 debido a problemas de suministro de memoria.
Todos los límites máximos mencionados en este artículo se deben a la misma carencia. El «escándalo» de los teléfonos de 12 GB. El límite de 32 GB del M6. El techo de 128 GB de los portátiles. El retraso en el lanzamiento del nivel de 512 GB. Ninguno de ellos es un límite técnico del silicio; todos son decisiones de asignación en un mercado en el que la memoria es escasa y cara.
Si has estado esperando a que los precios se estabilicen antes de comprar una máquina para la inferencia local: nadie con credibilidad prevé cuándo ocurrirá eso.
Quinceª parte: La configuración
La parte práctica. Todo lo que aparece aquí lo he probado yo mismo; cuando me limito a informar en lugar de probarlo, lo indico expresamente.
La opción más sencilla: LM Studio
Una interfaz gráfica de usuario (GUI), nativa de MLX para Apple Silicon, con explorador de modelos integrado y un servidor compatible con OpenAI que se activa con un solo clic. Si quieres tener un modelo en funcionamiento en diez minutos, empieza por aquí. Además, es la herramienta con la que Apple compara sus resultados en sus propios comunicados de prensa, lo que da una idea de lo generalizada que se ha vuelto su uso.
La opción más flexible: Ollama
bash
Instalación de #
curl -fsSL https://ollama.com/install.sh | sh
Descarga y ejecuta la configuración predeterminada de 2026
ollama run qwen3.8:27b
# El tamaño predeterminado del contexto es demasiado pequeño para trabajar con código real: auméntalo
OLLAMA_CONTEXT_LENGTH=65536 ollama serve
Ese segundo comando es el que la gente suele pasar por alto. El contexto predeterminado de Ollama está configurado de forma conservadora; en una tarea de código, truncará el texto sin avisar y acabarás echándole la culpa al modelo.
La ruta más rápida en Apple Silicon: MLX
bash
pip install --upgrade mlx-lm
# Generar directamente
mlx_lm.generate \
--model mlx-community/Qwen3.8-27B-4bit \
--prompt "Explica el enrutamiento mediante mezcla de expertos en dos párrafos". \
--max-tokens 512
# O bien, poner en servicio un punto final compatible con OpenAI
mlx_lm.server --model mlx-community/Qwen3.8-27B-4bit --port 8080
Dirige cualquier cliente compatible con OpenAI a http://localhost:8080/v1.
Aumenta el límite de memoria física antes de quejarte de los fallos del sistema
Por defecto, macOS no permite que la GPU gestione toda la memoria unificada. En un equipo con mucha memoria, esto marca la diferencia entre que un modelo se cargue correctamente o que falle:
bash
# Comprueba el límite actual
sysctl iogpu.wired_limit_mb
# Ejemplo para un equipo de 128 GB, dejando unos 14 GB para el sistema operativo
sudo sysctl iogpu.wired_limit_mb=116736
# Hacerlo permanente
echo "iogpu.wired_limit_mb=116736" | sudo tee -a /etc/sysctl.conf
No lo configures con el tamaño total de la memoria. Deja entre 12 y 16 GB para el sistema operativo en un ordenador potente; de lo contrario, tendrás errores del kernel en lugar de una inferencia rápida. Y vuelve a comprobarlo después de cada actualización de macOS, ya que las actualizaciones lo restablecen.
En Windows, utiliza primero los modelos del sistema operativo
Antes de instalar nada, comprueba qué te ofrece ya Windows. Las API Prompt, Summarizer, Writer y Rewriter de Edge utilizan Aion 1.0, que funciona de forma local sin necesidad de claves ni de pagar nada. Para la síntesis, la reescritura y la extracción de información dentro de una aplicación web, se trata de una solución completa que no requiere infraestructura alguna.
JavaScript
// Edge Canary 150.0.4070+ — se ejecuta íntegramente en el dispositivo
const summarizer = await Summarizer.create({ type: "key-points" });
const summary = await summarizer.summarize(longText);
Si necesitas más que eso, tanto LM Studio como Ollama funcionan bien en Windows, y en un equipo que no cuente con una NPU compatible utilizarán la GPU o la CPU, lo cual, para modelos de la clase 8B, suele ser más rápido que la ruta de la NPU, en cualquier caso.
Una configuración híbrida sensata
La arquitectura que construiría realmente y, a grandes rasgos, la que utilizo:
- Nivel 1: en el dispositivo. Un pequeño modelo para el enrutamiento, la clasificación, la extracción, la síntesis y el dictado. Gemma 4 E4B o Aion 1.0 Instruct. Siempre disponible, con un coste marginal nulo.
- Nivel 2: tu propio hardware. Un modelo de peso abierto 27B–120B en un equipo de tu propiedad, para cualquier tarea que implique datos de clientes que no deban salir de la jurisdicción. Qwen3.8-27B con 32 GB,
gpt-oss-120ben 128 GB. - Nivel 3: Frontier a través de la API. La planificación, el razonamiento riguroso, las secuencias de acciones prolongadas… cualquier situación en la que equivocarse tenga un alto coste.
El debate nunca se reduce a “local o en la nube”. Se trata de dónde se trazan los límites, y este año esos límites se han desplazado mucho.
Parte XVI: Cálculos sobre costes y cumplimiento normativo
El argumento del ahorro no resiste un cálculo con la calculadora
Tomemos como ejemplo una carga de trabajo realista de una pequeña empresa: un mes de trabajo de codificación de agentes moderada, digamos 40 millones de tokens de entrada y 3 millones de tokens de salida.
| Opción | Coste mensual |
|---|---|
| GLM-5.3-API de Flash ($0.15 / $0.47) | ~$7.40 |
| API Flash de Gemini 3.8 ($0.75 / $3.75) | ~$41 |
| API Claude Opus 5 ($5 / $25) | ~$275 |
| API Claude Fable 5.1 ($10 / $50, sin almacenamiento en caché) | ~$550 |
| Una caja Strix Halo $2.400, amortizada en 3 años | ~1 TP4T67 al mes + electricidad |
Fíjate en lo que dice realmente esa tabla. El hardware local es más barato que el de la parte superior de la gama y más caro que el de la parte inferior. Frente al GLM-5.3-Flash, un equipo local nunca llega a amortizarse, ni siquiera con tokens. Frente al Fable 5.1 sin caché, se amortiza en cinco meses; pero no se trata de una comparación entre iguales, ya que el Fable 5.1 es un modelo mucho mejor que cualquier otro que quepa en 128 GB.
Así que no compres material de ferretería local para ahorrar dinero. Cómpralo por una de estas cinco razones, todas ellas reales:
- La residencia de datos es una decisión de arquitectura más que un proyecto jurídico.
- Sin límites de velocidad, sin cuotas, sin incidencias de capacidad. Tu máquina no tiene nada que hacer este martes.
- Fijación de versiones para siempre. Un punto de control local es idéntico, byte a byte, en un año.
- Funcionamiento sin conexión.
- De todas formas, necesitabas la estación de trabajo. Este es el caso más habitual en el que comprar es, sin duda, la decisión correcta: si ya tenías pensado gastarte 2.500 € en un equipo, el coste marginal de la capacidad de IA es la ampliación de memoria, no el equipo completo.
La situación en materia de cumplimiento de la normativa de la UE, ya que cambió en 2026
Para los lectores de Alemania y de la UE, el marco normativo ha cambiado este año y las fechas ya son fijas, en lugar de estar sujetas a condiciones.
- 2 de agosto de 2025 — Los proveedores del modelo GPAI asumieron las obligaciones relativas a la documentación, el resumen del contenido formativo y los derechos de autor.
- 2 de agosto de 2026 — Entraron en vigor las competencias de ejecución y las obligaciones de transparencia previstas en el artículo 50. A partir de ahora se impondrán multas.
- 27 de julio de 2026 — Entró en vigor el «Ómnibus Digital», el Reglamento (UE) n.º 2026/1744, que sustituye el anterior mecanismo condicional para los sistemas de alto riesgo por fechas fijas.
- 2 de diciembre de 2026 — Fin del periodo de gracia para la incorporación de marcas de agua legibles por máquina en los sistemas existentes.
- 2 de agosto de 2027 — Finaliza el plazo de transición de dos años para los modelos GPAI que ya se encuentran en el mercado.
- 2 de diciembre de 2027 — sistemas autónomos de alto riesgo contemplados en el anexo III (contratación, evaluación de la solvencia crediticia, educación, infraestructuras críticas).
- 2 de agosto de 2028 — IA de alto riesgo integrada en productos regulados contemplados en el anexo I (productos sanitarios, maquinaria).
El Omnibus Digital también introdujo prohibiciones relativas a las imágenes íntimas generadas por IA sin consentimiento y al material de abuso sexual infantil (CSAM), y amplió las competencias de supervisión de la Oficina de IA de la UE.
Qué significa esto, en la práctica, para los lectores de este artículo. Si estás desarrollando sobre la base de modelos en lugar de entrenarlos, la mayor parte de las obligaciones derivadas de la GPAI recaen sobre el proveedor, no sobre ti. Lo que te corresponde a ti es la transparencia —informar a las personas cuando interactúan con la IA y señalar el contenido sintético—, además de la cuestión de la clasificación de alto riesgo si tu sistema tiene que ver con la contratación, el crédito, la educación o las infraestructuras críticas. La fecha de diciembre de 2027 está lo suficientemente lejos como para poder planificarse, pero lo suficientemente cerca como para que “ya lo veremos más adelante” ya no sea una estrategia válida.
Y el punto más relevante para el acto III: Un modelo integrado en el dispositivo simplifica considerablemente varias de estas conversaciones a la vez. Sin transferencia, sin procesador, un mapa de flujo de datos mucho más breve. No se trata de una laguna jurídica —las obligaciones de transparencia siguen siendo aplicables—, pero elimina toda una categoría de trabajo.
No soy abogado y esto no constituye un asesoramiento jurídico. Para cualquier asunto relacionado con dinero, acude a un asesor con titulación alemana o de la UE para que analice tu situación concreta.
Parte decimoséptima: Argumentos sinceros en contra de todo esto
Si me detuviera en la parte dieciséis, esto sería un anuncio.
Los datos sobre productividad que se han medido siguen sin respaldar ese entusiasmo. Un ensayo controlado aleatorio, el 19%, más lento. Un seguimiento que no se pudo llevar a cabo de forma rigurosa. Los datos autoinformados se inflaron en 40 puntos porcentuales. Todos los que formamos parte de este sector, yo incluido, nos basamos en gran medida en corazonadas sobre corazonadas.
Los datos sobre seguridad son malos y no mejoran. La tasa de fallos de Veracode en el 45% de OWASP se mantuvo prácticamente sin cambios hasta principios de 2026, mientras que los modelos se volvieron mucho más inteligentes. No se trata de un problema transitorio que se solucione con el aumento de escala. La capacidad y la seguridad no son el mismo eje, y nadie se está esforzando por optimizar este último.
Los resultados de las pruebas de rendimiento están saturados en la parte superior y no se pueden verificar en la parte central. SWE-bench Verified cuenta con tres modelos dentro de un punto. Las pruebas de rendimiento que lo sustituyen son cada vez más privadas, lo que resuelve el problema de la contaminación al hacer imposible la verificación independiente.
Las categorías de peso libre están a una revisión de la licencia de dejar de ser «abiertas». Z.ai cambió la licencia de GLM, que pertenecía al MIT, a una licencia propia con un control de seguridad entre las versiones 5.2 y 5.3. Meta ha prometido pesos abiertos para Muse Spark, pero sin fecha, sin tamaño y sin texto de licencia. Si tu arquitectura parte de la base de que los pesos se podrán descargar el año que viene, esa suposición es una decisión empresarial del proveedor, no una ley de la naturaleza.
La frontera sigue sin ser local y, cada vez más, tampoco se puede adquirir. Mythos 5.1, el que ha obtenido la puntuación más alta en Terminal-Bench 4.0, está restringido a ciberdéfensores y científicos biológicos que hayan superado un proceso de selección, la mayoría de los cuales se encuentran actualmente en EE. UU. Kimi K3 y DeepSeek V4 Pro no caben en ningún ordenador de consumo. Lo que cabe en tu escritorio es un excelente modelo de segunda categoría, que resulta realmente útil, pero no representa la vanguardia.
El rendimiento del dispositivo es peor de lo que sugiere la publicidad. Cinco tokens por segundo para un modelo 8B en una NPU de 45 TOPS. Una barrera de memoria de 12 GB que excluye a la mayoría de los teléfonos en circulación. Una promesa de actualizaciones durante siete años que no incluye nuevas funciones. La brecha entre la denominación “AI PC” y lo que el dispositivo es capaz de ejecutar realmente es, en la actualidad, enorme.
Y la geopolítica es un factor que influye en la contratación pública, independientemente de si uno cree que debería serlo o no. Varios de los mejores modelos de peso abierto —Kimi, GLM, DeepSeek, Qwen, MiniMax— proceden de laboratorios chinos. Para los clientes del sector público, los relacionados con la defensa y algunos clientes sujetos a regulación, esto supone un obstáculo insuperable, independientemente de dónde se ejecuten los pesos o de lo que establezca la licencia. Por su parte, el modelo de codificación más potente de Anthropic está restringido a organizaciones estadounidenses previamente evaluadas. El ecosistema abierto se está fragmentando a lo largo de las fronteras nacionales desde ambos extremos, y si estás en Europa, no estás en ninguno de los dos extremos.
Parte XVIII: El marco de decisión para el «Estado de la IA 2026»
Mostrar imagen Siete situaciones, siete respuestas. Encuentra la fila que mejor refleje tu año.
Siete situaciones, aplicadas al estado actual de la IA en 2026 tal y como se presenta hoy en día.
1. “Quiero el mejor modelo y el precio no es un problema”.”
Claude Fable 5.1 con un índice agregado de 65,7, en el contexto $10/$50 y 1M, y activa el almacenamiento en caché, ya que el recorte de lectura de caché de 75% supone entre 25 y 45% de tu factura. Mantén GPT-5.6 Sol Disponible para investigaciones que requieran una navegación intensiva en el ordenador 90.4% BrowseComp. No te preocupes; la diferencia entre ambos es menor que la que hay entre tu mejor y tu peor indicación.
2. “Tengo muchos agentes a mi cargo y la factura se está volviendo una locura”.”
Claude Opus 5 con parámetros $5/$25 para el trabajo a largo plazo, GLM-5.3-Flash con parámetros $0,15/$0,47 para el trabajo mecánico general, y un modelo local para «grunt». El enrutamiento es el principal factor de control de costes del que dispones y se trata de un archivo de configuración, no de un proyecto. Analiza la distribución de tus tokens por función de los agentes antes de optimizar nada: la mayoría de la gente descubre que el 80% de su gasto corresponde a tareas que no requerían un modelo «frontier».
3. “El RGPD y la residencia de datos son requisitos imprescindibles para trabajar con los clientes”.”
Qwen3.8-27B o Gemma 4 31B en tu propio equipo, ambos bajo licencia Apache 2.0 y ambos multimodales. Da el salto a gpt-oss-120b en un equipo de 128 GB si el trabajo lo requiere. La cuestión no es la velocidad, sino que ningún mensaje salga del edificio y que tu revisión jurídica se convierta en una simple lectura de la licencia en lugar de una evaluación del impacto de la transferencia. Elige modelos con licencias permisivas, precisamente para que el código sea breve.
4. “Quiero probar la IA local sin gastar mucho”.”
Todo lo que ya tengas, además de LM Studio y Gemma 4 E4B. Ocho gigabytes de memoria son suficientes para que resulte realmente útil. Averigua si la IA local es adecuada para ti antes de gastarte dinero en ella: la mayoría de la gente descubre que quiere los niveles 1 y 3 y que, en realidad, nunca ha necesitado el nivel 2.
5. “Voy a comprar un equipo específicamente para la inferencia local”.”
Elige en función del ancho de banda y la capacidad de la memoria, en ese orden, y no te fijes en los TOPS. En la categoría de 128 GB, la Strix Halo, a unos $2.400, es la opción más rentable, mientras que la DGX Spark, a unos $3.999, te ofrece CUDA y una generación de imágenes mucho mejor. Por encima de eso, el Mac Studio M5 Ultra es el único que ofrece un modelo de 400B, a un precio que solo tiene sentido si, de todos modos, necesitas una estación de trabajo.
6. “Mi equipo está incorporando herramientas de programación basadas en IA y yo asumo la responsabilidad de los riesgos”.”
Haz las cosas aburridas, en este orden: SAST y detección de secretos en cada commit; análisis de la composición del software para paquetes «alucinados»; una política por escrito que excluye el código de IA no revisado de las áreas de autenticación, cifrado, autorización y pagos; credenciales de agente clasificadas como privilegiadas; y una SBOM que registra la procedencia de las herramientas. Entonces, cabe esperar un Curva en J — DORA registró un descenso real antes de la subida — y no te asustes en el tercer mes.
7. “¿Qué móvil debería comprarme para usar la IA?”
Cualquier modelo de 12 GB. Esa es la línea que han marcado todas las plataformas: el iPhone 17 Pro y el 18 Pro con 12 GB, el Pixel 10 con Nano v3 y el Galaxy S26 Ultra con Snapdragon 8 Elite Gen 5. El iPhone 18 básico, que según se informa tendrá 9 GB, y el Pixel 9 y modelos anteriores funcionarán sin problemas, pero no contarán con estas funciones. Si ya tienes un dispositivo de 12 GB, la actualización de este año supone una mejora gradual, concretamente en lo que respecta a la IA.
Parte XIX: Lo que voy a ver el próximo trimestre
Si Meta distribuye realmente las fuentes de Muse Spark y bajo qué licencia. “Que un director general diga ”pronto» en X, sin especificar parámetros ni incluir el texto de la licencia, es la forma más débil de compromiso que se menciona en este artículo. Si lo lanzan bajo la licencia Apache 2.0, eso cambiaría sustancialmente el ecosistema abierto. Si lo lanzan bajo una licencia a medida con una barrera de ingresos, eso se convertiría en el estándar del sector y el carácter abierto pasaría a ser una categoría de marketing en lugar de una propiedad.
Si se reproduce el resultado de la mejora automática de Ornith-1.5. Una evaluación independiente de las tareas ajenas al plan de estudios elaborado por la propia institución sería lo que zanjaría la cuestión. Este es el punto de la lista que presenta mayor variabilidad: o bien es el resultado más importante de 2026, o bien una advertencia sobre los criterios de referencia elaborados por la propia institución, y por el momento no sé cuál de las dos cosas es.
Si el «Plan Aion 1.0» se lanzará realmente y a qué velocidad funcionará. Un modelo de razonamiento 14B en Windows constituye una categoría totalmente nueva. Si funciona a una velocidad de 3 tokens por segundo en un equipo que cumpla los requisitos, se trata de una demostración. Si funciona a 20, cambia lo que una aplicación de escritorio puede dar por sentado.
La curva de atribución del CVE. 6, 15 y 35 en meses consecutivos. Si de abril a agosto se mantuviera esa tendencia, los datos de Georgia Tech se convertirían, cuando se publiquen, en la publicación más relevante del año en materia de seguridad de la IA.
Si alguien desarrolla las herramientas de revisión. La brecha entre lo que los agentes pueden generar y lo que los humanos pueden verificar es el problema clave de 2027 y, a día de hoy, casi todo el capital de riesgo sigue destinándose a la generación, en lugar de a la verificación. Quien lance la herramienta que indique de forma fiable qué 5% de una diferencia requiere la revisión humana será muy difícil de superar.
Si la escasez de memoria se alivia. Es la variable oculta que se esconde tras el escándalo del teléfono de 12 GB, el límite de 32 GB del M6, el retraso en el lanzamiento del modelo de Mac de 512 GB y la subida de precios de Apple en junio. Nadie con credibilidad prevé que la situación mejore.
Y si los modelos fronterizos con barreras de seguridad seguirán siendo una excepción. Mythos 5.1 está restringido por motivos de doble uso que considero justificables, y el Proyecto Glasswing está ampliando activamente el acceso: unas 150 organizaciones en más de quince países para junio de 2026. Pero el precedente ya está sentado: el mejor clasificado en una prueba de rendimiento pública de programación es ahora algo que la mayoría de las organizaciones no pueden adquirir a ningún precio. Si eso se convierte en una tendencia en lugar de un caso aislado, la pregunta “¿puede mi organización pasar el proceso de selección?” se transforma en un criterio de selección de modelos, y el argumento a favor de la transparencia de los pesos fuera de EE. UU. deja de girar exclusivamente en torno al coste.
Preguntas frecuentes
¿Cuál es el mejor máster en Derecho (LLM) en septiembre de 2026?
En conjunto, Claude Fable 5.1 lidera el Índice de Inteligencia v4.1.1 de Artificial Analysis con una puntuación de 65,7, por delante de Claude Opus 5 con 63,0, Claude Fable 5 con 62,1, Grok 4.6, con 60,9, y GPT-5.6 Sol, con 58,9. Sin embargo, la media global minimiza las diferencias que realmente importan. GPT-5.6 Sol lidera la navegación con 90,41 TP3T en BrowseComp; Gemini 3.8 Flash alcanza 58,7 con $0,75 por millón de tokens de entrada; GLM-5.3-Flash alcanza 57,5 con $0,15. Para la mayoría de las cargas de trabajo reales, los ocho mejores modelos son intercambiables y la decisión debería basarse en el precio, la latencia, la rentabilidad de la caché y la licencia, más que en la clasificación.
¿Cuál es el mejor modelo de peso libre en este momento?
Depende de tu hardware y de tu tolerancia a las licencias. GLM-5.3 (753B) obtiene la puntuación más alta, con 59,5, pero conlleva una licencia personalizada con un requisito de revisión de seguridad de $10 mil millones de ingresos. DeepSeek V4 Pro (1,6 T en total, 49 mil millones activos) tiene licencia del MIT y obtiene una puntuación de 87,9 en Terminal-Bench 2.1, pero requiere un clúster. Si se trata de un equipo propio, Qwen3.8-27B o Gemma 4 31B —ambos con licencia Apache 2.0— son los mejores modelos que caben en 32 GB.
¿Habrá desaparecido la programación «vibe» en 2026?
El término está cayendo en desuso; la práctica se ha dividido en dos. La programación «vibe», en su sentido original —escribir, aceptar, no leer el diff— sigue siendo adecuada para trabajos desechables: scripts, prototipos, análisis puntuales. Lo que la ha sustituido para todo lo que se lanza al mercado es la ingeniería agencial basada en especificaciones: una especificación escrita, un entorno de pruebas, un conjunto de pruebas que el agente debe superar y una revisión real del diff resultante. El peligroso término medio —código de producción sin revisar— es el origen de todos los incidentes documentados de 2026.
¿La programación con IA realmente permite a los desarrolladores trabajar más rápido?
El único ensayo controlado aleatorio dice que no. El estudio METR reveló que los desarrolladores experimentados eran un 19% más lentos al utilizar herramientas de IA de principios de 2025 en bases de código maduras, aunque creían que habían sido un 20% más rápidos —una sobreestimación de 40 puntos porcentuales—. Su estudio de seguimiento de 2026 no pudo llevarse a cabo correctamente porque los desarrolladores se negaron a trabajar sin IA. Las encuestas indican un multiplicador de velocidad de 3×, pero solo un cambio de 1,4–2× en el valor del trabajo. Mi interpretación: grandes beneficios en tareas desconocidas, código repetitivo, pruebas y migraciones; beneficios pequeños o negativos en bases de código que se conocen a la perfección.
¿Qué riesgo entraña el código generado por IA?
Un riesgo cuantificable y una mejora lenta. Veracode detectó que 45% de las muestras generadas por IA presentaban una vulnerabilidad del Top 10 de OWASP, siendo Java el peor caso con 72%. Apiiro ha medido que los desarrolladores asistidos por IA realizan commits entre 3 y 4 veces más rápido y detectan problemas de seguridad 10 veces más rápido, con un aumento de las rutas de escalada de privilegios de hasta 322%. Aproximadamente 20% del código generado por IA hace referencia a paquetes que no existen, y 43% de esos nombres «alucinados» se repiten constantemente, lo que constituye una superficie de ataque en la cadena de suministro. La solución son controles automatizados en cada commit, no la abstinencia.
¿Puedo ejecutar un buen modelo de lenguaje grande (LLM) sin conexión en mi propio ordenador?
Sí, y 2026 es el primer año en el que esto es indiscutiblemente cierto. Con 8 GB de memoria, Gemma 4 E4B resulta realmente útil. Con 32 GB, Qwen3.8-27B o Gemma 4 31B son potentes modelos multimodales bajo licencia Apache 2.0. Con 128 GB, gpt-oss-120b es la opción ideal. Lo que no cabe en ningún ordenador de consumo es la verdadera vanguardia: Kimi K3, con 2,8 billones de parámetros, y DeepSeek V4 Pro, con 1,6 billones, necesitan ambos un clúster.
¿Qué es Microsoft Aion 1.0?
Una familia de modelos integrados en el dispositivo anunciada en la conferencia Build el 2 de junio de 2026 e incorporada a Windows 11. Aion 1.0 Instruct es un modelo pequeño para la síntesis, la reescritura y la extracción que se ejecuta en una CPU moderna sin necesidad de NPU, accesible a través de las API de JavaScript Prompt, Summarizer, Writer y Rewriter de Edge, con pesos abiertos en Hugging Face desde julio de 2026. Aion 1.0 Plan es un modelo de razonamiento y activación de herramientas de 14 000 millones de parámetros con una ventana de contexto de 32K para flujos de trabajo agenticos, que requiere un PC con Copilot+ y una NPU de al menos 40 TOPS, y que, a principios de septiembre de 2026, aún estaba previsto para “los próximos meses”.
¿Por qué los teléfonos necesitan 12 GB de RAM para las funciones de inteligencia artificial?
Porque los modelos integrados en el dispositivo tienen limitaciones de memoria, no de potencia de cálculo. El AFM 3 Core Advanced de Apple es un modelo disperso de 20 000 millones de parámetros que reside en el almacenamiento flash y traslada los expertos enrutados a la DRAM bajo demanda —lo cual sigue necesitando un espacio donde almacenarlos, además del sistema operativo, la aplicación y el proceso de la cámara—. Ming-Chi Kuo señala que dos funciones de iOS 27 requieren 12 GB. Gemini Intelligence, de Google, tiene el mismo mínimo de 12 GB. La diferencia entre 9 GB y 12 GB radica en el conjunto de trabajo, no en la segmentación del mercado.
¿Merece la pena tener una NPU para la IA local?
Menos de lo que sugiere la publicidad. En una NPU de 45 TOPS, un modelo de 8 mil millones genera aproximadamente 5 tokens por segundo, ya que la generación de tokens está limitada por el ancho de banda de la memoria y no por la potencia de cálculo. Las NPU son excelentes para tareas de bajo consumo, de ráfagas cortas y en funcionamiento continuo —esas que el sistema operativo ejecuta constantemente—. Para un chat interactivo en un portátil, la GPU o incluso la CPU suelen ser más rápidas. A la hora de comprar, fíjate en el ancho de banda y la capacidad de la memoria; considera que los TOPS no tienen prácticamente ningún sentido a la hora de elegir un producto.
¿Son realmente de código abierto los modelos de peso abierto?
En su mayoría, no. DeepSeek V4 Pro (MIT), Qwen3.8 (Apache 2.0), Gemma 4 (Apache 2.0) y Ornith-1.5 (MIT) cuentan con licencias verdaderamente permisivas. GLM-5.3 exige que las empresas con ingresos superiores a $10 mil millones superen la revisión de seguridad de Z.ai; Kimi K3 utiliza una licencia por tramos de ingresos; MiniMax M3 exige la atribución destacada “Creado con MiniMax M3” para cualquier uso comercial y una autorización por escrito para ingresos superiores a $20 millones. Ninguno de ellos publica datos de entrenamiento ni código de entrenamiento. “Open weight” es el término correcto; “código abierto” es un término engañoso.
¿Es más barato ejecutar modelos de forma local que utilizar una API?
Casi nunca solo por el coste de los tokens. Un mes moderado de trabajo de agente —40 millones de tokens de entrada y 3 millones de salida— cuesta aproximadamente $7 en GLM-5.3-Flash y unos $41 en Gemini 3.8 Flash. Una máquina local de $2.400 amortizada a lo largo de tres años supone aproximadamente $67 al mes, sin contar la electricidad. El hardware local supera a los mejores de la frontera en cuanto a coste, pero queda por detrás de los peores. Opta por el hardware local por la residencia de datos, la libertad de limitar el ancho de banda, la fijación de versiones y el funcionamiento sin conexión —o simplemente porque, de todos modos, necesitabas la estación de trabajo—.
¿Qué exige la Ley de IA de la UE para 2026?
A partir del 2 de agosto de 2026, las facultades de ejecución y las obligaciones de transparencia previstas en el artículo 50 se aplican a la IA de uso general, y ya se pueden imponer multas. El «Omnibus Digital», el Reglamento (UE) 2026/1744, entró en vigor el 27 de julio de 2026 y estableció fechas fijas: el 2 de diciembre de 2026 finaliza el período de gracia para el marcado digital; el 2 de agosto de 2027 finaliza la fase de transición para los modelos de IA de uso general (GPAI) que ya se encuentran en el mercado; el 2 de diciembre de 2027 se aplica a los sistemas autónomos de alto riesgo contemplados en el anexo III; el 2 de agosto de 2028 abarca la IA de alto riesgo integrada en productos regulados. Si se basa en modelos en lugar de entrenarlos, la mayoría de las obligaciones relativas a la IA general (GPAI) recaen sobre el proveedor: la transparencia y la clasificación de alto riesgo son responsabilidades que le corresponden a usted. Esto no constituye asesoramiento jurídico.
¿Cuánto tiempo puede trabajar un agente de IA sin supervisión?
METR mide la duración de la tarea que un modelo completa de forma autónoma con éxito en 50%. Esa cifra pasó de unos 30 segundos en 2022 a más de 14 horas para los sistemas de vanguardia en 2026, con un tiempo de duplicación de aproximadamente 196 días en el ajuste híbrido de METR, o de 131 días si se limita a los modelos posteriores a 2023. Los intervalos de confianza son muy amplios —el horizonte de 320 minutos de Claude Opus 4.5 oscila entre 170 y 729 minutos— y solo 5 de las 31 tareas largas de METR utilizan referencias humanas medidas. Extrapolando, eso supone aproximadamente un día laborable de duración de la tarea autónoma en 2027.
¿Qué modelo debería utilizar específicamente para la programación?
Planificar en lugar de elegir. Planificación y arquitectura para el modelo más potente que te puedas permitir (Claude Fable 5.1); la mayor parte de la implementación a largo plazo para Claude Opus 5 a mitad de precio; el trabajo mecánico de gran volumen para GLM-5.3-Flash a $0.15/$0.47; cualquier cosa que afecte a los datos de los clientes, a un modelo local de peso abierto; y los cambios de nombre, las cadenas de documentación y las correcciones de lint, a un pequeño modelo local. Escribe los ID de los modelos de tal forma que cambiar uno suponga un cambio de una sola línea: cuatro laboratorios lanzaron un modelo del top 10 entre junio y septiembre de 2026.
Conclusión
Hace doce meses, la pregunta más interesante en el ámbito de la IA era qué modelo era el más inteligente. En 2026, esta pregunta ha perdido casi todo su interés. Los diez mejores modelos abarcan 8,2 puntos en el mejor agregado disponible, y el más barato de ellos cuesta una sesentésima séptima parte del más caro.
Lo que lo ha sustituido es más útil y menos emocionante: ¿Puedes comprobar qué producen estas cosas, con la rapidez suficiente para seguirles el ritmo?
Esa única pregunta explica todos los hallazgos de este artículo. Explica por qué el SWE-bench se estancó en 96% y dejó de aportar información. Explica por qué la adopción de herramientas de programación basadas en IA alcanzó los 90%, mientras que la confianza cayó hasta los 29%. Explica por qué la tasa de fallos de seguridad de Veracode no varió mientras que la capacidad se disparó, ya que la capacidad y la verificabilidad son ejes diferentes y solo se está optimizando uno de ellos. Explica por qué DORA concluyó que los beneficios provienen de la organización y no de la herramienta. Y explica por qué la práctica que realmente funciona en 2026 —especificación, entorno de pruebas, control de pruebas, revisión real— parece mucho menos mágica que las demostraciones.
Cuatro cosas que me quedaría.
La frontera se ha comercializado más rápido de lo que nadie esperaba, y la diferencia de peso libre es ahora de unos seis meses. Un modelo 397B con licencia del MIT supera el límite alcanzado por la última generación en la prueba SWE-bench. Un modelo 753B de peso abierto supera a GPT-5.6 Sol en el índice agregado. Prepárate para un mundo en el que el modelo ya no sea tu factor diferenciador, porque, de hecho, ya casi ha dejado de serlo.
Lee la licencia antes de realizar la prueba de rendimiento. Las capacidades se están unificando; los términos, en cambio, se están diferenciando. Z.ai se ha distanciado del MIT entre una versión y otra. Meta ha prometido pesos sin texto de licencia. El mejor modelo de programación de Anthropic está restringido por la nacionalidad. Para un comprador comercial, cuatro puntos en una prueba de rendimiento valen menos que una licencia que su abogado pueda leer en noventa segundos.
Ahora lo más importante es la verificación, y casi nadie la financia. Los agentes pueden generar el trabajo de un día; nosotros lo revisamos con herramientas diseñadas para revisar el trabajo de una hora. Si tienes que decidir en qué invertir el esfuerzo de ingeniería durante los próximos doce meses, invierte en pruebas, especificaciones y herramientas de revisión, en lugar de en técnicas de generación de prompts. Las técnicas de generación de prompts pierden valor con cada nueva versión del modelo. La infraestructura de verificación, en cambio, se multiplica.
Y la IA sin conexión se ha hecho realidad, con un presupuesto de memoria que acaba de encarecerse. Un modelo multimodal con 27 000 millones de parámetros y bajo licencia Apache se ejecuta en un equipo que se puede comprar por 2 500 €. Windows incluye un modelo integrado en el sistema operativo. Tu teléfono ejecuta un modelo disperso de 20 000 millones de parámetros desde la memoria flash. Todos los límites en este sentido —la barrera de los 12 GB en los teléfonos, el tope de los 32 GB en los portátiles, el mínimo de 40 TOPS— son decisiones de asignación de memoria en un mercado en el que la DRAM es escasa, no un límite del silicio.
La configuración que montaría hoy mismo: Gemma 4 E4B en el dispositivo para el nivel de disponibilidad permanente; Qwen3.8-27B en tu propio equipo para todo aquello que no deba salir del edificio; GLM-5.3-Flash en $0,15/$0,47 para el segmento medio de gran volumen; y Claude Opus 5 o Fable 5.1 para la planificación y los problemas realmente difíciles, con el almacenamiento en caché activado. Establece la ruta entre ellos en un archivo de configuración y ten en cuenta que tendrás que reescribir ese archivo dentro de tres meses.
Vuelve a revisar esto en diciembre. Para entonces, Meta habrá lanzado los pesos o no. El Plan Aion 1.0 será una realidad o se quedará en el aire. El resultado de la mejora de Ornith se habrá replicado o habrá desaparecido discretamente. Y la curva de atribución de CVE nos habrá revelado si 2026 fue el año en que el sector endureció sus propias normas o el año en que esperó a que lo hiciera otro.
¿Estás ejecutando modelos de peso abierto en producción en la UE, o sometes el código escrito por los agentes a un proceso de revisión en el que realmente confías? Me interesan especialmente dos cosas: los desgloses del coste por token medidos según la función del agente, y cualquier método que funcione para revisar diferencias de miles de líneas de código de los agentes. Se aceptan correcciones y pruebas contrarias; este artículo se actualizará cuando la situación cambie.
Última actualización: 3 de septiembre de 2026.



