Ir al contenido
DOMINGO, 23 DE AGOSTO DE 2026NOTICIAS TECNOLÓGICAS INDEPENDIENTES, Reseñas y guías prácticas
ACERCA DE
ÚLTIMAS NOTICIAS /

MacBook Pro M5 Pro de 64 GB: el punto óptimo de la IA local para modelos de lenguaje a gran escala (LLM), generación de imágenes y vídeo

LEE LA GUÍA
HERRAMIENTAS DE IAGM / 759

MacBook Pro M5 Pro de 64 GB: el punto óptimo de la IA local para modelos de lenguaje a gran escala (LLM), generación de imágenes y vídeo

MacBook Pro M5 Pro en el que se ejecutan simultáneamente en pantalla un modelo de lenguaje local y un generador de imágenes

Índice

Hay una configuración concreta de Mac que, sin hacer mucho ruido, se ha convertido en la respuesta por defecto a la pregunta: “¿Qué portátil debería comprar si quiero ejecutar modelos de IA por mi cuenta?”. Se trata del MacBook Pro de 2026 con el chip M5 Pro y 64 GB de memoria unificada.

No es el más barato. No es el más rápido. Pero es aquel en el que el equilibrio entre las distintas características resulta adecuado para la mayoría de las personas que realmente quieren uso modelos locales, en lugar de limitarnos a compararlos con otros de referencia.

Esta guía explica lo que esa máquina es realmente capaz de hacer en tres tipos de tareas —modelos de lenguaje a gran escala, generación de imágenes y generación de vídeos— con cifras reales cuando las hay, estimaciones fiables cuando no las hay, e instrucciones de configuración paso a paso que podrás seguir el mismo día en que recibas tu máquina.

También aborda los casos en los que el argumento del «punto óptimo» deja de ser válido, porque efectivamente deja de serlo, y es importante que sepas exactamente en qué casos ocurre esto antes de gastarte tres mil dólares en memoria que no podrás ampliar más adelante.


En resumen — El veredicto

Compra el M5 Pro de 64 GB si: Quieres un equipo portátil que ejecute modelos 8B–70B y modelos «Mixture-of-Experts» con la rapidez suficiente para el trabajo real, que genere imágenes en segundos en lugar de minutos y que, además, tenga capacidad para que tu navegador, tu IDE y tus contenedores de Docker se ejecuten simultáneamente. Este es el más equilibrado ordenador portátil para la IA local en 2026.

Opta por el M5 Max de 128 GB si: Necesitas específicamente modelos locales de clase «frontier» como gpt-oss-120b (lo cual hace no (cabe en 64 GB), o si quieres aproximadamente el doble de velocidad en la generación de tokens en modelos grandes. El M5 Max de 40 núcleos tiene un ancho de banda de memoria de 614 GB/s frente a los 307 GB/s del M5 Pro, y para la decodificación de LLM, el ancho de banda lo es todo.

Busca en otro sitio si: La creación de vídeos locales es tu principal tarea. En este ámbito, cualquier Mac sigue siendo varias veces más lenta que una RTX 5090, y el alquiler de recursos en la nube resulta mucho más económico por clip.

Las tres cifras que definen esta máquina:

MétricaM5 Pro (GPU de 20 núcleos)Por qué es importante
307 GB/s ancho de banda de memoria~2× M5 básico, ~½ M5, máximo 40 núcleosEstablece el límite máximo de tokens por segundo para los modelos de lenguaje grandes (LLM)
64 GB memoria unificada máxima~48-52 GB de espacio útil por defectoDetermina qué modelos encajan
20 núcleos de GPU con aceleradores neuronalesRendimiento de computación de IA 4×+ frente al M4 ProImpulsa la rapidez de procesamiento y difusión

En primer lugar: sí, este chip es real

Gran parte de lo que se escribió sobre el M5 Pro a finales de 2025 y principios de 2026 eran especulaciones. Ya no se trata de especulaciones.

Apple anunció los modelos M5 Pro y M5 Max el 3 de marzo de 2026, y ambos se comercializaron en los modelos MacBook Pro de 14 y 16 pulgadas el 11 de marzo de 2026. El M5 básico ya había llegado antes, en el MacBook Pro de 14 pulgadas el 22 de octubre de 2025, pero ese chip es algo totalmente distinto: tiene una capacidad máxima de 32 GB y 153 GB/s, lo cual no es suficiente para las cargas de trabajo de esta guía.

Esto es lo que Apple ha confirmado en las páginas de noticias y de especificaciones técnicas:

M5 Pro: especificaciones confirmadas

ComponenteEspecificación
CPU18 núcleos (6 “supernúcleos” de hasta ~4,6 GHz + 12 núcleos de rendimiento de hasta ~4,4 GHz). Bin base: 15 núcleos. Hasta un 30% más rápido en multihilo que el M4 Pro.
GPUHasta 20 núcleos, cada uno con un acelerador neuronal dedicado. Traza de rayos por hardware de tercera generación. Más de cuatro veces la potencia de cálculo máxima de la GPU para IA en comparación con la M4 Pro.
Motor neuronal16 núcleos
Memoria unificada24 GB / 48 GB / 64 GB — 64 GB es la capacidad máxima
Ancho de banda de memoriaHasta 307 GB/s (LPDDR5X)
ProcesoTSMC 3 nm (N3P), “Fusion Architecture”: dos chips unidos mediante el encapsulado SoIC-mH
E/S y soportesThunderbolt 5, codificación y decodificación de H.264/HEVC/ProRes/ProRes RAW, decodificación de AV1

M5 Max — para el contraste

El M5 Max cuenta con la misma CPU de 18 núcleos, pero con una GPU de hasta 40 núcleos y, lo que es más importante, una configuración de memoria diferente: la variante de 32 núcleos funciona a 460 GB/s, y la de 40 núcleos a 614 GB/s, con una capacidad configurable de hasta 128 GB.

Esa diferencia de ancho de banda no es un simple detalle técnico. Es el factor más importante a la hora de decidir entre el M5 Pro y el M5 Max, y volveremos sobre él en varias ocasiones.

Diagrama que muestra cómo se reparten los 64 GB de memoria unificada entre macOS y la memoria conectada directamente a la GPU, así como el margen adicional que se obtiene al aumentar el límite de conexión directa de iogpu

Pruebas de rendimiento independientes

La unidad de prueba de Notebookcheck —un M5 Pro de 16 pulgadas con 64 GB— obtuvo en Geekbench 6.7 unas puntuaciones de 4.295 en un solo núcleo y 28.436 en varios núcleos, en Cinebench 2024, una puntuación de 2.347 en el test multinúcleo, y en Cinebench 2026, una puntuación de 9.481 en el test multinúcleo.

Según su análisis de la GPU, la M5 Max se sitúa más o menos al mismo nivel que una RTX 5070 de sobremesa y claramente por delante de la Strix Halo de AMD. La GPU de 20 núcleos de la M5 Pro se sitúa por debajo de ese nivel, lo cual conviene tener en cuenta: se trata de una GPU competente para un portátil, pero no sustituye a una tarjeta gráfica dedicada.

También han señalado algo menos halagador, y que merece la pena tomarse en serio: el MacBook Pro de 2026 reduce notablemente su rendimiento bajo una carga prolongada, con un rendimiento de la CPU irregular incluso en el modo de alta potencia. Más información al respecto en la sección dedicada a la temperatura.


El problema del precio (edición de 2026)

La gama M5 Pro se presentó en $2,199 para el de 14 pulgadas y $2,699 para el de 16 pulgadas. Entonces se produjo la escasez mundial de memoria.

En En junio de 2026, Apple subió los precios de los MacBook Pro en aproximadamente $300 en toda la gama.. Tras la subida de precios, el modelo básico M5 Pro de 14 pulgadas ronda los $2,499, y un M5 Pro de 14 pulgadas configurado con 64 GB y un SSD de 1 TB se sitúa en algún punto del rango de $2,799 y $2,999, dependiendo del día y del distribuidor. B&H y otros distribuidores han estado aplicando descuentos de entre $300 y $400 a las configuraciones del M5 Pro de 48 GB y 64 GB, por lo que merece la pena comprobarlo antes de comprar directamente.

En Alemania, la gama M5 Pro tiene un precio inicial de 2.199 €, aunque en tiendas como Edustore se pueden encontrar precios para el sector educativo que bajan hasta los 1.979 €. Las configuraciones de 64 GB resultan considerablemente más caras una vez incluido el IVA 19%.

Hay dos factores que influyen en tu decisión:

  • De 48 GB a 64 GB en el M5 Pro: Históricamente, se trataba de una ampliación de $200 a $400, pero el precio de la ampliación de la memoria RAM se disparó entre 50 y 67% en muchas configuraciones tras la subida de precios de junio.
  • M5 Pro 64 GB → M5 Max 128 GB: un aumento considerable. El M5 Max tenía un precio inicial de $3.599 (14 pulgadas) y $3.899 (16 pulgadas) antes de la subida de precios, y las ampliaciones de memoria de 64 GB y 128 GB del M5 Max prácticamente duplicaron su precio en junio. Un modelo de 16 pulgadas con todas las prestaciones supera ahora los $10,000.

Comprueba todos los precios de esta sección antes de comprar. El mercado de la memoria en 2026 cambia cada mes, por lo que cualquier información que se publique aquí tiene una vigencia limitada.


¿Por qué precisamente 64 GB? El argumento del «punto óptimo»

La afirmación sobre el “punto óptimo” no se refiere a que 64 GB sean una cifra mágica. Se refiere a lo que cada nivel de memoria excluye en realidad.

Lo que no se puede hacer en cada nivel

16 GB / 24 GB — Puedes ejecutar modelos de 7B a 8B sin problemas y modelos de 14B con una cuantificación agresiva. No puedes ejecutar nada de la clase de 30B+ con un contexto significativo. Te pasarás el tiempo gestionando la memoria en lugar de utilizar los modelos.

32 GB — Funciona con modelos densos de 14B y algunos modelos MoE más pequeños. Pero en cuanto añades una caché KV para un contexto de más de 32K, además de Chrome, tu IDE y un daemon de Docker, te encuentras en una situación de presión de memoria. Este es el nivel en el que la gente se convence a sí misma de que la IA local no funciona.

48 GB — Es realmente bueno. Ejecuta sin problemas modelos densos de clase 32B. El problema es el margen de memoria: un modelo de 70B a Q4 ocupa aproximadamente 40 GB, lo que técnicamente cabe, pero no deja nada para el resto del equipo. Al final, tienes que cerrar aplicaciones para ejecutar un modelo, y ese es precisamente el obstáculo que acaba con los flujos de trabajo locales.

64 GB — Este es el punto en el que puedes sujetar un modelo 70B Q4 o un modelo MoE de 106B parámetros en memoria y Mantén todo tu entorno de trabajo activo. No hace falta salir de Slack. No hace falta cerrar los contenedores. Abres un modelo y sigues trabajando.

128 GB (gama M5 Max) — Desbloqueos gpt-oss-120b y la clase 120B+. Es realmente útil si es lo que necesitas, y realmente cara si no lo es.

El argumento del “punto óptimo” es, en realidad, el argumento de «ejecutar un modelo serio Y todo lo demás». Esa es la diferencia entre que la IA local sea algo que se muestra en una demostración y algo que se utiliza.

Pero los 64 GB tienen un límite máximo inamovible, y es mejor que lo sepas ya.

El problema del gpt-oss-120b

gpt-oss-120b En MXFP4, la cuantificación requiere aproximadamente 63 GB solo para los pesos. Según mediciones independientes realizadas en un M5 Max de 128 GB con MLX, el consumo máximo de memoria es de unos 64,4 GB con un contexto de 4.096 tokens y 64,9 GB con un contexto de 16 K.

En un equipo de 64 GB, en el que el espacio útil real es de entre 52 y 60 GB, eso no cabe. No es que “cabe a duras penas”, es que no cabe.

Si ves una afirmación que diga que gpt-oss-120b Si funciona con 64 GB, desconfía. Se trata de un modelo de 128 GB. Este es el argumento más claro a favor de dar el salto al M5 Max, y si ese modelo te interesa, ningún razonamiento sobre el «punto óptimo» cambia las cuentas.


Paso 1: Desbloquea tu memoria (haz esto primero)

Hay algo que la mayoría de los compradores no saben: macOS no permite que la GPU utilice toda la memoria RAM.

De forma predeterminada, macOS limita la memoria dedicada a la GPU a unos 75% del total. En un ordenador de 64 GB, eso equivale a unos 51,84 GB que se pueden utilizar para los pesos del modelo, y el resto se reserva para el sistema.

Puedes activarlo con un solo comando. Sin necesidad de reiniciar ni de modificar la Protección de Integridad del Sistema.

Nota: la clave moderna es iogpu.wired_limit_mb. Las guías más antiguas hacen referencia a debug.iogpu.wired_limit, que ha sido sustituida. Si encuentras algún tutorial en el que se utilice la clave antigua, significa que está desactualizado.

Aumentar el límite

bash

# Establece el límite de memoria fija de la GPU en 60 GB (60 × 1024 = 61 440 MB)
sudo sysctl iogpu.wired_limit_mb=61440

# Comprueba que el cambio se ha aplicado
sysctl iogpu.wired_limit_mb

# Restablece el valor predeterminado de macOS en cualquier momento
sudo sysctl iogpu.wired_limit_mb=0

Haz que sea persistente

La configuración se restablece al reiniciar el sistema. Para que se mantenga, añádela a /etc/sysctl.conf:

bash

echo "iogpu.wired_limit_mb=61440" | sudo tee -a /etc/sysctl.conf

Como alternativa, crea un LaunchDaemon o añade el sysctl ejecuta un script de inicio de sesión si prefieres no modificarlo /etc/sysctl.conf.

¿Hasta dónde hay que llegar?

Deja entre 4 y 8 GB para macOS. En un equipo de 64 GB, 60 GB (61 440 MB) es una configuración ambiciosa, pero viable si no tienes muchas otras aplicaciones en ejecución. 56 GB (57 344 MB) es la configuración más segura para el uso diario.

No asignes 100%. Se producirán «beachballs», bloqueos de la aplicación o un reinicio forzado, y en una máquina que se encuentre en pleno proceso de inferencia, eso significa perder todo lo que estuvieras haciendo.

Presupuesto práctico para un M5 Pro de 64 GB:

  • Por defecto: ~48–52 GB de espacio útil
  • Aumentado a 56 GB: suficiente para un modelo 70B del cuarto trimestre, además del contexto
  • Se ha aumentado a 60 GB: capacidad máxima, con un espacio mínimo para otras aplicaciones

Esa diferencia —48 GB frente a 58 GB— suele ser la que marca la diferencia entre que un modelo se ejecute en la GPU o tenga que recurrir a la CPU, lo que reduce drásticamente el rendimiento. Son los cinco minutos de configuración que más te valdrán.

Un requisito más

MLX requiere macOS 26.2 o una versión posterior para poder utilizar realmente los aceleradores neuronales del M5. Si tienes una versión anterior, te estás perdiendo la mejora generacional más importante. Comprueba si hay actualizaciones de software antes de realizar cualquier prueba de rendimiento.


Paso 2: Crea tu pila

A continuación te explico todo el proceso, paso a paso. Calcula unos 30 minutos, más el tiempo de descarga.

2.1 — Fundamentos

bash

# Instala Homebrew si aún no lo tienes
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

# Instala uv, un gestor de paquetes de Python rápido, mucho mejor que pip para esto
brew install uv

# Opcional, pero recomendado: un gestor de versiones de Python
brew install python@3.12

2.2 — MLX (el marco de aprendizaje automático nativo de Apple)

MLX es el marco de trabajo de matrices propio de Apple, diseñado específicamente para la arquitectura de memoria unificada de Apple Silicon. Es la opción más rápida para la inferencia de modelos de lenguaje grandes (LLM) en un Mac y debería ser tu opción predeterminada.

bash

# Crear un entorno dedicado
uv venv ~/mlx-env
source ~/mlx-env/bin/activate

# Instalar mlx-lm
uv pip install mlx-lm

# Pruébalo: esto descarga y ejecuta un modelo
mlx_lm.generate \
  --model mlx-community/Qwen3.6-27B-4bit \
  --prompt "Explica la arquitectura de memoria unificada en tres frases."

Si eso genera texto, tu pila funciona.

2.3 — LM Studio (la interfaz gráfica de usuario)

Descargar desde lmstudio.ai. Esta es la forma más intuitiva de explorar, descargar y ejecutar modelos, y Apple lo demostró durante la presentación del M5 Pro, lo que da una idea de hasta qué punto se ha generalizado la inferencia local.

La función más útil de LM Studio para los desarrolladores es el servidor integrado compatible con OpenAI. Actívalo en la sección Desarrollador pestaña y expone un punto final en http://localhost:1234/v1 con el que pueda comunicarse cualquier cliente compatible con OpenAI.

2.4 — Ollama (la CLI y el servidor)

bash

brew install ollama

# Iniciar el servidor
ollama serve

# En otra terminal, descargar y ejecutar un modelo
ollama pull gpt-oss:20b
ollama run gpt-oss:20b

Actualización importante para 2026: en El 30 de marzo de 2026, Ollama 0.19 cambió su backend para Apple Silicon, pasando de llama.cpp a MLX. Esto duplicó aproximadamente la velocidad de decodificación. Según las propias mediciones de Ollama con el M5 Max ejecutando Qwen3.5-35B-A3B, el prefill pasó de 1.154 a 1.810 tokens/segundo y la decodificación de 58 a 112 tokens/segundo; además, su versión int4 elevó el prefill a 1.851 y la decodificación a 134.

Si la última vez que probaste Ollama en un Mac fue antes de esa versión, tu percepción sobre su rendimiento está desactualizada.

2.5 — Dibujar cosas (imágenes y vídeos)

Instálala desde la Mac App Store. Es gratuita, nativa, está optimizada para Metal y, actualmente, es la mejor herramienta de generación de imágenes para Apple Silicon. Su implementación de Metal FlashAttention v2.5 funciona hasta 4,6 veces más rápido en el M5 que en el M4, y es compatible con el entrenamiento de LoRA en el propio dispositivo.

2.6 — ComfyUI (cuando necesitas pipelines)

bash

brew install comfyui

ComfyUI te ofrece un control del flujo de trabajo basado en nodos que Draw Things no puede igualar. Se ejecuta en el backend de MPS y es aproximadamente un 20% más lento que Draw Things en Apple Silicon para un trabajo equivalente; además, presenta verdaderos problemas con los puntos de control FP8 en Metal. Úsalo cuando necesites flujos de trabajo complejos; utiliza Draw Things cuando necesites velocidad.

2.7 — Comprobarlo todo

bash

# Comprueba si el límite de memoria está bloqueado
sysctl iogpu.wired_limit_mb

# Comprueba que MLX detecta tu GPU
python -c "import mlx.core as mx; print(mx.default_device())"

# Comprueba que Ollama está en funcionamiento
curl http://localhost:11434/api/tags

Parte 1: Ejecución de modelos de lenguaje a gran escala (LLM)

Esto es lo que mejor se le da al M5 Pro de 64 GB, y merece la pena entenderlo ¿por qué? antes de consultar la lista de modelos.

El único concepto que lo explica todo: ancho de banda frente a potencia de cálculo

La inferencia LLM consta de dos fases, y cada una de ellas supone una carga muy diferente para la máquina.

Relleno automático (procesamiento rápido) es la pasada por los datos de entrada antes de que aparezca el primer token. Es limitado por el cálculo. Por eso, pegar un archivo de 40 000 tokens en un agente de programación local solía suponer varios minutos de silencio en un Mac, mientras que una tarjeta NVIDIA lo procesaba en cuestión de segundos.

Decodificación (generación de tokens) está generando cada token posterior. Es limitado por el ancho de banda de la memoria. Cada token generado requiere leer los pesos del modelo desde la memoria. Cuanto más rápida sea la memoria, más rápido se generan los tokens. Es casi así de sencillo.

Esta división explica toda la propuesta del M5 Pro:

  • Su 307 GB/s El ancho de banda establece un límite máximo estricto para la velocidad de decodificación. Aproximadamente el doble de los 153 GB/s del M5 básico, y aproximadamente la mitad de los 614 GB/s del M5 Max de 40 núcleos.
  • Su Aceleradores neuronales — uno en cada núcleo de la GPU, una novedad de la generación M5 — mejora considerablemente el prefill.

El propio equipo de investigación MLX de Apple publicó en noviembre de 2025 unos resultados que comparaban el M5 básico con el M4 básico en el modelo Qwen3-14B-4bit: El tiempo hasta el primer token fue 4,06 veces más rápido, mientras que la generación de tokens solo mejoró en un factor de 1,19. Esa modesta mejora en la decodificación se corresponde exactamente con el aumento del ancho de banda (120 GB/s → 153 GB/s). La enorme mejora en el prellenado se debe íntegramente a los aceleradores neuronales.

Apple promociona las variantes Pro y Max afirmando que ofrecen un procesamiento de prompts de LLM hasta cuatro veces más rápido que el de los M4 Pro y M4 Max. El mecanismo es idéntico, aunque aún hay poca información disponible sobre la confirmación del rellenado previo específica del M5 Pro.

En la práctica, esto significa lo siguiente: El M5 Pro supone una mejora revolucionaria con respecto a los Mac anteriores al M5 para el trabajo con contextos largos y la programación «agente», donde predomina el rellenado automático. En cambio, supone una mejora modesta en cuanto al rendimiento puro del chat, donde predomina la decodificación.

La revolución del MoE (por qué los Mac de repente mejoraron)

Las arquitecturas de «mezcla de expertos» han cambiado las reglas del juego para las máquinas de memoria unificada, y si no entiendes nada más de esta guía, que al menos entiendas esto.

Un modelo MoE tiene un número enorme de parámetros totales, pero solo activa una pequeña fracción de ellos por token. gpt-oss-120b tiene un total de 117 000 millones de parámetros, pero activa aproximadamente 5.1 mil millones por token.

  • Parámetros totales determina tu memoria requisito — del que los Mac disponen en abundancia.
  • Parámetros activos determina tu velocidad de decodificación — lo cual está limitado por el ancho de banda.

Por lo tanto, un modelo MoE necesita el recurso del que los Mac disponen en abundancia y consume muy poco del recurso del que carecen. Un modelo MoE bien elegido en un Mac de 64 GB ofrece una calidad cercana a la de los modelos más avanzados con la velocidad de decodificación de un modelo mucho más pequeño.

Esta es la razón por la que un portátil con 307 GB/s puede resultar competitivo frente a tarjetas que funcionan a 1.700 GB/s en determinadas cargas de trabajo. Opta por los modelos MoE siempre que puedas.

¿Qué modelos encajan realmente? — La tabla

Las cifras medidas que figuran a continuación proceden de la base de datos de pruebas comparativas de la comunidad oMLX para el M5 Pro de 20 núcleos con 64 GB. Las estimaciones están claramente señaladas. No te fíes de los números de token o de seguridad sin marcar que encuentres en otros sitios para este chip — Son muy pocas las personas que han publicado mediciones reales del M5 Pro.

ModeloTipoHuellaDecodificación (tok/s)Prellenado (tok/s)Veredicto
gpt-oss-20b (MXFP4)MoE~12 GB66–80 ✅ medido1.500–2.200El coche para el día a día. Rápido, versátil y compacto.
Qwen3.5-35B-A3B / Qwen3-30B-A3B (4.º trimestre)MoE~20 GB~55–70 (aprox.)AltaLa mejor relación calidad-precio por GB. La opción más eficiente.
Qwen3.6-27B (4 bits)Denso~16 GB17.8 ✅ medido470Ejemplo representativo de la clase de densidad 27–35B.
GLM-4.5 / 4.6 Aire (106B-A12B)MoE~40 GB o más~30AltaUn razonamiento «casi pionero» que realmente encaja.
Llama 3.3 70B (Q4_K_M)Denso~40 GB~7–12 (aprox.)ModeradoAdecuado para el procesamiento por lotes; de utilidad limitada en modo interactivo.
Llama 3.3 70B (Q5_K_M)Denso~49 GB~6–10 (aprox.)ModeradoCabe, pero va un poco justo. Aumenta primero el límite de memoria.
Qwen3 14B / 32B, Gemma 3, Mistral Small, Devstral, Command-ADenso8-24 GB20–60+BienTodo muy cómodo. Elige según la tarea.
gpt-oss-120b (MXFP4)MoE~63 GBNo encaja. Se requiere un dispositivo de 128 GB.
Qwen3-235B-A22B (ternario de 1,58 bits)MoE~53 GB~5.6BajoTécnicamente funciona. Es un truco de salón, no un flujo de trabajo.

La bonificación por lotes: gpt-oss-20b en la escala M5 Pro, equivale aproximadamente a 142 tok/s con un tamaño de lote de 8. Si estás ejecutando agentes, bucles de evaluación o cualquier carga de trabajo con solicitudes paralelas, el rendimiento mejora considerablemente con respecto a la cifra correspondiente a un solo flujo.

Una visión realista de los modelos 70B

No hay ninguna cifra publicada ni medida de forma independiente sobre la capacidad de decodificación del M5 Pro con Llama 3.3 70B. La estimación de 7-12 tok/s se ha extrapolado a partir del ancho de banda.

A modo de referencia: un M4 Max de 128 GB a 546 GB/s registra aproximadamente entre 18 y 20 tok/s en el mismo modelo. El M5 Pro alcanza los 307 GB/s. Las cifras no son alentadoras.

A una velocidad de 7-12 tok/s se obtienen aproximadamente entre 5 y 9 palabras por segundo, lo cual es más lento que la velocidad de lectura cómoda. Esto está bien para tareas en segundo plano, el procesamiento de documentos y los lotes que se ejecutan durante la noche. Sin embargo, resulta frustrante para un chat interactivo.

Mi recomendación sincera: En un M5 Pro de 64 GB, utiliza los modelos densos de 70 mil millones de parámetros como herramientas para cargas de trabajo por lotes y recurre a los modelos MoE para cualquier tarea interactiva.

Cuantización: qué elegir realmente

FormatoPérdida de calidadCuándo utilizarlo
Q4_K_M (GGUF)~1–2%Predeterminado. La mejor relación entre velocidad y calidad.
MLX de 4 bits~1–2%Configuración predeterminada en Mac. Aproximadamente 10% menos de memoria y entre 15 y 30% más rápido que un GGUF equivalente.
Q5_K_M / MLX de 6 bits<1%Cuando dispones de margen dinámico y quieres un resultado prácticamente sin pérdidas.
Q6_KInsignificanteTrabajo en el que la calidad es fundamental, con capacidad de memoria de sobra.
Q8 / FP16NingunoRara vez merece la pena en un portátil. Reduce a la mitad o a una cuarta parte el presupuesto para el tamaño del modelo.
MXFP4NativoNo es una elección, es así como gpt-oss barcos.
1,58 bits ternarioGraveSolo para meter a la fuerza un modelo que, de otro modo, no cabría.

Regla general: 4 bits si lo que buscas es velocidad y que quepa todo; 6 bits cuando prima la calidad y dispones de espacio suficiente; y mejor no uses 8 bits en un portátil.

MLX frente a llama.cpp: ¿qué entorno de ejecución?

La respuesta breve es MLX, con una salvedad.

  • Con unos ~14 mil millones de parámetros: MLX supera a llama.cpp por 20–87%. No hay color.
  • Por encima de ~27B: Ambos factores convergen, ya que el ancho de banda de la memoria se convierte en el cuello de botella y el tiempo de ejecución deja de ser relevante.
  • Memoria: MLX consume aproximadamente 10% menos que GGUF con una cuantificación equivalente.
  • La salvedad: Con más de 30 000 contextos de tokens, MLX puede llegar a ser de hasta 50% más lento que «llama.cpp» con la función «Flash Attention» activada. Esto depende del modelo y del contexto.

Si sueles trabajar con contextos muy largos, realiza pruebas de rendimiento con tu carga de trabajo real. De lo contrario, opta por el MLX.

Ejecutar un servidor API local

mlx-lm La versión 0.18 y posteriores incluyen un servidor compatible con OpenAI con procesamiento por lotes continuo:

bash

mlx_lm.server \
  --model mlx-community/gpt-oss-20b-MXFP4 \
  --port 8080

Ahora, cualquier aplicación que utilice la API de OpenAI puede usar tu modelo local:

bash

curl http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "local",
    "messages": [{"role": "user", "content": "Escribe una línea de comando de Bash para buscar archivos grandes."}]
  }'

Ese punto final constituye la base de todo lo que se explica en la sección de flujos de trabajo que figura a continuación.


Parte 2: Generación de imágenes

La generación de imágenes es el ámbito en el que el M5 Pro ofrece mejores resultados de lo que cabría esperar por su ancho de banda, por una razón muy sencilla: la difusión es limitado por el cálculo, no están limitados por el ancho de banda, y los modelos son lo suficientemente pequeños como para que la memoria nunca suponga una limitación en un equipo de 64 GB.

Rendimiento por modelo

ModeloTamañoMemoriaTiempo por imagen de 1024×1024Notas
SDXL3,5 mil millones~7 GB~7 s a 30 pasos (M5 Max)La opción más rápida y de mayor calidad. Un ecosistema LoRA enorme.
FLUX.1 [rápido]12B~7 GB (4.º trimestre)~20-25 s en 4 pasosDiseñado para la rapidez. Apache-2.0.
FLUX.1 [dev]12B~10 GB (P6)~50 s en 20 pasos (clase M4)El referente en materia de calidad.
FLUX.2 [Klein]4B destilado~8 GB~40 añosMás nuevo, más pequeño, más rápido.
FLUX.2 [dev]Grande24 GB o másVarios minutosSe requiere la mejor calidad y mucha paciencia.
SD 3,5Varía10-20 GBDecenas de segundosUn término medio sólido.
Qwen-Image / Qwen-Image-EditVaría15-25 GBDecenas de segundosExcelente para la visualización y edición de texto.
HiDream, ChromaVaría10-20 GBVaríaMerece la pena echarle un vistazo por su variedad de estilos.

El equipo de investigación en aprendizaje automático de Apple midió el rendimiento de FLUX-dev-4bit al generar una imagen de 1024×1024 más de 3,8 veces más rápido en el M5 que en el M4 gracias a MLX. Esa mejora se debe a los aceleradores neuronales y se aplica a toda la familia M5.

Aún no se ha publicado ninguna prueba de rendimiento específica para el M5 Pro en cuanto a segundos por imagen, por lo que debes considerar la tabla anterior como cifras propias de la clase M4, con una mejora significativa esperada para el M5. En la práctica: puedes esperar que FLUX.1 [schnell] se procese en bastante menos de 20 segundos y que SDXL se procese en menos de diez segundos.

Con 64 GB puedes ejecutar estos modelos a FP16 sin cuantificación, lo que supone una auténtica ventaja en cuanto a calidad frente a los equipos de 16 GB y 24 GB que se ven obligados a utilizar el modo Q4.

Herramientas: qué utilizar

Dibujar cosas — La opción por defecto. Metal nativo, sin entorno de Python que pueda fallar, Metal FlashAttention v2.5 que funciona hasta 4,6 veces más rápido en el M5 que en el M4, y entrenamiento LoRA en el propio dispositivo. Gratis en la App Store.

ComfyUI — para flujos de trabajo basados en nodos, cadenas de ControlNet y flujos de trabajo de varias etapas. Aproximadamente un 20% más lento que Draw Things en Apple Silicon. Hay que tener cuidado con los puntos de control de FP8, que suelen fallar en Metal.

DiffusionKit — El kit de herramientas de difusión propio de Apple, con el respaldo de MLX. Merece la pena estar atento.

Mochi Diffusion, InvokeAI — Ambas opciones son válidas, ambas están bien.

Evita: DiffusionBee está prácticamente abandonado. Automatic1111 y Forge funcionan técnicamente a través de MPS, pero son lentos y su mantenimiento en Mac es deficiente.

Paso a paso: tu primera imagen local

  1. Instalar Dibujar cosas desde la Mac App Store.
  2. Ábrelo y ve al gestor de modelos (el icono situado en la parte superior del panel izquierdo).
  3. Descargar FLUX.1 [rápido] — unos 7 GB en el cuarto trimestre, o bien descárgate la versión FP16, ya que tienes memoria suficiente.
  4. Conjunto Pasos hasta 4 (el «schnell» se destila precisamente para esto) y Tamaño a 1024×1024.
  5. Escribe un comando y pulsa Generar.
  6. La primera ejecución incluye la carga del modelo. Las generaciones posteriores son mucho más rápidas.

Entrenamiento de LoRA en el propio dispositivo

Un dispositivo de 64 GB permite ajustar con precisión los modelos de imagen de forma local, una capacidad que, sin duda, se subestima. Draw Things es compatible directamente con el entrenamiento LoRA, y MLX admite LoRA y QLoRA tanto para modelos de imagen como de lenguaje.

Un modelo LoRA pequeño, basado en 20-50 imágenes, se procesa de la noche a la mañana en un M5 Pro, y nunca sale de tu ordenador. Para cualquiera que trabaje con material de clientes o recursos propios, eso es más importante que la velocidad.


Parte 3: Creación de vídeos — La sección sincera

Aquí es donde tengo que ser directo contigo, porque gran parte del contenido sobre este tema no lo es.

En 2026, la creación de vídeos locales en cualquier Mac es lenta. No es que sea “más lento que una 4090”. Es lo suficientemente lento como para cambiar tu forma de trabajar.

¿Por qué los Mac tienen dificultades precisamente en este aspecto?

La difusión de vídeos está muy limitado por el cálculo. A diferencia de la decodificación de modelos de lenguaje grande (LLM), en la que el amplio ancho de banda de memoria del Mac es el recurso clave, la generación de vídeo exige al máximo la potencia de cálculo bruta de la GPU —precisamente el aspecto en el que la GPU de un portátil de 20 núcleos sale perdiendo frente a una tarjeta gráfica dedicada.

Los aceleradores neuronales del M5 ayudan. Pero no bastan para salvar una brecha tan grande.

Las cifras, sin adornos

Wan 2.2 (Alibaba, Apache-2.0, disponible como modelo de 14 000 millones de parámetros y como variante densa de 5 000 millones de parámetros para la conversión de texto e imágenes a vídeo): en un M1 Max de 64 GB con una compilación GGUF, un Un vídeo de 2 segundos a 832×480 tardó 82 minutos en grabarse. Un vídeo de 5 segundos duraría más de tres horas.

A modo de comparación, el mismo modelo TI2V-5B en una RTX 4090 de 24 GB tarda unos 5 segundos en renderizar a 720p en aproximadamente 9 minutos.

Un M5 Pro es considerablemente más rápido que un M1 Max, pero lo importante es el orden de magnitud.

Una limitación fundamental del metal: Los puntos de control del FP8 no funcionan en Metal — el Float8_e4m3fn Este tipo de datos no es compatible. Debes utilizar las compilaciones GGUF. Esto confunde a mucha gente que sigue tutoriales orientados a NVIDIA, y además significa que Las plantillas FP8 del LTX-2 no funcionan en absoluto en Mac.

La buena noticia: Los modelos destilados más recientes están cambiando esta situación. Iván Fioravanti midió el destilado LTX 2.3 22B en Draw Things generando un vídeo de 5 segundos en unos 121 segundos en un M5 Max de 40 núcleos — superando, de hecho, a un M3 Ultra de 80 núcleos, que tardó 206 segundos.

Ese es un resultado real y un cambio auténtico. Pero fíjate en el chip: un M5 Pro de 20 núcleos será considerablemente más lento que un M5 Max de 40 núcleos en tareas que dependen tanto de la potencia de cálculo como esta. Calcula varios minutos en lugar de dos.

Otros modelos — HunyuanVideo, Mochi 1, CogVideoX, FramePack, Stable Video Diffusion — van desde lentos hasta imposibles de usar en Mac. Varios de ellos están optimizados para CUDA y requieren soluciones alternativas.

El veredicto en vídeo

La reproducción de vídeos locales en un M5 Pro de 64 GB es una opción viable para realizar experimentos ocasionales y con paciencia. — Vídeos cortos, resoluciones más bajas, modelos simplificados, a través de Draw Things. Funciona. Crearás cosas.

Si quieres un rendimiento real, alquila una GPU. RunPod, Vast.ai y Lambda pueden ejecutar una 5090 o una H100 por unos pocos dólares la hora y producir en minutos lo que tu portátil tarda una hora en hacer. En el caso concreto del vídeo, la diferencia de costes es abismal.

Si la creación de vídeos es tu principal Si tienes mucho trabajo, cómprate un ordenador con NVIDIA o reserva presupuesto para la nube. No compres un Mac y te limites a cruzar los dedos.

Si, aun así, quieres intentarlo: paso a paso

  1. Abrir Dibujar cosas y cambia al gestor de modelos de vídeo.
  2. Descargar un destilado modelo: LTX 2.3 o una versión GGUF de Wan 2.2. Los modelos «destilados» marcan la diferencia entre minutos y horas.
  3. Empieza poco a poco: 480p, 2 segundos, bajo número de pasos. Establece tus tiempos de referencia antes de ampliar la escala.
  4. Conéctalo y utiliza el modo de alta potencia. Así se pondrán en marcha los ventiladores.
  5. Determina la resolución y la duración solo después de saber cuánto tiempo real te lleva un clip corto.

Nunca utilices los puntos de control de FP8 en un Mac. GGUF o nada.


Parte 4: Flujos de trabajo reales que merece la pena crear

Las pruebas de rendimiento no son lo importante. Esto es lo que la gente hace realmente con este ordenador.

Flujo de trabajo 1: Un agente de codificación local

Esta es la configuración más cara de la lista y se tarda unos diez minutos en realizarla.

Paso 1: Inicia un servidor de modelos. O bien, en la pestaña «Desarrollador» de LM Studio (punto de acceso en http://localhost:1234/v1) o bien:

bash

mlx_lm.server --model mlx-community/gpt-oss-20b-MXFP4 --port 1234

Paso 2: Dirige tu editor hacia allí.

VS Code con Cline o Continue: Añadir un proveedor compatible con OpenAI con una URL base http://localhost:1234/v1, cualquier clave API que no esté vacía y el nombre de tu modelo.

Zed: Configura un proveedor personalizado compatible con OpenAI en los ajustes.

Aider (terminal):

bash

export OPENAI_API_BASE=http://localhost:1234/v1
export OPENAI_API_KEY=local
aider --model openai/gpt-oss-20b

Paso 3: Elige el modelo adecuado. gpt-oss-20b Y tanto Qwen3-Coder-30B-A3B como el M5 son codificadores locales potentes. Ambos son de tipo MoE, que es justo lo que buscas: una decodificación rápida, y las mejoras en el prellenado del M5 hacen que los contextos de archivos grandes ya no se queden atascados durante minutos.

Esto es lo que obtienes: Iteraciones ilimitadas sin coste por token, sin límites de frecuencia y con un código que nunca sale de tu equipo. En el caso de bases de código propias o de clientes, este último punto suele ser la única justificación.

Flujo de trabajo 2: RAG privado sobre tus documentos

Gracias a las incrustaciones locales y a un modelo de entre 27 000 y 70 000 millones, los documentos confidenciales —contratos, historiales médicos, investigaciones internas, datos financieros— se pueden buscar y resumir sin que ni un solo byte salga de tu portátil.

El nivel de 64 GB es importante en este caso concreto porque los pipelines RAG almacenan simultáneamente en memoria un modelo de incrustación, un almacén de vectores y un modelo de generación. Con 32 GB, hay que realizar intercambios constantemente; con 64 GB, no.

Flujo de trabajo 3: Generación por lotes durante la noche

Pon en cola unos cientos de generaciones de imágenes en Draw Things, o ejecuta un trabajo largo de procesamiento de documentos a través de mlx_lm.server, y deja que la máquina trabaje mientras duermes. Una vez enchufados, los modelos 70B y los lotes de imágenes que parecen demasiado lentos al procesarlos de forma interactiva se pueden procesar perfectamente durante la noche.

Flujo de trabajo 4: Enrutamiento híbrido (la estrategia que la mayoría de la gente debería adoptar)

No pienses en la opción local frente a la nube como una disyuntiva. Decide en función de cada tarea:

Enviar a un destinatario localAPI «Enviar a la nube»
Cualquier cosa relacionada con la privacidadLas tareas de razonamiento más difíciles
Procesamiento masivo y por lotesCasos que requieren una auténtica calidad de vanguardia
Bucles de agentes con muchas llamadas baratasResultados puntuales de gran importancia
Iteración y experimentaciónTrabajo que requiere el modelo más reciente
Trabajo sin conexiónVentanas de contexto muy largas

Aquí es donde reside la mayor parte del valor. El sistema local se encarga del volumen, las iteraciones y la privacidad. La nube se encarga de las tareas complejas 5%.

La propia pila de IA de Apple (vale la pena conocerla)

En Marco de modelos base Ofrece a los desarrolladores acceso directo desde Swift al modelo en dispositivo de Apple —aproximadamente 3.000 millones de parámetros, gratuito, privado y sin conexión—, con generación guiada y llamadas a herramientas integradas.

Las actualizaciones de 2026 son más importantes que la versión original: datos de visión, ejecución del lado del servidor y un Modelo de lenguaje protocolo que permite respaldar una sesión con el modelo de Apple, un modelo en la nube, o un modelo MLX local a través de MLXLanguageModel. Si desarrollas aplicaciones para Mac o iOS, esa es una vía clara para incorporar funciones híbridas de IA en el propio dispositivo.

Xcode 26 Además, incluye herramientas de programación LLM integradas que pueden utilizar ChatGPT, otros proveedores a través de una clave API o un modelo local que se ejecute en tu Mac.


Convivir con ello: temperatura, batería y ruido

Las especificaciones técnicas no te dicen cómo es utilizar una máquina. Unas cuantas observaciones sinceras.

Los de 14 pulgadas aceleran más que los de 16 pulgadas. Notebookcheck ha señalado una marcada reducción del rendimiento por sobrecalentamiento en el MacBook Pro de 2026 bajo carga prolongada, con un comportamiento irregular de la CPU incluso en el modo de alta potencia. El modelo de 16 pulgadas cuenta con mayor capacidad de refrigeración y una batería de mayor capacidad. Si tienes previsto realizar sesiones prolongadas de inferencia, el modelo de 16 pulgadas es el más adecuado. — Se trata de una diferencia funcional real, no de una cuestión de preferencias.

No todas las cargas de trabajo de IA son iguales desde el punto de vista térmico. La decodificación de LLM es relativamente suave: está limitada por la memoria, por lo que la GPU no se satura por completo y los ventiladores suelen permanecer silenciosos. La difusión de imágenes y vídeos está limitada por la capacidad de cálculo, lo que saturará tu GPU, hará que los ventiladores rueden a un nivel audible y agotará la batería rápidamente.

La realidad de las baterías: Las sesiones cortas de LLM se pueden realizar sin conexión. El trabajo de difusión prolongado agotará la batería en un par de horas y provocará una limitación térmica antes de eso. Mantén el dispositivo enchufado para cualquier tarea exigente.

Modos de alimentación: El modelo de 16 pulgadas cuenta con el modo de alta potencia, que conviene activar para tareas prolongadas. El modo de bajo consumo reduce considerablemente la velocidad de inferencia, por lo que es mejor evitarlo al ejecutar modelos.

Hábito práctico: Sin enchufar, para chatear y recibir ayuda con la programación. Enchufado, en modo de alta potencia, para procesar lotes de imágenes y vídeos.


Los contraargumentos sinceros

Una guía que solo expone un punto de vista es, en realidad, una estrategia de marketing. A continuación, te presentamos los argumentos en contra.

1. El M5 Max es realmente más rápido, y la diferencia es evidente

307 GB/s frente a 614 GB/s. Dado que la decodificación depende del ancho de banda, Un M5 Max de 40 núcleos genera tokens aproximadamente el doble de rápido en el mismo modelo. También se adapta a gpt-oss-120b, algo que el M5 Pro no puede hacer.

Si tu principal necesidad es la velocidad de decodificación de modelos grandes, el M5 Max es el equipo adecuado y el M5 Pro es una opción intermedia. El inconveniente es el precio: a partir de junio de 2026, esa actualización sale muy cara.

2. Un M4 Max con descuento podría superar a un M5 Pro nuevo

Este es el argumento que la mayoría de los compradores pasan por alto. El M4 Max tiene aproximadamente 546 GB/s de ancho de banda de memoria, una cifra considerablemente superior a los 307 GB/s del M5 Pro. En lo que respecta a la decodificación pura de modelos de lenguaje grande (LLM), un M4 Max de 64 GB suele superar a un M5 Pro de 64 GB.

Lo que se pierde: los aceleradores neuronales del M5, lo que se traduce en un precargamiento mucho más lento y una generación de imágenes más lenta.

La regla de decisión: Si sueles chatear principalmente con modelos grandes, podría decirse que un M4 Max de 64 GB con descuento es la mejor opción. Si te dedicas a la programación agente con contextos largos o a generar imágenes, las ventajas del M5 Pro en cuanto a prellenado y difusión son decisivas.

3. NVIDIA sigue liderando en potencia de cálculo

Una RTX 5090 tiene 32 GB de VRAM, lo que equivale aproximadamente a 1.792 GB/s — casi seis veces el ancho de banda del M5 Pro — además de una capacidad de cálculo mucho mayor. Para cualquier modelo que quepa en 32 GB, y para cualquier tarea en la que el rendimiento dependa de la capacidad de cálculo (vídeo, imágenes, precarga), no hay color.

La ventaja del Mac empieza precisamente donde acaba la memoria VRAM de 32 GB, e incluye la portabilidad, el funcionamiento silencioso, el bajo consumo energético y la posibilidad de hacer esto en un tren.

4. Los competidores con memoria unificada de 128 GB apuestan por la capacidad, no por la velocidad

NVIDIA DGX Spark / GB10: 128 GB a unos 273 GB/s, con CUDA. En gpt-oss-120b MXFP4: según pruebas independientes, su rendimiento se sitúa entre 34 y 39 tok/s.

AMD Strix Halo / Ryzen AI Max+ 395: 128 GB a unos 256 GB/s. Las propias cifras de AMD indican hasta 30 tok/s en el mismo modelo mediante llama.cpp. Los miniordenadores basados en este modelo son notablemente más baratos que cualquier Mac.

Ten en cuenta que ambos tienen inferior ancho de banda que el M5 Pro. Te ofrecen capacidad, no velocidad. Si tu objetivo es ejecutar modelos muy grandes a velocidades aceptables, en lugar de a gran velocidad, resultan más económicos. Si lo que buscas es velocidad, no son la solución.

5. Un Mac de sobremesa es un mejor ordenador fijo

A Mac Studio M3 Ultra alcanza los 512 GB a 800 GB/s. Si tu ordenador está siempre en el escritorio, es un dispositivo de IA local mucho mejor que cualquier MacBook Pro. Las ventajas de un portátil son la portabilidad, la batería y el silencio; si no las necesitas, no pagues por ellas.

6. No se puede ampliar la memoria. Nunca.

La memoria de Apple Silicon está integrada en el chip. Lo que compres es lo que tendrás durante toda la vida útil del equipo.

Dado que los modelos que saldrán al mercado en 2026 siguen mostrando una tendencia hacia unas huellas de MoE cada vez mayores, Comprar poca memoria RAM es el típico error del que siempre uno se arrepiente. Si tienes que elegir entre 48 GB y 64 GB, quédate con los 64 GB.


Cálculos de costes: local frente a la nube

Diagrama de decisión que muestra qué tareas de IA deben dirigirse a un modelo local y cuáles a una API en la nube

Hagamos las cuentas con sinceridad, porque a menudo se afirma que “lo local es más barato”, pero rara vez se calcula.

Máquina: aproximadamente 1 TP 4 T 2.800 por un M5 Pro de 64 GB, amortizado en un plazo de tres a cuatro años.

Tarifas de la API a partir de agosto de 2026 (por millón de tokens, entrada/salida):

ServicioEntradaResultado
Clase «Claude Sonnet»~$3~$15
Clase GPT-5~$1,75–$5~$14–$30
DeepSeek V4 Flash~$0.14~$0.28
Modelos abiertos alojados (gpt-oss, Llama)Aún más abajoAún más abajo

Alquiler de GPU en la nube: H100: alrededor de $3/hora; H200: alrededor de $5/hora bajo demanda.

El umbral de rentabilidad: Según los análisis publicados, el punto de equilibrio para un ordenador de consumo se sitúa aproximadamente en Entre 2 y 3 millones de tokens al día de forma constante durante unos doce meses frente a las API propietarias de gama media.

Son un montón de tokens. Por debajo de ese umbral, las API baratas —especialmente las del tipo DeepSeek— son realmente más económicas que las locales si solo se tiene en cuenta el coste puro de los tokens.

Entonces, ¿por qué comprar la máquina?

Porque el coste de las fichas no es el único coste:

  1. Privacidad. Tus datos nunca salen del dispositivo. En el ámbito jurídico, médico, financiero o en el desarrollo de código propio, esto suele ser una condición innegociable, independientemente del precio.
  2. Sin límites de frecuencia. Sin limitaciones de ancho de banda, sin colas, sin errores de capacidad a las 2 de la madrugada.
  3. Sin conexión. Aviones, trenes, mala conexión wifi en los hoteles, cortes en la red.
  4. Coste marginal cero. Esto cambia el comportamiento más de lo que la gente espera. Cuando cada experimento es gratuito, se realizan diez veces más. La ausencia de ansiedad por cada token durante las iteraciones se traduce en un aumento real de la productividad.
  5. De todas formas, necesitabas un portátil. La forma correcta de plantearlo no es “$2.800 para IA”, sino la diferencia entre el ordenador que habrías comprado y este.

La conclusión correcta es «híbrido». El entorno local para el volumen, la privacidad, la iteración y los bucles de agentes. La nube para los problemas complejos. Quien afirme que el entorno local sustituirá por completo a las API de Frontier en 2026 está exagerando; quien afirme que el entorno local no tiene sentido es porque no ha ejecutado un bucle de agentes a gran escala.


La guía de compra

Si tú…Compra estoPor qué
¿Buscas el portátil con IA local más equilibrado?M5 Pro de 64 GB, 16 pulgadasEjecuta modelos 8B–70B y MoE, generación rápida de imágenes y espacio de sobra para todo lo demás. Mejor gestión térmica que los de 14 pulgadas.
Necesidad gpt-oss-120b o modelos 120B+M5 Max 128 GBEl único portátil Mac que se adapta a ellos. Además, la velocidad de decodificación es aproximadamente el doble.
Sobre todo chateo con modelos de talla grande, busco una buena relación calidad-precioM4 Max de 64 GB con descuentoSu mayor ancho de banda (546 GB/s) supera al M5 Pro en la decodificación.
Tómate en serio la creación de vídeosNVIDIA (RTX 5090) o en la nubeTareas que dependen de la potencia de cálculo; los Mac son varias veces más lentos.
¿Quieres la máxima capacidad sin salirte del presupuesto?Mini-PC Strix Halo de 128 GB128 GB a un precio asequible, pero con un ancho de banda inferior al del M5 Pro.
Trabajar en un escritorioMac Studio M3 UltraHasta 512 GB a 800 GB/s.
Tenéis un presupuesto ajustadoM5 Pro 48 GBFunciona perfectamente en la clase 32B. Acepta el límite máximo de 70B/MoE.

Lo que no haría: Compra un equipo de 24 GB o 32 GB si quieres dedicarte en serio a la IA local. En cuestión de semanas te encontrarás con un límite y no podrás ampliar la memoria para superarlo.


Preguntas frecuentes

¿Serán suficientes 64 GB para la IA local en 2026? Sí, para la mayoría de las cargas de trabajo. Con 64 GB se pueden ejecutar sin problemas modelos de hasta unos 70 000 millones de parámetros con cuantificación de 4 bits, además de modelos de «mezcla de expertos» como GLM-4.6 Air, dejando espacio suficiente para el sistema operativo y las aplicaciones. La principal excepción es gpt-oss-120b, que necesita unos 63 GB solo para los pesos y requiere un ordenador de 128 GB.

¿Puede el M5 Pro ejecutar gpt-oss-120b? No. La compilación del MXFP4 necesita unos 63 GB para los pesos, y el consumo máximo de memoria registrado en un M5 Max oscila entre 64,4 y 64,9 GB, dependiendo de la longitud del contexto. En un equipo de 64 GB, con un espacio útil realista de entre 52 y 60 GB, no cabe. Este es un modelo de 128 GB.

¿Cuántas fichas por segundo produce el M5 Pro? Depende en gran medida del modelo. Cifras medidas para el M5 Pro de 20 núcleos con 64 GB: gpt-oss-20b a 66-80 tok/s de decodificación con un prellenado de 1.500-2.200 tok/s, y Qwen3.6-27B a 17,8 tok/s de decodificación con un prellenado de 470 tok/s. Los modelos más grandes y densos, como Llama 3.3 70B, se estiman entre 7 y 12 tok/s.

¿M5 Pro o M5 Max para los LLM locales? El M5 Max si tu prioridad es la velocidad de generación de tokens en modelos grandes: cuenta con 614 GB/s de ancho de banda de memoria frente a los 307 GB/s del M5 Pro, lo que prácticamente duplica la velocidad de decodificación, y admite 128 GB. El M5 Pro si buscas el mejor equilibrio entre precio, portabilidad y capacidad para modelos de hasta 70 000 millones.

¿Es práctico crear vídeos en un Mac? En realidad, no, en 2026. La difusión de vídeo depende de la potencia de cálculo, y los Mac son varias veces más lentos que una RTX 5090. Los modelos destilados ayudan —LTX 2.3 genera un clip de 5 segundos en unos 121 segundos en un M5 Max—, pero para obtener un rendimiento real, el alquiler de GPU en la nube es mucho más rápido y barato por clip.

¿Cómo puedo aumentar el límite de memoria de la GPU en macOS? Correr sudo sysctl iogpu.wired_limit_mb=61440 asignar 60 GB. Compruébalo con sysctl iogpu.wired_limit_mb y restablecerlo con un valor de 0. Añádelo a /etc/sysctl.conf para que se mantenga tras los reinicios. Deja siempre entre 4 y 8 GB para macOS.

¿MLX o llama.cpp en Apple Silicon? MLX en la mayoría de los casos. Supera a llama.cpp en 20–871 TP3T en modelos de menos de 14 000 millones, consume aproximadamente 101 TP3T menos de memoria y es a lo que Ollama 0.19 cambió en marzo de 2026. La excepción son los contextos muy largos: con más de 30 000 tokens, llama.cpp con Flash Attention puede ser hasta 501 TP3T más rápido.

¿Debería comprar el de 14 pulgadas o el de 16 pulgadas? El de 16 pulgadas es ideal para trabajos continuos con IA. Cuenta con un mayor margen térmico, una batería de mayor capacidad y el modo de alta potencia. El de 14 pulgadas se ralentiza notablemente bajo una carga continuada.

¿Un M4 Max rebajado es mejor que un M5 Pro nuevo? En cuanto a la decodificación pura de modelos de lenguaje grande (LLM), a menudo sí: el M4 Max alcanza aproximadamente los 546 GB/s, frente a los 307 GB/s del M5 Pro. El M5 Pro destaca en el procesamiento de prompts (hasta 4 veces más rápido) y en la generación de imágenes (más de 3,8 veces más rápido) gracias a sus aceleradores neuronales. Elige en función de qué tipo de carga de trabajo predomine en tu uso.


¿Qué vendrá después?

Hay algunos aspectos a los que conviene prestar atención, ya que podrían modificar la recomendación anterior.

Pruebas de rendimiento independientes del M5 Pro en los modelos 70B. Todavía nadie ha publicado una cifra de decodificación medida correctamente. Si los resultados en condiciones reales superan los 15 tok/s, el argumento de “comprar el Max para la decodificación” pierde mucha fuerza.

Más pequeño gpt-oss-120b cuantizaciones. Si una versión ocupa menos de 52 GB, el argumento del límite máximo de 64 GB pierde fuerza de la noche a la mañana.

Valores predeterminados de memoria en macOS. Si Apple aumenta la asignación predeterminada de la GPU por encima de 75%, todos los usuarios con un equipo de 64 GB obtendrán margen adicional de forma gratuita.

El Ministerio de Educación sigue ganando. La tendencia hacia modelos con un total elevado y pocos parámetros activos es lo mejor que le ha pasado a los ordenadores con memoria unificada. Cada nueva versión de MoE hace que los Mac sean relativamente más competitivos.

Caída de los precios de la API. Vuelve a calcular el umbral de rentabilidad entre la opción local y la nube cada seis meses. Va cambiando.


Conclusión

El MacBook Pro M5 Pro con 64 GB no es el ordenador con IA local más rápido que se puede comprar. Ni siquiera es el Mac más rápido. Lo que sí es, es la configuración en la que las diferentes características dejan de entrar en conflicto entre sí.

Ejecuta modelos lo suficientemente buenos como para resultar realmente útiles — gpt-oss-20b a 66-80 tok/s, GLM-4.6 Air a unos 30, generación de imágenes en segundos… y todo ello sin dejar de ser un portátil que puedes llevar contigo, que funciona con batería y que puedes utilizar como tu ordenador habitual. Los aceleradores neuronales de la generación M5 solucionaron la debilidad específica (el lento procesamiento de las indicaciones) que hacía que los Mac anteriores resultaran frustrantes para el trabajo con agentes y contextos largos.

Los límites son reales y conviene conocerlos: gpt-oss-120b No encaja: los modelos densos 70B son herramientas de procesamiento por lotes más que interlocutores de chat, y la generación de vídeos es algo que debe realizarse en la nube.

Si esos límites se ajustan a tu trabajo, esta es la máquina que necesitas. Si no es así, en los apartados anteriores te indican exactamente cuál debes comprar en su lugar, y eso es más útil que otro artículo en el que te digan que todo va bien.


Los precios, las versiones de los modelos y las cifras de referencia que figuran en este artículo se basan en los datos disponibles en agosto de 2026 y pueden variar rápidamente, sobre todo los precios de los Mac debido a la actual escasez de memoria. Comprueba las especificaciones actuales antes de realizar la compra.

Añade tu señal.

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

es_ESEspañol