Table des matières
- En bref — Le verdict
- Tout d'abord : oui, cette puce existe bel et bien
- Le problème des prix (édition 2026)
- Pourquoi précisément 64 Go ? L'argument du « juste milieu »
- Étape 1 : Libérez votre mémoire (commencez par cela)
- Étape 2 : Constituez votre pile
- 1re partie : Exécution des modèles de langage à grande échelle (LLM)
- Le concept qui explique tout : bande passante contre puissance de calcul
- La révolution MoE (pourquoi les Mac sont soudainement devenus performants)
- Quels modèles conviennent réellement ? — le tableau
- Un regard réaliste sur les modèles 70B
- Quantification : que choisir concrètement ?
- MLX ou llama.cpp : quel environnement d'exécution choisir ?
- Exécuter un serveur API local
- 2e partie : Génération d'images
- 3e partie : Création de vidéos — La rubrique « en toute honnêteté »
- 4e partie : Des workflows concrets qui méritent d'être mis en place
- Au quotidien : température, autonomie et bruit
- Les contre-arguments honnêtes
- 1. Le M5 Max est véritablement plus rapide, et la différence est flagrante
- 2. Un M4 Max à prix réduit pourrait bien rivaliser avec un M5 Pro neuf
- 3. NVIDIA reste en tête dans le domaine du calcul
- 4. Les concurrents proposant une mémoire unifiée de 128 Go misent sur la capacité, et non sur la vitesse
- 5. Un Mac de bureau est un meilleur ordinateur fixe
- 6. Il n'est pas possible d'augmenter la capacité de la mémoire. Jamais.
- Comparaison des coûts : infrastructure locale ou cloud ?
- Le guide d'achat
- Foire aux questions
- Et maintenant ?
- En résumé
Il existe une configuration spécifique de Mac qui s'est discrètement imposée comme la réponse par défaut à la question : “ Quel ordinateur portable devrais-je acheter si je souhaite exécuter moi-même des modèles d'IA ? ” Il s'agit du MacBook Pro 2026 équipé de la puce M5 Pro et de 64 Go de mémoire unifiée.
Ce n'est pas le moins cher. Ce n'est pas le plus rapide. Mais c'est celui où le rapport qualité-prix est le plus adapté à la plupart des gens qui souhaitent réellement utilisation développer des modèles locaux plutôt que de se contenter de les comparer à des modèles de référence.
Ce guide présente les capacités réelles de cette machine dans trois domaines d'utilisation — les grands modèles linguistiques, la génération d'images et la génération de vidéos — en s'appuyant sur des chiffres concrets lorsque ceux-ci sont disponibles, sur des estimations fiables lorsqu'ils ne le sont pas, ainsi que sur des instructions de configuration étape par étape que vous pourrez suivre dès la réception de votre machine.
Il explique également dans quels cas l'argument du « sweet spot » ne tient plus, car il y a effectivement des cas où ce n'est pas le cas, et vous devez savoir exactement lesquels avant de dépenser trois mille dollars pour de la mémoire que vous ne pourrez pas mettre à niveau par la suite.
En bref — Le verdict
Achetez le M5 Pro 64 Go si : Vous recherchez une machine portable capable d'exécuter les modèles 8B–70B et les modèles « Mixture-of-Experts » avec une rapidité suffisante pour une utilisation professionnelle, de générer des images en quelques secondes plutôt qu'en quelques minutes, tout en laissant suffisamment de ressources pour que votre navigateur, votre IDE et vos conteneurs Docker puissent fonctionner simultanément. C'est la solution la plus équilibrée ordinateur portable pour l'IA locale en 2026.
Optez pour le M5 Max 128 Go si : vous avez spécifiquement besoin de modèles locaux de type « frontier » tels que
gpt-oss-120b(ce qui fait pas (pour tenir sur 64 Go), ou si vous souhaitez environ doubler la vitesse de génération de jetons sur des modèles volumineux. Le M5 Max à 40 cœurs offre une bande passante mémoire de 614 Go/s, contre 307 Go/s pour le M5 Pro, et pour le décodage des LLM, la bande passante est primordiale.Ne cherchez pas ici si : La création de vidéos en local constitue votre principale activité. Dans ce domaine, tous les Mac restent plusieurs fois plus lents qu’une RTX 5090, et la location de ressources dans le cloud revient nettement moins cher par clip.
Les trois chiffres qui caractérisent cette machine :
| Métrique | M5 Pro (GPU à 20 cœurs) | Pourquoi est-ce important ? |
|---|---|---|
| 307 Go/s bande passante mémoire | ~2× M5 de base, ~½ M5, 40 cœurs maximum | Définit la limite maximale de jetons par seconde pour les modèles de langage de grande envergure (LLM) |
| 64 Go mémoire unifiée maximale | ~48 à 52 Go d'espace disponible par défaut | Détermine quels modèles conviennent |
| 20 cœurs de GPU avec des accélérateurs neuronaux | Compute IA 4×+ vs M4 Pro | Favorise la rapidité de traitement et de diffusion |
Tout d'abord : oui, cette puce existe bel et bien
La plupart des articles consacrés au M5 Pro publiés fin 2025 et début 2026 relevaient de la spéculation. Ce n'est plus le cas aujourd'hui.
Apple a annoncé les puces M5 Pro et M5 Max le 3 mars 2026, et les deux modèles ont été commercialisés dans les MacBook Pro 14 pouces et 16 pouces le 11 mars 2026. La puce M5 de base avait déjà fait son apparition le 22 octobre 2025 dans le MacBook Pro 14 pouces, mais cette puce est d'un tout autre ordre : elle offre une capacité maximale de 32 Go et un débit maximal de 153 Go/s, ce qui n'est pas suffisant pour les charges de travail décrites dans ce guide.
Voici ce qu'Apple a confirmé sur ses pages « Actualités » et « Caractéristiques techniques » :
M5 Pro — caractéristiques techniques confirmées
| Composant | Spécifications |
|---|---|
| UNITÉ CENTRALE | 18 cœurs (6 “ super cœurs ” pouvant atteindre environ 4,6 GHz + 12 cœurs de performance pouvant atteindre environ 4,4 GHz). Configuration de base : 15 cœurs. Jusqu’à 30% plus rapide en multithread que le M4 Pro. |
| GPU | Jusqu’à 20 cœurs, chacun doté d’un accélérateur neuronal dédié. Ray tracing matériel de troisième génération. Puissance de calcul GPU de pointe plus de 4 fois supérieure à celle du M4 Pro pour l’IA. |
| Moteur neuronal | 16 cœurs |
| Mémoire unifiée | 24 Go / 48 Go / 64 Go — 64 Go est la capacité maximale |
| Bande passante mémoire | Jusqu'à 307 Go/s (LPDDR5X) |
| Processus | TSMC 3 nm (N3P), “ Fusion Architecture ” — deux puces assemblées via un boîtier SoIC-mH |
| E/S et supports de stockage | Thunderbolt 5, encodage et décodage H.264/HEVC/ProRes/ProRes RAW, décodage AV1 |
M5 Max — pour le contraste
Le M5 Max est équipé du même processeur à 18 cœurs, mais d'un processeur graphique pouvant compter jusqu'à 40 cœurs, et surtout, d'une configuration mémoire différente : la version à 32 cœurs offre un débit de 460 Go/s, tandis que celle à 40 cœurs atteint 614 Go/s, avec une capacité configurable allant jusqu’à 128 Go.
Cet écart de bande passante n’est pas un simple détail technique. C’est le facteur le plus déterminant dans le choix entre le M5 Pro et le M5 Max, et nous y reviendrons à plusieurs reprises.

Tests de performance indépendants
L'appareil testé par Notebookcheck — un M5 Pro de 16 pouces doté de 64 Go — a enregistré des scores Geekbench 6.7 de 4 295 en monocœur et de 28 436 en multicœur, un score de 2 347 en mode multicœur sur Cinebench 2024 et de 9 481 en mode multicœur sur Cinebench 2026.
D'après leur analyse des performances graphiques, le M5 Max se situe à peu près au même niveau qu'une carte graphique RTX 5070 de bureau et devance largement la Strix Halo d'AMD. Le GPU à 20 cœurs du M5 Pro se classe quant à lui en dessous, ce qu'il convient de garder à l'esprit : il s'agit d'un GPU performant pour un ordinateur portable, mais qui ne remplace pas une carte graphique dédiée.
Ils ont également relevé un point moins flatteur, qu'il convient de prendre au sérieux : le MacBook Pro 2026 subit un ralentissement notable en cas de charge prolongée, avec des performances du processeur irrégulières, même en mode « Haute puissance ». Nous y reviendrons plus en détail dans la section consacrée à la gestion thermique.
Le problème des prix (édition 2026)
La gamme M5 Pro a été lancée lors de $2,199 pour le modèle 14 pouces et $2,699 pour le modèle 16 pouces. C'est alors que la pénurie mondiale de mémoire a frappé.
En En juin 2026, Apple a augmenté les prix des MacBook Pro d'environ $300 sur l'ensemble de la gamme.. Après cette hausse, le M5 Pro d'entrée de gamme de 14 pouces se situe autour de $2,499, tandis qu'un M5 Pro de 14 pouces configuré avec 64 Go de mémoire et un SSD de 1 To se situe dans une fourchette comprise entre $2,799 et $2,999, selon les jours et les revendeurs. B&H et d’autres revendeurs proposent actuellement des réductions de $300 à $400 sur les configurations M5 Pro de 48 Go et 64 Go ; cela vaut la peine de vérifier ces offres avant d’acheter directement auprès du fabricant.
En Allemagne, la gamme M5 Pro est proposée à partir de 2 199 €, avec des tarifs éducatifs pouvant descendre jusqu'à 1 979 € chez des revendeurs tels qu'Edustore. Les configurations à 64 Go reviennent nettement plus cher une fois la TVA 19% incluse.
Deux facteurs sont déterminants pour votre décision :
- De 48 Go à 64 Go sur le M5 Pro : Historiquement, il s'agissait d'une mise à niveau de 1 TP4T200 à 1 TP4T400, mais le prix de la mise à niveau de la mémoire vive a grimpé de 50 à 671 TP3T dans de nombreuses configurations après la hausse de juin.
- M5 Pro 64 Go → M5 Max 128 Go : une hausse considérable. Avant cette augmentation, le M5 Max était proposé à 1 439,59 € (14 pouces) et 1 439,89 € (16 pouces) ; en juin, le prix des mises à niveau de mémoire du M5 Max (64 Go et 128 Go) a pratiquement doublé. Un modèle 16 pouces avec toutes les options dépasse désormais $10,000.
Vérifiez chaque prix de cette rubrique avant d'acheter. Le marché de la mémoire en 2026 évolue de mois en mois, et tout ce qui est écrit ici a une durée de vie très limitée.
Pourquoi précisément 64 Go ? L'argument du « juste milieu »
L'argument du “ sweet spot ” ne repose pas sur le fait que 64 Go serait une capacité « magique ». Il s'agit plutôt de ce que chaque niveau de mémoire exclut concrètement.
Ce que vous ne pouvez pas faire à chaque niveau
16 Go / 24 Go — Vous pouvez faire fonctionner sans problème des modèles de 7B à 8B, et des modèles de 14B avec une quantification poussée. En revanche, il est impossible de faire fonctionner des modèles de la classe 30B+ avec un contexte pertinent. Vous passerez votre temps à gérer la mémoire au lieu d’utiliser les modèles.
32 Go — Cela fonctionne pour les modèles denses de taille 14B et certains modèles MoE plus petits. Mais dès que vous ajoutez un cache KV pour un contexte de plus de 32K, plus Chrome, plus votre IDE, plus un démon Docker, vous entrez dans une zone de pression mémoire. C’est à ce niveau-là que les gens finissent par se convaincre que l’IA locale ne fonctionne pas.
48 Go — Vraiment excellent. Il exécute sans problème des modèles denses de classe 32B. Le problème, c’est la marge disponible : un modèle de classe 70B à Q4 occupe environ 40 Go, ce qui, techniquement, tient dans la mémoire, mais ne laisse plus rien pour le reste de la machine. On finit par devoir fermer des applications pour pouvoir exécuter un modèle, et c’est précisément ce genre de contrainte qui nuit aux flux de travail locaux.
64 Go — C'est à ce moment-là que vous pouvez prendre en main un modèle 70B Q4 ou un modèle MoE à 106 milliards de paramètres en mémoire et Votre environnement de travail reste entièrement actif. Pas besoin de quitter Slack. Pas besoin d'arrêter les conteneurs. Vous ouvrez un modèle et vous continuez à travailler.
128 Go (gamme M5 Max) — Débloque gpt-oss-120b et la gamme 120B+. Vraiment utile si c'est ce dont vous avez besoin, et vraiment cher si ce n'est pas le cas.
L'argument du “ sweet spot ” revient en réalité à dire : « exécutez un modèle sérieux ET tout le reste ». C'est ce qui fait la différence entre une IA locale qui sert de démonstration et une IA locale que l'on utilise réellement.
Mais la capacité de 64 Go a une limite stricte, et il vaut mieux que vous le sachiez dès maintenant.
Le problème du gpt-oss-120b
gpt-oss-120b Avec la quantification MXFP4, environ 63 Go sont nécessaires rien que pour les poids. Des mesures indépendantes réalisées sur un M5 Max de 128 Go à l'aide de MLX indiquent une consommation maximale de mémoire d'environ 64,4 Go avec un contexte de 4 096 tokens et 64,9 Go avec un contexte de 16 000 tokens.
Sur un ordinateur de 64 Go, où l'espace réellement utilisable se situe entre 52 et 60 Go, cela ne rentre pas. Pas “ ça rentre de justesse ” — ça ne rentre tout simplement pas.
Si vous tombez sur une affirmation selon laquelle gpt-oss-120b Si la capacité indiquée est de 64 Go, méfiez-vous. Il s’agit en réalité d’un modèle de 128 Go. C’est là l’argument le plus convaincant en faveur du M5 Max, et si ce modèle vous intéresse, aucun raisonnement, aussi séduisant soit-il, ne changera la donne.
Étape 1 : Libérez votre mémoire (commencez par cela)
Voici une chose que la plupart des acheteurs ignorent : macOS ne permet pas à la carte graphique d'utiliser toute votre mémoire vive.
Par défaut, macOS limite la mémoire dédiée au GPU à environ 751 TP3T au total. Sur un ordinateur de 64 Go, cela correspond à environ 51,84 Go utilisable pour les poids du modèle, le reste étant réservé au système.
Vous pouvez activer cette fonctionnalité à l'aide d'une seule commande. Pas de redémarrage, pas de modification de la protection de l'intégrité du système.
Remarque : la clé moderne est
iogpu.wired_limit_mb. Les anciens guides font référence àdebug.iogpu.wired_limit, qui a été remplacée. Si vous tombez sur un tutoriel utilisant l'ancienne clé, sachez qu'il n'est plus d'actualité.
Augmenter la limite
bash
# Définir la limite de mémoire « wired » du GPU à 60 Go (60 × 1 024 = 61 440 Mo)
sudo sysctl iogpu.wired_limit_mb=61440
# Vérifiez que la modification a bien pris effet
sysctl iogpu.wired_limit_mb
# Vous pouvez à tout moment rétablir la valeur par défaut de macOS
sudo sysctl iogpu.wired_limit_mb=0
Rendre cela persistant
Ce paramètre est réinitialisé au redémarrage. Pour qu'il soit conservé, ajoutez-le à /etc/sysctl.conf:
bash
echo "iogpu.wired_limit_mb=61440" | sudo tee -a /etc/sysctl.conf
Vous pouvez également créer un LaunchDaemon ou ajouter le fichier sysctl appelez un script de connexion si vous préférez ne pas intervenir manuellement /etc/sysctl.conf.
Jusqu'où faut-il aller ?
Prévoyez entre 4 et 8 Go pour macOS. Sur un ordinateur de 64 Go, 60 Go (61 440 Mo) constituent une configuration ambitieuse mais réalisable si vous n'exécutez pas beaucoup d'autres applications. 56 Go (57 344 Mo) constituent un réglage quotidien plus prudent.
N'attribuez pas 100%. Vous risqueriez de voir apparaître des « beachballs », de provoquer des blocages de l'application ou de déclencher une réinitialisation matérielle — et sur une machine en plein processus d'inférence, cela signifie la perte de tout ce que vous étiez en train de faire.
Budget réaliste pour un M5 Pro de 64 Go :
- Par défaut : environ 48 à 52 Go d'espace disponible
- Portée à 56 Go : une capacité suffisante pour un modèle 70B du quatrième trimestre, ainsi que le contexte
- Portée à 60 Go : capacité maximale, laissant très peu d'espace pour d'autres applications
Cette différence — 48 Go contre 58 Go — fait souvent la différence entre un modèle fonctionnant sur le GPU et un modèle qui doit recourir au CPU, ce qui réduit considérablement le débit. Ce sont les cinq minutes de configuration les plus rentables que vous passerez.
Une condition préalable supplémentaire
MLX nécessite macOS 26.2 ou une version ultérieure pour pouvoir exploiter pleinement les accélérateurs neuronaux de la puce M5. Si vous utilisez une version antérieure, vous passez à côté de la plus importante amélioration jamais apportée. Vérifiez la rubrique « Mise à jour logicielle » avant de lancer le moindre test de performances.
Étape 2 : Constituez votre pile
Voici la procédure complète, étape par étape. Prévoyez environ 30 minutes, plus le temps de téléchargement.
2.1 — Principes fondamentaux
bash
# Installez Homebrew si vous ne l'avez pas encore
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
# Installez uv — un gestionnaire de paquets Python rapide, bien meilleur que pip pour cela
brew install uv
# Facultatif mais recommandé : un gestionnaire de versions Python
brew install python@3.12
2.2 — MLX (le framework d'apprentissage automatique natif d'Apple)
MLX est le framework de tableaux propre à Apple, spécialement conçu pour l’architecture de mémoire unifiée d’Apple Silicon. Il s’agit de la solution la plus rapide pour l’inférence des modèles de langage de grande envergure (LLM) sur un Mac et devrait constituer votre choix par défaut.
bash
# Créer un environnement dédié
uv venv ~/mlx-env
source ~/mlx-env/bin/activate
# Installer mlx-lm
uv pip install mlx-lm
# Testez-le — cette commande télécharge et exécute un modèle
mlx_lm.generate \
--model mlx-community/Qwen3.6-27B-4bit \
--prompt " Expliquez l'architecture à mémoire unifiée en trois phrases. "
Si cela affiche du texte, cela signifie que votre pile fonctionne.
2.3 — LM Studio (l'interface graphique)
Télécharger depuis lmstudio.ai. C'est la manière la plus conviviale de parcourir, de télécharger et d'exécuter des modèles, et Apple l'a démontré lors du lancement du M5 Pro, ce qui en dit long sur la généralisation de l'inférence locale.
La fonctionnalité la plus utile de LM Studio pour les développeurs est le serveur intégré compatible avec OpenAI. Vous pouvez l'activer dans la section Développeur onglet et expose un point de terminaison à l'adresse http://localhost:1234/v1 avec lequel n'importe quel client compatible avec OpenAI peut communiquer.
2.4 — Ollama (l'interface CLI et le serveur)
bash
brew install ollama
# Démarrer le serveur
ollama serve
# Dans un autre terminal, récupérer et exécuter un modèle
ollama pull gpt-oss:20b
ollama run gpt-oss:20b
Mise à jour importante pour 2026 : sur Le 30 mars 2026, Ollama 0.19 a remplacé llama.cpp par MLX comme backend Apple Silicon. Cela a permis de doubler approximativement la vitesse de décodage. D’après les mesures réalisées par Ollama sur son propre M5 Max avec Qwen3.5-35B-A3B, le préremplissage est passé de 1 154 à 1 810 tokens/sec et le décodage de 58 à 112 tokens/sec — leur version int4 portant le préremplissage à 1 851 et le décodage à 134.
Si vous avez utilisé Ollama pour la dernière fois sur un Mac avant cette version, votre perception de ses performances n'est plus d'actualité.
2.5 — Dessiner des éléments (images et vidéos)
Installez-le depuis le Mac App Store. Il est gratuit, natif, optimisé pour Metal et constitue actuellement le meilleur outil de génération d’images sur Apple Silicon. Son implémentation de Metal FlashAttention v2.5 est jusqu’à 4,6 fois plus rapide sur le M5 que sur le M4, et prend en charge l’entraînement LoRA sur l’appareil.
2.6 — ComfyUI (lorsque vous avez besoin de pipelines)
bash
brew install comfyui
ComfyUI vous offre un contrôle du flux de travail basé sur des nœuds que Draw Things ne peut égaler. Il s'exécute sur le backend MPS et est environ 20% plus lent que Draw Things sur Apple Silicon pour un travail équivalent ; de plus, il présente de réels écueils avec les points de contrôle FP8 sur Metal. Utilisez-le lorsque vous avez besoin de pipelines complexes ; utilisez Draw Things lorsque vous avez besoin de rapidité.
2.7 — Tout vérifier
bash
# Vérifiez que la limite de mémoire n'est pas bloquée
sysctl iogpu.wired_limit_mb
# Vérifiez que MLX détecte bien votre GPU
python -c "import mlx.core as mx; print(mx.default_device())"
# Vérifiez qu'Ollama est opérationnel
curl http://localhost:11434/api/tags
1re partie : Exécution des modèles de langage à grande échelle (LLM)
C'est là que le M5 Pro 64 Go excelle, et cela vaut la peine de le comprendre pourquoi avant de consulter la liste des modèles.
Le concept qui explique tout : bande passante contre puissance de calcul
L'inférence LLM se déroule en deux phases, qui sollicitent des composants totalement différents de votre machine.
Préremplissage (traitement rapide) correspond au nombre de passages effectués sur votre entrée avant l'apparition du premier token. Il s'agit de limité par le temps de calcul. C'est pourquoi, auparavant, coller un fichier de 40 000 tokens dans un agent de codage local entraînait plusieurs minutes de silence sur un Mac, alors qu'une carte NVIDIA le traitait en quelques secondes.
Décodage (génération de jetons) génère chaque jeton suivant. Il s'agit de limité par la bande passante mémoire. Chaque jeton généré nécessite la lecture des poids du modèle en mémoire. Plus la mémoire est rapide, plus les jetons sont générés rapidement. C'est presque aussi simple que cela.
Cette distinction résume à elle seule tout l'intérêt du M5 Pro :
- Son 307 Go/s La bande passante impose une limite maximale stricte à la vitesse de décodage. Elle représente environ le double des 153 Go/s du M5 de base, et environ la moitié des 614 Go/s du M5 Max à 40 cœurs.
- Son Accélérateurs neuronaux — un par cœur de GPU, une nouveauté de la génération M5 — améliorent considérablement le préremplissage.
L'équipe de recherche MLX d'Apple a publié en novembre 2025 des résultats comparant la version de base du M5 à celle du M4 sur le modèle Qwen3-14B-4bit : le temps nécessaire pour obtenir le premier jeton était 4,06 fois plus rapide, tandis que la génération de tokens n'a progressé que de 1,19 fois. Ce gain modeste en décodage correspond exactement à l'augmentation de la bande passante (120 Go/s → 153 Go/s). L'énorme gain en préremplissage provient entièrement des accélérateurs neuronaux.
Apple vante les versions « Pro » et « Max » en affirmant qu’elles offrent un traitement des prompts LLM jusqu’à 4 fois plus rapide que les puces M4 Pro et M4 Max. Le mécanisme est identique, même si les informations spécifiques au M5 Pro concernant la confirmation du préremplissage restent encore rares.
Concrètement, cela signifie : Le M5 Pro constitue une amélioration révolutionnaire par rapport aux Mac antérieurs au M5 pour les tâches nécessitant une longue réflexion et la programmation active, où la préremplissage joue un rôle prépondérant. Il s'agit en revanche d'une amélioration modeste en termes de débit de discussion pur, où le décodage est prédominant.
La révolution MoE (pourquoi les Mac sont soudainement devenus performants)
Les architectures de type « mixture-of-experts » ont bouleversé les règles du jeu pour les machines à mémoire unifiée, et si vous ne retenez qu'une seule chose de ce guide, retenez bien celle-ci.
Un modèle MoE comporte un nombre considérable de paramètres, mais n'en active qu'une petite fraction par token. gpt-oss-120b compte au total 117 milliards de paramètres, mais en active environ 5,1 milliards par jeton.
- Nombre total de paramètres déterminez votre mémoire exigence — dont les Mac regorgent.
- Paramètres actifs déterminez votre vitesse de décodage — ce qui dépend de la bande passante.
Ainsi, un modèle MoE doit tirer parti de la ressource dont les Mac disposent en abondance et consommer peu de la ressource dont ils manquent. Un modèle MoE bien choisi, sur un Mac de 64 Go, offre une qualité proche de la frontière à la vitesse de décodage d'un modèle bien plus petit.
C'est la raison pour laquelle un ordinateur portable offrant un débit de 307 Go/s peut se montrer compétitif face à des cartes fonctionnant à 1 700 Go/s pour certaines charges de travail. Optez pour des modèles MoE dès que vous le pouvez.
Quels modèles conviennent réellement ? — le tableau
Les chiffres mesurés ci-dessous proviennent de la base de données de benchmarks communautaire oMLX pour le M5 Pro à 20 cœurs et 64 Go. Les estimations sont clairement signalées. Ne vous fiez pas aux numéros de jetons ou de secondes non marqués que vous pourriez trouver ailleurs pour cette puce — très peu de personnes ont publié de véritables mesures concernant le M5 Pro.
| Modèle | Type | Empreinte | Décodage (tok/s) | Preremplissage (tok/s) | Verdict |
|---|---|---|---|---|---|
| gpt-oss-20b (MXFP4) | MoE | environ 12 Go | 66–80 ✅ mesuré | 1 500–2 200 ✅ | La voiture du quotidien. Rapide, performante, compacte. |
| Qwen3.5-35B-A3B / Qwen3-30B-A3B (4e trimestre) | MoE | environ 20 Go | ~55–70 (estimation) | Haut | Le meilleur rapport qualité-prix au Go. Le choix le plus rentable. |
| Qwen3.6-27B (4 bits) | Dense | environ 16 Go | 17.8 ✅ mesuré | 470 ✅ | Modèle représentatif de la catégorie « dense » 27–35B. |
| GLM-4.5 / 4.6 Air (106B-A12B) | MoE | ~40 Go et plus | ~30 | Haut | Un raisonnement « proche de la frontière » qui tient vraiment la route. |
| Llama 3.3 70B (Q4_K_M) | Dense | environ 40 Go | ~7 à 12 (estimation) | Modéré | Convient pour le traitement par lots ; peu adapté à une utilisation interactive. |
| Llama 3.3 70B (Q5_K_M) | Dense | environ 49 Go | ~6–10 (estimation) | Modéré | Ça passe, mais c'est juste. Augmentez d'abord la limite de mémoire. |
| Qwen3 14B / 32B, Gemma 3, Mistral Small, Devstral, Command-A | Dense | 8 à 24 Go | 20 à 60 ans et plus | Bon | Tout est pratique. Choisissez en fonction de la tâche à accomplir. |
| gpt-oss-120b (MXFP4) | MoE | environ 63 Go | — | — | ❌ Ça ne va pas. Un ordinateur doté d'une capacité de stockage de 128 Go est nécessaire. |
| Qwen3-235B-A22B (1,58 bit ternaire) | MoE | environ 53 Go | ~5.6 | Faible | Techniquement, ça fonctionne. C'est un tour de passe-passe, pas un processus de travail. |
Le bonus de lot : gpt-oss-20b sur la balance M5 Pro, soit environ 142 tok/s avec une taille de lot de 8. Si vous exécutez des agents, des boucles d'évaluation ou toute autre charge de travail impliquant des requêtes parallèles, le débit s'améliore considérablement par rapport à celui obtenu avec un seul flux.
Un regard réaliste sur les modèles 70B
Il n'existe aucune donnée publiée, mesurée de manière indépendante, concernant le débit de décodage du M5 Pro pour Llama 3.3 70B. L'estimation de 7 à 12 tok/s est extrapolée à partir de la bande passante.
À titre de comparaison : un M4 Max de 128 Go, avec un débit de 546 Go/s, affiche environ 18 à 20 tok/s sur le même modèle. Le M5 Pro atteint quant à lui 307 Go/s. Le calcul n'est pas très encourageant.
À un débit de 7 à 12 tok/s, on obtient environ 5 à 9 mots par seconde, ce qui est plus lent qu'une vitesse de lecture confortable. Cela convient pour les tâches en arrière-plan, le traitement de documents et les traitements par lots effectués pendant la nuit. En revanche, c'est frustrant pour un chat interactif.
Un conseil sincère : Sur un M5 Pro de 64 Go, considérez les modèles denses de 70 milliards de points comme des outils destinés aux tâches par lots et utilisez les modèles MoE pour toutes les tâches interactives.
Quantification : que choisir concrètement ?
| Format | Perte de qualité | Quand l'utiliser |
|---|---|---|
| Q4_K_M (GGUF) | ~1–2% | Par défaut. Meilleur rapport vitesse/qualité. |
| MLX 4 bits | ~1–2% | Configuration par défaut sur Mac. Environ 10% de mémoire en moins et 15 à 30% plus rapide qu’un GGUF équivalent. |
| Q5_K_M / MLX 6 bits | <1% | Lorsque vous disposez d'une marge dynamique suffisante et que vous souhaitez obtenir un résultat quasi sans perte. |
| Q6_K | Négligeable | Des tâches où la qualité est primordiale, avec une mémoire abondante. |
| Q8 / FP16 | Aucun | Cela en vaut rarement la peine sur un ordinateur portable. Cela réduit de moitié, voire de trois quarts, le budget alloué à la taille de votre modèle. |
| MXFP4 | Natif | Ce n'est pas un choix — c'est comme ça gpt-oss navires. |
| 1,58 bit ternaire | Grave | Uniquement pour y faire rentrer de force un modèle qui, autrement, n'y entrerait pas. |
Règle générale : Optez pour le 4 bits si vous privilégiez la vitesse et la compatibilité, le 6 bits lorsque la qualité prime et que vous disposez de suffisamment d'espace, et évitez le 8 bits sur un ordinateur portable.
MLX ou llama.cpp : quel environnement d'exécution choisir ?
En bref, la réponse est MLX, mais avec une réserve.
- Avec environ 14 milliards de paramètres : MLX devance llama.cpp de 20 à 871 TP3T. Il n'y a pas photo.
- Au-dessus de ~27 milliards : les deux tendent à se rejoindre, car la bande passante mémoire devient le goulot d'étranglement et la durée d'exécution n'a plus d'importance.
- Mémoire : MLX consomme environ 10% de moins que GGUF à un niveau de quantification équivalent.
- Une mise en garde : Avec plus de 30 000 contextes de tokens, MLX peut atteindre 50% plus lent que « llama.cpp » lorsque la fonction « Flash Attention » est activée. Cela dépend du modèle et du contexte.
Si vous travaillez régulièrement avec des contextes très longs, effectuez des tests de performance sur votre charge de travail réelle. Sinon, optez pour le MLX.
Exécuter un serveur API local
mlx-lm La version 0.18 et les versions ultérieures intègrent un serveur compatible avec OpenAI prenant en charge le traitement par lots en continu :
bash
mlx_lm.server \
--model mlx-community/gpt-oss-20b-MXFP4 \
--port 8080
Désormais, tout ce qui utilise l'API OpenAI peut exploiter votre modèle local :
bash
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "local",
"messages": [{"role": "user", "content": "Écrivez une ligne de commande Bash pour rechercher les fichiers volumineux."}]
}'
Ce point de terminaison constitue la base de tout ce qui est présenté dans la section « Flux de travail » ci-dessous.
2e partie : Génération d'images
C'est dans la génération d'images que le M5 Pro se révèle plus performant que ne le laisse supposer sa bande passante, et ce pour une raison simple : la diffusion est limité par le temps de calcul, sans être limités par la bande passante, et les modèles sont suffisamment petits pour que la mémoire ne constitue jamais une contrainte sur une machine dotée de 64 Go.
Performances par modèle
| Modèle | Taille | Mémoire | Temps nécessaire pour une image de 1 024 × 1 024 | Notes |
|---|---|---|---|---|
| SDXL | 3,5 milliards | environ 7 Go | environ 7 s pour 30 pas (M5 Max) | L'option la plus rapide et la plus performante. Un écosystème LoRA extrêmement vaste. |
| FLUX.1 [rapide] | 12B | environ 7 Go (4e trimestre) | environ 20 à 25 secondes en 4 étapes | Conçu pour la rapidité. Licence Apache 2.0. |
| FLUX.1 [développement] | 12B | environ 10 Go (Q6) | environ 50 secondes pour 20 pas (classe M4) | La référence en matière de qualité. |
| FLUX.2 [Klein] | 4B distillé | environ 8 Go | environ la quarantaine | Plus récent, plus compact, plus rapide. |
| FLUX.2 [développement] | Grand | 24 Go et plus | Quelques minutes | Une qualité irréprochable et une véritable patience sont indispensables. |
| SD 3,5 | Variable | 10 à 20 Go | Des dizaines de secondes | Un juste milieu solide. |
| Qwen-Image / Qwen-Image-Edit | Variable | 15 à 25 Go | Des dizaines de secondes | Idéal pour l'affichage et l'édition de texte. |
| HiDream, Chroma | Variable | 10 à 20 Go | Variable | À découvrir pour la diversité des styles proposés. |
L'équipe de recherche en apprentissage automatique d'Apple a mesuré les performances de FLUX-dev-4bit lors de la génération d'une image de 1 024 × 1 024 plus de 3,8 fois plus rapide sur le M5 que sur le M4 grâce à MLX. Ce gain est dû aux accélérateurs neuronaux et s'applique à l'ensemble de la gamme M5.
Aucun test de performance spécifique au M5 Pro en termes de temps par image n’a encore été publié ; considérez donc le tableau ci-dessus comme des chiffres correspondant à la gamme M4, avec une amélioration significative attendue pour le M5. En pratique : vous pouvez vous attendre à ce que FLUX.1 [schnell] s’exécute en bien moins de 20 secondes et SDXL en moins de 10 secondes.
Avec 64 Go, vous pouvez exécuter ces modèles à FP16 sans quantification, ce qui constitue un véritable avantage en termes de qualité par rapport aux machines de 16 Go et 24 Go qui sont limitées au mode Q4.
Outillage : quel matériel utiliser ?
Dessiner des choses — le choix par défaut. Metal natif, aucun environnement Python susceptible de poser problème, Metal FlashAttention v2.5 fonctionnant jusqu’à 4,6 fois plus vite sur le M5 que sur le M4, et entraînement LoRA sur l’appareil. Gratuit sur l’App Store.
ComfyUI — pour les pipelines basés sur des nœuds, les chaînes ControlNet et les workflows en plusieurs étapes. Environ 20% plus lent que Draw Things sur Apple Silicon. Attention aux points de contrôle FP8, qui échouent fréquemment sur Metal.
DiffusionKit — La boîte à outils de diffusion d'Apple, développée par MLX. À suivre de près.
Mochi Diffusion, InvokeAI — les deux sont envisageables, les deux conviennent.
À éviter : DiffusionBee est de fait abandonné. Automatic1111 et Forge fonctionnent techniquement via MPS, mais sont lents et peu entretenus sur Mac.
Étape par étape : votre première image locale
- Installer Dessiner des choses sur le Mac App Store.
- Ouvrez-le et accédez au gestionnaire de modèles (l'icône située en haut du panneau de gauche).
- Télécharger FLUX.1 [rapide] — environ 7 Go au quatrième trimestre, ou optez pour la version FP16 puisque vous disposez de suffisamment de mémoire.
- Ensemble Étapes jusqu’à 4 (le « schnell » est distillé précisément dans ce but) et Taille à 1024 × 1024.
- Saisissez une commande et appuyez sur Générer.
- La première exécution inclut le chargement du modèle. Les générations suivantes sont nettement plus rapides.
Entraînement LoRA sur l'appareil
Une machine dotée de 64 Go permet d'affiner les modèles d'images en local, une capacité qui est véritablement sous-estimée. Draw Things prend directement en charge l'entraînement LoRA, tandis que MLX prend en charge les méthodes LoRA et QLoRA, tant pour les modèles d'images que pour les modèles linguistiques.
Un petit modèle LoRA basé sur 20 à 50 images s'exécute en une nuit sur un M5 Pro, et les données ne quittent jamais votre machine. Pour toute personne travaillant avec du contenu fourni par des clients ou des ressources propriétaires, c'est un aspect qui prime sur la rapidité.
3e partie : Création de vidéos — La rubrique « en toute honnêteté »
C'est là que je dois être franc avec vous, car une grande partie des informations disponibles sur ce sujet ne l'est pas.
En 2026, la génération de vidéos en local sur n'importe quel Mac est lente. Pas “ plus lent qu'une 4090 ” au sens strict. Assez lent pour changer votre façon de travailler.
Pourquoi les Mac ont-ils justement du mal dans ce domaine ?
La diffusion de vidéos est très limité par le temps de calcul. Contrairement au décodage LLM, où la bande passante mémoire abondante du Mac constitue la ressource déterminante, la génération de vidéos sollicite à outrance la puissance de calcul brute du GPU — précisément le domaine dans lequel un GPU d'ordinateur portable à 20 cœurs est surpassé par une carte graphique dédiée.
Les accélérateurs neuronaux de la M5 sont utiles. Mais ils ne suffisent pas à combler un écart aussi important.
Les chiffres, sans fioritures
Wan 2.2 (Alibaba, Apache-2.0, disponible sous forme de modèle MoE de 14 milliards de paramètres et d’une variante dense de 5 milliards de paramètres pour la conversion de texte/images en vidéo) : sur un M1 Max de 64 Go exécutant une version GGUF, un Un clip de 2 secondes en 832×480 a pris 82 minutes. Un extrait de 5 secondes durerait plus de trois heures.
À titre de comparaison, le même modèle TI2V-5B monté sur une RTX 4090 de 24 Go permet d'obtenir 5 secondes en 720p en environ 9 minutes.
Un M5 Pro est nettement plus rapide qu’un M1 Max, mais c’est l’ordre de grandeur qui importe.
Une limite majeure du métal : Les points de contrôle FP8 ne fonctionnent pas sur Metal — le Float8_e4m3fn Ce type de données n'est pas pris en charge. Vous devez utiliser les versions GGUF. Cela pose problème à de nombreuses personnes qui suivent des tutoriels axés sur NVIDIA, et cela signifie également que Les modèles FP8 du LTX-2 ne fonctionnent tout simplement pas sur Mac.
La bonne nouvelle : Les modèles distillés plus récents sont en train de changer la donne. Ivan Fioravanti a mesuré la concentration distillée LTX 2.3 22B dans Draw Things : création d'une vidéo de 5 secondes en environ 121 secondes sur un M5 Max à 40 cœurs — surpassant même un M3 Ultra à 80 cœurs, qui avait mis 206 secondes.
C'est un résultat concret et un véritable changement. Mais attention au processeur : un M5 Pro à 20 cœurs sera nettement plus lent qu'un M5 Max à 40 cœurs sur des tâches de ce type, qui reposent principalement sur la puissance de calcul. Il faudra compter plusieurs minutes plutôt que deux.
Autres modèles — HunyuanVideo, Mochi 1, CogVideoX, FramePack, Stable Video Diffusion — fonctionnent plus ou moins lentement sur Mac, voire sont inutilisables. Plusieurs d’entre eux sont optimisés pour CUDA et nécessitent des solutions de contournement.
Le verdict en vidéo
La lecture de vidéos locales sur un M5 Pro 64 Go est envisageable pour une utilisation occasionnelle et une exploration en prenant son temps — de courtes vidéos, des résolutions plus faibles, des modèles simplifiés, grâce à Draw Things. Ça marche. Vous allez créer des choses.
Pour obtenir un débit réel, louez un GPU. RunPod, Vast.ai et Lambda proposent de faire tourner une carte 5090 ou une H100 pour quelques dollars de l'heure et produisent en quelques minutes ce que votre ordinateur portable met une heure à produire. En ce qui concerne spécifiquement la vidéo, la différence de coût est considérable.
Si la création de vidéos est votre primaire En fonction de votre charge de travail, achetez un ordinateur équipé d'une carte graphique NVIDIA ou prévoyez un budget pour le cloud. N'achetez pas un Mac en comptant sur la chance.
Si vous souhaitez tout de même essayer : étape par étape
- Ouvrir Dessiner des choses puis passez au gestionnaire de modèles vidéo.
- Télécharger un distillé modèle — LTX 2.3 ou une version Wan 2.2 GGUF. Les modèles « Distilled » font toute la différence entre quelques minutes et plusieurs heures.
- Commencez petit : 480p, 2 secondes, faible nombre de pas. Définissez vos délais de référence avant de passer à une plus grande échelle.
- Branchez l'appareil et activez le mode haute puissance. Cela permettra de faire fonctionner vos ventilateurs.
- Ne déterminez la résolution et la durée qu’après avoir calculé combien de temps réel vous prend un court extrait.
N'utilisez jamais les points de contrôle FP8 sur un Mac. GGUF ou rien.
4e partie : Des workflows concrets qui méritent d'être mis en place
Les tests de performances ne sont pas ce qui compte. Voici ce que les gens font réellement avec cette machine.
Processus 1 : un agent de codage local
Il s'agit de la configuration la plus coûteuse de la liste, et elle prend environ dix minutes.
Étape 1 — Démarrez un serveur de modèles. Soit l'onglet « Developer » de LM Studio (point de terminaison à l'adresse http://localhost:1234/v1) ou :
bash
mlx_lm.server --model mlx-community/gpt-oss-20b-MXFP4 --port 1234
Étape 2 — Ouvrez-le dans votre éditeur.
VS Code avec Cline ou Continue : Ajouter un fournisseur compatible avec OpenAI avec une URL de base http://localhost:1234/v1, une clé API non vide et le nom de votre modèle.
Zed : Configurez un fournisseur personnalisé compatible avec OpenAI dans les paramètres.
Aider (terminal) :
bash
export OPENAI_API_BASE=http://localhost:1234/v1
export OPENAI_API_KEY=local
aider --model openai/gpt-oss-20b
Étape 3 — Choisissez le modèle qui vous convient. gpt-oss-20b et Qwen3-Coder-30B-A3B sont tous deux des codeurs locaux performants. Ils utilisent tous deux l’algorithme MoE, ce qui correspond exactement à ce que vous recherchez : un décodage rapide, et grâce aux améliorations apportées au préremplissage par le M5, les contextes de fichiers volumineux ne provoquent plus de blocages de plusieurs minutes.
Voici ce que cela vous apporte : des itérations illimitées sans coût par jeton, sans limite de débit, et avec un code qui ne quitte jamais votre machine. Pour les bases de code propriétaires ou celles des clients, ce dernier point constitue souvent la justification principale.
Workflow 2 : RAG privé sur vos documents
Grâce aux représentations locales associées à un modèle de 27 à 70 milliards de paramètres, les documents sensibles — contrats, dossiers médicaux, recherches internes, données financières — peuvent faire l'objet de recherches et être résumés sans qu'un seul octet ne quitte votre ordinateur portable.
La capacité de 64 Go est particulièrement importante ici, car les pipelines RAG stockent simultanément en mémoire un modèle d'intégration, un magasin de vecteurs et un modèle de génération. Avec 32 Go, on est constamment confronté à des opérations de swap. Avec 64 Go, ce n'est pas le cas.
Workflow 3 : Génération par lots pendant la nuit
Mettez en file d'attente quelques centaines de générations d'images dans Draw Things, ou lancez une tâche de traitement de documents de longue durée via mlx_lm.server, et laissez la machine travailler pendant que vous dormez. Une fois branchés, les modèles 70B et les lots d'images qui semblent trop lents en mode interactif peuvent tout à fait être traités pendant la nuit.
Processus n° 4 : acheminement hybride (la stratégie que la plupart des gens devraient adopter)
Ne considérez pas le choix entre « local » et « cloud » comme une alternative binaire. Choisissez en fonction de la tâche :
| Envoyer à un contact local | API « Envoyer vers le cloud » |
|---|---|
| Tout ce qui relève de la vie privée | Les exercices de raisonnement les plus difficiles |
| Traitement en masse et par lots | Cas nécessitant une véritable qualité « frontier » |
| Boucles d'agent comportant de nombreux appels peu coûteux | Résultats ponctuels à enjeux élevés |
| Itération et expérimentation | Travaux nécessitant le tout dernier modèle |
| Travail hors ligne | Fenêtres de contexte très longues |
C'est là que réside l'essentiel de la valeur ajoutée. L'environnement local gère le volume, les itérations et la confidentialité. Le cloud prend en charge les aspects techniques complexes (5%).
La pile d'IA d'Apple (à connaître)
Le Cadre des modèles de base offre aux développeurs un accès direct via Swift au modèle embarqué d'Apple — environ 3 milliards de paramètres, gratuit, privé, hors ligne, avec une génération guidée et l'appel d'outils intégrés.
Les mises à jour de 2026 revêtent une importance plus grande que la version initiale : traitement des données visuelles, exécution côté serveur et un Modèle linguistique protocole permettant de faire fonctionner une session avec le modèle d'Apple, un modèle cloud, ou un modèle MLX local via MLXLanguageModel. Si vous développez des applications Mac ou iOS, c'est un moyen simple d'intégrer des fonctionnalités d'IA hybride directement sur l'appareil.
Xcode 26 Il intègre également des outils de programmation LLM permettant d'utiliser ChatGPT, d'autres fournisseurs via une clé API ou un modèle local fonctionnant sur votre Mac.
Au quotidien : température, autonomie et bruit
Les caractéristiques techniques ne vous renseignent pas sur l'expérience d'utilisation d'un appareil. Voici quelques observations sincères.
Les papillons de 14 pouces sont plus puissants que ceux de 16 pouces. Notebookcheck a signalé d'importants ralentissements dus à la surchauffe sur le MacBook Pro 2026 soumis à une charge prolongée, avec un comportement irrégulier du processeur même en mode « High Power ». Le modèle 16 pouces dispose d'une plus grande marge de refroidissement et d'une batterie plus puissante. Si vous prévoyez des sessions d'inférence prolongées, le modèle 16 pouces est le meilleur choix. — Il s'agit là d'une véritable différence fonctionnelle, et non d'une simple préférence.
Toutes les charges de travail liées à l'IA ne présentent pas les mêmes caractéristiques thermiques. Le décodage LLM est relativement peu exigeant : il est limité par la mémoire, ce qui fait que le GPU n’est pas pleinement sollicité et que les ventilateurs restent souvent silencieux. La diffusion d’images et de vidéos est quant à elle très gourmande en ressources de calcul : elle sollicitera pleinement votre GPU, fera tourner les ventilateurs à un niveau sonore perceptible et épuisera rapidement la batterie.
La réalité des batteries : Pour de courtes sessions de LLM, vous pouvez très bien vous passer d'alimentation. En revanche, un travail de diffusion prolongé épuisera la batterie en quelques heures et provoquera une limitation thermique bien avant cela. Restez branché pour toute tâche exigeante.
Modes d'alimentation : Le modèle 16 pouces propose un mode « High Power » (haute puissance), qu'il est recommandé d'activer pour les tâches de longue durée. Le mode « Low Power » (basse puissance) réduit considérablement la vitesse d'inférence ; évitez de l'utiliser lors de l'exécution de modèles.
Habitude pratique : Débranché pour discuter et obtenir de l'aide en programmation. Branché, en mode haute puissance, pour le traitement par lots d'images et la vidéo.
Les contre-arguments honnêtes
Un guide qui ne présente qu'un seul point de vue, c'est du marketing. Voici les arguments contre.
1. Le M5 Max est véritablement plus rapide, et la différence est flagrante
307 Go/s contre 614 Go/s. Étant donné que le décodage dépend de la bande passante, Un M5 Max à 40 cœurs génère des jetons environ deux fois plus vite sur le même modèle. Il s'adapte également gpt-oss-120b, ce que le M5 Pro ne peut pas faire.
Si votre principal cas d'utilisation est la vitesse de décodage de grands modèles, le M5 Max est la machine qu'il vous faut, tandis que le M5 Pro représente un compromis. Le bémol, c'est le prix : après juin 2026, cette mise à niveau coûtera très cher.
2. Un M4 Max à prix réduit pourrait bien rivaliser avec un M5 Pro neuf
C'est l'argument que la plupart des acheteurs négligent. Le M4 Max dispose d'une bande passante mémoire d'environ 546 Go/s, soit nettement plus que les 307 Go/s du M5 Pro. Pour le décodage pur d'un LLM, un M4 Max 64 Go est généralement plus performant qu'un M5 Pro 64 Go.
Ce à quoi vous renoncez : les accélérateurs neuronaux de la M5, ce qui se traduit par un préremplissage et une génération d'images nettement plus lents.
La règle de décision : Si vous utilisez principalement des modèles de grande taille, le M4 Max 64 Go à prix réduit est sans doute le meilleur choix. En revanche, si vous pratiquez le codage agentique avec des contextes longs ou si vous générez des images, les avantages du M5 Pro en matière de préremplissage et de diffusion l'emportent.
3. NVIDIA reste en tête dans le domaine du calcul
Une RTX 5090 dispose de 32 Go de mémoire vidéo, soit environ 1 792 Go/s — soit près de six fois la bande passante du M5 Pro — sans compter une puissance de calcul nettement supérieure. Pour tout modèle pouvant tenir dans 32 Go, et pour toutes les tâches dépendantes de la puissance de calcul (vidéo, image, préremplissage), il n’y a pas photo.
L'avantage du Mac commence précisément là où s'arrêtent les 32 Go de mémoire vidéo, et comprend la portabilité, le silence, la faible consommation d'énergie et la possibilité de faire tout cela dans un train.
4. Les concurrents proposant une mémoire unifiée de 128 Go misent sur la capacité, et non sur la vitesse
NVIDIA DGX Spark / GB10 : 128 Go à environ 273 Go/s, avec CUDA. Sur gpt-oss-120b MXFP4 : selon des tests indépendants, sa vitesse de traitement est comprise entre 34 et 39 tok/s.
AMD Strix Halo / Ryzen AI Max+ 395 : 128 Go à environ 256 Go/s. Selon les chiffres fournis par AMD, ce même modèle atteint jusqu’à 30 tok/s via llama.cpp. Les mini-PC équipés de ce composant sont nettement moins chers que n’importe quel Mac.
Notez que les deux ont inférieur une bande passante supérieure à celle du M5 Pro. Ils vous offrent de la capacité, pas de la vitesse. Si votre objectif est d'exécuter des modèles très volumineux à une vitesse acceptable plutôt qu'à grande vitesse, ils sont plus économiques. Si vous recherchez la vitesse, ce n'est pas la solution.
5. Un Mac de bureau est un meilleur ordinateur fixe
A Mac Studio M3 Ultra atteint 512 Go à 800 Go/s. Si votre ordinateur reste sur un bureau, c’est un appareil bien plus performant pour l’IA locale que n’importe quel MacBook Pro. Les atouts d’un ordinateur portable sont sa portabilité, son autonomie et son silence — si vous n’en avez pas besoin, ne payez pas pour ça.
6. Il n'est pas possible d'augmenter la capacité de la mémoire. Jamais.
La mémoire des puces Apple Silicon est intégrée au boîtier. La quantité de mémoire dont vous disposez correspond à celle du produit que vous achetez et restera inchangée pendant toute la durée de vie de l'appareil.
Étant donné que les modèles commercialisés en 2026 continuent de présenter des empreintes MoE de plus en plus importantes, Acheter trop peu de mémoire vive (RAM) est un regret classique et récurrent. Si vous hésitez entre 48 Go et 64 Go, optez pour la version 64 Go.
Comparaison des coûts : infrastructure locale ou cloud ?

Faisons le calcul en toute honnêteté, car on affirme souvent que “ le local coûte moins cher ”, mais on le vérifie rarement.
Machine : environ 1 TP 4 T 2 800 pour un M5 Pro 64 Go, amorti sur trois à quatre ans.
Tarifs de l'API en août 2026 (par million de jetons, entrée/sortie) :
| Service | Saisie | Résultat |
|---|---|---|
| Classe « Claude Sonnet » | ~$3 | ~$15 |
| de type GPT-5 | ~$1,75–$5 | ~$14–$30 |
| DeepSeek V4 Flash | ~$0.14 | ~$0.28 |
| Modèles ouverts hébergés (gpt-oss, Llama) | Encore plus bas | Encore plus bas |
Location de GPU dans le cloud : H100 : environ $3/heure, H200 : environ $5/heure à la demande.
Le seuil de rentabilité : Selon les analyses publiées, le seuil de rentabilité pour un appareil grand public se situerait à environ 2 à 3 millions de jetons par jour, à un rythme soutenu pendant environ douze mois par rapport aux API propriétaires de milieu de gamme.
Cela représente un nombre considérable de jetons. En dessous de ce seuil, les API bon marché — notamment celles de la gamme DeepSeek — sont réellement plus avantageuses que les solutions locales en termes de coût pur des jetons.
Alors, pourquoi acheter cette machine ?
Car le coût des jetons n'est pas le seul coût :
- Confidentialité. Vos données ne quittent jamais l'appareil. Dans le cadre de travaux juridiques, médicaux, financiers ou liés à du code propriétaire, cette condition est souvent incontournable, quel que soit le prix.
- Aucune limite de fréquence. Pas de limitation de débit, pas de files d'attente, pas d'erreurs de capacité à 2 heures du matin.
- Hors ligne. Les avions, les trains, le Wi-Fi médiocre des hôtels, les pannes de réseau.
- Coût marginal nul. Cela modifie les comportements bien plus que ce à quoi on pourrait s'attendre. Lorsque chaque expérience est gratuite, on en effectue dix fois plus. Le fait de ne plus avoir à se soucier du coût de chaque jeton lors des itérations se traduit par un gain concret en termes de rendement.
- De toute façon, tu avais besoin d'un ordinateur portable. La formulation correcte n’est pas “ $2 800 pour l’IA ” : il s’agit de la différence de prix entre l’appareil que vous auriez acheté et celui-ci.
La bonne réponse est « hybride ». Le local pour le volume, la confidentialité, les itérations et les boucles d’agents. Le cloud pour les problèmes complexes. Quiconque prétend que le local remplacera entièrement les API de pointe d’ici 2026 exagère ; quiconque prétend que le local est inutile n’a jamais exécuté de boucle d’agents à grande échelle.
Le guide d'achat
| Si vous… | Achetez cet article | Pourquoi |
|---|---|---|
| Vous recherchez l'ordinateur portable offrant le meilleur compromis en matière d'IA locale ? | M5 Pro 64 Go, 16 pouces | Prend en charge les modèles 8B à 70B et MoE, génération rapide d'images, et suffisamment d'espace pour tout le reste. Meilleures performances thermiques que les modèles 14 pouces. |
Besoin gpt-oss-120b ou les modèles 120B+ | M5 Max 128 Go | Le seul ordinateur portable Mac qui leur convient. Et une vitesse de décodage environ deux fois supérieure. |
| Je discute surtout avec des mannequins de grande taille, je recherche un bon rapport qualité-prix | M4 Max 64 Go à prix réduit | Sa bande passante plus élevée (546 Go/s) lui permet de surpasser le M5 Pro en matière de décodage. |
| Prenez la création de vidéos au sérieux | NVIDIA (RTX 5090) ou cloud | Tâches gourmandes en calcul ; les Mac sont plusieurs fois plus lents. |
| Vous recherchez une capacité maximale sans vous ruiner ? | Mini-PC Strix Halo 128 Go | 128 Go à petit prix, mais une bande passante inférieure à celle du M5 Pro. |
| Travailler à un bureau | Mac Studio M3 Ultra | Jusqu'à 512 Go à 800 Go/s. |
| Vous disposez d'un budget limité | M5 Pro 48 Go | Fonctionne parfaitement en classe 32B. Accepte la limite maximale de 70B/MoE. |
Ce que je ne ferais pas : Achetez un ordinateur de 24 Go ou 32 Go si vous souhaitez vous lancer sérieusement dans l'IA locale. Vous atteindrez vos limites en quelques semaines et ne pourrez pas améliorer la configuration.
Foire aux questions
64 Go suffiront-ils pour l'IA locale en 2026 ? Oui, pour la plupart des charges de travail. 64 Go permettent d’exécuter sans problème des modèles comptant jusqu’à environ 70 milliards de paramètres avec une quantification à 4 bits, ainsi que des modèles de type « Mixture-of-Experts » tels que GLM-4.6 Air, tout en laissant suffisamment d’espace pour votre système d’exploitation et vos applications. La principale exception est gpt-oss-120b, qui nécessite environ 63 Go rien que pour les poids et qui exige un ordinateur doté d'un disque dur de 128 Go.
Le M5 Pro peut-il faire tourner gpt-oss-120b ? Non. La version MXFP4 nécessite environ 63 Go pour les poids, et la consommation maximale de mémoire mesurée sur un M5 Max se situe entre 64,4 et 64,9 Go selon la longueur du contexte. Sur une machine de 64 Go, dont l’espace utilisable se situe en réalité entre 52 et 60 Go, cela ne tient pas. Il s’agit ici d’un modèle de 128 Go.
Combien de jetons par seconde le M5 Pro génère-t-il ? Cela dépend fortement du modèle. Chiffres mesurés pour le M5 Pro à 20 cœurs avec 64 Go : gpt-oss-20b à une vitesse de décodage de 66 à 80 tok/s avec un préremplissage de 1 500 à 2 200 tok/s, et Qwen3.6-27B à une vitesse de décodage de 17,8 tok/s avec un préremplissage de 470 tok/s. Les modèles plus volumineux et denses, comme Llama 3.3 70B, sont estimés à 7–12 tok/s.
M5 Pro ou M5 Max pour les LLM locaux ? Optez pour le M5 Max si la vitesse de génération de jetons sur les grands modèles est votre priorité : il offre une bande passante mémoire de 614 Go/s contre 307 Go/s pour le M5 Pro, ce qui permet de doubler approximativement la vitesse de décodage, et prend en charge 128 Go. Optez pour le M5 Pro si vous recherchez le meilleur compromis entre prix, portabilité et performances pour des modèles allant jusqu'à 70 milliards de paramètres.
La création de vidéos est-elle possible sur un Mac ? Pas vraiment, en 2026. La diffusion vidéo dépend de la puissance de calcul, et les Mac sont plusieurs fois plus lents qu’une RTX 5090. Les modèles distillés aident — LTX 2.3 produit un clip de 5 secondes en environ 121 secondes sur un M5 Max — mais pour un débit réel, la location de GPU dans le cloud est nettement plus rapide et moins chère par clip.
Comment augmenter la limite de mémoire du GPU sous macOS ? Courir sudo sysctl iogpu.wired_limit_mb=61440 pour allouer 60 Go. Vérifiez avec sysctl iogpu.wired_limit_mb et réinitialisé à la valeur de 0. Ajoutez-le à /etc/sysctl.conf pour que ces paramètres soient conservés après les redémarrages. Prévoyez toujours entre 4 et 8 Go pour macOS.
MLX ou llama.cpp sur Apple Silicon ? MLX dans la plupart des cas. Il devance llama.cpp de 20 à 871 TP3T sur les modèles de moins de 14 milliards de tokens, utilise environ 101 TP3T de mémoire en moins, et c’est vers cette solution qu’Ollama 0.19 s’est orienté en mars 2026. La seule exception concerne les contextes très longs : à partir de 30 000 tokens, llama.cpp avec Flash Attention peut être jusqu’à 501 TP3T plus rapide.
Dois-je acheter le modèle 14 pouces ou le modèle 16 pouces ? Le modèle 16 pouces est idéal pour une utilisation intensive de l'IA. Il offre une meilleure marge thermique, une batterie plus grande et un mode « High Power ». Le modèle 14 pouces subit une baisse de performances notable en cas de charge prolongée.
Un M4 Max en promotion est-il plus performant qu'un M5 Pro neuf ? Pour le décodage pur des modèles de langage (LLM), c'est souvent le cas : le M4 Max offre environ 546 Go/s, contre 307 Go/s pour le M5 Pro. Le M5 Pro l’emporte en matière de traitement des requêtes (jusqu’à 4 fois plus rapide) et de génération d’images (plus de 3,8 fois plus rapide) grâce à ses accélérateurs neuronaux. Faites votre choix en fonction de la charge de travail qui prédomine dans votre utilisation.
Et maintenant ?
Quelques éléments à surveiller, car ils pourraient modifier la recommandation ci-dessus.
Tests de performances indépendants du M5 Pro sur les modèles 70B. Personne n'a encore publié de chiffres de décodage correctement mesurés. Si les résultats concrets dépassent les 15 tok/s, l'argument selon lequel “ il faut acheter le Max pour le décodage ” perdra considérablement de sa force.
Plus petit gpt-oss-120b quantifications. Si la taille d'une version est inférieure à 52 Go, l'argument du plafond de 64 Go perd de son poids du jour au lendemain.
Paramètres par défaut de la mémoire sous macOS. Si Apple augmente l'allocation par défaut du GPU au-delà de 75%, tous les utilisateurs disposant d'un appareil de 64 Go bénéficieront d'une marge de manœuvre supplémentaire.
Le ministère de l'Éducation continue de remporter des victoires. La tendance vers des modèles à mémoire totale élevée et à faible nombre de paramètres actifs est sans conteste la meilleure chose qui soit arrivée aux machines à mémoire unifiée. Chaque nouvelle version de MoE rend les Mac relativement plus compétitifs.
Baisse des prix de l'API. Réévaluez tous les six mois le seuil de rentabilité entre l'infrastructure locale et le cloud. Ce seuil évolue.
En résumé
Le MacBook Pro M5 Pro avec 64 Go n'est pas l'ordinateur doté d'une IA locale le plus rapide du marché. Ce n'est même pas le Mac le plus rapide. C'est simplement la configuration où les compromis cessent de s'opposer les uns aux autres.
Il exécute des modèles suffisamment performants pour être réellement utiles — gpt-oss-20b à une vitesse de 66 à 80 tok/s, GLM-4.6 Air à environ 30, génération d’images en quelques secondes — tout en restant un ordinateur portable que vous pouvez transporter, faire fonctionner sur batterie et utiliser comme votre ordinateur principal. Les accélérateurs neuronaux de la génération M5 ont corrigé la faiblesse spécifique (traitement lent des invites) qui rendait les anciens Mac frustrants pour les tâches nécessitant une grande autonomie et un contexte étendu.
Ces limites sont bien réelles et il est utile de les connaître : gpt-oss-120b Cela ne convient pas : les modèles denses de type 70B sont des outils de traitement par lots plutôt que des interlocuteurs de chat, et la génération de vidéos relève du cloud.
Si ces contraintes correspondent à votre activité, c'est la machine qu'il vous faut. Si ce n'est pas le cas, les sections ci-dessus vous indiquent précisément quelle autre machine acheter à la place — et cela vous sera bien plus utile qu'un énième article vous assurant que tout va bien.
Les prix, les versions des modèles et les chiffres de référence mentionnés dans cet article reflètent les données disponibles en août 2026 et sont susceptibles d’évoluer rapidement — en particulier les prix des Mac dans le contexte de la pénurie actuelle de mémoire. Vérifiez les caractéristiques techniques actuelles avant tout achat.



