Intermédiaire 14 minApple

MacBook Pro M5 Max 128 Go : les vraies mesures en IA locale (benchmark 2026)

Un MacBook Pro M5 Max 40 cœurs GPU avec 128 Go de mémoire unifiée, un protocole écrit à l'avance, six modèles, un document de 16 689 tokens : voici les premiers relevés publics en français sur le plus gros portable Apple en IA locale. Les mesures ont été réalisées par Joël Ramat, consultant cybersécurité et GRC, sur sa propre machine, à notre demande et selon notre protocole. Tous les chiffres sont les sorties brutes d'Ollama, sans retouche.

Par Mohamed Meguedmi·Màj 2026-09-16·Testé sur macOS 14+
MacBook Pro ouvert sur un bureau sombre, terminal affichant une génération de texte en cours
Illustration. La machine testée est un MacBook Pro M5 Max 128 Go de série, sans aucun réglage système modifié.
i
Pourquoi ce guide existe
Le M5 Max 128 Go est la seule configuration du haut de notre configurateur sur laquelle nous ne pouvions produire aucun relevé de première main. Joël Ramat, lecteur du kit Mac et propriétaire de la machine, a proposé de faire les mesures. Nous avons écrit le protocole, il l'a exécuté le 16 septembre 2026, et nous publions ici ses résultats en le créditant comme auteur des mesures.

#La machine et le protocole

Fiche de la machine : puce M5 Max, 40 cœurs GPU, 18 cœurs CPU, 614 Go/s, 128 Go de mémoire unifiée, macOS 27.0, Ollama 0.34.1
La configuration exacte, relevée par script avant la première mesure. Le nombre de cœurs GPU est le point décisif : seule la variante 40 cœurs atteint 614 Go/s.

La machine est un MacBook Pro 16 pouces avec la puce M5 Max complète : 18 cœurs CPU, 40 cœurs GPU, 128 Go de mémoire unifiée annoncés à 614 Go/s. Elle tourne sous macOS 27.0 avec Ollama 0.34.1. Aucun paramètre système n'a été modifié : la limite mémoire GPU est celle par défaut, ce qui compte pour comparer avec votre propre Mac.

Le protocole tient en quatre règles, et elles ne sont pas décoratives. Mac branché sur secteur, parce que macOS bride la puce sur batterie. Applications lourdes fermées. Un seul modèle chargé à la fois. Et surtout le même prompt pour toutes les séries, celui qui rend les chiffres comparables entre modèles et, demain, entre machines.

Le prompt commun à toutes les séries
Explique en 300 mots la différence entre la mémoire unifiée d'un Mac et la VRAM d'un GPU dédié, pour un lecteur non technique.
Série A, les deux repères
Gemma 4 12B et Qwen 3.8 27B en GGUF, deux modèles qui tournent aussi sur des Mac bien plus modestes. Ils situent la machine sur une échelle connue.
Série B, MLX contre GGUF
Le même Qwen 3.8 27B, même poids, servi par le moteur MLX d'Ollama au lieu de llama.cpp. Seul le moteur change.
Série C, le vrai sujet du palier 128 Go
gpt-oss 120B, 65 Go, un modèle qui n'entre tout simplement pas dans un portable PC.
Série D, le préfill sur charge réelle
Un document de 16 689 tokens envoyé d'un bloc à gpt-oss 120B, avec une consigne de synthèse. C'est le seul relevé de préfill significatif de la campagne.
Deux bonus hors protocole
Joël avait déjà Qwen 3.6 35B-A3B en MLX et gpt-oss 20B sur sa machine. Il les a mesurés dans les mêmes conditions.
Ce qu'on mesure, et ce qu'il ne faut pas confondre
Ollama affiche deux débits. Le préfill (prompt eval rate) est la vitesse à laquelle le modèle lit votre prompt avant de répondre : il fait l'attente avant le premier mot. La génération (eval rate) est la production de la réponse, token après token : elle fait la sensation de fluidité. Un modèle peut être rapide sur l'un et lent sur l'autre.

#Tous les chiffres en un tableau

Le kit Mac

L'IA locale sur ton Mac, à fond : mémoire unifiée, MLX vs GGUF, le bon modèle pour ta puce, Ollama et LM Studio réglés pour Apple Silicon.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j

Voici les sorties brutes de la commande ollama run --verbose, telles que Joël les a copiées après chaque mesure. Chaque modèle a produit une réponse complète au prompt de 300 mots, en mode raisonnement quand le modèle en dispose, ce qui explique les 1 400 à 3 200 tokens générés pour 300 mots de texte final.

M5 Max 40 GPU · 128 Go · Ollama 0.34.1 · secteur · deux passages par modèle, second conservé · 16/09/2026
ModèleMoteurPoidsGénérationTokens produitsDurée totale
Gemma 4 12BGGUF Q47,6 Go58,1 tok/s1 39024 s
Qwen 3.8 27BGGUF Q417 Go36,6 tok/s2 51769 s
Qwen 3.8 27BMLX18 Go68,0 tok/s2 10331 s
Qwen 3.6 35B-A3B (bonus)MLX23 Go167,2 tok/s3 20519 s
gpt-oss 20B (bonus)MXFP413 Go113,4 tok/s2 19919 s
gpt-oss 120BMXFP465 Go79,1 tok/s6698,5 s
gpt-oss 120B, relance 1MXFP465 Go77,5 tok/s73212,5 s
gpt-oss 120B, relance 2MXFP465 Go75,5 tok/s1 70722,7 s
gpt-oss 120B, série DMXFP465 Go67,6 tok/s2 58450 s
Préfill : seul le relevé de la série D est significatif (voir la section Limites)
SérieTokens de promptPréfillTemps avant le premier mot
A, B, C (prompt court)43 à 9831 à 346 tok/s0,1 à 0,9 s : latence de démarrage, pas un débit
D, document de 16 689 tokens16 6891 388 tok/s12,0 s
!
Pourquoi les préfills des prompts courts ne sont pas commentés
Chaque modèle a été mesuré deux fois et seul le second passage est conservé, conformément au protocole : le chargement du modèle et la compilation des shaders Metal sont donc hors mesure. Mais sur un prompt de 43 à 98 tokens, le préfill se joue en moins d'une seconde : le chiffre reflète une latence fixe de démarrage, pas un débit de lecture. Il faut des milliers de tokens pour que le débit prenne le dessus, et c'est précisément l'objet de la série D.

#Génération : six modèles, une lecture

Graphique en barres de la vitesse de génération : Qwen 3.6 35B-A3B 167 tokens par seconde, gpt-oss 20B 113, gpt-oss 120B 79, Qwen 3.8 27B MLX 68, Gemma 4 12B 58, Qwen 3.8 27B GGUF 37
Génération en tokens par seconde. En orange les modèles MoE, qui n'activent que 3 à 5 milliards de paramètres par token ; en bleu les modèles denses.

Lu naïvement, ce classement est absurde : un modèle de 120 milliards de paramètres à 79 tokens par seconde, deux fois plus rapide qu'un 27B en GGUF. L'explication tient en trois lettres. gpt-oss 120B, gpt-oss 20B et Qwen 3.6 35B-A3B sont des modèles à mélange d'experts, MoE. À chaque token, seule une fraction des paramètres est sollicitée : environ 5 milliards pour gpt-oss 120B, 3,6 milliards pour gpt-oss 20B, 3 milliards pour le Qwen. La vitesse de génération dépend de ce qui bouge en mémoire à chaque token, pas de ce qui y dort.

Les modèles denses, Gemma 4 12B et Qwen 3.8 27B, sollicitent tous leurs paramètres à chaque token. Leur vitesse suit donc la bande passante mémoire divisée par le poids du modèle : c'est la règle des Mac depuis le M1, et le M5 Max ne s'en affranchit pas. Sur cette machine, un 27B dense en GGUF tourne à 37 tokens par seconde, un 12B à 58.

167 tok/s sur Qwen 3.6 35B-A3B en MLX
Le chiffre le plus élevé de la campagne, sur le modèle qui combine les deux accélérateurs : architecture MoE et moteur MLX. C'est la vitesse d'un petit 8B, avec la culture d'un 35B.
113 tok/s sur gpt-oss 20B
Le meilleur rapport vitesse, qualité et poids pour un usage quotidien de type assistant : 13 Go, une réponse de 2 200 tokens en 19 secondes.
79 tok/s sur gpt-oss 120B
Le modèle le plus capable de la liste, à une vitesse deux fois supérieure à la lecture humaine. C'est le résultat qui justifie le palier 128 Go, on y revient plus bas.
58 et 37 tok/s sur les denses
Gemma 4 12B et Qwen 3.8 27B en GGUF : confortable, mais sans surprise. Ce sont les mêmes ordres de grandeur que sur un M4 Max, la bande passante ayant peu bougé entre les deux générations.
i
Pourquoi le 27B dense est plus lent que le 120B MoE
Qwen 3.8 27B doit déplacer 17 Go de poids par token généré. gpt-oss 120B en déplace environ 3 Go, ceux des experts activés, même si les 65 Go doivent tenir en mémoire. À 614 Go/s, le premier plafonne mécaniquement autour de 36 tokens par seconde, et c'est exactement ce que mesure Joël. Le second a de la marge.

#MLX contre GGUF, à conditions égales

Comparaison de deux barres : Qwen 3.8 27B à 36,6 tokens par seconde en GGUF et 68 tokens par seconde en MLX, soit plus 86 pour cent
Même modèle, même poids à un gigaoctet près, seul le moteur change. L'écart mesuré est de 86 %.

Tout le monde affirme que MLX, la bibliothèque d'Apple optimisée pour Apple Silicon, est plus rapide que llama.cpp. Très peu de gens le mesurent à conditions strictement égales, sur le même modèle, le même jour, la même machine. C'est ce que fait la série B : Qwen 3.8 27B en GGUF Q4 à 36,6 tokens par seconde, puis Qwen 3.8 27B en MLX à 68,0 tokens par seconde. Plus 86 %.

Notre guide sur MLX et le Mac M5 annonçait un gain de 30 à 40 % en génération. Sur le M5 Max et ce modèle, la réalité est plus du double. Une partie de l'écart vient sans doute des optimisations MLX propres à la génération M5 et des accélérateurs neuronaux intégrés au GPU ; nous ne pouvons pas encore isoler leur contribution. Ce que nous pouvons dire, c'est que sur un Mac récent, tourner un modèle dense en GGUF alors que sa version MLX existe revient à laisser la moitié de la machine au garage.

Basculer un modèle sur le moteur MLX
ollama pull qwen3.8:27b-mlx
ollama run qwen3.8:27b-mlx --verbose
Le réflexe à prendre
Avant de tirer un modèle, vérifiez s'il existe un tag -mlx dans la bibliothèque Ollama. Pour un modèle dense de 20 Go et plus, la différence se voit à l'œil nu. Le guide sur MLX et llama.cpp explique comment le moteur est choisi et ce qu'il faut faire quand un tag MLX manque.

#Ce que 128 Go achètent réellement

Schéma : à gauche la mémoire unifiée, un même espace de 128 Go partagé entre CPU et GPU où le modèle IA de 65 Go tient ; à droite la mémoire dédiée, où 65 Go ne tiennent pas dans 16 Go de VRAM
Schéma de principe. La mémoire unifiée met tout le pool de 128 Go à disposition du GPU. Sur un PC portable, une carte graphique de 16 Go ne peut pas charger un modèle de 65 Go, quelle que soit la RAM système.

Le vrai sujet du palier 128 Go n'est pas la vitesse, c'est ce qui rentre. gpt-oss 120B pèse 65 Go en MXFP4. Aucun portable PC ne le fait tourner sur GPU : les cartes mobiles plafonnent à 16 ou 24 Go de VRAM. Sur le M5 Max 128 Go, il se charge, répond entre 75 et 79 tokens par seconde sur trois exécutions, et il reste de la place.

Barre empilée des 128 Go : 35 Go pour macOS et les applications ouvertes, 65 Go pour gpt-oss 120B, 28 Go libres
Répartition de la mémoire pendant la série C, en ordres de grandeur. Joël n'a rien fermé : Obsidian, Terminal et le reste de sa session étaient ouverts.

Le relevé mémoire fait avant la campagne est parlant : 35 Go occupés par macOS et les applications de la session de travail, 93 Go disponibles pour l'IA. Le 120B s'y installe avec une marge d'une trentaine de gigaoctets, de quoi tenir un contexte long et un second modèle léger en parallèle, un 8B pour l'autocomplétion de code par exemple. Sur un M5 Max 64 Go, le même modèle ne se charge pas du tout ; sur 96 Go il passe, mais sans marge pour le reste.

8,5 à 22,7 secondes
Durée totale de la réponse de gpt-oss 120B au prompt de 300 mots, sur trois exécutions : 669, 732 puis 1 707 tokens produits. La vitesse ne bouge pas (79,1, 77,5 et 75,5 tokens par seconde), c'est la longueur du raisonnement qui varie d'une exécution à l'autre, le modèle décidant ou non de compter ses mots un par un.
50 secondes
Durée de la série D : lecture d'un document de 16 689 tokens puis rédaction d'une synthèse en dix puces de 2 584 tokens.
Pression thermique « Nominal »
Relevé après chaque série. Aucun ventilateur audible sur l'ensemble de la campagne, 120B compris.
i
Ce que nous n'avons pas pu mesurer sur ce palier
Un 70B dense en Q4, la configuration que notre fiche MacBook Pro M5 Max estime entre 15 et 25 tokens par seconde en MLX, n'était pas installé sur la machine. Le chiffre reste une estimation jusqu'à la prochaine campagne.

#Le préfill, le chiffre que personne ne publie

Chronologie d'une requête de 50 secondes : 12 secondes de lecture d'un document de 16 689 tokens à 1 388 tokens par seconde, puis 38 secondes de réponse
Série D. Le document envoyé est le rapport de benchmark lui-même, exporté en texte, suivi d'une consigne de synthèse.

Un prompt de vingt mots ne dit rien du préfill. Pour le mesurer, Joël a envoyé à gpt-oss 120B un texte de 11 280 mots en un seul bloc, soit 16 689 tokens et environ 45 pages, avec une consigne de récapitulatif. Résultat : 1 388 tokens par seconde en lecture, soit douze secondes avant que le premier mot de la réponse n'apparaisse, puis 2 584 tokens de synthèse à 67,6 tokens par seconde.

C'est le chiffre qui parle aux usages sérieux. Analyser un contrat, résumer un rapport d'audit, interroger une base documentaire en RAG : dans tous ces cas, le modèle passe l'essentiel de son temps à lire, pas à écrire. Douze secondes pour 45 pages, sur un portable, sans qu'un octet ne quitte la machine, c'est ce qui rend l'IA locale utilisable pour un consultant soumis au secret professionnel ou une entreprise sous contrainte de confidentialité.

Ordre de grandeur pour vos documents
À 1 388 tokens par seconde, un contrat de 30 pages est lu en 8 secondes, un rapport de 100 pages en 27 secondes. Ces temps s'ajoutent à la génération de la réponse ; prévoyez donc environ une minute pour une synthèse complète d'un long document sur cette machine.

#Chaleur et ventilateurs

Joël a noté l'état thermique après chaque série avec la commande de pression thermique de macOS. Verdict constant : « Nominal », et aucune ventilation audible, y compris pendant la série D qui sollicite le GPU à plein pendant cinquante secondes. C'est cohérent avec ce qu'on observe sur les M4 Max, avec une réserve : nos mesures sont des rafales de moins d'une minute. Le test de throttling prévu au protocole, dix minutes de charge continue puis nouvelle mesure de la série A, n'a pas été réalisé. Nous le demanderons lors de la prochaine campagne.

Vérifier la pression thermique pendant une génération
sudo powermetrics --samplers thermal -i 1000 -n 1 | grep -i pressure

#Ce que ces mesures ne disent pas

Un benchmark honnête liste ce qu'il ne prouve pas. Voici les réserves, dans l'ordre d'importance.

Préfills des prompts courts
Deux passages par modèle, second conservé. Mais 43 à 98 tokens de prompt ne mesurent qu'une latence de démarrage : seule la série D, sur 16 689 tokens, donne un vrai débit de lecture.
Aucun modèle dense de 70 milliards
Le palier 128 Go se justifie aussi par les 70B en Q4 avec un long contexte. Non mesuré ici.
Pas de test de throttling
Rafales de moins d'une minute. Le comportement sur une heure de RAG intensif reste à documenter.
Pas de mesure sur batterie
Le protocole impose le secteur. Sur batterie, attendez-vous à des chiffres sensiblement inférieurs, macOS bridant la puce.
Un document de série D propre à chaque testeur
Le texte long envoyé en série D n'est pas imposé par le protocole : deux testeurs ne lisent pas le même document, ce qui limite la comparaison des préfills entre machines. Sur une suggestion de Joël, le protocole fournit désormais un texte de référence unique de 11 292 mots, à télécharger dans la section suivante : les prochains relevés seront comparables entre eux. Le relevé de cette page a été fait avant, sur un autre document de taille équivalente.
Une seule machine, un seul opérateur
Aucune variance mesurée. Si vous avez la même configuration, vos relevés sont bienvenus, voir la section suivante.
Modèles en mode raisonnement
Les modèles qui réfléchissent avant de répondre produisent beaucoup plus de tokens que les 300 mots demandés, et cette longueur varie d'une exécution à l'autre pour un même modèle (669 à 1 707 tokens sur gpt-oss 120B). Les durées totales ne sont donc pas comparables, seules les vitesses le sont.
Cache de prompt sur les relances
Quand le même prompt est relancé, Ollama réutilise les tokens déjà lus (« prompt eval cached »). Le préfill d'une relance à l'identique n'est donc pas une mesure ; pour mesurer le préfill, il faut un prompt long et nouveau, comme en série D.

#Reproduire le benchmark chez vous

Portable vu de dessus sur un bureau blanc, chronomètre mécanique, chargeur branché, carnet et stylo
Illustration. Secteur branché, applications fermées, un modèle à la fois : trois conditions sans lesquelles un relevé ne vaut rien.

Le protocole est conçu pour être rejoué tel quel sur n'importe quel Mac Apple Silicon, du MacBook Air au Mac Studio. Si vous suivez les mêmes séries avec le même prompt, vos chiffres sont directement comparables à ceux de cette page.

  1. 01
    Préparer la machine
  2. 02
    Relever l'état du système
  3. 03
    Série A
  4. 04
    Série B
  5. 05
    Série C
  6. 06
    Série D
Les commandes du protocole
# Série A — les deux repères
ollama pull gemma4:12b && ollama pull qwen3.8:27b
ollama run gemma4:12b --verbose
ollama run qwen3.8:27b --verbose

# Série B — même modèle, moteur MLX
ollama pull qwen3.8:27b-mlx
ollama run qwen3.8:27b-mlx --verbose

# Série C — le palier 128 Go (65 Go à télécharger)
ollama pull gpt-oss:120b
ollama run gpt-oss:120b --verbose

# Série D — préfill sur le texte de référence commun (11 292 mots)
curl -sO https://quelllm.fr/img/protocole/texte-reference-quelllm-v1.txt
ollama run gpt-oss:120b --verbose "$(cat texte-reference-quelllm-v1.txt) Résume ce texte en 10 puces."
Envoyez-nous vos relevés
Collez le bloc de statistiques brut de chaque mesure dans un e-mail à [email protected], avec votre puce, vos cœurs GPU et votre version d'Ollama. Nous publions les relevés vérifiés avec votre nom, ou anonymement si vous préférez. Les configurations qui nous manquent le plus : M5 Max 64 Go, M5 Pro, Mac Studio M5 Ultra.

#Pour qui, et à quel prix

Le M5 Max 128 Go se justifie par un seul usage : faire tourner en local des modèles qui ne rentrent nulle part ailleurs dans un portable, avec de la marge pour le contexte et un second modèle. gpt-oss 120B à 79 tokens par seconde et un document de 45 pages lu en douze secondes, sans ventilateur, c'est une station de travail IA qui tient dans un sac.

Lecture des résultats par profil d'usage
Vous êtesCe que ce benchmark vous ditPalier conseillé
Consultant, avocat, expert-comptable sous secret professionnelUn 120B lit et synthétise vos dossiers en local, à une vitesse utilisable, sans rien envoyer dehorsM5 Max 128 Go
Développeur qui veut un copilote local sérieuxgpt-oss 20B ou Qwen 3.6 35B-A3B suffisent largement et tiennent dans 48 Go. Nos 113 et 167 tok/s valent pour la puce 40 cœurs GPU : la mémoire suffit, la vitesse sera inférieure sur une variante à bande passante plus faibleM5 Max 48 ou 64 Go
Utilisateur quotidien d'un assistant de rédactionUn 12B dense ou un MoE 20B couvrent l'usage ; le 128 Go est un luxe. La mémoire suffit, mais celle du M5 Pro est plus lente : comptez moins que nos 58 et 113 tok/sM5 Pro 48 Go
Équipe qui veut un serveur partagéLe Mac Studio M5 Max ou Ultra offre le même moteur avec plus de mémoire et un refroidissement de bureauMac Studio
!
Ces vitesses valent pour cette puce
Tous les chiffres de cette page ont été mesurés sur un M5 Max à 40 cœurs GPU et 614 Go/s de bande passante mémoire. La génération d'un LLM est limitée par cette bande passante : sur un M5 Max à 32 cœurs GPU ou un M5 Pro, dont la mémoire est plus lente, les mêmes modèles tiendront en mémoire mais iront moins vite. Le tableau ci-dessus dit ce qui rentre, pas la vitesse que vous obtiendrez sur un autre palier.

Si votre besoin s'arrête aux modèles de 30 milliards de paramètres, la moitié de la mémoire suffit et l'écart de prix finance un très bon écran. Si votre besoin commence aux modèles de 100 milliards, il n'existe pas d'alternative portable, et ce guide vous donne les chiffres pour le justifier devant qui signe le bon de commande.

#Crédits et sources

Consultant travaillant de nuit sur un portable affichant un terminal, lampe de bureau et carnet
Illustration. Une session de travail ordinaire, applications ouvertes : c'est dans ces conditions que les mesures ont été faites, sur la machine de travail de leur auteur.

Les mesures de cette page ont été réalisées par Joël Ramat, consultant cybersécurité et GRC, expert ISO 27001, conseil et audit augmentés par l'IA on-premise, cofondateur et président de Sywédgia SAS. Il a exécuté le protocole QuelLLM sur sa propre machine le 16 septembre 2026, et a relu cet article avant publication. Les relevés restent les siens et il est libre de les publier de son côté.

Méthode : sorties brutes de ollama run --verbose copiées après chaque mesure, sans retouche ; état système relevé par script avant la campagne ; pression thermique lue après chaque série. Le rapport complet, avec les réponses intégrales des modèles, est conservé et peut être communiqué sur demande. Rédaction et mise en forme : Mohamed Meguedmi, QuelLLM.fr.


#FAQ

Le M5 Max 128 Go est-il plus rapide que le M4 Max 128 Go en IA locale ?+
Pas de façon spectaculaire sur les modèles denses en GGUF : la bande passante mémoire a peu bougé et Qwen 3.8 27B tourne à 37 tokens par seconde, un ordre de grandeur comparable au M4 Max. L'écart se creuse avec MLX, où le M5 Max mesure 68 tokens par seconde sur le même modèle. Nous n'avons pas de mesure M4 Max en MLX dans les mêmes conditions pour chiffrer l'écart exact.
Pourquoi gpt-oss 120B est-il plus rapide que Qwen 3.8 27B ?+
Parce que gpt-oss 120B est un modèle MoE qui n'active qu'environ 5 milliards de paramètres par token, alors que Qwen 3.8 27B, dense, en déplace 27 milliards à chaque token. La vitesse dépend des paramètres actifs, pas des paramètres totaux. En revanche, les 65 Go du 120B doivent tenir en mémoire, ce que seul le palier 96 ou 128 Go permet.
Faut-il 128 Go pour faire tourner gpt-oss 120B ?+
Il faut au minimum 96 Go de mémoire unifiée pour le charger avec un contexte raisonnable. Les 128 Go apportent la marge pour un contexte long, un second modèle léger et une session de travail normale ouverte à côté. Joël faisait tourner le 120B avec 35 Go déjà occupés par ses applications.
Ces chiffres valent-ils sur batterie ?+
Non. Le protocole impose le secteur parce que macOS bride la puce sur batterie. Attendez-vous à des vitesses nettement inférieures en mobilité, et surtout à des mesures non reproductibles.
Pourquoi les préfills des séries A, B et C ne sont-ils pas publiés ?+
Ils ont été mesurés sur des prompts de 43 à 98 tokens. À cette taille, le préfill dure moins d'une seconde et reflète une latence de démarrage, pas un débit de lecture ; le chiffre ne dit rien de la vitesse à laquelle le modèle lit un vrai document. Le seul préfill exploitable est celui de la série D, sur 16 689 tokens : 1 388 tokens par seconde.
Puis-je envoyer mes propres mesures ?+
Oui. Suivez les séries A à D avec le prompt commun, deux passages par mesure, et envoyez les blocs de statistiques bruts à [email protected] avec votre configuration. Nous publions les relevés vérifiés en vous créditant.
Où trouver le script de préparation utilisé pour ce benchmark ?+
Le script zsh écrit par Joël Ramat, qui produit un rapport complet de l'état du Mac avant mesure, sera ajouté au chapitre benchmark du kit Mac une fois vérifié sur d'autres machines, avec son autorisation et son crédit. En attendant, la section « Reproduire le benchmark » liste les informations à relever à la main.

Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.