Intermédiaire 13 minComparatif

Strix Halo vs DGX Spark : le duel des machines 128 Go pour LLM local

En 2026, deux machines à 128 Go de mémoire unifiée se disputent le bureau des amateurs de LLM local : le Ryzen AI Max+ 395 d'AMD (nom de code Strix Halo) et le DGX Spark de NVIDIA. Sur le papier, même capacité mémoire, même promesse — charger des modèles 70B et de gros MoE sans multi-GPU. En pratique, le duel strix halo vs dgx spark se joue moins sur la génération de tokens que sur le prompt processing, où l'écart atteint un facteur 5. Ce comparatif pose les chiffres, le prix, et tranche selon votre usage réel.

Par Mohamed Meguedmi·Màj 2026-08-20·Testé sur Windows, macOS, Linux

#Deux 128 Go, deux philosophies

Le Ryzen AI Max+ 395 est un APU x86 : CPU Zen 5 (16 cœurs), iGPU Radeon 8060S (RDNA 3.5, 40 CU) et NPU XDNA 2, le tout partageant jusqu'à 128 Go de LPDDR5X sur un bus 256 bits. On le trouve dans des mini-PC (Framework Desktop, GMKtec EVO-X2, Beelink GTR9) et quelques laptops. C'est une plateforme grand public, sous Windows ou Linux, qui fait tourner Ollama et LM Studio comme n'importe quel PC.

Le DGX Spark est une bête différente : une puce GB10 (architecture Grace Blackwell) avec un CPU ARM 20 cœurs et un GPU Blackwell doté de Tensor Cores, également couplés à 128 Go de LPDDR5X unifiée. C'est un appareil NVIDIA-first, livré avec DGX OS (un Ubuntu customisé) et l'intégralité de la stack CUDA. Prix officiel annoncé : 4 699 dollars.

i
Même mémoire, cibles opposées
Strix Halo vise le prix et la polyvalence x86 ; le DGX Spark vise la performance de calcul et l'écosystème CUDA. Les deux chargent les mêmes gros modèles, mais ne les servent pas à la même vitesse ni pour le même budget.

#1. Les specs face à face

Le point qui surprend le plus au premier coup d'œil : la bande passante mémoire est quasiment identique. Or c'est elle qui gouverne la vitesse de génération de tokens. Cela explique pourquoi, en chat, les deux machines se tiennent de près.

Mémoire
128 Go LPDDR5X unifiée des deux côtés. Suffisant pour un 70B Q4 (~40 Go) plus contexte, ou un MoE comme Qwen3-235B en quantization agressive.
Bande passante
Strix Halo : ~256 Go/s théoriques (256 bits, LPDDR5X-8000). DGX Spark : ~273 Go/s. Écart réel négligeable pour la génération.
Calcul GPU
Radeon 8060S RDNA 3.5, 40 CU, pas de Tensor Cores dédiés. Côté Spark : GPU Blackwell avec Tensor Cores et support FP4 natif — un ordre de grandeur au-dessus en compute brut.
CPU
AMD : Zen 5, 16 cœurs x86. NVIDIA : ARM Grace, 20 cœurs. Le x86 reste plus simple pour le logiciel grand public.
OS
Strix Halo : Windows 11 ou Linux au choix. DGX Spark : DGX OS (Ubuntu) avec pilotes et CUDA préinstallés.
Consommation
Strix Halo : enveloppe 55-120 W selon le châssis. DGX Spark : ~240 W au mur en charge, alimentation dédiée.

#2. Tokens/sec : le match serré

Sur la génération pure (decode), les deux machines sont limitées par la bande passante mémoire, pas par le calcul. Résultat : des chiffres proches, avec un léger avantage au Spark grâce à sa bande passante marginalement supérieure et à des kernels CUDA très optimisés. Voici des mesures représentatives publiées par la communauté en 2026, en quantization Q4 équivalente, prompt court.

Qwen3-30B-A3B (MoE) — Strix Halo
~100 tok/s en génération. Le MoE ne réveille que 3B de paramètres actifs, d'où la vitesse élevée malgré la taille.
Qwen3-30B-A3B (MoE) — DGX Spark
~100-115 tok/s. Écart faible : les deux sont bornés par la mémoire sur ce MoE léger.
Llama 3.3 70B Q4 — Strix Halo
~4-5 tok/s. Un 70B dense sature la bande passante ; l'expérience reste utilisable mais lente.
Llama 3.3 70B Q4 — DGX Spark
~5-6 tok/s. Idem, borné mémoire. La différence se compte en fractions de token/s.
Modèle 8B Q4 — les deux
50-70 tok/s, largement confortable pour du chat interactif.
Le MoE est l'ami des 128 Go
Un modèle Mixture-of-Experts comme Qwen3-30B-A3B ne calcule que ses experts actifs à chaque token. Sur ces deux machines, c'est le sweet spot : gros modèle chargé en mémoire, mais vitesse d'un petit modèle. Privilégiez les MoE si vous voulez de la qualité ET du débit.

La conclusion de cette section est contre-intuitive : si vous ne regardez que les tokens/sec en chat, les deux machines sont quasi équivalentes, et le Strix Halo — bien moins cher — semble gagner. Mais ce chiffre ne raconte que la moitié de l'histoire.

#3. Prompt processing : la vraie différence

Le prompt processing (ou prefill) est la phase où le modèle lit et encode votre prompt d'entrée avant de générer le premier token. Contrairement à la génération, cette phase est bornée par le calcul, pas par la mémoire. C'est là que les Tensor Cores du DGX Spark font toute la différence.

Strix Halo — prefill
~340 tok/s de prompt processing sur un modèle 30B typique. L'iGPU RDNA 3.5 n'a pas d'unités matricielles dédiées, il plafonne vite.
DGX Spark — prefill
environ 5x plus rapide sur les mêmes modèles, grâce aux Tensor Cores Blackwell et au support FP4. Sur de gros contextes, l'écart peut se creuser encore.

Pourquoi ça compte ? Parce que dès que vous sortez du chat court, le prefill domine le temps de réponse perçu. Un système RAG qui injecte 8 000 tokens de contexte, un agent qui relit tout son historique à chaque tour, une analyse de document long, du traitement par batch : dans tous ces cas, vous attendez le prefill avant de voir quoi que ce soit.

!
Le piège du benchmark à prompt court
Beaucoup de tests publient uniquement les tokens/sec en génération avec un prompt de 20 tokens, et concluent que le Strix Halo est au niveau. C'est vrai en chat, faux en RAG ou en agent. Si votre usage envoie de longs contextes, le prompt processing du DGX Spark change radicalement l'expérience — mesurez cette phase séparément avant d'acheter.

Exemple concret : un prompt de 4 000 tokens. À 340 tok/s, le Strix Halo met ~12 secondes rien que pour le prefill avant de commencer à répondre. Le DGX Spark, ~5x plus rapide, boucle la même phase en 2-3 secondes. Sur une session RAG intensive avec des dizaines de requêtes, cet écart devient l'expérience dominante.

#4. Prix et disponibilité

C'est le domaine où le Strix Halo reprend l'avantage, et pas qu'un peu. Le rapport prix/mémoire est son argument massue.

DGX Spark
4 699 dollars, prix NVIDIA officiel. Disponibilité via NVIDIA et partenaires (Dell, Asus, HP, Lenovo). Positionnement pro/développeur.
Strix Halo — mini-PC
Framework Desktop, GMKtec EVO-X2, Beelink GTR9 : selon la config 128 Go, on se situe généralement entre ~1 700 et ~2 500 dollars/euros. Environ deux fois moins cher que le Spark pour la même mémoire.
Strix Halo — laptop
Quelques portables (ex. HP ZBook Ultra, Asus ROG Flow Z13) embarquent l'APU, avantage rare pour du LLM 128 Go en mobilité.
Disponibilité
Strix Halo est en vente ouverte chez plusieurs assembleurs depuis mi-2026. Le DGX Spark suit un calendrier NVIDIA plus contraint selon les régions.
i
Le vrai arbitrage prix
Pour environ le prix d'un DGX Spark, vous pouvez acheter un mini-PC Strix Halo 128 Go ET une RTX 4090 24 Go à côté. Si votre besoin est surtout du chat et des modèles qui tiennent en 24 Go, cette combinaison peut battre le Spark sur presque tous les tableaux — sauf le prompt processing sur très gros modèles.

#5. Écosystème logiciel

Au-delà du matériel, la stack logicielle pèse lourd dans le confort quotidien — et c'est là que NVIDIA capitalise sur des années d'avance CUDA.

DGX Spark — CUDA
Tout l'écosystème NVIDIA fonctionne nativement : vLLM, TensorRT-LLM, PyTorch, les containers NGC. Pour du fine-tuning, du serving batché ou de la recherche, c'est le terrain le plus balisé.
Strix Halo — ROCm / Vulkan
L'inférence marche bien via Ollama et llama.cpp (backend Vulkan ou ROCm). Le fine-tuning et les frameworks avancés restent plus artisanaux sur RDNA 3.5 qu'en CUDA.
Simplicité grand public
Avantage Strix Halo pour l'utilisateur lambda : Windows, Ollama en une commande, LM Studio en clic. Le Spark suppose d'être à l'aise sous Linux/Ubuntu.
Serving multi-clients
Avantage DGX Spark : vLLM et TensorRT-LLM offrent du batching et un débit agrégé bien supérieurs pour servir une équipe ou une app.

#6. Quel profil pour quelle machine

  1. 01
    Vous faites surtout du chat local et du MoE
    Strix Halo. Les tokens/sec en génération sont au niveau du Spark, le prix est deux fois inférieur, et Windows + Ollama rend l'usage trivial. Un Qwen3-30B-A3B à ~100 t/s est un excellent daily driver.
  2. 02
    Vous montez un RAG ou des agents à long contexte
    DGX Spark. Le prompt processing 5x plus rapide transforme l'expérience dès que vous injectez de gros contextes à répétition. C'est le scénario où le prix supplémentaire se justifie.
  3. 03
    Vous voulez fine-tuner ou faire de la recherche
    DGX Spark. La stack CUDA (PyTorch, TensorRT-LLM, containers NGC) est incomparablement mieux outillée que ROCm sur APU pour l'entraînement.
  4. 04
    Vous cherchez le meilleur rapport mémoire/euro
    Strix Halo, sans hésiter. 128 Go unifiés à ~2 000 €, souvent moitié prix du Spark, avec la polyvalence x86 d'un vrai PC de bureau.
  5. 05
    Vous voulez 128 Go en mobilité
    Strix Halo, via un laptop équipé de l'APU — une catégorie que le DGX Spark, appareil de bureau, ne couvre pas.

#Verdict

Le duel strix halo vs dgx spark n'a pas un vainqueur unique : il a deux gagnants selon la charge de travail. Le Strix Halo gagne le rapport prix/mémoire et le chat interactif ; le DGX Spark gagne le prompt processing, le fine-tuning et l'écosystème CUDA.

Le chiffre qui trompe
~100 tok/s de génération des deux côtés sur Qwen3-30B → semble un match nul, avantage prix au Strix Halo.
Le chiffre qui tranche
Prompt processing ~340 tok/s (Strix Halo) contre ~5x plus (DGX Spark). C'est lui qui décide dès qu'on quitte le chat court.
La règle simple
Contexte court + budget serré → Strix Halo. Contexte long, agents, RAG, fine-tuning → DGX Spark.
Testez votre charge réelle, pas un benchmark générique
Avant d'acheter, chronométrez votre prompt typique : longueur d'entrée, fréquence des requêtes, taille du modèle visé. Si vos prompts dépassent régulièrement quelques milliers de tokens, le prompt processing du Spark justifie son prix. Sinon, le Strix Halo est le choix rationnel.

#Pour aller plus loin

Pour creuser chaque machine et le contexte matériel autour de ce duel :

Ryzen AI Max+ 395 (Strix Halo)
Le guide dédié à l'APU AMD : mini-PC et laptops disponibles, modèles 70B+ accessibles et perfs réelles face aux GPU dédiés et aux Mac.
NVIDIA DGX Spark
Le mini-PC IA à 128 Go décortiqué face aux GPU classiques : repères de performance, cas d'usage et limites.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Pour comprendre pourquoi un 70B tient en 40 Go en Q4 et ce que chaque cran coûte en qualité sur ces machines à mémoire unifiée.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.