Strix Halo vs DGX Spark : le duel des machines 128 Go pour LLM local
En 2026, deux machines à 128 Go de mémoire unifiée se disputent le bureau des amateurs de LLM local : le Ryzen AI Max+ 395 d'AMD (nom de code Strix Halo) et le DGX Spark de NVIDIA. Sur le papier, même capacité mémoire, même promesse — charger des modèles 70B et de gros MoE sans multi-GPU. En pratique, le duel strix halo vs dgx spark se joue moins sur la génération de tokens que sur le prompt processing, où l'écart atteint un facteur 5. Ce comparatif pose les chiffres, le prix, et tranche selon votre usage réel.
#Deux 128 Go, deux philosophies
Le Ryzen AI Max+ 395 est un APU x86 : CPU Zen 5 (16 cœurs), iGPU Radeon 8060S (RDNA 3.5, 40 CU) et NPU XDNA 2, le tout partageant jusqu'à 128 Go de LPDDR5X sur un bus 256 bits. On le trouve dans des mini-PC (Framework Desktop, GMKtec EVO-X2, Beelink GTR9) et quelques laptops. C'est une plateforme grand public, sous Windows ou Linux, qui fait tourner Ollama et LM Studio comme n'importe quel PC.
Le DGX Spark est une bête différente : une puce GB10 (architecture Grace Blackwell) avec un CPU ARM 20 cœurs et un GPU Blackwell doté de Tensor Cores, également couplés à 128 Go de LPDDR5X unifiée. C'est un appareil NVIDIA-first, livré avec DGX OS (un Ubuntu customisé) et l'intégralité de la stack CUDA. Prix officiel annoncé : 4 699 dollars.
#1. Les specs face à face
Le point qui surprend le plus au premier coup d'œil : la bande passante mémoire est quasiment identique. Or c'est elle qui gouverne la vitesse de génération de tokens. Cela explique pourquoi, en chat, les deux machines se tiennent de près.
- Mémoire
- 128 Go LPDDR5X unifiée des deux côtés. Suffisant pour un 70B Q4 (~40 Go) plus contexte, ou un MoE comme Qwen3-235B en quantization agressive.
- Bande passante
- Strix Halo : ~256 Go/s théoriques (256 bits, LPDDR5X-8000). DGX Spark : ~273 Go/s. Écart réel négligeable pour la génération.
- Calcul GPU
- Radeon 8060S RDNA 3.5, 40 CU, pas de Tensor Cores dédiés. Côté Spark : GPU Blackwell avec Tensor Cores et support FP4 natif — un ordre de grandeur au-dessus en compute brut.
- CPU
- AMD : Zen 5, 16 cœurs x86. NVIDIA : ARM Grace, 20 cœurs. Le x86 reste plus simple pour le logiciel grand public.
- OS
- Strix Halo : Windows 11 ou Linux au choix. DGX Spark : DGX OS (Ubuntu) avec pilotes et CUDA préinstallés.
- Consommation
- Strix Halo : enveloppe 55-120 W selon le châssis. DGX Spark : ~240 W au mur en charge, alimentation dédiée.
#2. Tokens/sec : le match serré
Sur la génération pure (decode), les deux machines sont limitées par la bande passante mémoire, pas par le calcul. Résultat : des chiffres proches, avec un léger avantage au Spark grâce à sa bande passante marginalement supérieure et à des kernels CUDA très optimisés. Voici des mesures représentatives publiées par la communauté en 2026, en quantization Q4 équivalente, prompt court.
- Qwen3-30B-A3B (MoE) — Strix Halo
- ~100 tok/s en génération. Le MoE ne réveille que 3B de paramètres actifs, d'où la vitesse élevée malgré la taille.
- Qwen3-30B-A3B (MoE) — DGX Spark
- ~100-115 tok/s. Écart faible : les deux sont bornés par la mémoire sur ce MoE léger.
- Llama 3.3 70B Q4 — Strix Halo
- ~4-5 tok/s. Un 70B dense sature la bande passante ; l'expérience reste utilisable mais lente.
- Llama 3.3 70B Q4 — DGX Spark
- ~5-6 tok/s. Idem, borné mémoire. La différence se compte en fractions de token/s.
- Modèle 8B Q4 — les deux
- 50-70 tok/s, largement confortable pour du chat interactif.
La conclusion de cette section est contre-intuitive : si vous ne regardez que les tokens/sec en chat, les deux machines sont quasi équivalentes, et le Strix Halo — bien moins cher — semble gagner. Mais ce chiffre ne raconte que la moitié de l'histoire.
#3. Prompt processing : la vraie différence
Le prompt processing (ou prefill) est la phase où le modèle lit et encode votre prompt d'entrée avant de générer le premier token. Contrairement à la génération, cette phase est bornée par le calcul, pas par la mémoire. C'est là que les Tensor Cores du DGX Spark font toute la différence.
- Strix Halo — prefill
- ~340 tok/s de prompt processing sur un modèle 30B typique. L'iGPU RDNA 3.5 n'a pas d'unités matricielles dédiées, il plafonne vite.
- DGX Spark — prefill
- environ 5x plus rapide sur les mêmes modèles, grâce aux Tensor Cores Blackwell et au support FP4. Sur de gros contextes, l'écart peut se creuser encore.
Pourquoi ça compte ? Parce que dès que vous sortez du chat court, le prefill domine le temps de réponse perçu. Un système RAG qui injecte 8 000 tokens de contexte, un agent qui relit tout son historique à chaque tour, une analyse de document long, du traitement par batch : dans tous ces cas, vous attendez le prefill avant de voir quoi que ce soit.
Exemple concret : un prompt de 4 000 tokens. À 340 tok/s, le Strix Halo met ~12 secondes rien que pour le prefill avant de commencer à répondre. Le DGX Spark, ~5x plus rapide, boucle la même phase en 2-3 secondes. Sur une session RAG intensive avec des dizaines de requêtes, cet écart devient l'expérience dominante.
#4. Prix et disponibilité
C'est le domaine où le Strix Halo reprend l'avantage, et pas qu'un peu. Le rapport prix/mémoire est son argument massue.
- DGX Spark
- 4 699 dollars, prix NVIDIA officiel. Disponibilité via NVIDIA et partenaires (Dell, Asus, HP, Lenovo). Positionnement pro/développeur.
- Strix Halo — mini-PC
- Framework Desktop, GMKtec EVO-X2, Beelink GTR9 : selon la config 128 Go, on se situe généralement entre ~1 700 et ~2 500 dollars/euros. Environ deux fois moins cher que le Spark pour la même mémoire.
- Strix Halo — laptop
- Quelques portables (ex. HP ZBook Ultra, Asus ROG Flow Z13) embarquent l'APU, avantage rare pour du LLM 128 Go en mobilité.
- Disponibilité
- Strix Halo est en vente ouverte chez plusieurs assembleurs depuis mi-2026. Le DGX Spark suit un calendrier NVIDIA plus contraint selon les régions.
#5. Écosystème logiciel
Au-delà du matériel, la stack logicielle pèse lourd dans le confort quotidien — et c'est là que NVIDIA capitalise sur des années d'avance CUDA.
- DGX Spark — CUDA
- Tout l'écosystème NVIDIA fonctionne nativement : vLLM, TensorRT-LLM, PyTorch, les containers NGC. Pour du fine-tuning, du serving batché ou de la recherche, c'est le terrain le plus balisé.
- Strix Halo — ROCm / Vulkan
- L'inférence marche bien via Ollama et llama.cpp (backend Vulkan ou ROCm). Le fine-tuning et les frameworks avancés restent plus artisanaux sur RDNA 3.5 qu'en CUDA.
- Simplicité grand public
- Avantage Strix Halo pour l'utilisateur lambda : Windows, Ollama en une commande, LM Studio en clic. Le Spark suppose d'être à l'aise sous Linux/Ubuntu.
- Serving multi-clients
- Avantage DGX Spark : vLLM et TensorRT-LLM offrent du batching et un débit agrégé bien supérieurs pour servir une équipe ou une app.
#6. Quel profil pour quelle machine
- 01Vous faites surtout du chat local et du MoEStrix Halo. Les tokens/sec en génération sont au niveau du Spark, le prix est deux fois inférieur, et Windows + Ollama rend l'usage trivial. Un Qwen3-30B-A3B à ~100 t/s est un excellent daily driver.
- 02Vous montez un RAG ou des agents à long contexteDGX Spark. Le prompt processing 5x plus rapide transforme l'expérience dès que vous injectez de gros contextes à répétition. C'est le scénario où le prix supplémentaire se justifie.
- 03Vous voulez fine-tuner ou faire de la rechercheDGX Spark. La stack CUDA (PyTorch, TensorRT-LLM, containers NGC) est incomparablement mieux outillée que ROCm sur APU pour l'entraînement.
- 04Vous cherchez le meilleur rapport mémoire/euroStrix Halo, sans hésiter. 128 Go unifiés à ~2 000 €, souvent moitié prix du Spark, avec la polyvalence x86 d'un vrai PC de bureau.
- 05Vous voulez 128 Go en mobilitéStrix Halo, via un laptop équipé de l'APU — une catégorie que le DGX Spark, appareil de bureau, ne couvre pas.
#Verdict
Le duel strix halo vs dgx spark n'a pas un vainqueur unique : il a deux gagnants selon la charge de travail. Le Strix Halo gagne le rapport prix/mémoire et le chat interactif ; le DGX Spark gagne le prompt processing, le fine-tuning et l'écosystème CUDA.
- Le chiffre qui trompe
- ~100 tok/s de génération des deux côtés sur Qwen3-30B → semble un match nul, avantage prix au Strix Halo.
- Le chiffre qui tranche
- Prompt processing ~340 tok/s (Strix Halo) contre ~5x plus (DGX Spark). C'est lui qui décide dès qu'on quitte le chat court.
- La règle simple
- Contexte court + budget serré → Strix Halo. Contexte long, agents, RAG, fine-tuning → DGX Spark.
#Pour aller plus loin
Pour creuser chaque machine et le contexte matériel autour de ce duel :
- Ryzen AI Max+ 395 (Strix Halo)
- Le guide dédié à l'APU AMD : mini-PC et laptops disponibles, modèles 70B+ accessibles et perfs réelles face aux GPU dédiés et aux Mac.
- NVIDIA DGX Spark
- Le mini-PC IA à 128 Go décortiqué face aux GPU classiques : repères de performance, cas d'usage et limites.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Pour comprendre pourquoi un 70B tient en 40 Go en Q4 et ce que chaque cran coûte en qualité sur ces machines à mémoire unifiée.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.