Ryzen AI 9 HX : le NPU 50 TOPS sert-il vraiment pour les LLM ?
Le Ryzen AI 9 HX 370 affiche fièrement 50 TOPS sur son NPU XDNA 2 — un chiffre que marketing AMD adore brandir face à Intel et Apple. La vraie question pour qui veut faire tourner un LLM local : ce NPU sert-il à quelque chose, ou faut-il continuer à compter sur le GPU intégré Radeon 890M ? Ce guide teste honnêtement la stack Ryzen AI pour LLM (LM Studio Ryzen AI, Lemonade SDK), compare au CPU pur et à l'iGPU, et donne le verdict — sans embellissement.
#Pourquoi un NPU pour un LLM local ?
Un NPU (Neural Processing Unit) est un accélérateur dédié aux opérations matricielles INT8 et INT4 typiques de l'inférence. Sur le Ryzen AI 9 HX 370, le bloc XDNA 2 délivre jusqu'à 50 TOPS INT8 pour environ 2 W de consommation. À première vue, le compromis est imbattable pour un usage portable — un LLM qui tourne sans réveiller les ventilateurs et sans vider la batterie en 40 minutes.
Le mot-clé Ryzen AI 9 HX LLM NPU revient partout dans les démos AMD, mais en réalité l'écosystème logiciel est jeune. La plupart des stacks LLM (llama.cpp, Ollama, vLLM) ignorent complètement le NPU et exécutent tout sur CPU AVX-512 ou sur le GPU intégré via Vulkan / ROCm. Pour exploiter XDNA 2, il faut passer par des runtimes spécifiques compilés par AMD ou par la communauté.
#XDNA 2 en pratique : ce que dit le silicium
L'architecture XDNA 2 embarquée dans Strix Point (génération Ryzen AI 300) double les TOPS par rapport à XDNA 1 (16 → 50 TOPS) et introduit un support natif du bloc-flottant FP8 et FP16. C'est le premier NPU AMD qui peut gérer un LLM décemment, mais avec deux contraintes lourdes.
- Bande passante mémoire
- Le NPU partage la mémoire système (LPDDR5X-7500 ou 8000 sur les machines Strix Point). Soit ~120-128 Go/s, partagés avec CPU, GPU et OS. Le NPU ne pourra jamais saturer son débit théorique de calcul.
- Quantization obligatoire
- Le pipeline officiel AMD attend des modèles quantizés en INT4 ou INT8 via le format ONNX optimisé. Les GGUF Q4_K_M classiques ne tournent pas tels quels — il faut une conversion.
- Précompilation ONNX
- Chaque modèle doit être compilé pour XDNA 2 (sous-graphes alloués au NPU, le reste au CPU). C'est l'étape qui décourage 95 % des utilisateurs.
- Pas de multi-utilisateur
- Le NPU est mono-process. Si un LLM le tient, aucune autre IA Windows (Studio Effects, Recall si vous l'utilisez) ne peut s'en servir en parallèle.
#Prérequis matériel et logiciel
- CPU
- Ryzen AI 9 HX 370, HX 365 ou HX PRO 370 (Strix Point, codename Krackan). Les Ryzen AI 7/5 fonctionnent avec un NPU plus modeste mais la même stack logicielle.
- RAM
- 32 Go LPDDR5X minimum pour un usage confortable. 64 Go si vous voulez essayer du 14B sur iGPU en parallèle.
- OS
- Windows 11 24H2 ou supérieur. Les pilotes NPU XDNA Linux existent (driver upstream depuis kernel 6.11) mais l'outillage utilisateur est très en retard.
- Pilotes NPU
- AMD Ryzen AI Software 1.3 ou supérieur (téléchargement séparé sur amd.com, pas inclus dans le pilote Adrenalin).
- Stockage
- ~20 Go libres pour les modèles ONNX précompilés (plus volumineux que les GGUF équivalents).
#1. LM Studio Ryzen AI : la voie la plus simple
AMD distribue un fork officiel de LM Studio préconfiguré pour XDNA 2. C'est le chemin recommandé pour qui veut tester sans toucher à Python ni ONNX Runtime.
- 01Télécharger le binaireAllez sur amd.com/lmstudio (page officielle « LM Studio for Ryzen AI »). Le binaire Windows est signé AMD.
- 02Installation classiqueL'installeur place LM Studio dans Program Files et configure automatiquement le runtime ONNX RyzenAI Execution Provider.
- 03Sélectionner un modèle optimisé NPUDans l'onglet Discover, filtrez sur le badge « Ryzen AI ». Vous trouverez Llama 3.1 8B, Phi 3.5 Mini, Mistral 7B précompilés pour XDNA 2 (suffixe -hybrid).
- 04Charger et testerAu chargement, LM Studio affiche un sélecteur de runtime : GPU, CPU, ou « Ryzen AI Hybrid » (NPU + iGPU). Choisissez Hybrid pour exploiter le NPU.
- 05Vérifier que le NPU travailleOuvrez le Gestionnaire des tâches → onglet Performances → NPU. La courbe doit monter à 60-95 % pendant la génération. Si elle reste à 0, le runtime est tombé sur CPU.
#2. Lemonade SDK : pour aller plus loin que LM Studio
Lemonade SDK est l'outil officiel AMD pour développeurs. Il sert deux objectifs : (1) compiler vos propres modèles GGUF/HF vers le format ONNX hybride, (2) exposer une API OpenAI-compatible utilisable depuis Open WebUI, Continue.dev, etc.
#3. Repli sur le Radeon 890M : souvent le meilleur choix
Le Ryzen AI 9 HX 370 embarque aussi un iGPU Radeon 890M (RDNA 3.5, 16 CU). Sur LM Studio standard ou Ollama, cet iGPU est exploitable via Vulkan et bat parfois le NPU en débit pur. Voici comment l'utiliser.
- Allocation VRAM dynamique
- Le Radeon 890M partage la RAM système. Dans le BIOS UEFI, cherchez « UMA Frame Buffer Size » et fixez 8 Go minimum (16 Go si possible) avant tout test LLM.
- Pilote
- Adrenalin 24.10 ou supérieur pour bénéficier du chemin Vulkan optimisé compute. Les pilotes OEM Lenovo/Asus sont souvent en retard de 2 versions.
- ROCm sous Linux
- ROCm 6.3+ supporte officiellement Strix Point depuis avril 2026. Sur Ubuntu 24.04, c'est jouable mais l'iGPU reste limité par sa bande passante mémoire partagée.
#Benchmarks : NPU vs iGPU vs CPU
Mesures faites sur un Asus Zenbook S 14 (Ryzen AI 9 HX 370, 32 Go LPDDR5X-7500, Windows 11 24H2, AMD Ryzen AI Software 1.3, Adrenalin 24.10.1). Prompt court (~50 tokens), génération 256 tokens, température 0.7. Moyenne de 5 runs.
- Llama 3.1 8B Q4 — CPU AVX-512
- 4,1 tok/s · 28 W package · ventilo audible
- Llama 3.1 8B Q4 — Radeon 890M (Vulkan)
- 9,8 tok/s · 35 W package · ventilo soutenu
- Llama 3.1 8B hybride — NPU + iGPU (LM Studio Ryzen AI)
- 11,2 tok/s · 18 W package · ventilo discret
- Phi 3.5 Mini 3.8B — NPU pur
- 24 tok/s · 9 W package · ventilo coupé
- Mistral 7B Q4 — NPU + iGPU
- 13,5 tok/s · 19 W package · ventilo discret
- Qwen 2.5 14B Q4 — Radeon 890M (Vulkan)
- 4,2 tok/s · 38 W · trop gros pour le NPU seul
#Cas d'usage où le NPU brille
- Chatbot d'assistance permanent
- Un Phi 3.5 Mini ou Llama 3.2 3B sur NPU coûte ~5 W et reste disponible H24 sans impact batterie notable. Idéal pour intégration dans une app de productivité.
- Résumé automatique d'emails / docs
- Tâche batch courte, contexte 4-8k tokens, modèles 3B-8B. Parfait pour le NPU : ventilo coupé, traitement silencieux en arrière-plan pendant que vous travaillez.
- Speech-to-text temps réel + résumé
- Whisper (sur iGPU) + Llama 3 8B (sur NPU) en pipeline — possible précisément parce que les deux blocs sont indépendants.
- Mode avion prolongé
- Sur batterie, un usage NPU + iGPU permet 4-5 h d'utilisation active LLM contre 1h30 sur un setup CPU/iGPU pur.
#Pièges et limitations à connaître
- Contexte limité
- La plupart des modèles précompilés AMD plafonnent à 4096 tokens de contexte. Pour 32k ou plus, vous devez recompiler — et ça consomme beaucoup plus de mémoire.
- Pas de modèles > 8B sur NPU seul
- Au-delà de 8B, même en INT4, le NPU manque de bande passante. Au-delà de 13B, l'iGPU prend forcément le relais.
- Modèles indisponibles
- Qwen 2.5, DeepSeek, Gemma 2 ne sont pas tous précompilés officiellement. Vérifiez le hub Ryzen AI avant d'acheter une config en pensant tourner un modèle spécifique.
- Mise à jour Windows cassante
- Certaines mises à jour cumulatives 24H2 ont temporairement désactivé l'enumeration du NPU. Gardez le paquet AMD Ryzen AI Software à jour, et vérifiez le Gestionnaire de périphériques après chaque cumulative.
- Pas de fine-tuning
- XDNA 2 ne fait que de l'inférence. Pour entraîner ou LoRA-tuner, il faut un GPU dédié — point.
#Pour aller plus loin
Trois pistes pour approfondir, selon votre prochaine étape :
- Comprendre les quantizations
- Le NPU XDNA 2 ne digère que de l'INT4/INT8. Le guide « Choisir sa quantification (Q4, Q5, Q8, FP16) » explique pourquoi Q4_K_M reste le standard CPU/GPU et ce que change INT4 sur NPU.
- Comparer avec une vraie config GPU
- Si vous hésitez avec un fixe, le guide « Choisir son GPU pour l'IA locale » compare RTX 4070, 4090, M-Max et donne les seuils d'achat selon usage.
- Setup Ollama plus classique
- Pour rester sur la stack standard avec votre Radeon 890M, le guide d'installation d'Ollama sur Windows couvre la configuration Vulkan et la gestion VRAM/RAM partagée.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.