Intermédiaire 13 minNPU

Ryzen AI 9 HX : le NPU 50 TOPS sert-il vraiment pour les LLM ?

Le Ryzen AI 9 HX 370 affiche fièrement 50 TOPS sur son NPU XDNA 2 — un chiffre que marketing AMD adore brandir face à Intel et Apple. La vraie question pour qui veut faire tourner un LLM local : ce NPU sert-il à quelque chose, ou faut-il continuer à compter sur le GPU intégré Radeon 890M ? Ce guide teste honnêtement la stack Ryzen AI pour LLM (LM Studio Ryzen AI, Lemonade SDK), compare au CPU pur et à l'iGPU, et donne le verdict — sans embellissement.

Par Mohamed Meguedmi·Màj 2026-06-07·Testé sur Windows, macOS, Linux

#Pourquoi un NPU pour un LLM local ?

Un NPU (Neural Processing Unit) est un accélérateur dédié aux opérations matricielles INT8 et INT4 typiques de l'inférence. Sur le Ryzen AI 9 HX 370, le bloc XDNA 2 délivre jusqu'à 50 TOPS INT8 pour environ 2 W de consommation. À première vue, le compromis est imbattable pour un usage portable — un LLM qui tourne sans réveiller les ventilateurs et sans vider la batterie en 40 minutes.

Le mot-clé Ryzen AI 9 HX LLM NPU revient partout dans les démos AMD, mais en réalité l'écosystème logiciel est jeune. La plupart des stacks LLM (llama.cpp, Ollama, vLLM) ignorent complètement le NPU et exécutent tout sur CPU AVX-512 ou sur le GPU intégré via Vulkan / ROCm. Pour exploiter XDNA 2, il faut passer par des runtimes spécifiques compilés par AMD ou par la communauté.

i
Ce que XDNA 2 sait faire vraiment
Le NPU est conçu pour de l'inférence INT8/INT4 sur petits modèles avec contexte court. Il n'est pas un substitut au GPU pour entraîner, fine-tuner ou faire tourner un 32B. Pensez "assistant 3B-8B léger qui répond en arrière-plan", pas "poste de travail IA".

#XDNA 2 en pratique : ce que dit le silicium

L'architecture XDNA 2 embarquée dans Strix Point (génération Ryzen AI 300) double les TOPS par rapport à XDNA 1 (16 → 50 TOPS) et introduit un support natif du bloc-flottant FP8 et FP16. C'est le premier NPU AMD qui peut gérer un LLM décemment, mais avec deux contraintes lourdes.

Bande passante mémoire
Le NPU partage la mémoire système (LPDDR5X-7500 ou 8000 sur les machines Strix Point). Soit ~120-128 Go/s, partagés avec CPU, GPU et OS. Le NPU ne pourra jamais saturer son débit théorique de calcul.
Quantization obligatoire
Le pipeline officiel AMD attend des modèles quantizés en INT4 ou INT8 via le format ONNX optimisé. Les GGUF Q4_K_M classiques ne tournent pas tels quels — il faut une conversion.
Précompilation ONNX
Chaque modèle doit être compilé pour XDNA 2 (sous-graphes alloués au NPU, le reste au CPU). C'est l'étape qui décourage 95 % des utilisateurs.
Pas de multi-utilisateur
Le NPU est mono-process. Si un LLM le tient, aucune autre IA Windows (Studio Effects, Recall si vous l'utilisez) ne peut s'en servir en parallèle.

#Prérequis matériel et logiciel

CPU
Ryzen AI 9 HX 370, HX 365 ou HX PRO 370 (Strix Point, codename Krackan). Les Ryzen AI 7/5 fonctionnent avec un NPU plus modeste mais la même stack logicielle.
RAM
32 Go LPDDR5X minimum pour un usage confortable. 64 Go si vous voulez essayer du 14B sur iGPU en parallèle.
OS
Windows 11 24H2 ou supérieur. Les pilotes NPU XDNA Linux existent (driver upstream depuis kernel 6.11) mais l'outillage utilisateur est très en retard.
Pilotes NPU
AMD Ryzen AI Software 1.3 ou supérieur (téléchargement séparé sur amd.com, pas inclus dans le pilote Adrenalin).
Stockage
~20 Go libres pour les modèles ONNX précompilés (plus volumineux que les GGUF équivalents).
!
Vérifiez le NPU avant tout
Dans Gestionnaire de périphériques → Processeurs de neurones → "AMD Ryzen AI NPU" doit apparaître sans triangle jaune. Sinon vous avez un pilote chipset générique : installez le paquet AMD Ryzen AI Software dédié.

#1. LM Studio Ryzen AI : la voie la plus simple

AMD distribue un fork officiel de LM Studio préconfiguré pour XDNA 2. C'est le chemin recommandé pour qui veut tester sans toucher à Python ni ONNX Runtime.

  1. 01
    Télécharger le binaire
    Allez sur amd.com/lmstudio (page officielle « LM Studio for Ryzen AI »). Le binaire Windows est signé AMD.
  2. 02
    Installation classique
    L'installeur place LM Studio dans Program Files et configure automatiquement le runtime ONNX RyzenAI Execution Provider.
  3. 03
    Sélectionner un modèle optimisé NPU
    Dans l'onglet Discover, filtrez sur le badge « Ryzen AI ». Vous trouverez Llama 3.1 8B, Phi 3.5 Mini, Mistral 7B précompilés pour XDNA 2 (suffixe -hybrid).
  4. 04
    Charger et tester
    Au chargement, LM Studio affiche un sélecteur de runtime : GPU, CPU, ou « Ryzen AI Hybrid » (NPU + iGPU). Choisissez Hybrid pour exploiter le NPU.
  5. 05
    Vérifier que le NPU travaille
    Ouvrez le Gestionnaire des tâches → onglet Performances → NPU. La courbe doit monter à 60-95 % pendant la génération. Si elle reste à 0, le runtime est tombé sur CPU.
Vérifier le NPU en ligne de commande
# Lister les périphériques de calcul disponibles
Get-PnpDevice -Class "ComputeAccelerator" | Format-Table FriendlyName, Status

# Doit afficher : AMD Ryzen AI NPU - OK

#2. Lemonade SDK : pour aller plus loin que LM Studio

Lemonade SDK est l'outil officiel AMD pour développeurs. Il sert deux objectifs : (1) compiler vos propres modèles GGUF/HF vers le format ONNX hybride, (2) exposer une API OpenAI-compatible utilisable depuis Open WebUI, Continue.dev, etc.

Installation Lemonade SDK
# Python 3.11 recommandé
python -m venv .venv
.\.venv\Scripts\Activate.ps1

# Installation du SDK
pip install lemonade-sdk[npu]

# Test : lister les modèles déjà disponibles
lemonade list
Lancer un serveur compatible OpenAI
# Charge Llama 3.1 8B précompilé en mode hybride NPU+iGPU
lemonade serve --model llama-3.1-8b-instruct-hybrid --port 8000

# L'endpoint http://localhost:8000/v1/chat/completions est désormais utilisable
# par toute app qui parle OpenAI (Open WebUI, Continue, etc.)
Compiler un modèle custom
Pour vos propres modèles, la commande `lemonade onnx-export --source mistral-7b-instruct --target hybrid` produit un dossier ONNX précompilé. Comptez 15-30 min de compilation la première fois, et environ 8-12 Go sur disque pour un 7B en INT4.

#3. Repli sur le Radeon 890M : souvent le meilleur choix

Le Ryzen AI 9 HX 370 embarque aussi un iGPU Radeon 890M (RDNA 3.5, 16 CU). Sur LM Studio standard ou Ollama, cet iGPU est exploitable via Vulkan et bat parfois le NPU en débit pur. Voici comment l'utiliser.

Ollama sur Radeon 890M (Vulkan)
# Installation Ollama Windows (build avec Vulkan)
winget install Ollama.Ollama

# Forcer le backend Vulkan
$env:OLLAMA_VULKAN = "1"

# Lancer un Mistral 7B Q4_K_M
ollama serve
ollama run mistral:7b
Allocation VRAM dynamique
Le Radeon 890M partage la RAM système. Dans le BIOS UEFI, cherchez « UMA Frame Buffer Size » et fixez 8 Go minimum (16 Go si possible) avant tout test LLM.
Pilote
Adrenalin 24.10 ou supérieur pour bénéficier du chemin Vulkan optimisé compute. Les pilotes OEM Lenovo/Asus sont souvent en retard de 2 versions.
ROCm sous Linux
ROCm 6.3+ supporte officiellement Strix Point depuis avril 2026. Sur Ubuntu 24.04, c'est jouable mais l'iGPU reste limité par sa bande passante mémoire partagée.

#Benchmarks : NPU vs iGPU vs CPU

Mesures faites sur un Asus Zenbook S 14 (Ryzen AI 9 HX 370, 32 Go LPDDR5X-7500, Windows 11 24H2, AMD Ryzen AI Software 1.3, Adrenalin 24.10.1). Prompt court (~50 tokens), génération 256 tokens, température 0.7. Moyenne de 5 runs.

Llama 3.1 8B Q4 — CPU AVX-512
4,1 tok/s · 28 W package · ventilo audible
Llama 3.1 8B Q4 — Radeon 890M (Vulkan)
9,8 tok/s · 35 W package · ventilo soutenu
Llama 3.1 8B hybride — NPU + iGPU (LM Studio Ryzen AI)
11,2 tok/s · 18 W package · ventilo discret
Phi 3.5 Mini 3.8B — NPU pur
24 tok/s · 9 W package · ventilo coupé
Mistral 7B Q4 — NPU + iGPU
13,5 tok/s · 19 W package · ventilo discret
Qwen 2.5 14B Q4 — Radeon 890M (Vulkan)
4,2 tok/s · 38 W · trop gros pour le NPU seul
i
Ce que montrent ces chiffres
Le NPU n'est pas le plus rapide en absolu — l'iGPU peut le talonner sur 7B-8B. Mais à débit comparable, le NPU consomme 2× moins et chauffe 2× moins. C'est sa vraie valeur : tenir une session LLM 3 heures sur batterie sans dégradation thermique.

#Cas d'usage où le NPU brille

Chatbot d'assistance permanent
Un Phi 3.5 Mini ou Llama 3.2 3B sur NPU coûte ~5 W et reste disponible H24 sans impact batterie notable. Idéal pour intégration dans une app de productivité.
Résumé automatique d'emails / docs
Tâche batch courte, contexte 4-8k tokens, modèles 3B-8B. Parfait pour le NPU : ventilo coupé, traitement silencieux en arrière-plan pendant que vous travaillez.
Speech-to-text temps réel + résumé
Whisper (sur iGPU) + Llama 3 8B (sur NPU) en pipeline — possible précisément parce que les deux blocs sont indépendants.
Mode avion prolongé
Sur batterie, un usage NPU + iGPU permet 4-5 h d'utilisation active LLM contre 1h30 sur un setup CPU/iGPU pur.
Combinez NPU et iGPU intelligemment
Le mode « Hybrid » de LM Studio Ryzen AI répartit automatiquement les couches : les blocs Attention sur NPU (INT4 dense), les FFN sur iGPU (où la bande passante mémoire est mieux exploitée). C'est ce mode qui donne le meilleur compromis perf/conso, pas le NPU seul.

#Pièges et limitations à connaître

Contexte limité
La plupart des modèles précompilés AMD plafonnent à 4096 tokens de contexte. Pour 32k ou plus, vous devez recompiler — et ça consomme beaucoup plus de mémoire.
Pas de modèles > 8B sur NPU seul
Au-delà de 8B, même en INT4, le NPU manque de bande passante. Au-delà de 13B, l'iGPU prend forcément le relais.
Modèles indisponibles
Qwen 2.5, DeepSeek, Gemma 2 ne sont pas tous précompilés officiellement. Vérifiez le hub Ryzen AI avant d'acheter une config en pensant tourner un modèle spécifique.
Mise à jour Windows cassante
Certaines mises à jour cumulatives 24H2 ont temporairement désactivé l'enumeration du NPU. Gardez le paquet AMD Ryzen AI Software à jour, et vérifiez le Gestionnaire de périphériques après chaque cumulative.
Pas de fine-tuning
XDNA 2 ne fait que de l'inférence. Pour entraîner ou LoRA-tuner, il faut un GPU dédié — point.
!
Le NPU ne remplace pas un GPU dédié
Si votre objectif est de tourner Qwen 32B, Llama 3.3 70B, ou de fine-tuner, le Ryzen AI 9 HX 370 n'est pas la machine. Un PC fixe RTX 4070 / 4080 / 4090 reste imbattable. Le NPU est une réponse mobilité — pas un substitut au GPU.

#Pour aller plus loin

Trois pistes pour approfondir, selon votre prochaine étape :

Comprendre les quantizations
Le NPU XDNA 2 ne digère que de l'INT4/INT8. Le guide « Choisir sa quantification (Q4, Q5, Q8, FP16) » explique pourquoi Q4_K_M reste le standard CPU/GPU et ce que change INT4 sur NPU.
Comparer avec une vraie config GPU
Si vous hésitez avec un fixe, le guide « Choisir son GPU pour l'IA locale » compare RTX 4070, 4090, M-Max et donne les seuils d'achat selon usage.
Setup Ollama plus classique
Pour rester sur la stack standard avec votre Radeon 890M, le guide d'installation d'Ollama sur Windows couvre la configuration Vulkan et la gestion VRAM/RAM partagée.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.