Meilleur LLM pour Ryzen AI 9
Choisir le meilleur LLM pour Ryzen AI 9 n'est pas une question de puissance brute, mais d'adéquation entre la mémoire unifiée disponible, l'architecture du modèle (dense ou Mixture-of-Experts) et le débit réel de l'iGPU RDNA et du NPU XDNA. Sur ces plateformes, un modèle MoE à faible nombre de paramètres actifs bat souvent un modèle dense plus petit. Cet article détaille les specs VRAM par quantification, les débits attendus, les licences, les repères de benchmark et les cas d'usage concrets pour bâtir un poste d'inférence locale cohérent sur Ryzen AI 9.
Comprendre la contrainte mémoire du Ryzen AI 9
Les APU Ryzen AI 9 (HX et Max) reposent sur une mémoire unifiée partagée entre CPU, iGPU et NPU. La quantité allouable au GPU conditionne directement le modèle que vous pourrez charger. Sur une configuration Ryzen AI Max 395 dotée de 128 Go de mémoire unifiée, l'enveloppe utile pour l'inférence dépasse largement celle d'un HX 370 limité à 32 Go environ.
Repères de dimensionnement (ordres de grandeur, à confirmer selon votre allocation BIOS) :
- Q4 : ~0,55 à 0,60 Go de VRAM par milliard de paramètres stockés
- Q5 : environ +20 % par rapport au Q4
- Q8 : environ le double du Q4
- FP16 : environ le quadruple du Q4
Pour la démarche complète d'allocation NPU/iGPU, consultez le guide Ryzen AI 9 HX et le guide Ryzen AI Max 395. Le choix de quantification est détaillé dans notre guide Q4/Q5/Q8.
Pourquoi privilégier les modèles MoE à faible activation
Sur un iGPU à bande passante mémoire modérée, le facteur limitant est le nombre de paramètres actifs par token, pas le total. Un modèle Mixture-of-Experts n'active qu'une fraction de ses poids à chaque passe.
- Qwen3.8 Flash Next 125B-A6B (125B, ~72 Go Q4, ctx 256000) : seulement ~6B de paramètres actifs, ce qui en fait un candidat efficient pour un débit interactif sur mémoire unifiée large. Voir la fiche Qwen3.8 Flash Next et l'éditeur Alibaba sur Hugging Face.
- Qwen 3.5 122B-A10B (122B, ~73 Go Q4, ctx 262000, Apache 2.0) : ~10B actifs, bon compromis qualité/débit. Voir la fiche Qwen 3.5 122B-A10B.
- Mixtral 8x22B Instruct (141B, ~82 Go Q4, ctx 64000, Apache 2.0) : MoE historique de Mistral AI sur Hugging Face, valeur sûre. Voir la fiche Mixtral 8x22B.
Ces trois modèles ne tiennent en Q4 que sur une configuration à mémoire unifiée élevée (type Ryzen AI Max 395, 128 Go). Sur un HX 370 à 32 Go, ils sont hors de portée en local sans offload disque très lent.
Modèles denses compacts et alternatives
Si votre charge exige un modèle dense plus prévisible :
- Mistral Small 4 (119B, ~72 Go Q4, ctx 256000, Apache 2.0) : licence permissive pour usage commercial. Voir la fiche Mistral Small 4.
- Nemotron 3 Super 120B (120B, ~72 Go Q4, ctx 128000, NVIDIA Open Model License) : voir la fiche Nemotron 3 Super et NVIDIA sur Hugging Face.
- DBRX Instruct (132B, ~76 Go Q4, ctx 32768, Databricks Open Model License) : voir la fiche DBRX Instruct.
- dots.llm1 Instruct (142B, ~85 Go Q4, ctx 32768, MIT) : voir la fiche dots.llm1.
À VRAM égale, un modèle dense sollicite davantage la bande passante par token qu'un MoE à faible activation : attendez-vous à un débit plus faible sur iGPU. Les débits tokens/sec précis sur Ryzen AI dépendent du backend et de l'allocation mémoire, et restent à confirmer sur votre machine.
Licences et conformité
Pour un usage professionnel, la licence prime autant que le débit :
- Apache 2.0 : Qwen 3.5 122B-A10B, Mixtral 8x22B, Mistral Small 4 — usage commercial large.
- MIT : dots.llm1 Instruct — très permissive.
- NVIDIA Open Model License : Nemotron 3 Super 120B — vérifiez les clauses d'attribution.
- Databricks Open Model License : DBRX Instruct — conditions spécifiques à lire.
Pour les enjeux réglementaires européens, référez-vous à notre guide de conformité AI Act.
Backends d'inférence recommandés
Le choix du moteur influe fortement sur le débit obtenu :
- llama.cpp : support Vulkan/ROCm pour iGPU AMD, format GGUF quantifié, idéal en self-host sur Ryzen AI.
- Ollama : surcouche pratique pour gérer les modèles GGUF localement.
- vLLM : orienté débit serveur, pertinent si vous exposez une API interne.
Restez en inférence strictement locale : le but d'un poste Ryzen AI 9 est de garder vos données sur la machine.
FAQ
Q : Quel modèle tient sur un Ryzen AI 9 HX 370 (32 Go) ?
Avec ~32 Go de mémoire unifiée dont une part réservée au GPU, les modèles listés ici (68 Go+ en Q4) ne tiennent pas. Le HX 370 vise plutôt des modèles plus légers hors de cette sélection. Consultez le catalogue filtré par VRAM et le configurateur pour un dimensionnement adapté à votre mémoire réelle.
Q : MoE ou dense pour un iGPU AMD ?
Un MoE à faible activation comme Qwen3.8 Flash Next 125B-A6B (~6B actifs) sollicite moins la bande passante par token qu'un dense de 120B. Sur iGPU à bande passante limitée, le MoE offre généralement un meilleur débit interactif à qualité comparable, au prix d'une empreinte mémoire totale plus grande.
Q : Quelle quantification choisir ?
Le Q4 maximise le nombre de paramètres chargeables et reste le point d'équilibre courant. Le Q5 améliore légèrement la fidélité pour ~20 % de VRAM en plus. Le Q8 double l'empreinte : réservez-le aux configurations 128 Go. Détails dans le guide Q4/Q5/Q8.
Q : Le NPU accélère-t-il l'inférence LLM ?
Le NPU XDNA cible surtout des charges spécifiques et son intégration aux backends LLM open-source évolue. En pratique, l'iGPU RDNA via Vulkan/ROCm porte l'essentiel de l'inférence aujourd'hui. Vérifiez le support à jour dans llama.cpp — l'état exact reste à confirmer selon votre pilote.
Q : Quelle licence pour un usage commercial ?
Privilégiez Apache 2.0 (Qwen 3.5 122B-A10B, Mixtral 8x22B, Mistral Small 4) ou MIT (dots.llm1 Instruct) pour la plus grande liberté d'usage. Les licences NVIDIA et Databricks imposent des conditions spécifiques à lire avant tout déploiement.
Conclusion
Le meilleur LLM pour Ryzen AI 9 dépend avant tout de votre mémoire unifiée : sur une configuration 128 Go type Ryzen AI Max 395, les MoE à faible activation comme Qwen 3.5 122B-A10B ou Qwen3.8 Flash Next 125B-A6B offrent le meilleur rapport débit/qualité en Q4, tandis que Mistral Small 4 reste une option dense permissive. Vérifiez vos débits réels avant de figer un choix. Dimensionnez votre poste avec le configurateur ou parcourez le catalogue complet.
Le matériel pour faire tourner un LLM en local
Pour exécuter ces modèles confortablement en local, un RTX 5070 Ti offre un excellent rapport prix/performance. Comparez les prix :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.