Meilleur LLM pour Ryzen AI 9

Choisir le meilleur LLM pour Ryzen AI 9 n'est pas une question de puissance brute, mais d'adéquation entre la mémoire unifiée disponible, l'architecture du modèle (dense ou Mixture-of-Experts) et le débit réel de l'iGPU RDNA et du NPU XDNA. Sur ces plateformes, un modèle MoE à faible nombre de paramètres actifs bat souvent un modèle dense plus petit. Cet article détaille les specs VRAM par quantification, les débits attendus, les licences, les repères de benchmark et les cas d'usage concrets pour bâtir un poste d'inférence locale cohérent sur Ryzen AI 9.

Comprendre la contrainte mémoire du Ryzen AI 9

Les APU Ryzen AI 9 (HX et Max) reposent sur une mémoire unifiée partagée entre CPU, iGPU et NPU. La quantité allouable au GPU conditionne directement le modèle que vous pourrez charger. Sur une configuration Ryzen AI Max 395 dotée de 128 Go de mémoire unifiée, l'enveloppe utile pour l'inférence dépasse largement celle d'un HX 370 limité à 32 Go environ.

Repères de dimensionnement (ordres de grandeur, à confirmer selon votre allocation BIOS) :

Pour la démarche complète d'allocation NPU/iGPU, consultez le guide Ryzen AI 9 HX et le guide Ryzen AI Max 395. Le choix de quantification est détaillé dans notre guide Q4/Q5/Q8.

Pourquoi privilégier les modèles MoE à faible activation

Sur un iGPU à bande passante mémoire modérée, le facteur limitant est le nombre de paramètres actifs par token, pas le total. Un modèle Mixture-of-Experts n'active qu'une fraction de ses poids à chaque passe.

Ces trois modèles ne tiennent en Q4 que sur une configuration à mémoire unifiée élevée (type Ryzen AI Max 395, 128 Go). Sur un HX 370 à 32 Go, ils sont hors de portée en local sans offload disque très lent.

Modèles denses compacts et alternatives

Si votre charge exige un modèle dense plus prévisible :

À VRAM égale, un modèle dense sollicite davantage la bande passante par token qu'un MoE à faible activation : attendez-vous à un débit plus faible sur iGPU. Les débits tokens/sec précis sur Ryzen AI dépendent du backend et de l'allocation mémoire, et restent à confirmer sur votre machine.

Licences et conformité

Pour un usage professionnel, la licence prime autant que le débit :

Pour les enjeux réglementaires européens, référez-vous à notre guide de conformité AI Act.

Backends d'inférence recommandés

Le choix du moteur influe fortement sur le débit obtenu :

Restez en inférence strictement locale : le but d'un poste Ryzen AI 9 est de garder vos données sur la machine.

FAQ

Q : Quel modèle tient sur un Ryzen AI 9 HX 370 (32 Go) ?

Avec ~32 Go de mémoire unifiée dont une part réservée au GPU, les modèles listés ici (68 Go+ en Q4) ne tiennent pas. Le HX 370 vise plutôt des modèles plus légers hors de cette sélection. Consultez le catalogue filtré par VRAM et le configurateur pour un dimensionnement adapté à votre mémoire réelle.

Q : MoE ou dense pour un iGPU AMD ?

Un MoE à faible activation comme Qwen3.8 Flash Next 125B-A6B (~6B actifs) sollicite moins la bande passante par token qu'un dense de 120B. Sur iGPU à bande passante limitée, le MoE offre généralement un meilleur débit interactif à qualité comparable, au prix d'une empreinte mémoire totale plus grande.

Q : Quelle quantification choisir ?

Le Q4 maximise le nombre de paramètres chargeables et reste le point d'équilibre courant. Le Q5 améliore légèrement la fidélité pour ~20 % de VRAM en plus. Le Q8 double l'empreinte : réservez-le aux configurations 128 Go. Détails dans le guide Q4/Q5/Q8.

Q : Le NPU accélère-t-il l'inférence LLM ?

Le NPU XDNA cible surtout des charges spécifiques et son intégration aux backends LLM open-source évolue. En pratique, l'iGPU RDNA via Vulkan/ROCm porte l'essentiel de l'inférence aujourd'hui. Vérifiez le support à jour dans llama.cpp — l'état exact reste à confirmer selon votre pilote.

Q : Quelle licence pour un usage commercial ?

Privilégiez Apache 2.0 (Qwen 3.5 122B-A10B, Mixtral 8x22B, Mistral Small 4) ou MIT (dots.llm1 Instruct) pour la plus grande liberté d'usage. Les licences NVIDIA et Databricks imposent des conditions spécifiques à lire avant tout déploiement.

Conclusion

Le meilleur LLM pour Ryzen AI 9 dépend avant tout de votre mémoire unifiée : sur une configuration 128 Go type Ryzen AI Max 395, les MoE à faible activation comme Qwen 3.5 122B-A10B ou Qwen3.8 Flash Next 125B-A6B offrent le meilleur rapport débit/qualité en Q4, tandis que Mistral Small 4 reste une option dense permissive. Vérifiez vos débits réels avant de figer un choix. Dimensionnez votre poste avec le configurateur ou parcourez le catalogue complet.

Le matériel pour faire tourner un LLM en local

Pour exécuter ces modèles confortablement en local, un RTX 5070 Ti offre un excellent rapport prix/performance. Comparez les prix :

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.

Article publié et mis à jour le par Mohamed Meguedmi · Source de données : /api/models.json · Licence contenu : CC BY 4.0.

Une erreur ou une mise à jour à signaler ? Contribuer.