Meilleur LLM pour AMD AI PC (Ryzen AI & NPU)
Un AMD AI PC désigne une machine équipée d'un processeur Ryzen AI, c'est-à-dire un APU qui réunit des cœurs Zen 5, un GPU Radeon intégré et un NPU XDNA 2. Choisir le meilleur LLM pour un AMD AI PC revient donc à répondre à une question précise : combien de mémoire unifiée la machine peut-elle prêter au modèle, et quelle bande passante alimente cette mémoire ? La réponse n'est pas la même pour un portable Ryzen AI 9 HX avec 32 Go et pour une station Ryzen AI Max+ 395 avec 128 Go. Cet article détaille les deux familles de machines, les modèles du catalogue quelllm.fr qui tiennent réellement dans leur mémoire, la place du NPU, les outils d'inférence compatibles, les licences, puis répond aux questions les plus fréquentes.
Deux familles d'AMD AI PC, deux budgets mémoire
Le terme AMD AI PC recouvre des machines très différentes. Il faut les distinguer avant de parler de modèles.
- Ryzen AI 300 (HX 370, HX 375, 9 365) : GPU Radeon 890M, mémoire LPDDR5X sur bus 128 bits, bande passante d'environ 120 Go/s (estimé). Les portables du commerce embarquent 16, 32 ou parfois 64 Go partagés entre le système et le GPU. Notre guide Ryzen AI 9 HX détaille cette configuration.
- Ryzen AI Max (385, 390, Max+ 395, nom de code Strix Halo) : GPU Radeon 8060S avec 40 unités de calcul sur le Max+ 395, bus mémoire 256 bits, bande passante d'environ 256 Go/s (estimé). Les mini-PC et stations se vendent en 64 ou 128 Go de LPDDR5X soudée. Le guide Ryzen AI Max+ 395 couvre les réglages BIOS et Linux.
La règle pratique est simple. Le poids du modèle quantifié doit tenir dans la part de mémoire allouée au GPU, avec une marge pour le cache KV et le système. Sur une machine 128 Go, la part GPU réglable en BIOS atteint couramment 96 Go sous Windows, davantage sous Linux via l'allocation GTT (valeur exacte à confirmer selon la carte mère et le noyau).
Quels modèles du catalogue tiennent sur un Ryzen AI Max+ 395 en 128 Go
Avec environ 96 Go disponibles pour le GPU, une station Ryzen AI Max+ 395 accueille plusieurs modèles de 118 à 142 milliards de paramètres en quantification Q4. Voici ceux du catalogue quelllm.fr, avec le poids Q4 indexé et les estimations pour les autres quantifications (Q5 ≈ ×1,2, Q8 ≈ ×1,9, FP16 ≈ ×3,4, estimé).
- Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) : Q4 ~73 Go, Q5 ~88 Go (estimé), Q8 ~139 Go (ne tient pas), contexte 262 000 tokens. Architecture MoE avec environ 10 milliards de paramètres actifs par token, ce qui en fait le candidat le plus rapide de cette liste. Les poids sont publiés par Alibaba sur Hugging Face.
- Qwen3.8 Flash Next 125B-A6B (Qwen, licence open weights spécifique) : Q4 ~72 Go, contexte 256 000 tokens. Seulement 6 milliards de paramètres actifs, donc un débit encore supérieur au précédent (estimé), au prix d'une licence à lire attentivement avant un usage commercial.
- Mistral Small 4 (Mistral AI, Apache 2.0) : Q4 ~72 Go, contexte 256 000 tokens. Bonne tenue en français, publié par Mistral AI sur Hugging Face.
- Mistral Medium 3.5 128B (Mistral AI, Modified MIT) : Q4 ~74 Go, contexte 256 000 tokens. Positionné au-dessus de Small 4 en qualité, à vérifier sur les fiches pour les scores.
- Nemotron 3 Super 120B (NVIDIA, NVIDIA Open Model License) : Q4 ~72 Go, contexte 128 000 tokens. Orienté raisonnement et agents. Poids disponibles chez NVIDIA sur Hugging Face.
- Laguna S 2.1 (Poolside, OpenMDW 1.1) : Q4 ~68 Go, contexte 262 144 tokens. Le plus léger de la sélection, spécialisé code, publié par Poolside sur Hugging Face.
- Mixtral 8x22B Instruct (Mistral AI, Apache 2.0) : Q4 ~82 Go, contexte 64 000 tokens. Tient encore en 96 Go mais laisse peu de place au cache KV. Modèle plus ancien, utile surtout comme référence.
- dots.llm1 Instruct (Rednote, MIT) : Q4 ~85 Go, contexte 32 768 tokens. Limite haute pour une allocation de 96 Go, contexte court.
Au-delà, Step 3.5 Flash (Q4 ~118 Go) et MiniMax-M2.7 (Q4 ~138 Go) dépassent la mémoire d'un AMD AI PC 128 Go, même sous Linux. Ils ne sont pas des options réalistes sur cette plateforme sans quantification plus agressive (Q2 ou Q3, qualité à confirmer).
Débit attendu : la bande passante décide, pas le nombre de cœurs
Sur une puce à mémoire unifiée, la génération de tokens est limitée par la bande passante mémoire. Chaque token oblige le GPU à relire l'ensemble des paramètres actifs. Le calcul d'ordre de grandeur est donc : débit maximal ≈ bande passante ÷ octets lus par token.
- Modèle MoE à 10 milliards de paramètres actifs en Q4 (cas de Qwen 3.5 122B-A10B) : environ 5 à 6 Go lus par token. Sur les 256 Go/s du Ryzen AI Max+ 395, cela donne un plafond théorique de 40 à 50 tokens/s, et un débit réel de 20 à 35 tokens/s une fois le cache KV et l'overhead du runtime comptés (estimé, non mesuré par quelllm.fr sur cette machine).
- Modèle MoE à 6 milliards de paramètres actifs (Qwen3.8 Flash Next) : débit réel estimé de 30 à 50 tokens/s, à confirmer.
- Modèle dense de 70 à 120 milliards de paramètres en Q4 : 40 à 70 Go lus par token, soit 3 à 6 tokens/s. C'est lisible mais lent pour un usage interactif. Vérifiez donc l'architecture du modèle sur sa fiche avant de le télécharger : la mention « A10B » ou « A6B » signale un MoE.
- Ryzen AI 9 HX 370 : avec environ 120 Go/s, les mêmes MoE de 120 milliards de paramètres ne tiennent pas en mémoire. Le problème n'est pas le débit mais la capacité.
Le traitement du prompt (prefill) dépend lui du calcul brut et non de la bande passante. Un contexte de 30 000 tokens peut demander plusieurs dizaines de secondes sur un Radeon 8060S. Prévoyez-le pour les usages RAG ou analyse de documents longs.
Et le NPU XDNA 2 ? Utile, mais pas pour les gros modèles
Le NPU intégré aux Ryzen AI annonce environ 50 TOPS en INT8. Il faut être précis sur ce qu'il fait réellement pour un LLM local.
- Ce qu'il fait : exécuter des modèles compilés au format ONNX via la pile logicielle Ryzen AI d'AMD, en mode hybride NPU + GPU pour la génération. Les modèles supportés sont pour l'instant de petite taille, de 1 à 8 milliards de paramètres (à confirmer selon la version de la pile logicielle).
- Ce qu'il ne fait pas : accélérer un modèle GGUF chargé dans llama.cpp ou Ollama. Ces runtimes s'appuient sur le GPU Radeon via Vulkan ou ROCm et ignorent le NPU.
- Son intérêt : décharger le GPU et la batterie pour des tâches d'arrière-plan (transcription, petit assistant résident, embeddings) pendant que le GPU sert un modèle plus gros.
Pour les modèles de 118 milliards de paramètres et plus listés ci-dessus, le NPU n'entre pas en jeu. Le GPU Radeon et la mémoire unifiée font tout le travail. Notre article qu'est-ce qu'un NPU approfondit ce point.
Outils d'inférence compatibles Ryzen AI
Trois voies existent pour faire tourner un modèle du catalogue sur un AMD AI PC.
- llama.cpp avec backend Vulkan : la voie la plus robuste sur Windows comme sur Linux. Le backend Vulkan fonctionne sur tous les Radeon intégrés sans installation ROCm. Les gains de performance liés au format de quantification (Q4_K_M, Q5_K_M, Q8_0) sont comparables à ceux observés sur GPU dédié.
- Ollama avec ROCm : sous Linux, ROCm exploite le Radeon 8060S de manière native. La configuration demande quelques variables d'environnement, décrites dans notre guide Ollama sur GPU AMD avec ROCm. Sous Windows, Ollama s'appuie sur Vulkan (support à confirmer selon la version).
- vLLM : possible sous Linux avec ROCm, mais orienté serveur multi-utilisateurs. Pour un poste unique, llama.cpp reste plus simple. La documentation vLLM liste les GPU AMD supportés.
Dans tous les cas, réglez la mémoire GPU au maximum dans le BIOS (option souvent nommée « UMA frame buffer » ou « variable graphics memory »), puis vérifiez avec le runtime que le modèle est bien chargé intégralement sur le GPU et non partiellement sur CPU.
Licences et benchmarks : ce qu'il faut vérifier avant de choisir
La licence conditionne l'usage professionnel. Les modèles cités se répartissent ainsi.
- Apache 2.0 : Qwen 3.5 122B-A10B, Mistral Small 4, Mixtral 8x22B. Usage commercial libre, modification et redistribution autorisées.
- MIT ou Modified MIT : dots.llm1 (MIT), Mistral Medium 3.5 (Modified MIT). Lire les clauses ajoutées pour la version modifiée.
- Licences éditeur : Nemotron 3 Super 120B (NVIDIA Open Model License), Laguna S 2.1 (OpenMDW 1.1), Qwen3.8 Flash Next (licence open weights spécifique). Ces textes autorisent généralement l'usage commercial mais ajoutent des conditions d'attribution ou d'usage. Notre guide sur la conformité AI Act des modèles open-weights aide à documenter ce choix.
Pour les benchmarks, quelllm.fr n'a pas mesuré ces modèles sur Ryzen AI. Les scores publiés par les éditeurs (MMLU pour les connaissances générales, HumanEval et SWE-bench pour le code, AIME pour le raisonnement mathématique) sont à confirmer sur les fiches et sur l'Open LLM Leaderboard. Un score de benchmark ne remplace pas un test sur vos propres documents en français. Notre guide comprendre les leaderboards explique les pièges de lecture.
FAQ
Q : Quel LLM choisir pour un AMD AI PC avec 32 Go de RAM ?
Aucun des modèles de 118 milliards de paramètres et plus de cette sélection ne tient en 32 Go. Sur un portable Ryzen AI 9 HX, visez des modèles de 7 à 14 milliards de paramètres en Q4, qui occupent 5 à 10 Go. Notre guide configuration 32 Go et la page meilleur LLM 8 Go VRAM listent des candidats adaptés.
Q : Le Ryzen AI Max+ 395 en 128 Go vaut-il mieux qu'une carte graphique dédiée ?
Cela dépend du modèle visé. Une RX 9070 XT avec 16 Go offre une bande passante bien supérieure et sera plus rapide sur un modèle de 30 milliards de paramètres. Mais elle ne chargera jamais un modèle de 120 milliards en Q4. Le Ryzen AI Max+ 395 privilégie la capacité au débit. Voir notre page meilleur LLM pour RX 9070 XT pour comparer.
Q : Peut-on utiliser le NPU pour accélérer Ollama ou llama.cpp ?
Non, pas à ce jour. Ces deux runtimes utilisent le GPU Radeon via Vulkan ou ROCm. Le NPU XDNA 2 ne sert qu'aux modèles ONNX exécutés par la pile logicielle Ryzen AI, pour des tailles de 1 à 8 milliards de paramètres environ. Pour les gros modèles, comptez uniquement sur le GPU et la mémoire unifiée.
Q : Faut-il Windows ou Linux sur un AMD AI PC pour l'inférence locale ?
Les deux fonctionnent. Windows offre Vulkan via llama.cpp sans configuration particulière. Linux ajoute ROCm et permet d'allouer davantage de mémoire au GPU au-delà du plafond BIOS, ce qui compte sur une machine 128 Go. Pour charger Mixtral 8x22B ou dots.llm1 à plus de 80 Go, Linux est la voie la plus sûre.
Q : Quelle quantification choisir sur un Ryzen AI Max+ 395 ?
Q4_K_M est le bon compromis pour les modèles de 118 à 128 milliards de paramètres, autour de 72 Go. Q5 reste possible pour les plus petits comme Laguna S 2.1, environ 82 Go estimés. Q8 dépasse la mémoire disponible pour toute cette sélection. Gardez au moins 10 Go libres pour le cache KV si vous utilisez des contextes longs.
Q : Ces modèles sont-ils bons en français ?
Mistral Small 4 et Mistral Medium 3.5 sont entraînés par un éditeur français et se comportent bien dans notre langue. Qwen 3.5 122B-A10B est multilingue et couvre le français correctement. Les scores précis par langue sont à confirmer sur les fiches. Notre page meilleur LLM en français compare plusieurs modèles sur ce critère.
Conclusion
Le meilleur LLM pour un AMD AI PC dépend d'abord de la mémoire disponible. Sur un Ryzen AI Max+ 395 en 128 Go, Qwen 3.5 122B-A10B, Mistral Small 4 et Nemotron 3 Super 120B tiennent en Q4 avec un débit interactif pour les architectures MoE. Sur un Ryzen AI 9 HX en 32 Go, orientez-vous vers des modèles bien plus petits. Le NPU reste un appoint pour les petites tâches. Pour affiner selon votre machine exacte, utilisez le configurateur ou parcourez le catalogue filtré par VRAM.
Le matériel pour faire tourner un LLM en local
Pour exécuter ces modèles confortablement en local, un RTX 5070 Ti offre un excellent rapport prix/performance. Comparez les prix :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.