Meilleur LLM pour AMD AI PC (Ryzen AI & NPU)

Un AMD AI PC désigne une machine équipée d'un processeur Ryzen AI, c'est-à-dire un APU qui réunit des cœurs Zen 5, un GPU Radeon intégré et un NPU XDNA 2. Choisir le meilleur LLM pour un AMD AI PC revient donc à répondre à une question précise : combien de mémoire unifiée la machine peut-elle prêter au modèle, et quelle bande passante alimente cette mémoire ? La réponse n'est pas la même pour un portable Ryzen AI 9 HX avec 32 Go et pour une station Ryzen AI Max+ 395 avec 128 Go. Cet article détaille les deux familles de machines, les modèles du catalogue quelllm.fr qui tiennent réellement dans leur mémoire, la place du NPU, les outils d'inférence compatibles, les licences, puis répond aux questions les plus fréquentes.

Deux familles d'AMD AI PC, deux budgets mémoire

Le terme AMD AI PC recouvre des machines très différentes. Il faut les distinguer avant de parler de modèles.

La règle pratique est simple. Le poids du modèle quantifié doit tenir dans la part de mémoire allouée au GPU, avec une marge pour le cache KV et le système. Sur une machine 128 Go, la part GPU réglable en BIOS atteint couramment 96 Go sous Windows, davantage sous Linux via l'allocation GTT (valeur exacte à confirmer selon la carte mère et le noyau).

Quels modèles du catalogue tiennent sur un Ryzen AI Max+ 395 en 128 Go

Avec environ 96 Go disponibles pour le GPU, une station Ryzen AI Max+ 395 accueille plusieurs modèles de 118 à 142 milliards de paramètres en quantification Q4. Voici ceux du catalogue quelllm.fr, avec le poids Q4 indexé et les estimations pour les autres quantifications (Q5 ≈ ×1,2, Q8 ≈ ×1,9, FP16 ≈ ×3,4, estimé).

Au-delà, Step 3.5 Flash (Q4 ~118 Go) et MiniMax-M2.7 (Q4 ~138 Go) dépassent la mémoire d'un AMD AI PC 128 Go, même sous Linux. Ils ne sont pas des options réalistes sur cette plateforme sans quantification plus agressive (Q2 ou Q3, qualité à confirmer).

Débit attendu : la bande passante décide, pas le nombre de cœurs

Sur une puce à mémoire unifiée, la génération de tokens est limitée par la bande passante mémoire. Chaque token oblige le GPU à relire l'ensemble des paramètres actifs. Le calcul d'ordre de grandeur est donc : débit maximal ≈ bande passante ÷ octets lus par token.

Le traitement du prompt (prefill) dépend lui du calcul brut et non de la bande passante. Un contexte de 30 000 tokens peut demander plusieurs dizaines de secondes sur un Radeon 8060S. Prévoyez-le pour les usages RAG ou analyse de documents longs.

Et le NPU XDNA 2 ? Utile, mais pas pour les gros modèles

Le NPU intégré aux Ryzen AI annonce environ 50 TOPS en INT8. Il faut être précis sur ce qu'il fait réellement pour un LLM local.

Pour les modèles de 118 milliards de paramètres et plus listés ci-dessus, le NPU n'entre pas en jeu. Le GPU Radeon et la mémoire unifiée font tout le travail. Notre article qu'est-ce qu'un NPU approfondit ce point.

Outils d'inférence compatibles Ryzen AI

Trois voies existent pour faire tourner un modèle du catalogue sur un AMD AI PC.

Dans tous les cas, réglez la mémoire GPU au maximum dans le BIOS (option souvent nommée « UMA frame buffer » ou « variable graphics memory »), puis vérifiez avec le runtime que le modèle est bien chargé intégralement sur le GPU et non partiellement sur CPU.

Licences et benchmarks : ce qu'il faut vérifier avant de choisir

La licence conditionne l'usage professionnel. Les modèles cités se répartissent ainsi.

Pour les benchmarks, quelllm.fr n'a pas mesuré ces modèles sur Ryzen AI. Les scores publiés par les éditeurs (MMLU pour les connaissances générales, HumanEval et SWE-bench pour le code, AIME pour le raisonnement mathématique) sont à confirmer sur les fiches et sur l'Open LLM Leaderboard. Un score de benchmark ne remplace pas un test sur vos propres documents en français. Notre guide comprendre les leaderboards explique les pièges de lecture.

FAQ

Q : Quel LLM choisir pour un AMD AI PC avec 32 Go de RAM ?

Aucun des modèles de 118 milliards de paramètres et plus de cette sélection ne tient en 32 Go. Sur un portable Ryzen AI 9 HX, visez des modèles de 7 à 14 milliards de paramètres en Q4, qui occupent 5 à 10 Go. Notre guide configuration 32 Go et la page meilleur LLM 8 Go VRAM listent des candidats adaptés.

Q : Le Ryzen AI Max+ 395 en 128 Go vaut-il mieux qu'une carte graphique dédiée ?

Cela dépend du modèle visé. Une RX 9070 XT avec 16 Go offre une bande passante bien supérieure et sera plus rapide sur un modèle de 30 milliards de paramètres. Mais elle ne chargera jamais un modèle de 120 milliards en Q4. Le Ryzen AI Max+ 395 privilégie la capacité au débit. Voir notre page meilleur LLM pour RX 9070 XT pour comparer.

Q : Peut-on utiliser le NPU pour accélérer Ollama ou llama.cpp ?

Non, pas à ce jour. Ces deux runtimes utilisent le GPU Radeon via Vulkan ou ROCm. Le NPU XDNA 2 ne sert qu'aux modèles ONNX exécutés par la pile logicielle Ryzen AI, pour des tailles de 1 à 8 milliards de paramètres environ. Pour les gros modèles, comptez uniquement sur le GPU et la mémoire unifiée.

Q : Faut-il Windows ou Linux sur un AMD AI PC pour l'inférence locale ?

Les deux fonctionnent. Windows offre Vulkan via llama.cpp sans configuration particulière. Linux ajoute ROCm et permet d'allouer davantage de mémoire au GPU au-delà du plafond BIOS, ce qui compte sur une machine 128 Go. Pour charger Mixtral 8x22B ou dots.llm1 à plus de 80 Go, Linux est la voie la plus sûre.

Q : Quelle quantification choisir sur un Ryzen AI Max+ 395 ?

Q4_K_M est le bon compromis pour les modèles de 118 à 128 milliards de paramètres, autour de 72 Go. Q5 reste possible pour les plus petits comme Laguna S 2.1, environ 82 Go estimés. Q8 dépasse la mémoire disponible pour toute cette sélection. Gardez au moins 10 Go libres pour le cache KV si vous utilisez des contextes longs.

Q : Ces modèles sont-ils bons en français ?

Mistral Small 4 et Mistral Medium 3.5 sont entraînés par un éditeur français et se comportent bien dans notre langue. Qwen 3.5 122B-A10B est multilingue et couvre le français correctement. Les scores précis par langue sont à confirmer sur les fiches. Notre page meilleur LLM en français compare plusieurs modèles sur ce critère.

Conclusion

Le meilleur LLM pour un AMD AI PC dépend d'abord de la mémoire disponible. Sur un Ryzen AI Max+ 395 en 128 Go, Qwen 3.5 122B-A10B, Mistral Small 4 et Nemotron 3 Super 120B tiennent en Q4 avec un débit interactif pour les architectures MoE. Sur un Ryzen AI 9 HX en 32 Go, orientez-vous vers des modèles bien plus petits. Le NPU reste un appoint pour les petites tâches. Pour affiner selon votre machine exacte, utilisez le configurateur ou parcourez le catalogue filtré par VRAM.

Le matériel pour faire tourner un LLM en local

Pour exécuter ces modèles confortablement en local, un RTX 5070 Ti offre un excellent rapport prix/performance. Comparez les prix :

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.

Article publié et mis à jour le par Mohamed Meguedmi · Source de données : /api/models.json · Licence contenu : CC BY 4.0.

Une erreur ou une mise à jour à signaler ? Contribuer.