Performance LLM sur GPU AMD Radeon 9070XT
La requête « 9070xt llm » revient souvent chez les possesseurs de la Radeon RX 9070 XT qui veulent faire tourner un modèle en local sans carte NVIDIA. Bonne nouvelle : avec 16 Go de GDDR6 et le support ROCm de l'architecture RDNA 4, un setup 9070xt llm est viable pour la plupart des usages personnels, à condition de comprendre ses limites en mémoire. Cette page détaille les specs de la carte utiles à l'inférence, la VRAM consommée selon la quantification (Q4, Q5, Q8, FP16), les débits en tokens/sec à attendre, les modèles du catalogue quelllm.fr exploitables avec déchargement CPU, la lecture des benchmarks, puis les cas d'usage et les outils (llama.cpp, Ollama, vLLM) qui fonctionnent réellement sur AMD.
Fiche technique de la RX 9070 XT pour l'inférence
Ce qui compte pour un LLM n'est pas la puissance de calcul brute mais la bande passante mémoire et la quantité de VRAM. Sur ces deux points, la carte se situe ainsi :
- Architecture : RDNA 4, identifiant ROCm gfx1201
- VRAM : 16 Go GDDR6, bus 256 bits
- Bande passante : environ 640 Go/s (valeur constructeur)
- Unités de calcul : 64 CU, 4096 processeurs de flux
- Consommation typique : 304 W en charge
- Support logiciel : ROCm 6.4 et versions ultérieures, backend Vulkan de llama.cpp en alternative
Pour situer : la bande passante est proche de celle d'une RX 7900 XT, mais la VRAM reste à 16 Go contre 20 ou 24 Go sur la génération précédente. C'est le compromis à retenir avant d'acheter. La page de la RX 9070 XT liste les modèles classés par compatibilité, et le guide d'installation dédié couvre la mise en place pas à pas.
VRAM : ce qui tient dans 16 Go selon la quantification
Règle pratique pour estimer la mémoire d'un modèle dense : environ 0,55 à 0,6 Go par milliard de paramètres en Q4, 0,7 en Q5, 1,05 en Q8 et 2 en FP16, plus le cache KV qui grossit avec le contexte. Sur 16 Go, en gardant 1 à 1,5 Go pour le système et le KV cache :
- Q4 (Q4_K_M) : modèles denses jusqu'à environ 20 à 24 milliards de paramètres, contexte 8k à 16k
- Q5 : jusqu'à environ 16 à 18 milliards de paramètres
- Q8 : jusqu'à environ 12 à 13 milliards de paramètres
- FP16 : jusqu'à environ 7 milliards de paramètres, rarement utile en inférence locale
Les modèles du catalogue de référence cité sur cette page sont tous bien plus gros que cela. Prenons trois exemples de la gamme 118 à 128 milliards de paramètres, où seuls les experts actifs travaillent à chaque token :
- Qwen 3.5 122B-A10B : Q4 ~73 Go, Q5 ~88 Go (estimé), Q8 ~130 Go (estimé), FP16 ~245 Go (estimé). Fiche : Qwen 3.5 122B-A10B
- Mistral Small 4 (119B) : Q4 ~72 Go, Q8 ~128 Go (estimé). Fiche : Mistral Small 4
- Qwen3.8 Flash Next 125B-A6B : Q4 ~72 Go, 6 milliards de paramètres actifs seulement. Fiche : Qwen3.8 Flash Next
Aucun de ces modèles ne tient dans 16 Go de VRAM. Ils restent pourtant intéressants pour une 9070 XT grâce au déchargement des experts vers la RAM système, expliqué plus bas.
Débit en tokens/sec : ordres de grandeur estimés
En génération, le débit d'un modèle qui tient entièrement en VRAM est borné par la bande passante : chaque token nécessite de lire tous les poids. Avec 640 Go/s, la limite théorique pour un modèle de 8 Go en Q4 est d'environ 80 tokens/sec ; en pratique, on observe 55 à 70 % de ce plafond. Ordres de grandeur, tous estimés et à confirmer avec votre propre configuration :
- Modèle dense de 7 à 9 milliards de paramètres, Q4, 100 % en VRAM : 45 à 60 tokens/sec
- Modèle dense de 12 à 14 milliards, Q4 : 28 à 38 tokens/sec
- Modèle dense de 22 à 24 milliards, Q4, contexte court : 15 à 22 tokens/sec
- Modèle dense de 30 milliards et plus, Q4 : déchargement partiel vers le CPU, souvent 3 à 6 tokens/sec, pénible au quotidien
Sur les modèles à experts du catalogue, le débit dépend surtout de la RAM système. Avec 64 à 96 Go de DDR5 en double canal, les couches d'attention en VRAM et les experts en RAM, on peut viser 8 à 15 tokens/sec (estimé) sur un modèle à 10 milliards de paramètres actifs comme Qwen 3.5 122B-A10B, et 12 à 20 tokens/sec (estimé) sur Qwen3.8 Flash Next 125B-A6B. Le traitement du prompt reste nettement plus lent qu'en tout-VRAM. La méthode est documentée sur le GitHub de llama.cpp via les options de placement des tenseurs sur CPU. Le comparateur de benchmarks locaux donne des chiffres relevés sur d'autres cartes pour calibrer vos attentes.
Modèles à experts exploitables avec déchargement CPU, et leurs licences
Pour un usage sérieux sur 9070 XT avec beaucoup de RAM, voici les candidats du catalogue quelllm.fr dans la tranche 118 à 142 milliards de paramètres, avec la licence à vérifier avant tout usage commercial :
- Qwen 3.5 122B-A10B (Alibaba) : Apache 2.0, contexte 262k, VRAM Q4 ~73 Go. Poids publiés sur la page Hugging Face d'Alibaba
- Qwen3.8 Flash Next 125B-A6B (Qwen) : licence « autre, open weights », à lire attentivement
- Mistral Small 4 (Mistral) : Apache 2.0, contexte 256k. Poids sur la page Hugging Face de Mistral
- Mistral Medium 3.5 128B : Modified MIT, VRAM Q4 ~74 Go. Fiche : Mistral Medium 3.5
- Nemotron 3 Super 120B (NVIDIA) : NVIDIA Open Model License, VRAM Q4 ~72 Go. Poids sur la page Hugging Face de NVIDIA
- Laguna S 2.1 (Poolside) : OpenMDW 1.1, orienté code, VRAM Q4 ~68 Go, le plus léger du lot
- dots.llm1 Instruct (Rednote) : MIT, VRAM Q4 ~85 Go, contexte limité à 32k
- Mixtral 8x22B Instruct (Mistral) : Apache 2.0, VRAM Q4 ~82 Go, architecture plus ancienne
Apache 2.0 et MIT autorisent l'usage commercial sans clause particulière. Les licences « Modified MIT », « NVIDIA Open Model License » et « OpenMDW » ajoutent des conditions qu'il faut lire dans le dépôt du modèle avant de bâtir un produit dessus. Si vous hésitez entre plusieurs candidats, le comparateur met deux fiches côte à côte.
Benchmarks : comment lire les scores pour ce GPU
Les scores publiés (MMLU pour la culture générale, HumanEval et LiveCodeBench pour le code, GPQA pour le raisonnement scientifique) mesurent le modèle en précision pleine, pas votre configuration. Trois précautions s'imposent sur une 9070 XT :
- La quantification dégrade légèrement les scores : en Q4_K_M, la perte reste généralement inférieure à 2 points sur MMLU pour les modèles de plus de 12 milliards de paramètres, davantage sur les petits modèles. Chiffre à confirmer modèle par modèle.
- Les scores du catalogue sont à recouper avec l'Open LLM Leaderboard, qui évalue les poids ouverts dans des conditions homogènes.
- Le contexte tronqué change les résultats : un modèle annoncé à 256k de contexte mais lancé avec 8k sur 16 Go de VRAM ne se comportera pas comme dans les tests longs.
Le bon réflexe consiste à comparer deux modèles sur vos propres tâches, avec vos prompts, plutôt que de se fier à un classement agrégé.
Cas d'usage concrets et outils compatibles AMD
Sur 9070 XT, les usages qui fonctionnent bien au quotidien sont l'assistant de code dans l'éditeur, le résumé et la reformulation de documents, la traduction, l'analyse de fichiers privés en RAG local et les agents outillés sur des tâches courtes. Les usages à très long contexte, comme l'analyse de contrats de plusieurs centaines de pages, exigent soit un petit modèle avec un KV cache quantifié, soit une seconde carte.
Côté logiciels :
- Ollama prend en charge ROCm sur RDNA 4 depuis les versions de 2025 ; la marche à suivre est dans le guide Ollama sur GPU AMD, et le projet est suivi sur le GitHub d'Ollama
- llama.cpp offre deux backends : ROCm (HIP) pour le meilleur débit et Vulkan pour la simplicité d'installation, utile si ROCm refuse de reconnaître la carte
- vLLM cible plutôt le service multi-utilisateurs ; son support ROCm est documenté sur le site de vLLM mais vise d'abord les cartes professionnelles, à tester avant de compter dessus
En cas d'erreur au chargement, de GPU non détecté ou de basculement silencieux vers le CPU, le guide de dépannage Ollama GPU recense les causes fréquentes. Si vous envisagez d'ajouter une seconde carte pour dépasser 16 Go, le guide multi-GPU llama.cpp explique la répartition des couches.
FAQ
Q : La RX 9070 XT est-elle un bon choix pour un premier setup LLM local ?
Oui pour les modèles jusqu'à 24 milliards de paramètres en Q4, avec des débits confortables et un prix inférieur aux cartes NVIDIA de VRAM équivalente. Le point faible reste les 16 Go : comparez avec une RX 7900 XTX à 24 Go d'occasion si vous visez des modèles plus gros. Le guide de choix d'un GPU détaille ces arbitrages.
Q : Quelle différence avec la RX 9060 XT 16 Go pour les LLM ?
Même quantité de VRAM, donc mêmes modèles chargeables, mais la 9060 XT dispose d'un bus 128 bits et d'une bande passante environ deux fois plus faible. Le débit en tokens/sec suit à peu près ce rapport. Le benchmark de la 9060 XT 16 Go donne des mesures concrètes à mettre en face des estimations de cette page.
Q : Peut-on faire tourner Qwen 3.5 122B-A10B sur une 9070 XT ?
Pas en VRAM seule : la version Q4 pèse environ 73 Go. Avec 96 Go de RAM système ou plus, llama.cpp permet de garder les couches partagées sur le GPU et d'envoyer les experts en RAM. Le débit tombe alors autour de 8 à 15 tokens/sec (estimé), acceptable en usage conversationnel mais lent pour des prompts longs.
Q : ROCm ou Vulkan sur cette carte ?
ROCm donne généralement 10 à 25 % de débit en plus (estimé) et un meilleur traitement du prompt. Vulkan s'installe sans dépendances AMD spécifiques et fonctionne sur presque toutes les distributions Linux et sous Windows. Commencez par Vulkan pour valider le matériel, puis passez à ROCm si le gain vous intéresse et que la version installée reconnaît gfx1201.
Q : Combien de RAM système prévoir en complément ?
Pour rester sur des modèles qui tiennent en VRAM, 32 Go suffisent. Pour exploiter les modèles à experts du catalogue avec déchargement, visez 64 Go au minimum et idéalement 96 à 128 Go en DDR5 double canal. La vitesse de la RAM influence directement les tokens/sec dans ce mode, davantage que le processeur lui-même.
Q : Quels modèles tournent sans GPU si la carte est occupée ?
Les modèles à faible nombre de paramètres actifs restent utilisables sur processeur seul, à des débits réduits. La page dédiée à l'inférence sans GPU explique les réglages de threads et de quantification qui limitent la casse, et le classement CPU only liste les candidats.
Conclusion
Un setup 9070xt llm est cohérent pour qui veut un LLM local rapide sur des modèles de 7 à 24 milliards de paramètres, et reste exploitable sur les modèles à experts du catalogue à condition d'investir dans la RAM système. Les chiffres de débit donnés ici sont des estimations à confirmer sur votre machine. Pour trouver le modèle adapté à vos 16 Go de VRAM, à votre RAM et à votre usage, utilisez le configurateur ou parcourez le catalogue complet filtré par VRAM.
Le matériel pour faire tourner un LLM en local
Pour exécuter ces modèles confortablement en local, un RTX 5070 Ti offre un excellent rapport prix/performance. Comparez les prix :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.