Performance LLM sur GPU AMD Radeon 9070XT

La requête « 9070xt llm » revient souvent chez les possesseurs de la Radeon RX 9070 XT qui veulent faire tourner un modèle en local sans carte NVIDIA. Bonne nouvelle : avec 16 Go de GDDR6 et le support ROCm de l'architecture RDNA 4, un setup 9070xt llm est viable pour la plupart des usages personnels, à condition de comprendre ses limites en mémoire. Cette page détaille les specs de la carte utiles à l'inférence, la VRAM consommée selon la quantification (Q4, Q5, Q8, FP16), les débits en tokens/sec à attendre, les modèles du catalogue quelllm.fr exploitables avec déchargement CPU, la lecture des benchmarks, puis les cas d'usage et les outils (llama.cpp, Ollama, vLLM) qui fonctionnent réellement sur AMD.

Fiche technique de la RX 9070 XT pour l'inférence

Ce qui compte pour un LLM n'est pas la puissance de calcul brute mais la bande passante mémoire et la quantité de VRAM. Sur ces deux points, la carte se situe ainsi :

Pour situer : la bande passante est proche de celle d'une RX 7900 XT, mais la VRAM reste à 16 Go contre 20 ou 24 Go sur la génération précédente. C'est le compromis à retenir avant d'acheter. La page de la RX 9070 XT liste les modèles classés par compatibilité, et le guide d'installation dédié couvre la mise en place pas à pas.

VRAM : ce qui tient dans 16 Go selon la quantification

Règle pratique pour estimer la mémoire d'un modèle dense : environ 0,55 à 0,6 Go par milliard de paramètres en Q4, 0,7 en Q5, 1,05 en Q8 et 2 en FP16, plus le cache KV qui grossit avec le contexte. Sur 16 Go, en gardant 1 à 1,5 Go pour le système et le KV cache :

Les modèles du catalogue de référence cité sur cette page sont tous bien plus gros que cela. Prenons trois exemples de la gamme 118 à 128 milliards de paramètres, où seuls les experts actifs travaillent à chaque token :

Aucun de ces modèles ne tient dans 16 Go de VRAM. Ils restent pourtant intéressants pour une 9070 XT grâce au déchargement des experts vers la RAM système, expliqué plus bas.

Débit en tokens/sec : ordres de grandeur estimés

En génération, le débit d'un modèle qui tient entièrement en VRAM est borné par la bande passante : chaque token nécessite de lire tous les poids. Avec 640 Go/s, la limite théorique pour un modèle de 8 Go en Q4 est d'environ 80 tokens/sec ; en pratique, on observe 55 à 70 % de ce plafond. Ordres de grandeur, tous estimés et à confirmer avec votre propre configuration :

Sur les modèles à experts du catalogue, le débit dépend surtout de la RAM système. Avec 64 à 96 Go de DDR5 en double canal, les couches d'attention en VRAM et les experts en RAM, on peut viser 8 à 15 tokens/sec (estimé) sur un modèle à 10 milliards de paramètres actifs comme Qwen 3.5 122B-A10B, et 12 à 20 tokens/sec (estimé) sur Qwen3.8 Flash Next 125B-A6B. Le traitement du prompt reste nettement plus lent qu'en tout-VRAM. La méthode est documentée sur le GitHub de llama.cpp via les options de placement des tenseurs sur CPU. Le comparateur de benchmarks locaux donne des chiffres relevés sur d'autres cartes pour calibrer vos attentes.

Modèles à experts exploitables avec déchargement CPU, et leurs licences

Pour un usage sérieux sur 9070 XT avec beaucoup de RAM, voici les candidats du catalogue quelllm.fr dans la tranche 118 à 142 milliards de paramètres, avec la licence à vérifier avant tout usage commercial :

Apache 2.0 et MIT autorisent l'usage commercial sans clause particulière. Les licences « Modified MIT », « NVIDIA Open Model License » et « OpenMDW » ajoutent des conditions qu'il faut lire dans le dépôt du modèle avant de bâtir un produit dessus. Si vous hésitez entre plusieurs candidats, le comparateur met deux fiches côte à côte.

Benchmarks : comment lire les scores pour ce GPU

Les scores publiés (MMLU pour la culture générale, HumanEval et LiveCodeBench pour le code, GPQA pour le raisonnement scientifique) mesurent le modèle en précision pleine, pas votre configuration. Trois précautions s'imposent sur une 9070 XT :

Le bon réflexe consiste à comparer deux modèles sur vos propres tâches, avec vos prompts, plutôt que de se fier à un classement agrégé.

Cas d'usage concrets et outils compatibles AMD

Sur 9070 XT, les usages qui fonctionnent bien au quotidien sont l'assistant de code dans l'éditeur, le résumé et la reformulation de documents, la traduction, l'analyse de fichiers privés en RAG local et les agents outillés sur des tâches courtes. Les usages à très long contexte, comme l'analyse de contrats de plusieurs centaines de pages, exigent soit un petit modèle avec un KV cache quantifié, soit une seconde carte.

Côté logiciels :

En cas d'erreur au chargement, de GPU non détecté ou de basculement silencieux vers le CPU, le guide de dépannage Ollama GPU recense les causes fréquentes. Si vous envisagez d'ajouter une seconde carte pour dépasser 16 Go, le guide multi-GPU llama.cpp explique la répartition des couches.

FAQ

Q : La RX 9070 XT est-elle un bon choix pour un premier setup LLM local ?

Oui pour les modèles jusqu'à 24 milliards de paramètres en Q4, avec des débits confortables et un prix inférieur aux cartes NVIDIA de VRAM équivalente. Le point faible reste les 16 Go : comparez avec une RX 7900 XTX à 24 Go d'occasion si vous visez des modèles plus gros. Le guide de choix d'un GPU détaille ces arbitrages.

Q : Quelle différence avec la RX 9060 XT 16 Go pour les LLM ?

Même quantité de VRAM, donc mêmes modèles chargeables, mais la 9060 XT dispose d'un bus 128 bits et d'une bande passante environ deux fois plus faible. Le débit en tokens/sec suit à peu près ce rapport. Le benchmark de la 9060 XT 16 Go donne des mesures concrètes à mettre en face des estimations de cette page.

Q : Peut-on faire tourner Qwen 3.5 122B-A10B sur une 9070 XT ?

Pas en VRAM seule : la version Q4 pèse environ 73 Go. Avec 96 Go de RAM système ou plus, llama.cpp permet de garder les couches partagées sur le GPU et d'envoyer les experts en RAM. Le débit tombe alors autour de 8 à 15 tokens/sec (estimé), acceptable en usage conversationnel mais lent pour des prompts longs.

Q : ROCm ou Vulkan sur cette carte ?

ROCm donne généralement 10 à 25 % de débit en plus (estimé) et un meilleur traitement du prompt. Vulkan s'installe sans dépendances AMD spécifiques et fonctionne sur presque toutes les distributions Linux et sous Windows. Commencez par Vulkan pour valider le matériel, puis passez à ROCm si le gain vous intéresse et que la version installée reconnaît gfx1201.

Q : Combien de RAM système prévoir en complément ?

Pour rester sur des modèles qui tiennent en VRAM, 32 Go suffisent. Pour exploiter les modèles à experts du catalogue avec déchargement, visez 64 Go au minimum et idéalement 96 à 128 Go en DDR5 double canal. La vitesse de la RAM influence directement les tokens/sec dans ce mode, davantage que le processeur lui-même.

Q : Quels modèles tournent sans GPU si la carte est occupée ?

Les modèles à faible nombre de paramètres actifs restent utilisables sur processeur seul, à des débits réduits. La page dédiée à l'inférence sans GPU explique les réglages de threads et de quantification qui limitent la casse, et le classement CPU only liste les candidats.

Conclusion

Un setup 9070xt llm est cohérent pour qui veut un LLM local rapide sur des modèles de 7 à 24 milliards de paramètres, et reste exploitable sur les modèles à experts du catalogue à condition d'investir dans la RAM système. Les chiffres de débit donnés ici sont des estimations à confirmer sur votre machine. Pour trouver le modèle adapté à vos 16 Go de VRAM, à votre RAM et à votre usage, utilisez le configurateur ou parcourez le catalogue complet filtré par VRAM.

Le matériel pour faire tourner un LLM en local

Pour exécuter ces modèles confortablement en local, un RTX 5070 Ti offre un excellent rapport prix/performance. Comparez les prix :

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.

Article publié et mis à jour le par Mohamed Meguedmi · Source de données : /api/models.json · Licence contenu : CC BY 4.0.

Une erreur ou une mise à jour à signaler ? Contribuer.