Meilleur LLM sur Radeon RX 9070 XT (16 Go) en 2026
Identifier le meilleur LLM RX 9070 XT exige de comprendre deux contraintes qui s'articulent : 16 Go de VRAM GDDR6 et l'écosystème ROCm d'AMD, désormais fonctionnel sur l'architecture RDNA4. La RX 9070 XT représente en 2026 le point d'entrée le plus accessible pour exécuter des modèles de 27 milliards de paramètres en quantification Q4 sur GPU grand public sous Linux ou Windows. Ce guide examine les specs matérielles, sélectionne les modèles du catalogue quelllm.fr adaptés à cette carte, compare les licences, donne des repères de vitesse et propose des recommandations par cas d'usage.
RX 9070 XT et ROCm : ce que vous devez savoir avant de choisir un modèle
La Radeon RX 9070 XT embarque 16 Go de mémoire GDDR6 sur un bus 256 bits, pour une bande passante théorique d'environ 576 Go/s. L'architecture RDNA4 est prise en charge depuis ROCm 6.x, ce qui permet d'utiliser llama.cpp compilé avec le backend HIP, Ollama ≥ 0.3.x ou LM Studio — à condition de disposer des drivers amdgpu récents sur Linux, ou d'une installation ROCm for Windows.
Points clés avant de lancer un modèle :
- VRAM exploitable : ~15,5 Go en pratique, après overhead système et drivers
- Bande passante : ~576 Go/s (estimé), contre ~1 008 Go/s pour une RTX 4090 — la vitesse d'inférence est proportionnellement réduite
- Backend le plus stable : llama.cpp avec
-DGGML_HIPBLAS=ONsur Linux - Compatibilité : vérifier la matrice de compatibilité AMD pour votre noyau et driver exacts
- Précision native : FP16 supporté par les unités de calcul RDNA4
La bonne nouvelle : les modèles autour de 27B en quantification Q4 sont parfaitement adaptés à 16 Go, et la famille des 24B offre une marge confortable pour de longs contextes.
Quels modèles tiennent dans 16 Go de VRAM ?
La règle approximative pour Q4 est d'environ 0,55 Go par milliard de paramètres. Un modèle 27B pèse donc ~15-16 Go en Q4, un 24B ~13-14 Go, et un 32B ~18-19 Go — hors limite.
Modèles 26-27B compatibles Q4 natifs (≤ 16 Go)
- Gemma 2 27B — VRAM Q4 : ~16 Go, ctx : 8 192
- Gemma 3 27B — VRAM Q4 : ~16 Go, ctx : 128 000
- Qwen 3.5 27B — VRAM Q4 : ~16 Go, ctx : 262 000
- Qwen 3.6 27B — VRAM Q4 : ~16 Go, ctx : 262 144
- Qwen 3.8 27B — VRAM Q4 : ~16 Go, ctx : 262 144
- Gemma 4 26B-A4B MoE — VRAM Q4 : ~16 Go, ctx : 128 000, architecture mixture-of-experts
- Trinity Mini 26B-A3B — VRAM Q4 : ~15 Go, ctx : 131 072
Modèles 24B (marge confortable, 2-3 Go libres)
- Mistral Small 3.2 24B — VRAM Q4 : ~14 Go
- Magistral Small 24B — VRAM Q4 : ~14 Go
- Devstral Small 2 24B — VRAM Q4 : ~14 Go, ctx : 256 000
Modèles 20-22B (large marge, ~3-5 Go libres)
- Codestral 22B v0.1 — VRAM Q4 : ~13 Go, ctx : 32 000
- EuroLLM 22B Instruct 2512 — VRAM Q4 : ~13 Go, multilingue européen
- gpt-oss 20B — VRAM Q4 : ~13 Go, ctx : 128 000
Remarque sur les 32B : en Q4 (~19 Go), ils dépassent les 16 Go disponibles. En Q3 (~13-14 Go, soit ~0,42 Go/B), c'est techniquement possible avec une perte de précision mesurable. Sur la 9070 XT, rester sur les 27B en Q4 reste le choix le plus rationnel.
Top 5 des modèles recommandés pour la RX 9070 XT
1. Qwen 3.8 27B — polyvalence et contexte long
Qwen 3.8 27B est la version la plus avancée de la série Qwen 3.x dans la tranche 27B, publiée par Alibaba sous licence Apache 2.0. Son contexte de 262 144 tokens est l'un des plus larges disponibles dans cette plage de taille. Il occupe l'intégralité des 16 Go en Q4 sans débordement.
- Licence : Apache 2.0 (usage commercial autorisé)
- VRAM Q4 : ~16 Go
- Contexte : 262 144 tokens
- Points forts : raisonnement général, code, questions longue distance
- Vitesse estimée : 20-30 tokens/s sur RX 9070 XT (estimé d'après benchmark communauté, proportionnel à la bande passante)
2. Gemma 3 27B — performances validées, contexte 128 k
Gemma 3 27B de Google propose 128 000 tokens de contexte et une architecture bien documentée. Ses performances sur le Open LLM Leaderboard de Hugging Face le placent parmi les références dans la catégorie 27B pour la compréhension et le suivi d'instructions.
- Licence : Gemma (restrictions pour certains usages commerciaux — voir CGU Google)
- VRAM Q4 : ~16 Go
- Contexte : 128 000 tokens
- Points forts : compréhension longue distance, suivi d'instructions précis
3. Magistral Small 24B — raisonnement structuré
Magistral Small 24B de Mistral AI est conçu pour les tâches de raisonnement multi-étapes et l'analyse structurée. Avec ~14 Go en Q4, il laisse 2 Go de marge sur la 9070 XT — utile pour maintenir un contexte système étendu en production.
- Licence : Apache 2.0
- VRAM Q4 : ~14 Go
- Contexte : 128 000 tokens
- Points forts : analyse, résumé structuré, agent à étapes, raisonnement chaîné
4. Devstral Small 2 24B — agent de développement logiciel
Devstral Small 2 24B (Apache 2.0, Mistral AI) cible explicitement les agents de développement avec un contexte exceptionnel de 256 000 tokens. Il peut ingérer une base de code entière en une seule passe, ce qui le rend pertinent pour la revue automatisée, la génération de tests ou la documentation.
- Licence : Apache 2.0
- VRAM Q4 : ~14 Go
- Contexte : 256 000 tokens
- Points forts : génération de code, refactoring, lecture de large codebase
5. Codestral 22B v0.1 — spécialiste du code, léger
Codestral 22B v0.1 de Mistral AI est l'une des références dans la catégorie code sous 23B. Il supporte le fill-in-the-middle (FIM) et atteint des scores HumanEval supérieurs aux généralistes de même taille (scores exacts sur GGUF Q4 : à confirmer). Il pèse seulement ~13 Go en Q4.
- Licence : Mistral Non-Production License (usage non commercial uniquement)
- VRAM Q4 : ~13 Go
- Contexte : 32 000 tokens
- Points forts : complétion de code, FIM, intégration IDE
Licences : Apache 2.0, MIT, Gemma — ce qui change selon l'usage
Le choix de la licence conditionne l'usage en entreprise ou dans un produit.
Licences libres pour l'usage commercial (Apache 2.0 ou MIT)
- Qwen 3.5 27B, Qwen 3.6 27B, Qwen 3.8 27B — Apache 2.0
- Trinity Mini 26B-A3B — Apache 2.0
- Magistral Small 24B, Devstral Small 2 24B, Mistral Small 3.2 24B — Apache 2.0
- EuroLLM 22B Instruct 2512, gpt-oss 20B — Apache 2.0
- Phi-4 14B — MIT
Licences restreintes
- Licence Gemma (Gemma 2 27B, Gemma 3 27B, Gemma 4 26B-A4B MoE) : nécessite l'acceptation des conditions d'utilisation Google Gemma ; certains usages commerciaux sont soumis à restrictions
- Mistral Non-Production License : Codestral 22B est réservé aux contextes non commerciaux et de recherche
Pour une vue synthétique des licences disponibles dans le catalogue, consulter le guide des licences LLM open-weights.
Benchmarks et performances attendues sur RX 9070 XT
Les scores ci-dessous sont issus des publications officielles ou des benchmarks communautaires. Les vitesses d'inférence sur RX 9070 XT sont estimées à partir de mesures sur d'autres GPU pondérées par la bande passante mémoire respective.
MMLU — évaluation générale
- Série Qwen 3.x 27B : performances MMLU supérieures à 75 % en 5-shot rapportées sur la page Qwen de HuggingFace pour les variantes de cette taille (à confirmer sur Q4)
- Gemma 3 27B : résultats publiés par Google dans la documentation officielle Gemma — vérifier la dégradation en Q4 selon le niveau de quantification
- Magistral Small 24B : métriques raisonnement publiées par Mistral AI dans les notes de version
HumanEval — génération de code
- Devstral Small 2 24B : conçu agent-code, score HumanEval supérieur aux généralistes de même taille (à confirmer sur GGUF Q4)
- Codestral 22B : référence catégorie code sub-23B selon les benchmarks communautaires rapportés sur r/LocalLLaMA
Vitesse d'inférence (estimé)
- Modèles 27B Q4 : 20-35 tokens/s sur RX 9070 XT
- Modèles 24B Q4 : 35-50 tokens/s
- Modèles 14-22B Q4 : 50-80 tokens/s
Ces plages dépendent du backend (llama.cpp HIP vs ROCm natif), du niveau de parallélisme, et de la longueur du contexte actif. Avec un contexte proche du maximum (262 k tokens), la vitesse chute significativement.
Cas d'usage concrets
Développement logiciel et revue de code Devstral Small 2 24B pour les agents multi-fichiers et les projets de grande taille ; Codestral 22B pour la complétion et le FIM dans un IDE. Les deux s'exécutent avec marge sur la 9070 XT.
Analyse de documents longs Qwen 3.8 27B avec ses 262 144 tokens de contexte permet d'analyser des contrats ou rapports volumineux en une seule requête. Gemma 3 27B (128 000 tokens) est une alternative solide sous licence Gemma.
Multilinguisme et français EuroLLM 22B Instruct 2512 est entraîné spécifiquement sur les langues européennes dont le français, l'allemand et l'espagnol. Il s'exécute avec environ 3 Go de marge sur la 9070 XT.
Modèle rapide et léger Phi-4 14B (MIT, Microsoft) occupe ~9 Go en Q4 et libère 7 Go pour un contexte très étendu ou des sessions simultanées. Pertinent quand la vitesse prime sur la taille du modèle.
Raisonnement et agents Magistral Small 24B pour les chaînes de raisonnement structurées et les agents simples. Trinity Mini 26B-A3B (Apache 2.0, Arcee AI) à ~15 Go en Q4 offre un bon compromis raisonnement/taille.
Pour comparer deux modèles directement, utiliser le comparateur quelllm.fr.
FAQ
Q : La RX 9070 XT est-elle bien prise en charge par ROCm ?
ROCm 6.x inclut le support de l'architecture RDNA4 (navi48). Sur Linux avec les drivers amdgpu-dkms récents, llama.cpp HIP fonctionne de manière stable. Sous Windows, ROCm for Windows est en cours de maturité — consulter la matrice de compatibilité AMD avant toute configuration. Les performances sous Linux sont généralement meilleures qu'en environnement Windows pour le moment.
Q : Peut-on faire tourner un modèle 32B sur une RX 9070 XT avec 16 Go ?
En Q4 (~19 Go pour un 32B), non — la VRAM est dépassée. En Q3 (~13-14 Go), c'est faisable avec une perte de précision notable. En pratique, les 27B en Q4 offrent un meilleur rapport qualité/taille sur cette carte : même niveau d'inférence, pleine précision Q4, et sans risque de débordement.
Q : Quelle quantification choisir entre Q4, Q5 et Q8 ?
Q4_K_M est le meilleur point de départ : perte de qualité faible, taille réduite de moitié par rapport au FP16. Q5_K_M améliore la précision pour environ +25 % de VRAM. Q8_0 est proche du FP16 mais dépasse 16 Go pour la plupart des 27B. Sur la 9070 XT, Q4_K_M sur 27B ou Q5_K_M sur 24B sont des choix rationnels. FP16 complet sur 27B (~30 Go) est hors de portée.
Q : Ollama fonctionne-t-il sur la RX 9070 XT sous Linux ?
Oui. Ollama ≥ 0.3.x détecte automatiquement les GPU AMD compatibles ROCm sous Linux si les drivers amdgpu-dkms sont correctement installés. Aucune configuration manuelle n'est requise dans la majorité des cas. Sous Windows, la prise en charge dépend de la version de ROCm for Windows disponible au moment de l'installation.
Q : Quel modèle recommandez-vous pour du français courant ?
EuroLLM 22B Instruct 2512 est le plus ciblé pour les langues européennes. Mistral Small 3.2 24B de Mistral AI (Apache 2.0) offre d'excellentes performances en français pour les tâches générales et la rédaction assistée, avec une bonne marge sur la 9070 XT.
Q : Qwen 3.8 27B ou Gemma 3 27B : lequel choisir ?
Les deux occupent ~16 Go en Q4. Qwen 3.8 27B est sous Apache 2.0 (usage commercial libre) et propose un contexte plus large (262 144 vs 128 000 tokens). Gemma 3 27B est soumis à la licence Gemma, plus restrictive pour les usages commerciaux. Si la licence est neutre, les scores respectifs sur le Open LLM Leaderboard permettent de trancher selon votre tâche précise.
Conclusion
Le meilleur LLM RX 9070 XT en 2026 se situe dans la tranche 24-27B : Qwen 3.8 27B et Gemma 3 27B pour la polyvalence générale, Devstral Small 2 24B et Codestral 22B pour le développement logiciel, EuroLLM 22B pour le multilinguisme européen, Magistral Small 24B pour le raisonnement structuré. Avec 16 Go de VRAM RDNA4 et ROCm, cette carte permet d'accéder à un niveau de performance sérieux en self-hosting. Explorez le catalogue complet de quelllm.fr ou utilisez le configurateur pour affiner votre sélection selon votre GPU, votre licence cible et votre cas d'usage.
Le matériel pour faire tourner un LLM en local
Pour exécuter ces modèles confortablement en local, un Radeon RX 9070 XT offre un excellent rapport prix/performance. Comparez les prix :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.