🇨🇳 LLaDA 2.0 Uni 16B
Premier dLLM open Apache 2.0 : MoE 16B/1B + décodeur diffusion 6.2B. Texte+vision unifié. Sortie 22 avril 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Classement mis à jour le 18/08/2026
La Radeon RX 7900 XT (20 GB GDDR6, 800 Go/s) est la sœur cadette de la 7900 XTX. 20 Go inhabituels permettent les 24-32B en Q4 confortable. ~650 € neuve, excellent rapport.
Premier dLLM open Apache 2.0 : MoE 16B/1B + décodeur diffusion 6.2B. Texte+vision unifié. Sortie 22 avril 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Spécialiste coding 24B Apache 2.0. 72.2% SWE-Bench. 256k ctx, FR lab.
ollama run devstral-small2:24b
Version 22B d'EuroLLM (Févr 2026). 35 langues UE. 32k ctx. Supplante EuroLLM 9B pour tâches lourdes.
# HuggingFace : utter-project/EuroLLM-22B-Instruct-2512
Dense 27B multimodal sortie 22 avril 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B : dense multimodal (texte + vision), 262k contexte, ~16 Go VRAM Q4 (18 Go de poids Ollama). Apache 2.0, code agentique et vision.
ollama run qwen3.8:27b
Small 3 enrichi de la vision. 128k ctx, Apache 2.0. Remplacé par Small 3.2 depuis juin 2025.
ollama run mistral-small3.1:24b
Premier raisonneur open Mistral. AIME24 70.7%. Base Small 3.1 + entraînement CoT.
ollama run magistral:24b
| Rang | Modèle | Params | VRAM Q4 | Contexte | Licence | Sur Radeon RX 7900 XT |
|---|---|---|---|---|---|---|
| #1 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 tok/s · Q4_K_M |
| #2 | Devstral Small 2 24B | 24B | 14 GB | 256 000 | Apache 2.0 | 15 tok/s · Q5_K_M |
| #3 | EuroLLM 22B Instruct 2512 | 22.6B | 13 GB | 32 768 | Apache 2.0 | 16 tok/s · Q5_K_M |
| #4 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 13 tok/s · Q5_K_M |
| #5 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 14 tok/s · Q5_K_M |
| #6 | Mistral Small 3.1 24B | 24B | 14 GB | 128 000 | Apache 2.0 | 15 tok/s · Q5_K_M |
| #7 | Magistral Small 24B | 24B | 14 GB | 128 000 | Apache 2.0 | 15 tok/s · Q5_K_M |
Comparez les prix de Radeon RX 7900 XT chez nos marchands partenaires (prix et stock à jour) :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous, ce qui n'influence pas le classement (établi de façon indépendante). En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.
Mémo gratuit
Reçois le mémo VRAM → meilleur modèle de code → commande Ollama (un seul écran, copier-coller). Et passe au kit Copilote Local pour en faire un setup qui marche vraiment.
Le kit Copilote Local — les configs Ollama + Cline + Aider prêtes à coller, Modelfiles réglés, dépannage, espace en ligne à vie →Pas de spam. Désinscription en 1 clic. Tes données restent chez nous (jamais revendues).
Ta carte → le meilleur modèle de code à faire tourner en local, et la commande Ollama exacte :
| Ta VRAM | GPU / Mac typiques | Modèle de code conseillé | Commande Ollama |
|---|---|---|---|
| 8 Go | RTX 4060 / 3060 · M1-M2 16 Go | Qwen2.5-Coder 7B (Q4) | ollama run qwen2.5-coder:7b |
| 12 Go | RTX 4070 / 5070 | Qwen2.5-Coder 14B (Q4) | ollama run qwen2.5-coder:14b |
| 16 Go | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 Go | DeepSeek-Coder-V2-Lite 16B ou Qwen2.5-Coder 14B Q8 | ollama run deepseek-coder-v2:16b |
| 24 Go | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 Go | Qwen2.5-Coder 32B (Q4) — le « proche Copilot » | ollama run qwen2.5-coder:32b |
| 32 Go | RTX 5090 | Qwen2.5-Coder 32B en Q5/Q6 ou Devstral Small 2 (agentique) | ollama run devstral |
| 48 Go+ | Mac M4 Max 64 Go · M2 Ultra 128 Go | Qwen3-Coder 30B-A3B (MoE rapide) ou un 32B en Q8 | ollama run qwen3-coder:30b |
🔌 Pour le brancher dans VS Code : Cline (agent multi-fichiers), Aider (CLI) ou Tabby/Twinny (autocomplétion FIM) — tous se connectent à Ollama en local. Le kit Copilote Local — configs prêtes à coller + setup testé — est dispo : /copilote-local.
Filtre : Q4_K_M ≤ 18 Go. Bonus 13-32B (peak 20 Go). 800 Go/s + ROCm 6.
Critères pris en compte :
Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.
RX 7900 XT vs 7900 XTX ?
XT = 20 Go + 800 Go/s. XTX = 24 Go + 960 Go/s. Pour 24-32B Q4, les deux conviennent. XTX préférable pour fine-tuning ou 32B Q5. Voir RX 7900 XTX.
Pourquoi 20 Go et pas 16 ou 24 ?
Choix marketing AMD pour positionner entre 7900 XTX et le tier précédent. Pour LLM, c'est sweet spot : Mistral Small 24B Q4 (~13 Go) + contexte 32k + cache = ~18 Go.
ROCm sur 7900 XT : easy ?
Oui depuis ROCm 6 (2024). Ollama supporte natif via -gpu rocm. llama.cpp aussi. Plus simple qu'il y a 2 ans. Voir guide.
Sweet spot LLM 7900 XT ?
Mistral Small 24B Q5 (~17 Go) à 25 tok/s, Qwen 3 32B Q4 (~17 Go) à 22 tok/s. Excellent pour code + chat.