🇨🇳 Qwen 3 14B
Dense 14B avec hybrid thinking. Égale Qwen 2.5 32B Base sur STEM/code.
ollama run qwen3:14b
Classement mis à jour le 29/08/2026
La RTX 5080 (16 GB GDDR7, 960 Go/s) est le tier 2 Blackwell. VRAM identique à la 4080 mais GDDR7 + Neural Engine boosté = 25-30 % plus rapide sur les mêmes modèles.
Dense 14B avec hybrid thinking. Égale Qwen 2.5 32B Base sur STEM/code.
ollama run qwen3:14b
Raisonneur MIT 14B. Bat R1-Distill-Llama-70B sur AIME/GPQA avec 50× moins de paramètres.
ollama run phi4-reasoning:14b
Raisonnement exceptionnel pour sa taille. Orienté STEM.
ollama run phi4:14b
Dense 14B Apache 2.0. MMLU 79.7, HumanEval 83.5. 29+ langues. Bon compromis.
ollama run qwen2.5:14b
Coder 14B. HumanEval 89.6, LiveCodeBench 37.1. Sweet spot VRAM pour code self-host.
ollama run qwen2.5-coder:14b
R1 distillé Qwen 14B. AIME24 69.7, MATH-500 93.9. Dépasse o1-mini sur beaucoup de benchmarks.
ollama run deepseek-r1:14b
Spécialiste coding 24B Apache 2.0. 72.2% SWE-Bench. 256k ctx, FR lab.
ollama run devstral-small2:24b
| Rang | Modèle | Params | VRAM Q4 | Contexte | Licence | Sur RTX 5080 |
|---|---|---|---|---|---|---|
| #1 | Qwen 3 14B | 14B | 9 GB | 131 072 | Apache 2.0 | 55 tok/s · Q8 |
| #2 | Phi-4 Reasoning 14B | 14B | 9 GB | 32 768 | MIT | 55 tok/s · Q8 |
| #3 | Phi-4 14B | 14B | 9 GB | 16 384 | MIT | 55 tok/s · Q8 |
| #4 | Qwen 2.5 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 | 55 tok/s · Q8 |
| #5 | Qwen 2.5 Coder 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 | 55 tok/s · Q8 |
| #6 | DeepSeek R1 Distill Qwen 14B | 14B | 9 GB | 131 072 | MIT | 55 tok/s · Q8 |
| #7 | Devstral Small 2 24B | 24B | 14 GB | 256 000 | Apache 2.0 | 40 tok/s · Q4_K_M |
Comparez les prix de RTX 5080 chez nos marchands partenaires (prix et stock à jour) :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous, ce qui n'influence pas le classement (établi de façon indépendante). En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.
Mémo gratuit
Reçois le mémo VRAM → meilleur modèle de code → commande Ollama (un seul écran, copier-coller). Et passe au kit Copilote Local pour en faire un setup qui marche vraiment.
Le kit Copilote Local — les configs Ollama + Cline + Aider prêtes à coller, Modelfiles réglés, dépannage, espace en ligne à vie →Pas de spam. Désinscription en 1 clic. Tes données restent chez nous (jamais revendues).
Ta carte → le meilleur modèle de code à faire tourner en local, et la commande Ollama exacte :
| Ta VRAM | GPU / Mac typiques | Modèle de code conseillé | Commande Ollama |
|---|---|---|---|
| 8 Go | RTX 4060 / 3060 · M1-M2 16 Go | Qwen 3.5 9B (Q4, 6,6 Go — 256k ctx) | ollama run qwen3.5:9b |
| 12 Go | RTX 3060 12 Go / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 Go) ou Gemma 4 12B (7,6 Go) | ollama run qwen3.5:9b-q8_0 |
| 16 Go | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 Go | Devstral 24B (Q4, 14 Go) — spécialiste agent de code | ollama run devstral:24b |
| 24 Go | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 Go | Qwen 3.8 27B (Q4, 18 Go) — le « proche Copilot » | ollama run qwen3.8:27b |
| 32 Go | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 Go) — MoE rapide | ollama run qwen3.6:35b |
| 48 Go+ | Mac M4 Max 64 Go · M2 Ultra 128 Go | Qwen3-Coder 30B-A3B (Q8, 32 Go — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — c'est encore la référence sur ce cas précis. ⚠️ Qwen 3.8 : son raisonnement est réglé très haut par défaut et il « sur-réfléchit » sur des demandes simples — baisse-le à low (ou coupe-le) au premier lancement. ⚠️ Piège licence : Codestral 22B = Mistral Non-Production License → interdit pour coder au travail. Qwen 3.5/3.8, Gemma 4 et Devstral sont en Apache 2.0. 💡 Ça plante en mémoire ? Garde ~1,5 Go de VRAM libre pour le contexte, ou descends d'un cran de quantization.🔌 Pour le brancher dans VS Code : Cline (agent multi-fichiers), Aider (CLI) ou Tabby/Twinny (autocomplétion FIM) — tous se connectent à Ollama en local. Le kit Copilote Local — configs prêtes à coller + setup testé — est dispo : /copilote-local.
Filtre : modèles dont Q4_K_M tient sous 14 Go. Bonus 7-14B (peak 5080) et 13-24B en limite. Bande passante GDDR7 960 Go/s = ~30 % gain vs 4080.
Critères pris en compte :
Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.
RTX 5080 vs RTX 4080 ?
Même 16 Go VRAM. La 5080 est 25-30 % plus rapide sur les mêmes modèles grâce à GDDR7 (960 vs 736 Go/s) + Neural Engine Blackwell. Mistral Small 24B Q4 : 5080 ~38 tok/s vs 4080 ~28 tok/s. Voir RTX 4080.
Peut-on faire tourner 30B sur 5080 ?
Mistral Small 24B Q4 (~13 Go) oui à 35-40 tok/s. Qwen 3 32B Q3_K_M (~14 Go) limite, qualité dégradée. Pour 30-32B en Q4 confort, viser RTX 5090 32 Go. Voir RTX 5090.
Quelle quantif sur 5080 ?
Q5_K_M pour 7-9B (qualité max, ~7 Go). Q4_K_M pour 13-24B (Mistral Small 24B). Q6_K pour 13-14B (Qwen 3 14B ~12 Go) idéal.
RTX 5080 ou Mac Studio M4 Max 64 Go ?
Studio M4 Max = silence + 64 Go (70B Q4 fluide). 5080 = vitesse pure sur 7-24B (35-50 tok/s). Si vous voulez du 70B local, Mac Studio. Pour speed sur 7-24B, RTX 5080. Voir Mac Studio.
Approfondissez avec nos duels détaillés des finalistes :