Meilleur LLM en 24 Go de VRAM en 2026
Trouver le meilleur LLM 24 Go VRAM dépend surtout de l'équilibre entre taille de contexte, licence et cas d'usage visé. Cette configuration, typique d'une RTX 3090 ou RTX 4090, ouvre l'accès à des modèles dans la classe des 30 à 40 milliards de paramètres en quantification Q4, ce qui change radicalement le niveau de raisonnement disponible en local par rapport à un GPU 12 ou 16 Go. Cet article passe en revue les modèles qui tiennent réellement dans cette enveloppe mémoire, leurs licences, et les compromis à connaître avant de choisir.
Quels modèles tiennent dans 24 Go en quantification Q4
À 24 Go de VRAM, la marge de manœuvre se situe entre 17 et 22 Go de poids modèle une fois le KV cache réservé. Plusieurs modèles se positionnent juste sous ou autour de cette limite :
- Seed-OSS 36B Instruct : ~22 Go en Q4, licence Apache 2.0, contexte exceptionnel de 524 288 tokens.
- Qwen 3.6 35B-A3B : ~21 Go en Q4, architecture MoE avec 3B de paramètres actifs, contexte 262 000 tokens.
- Salamandra 40B Instruct : ~24 Go en Q4, en limite haute de l'enveloppe, licence Apache 2.0.
- Command R 35B v01 et Aya 23 35B : ~20 Go en Q4 chacun, sous licence CC-BY-NC 4.0 (usage non commercial).
- Yi 1.5 34B Chat : ~20 Go en Q4, contexte limité à 4 096 tokens.
Le Mixtral 8x7B de Mistral AI, avec ses 47B de paramètres au total (architecture MoE), demande environ 26 Go en Q4 — légèrement au-dessus de 24 Go, ce qui impose souvent une quantification plus agressive (Q3) ou un déchargement partiel CPU pour tenir sur une seule carte. Le détail des specs par éditeur reste consultable sur Mistral AI sur Hugging Face et BSC sur Hugging Face pour Salamandra.
RTX 3090 vs RTX 4090 : débit réel attendu
Les deux cartes partagent 24 Go de VRAM GDDR6X, mais la RTX 4090 dispose d'une bande passante mémoire et d'une puissance de calcul supérieures. Sur un modèle de la classe 32-35B en Q4 :
- RTX 3090 : débit estimé entre 12 et 20 tokens/sec selon le modèle et le moteur d'inférence utilisé.
- RTX 4090 : débit estimé entre 18 et 30 tokens/sec dans les mêmes conditions.
Ces chiffres varient fortement selon le moteur — llama.cpp (GitHub officiel) et Ollama (GitHub officiel) restent les choix les plus simples pour du GGUF quantifié, tandis que vLLM (documentation) cible plutôt le service à haut débit avec plusieurs requêtes simultanées. Sur des modèles MoE comme Qwen 3 30B-A3B ou Nemotron Nano 3 30B-A3B, le débit est généralement plus élevé qu'un modèle dense de taille équivalente, car seule une fraction des paramètres est activée par token.
Licences : Apache 2.0, CC-BY-NC et licences propriétaires
Le choix de licence conditionne l'usage commercial :
- Apache 2.0 (usage commercial libre) : Mixtral 8x7B, Salamandra 40B, Seed-OSS 36B, Qwen 3.6 35B-A3B, la quasi-totalité de la gamme Qwen 2.5/3, Gemma 4 31B, OLMo 3 32B, Granite 4.0 H-Small.
- CC-BY-NC 4.0 (non commercial) : Command R 35B v01, Aya 23 35B, Aya Expanse 32B, publiés par Cohere — voir Cohere sur Hugging Face.
- MIT : DeepSeek R1 Distill 32B et DeepSeek R2 32B, également très permissifs.
- Licences propriétaires spécifiques : EXAONE 4.5 33B (EXAONE AI Model License, usage restreint) et Nemotron 3 33B (NVIDIA Open Model License).
Pour un projet destiné à la production commerciale, privilégier Apache 2.0 ou MIT évite les zones grises juridiques liées aux clauses non commerciales.
Cas d'usage : raisonnement, code et polyvalence
À 24 Go de VRAM, trois profils d'usage se dégagent :
- Raisonnement long : QwQ 32B et DeepSeek R1 Distill 32B ciblent les tâches de chaînage logique complexe, avec des scores généralement rapportés sur AIME et MMLU dans les benchmarks publics du Open LLM Leaderboard (Hugging Face).
- Code : Qwen 2.5 Coder 32B reste une référence en HumanEval pour cette classe de taille ; Qwen3-Coder 30B-A3B offre un contexte étendu à 262 144 tokens pour l'analyse de dépôts volumineux.
- Multilingue et généraliste : Aya 23 35B et Aya Expanse 32B ciblent explicitement la couverture multilingue, tandis que Jais 30B Chat v3 se spécialise sur l'arabe.
Pour une comparaison directe entre deux candidats fréquents dans cette gamme, la fiche Aya Expanse 32B vs Qwen 2.5 32B et DeepSeek R1 32B vs QwQ 32B détaillent les écarts de benchmarks côte à côte.
Optimiser le contexte disponible avec le KV cache
Un modèle de 32-35B en Q4 occupe déjà 17 à 22 Go de VRAM sur ses poids seuls. La marge restante pour le KV cache limite la taille de contexte réellement exploitable, même si la fiche technique annonce un contexte maximal de 128 000 ou 262 000 tokens. Pour comprendre comment la quantification du cache (Q8, Q4) permet de gagner plusieurs Go sans changer de modèle, consultez le guide sur la quantification et le KV cache et le guide sur le choix de quantification Q4/Q5/Q8.
FAQ
Q : Quel modèle Apache 2.0 privilégier en 24 Go pour un usage commercial ?
Seed-OSS 36B, Qwen 3.6 35B-A3B ou Qwen 2.5 32B Coder sont trois options Apache 2.0 qui tiennent en Q4 dans 24 Go. Le choix dépend du besoin : contexte long pour Seed-OSS, code pour Qwen 2.5 Coder, polyvalence MoE pour Qwen 3.6.
Q : Mixtral 8x7B tient-il vraiment dans 24 Go ?
Son empreinte estimée à ~26 Go en Q4 dépasse légèrement l'enveloppe de 24 Go. Une quantification plus basse (Q3) ou un contexte réduit permet généralement de le faire tenir, mais avec une perte de qualité à vérifier au cas par cas.
Q : RTX 3090 ou RTX 4090 pour ces modèles ?
Les deux offrent 24 Go de VRAM identiques, donc la même capacité à charger les modèles. La RTX 4090 apporte un débit en tokens/sec supérieur (estimé) grâce à sa bande passante mémoire plus élevée, utile pour le traitement par lots ou les longs contextes.
Q : Command R 35B et Aya 23 35B sont-ils utilisables en entreprise ?
Leur licence CC-BY-NC 4.0 restreint l'usage commercial sans accord séparé avec Cohere. Pour un déploiement en entreprise, un modèle Apache 2.0 ou MIT équivalent en taille est préférable.
Q : Quel outil pour faire tourner ces modèles en local ?
llama.cpp (GitHub officiel) et Ollama (GitHub officiel) couvrent l'inférence GGUF quantifiée sur une seule carte. Pour une interface web self-hosted, Open WebUI (GitHub officiel) s'ajoute par-dessus l'un ou l'autre.
Q : Faut-il viser 32 Go plutôt que 24 Go ?
Passer à 32 Go permet des contextes plus longs et davantage de marge sur les modèles de 35-40B sans compromis de quantification. Le guide 32 Go de VRAM détaille les modèles supplémentaires accessibles à ce palier.
Conclusion
Le meilleur LLM 24 Go VRAM n'est pas unique : il dépend de la licence recherchée (Apache 2.0 pour Seed-OSS 36B ou Qwen 3.6 35B-A3B, CC-BY-NC pour Command R et Aya), du cas d'usage (code, raisonnement, multilingue) et du contexte réellement nécessaire une fois le KV cache pris en compte. Le configurateur permet de croiser ces critères automatiquement, et le catalogue complet référence les 249 modèles avec leurs specs VRAM détaillées par quantification.
Le matériel pour faire tourner un LLM en local
Pour exécuter ces modèles confortablement en local, un RTX 5090 offre un excellent rapport prix/performance. Comparez les prix :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.