Intermédiaire 12 minPar VRAM
Quel LLM pour 24 Go de VRAM ?
24 Go de VRAM est le palier sérieux pour LLM en 2026. RTX 3090, 3090 Ti, 4090, RX 7900 XTX : ces cartes font tenir Qwen 3.8 27B (18 Go, 262k ctx, vision) tout en VRAM, un MoE code Qwen3-Coder 30B-A3B (19 Go) très rapide, ou le gros MoE Qwen 3.6 35B-A3B (23 Go) qui rivalise avec les 70B d'hier — plus fine-tuning LoRA 14B-24B et RAG multi-utilisateurs. C'est le minimum pour un usage pro intensif ou power user. Ce guide détaille ce que vous gagnez vs 16 Go.
#24 Go VRAM, le palier sérieux
→
Le haut de gamme tient enfin en VRAM
En 2026, plus besoin de dégrader un 70B dense : un MoE comme Qwen 3.6 35B-A3B (23 Go en Q4) tient entièrement dans les 24 Go et atteint une qualité proche des anciens 70B, tout en restant rapide grâce à ses 3B de paramètres actifs (marge de contexte serrée). Qwen 3.8 27B (18 Go) laisse davantage de place pour un gros contexte. Le vieux réflexe « offloader un 70B en IQ2 » n'a plus d'intérêt.
#1. GPU concernés
- Budget (~750 €)
- RTX 3090 occasion. Meilleur rapport 24 Go/€.
- Standard (~1100-1800 €)
- RX 7900 XTX (1100 € neuf) ou RTX 4090 occasion.
- Premium (occasion)
- RTX 3090 Ti (~1000 €) — entre 3090 et 4090.
#2. Modèles compatibles
24 Go VRAM — modèles LLM
| Modèle | Quant | VRAM | Tokens/sec (RTX 4090) |
|---|---|---|---|
| gpt-oss 20B | Q4_K_M | 13 Go | 117-143 t/s |
| Devstral Small 2 24B | Q4_K_M | 14 Go | 36-44 t/s |
| Qwen 3.8 27B | Q4_K_M | 16 Go | 20-24 t/s |
| Mistral Small 24B | Q6_K | 20 Go | 32 t/s |
| GLM 4.7 Flash | Q4_K_M | 19 Go | 90-110 t/s |
| Qwen 3.6 27B | Q5_K_M | 19 Go | 29-35 t/s |
| Granite 4.1 30B Instruct | Q5_K_M | 21 Go | 27-33 t/s |
| Gemma 4 26B-A4B MoE | Q5_K_M | 19 Go | 54-66 t/s |
#3. Faire tourner un 70B
- MoE 35B-A3B (23 Go)
- Qwen 3.6 35B-A3B en Q4 tient tout en VRAM, ~55-70 tok/s (RTX 4090), qualité proche d'un 70B dense d'hier. Le vrai choix 2026.
- Qwen 3.8 27B (18 Go)
- Dense, 262k ctx, vision : la référence généraliste 24 Go, ~29-35 tok/s, avec de la marge pour le contexte.
- Vieux 70B dense en IQ2 (21 Go)
- Encore techniquement possible (Llama 70B, 2024) mais dégradé à ~85 % et sans intérêt face aux MoE 2026. À éviter.
- 70B dense en Q3+ (30 Go et plus)
- Impose de l'offload RAM et tombe à 3-10 tok/s : réservez ce cas au palier 32 Go.
#4. Fine-tuning
- QLoRA 7B-14B
- Très confortable. Batch 8 + contexte 4096.
- QLoRA 24B
- Confortable. Batch 4 + contexte 2048.
- QLoRA 70B
- Tangent, 22-23 Go requis avec unsloth + batch 1 + contexte court.
- LoRA classique 14B
- Possible avec batch 2, contexte 2048.
#Questions fréquentes
Quel est le meilleur LLM pour 24 Go de VRAM ?+
Qwen 3.8 27B (18 Go, 262k ctx, vision) pour un généraliste polyvalent, ou le MoE Qwen 3.6 35B-A3B (23 Go) qui approche les 70B d'hier. Pour du code : Qwen3-Coder 30B-A3B (19 Go, MoE) ou l'agent de code Devstral 24B (14 Go). Pour les agents et outils : GLM 4.7 Flash (19 Go, MIT).
24 Go, faut-il encore viser un 70B ?+
Non, ça n'a plus de sens en 2026. Un MoE comme Qwen 3.6 35B-A3B (23 Go) tient entièrement en VRAM et rivalise avec les anciens 70B, sans la dégradation d'un IQ2. Un vrai 70B dense confortable reste réservé au palier 32 Go et plus (RTX 5090).
RTX 3090 ou RTX 4090 pour LLM en 24 Go ?+
4090 : +40 % vitesse, plus silencieuse, ~1000 € plus chère occasion. 3090 : meilleur rapport perf/€. Pour pur LLM, 3090 reste excellent. Si budget atteint 1800 €, 4090 mieux.
Combien de tokens/sec pour un gros MoE 30-35B sur RTX 3090 ?+
Comptez ~35-50 tok/s pour Qwen 3.6 35B-A3B et ~20-25 tok/s pour un dense Qwen 3.8 27B sur RTX 3090. La RTX 4090 ajoute environ +40 %, la RX 7900 XTX est comparable à la 3090.
24 Go suffit pour fine-tuning sérieux ?+
Pour QLoRA 7B-24B : oui largement. Pour LoRA classique 70B ou full fine-tune : non, il faut multi-GPU.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.