Avancé 12 minPar VRAM
Quel LLM pour 32 Go de VRAM ?
32 Go de VRAM est le palier frontier 2026 : RTX 5090 — la seule carte grand public à atteindre cette VRAM. Vous tenez Qwen 3.6 35B-A3B (23 Go) entièrement en VRAM à 29-35 tok/s, Qwen3-Coder 30B-A3B en Q8 (32 Go) confortable, Mistral Large 123B Q3 jouable en offload. C'est l'IA locale sérieuse, sans compromis qualité majeurs.
#32 Go VRAM, le palier frontier
→
Les gros MoE enfin en pur VRAM
Avec 32 Go, les gros MoE 2026 tiennent entièrement en VRAM sans offload : Qwen 3.6 35B-A3B (23 Go) à 29-35 tok/s, GLM 4.7 Flash (23 Go) jusqu'à 90-110 tok/s. Il reste même de la marge pour pousser un dense 123B comme Mistral Large en offload léger.
#1. GPU concernés
- RTX 5090
- Seule carte grand public 32 Go en 2026. ~2500 € neuve.
- Apple M3 Ultra / M4 Ultra
- Mémoire unifiée 64-512 Go. Mac Studio à partir de ~5000 €.
- Multi-GPU
- 2× RTX 5070 Ti 16 Go (32 Go total) ou 2× RX 7900 XT 20 Go (40 Go total) avec llama.cpp tensor parallelism.
#2. Modèles compatibles
32 Go VRAM (RTX 5090) — modèles LLM
| Modèle | Quant | VRAM | Tokens/sec |
|---|---|---|---|
| GLM 4.7 Flash | Q5_K_M | 23 Go | 90-110 t/s |
| Qwen 3.6 27B | Q8_0 | 29 Go | 29-35 t/s |
| Granite 4.1 30B Instruct | Q5_K_M | 21 Go | 27-33 t/s |
| DeepSeek-V3 671B | IQ1 | — | ❌ trop gros |
| Mistral Large 123B | Q3_K_M | 55 Go | 10-14 t/s offload |
| Devstral Small 2 24B | Q8_0 | 26 Go | 36-44 t/s |
#3. Mistral Large 123B en offload
Mistral Large 2 (123B) en Q3_K_M (55 Go) avec offload 23 Go en RAM système (DDR5 6400 minimum) tourne à 10-14 tok/s sur RTX 5090. C'est le frontière 2026 accessible localement.
#4. Fine-tuning haut niveau
- QLoRA 70B
- 28-30 Go requis. Tient confortablement sur 32 Go avec batch 1, contexte 4096.
- LoRA classique 24B
- 20-22 Go. Confortable, batch 4.
- Full fine-tuning 7B-8B
- Possible avec batch faible et FlashAttention.
- QLoRA Mistral Large 123B
- Hors de portée même 32 Go (besoin ~50 Go). Multi-GPU requis.
#Questions fréquentes
Quel est le meilleur LLM pour 32 Go de VRAM ?+
Qwen 3.6 35B-A3B (23 Go) est la valeur sûre : MoE rapide qui tient entièrement en VRAM. Pour le code : Qwen3-Coder 30B-A3B, en Q8 (32 Go) pour la pleine qualité. Pour les agents et le raisonnement : GLM 4.7 Flash (MIT) ou Qwen 3.8 27B (à passer en raisonnement « low » pour éviter la sur-réflexion).
32 Go suffit pour Mistral Large 123B ?+
Oui en Q3_K_M (55 Go) avec offload 23 Go en RAM. ~10-14 tok/s. Pour Q4 confortable, il faut 64 Go+ (Mac Studio) ou multi-GPU.
RTX 5090 32 Go ou Mac Studio M4 Ultra 64 Go ?+
Selon usage. RTX 5090 : plus rapide en pure inférence (~130 vs ~55 tok/s sur Qwen 3.5 9B), CUDA mature, prix ~2500 €. Mac Studio Ultra 64 Go : plus de VRAM, fanless, MLX, prix ~5000 €. Pour la pure perf sur les gros MoE et Mistral Large 123B en offload avec budget : 5090. Pour 200B+ : Mac.
Qwen 3.6 35B-A3B sur RTX 5090 — vitesse réelle ?+
29-35 tokens/seconde, et le modèle (23 Go) tient entièrement en VRAM : plus besoin d'offload RAM. Très utilisable pour chat et RAG.
Multi-GPU 2× RTX 5070 Ti vs RTX 5090 ?+
Match intéressant. 2× 5070 Ti = 32 Go total mais split inefficace + latence. RTX 5090 seule = 32 Go unifiés, plus simple, +30 % perf en pratique. Préférez 5090 sauf si vous avez déjà une 5070 Ti.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.