Intermédiaire 12 minPar VRAM

Quel LLM pour 24 Go de VRAM ?

24 Go de VRAM est le palier sérieux pour LLM en 2026. RTX 3090, 3090 Ti, 4090, RX 7900 XTX : ces cartes font tenir Qwen 3.8 27B (18 Go, 262k ctx, vision) tout en VRAM, un MoE code Qwen3-Coder 30B-A3B (19 Go) très rapide, ou le gros MoE Qwen 3.6 35B-A3B (23 Go) qui rivalise avec les 70B d'hier — plus fine-tuning LoRA 14B-24B et RAG multi-utilisateurs. C'est le minimum pour un usage pro intensif ou power user. Ce guide détaille ce que vous gagnez vs 16 Go.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#24 Go VRAM, le palier sérieux

Le haut de gamme tient enfin en VRAM
En 2026, plus besoin de dégrader un 70B dense : un MoE comme Qwen 3.6 35B-A3B (23 Go en Q4) tient entièrement dans les 24 Go et atteint une qualité proche des anciens 70B, tout en restant rapide grâce à ses 3B de paramètres actifs (marge de contexte serrée). Qwen 3.8 27B (18 Go) laisse davantage de place pour un gros contexte. Le vieux réflexe « offloader un 70B en IQ2 » n'a plus d'intérêt.

#1. GPU concernés

Budget (~750 €)
RTX 3090 occasion. Meilleur rapport 24 Go/€.
Standard (~1100-1800 €)
RX 7900 XTX (1100 € neuf) ou RTX 4090 occasion.
Premium (occasion)
RTX 3090 Ti (~1000 €) — entre 3090 et 4090.

#2. Modèles compatibles

24 Go VRAM — modèles LLM
ModèleQuantVRAMTokens/sec (RTX 4090)
gpt-oss 20BQ4_K_M13 Go117-143 t/s
Devstral Small 2 24BQ4_K_M14 Go36-44 t/s
Qwen 3.8 27BQ4_K_M16 Go20-24 t/s
Mistral Small 24BQ6_K20 Go32 t/s
GLM 4.7 FlashQ4_K_M19 Go90-110 t/s
Qwen 3.6 27BQ5_K_M19 Go29-35 t/s
Granite 4.1 30B InstructQ5_K_M21 Go27-33 t/s
Gemma 4 26B-A4B MoEQ5_K_M19 Go54-66 t/s

#3. Faire tourner un 70B

MoE 35B-A3B (23 Go)
Qwen 3.6 35B-A3B en Q4 tient tout en VRAM, ~55-70 tok/s (RTX 4090), qualité proche d'un 70B dense d'hier. Le vrai choix 2026.
Qwen 3.8 27B (18 Go)
Dense, 262k ctx, vision : la référence généraliste 24 Go, ~29-35 tok/s, avec de la marge pour le contexte.
Vieux 70B dense en IQ2 (21 Go)
Encore techniquement possible (Llama 70B, 2024) mais dégradé à ~85 % et sans intérêt face aux MoE 2026. À éviter.
70B dense en Q3+ (30 Go et plus)
Impose de l'offload RAM et tombe à 3-10 tok/s : réservez ce cas au palier 32 Go.

#4. Fine-tuning

QLoRA 7B-14B
Très confortable. Batch 8 + contexte 4096.
QLoRA 24B
Confortable. Batch 4 + contexte 2048.
QLoRA 70B
Tangent, 22-23 Go requis avec unsloth + batch 1 + contexte court.
LoRA classique 14B
Possible avec batch 2, contexte 2048.

#Questions fréquentes

Quel est le meilleur LLM pour 24 Go de VRAM ?+
Qwen 3.8 27B (18 Go, 262k ctx, vision) pour un généraliste polyvalent, ou le MoE Qwen 3.6 35B-A3B (23 Go) qui approche les 70B d'hier. Pour du code : Qwen3-Coder 30B-A3B (19 Go, MoE) ou l'agent de code Devstral 24B (14 Go). Pour les agents et outils : GLM 4.7 Flash (19 Go, MIT).
24 Go, faut-il encore viser un 70B ?+
Non, ça n'a plus de sens en 2026. Un MoE comme Qwen 3.6 35B-A3B (23 Go) tient entièrement en VRAM et rivalise avec les anciens 70B, sans la dégradation d'un IQ2. Un vrai 70B dense confortable reste réservé au palier 32 Go et plus (RTX 5090).
RTX 3090 ou RTX 4090 pour LLM en 24 Go ?+
4090 : +40 % vitesse, plus silencieuse, ~1000 € plus chère occasion. 3090 : meilleur rapport perf/€. Pour pur LLM, 3090 reste excellent. Si budget atteint 1800 €, 4090 mieux.
Combien de tokens/sec pour un gros MoE 30-35B sur RTX 3090 ?+
Comptez ~35-50 tok/s pour Qwen 3.6 35B-A3B et ~20-25 tok/s pour un dense Qwen 3.8 27B sur RTX 3090. La RTX 4090 ajoute environ +40 %, la RX 7900 XTX est comparable à la 3090.
24 Go suffit pour fine-tuning sérieux ?+
Pour QLoRA 7B-24B : oui largement. Pour LoRA classique 70B ou full fine-tune : non, il faut multi-GPU.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.