Débutant 9 minRTX 30
Quel LLM sur RTX 3050 (6 / 8 Go) ?
La RTX 3050 existe en 3 variantes : 8 Go (janvier 2022), 6 Go (février 2024) et mobile. Version bureau 8 Go : GA106, 2 560 CUs, 224 Go/s. Version 6 Go : encore plus cut-down (2 304 CUs, 168 Go/s, TDP 70 W). Pour LLM, elles se situent à l'entrée extrême de gamme — Mistral 7B Q4 passe tout juste sur la 8 Go, difficilement sur la 6 Go. À ~180 € d'occasion, ce n'est pas le meilleur choix LLM budget. Ce guide détaille ce qu'elle peut faire.
#La RTX 3050 en 2026
- Architecture
- Ampere GA106 (8 Go) / GA107 (6 Go).
- VRAM
- 6 Go OU 8 Go GDDR6.
- Bande passante
- 168 Go/s (6 Go) / 224 Go/s (8 Go).
- TDP
- 70 W (6 Go, sans connecteur PCIe !) / 130 W (8 Go).
- Prix 2026
- ~140 € (6 Go) / ~180 € (8 Go) occasion.
#1. 6 Go vs 8 Go
Différences entre les deux variantes
| Critère | RTX 3050 6 Go | RTX 3050 8 Go |
|---|---|---|
| Cœurs CUDA | 2 304 | 2 560 |
| Bande passante | 168 Go/s | 224 Go/s |
| TDP | 70 W | 130 W |
| Alim PCIe | Non (slot only) | Oui (6-pin) |
| Mistral 7B Q4 | 16 t/s | 22 t/s |
#2. Modèles compatibles
RTX 3050 — modèles utilisables
| Modèle | Quant | VRAM | 3050 6 Go | 3050 8 Go |
|---|---|---|---|---|
| Llama 3.2 1B | Q8_0 | 1,4 Go | 80 t/s | 95 t/s |
| Qwen 2.5 3B | Q5_K_M | 2,2 Go | 42 t/s | 52 t/s |
| Llama 3.2 3B | Q8_0 | 3,4 Go | 30 t/s | 38 t/s |
| Mistral 7B | Q4_K_M | 4,4 Go | 16 t/s | 22 t/s |
| Llama 3.1 8B | Q4_K_M | 4,9 Go | ❌ serré | 18 t/s |
#3. Benchmarks
Mesures sur RTX 3050 8 Go : Mistral 7B Q4 = 22 tok/s (correct pour un chat non temps réel), Llama 3.2 3B Q8 = 38 tok/s (fluide), Qwen 2.5 3B Q5 = 52 tok/s (très bon).
#4. Astuces pour 6 Go
- Restez sous 4 Go de modèle
- Mistral 7B Q4 (4,4 Go) + contexte = déborde sur 6 Go. Préférez Qwen 2.5 3B Q5 (2,2 Go) confortable.
- KV cache Q8 obligatoire
- OLLAMA_KV_CACHE_TYPE=q8_0 pour économiser chaque Go.
- Fermez GPU-hungry apps
- Chrome, OBS, jeux — tout ce qui consomme VRAM en arrière-plan.
#Verdict 2026
- Usage limité à 3B confortable
- La 3050 convient pour découvrir les LLM, pas pour un usage sérieux.
- Préférez une 3060 12 Go
- +70 € vs 3050 8 Go mais ouvre tout un autre monde LLM (14B, contexte long, RAG).
- Achat 2026 : seulement si déjà dans le PC
- Ou si budget strict ≤ 150 €. Sinon, un pas de plus vers la 3060.
#Questions fréquentes
La RTX 3050 peut-elle faire tourner un LLM ?+
Oui, pour des petits modèles. Qwen 2.5 3B Q5 à 52 tok/s, Mistral 7B Q4 à 22 tok/s (tangent). Pour du chat occasionnel, utilisable. Pas adapté à un usage pro.
RTX 3050 6 Go ou 8 Go ?+
8 Go si possible — la différence de prix est modeste (~40 €) et la 6 Go est largement cut-down (-10 % CUs, -25 % bande passante, pas d'alim PCIe).
RTX 3050 ou RTX 3060 12 Go ?+
RTX 3060 12 Go sans hésiter. Pour ~70 € de plus, +50 % de VRAM, +60 % de bande passante, accès aux 14B. La 3050 plafonne à Mistral 7B avec qualité dégradée.
La RTX 3050 6 Go peut-elle se passer d'alim PCIe ?+
Oui, elle tire tout du slot PCIe (75 W max). Utile pour réveiller un vieux PC sans alim moderne. Mais ses performances LLM sont faibles.
Combien de tokens/sec pour Mistral 7B sur RTX 3050 8 Go ?+
22 tokens/seconde en Q4_K_M. Correct mais lent vs 3060 12 Go (42 tok/s) ou 5060 (64 tok/s). Perceptible comme « lent » en chat interactif.
Peut-on faire du QLoRA sur RTX 3050 ?+
Uniquement sur 1B-3B. 7B QLoRA impossible (7-8 Go requis minimum, la 3050 en a 6 ou 8, saturée).
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.