🇺🇸 Granite 4.0 H-Tiny 7B-A1B
Hybride 7B/1B actifs. Coût compute extrêmement faible. Edge/embarqué.
ollama run granite4:tiny-h
Classement mis à jour le 19/07/2026
8 GB de VRAM est le palier d'entrée pour l'IA locale — RTX 3060 8GB, 4060, 5060, 3070, 2080, etc. Les modèles 7-9B en Q4_K_M tiennent confortablement. Voici les meilleurs choix pour ce budget VRAM.
Hybride 7B/1B actifs. Coût compute extrêmement faible. Edge/embarqué.
ollama run granite4:tiny-h
Codéveloppé avec NVIDIA. 128k ctx, Tekken tokenizer, fort en multilingue européen.
ollama run mistral-nemo:12b
Sweet spot multimodal. 128k ctx, vision, 140 langues.
ollama run gemma3:12b
VLM entreprise 12.6B. Strong DocVQA/ChartQA. Extraction documents pro.
ollama run nemotron3-v2:12b
Variante dense 12B de Nemotron 3 Super. Compacte et rapide, idéale pour raisonnement et code sur GPU consumer. Mars 2026.
ollama pull nemotron-3-super
LLM souverain francophone, entraîné sur corpus FR.
ollama run lucie:7b
Raisonnement chain-of-thought distillé. Bluffant en maths.
ollama run deepseek-r1:7b
Mode hybride thinking/fast. 119 langues, 32k natif (131k via YaRN).
ollama run qwen3:8b
| Rang | Modèle | Params | VRAM Q4 | Contexte | Licence | Sur RTX 4060 Ti 8GB |
|---|---|---|---|---|---|---|
| #1 | Granite 4.0 H-Tiny 7B-A1B | 7B | 4 GB | 128 000 | Apache 2.0 | 60 tok/s · Q8 |
| #2 | Mistral Nemo 12B Instruct | 12B | 7 GB | 128 000 | Apache 2.0 | 8 tok/s · Q4_K_M |
| #3 | Gemma 3 12B | 12B | 7 GB | 128 000 | Gemma | 7 tok/s · Q4_K_M |
| #4 | Nemotron Nano v2 VL 12B | 12.6B | 8 GB | 128 000 | NVIDIA Open Model License | 7 tok/s · Q4_K_M |
| #5 | Nemotron 3 Super 12B | 12B | 7 GB | 128 000 | NVIDIA Open Model License | 8 tok/s · Q4_K_M |
| #6 | Lucie 7B | 7B | 5 GB | 4 096 | Apache 2.0 | 12 tok/s · Q5_K_M |
| #7 | DeepSeek R1 Distill 7B | 7B | 5 GB | 32 768 | MIT | 12 tok/s · Q5_K_M |
| #8 | Qwen 3 8B | 8B | 5 GB | 131 072 | Apache 2.0 | 12 tok/s · Q5_K_M |
Comparez les prix de RTX 4060 Ti 8GB chez nos marchands partenaires (prix et stock à jour) :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous, ce qui n'influence pas le classement (établi de façon indépendante). En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.
Mémo gratuit
Reçois le mémo VRAM → meilleur modèle de code → commande Ollama (un seul écran, copier-coller). Et passe au kit Copilote Local pour en faire un setup qui marche vraiment.
Le kit Copilote Local — les configs Ollama + Cline + Aider prêtes à coller, Modelfiles réglés, dépannage, espace en ligne à vie →Pas de spam. Désinscription en 1 clic. Tes données restent chez nous (jamais revendues).
Ta carte → le meilleur modèle de code à faire tourner en local, et la commande Ollama exacte :
| Ta VRAM | GPU / Mac typiques | Modèle de code conseillé | Commande Ollama |
|---|---|---|---|
| 8 Go | RTX 4060 / 3060 · M1-M2 16 Go | Qwen2.5-Coder 7B (Q4) | ollama run qwen2.5-coder:7b |
| 12 Go | RTX 4070 / 5070 | Qwen2.5-Coder 14B (Q4) | ollama run qwen2.5-coder:14b |
| 16 Go | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 Go | DeepSeek-Coder-V2-Lite 16B ou Qwen2.5-Coder 14B Q8 | ollama run deepseek-coder-v2:16b |
| 24 Go | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 Go | Qwen2.5-Coder 32B (Q4) — le « proche Copilot » | ollama run qwen2.5-coder:32b |
| 32 Go | RTX 5090 | Qwen2.5-Coder 32B en Q5/Q6 ou Devstral Small 2 (agentique) | ollama run devstral |
| 48 Go+ | Mac M4 Max 64 Go · M2 Ultra 128 Go | Qwen3-Coder 30B-A3B (MoE rapide) ou un 32B en Q8 | ollama run qwen3-coder:30b |
🔌 Pour le brancher dans VS Code : Cline (agent multi-fichiers), Aider (CLI) ou Tabby/Twinny (autocomplétion FIM) — tous se connectent à Ollama en local. Le kit Copilote Local — configs prêtes à coller + setup testé — est dispo : /copilote-local.
Filtre : VRAM Q4 ≤ 8 GB et ≥ 3 GB (on écarte les ultra-petits sous-employés). On garde les 3-9B qui tiennent en Q4_K_M avec marge pour le contexte.
Critères pris en compte :
Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.
Quel LLM en 8 GB pour débuter ?
Granite 4.0 H-Tiny 7B-A1B est le meilleur point d'entrée. Mistral 7B, Llama 3.1 8B et Qwen 2.5 7B sont tous excellents et ne coûtent rien. Commencez par Ollama (ollama run mistral:7b-instruct).
Peut-on faire tourner Gemma 2 9B en 8 GB ?
Q4_K_M seulement (≈ 6 GB modèle + 1-2 GB contexte = ≈ 8 GB). Pas de marge pour un gros contexte. Préférez Mistral 7B si vous voulez du 32k+ tokens confortable.
Quelle quantif en 8 GB ?
Q4_K_M pour un 7-9B. Q5_K_M pour un 3-5B. Q8 uniquement pour un 3B et en-dessous.
RTX 4060 vs RTX 3060 12 GB ?
La 4060 est plus rapide en pur débit (+15-20%), mais elle est limitée à 8 GB — pas de 12B ni de gros contexte. La 3060 12 GB est meilleure pour le LLM malgré son tier inférieur.
Approfondissez avec nos duels détaillés des finalistes :