Accueil Catalogue Meilleur LLM local pour RAG en 2026

Meilleur LLM local pour RAG en 2026

Classement mis à jour le 18/08/2026

Classement des LLM les plus adaptés au RAG : fenêtre de contexte longue (≥ 32k tokens pour digérer plusieurs documents), qualité de synthèse sur sources fournies, robustesse aux « distractor » (infos non pertinentes dans le prompt).

Classement

1

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B paramètres · MIT · 128 000 tokens ctx

GLM-4.7-Flash (MoE 31B, ~3B actifs) : le meilleur rapport code/VRAM de la classe 30B. MIT, 128k ctx, très rapide sur 3090/4090.

Pourquoi ce rang Contexte de 128 000 tokens — excellent pour gros corpus. 31B paramètres pour une synthèse de qualité.
ollama run glm-4.7-flash
VRAM Q4
19 GB
35 GB en Q8
2

🇨🇳 Qwen 3.6 27B

Alibaba · 27B paramètres · Apache 2.0 · 262 144 tokens ctx

Dense 27B multimodal sortie 22 avril 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Pourquoi ce rang Contexte de 262 144 tokens — excellent pour gros corpus. 27B paramètres pour une synthèse de qualité.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB en Q8
3

🇨🇳 Qwen 3.8 27B

Alibaba · 27B paramètres · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B : dense multimodal (texte + vision), 262k contexte, ~16 Go VRAM Q4 (18 Go de poids Ollama). Apache 2.0, code agentique et vision.

Pourquoi ce rang Contexte de 262 144 tokens — excellent pour gros corpus. 27B paramètres pour une synthèse de qualité.
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB en Q8
4

🇺🇸 North Mini Code 1.0

Cohere · 30.5B paramètres · Apache 2.0 · 488 000 tokens ctx

Modèle Cohere de 30,5B orienté coding agentic et raisonnement. Contexte 488k, Apache 2.0, ~18 Go VRAM en Q4.

Pourquoi ce rang Contexte de 488 000 tokens — excellent pour gros corpus. 30.5B paramètres pour une synthèse de qualité.
ollama run north-mini-code-1.0
VRAM Q4
18 GB
33 GB en Q8
5

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35B paramètres · Apache 2.0 · 262 000 tokens ctx

MoE 35B/3B actifs agentic-coding. 73.4% SWE-Bench. Sortie 16 avril 2026.

Pourquoi ce rang Contexte de 262 000 tokens — excellent pour gros corpus. 35B paramètres pour une synthèse de qualité.
ollama run qwen3.6:35b-a3b
VRAM Q4
21 GB
38 GB en Q8
6

🇺🇸 Granite 4.1 30B Instruct

IBM · 30B paramètres · Apache 2.0 · 131 072 tokens ctx

Dense 30B Apache 2.0, 12 langues dont FR, 131k ctx, GQA 32Q/8KV. Tool calling OpenAI-compatible. Sortie 29 avril 2026.

Pourquoi ce rang Contexte de 131 072 tokens — excellent pour gros corpus. 30B paramètres pour une synthèse de qualité.
ollama run granite4.1:30b
VRAM Q4
17 GB
32 GB en Q8
7

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B paramètres · NVIDIA Open Model License · 128 000 tokens ctx

MoE 30B/3B actifs : thinking mode + instruct. Médaille d'or IMO 2025 et IOI 2025. Inférence rapide grâce aux 3B actifs, capacités raisonnement de niveau 30B. Sortie avril 2026.

Pourquoi ce rang Contexte de 128 000 tokens — excellent pour gros corpus. 30B paramètres pour une synthèse de qualité.
ollama run nemotron-cascade-2
VRAM Q4
17 GB
32 GB en Q8

Tableau comparatif

Rang Modèle Params VRAM Q4 Contexte Licence
#1 GLM 4.7 Flash 31B 19 GB 128 000 MIT
#2 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#3 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#4 North Mini Code 1.0 30.5B 18 GB 488 000 Apache 2.0
#5 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0
#6 Granite 4.1 30B Instruct 30B 17 GB 131 072 Apache 2.0
#7 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License

Méthodologie du classement

On garde les modèles chat/général avec un contexte d'au moins 32k tokens (requis pour une chunking utile). Le score favorise les modèles récents, à grande fenêtre, et à licence permissive (déploiement en entreprise).

Critères pris en compte :

  • Contexte ≥ 32k tokens
  • Qualité de synthèse
  • Robustesse aux distracteurs
  • Licence libre

Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.

Questions fréquentes

Quelle taille de contexte pour un bon RAG ?

Minimum 32k tokens pour gérer 5-10 chunks de ~2k tokens + prompt. Idéal : 128k tokens (GLM 4.7 Flash en a 128 000), pour encaisser des documents entiers sans chunking agressif.

Quel modèle pour RAG sur 24 GB VRAM (RTX 4090) ?

Mistral Small 3.1 24B en Q4_K_M ou Qwen 2.5 32B en Q4 tiennent dans 24 GB. Pour Llama 3.3 70B il faut descendre en Q2/Q3 ou ajouter une seconde carte.

Quel embedding coupler avec ces LLM ?

Pour du français : BGE-M3, multilingual-e5-large, ou les embeddings Mistral. Voir le guide embeddings FR.

Quel stack RAG local recommandé ?

Ollama (serveur LLM) + ChromaDB ou Qdrant (vector store) + LlamaIndex ou LangChain (orchestration). Voir le guide complet.

Pour aller plus loin