🇨🇳 GLM 4.7 Flash
GLM-4.7-Flash (MoE 31B, ~3B actifs) : le meilleur rapport code/VRAM de la classe 30B. MIT, 128k ctx, très rapide sur 3090/4090.
ollama run glm-4.7-flash
Classement mis à jour le 18/08/2026
Classement des LLM les plus adaptés au RAG : fenêtre de contexte longue (≥ 32k tokens pour digérer plusieurs documents), qualité de synthèse sur sources fournies, robustesse aux « distractor » (infos non pertinentes dans le prompt).
GLM-4.7-Flash (MoE 31B, ~3B actifs) : le meilleur rapport code/VRAM de la classe 30B. MIT, 128k ctx, très rapide sur 3090/4090.
ollama run glm-4.7-flash
Dense 27B multimodal sortie 22 avril 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B : dense multimodal (texte + vision), 262k contexte, ~16 Go VRAM Q4 (18 Go de poids Ollama). Apache 2.0, code agentique et vision.
ollama run qwen3.8:27b
Modèle Cohere de 30,5B orienté coding agentic et raisonnement. Contexte 488k, Apache 2.0, ~18 Go VRAM en Q4.
ollama run north-mini-code-1.0
MoE 35B/3B actifs agentic-coding. 73.4% SWE-Bench. Sortie 16 avril 2026.
ollama run qwen3.6:35b-a3b
Dense 30B Apache 2.0, 12 langues dont FR, 131k ctx, GQA 32Q/8KV. Tool calling OpenAI-compatible. Sortie 29 avril 2026.
ollama run granite4.1:30b
MoE 30B/3B actifs : thinking mode + instruct. Médaille d'or IMO 2025 et IOI 2025. Inférence rapide grâce aux 3B actifs, capacités raisonnement de niveau 30B. Sortie avril 2026.
ollama run nemotron-cascade-2
| Rang | Modèle | Params | VRAM Q4 | Contexte | Licence |
|---|---|---|---|---|---|
| #1 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT |
| #2 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #3 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #4 | North Mini Code 1.0 | 30.5B | 18 GB | 488 000 | Apache 2.0 |
| #5 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 |
| #6 | Granite 4.1 30B Instruct | 30B | 17 GB | 131 072 | Apache 2.0 |
| #7 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License |
On garde les modèles chat/général avec un contexte d'au moins 32k tokens (requis pour une chunking utile). Le score favorise les modèles récents, à grande fenêtre, et à licence permissive (déploiement en entreprise).
Critères pris en compte :
Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.
Quelle taille de contexte pour un bon RAG ?
Minimum 32k tokens pour gérer 5-10 chunks de ~2k tokens + prompt. Idéal : 128k tokens (GLM 4.7 Flash en a 128 000), pour encaisser des documents entiers sans chunking agressif.
Quel modèle pour RAG sur 24 GB VRAM (RTX 4090) ?
Mistral Small 3.1 24B en Q4_K_M ou Qwen 2.5 32B en Q4 tiennent dans 24 GB. Pour Llama 3.3 70B il faut descendre en Q2/Q3 ou ajouter une seconde carte.
Quel embedding coupler avec ces LLM ?
Pour du français : BGE-M3, multilingual-e5-large, ou les embeddings Mistral. Voir le guide embeddings FR.
Quel stack RAG local recommandé ?
Ollama (serveur LLM) + ChromaDB ou Qdrant (vector store) + LlamaIndex ou LangChain (orchestration). Voir le guide complet.