Accueil Catalogue Meilleur LLM local pour agents / tool-use en 2026

Meilleur LLM local pour agents / tool-use en 2026

Classement mis à jour le 18/08/2026

Classement des LLM les plus fiables pour bâtir des agents autonomes en local : précision du function calling, robustesse multi-tours, compréhension des schémas JSON, contexte suffisant pour maintenir un plan d'action.

Classement

1

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B paramètres · MIT · 128 000 tokens ctx

GLM-4.7-Flash (MoE 31B, ~3B actifs) : le meilleur rapport code/VRAM de la classe 30B. MIT, 128k ctx, très rapide sur 3090/4090.

Pourquoi ce rang Function calling fiable, 128 000 tokens de contexte pour garder l'historique d'actions. Capacité de raisonnement en bonus.
ollama run glm-4.7-flash
VRAM Q4
19 GB
35 GB en Q8
2

🇨🇳 Qwen 3.6 27B

Alibaba · 27B paramètres · Apache 2.0 · 262 144 tokens ctx

Dense 27B multimodal sortie 22 avril 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Pourquoi ce rang Function calling fiable, 262 144 tokens de contexte pour garder l'historique d'actions. Capacité de raisonnement en bonus.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB en Q8
3

🇨🇳 Qwen 3.8 27B

Alibaba · 27B paramètres · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B : dense multimodal (texte + vision), 262k contexte, ~16 Go VRAM Q4 (18 Go de poids Ollama). Apache 2.0, code agentique et vision.

Pourquoi ce rang Function calling fiable, 262 144 tokens de contexte pour garder l'historique d'actions. Capacité de raisonnement en bonus.
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB en Q8
4

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B paramètres · NVIDIA Open Model License · 128 000 tokens ctx

MoE 30B/3B actifs : thinking mode + instruct. Médaille d'or IMO 2025 et IOI 2025. Inférence rapide grâce aux 3B actifs, capacités raisonnement de niveau 30B. Sortie avril 2026.

Pourquoi ce rang Function calling fiable, 128 000 tokens de contexte pour garder l'historique d'actions. Capacité de raisonnement en bonus.
ollama run nemotron-cascade-2
VRAM Q4
17 GB
32 GB en Q8
5

🇺🇸 North Mini Code 1.0

Cohere · 30.5B paramètres · Apache 2.0 · 488 000 tokens ctx

Modèle Cohere de 30,5B orienté coding agentic et raisonnement. Contexte 488k, Apache 2.0, ~18 Go VRAM en Q4.

Pourquoi ce rang Function calling fiable, 488 000 tokens de contexte pour garder l'historique d'actions. Capacité de raisonnement en bonus.
ollama run north-mini-code-1.0
VRAM Q4
18 GB
33 GB en Q8
6

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35B paramètres · Apache 2.0 · 262 000 tokens ctx

MoE 35B/3B actifs agentic-coding. 73.4% SWE-Bench. Sortie 16 avril 2026.

Pourquoi ce rang Function calling fiable, 262 000 tokens de contexte pour garder l'historique d'actions. Capacité de raisonnement en bonus.
ollama run qwen3.6:35b-a3b
VRAM Q4
21 GB
38 GB en Q8
7

🇨🇳 Qwen 3 30B-A3B

Alibaba · 30B paramètres · Apache 2.0 · 131 072 tokens ctx

MoE 30B/3B actifs hybrid thinking. MMLU 81.4, AIME24 80.4. 100+ langues.

Pourquoi ce rang Function calling fiable, 131 072 tokens de contexte pour garder l'historique d'actions. Capacité de raisonnement en bonus.
ollama run qwen3:30b-a3b
VRAM Q4
19 GB
35 GB en Q8

Tableau comparatif

Rang Modèle Params VRAM Q4 Contexte Licence
#1 GLM 4.7 Flash 31B 19 GB 128 000 MIT
#2 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#3 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#4 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License
#5 North Mini Code 1.0 30.5B 18 GB 488 000 Apache 2.0
#6 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0
#7 Qwen 3 30B-A3B 30B 19 GB 131 072 Apache 2.0

Méthodologie du classement

On privilégie les modèles ≥ 7B avec contexte ≥ 32k (pour maintenir un historique d'actions) et un tag chat ou reasoning. Le score favorise les modèles récents et les tailles moyennes à grandes (où le function calling devient fiable).

Critères pris en compte :

  • Function calling précis
  • Contexte ≥ 32k tokens
  • Fiabilité multi-tours
  • Format JSON respecté

Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.

Questions fréquentes

Quel LLM pour un agent autonome en local ?

GLM 4.7 Flash est notre #1. Mistral Small 3.1 est particulièrement réputé pour sa fiabilité en tool-use et sa latence faible — critique pour un agent qui fait 20+ appels par tâche.

Ollama supporte-t-il le function calling ?

Oui depuis la 0.3.0 via le paramètre tools. LM Studio et vLLM aussi. Assurez-vous que le modèle a été entraîné pour (les Mistral, Qwen, Llama récents le sont).

Quel framework pour bâtir un agent local ?

LangGraph, CrewAI, AutoGen, Smolagents — tous pointables sur un Ollama local via l'endpoint OpenAI-compatible (http://localhost:11434/v1).

Quelle différence entre reasoning et agents ?

Un modèle reasoning (DeepSeek R1, QwQ) déroule une chaîne de pensée avant de répondre. Un modèle agent (Mistral Small, Qwen) choisit et appelle des outils externes. Les deux peuvent se combiner : reasoning pour planifier, agent pour exécuter.

Pour aller plus loin