Cline + Ollama : monter un agent de code 100% local dans VS Code
Cline transforme VS Code en agent de code autonome : il lit vos fichiers, propose des diffs, lance des commandes et itère jusqu'à ce que la tâche soit finie. Branché sur Ollama, tout ce travail reste sur votre machine — aucun jeton n'est envoyé à un serveur tiers. Ce guide monte un setup Cline + Ollama complet et fonctionnel : quel modèle choisir selon votre VRAM, la config Ollama qui évite les mauvaises surprises de contexte, et les réglages qui font la différence entre un agent utilisable et un agent qui tourne en rond.
#Pourquoi un agent Cline en local
Cline (anciennement Claude Dev) est une extension VS Code qui pilote un LLM en boucle d'agent : il planifie, édite plusieurs fichiers, exécute des commandes dans le terminal, lit la sortie et corrige. Contrairement à une simple complétion inline, c'est un exécutant qui prend en charge des tâches entières — écrire une fonction, migrer un module, débugger une stack trace.
L'associer à Ollama plutôt qu'à une API cloud a trois intérêts concrets : votre code propriétaire ne quitte jamais le poste, il n'y a aucun coût par jeton (Cline consomme énormément de contexte, ce qui chiffre vite en cloud), et l'agent fonctionne hors ligne. Le prix à payer : un bon modèle de code local exige de la VRAM, et les réglages par défaut d'Ollama ne conviennent pas à un usage agent.
#Prérequis
- VS Code
- Version récente (1.90+). Cline fonctionne aussi dans les forks compatibles Open VSX (VSCodium, Cursor), mais ce guide vise VS Code standard.
- Ollama installé
- Le daemon doit tourner et écouter sur http://localhost:11434. Si ce n'est pas encore fait, voir notre guide d'installation d'Ollama.
- Un GPU avec assez de VRAM
- 16 Go minimum pour un agent confortable, 24 Go pour le haut du panier. Un CPU pur reste possible mais trop lent pour la boucle d'agent.
- Un projet ouvert dans VS Code
- Cline agit dans le dossier du workspace courant : ouvrez un vrai dépôt, pas un fichier isolé.
#Choisir le modèle par VRAM
Le choix du modèle prime sur tout le reste : un agent Cline enchaîne appels d'outils, lecture de fichiers et diffs, donc il lui faut un modèle qui suit les instructions et respecte le format des outils. Trois profils couvrent la majorité des cartes en 2026.
- 24 Go (RTX 4090, 3090, RX 7900 XTX) — Qwen3-Coder 32B
- Le meilleur agent local aujourd'hui. En Q4_K_M il occupe ~19 Go, laissant de la marge pour un contexte de 32k. C'est le modèle à viser si votre carte l'encaisse.
- 16 Go (RTX 4080, 5070 Ti, 4060 Ti 16GB) — Devstral Small 2
- Modèle Mistral spécialisé agents de code, taillé pour tenir en 16 Go en Q4_K_M avec un contexte utile. Le meilleur compromis sur cette gamme de cartes.
- Généraliste solide — Qwen 3.6 27B
- Si vous voulez un seul modèle pour le code et le reste, la variante 27B tient sur 24 Go en Q4 et se débrouille très bien en agent. Un cran en dessous de Qwen3-Coder sur le pur code, mais plus polyvalent.
Évitez les modèles en dessous de 14B pour un usage agent : ils cassent le format des appels d'outils, bouclent, ou proposent des diffs qui ne s'appliquent pas. Un petit modèle rapide est excellent pour la complétion inline (via Tabby ou Continue), pas pour piloter Cline.
#1. Préparer Ollama
Vérifiez d'abord qu'Ollama tourne, puis tirez le modèle choisi. On prend ici Qwen3-Coder 32B en exemple — remplacez le tag par celui qui correspond à votre VRAM.
#2. Régler le contexte Ollama
C'est l'étape que tout le monde rate. Par défaut, Ollama sert les modèles avec une fenêtre de contexte de 4096 tokens. Or Cline envoie le contenu de plusieurs fichiers, l'historique de la tâche et les définitions d'outils : à 4k, l'agent oublie le début de sa propre tâche à chaque tour et devient inutilisable.
Il faut relever num_ctx. La façon propre est de créer un modèle dérivé via un Modelfile, pour que le réglage soit permanent et indépendant de Cline.
#3. Installer Cline
- 01Ouvrir le MarketplaceDans VS Code, ouvrez le panneau Extensions (Ctrl+Maj+X).
- 02Chercher ClineTapez « Cline » dans la barre de recherche. L'extension officielle est éditée par « Cline Bot Inc. » — vérifiez l'éditeur pour éviter les clones.
- 03Installer et épinglerCliquez sur Installer. Une icône Cline apparaît dans la barre latérale d'activité ; épinglez-la pour y accéder vite.
#4. Brancher Cline sur Ollama
Cline gère Ollama nativement : pas besoin de bricoler une URL d'API OpenAI-compatible. Ouvrez le panneau Cline, cliquez sur l'icône des réglages, puis configurez le fournisseur.
- 01API Provider → OllamaDans la liste déroulante « API Provider », sélectionnez « Ollama ».
- 02Base URLLaissez http://localhost:11434 (valeur par défaut). Changez-la seulement si Ollama tourne sur une autre machine ou dans un conteneur.
- 03ModelSélectionnez qwen3-coder-agent (le modèle dérivé créé à l'étape 2), pas le modèle brut à 4k de contexte.
- 04Vérifier la fenêtre de contexteCline affiche un champ « Context Window ». Alignez-le sur le num_ctx du Modelfile (32768). Un décalage ici fait tronquer les prompts côté Cline avant même Ollama.
#5. Premier run en mode agent
Ouvrez un vrai projet, puis donnez une tâche concrète et bornée à Cline. Les bons premiers tests sont ceux qui touchent peu de fichiers : ajouter un test, corriger un bug identifié, écrire une petite fonction utilitaire.
Cline va lire le dossier, proposer un diff, vous demander de valider chaque édition et chaque commande. Approuvez pas à pas la première fois pour comprendre son comportement. Une fois en confiance, vous pouvez activer l'auto-approbation de certaines actions (lecture de fichiers, commandes non destructives) dans les réglages.
#Pièges courants
- L'agent oublie sa tâche
- Presque toujours un problème de contexte : num_ctx trop bas côté Ollama ou Context Window mal réglée côté Cline. Réalignez les deux valeurs.
- Les diffs ne s'appliquent pas
- Le modèle est trop petit ou trop quantifié pour respecter le format d'édition. Montez d'un cran (14B → 27B/32B) ou passez de Q3 à Q4_K_M.
- L'inférence bascule sur CPU
- Le modèle + le contexte dépassent la VRAM. Vérifiez `ollama ps` ; réduisez num_ctx ou choisissez un modèle plus petit. Un agent en partie sur CPU devient inutilisable.
- Boucles infinies d'outils
- Certains modèles relancent la même commande. Passez en Plan Mode d'abord, et coupez la tâche en sous-tâches plus petites.
- Connexion refusée
- Ollama n'écoute pas, ou pas sur l'URL attendue. Testez `curl http://localhost:11434/api/version`. Dans un conteneur, exposez le port et pointez Cline sur la bonne adresse.
#Pour aller plus loin
Vous avez un agent Cline 100 % local qui édite votre code sans rien exposer. Deux prolongements naturels : peaufiner le choix du modèle et compléter avec l'autocomplétion inline que Cline ne fournit pas.
- Meilleur LLM local pour coder en 2026
- Le comparatif Devstral / Qwen3-Coder et alternatives, avec VRAM et qualité de code — pour affiner le modèle branché sur Cline.
- Continue.dev racheté par Cursor : migrer vers Cline
- Si vous arrivez de Continue.dev, le guide dédié à l'export et à la migration de votre config vers ce même setup.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Comprendre les compromis qualité/VRAM pour faire tenir le plus gros modèle possible dans votre carte.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.