Intermédiaire 14 minAgents

Cline + Ollama : monter un agent de code 100% local dans VS Code

Cline transforme VS Code en agent de code autonome : il lit vos fichiers, propose des diffs, lance des commandes et itère jusqu'à ce que la tâche soit finie. Branché sur Ollama, tout ce travail reste sur votre machine — aucun jeton n'est envoyé à un serveur tiers. Ce guide monte un setup Cline + Ollama complet et fonctionnel : quel modèle choisir selon votre VRAM, la config Ollama qui évite les mauvaises surprises de contexte, et les réglages qui font la différence entre un agent utilisable et un agent qui tourne en rond.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#Pourquoi un agent Cline en local

Cline (anciennement Claude Dev) est une extension VS Code qui pilote un LLM en boucle d'agent : il planifie, édite plusieurs fichiers, exécute des commandes dans le terminal, lit la sortie et corrige. Contrairement à une simple complétion inline, c'est un exécutant qui prend en charge des tâches entières — écrire une fonction, migrer un module, débugger une stack trace.

L'associer à Ollama plutôt qu'à une API cloud a trois intérêts concrets : votre code propriétaire ne quitte jamais le poste, il n'y a aucun coût par jeton (Cline consomme énormément de contexte, ce qui chiffre vite en cloud), et l'agent fonctionne hors ligne. Le prix à payer : un bon modèle de code local exige de la VRAM, et les réglages par défaut d'Ollama ne conviennent pas à un usage agent.

i
Ce guide n'est pas un guide de migration
Si vous venez de Continue.dev et cherchez à récupérer votre config, suivez plutôt notre guide dédié « Continue.dev racheté par Cursor : migrer vers Cline » — il couvre l'export des données et le mapping des réglages. Ici, on part de zéro pour construire un setup Cline + Ollama propre.

#Prérequis

VS Code
Version récente (1.90+). Cline fonctionne aussi dans les forks compatibles Open VSX (VSCodium, Cursor), mais ce guide vise VS Code standard.
Ollama installé
Le daemon doit tourner et écouter sur http://localhost:11434. Si ce n'est pas encore fait, voir notre guide d'installation d'Ollama.
Un GPU avec assez de VRAM
16 Go minimum pour un agent confortable, 24 Go pour le haut du panier. Un CPU pur reste possible mais trop lent pour la boucle d'agent.
Un projet ouvert dans VS Code
Cline agit dans le dossier du workspace courant : ouvrez un vrai dépôt, pas un fichier isolé.

#Choisir le modèle par VRAM

Le choix du modèle prime sur tout le reste : un agent Cline enchaîne appels d'outils, lecture de fichiers et diffs, donc il lui faut un modèle qui suit les instructions et respecte le format des outils. Trois profils couvrent la majorité des cartes en 2026.

24 Go (RTX 4090, 3090, RX 7900 XTX) — Qwen3-Coder 32B
Le meilleur agent local aujourd'hui. En Q4_K_M il occupe ~19 Go, laissant de la marge pour un contexte de 32k. C'est le modèle à viser si votre carte l'encaisse.
16 Go (RTX 4080, 5070 Ti, 4060 Ti 16GB) — Devstral Small 2
Modèle Mistral spécialisé agents de code, taillé pour tenir en 16 Go en Q4_K_M avec un contexte utile. Le meilleur compromis sur cette gamme de cartes.
Généraliste solide — Qwen 3.6 27B
Si vous voulez un seul modèle pour le code et le reste, la variante 27B tient sur 24 Go en Q4 et se débrouille très bien en agent. Un cran en dessous de Qwen3-Coder sur le pur code, mais plus polyvalent.
Repère VRAM en Q4
En quantification Q4_K_M (le défaut recommandé) : un 14B ≈ 9 Go, un 27B ≈ 16-17 Go, un 32B ≈ 19 Go. Ajoutez la VRAM du contexte : plus la fenêtre est grande, plus le KV cache grossit. Gardez toujours 2-3 Go de marge.

Évitez les modèles en dessous de 14B pour un usage agent : ils cassent le format des appels d'outils, bouclent, ou proposent des diffs qui ne s'appliquent pas. Un petit modèle rapide est excellent pour la complétion inline (via Tabby ou Continue), pas pour piloter Cline.

#1. Préparer Ollama

Vérifiez d'abord qu'Ollama tourne, puis tirez le modèle choisi. On prend ici Qwen3-Coder 32B en exemple — remplacez le tag par celui qui correspond à votre VRAM.

Terminal
# Vérifier que le daemon répond
curl http://localhost:11434/api/version

# Tirer le modèle de code (adapter au tag exact affiché sur ollama.com)
ollama pull qwen3-coder:32b

# Alternatives selon la VRAM
ollama pull devstral-small-2   # 16 Go
ollama pull qwen3.6:27b        # généraliste 24 Go

# Lister ce qui est installé
ollama list
!
Vérifiez le tag exact
Les noms de tags Ollama évoluent (suffixes de quantification, versions). Copiez le tag depuis la page officielle du modèle sur ollama.com plutôt que de le deviner : un tag inexistant renvoie une erreur de pull silencieuse.

#2. Régler le contexte Ollama

C'est l'étape que tout le monde rate. Par défaut, Ollama sert les modèles avec une fenêtre de contexte de 4096 tokens. Or Cline envoie le contenu de plusieurs fichiers, l'historique de la tâche et les définitions d'outils : à 4k, l'agent oublie le début de sa propre tâche à chaque tour et devient inutilisable.

Il faut relever num_ctx. La façon propre est de créer un modèle dérivé via un Modelfile, pour que le réglage soit permanent et indépendant de Cline.

Modelfile
# Fichier : Modelfile
FROM qwen3-coder:32b

# Contexte élargi pour l'usage agent (32k)
PARAMETER num_ctx 32768

# Un peu de déterminisme pour le code
PARAMETER temperature 0.2
Terminal
# Créer le modèle dérivé
ollama create qwen3-coder-agent -f Modelfile

# Il apparaît désormais dans la liste
ollama list
!
num_ctx coûte de la VRAM
Passer de 4k à 32k gonfle le KV cache de plusieurs Go. Sur 16 Go, restez à 16k (num_ctx 16384) plutôt que 32k, sinon Ollama fait déborder le modèle en RAM et l'agent rame. Surveillez `ollama ps` : si la colonne PROCESSOR affiche du CPU, réduisez le contexte ou la quantification.

#3. Installer Cline

  1. 01
    Ouvrir le Marketplace
    Dans VS Code, ouvrez le panneau Extensions (Ctrl+Maj+X).
  2. 02
    Chercher Cline
    Tapez « Cline » dans la barre de recherche. L'extension officielle est éditée par « Cline Bot Inc. » — vérifiez l'éditeur pour éviter les clones.
  3. 03
    Installer et épingler
    Cliquez sur Installer. Une icône Cline apparaît dans la barre latérale d'activité ; épinglez-la pour y accéder vite.

#4. Brancher Cline sur Ollama

Cline gère Ollama nativement : pas besoin de bricoler une URL d'API OpenAI-compatible. Ouvrez le panneau Cline, cliquez sur l'icône des réglages, puis configurez le fournisseur.

  1. 01
    API Provider → Ollama
    Dans la liste déroulante « API Provider », sélectionnez « Ollama ».
  2. 02
    Base URL
    Laissez http://localhost:11434 (valeur par défaut). Changez-la seulement si Ollama tourne sur une autre machine ou dans un conteneur.
  3. 03
    Model
    Sélectionnez qwen3-coder-agent (le modèle dérivé créé à l'étape 2), pas le modèle brut à 4k de contexte.
  4. 04
    Vérifier la fenêtre de contexte
    Cline affiche un champ « Context Window ». Alignez-le sur le num_ctx du Modelfile (32768). Un décalage ici fait tronquer les prompts côté Cline avant même Ollama.
i
Plan Mode et Act Mode
Cline distingue le mode Plan (il réfléchit et propose une stratégie sans toucher aux fichiers) et le mode Act (il exécute). Avec un modèle local, commencez en Plan pour valider l'approche : ça évite qu'un modèle un peu faible parte éditer dix fichiers dans la mauvaise direction.

#5. Premier run en mode agent

Ouvrez un vrai projet, puis donnez une tâche concrète et bornée à Cline. Les bons premiers tests sont ceux qui touchent peu de fichiers : ajouter un test, corriger un bug identifié, écrire une petite fonction utilitaire.

Prompt Cline
Ajoute une fonction `slugify(texte)` dans src/utils/strings.js qui met en minuscules, remplace les accents et les espaces par des tirets. Écris aussi un test unitaire dans le fichier de tests existant à côté.

Cline va lire le dossier, proposer un diff, vous demander de valider chaque édition et chaque commande. Approuvez pas à pas la première fois pour comprendre son comportement. Une fois en confiance, vous pouvez activer l'auto-approbation de certaines actions (lecture de fichiers, commandes non destructives) dans les réglages.

Un fichier de règles projet
Ajoutez un fichier `.clinerules` à la racine du dépôt pour cadrer l'agent : conventions de nommage, commande de test à lancer, dossiers à ne jamais toucher. Un modèle local suit mieux quand le cadre est explicite et court.

#Pièges courants

L'agent oublie sa tâche
Presque toujours un problème de contexte : num_ctx trop bas côté Ollama ou Context Window mal réglée côté Cline. Réalignez les deux valeurs.
Les diffs ne s'appliquent pas
Le modèle est trop petit ou trop quantifié pour respecter le format d'édition. Montez d'un cran (14B → 27B/32B) ou passez de Q3 à Q4_K_M.
L'inférence bascule sur CPU
Le modèle + le contexte dépassent la VRAM. Vérifiez `ollama ps` ; réduisez num_ctx ou choisissez un modèle plus petit. Un agent en partie sur CPU devient inutilisable.
Boucles infinies d'outils
Certains modèles relancent la même commande. Passez en Plan Mode d'abord, et coupez la tâche en sous-tâches plus petites.
Connexion refusée
Ollama n'écoute pas, ou pas sur l'URL attendue. Testez `curl http://localhost:11434/api/version`. Dans un conteneur, exposez le port et pointez Cline sur la bonne adresse.

#Pour aller plus loin

Vous avez un agent Cline 100 % local qui édite votre code sans rien exposer. Deux prolongements naturels : peaufiner le choix du modèle et compléter avec l'autocomplétion inline que Cline ne fournit pas.

Kit Copilote Local
Le combo complet pour remplacer GitHub Copilot en local : Cline (chat + agent) pour les tâches, Tabby pour la complétion grisée pendant la frappe, et un modèle de code adapté à votre GPU. Chaque brique reste sur votre machine.
Meilleur LLM local pour coder en 2026
Le comparatif Devstral / Qwen3-Coder et alternatives, avec VRAM et qualité de code — pour affiner le modèle branché sur Cline.
Continue.dev racheté par Cursor : migrer vers Cline
Si vous arrivez de Continue.dev, le guide dédié à l'export et à la migration de votre config vers ce même setup.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Comprendre les compromis qualité/VRAM pour faire tenir le plus gros modèle possible dans votre carte.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.