MCP : c'est quoi ? Le Model Context Protocol expliqué
MCP, pour Model Context Protocol, est un standard ouvert qui permet à une application d'IA d'utiliser des outils et des données extérieurs : lire un fichier, interroger une base, chercher sur le web. Anthropic l'a publié en novembre 2024 ; OpenAI, Google et Microsoft l'ont adopté en 2025. Au 20 septembre 2026, c'est la façon normale de brancher un assistant sur le reste de votre système, y compris avec un modèle qui tourne chez vous. Cette page explique le principe, le vocabulaire, et ce que MCP coûte réellement sur du matériel local.
#MCP en un paragraphe
Un modèle de langage, seul, ne sait produire que du texte à partir de ce qu'il a appris et de ce que contient le prompt. Pour consulter votre agenda, interroger la base de l'entreprise ou ouvrir un document, il lui faut un pont vers l'extérieur. Avant MCP, chaque application construisait ses propres ponts : un format de plugin par assistant, un autre par éditeur de code, un autre par framework d'agents. MCP remplace tout cela par une seule spécification. L'auteur d'un outil écrit un serveur MCP, et toute application compatible peut s'en servir. L'image habituelle est celle de l'USB-C : un connecteur, beaucoup d'appareils.
En décembre 2025, Anthropic a confié le protocole à l'Agentic AI Foundation, hébergée par la Linux Foundation. MCP n'appartient donc plus à un éditeur, ce qui explique en partie la vitesse de son adoption.
- La spécification officielle du Model Context Protocol
- L'annonce d'origine par Anthropic (novembre 2024)
#Hôte, client, serveur : qui fait quoi
Ce guide t'amène au modèle. Le kit t'amène au copilote qui code dans ton éditeur.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
| Élément | Ce que c'est | Exemples |
|---|---|---|
| Hôte | L'application d'IA à laquelle vous parlez | Claude Desktop, un assistant d'éditeur de code, Open WebUI, LM Studio |
| Client | Le connecteur interne à l'hôte, un par serveur connecté | Intégré à l'hôte, invisible pour l'utilisateur |
| Serveur | Un petit programme qui expose des capacités au format MCP | Système de fichiers, GitHub, PostgreSQL, recherche web, votre API interne |
Les messages échangés sont du JSON-RPC 2.0. Au démarrage, chaque client demande à son serveur ce qu'il sait faire. Le serveur répond par une liste de capacités, chacune avec un nom, une description en langage courant et un schéma JSON décrivant ses paramètres. L'hôte transmet ces descriptions au modèle. Quand le modèle estime qu'un outil serait utile, il produit un appel structuré ; le client le transmet au serveur, qui l'exécute et renvoie le résultat dans la conversation.
#Ce qu'un serveur MCP peut proposer
| Primitive | Pilotée par | Rôle | Exemple |
|---|---|---|---|
| Outils (tools) | Le modèle | Actions et recherches en direct | creer_ticket, executer_requete, chercher_web |
| Ressources (resources) | L'application | Données en lecture à charger en contexte | Un fichier, un schéma de base, une page de wiki |
| Prompts | L'utilisateur | Modèles de consignes réutilisables | « Relire cette pull request », avec paramètres |
Dans la pratique, la plupart des serveurs ne proposent que des outils, et c'est ce que l'on entend couramment par « MCP ». Le protocole prévoit aussi des fonctions dans l'autre sens, comme le sampling, où un serveur demande à l'hôte de faire générer du texte par son modèle.
#Local ou distant : les deux transports
- stdio
- L'hôte lance le serveur comme un sous-processus local et lui parle par l'entrée et la sortie standard. Rien ne passe par le réseau. C'est le mode de la plupart des installations de bureau, et le choix naturel pour une configuration privée.
- Streamable HTTP
- Le serveur tourne comme un service web, éventuellement sur une autre machine, avec une authentification classique. Ce transport a remplacé l'ancien couple HTTP et SSE dans les révisions 2025 de la spécification.
#MCP, function calling, API : les différences
| Ce que c'est | Qui le définit | |
|---|---|---|
| API REST | La façon dont un service expose ses fonctions aux programmes | Chaque service, à sa manière |
| Function calling | La capacité, acquise à l'entraînement, de produire un appel structuré plutôt que du texte | Chaque éditeur de modèle, avec des formats proches mais distincts |
| MCP | Une façon standard de découvrir, décrire et invoquer des outils d'une application à l'autre | Une seule spécification ouverte |
MCP ne remplace pas le function calling, il s'appuie dessus. Le modèle doit toujours savoir produire un appel d'outil correct. MCP normalise tout ce qui entoure ce moment : comment les outils sont listés, décrits, autorisés et exécutés. Un serveur MCP est très souvent une fine couche posée sur une API existante.
#MCP avec un modèle local : le vrai coût
MCP est indifférent au modèle. Avec un hôte compatible et un modèle local entraîné à l'appel d'outils, toute la boucle tourne sur votre machine. Deux contraintes pèsent alors bien plus lourd que dans le cloud.
Première contrainte : les descriptions d'outils consomment du contexte, et le contexte consomme de la VRAM. Chaque outil connecté injecte son nom, sa description et son schéma dans le prompt, à chaque tour. Comptez 100 à 300 tokens par outil, et 10 à 30 outils par serveur populaire. Avec quelques serveurs, plusieurs milliers de tokens sont dépensés avant que vous ayez tapé un mot. Chez un fournisseur cloud, c'est une ligne sur la facture. Sur votre GPU, c'est du cache KV prélevé sur une VRAM qui ne s'agrandit pas.
| Configuration | Tokens de définitions | Cache KV, Qwen 3 8B | Cache KV, Qwen 3 32B |
|---|---|---|---|
| 1 serveur, 8 outils | ≈ 1 600 | ≈ 0,2 Go | ≈ 0,4 Go |
| 3 serveurs, 30 outils | ≈ 6 000 | ≈ 0,9 Go | ≈ 1,6 Go |
| 6 serveurs, 80 outils | ≈ 16 000 | ≈ 2,4 Go | ≈ 4,2 Go |
Sur une carte de 16 Go qui fait tourner un modèle de 13 Go, 2,4 Go de descriptions d'outils font la différence entre une session qui fonctionne et une erreur de mémoire. La règle pratique en local : ne connectez que les serveurs utiles à la tâche du moment, et préférez ceux qui exposent quelques outils bien décrits à ceux qui publient toute leur API.
Seconde contrainte : les petits modèles choisissent moins bien. Sélectionner le bon outil parmi trente et remplir correctement son schéma est une compétence qui dépend de la taille et de l'entraînement. En dessous de 8 milliards de paramètres environ, les erreurs d'outil et les paramètres inventés deviennent fréquents.
- Le tutoriel : connecter des serveurs MCP à Ollama
- MCP et plugins dans LM Studio
- Les meilleurs LLM locaux pour les agents et l'appel d'outils
- Réduire le coût du contexte : quantifier le cache KV
#Sécurité : ce que les tutoriels oublient
Un serveur MCP est un programme qui tourne avec vos droits, alimenté par du texte qu'un modèle a produit. Trois risques méritent d'être compris avant d'installer quoi que ce soit.
- Injection de prompt
- Si un outil renvoie du contenu venu de l'extérieur (une page web, un e-mail, un commentaire), ce contenu peut contenir des instructions destinées au modèle. Un modèle qui lit du texte non fiable et peut agir est une cible.
- Empoisonnement d'outil
- Un serveur malveillant peut cacher des instructions dans la description de ses propres outils, que le modèle lit et que l'utilisateur ne voit généralement jamais.
- Permissions trop larges
- Un serveur de fichiers pointé sur votre dossier personnel donne au modèle votre dossier personnel.
Les parades sont sans éclat : installer des serveurs de source connue, limiter chacun au périmètre le plus étroit possible, garder la demande de confirmation pour tout ce qui écrit ou envoie, et éviter de mélanger, dans une même session, accès à des données privées et lecture de contenu non fiable.
#En avez-vous besoin ?
| Votre situation | Verdict |
|---|---|
| Vous discutez avec un modèle et collez ce dont il a besoin | Non. MCP ajoute des pièces mobiles dont vous ne vous servirez pas. |
| Vous voulez que l'assistant lise des fichiers, interroge une base ou cherche sur le web | Oui. C'est la façon standard de le faire en 2026. |
| Vous développez un outil interne utilisable depuis n'importe quelle application d'IA | Oui. Un serveur MCP plutôt qu'une intégration par application. |
| Vous faites tourner un petit modèle sur 8 Go de VRAM | Avec prudence : un ou deux serveurs légers au plus. |
Exemple concret : le catalogue QuelLLM est lui-même disponible via un serveur MCP open source. Un assistant qui y est connecté répond à « quel modèle tient sur une carte de 16 Go » à partir des données à jour, et non de sa mémoire.
- L'API publique et le serveur MCP de QuelLLM
- Le kit Agents locaux : monter un agent avec outils de bout en bout
#FAQ
Que signifie MCP ?+
C'est quoi un serveur MCP ?+
MCP est-il réservé à Claude ?+
MCP fonctionne-t-il avec Ollama ou LM Studio ?+
MCP est-il dangereux ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.