Tout savoir sur Granite Guardian d'IBM pour la conformité IA
Granite Guardian est le classifieur de sécurité d'IBM : un petit modèle dont le seul travail est de lire une entrée ou une sortie de LLM et de répondre « risqué » ou « sûr ». La version 4.1 (avril 2026, licence Apache 2.0) tourne entièrement en local via Ollama et couvre les risques propres aux agents — jailbreaks, appels d'outils hallucinés, réponses RAG non fondées. Ce guide montre comment l'installer, l'appeler et le brancher devant vos agents locaux, sans jamais envoyer un prompt vers le cloud.
#Pourquoi un garde-fou local pour vos agents
Un LLM qui répond à un chat est facile à surveiller : vous lisez la réponse. Un agent, lui, enchaîne des appels d'outils, lit des documents RAG et prend des décisions sans que personne relise chaque étape. C'est exactement là que les incidents arrivent : un prompt injecté dans un document déclenche une action non voulue, un tool-call est inventé de toutes pièces, une réponse « factuelle » est en réalité hallucinée. Vous avez besoin d'un composant qui inspecte ce flux en continu.
Le réflexe habituel est d'appeler une API de modération cloud (OpenAI Moderation, Azure Content Safety). Problème : vous avez justement choisi le local pour que vos prompts et vos données ne sortent pas. Envoyer chaque message à un service de modération distant annule tout le bénéfice de confidentialité. Granite Guardian résout ce paradoxe — c'est un garde-fou qui tourne à côté de vos modèles, sur la même machine.
#Granite Guardian, c'est quoi exactement
Granite Guardian appartient à la famille Granite d'IBM. C'est un classifieur de sécurité entraîné pour repérer des contenus problématiques dans les entrées et sorties de LLM. La version 4.1 (avril 2026) est publiée sous licence Apache 2.0, ce qui autorise l'usage commercial et la modification sans redevance — un point clé pour un déploiement en entreprise.
- Rôle
- Détecteur, pas générateur. Il reçoit un texte et renvoie un signal de risque (yes/no + score de probabilité).
- Tailles
- Une variante compacte (~2B) pour la latence, une variante plus large (~8B) pour la finesse. La 2B suffit pour la majorité des garde-fous en ligne.
- Licence
- Apache 2.0 — usage commercial, redistribution et fine-tuning autorisés.
- Spécialité 4.1
- Risques agentiques : détection d'appels d'outils hallucinés et vérification que les réponses RAG sont bien fondées sur le contexte fourni.
- Format
- Un prompt structuré désigne le type de risque à évaluer ; le modèle répond par un verdict que vous parsez.
#Les risques que Granite Guardian détecte
Le modèle couvre deux grandes familles. D'abord les risques « classiques » de contenu, ensuite les risques propres aux systèmes agentiques et RAG — c'est là que la 4.1 se démarque.
- Jailbreak / injection
- Tentatives de contourner les consignes système, y compris les injections cachées dans un document ou une page web lue par l'agent.
- Contenu nuisible
- Violence, contenu sexuel, incitation à des actes dangereux, discours haineux — sur l'entrée comme sur la sortie.
- Groundedness (RAG)
- La réponse est-elle réellement appuyée par les documents récupérés, ou le modèle a-t-il inventé ? Détecte l'hallucination RAG.
- Pertinence du contexte
- Les passages récupérés sont-ils vraiment liés à la question ? Un contexte hors-sujet est un signal de dérive du retriever.
- Function calling hallucination
- L'agent invoque-t-il un outil qui n'existe pas, ou avec des arguments incohérents par rapport à ce que l'utilisateur a demandé ?
#Prérequis
Granite Guardian tourne à côté de votre modèle principal, il faut donc prévoir sa VRAM en plus de celle de l'agent. La bonne nouvelle : la variante 2B est légère.
- Ollama installé
- Le daemon écoute par défaut sur http://localhost:11434. Voir le guide d'installation Ollama si ce n'est pas encore fait.
- VRAM (Guardian 2B, Q4_K_M)
- ≈ 2 Go. Il vient s'ajouter à votre modèle agent. Une RTX 3060 12GB absorbe sans peine un 7B + le Guardian.
- VRAM (Guardian 8B, Q4_K_M)
- ≈ 5 Go, si vous voulez la variante la plus fine et avez la marge (RTX 4080 16GB, M4 Pro).
- Quantization
- Q4_K_M recommandé pour l'équilibre latence/qualité. Q8_0 si vous avez de la marge et voulez limiter la perte sur la décision de risque.
#Installer le modèle
- 01Vérifier qu'Ollama tourneUn `ollama list` doit répondre sans erreur. Sinon, démarrez le daemon (`ollama serve` sous Linux, ou l'application sous Windows/macOS).
- 02Récupérer le tag officielCherchez « granite-guardian » sur ollama.com/library et notez le tag exact de la variante 2B. Les noms de tags changent d'une version à l'autre, ne les devinez pas.
- 03Télécharger le modèleUn simple `ollama pull` récupère le poids GGUF quantifié. Comptez 1 à 2 Go de téléchargement pour la 2B.
- 04ConfirmerRelancez `ollama list` : le modèle doit apparaître avec sa taille. Vous êtes prêt à l'interroger.
#Premier appel garde-fou
Le principe : vous soumettez au Guardian le texte à évaluer, en précisant le type de risque. Le modèle renvoie un verdict que vous interprétez. Le plus simple est de passer par l'API OpenAI-compatible d'Ollama, sur le même endpoint local.
#Protéger un agent : tool-calls et RAG
L'intérêt réel de la 4.1 apparaît quand vous encadrez un agent. On place le Guardian à trois endroits : avant que l'agent ne reçoive l'entrée (jailbreak/injection), après une récupération RAG (groundedness), et avant d'exécuter un tool-call (hallucination de fonction).
- 01Filtrer l'entréeChaque message utilisateur — et chaque document externe lu par l'agent — passe d'abord par le Guardian en mode jailbreak/injection. Un document web piégé est intercepté avant d'atteindre le modèle principal.
- 02Vérifier le grounding RAGAprès récupération des passages, soumettez au Guardian la question, les passages et la réponse candidate en mode groundedness. S'il juge la réponse non fondée, vous la refusez ou déclenchez une nouvelle récupération.
- 03Valider le tool-callAvant d'exécuter un appel d'outil, faites évaluer la cohérence entre la demande utilisateur et l'outil invoqué. Un appel halluciné (outil inexistant, arguments incohérents) est bloqué avant tout effet de bord.
#Cas d'usage RGPD et conformité
Placer la modération en local n'est pas qu'un confort technique : c'est un argument de conformité. Sous RGPD et AI Act, chaque transfert de donnée personnelle vers un service tiers doit être justifié, encadré et documenté. Un garde-fou cloud vous obligerait à faire transiter des prompts — potentiellement remplis de données personnelles — vers un sous-traitant supplémentaire.
- Zéro transfert
- Le texte évalué ne quitte jamais votre infrastructure. Pas de sous-traitant de modération à inscrire au registre des traitements ni à encadrer par un DPA.
- Traçabilité
- Vous journalisez localement chaque verdict (risque détecté, type, score). Utile pour démontrer une supervision effective au titre de l'AI Act sur les systèmes à risque.
- Minimisation
- Le Guardian bloque en amont les entrées piégées susceptibles d'exfiltrer des données via l'agent, ce qui réduit la surface d'incident.
- Souveraineté
- Modèle Apache 2.0 exécuté sur du matériel que vous maîtrisez : pas de dépendance à la disponibilité ou aux conditions d'un fournisseur externe.
#Dépannage & astuces
- Verdict toujours identique
- Si tout renvoie « no », vérifiez que le type de risque est bien passé (rôle system) et que le tag du modèle est le bon. Un modèle générique ne fera pas le travail d'un Guardian.
- Latence trop élevée
- Passez de la 8B à la 2B, quantifiez en Q4_K_M, et gardez le modèle chargé (keep-alive Ollama) pour éviter le rechargement à chaque appel.
- Parsing fragile
- Ne présumez pas du format. Loggez la sortie brute quelques jours en pré-prod, puis écrivez un parsing tolérant (minuscules, trim, préfixe).
- Deux modèles en VRAM
- Guardian + agent doivent tenir ensemble. Sur une carte 12 Go, restez sur un agent 7B Q4 + Guardian 2B Q4 (~7 Go cumulés).
- Faux positifs gênants
- Ajustez le type de risque évalué à votre usage réel plutôt que d'activer tous les détecteurs. Un garde-fou trop zélé finit désactivé par les équipes.
#Pour aller plus loin
Granite Guardian s'inscrit dans une démarche plus large de confidentialité et de conformité en local. Trois guides pour compléter le tableau : la checklist confidentialité pour vérifier que rien ne fuit de votre machine, le guide LLM local et RGPD pour le cadre légal complet, et le guide IA locale en entreprise pour l'organisation d'un déploiement conforme.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.