Intermédiaire 10 minIBM

Granite 4 d'IBM en local : installation et cas d'usage

IBM développe discrètement l'une des familles de LLM open-weight les plus intéressantes pour l'entreprise : Granite. Ce guide montre comment installer Granite 4 en local avec Ollama, explique l'architecture hybride Mamba qui divise la mémoire nécessaire, détaille la licence Apache 2.0 sans clause piège, et cible les usages — RAG, function calling, tâches métier — où Granite se démarque vraiment des modèles grand public.

Par Clara M.·Màj 2026-07-30·Testé sur Windows, macOS, Linux

#Pourquoi Granite 4 plutôt qu'un autre modèle

Granite n'est pas conçu pour gagner les classements de chatbots. IBM cible un objectif différent : des modèles fiables, économes en mémoire et juridiquement propres, faits pour être intégrés dans des applications d'entreprise. On ne choisit pas Granite pour discuter de philosophie, mais pour brancher un modèle sur une base documentaire, lui faire appeler des outils, ou l'exécuter à moindre coût sur du matériel modeste.

Trois choses distinguent Granite 4 du reste de l'open-weight. D'abord une architecture hybride Mamba qui réduit fortement la mémoire consommée, surtout en long contexte. Ensuite une licence Apache 2.0 stricte, sans les restrictions d'usage qu'imposent Llama ou Gemma. Enfin un travail de traçabilité et de gouvernance — modèles signés, données d'entraînement documentées, certification ISO 42001 — que les DSI et les services juridiques savent apprécier. C'est un modèle pensé pour passer une revue de conformité, pas seulement un benchmark.

i
Granite vise l'intégration, pas la conversation
Si vous cherchez le meilleur assistant généraliste en français, Qwen3 ou Mistral resteront souvent devant. Granite brille quand il devient un composant : moteur de RAG, orchestrateur d'outils, extracteur de données structurées dans un pipeline.

#L'architecture hybride Mamba et son gain mémoire

Le vrai argument technique de Granite 4, c'est son architecture. Un transformeur classique repose entièrement sur l'attention : à chaque nouveau token, le modèle relit tout le contexte, et il stocke un « KV cache » qui grossit linéairement avec la longueur de la conversation. Plus le contexte est long, plus la VRAM explose et plus l'inférence ralentit. C'est la limite bien connue des gros contextes en local.

Mamba appartient à une autre famille : les modèles à espace d'états (state space models). Au lieu de tout relire, une couche Mamba maintient un état récurrent de taille fixe qui résume le passé. Conséquence : la mémoire ne grandit pas avec la longueur du contexte, et le débit reste stable même sur des documents très longs. Le défaut de Mamba seul, c'est un rappel moins précis des détails éloignés.

Granite 4 combine les deux. La majorité des blocs sont des couches Mamba-2 (économes), entrecoupées d'une minorité de blocs d'attention (précis) — un ratio d'environ neuf couches Mamba pour une couche d'attention. On garde ainsi l'essentiel du gain mémoire tout en conservant la capacité de l'attention à retrouver un détail exact. En pratique, Granite 4 tourne dans nettement moins de RAM/VRAM qu'un transformeur de taille comparable, surtout dès que le contexte dépasse quelques milliers de tokens.

Le gain est maximal en long contexte
Sur un prompt court, la différence avec un transformeur classique est modeste. Mais chargez un gros document ou une longue conversation et l'écart se creuse : là où un modèle classique sature votre carte, Granite garde une empreinte mémoire quasi plate.

#Micro, Tiny et Small : quelle variante choisir

Granite 4 se décline en plusieurs tailles, avec des suffixes qui indiquent la cible matérielle. Les versions marquées « H » utilisent l'architecture hybride ; une version non hybride est fournie pour les environnements qui ne supportent pas encore Mamba.

Granite 4 Micro (~3B, dense)
Le plus petit, dense et hybride. Idéal sur CPU, petite VRAM ou en edge. Tient dans ~2 Go en Q4. Parfait pour extraction, classification et RAG léger.
Granite 4 Tiny-H (~7B, MoE)
Mixture of experts hybride : beaucoup de paramètres totaux mais peu actifs à chaque token, donc rapide. Bon compromis qualité/vitesse sur une carte d'entrée de gamme.
Granite 4 Small-H (~32B, MoE)
Le haut de gamme accessible : qualité proche des gros modèles pour les tâches métier, tout en gardant l'empreinte mémoire réduite du hybride. Cible station de travail ou serveur.
Variante non hybride
Une version transformeur classique existe pour les runtimes qui ne gèrent pas encore Mamba. À réserver aux cas de compatibilité — on perd le gain mémoire.

Pour débuter, Micro suffit à valider les cas d'usage et tourne partout. Passez à Tiny-H ou Small-H une fois que vous savez ce que vous voulez industrialiser et que vous mesurez un manque de qualité.

#Prérequis et VRAM

Le prérequis logiciel se résume à Ollama installé et à jour — le daemon écoute par défaut sur http://localhost:11434. Assurez-vous d'avoir une version récente : le support des couches Mamba de Granite 4 nécessite un Ollama assez récent, faute de quoi le modèle refusera de se charger.

Micro (3B) en Q4
≈ 2 Go de VRAM. Tourne aussi sur CPU avec 8 Go de RAM, lentement mais sûrement. Une RTX 3060 12GB est très confortable.
Tiny-H (7B MoE) en Q4
≈ 5 Go de VRAM pour les poids, mais l'activation MoE partielle rend l'inférence légère. Une carte 8–12 Go suffit largement.
Small-H (32B MoE) en Q4
≈ 19 Go de VRAM. RTX 4090 24GB ou Mac à mémoire unifiée 32–48 Go. Le hybride limite l'explosion mémoire en long contexte.
Marge pour le contexte
Grâce à Mamba, le KV cache pèse bien moins lourd qu'un transformeur équivalent : vous pouvez viser de grands contextes sans doubler la VRAM.
i
Repère quantization
Q4_K_M reste le défaut recommandé (meilleur ratio qualité/taille). Montez en Q5_K_M ou Q8_0 si vous avez la marge VRAM et visez la précision maximale sur des tâches d'extraction sensibles.

#Installer Granite 4 via Ollama

L'installation suit le flux Ollama habituel. Le modèle est publié dans la bibliothèque officielle sous le nom granite4 ; les variantes se sélectionnent via des tags. Vérifiez le nom exact des tags sur ollama.com/library avant de tirer une taille précise, car ils évoluent d'une release à l'autre.

  1. 01
    Vérifier Ollama
    Confirmez que le daemon tourne et qu'il est à jour. Une version ancienne ne connaît pas les couches Mamba de Granite 4.
  2. 02
    Tirer le modèle
    Téléchargez la variante choisie avec ollama pull. Commencez par Micro pour tester rapidement sans saturer votre disque ni votre carte.
  3. 03
    Lancer un premier chat
    ollama run ouvre une session interactive. Posez une question métier — résumé d'un texte, extraction de champs — plutôt qu'une devinette généraliste.
  4. 04
    Brancher une interface
    Pointez Open WebUI ou LM Studio sur l'endpoint local pour un usage confortable, ou appelez directement l'API HTTP depuis votre application.
Terminal — installer et lancer Granite 4
# Vérifier la version d'Ollama (doit être récente)
ollama --version

# Tirer la variante Micro (la plus légère)
ollama pull granite4:micro

# Lancer une session interactive
ollama run granite4:micro

# Vérifier ce qui tourne et la répartition GPU/CPU
ollama ps

Pour un usage applicatif, Ollama expose une API OpenAI-compatible sur le même port. Vous pouvez donc réutiliser tout client existant en changeant simplement l'URL de base et le nom du modèle.

Terminal — appel API local
curl http://localhost:11434/api/chat -d '{
  "model": "granite4:micro",
  "messages": [
    { "role": "user", "content": "Résume ce texte en trois points : ..." }
  ],
  "stream": false
}'

#Apache 2.0, la licence sans piège pour l'entreprise

C'est un point que les équipes juridiques regardent avant les benchmarks. Granite 4 est publié sous licence Apache 2.0, une licence open source permissive et éprouvée. Vous pouvez l'utiliser commercialement, le modifier, le redistribuer et l'intégrer à un produit fermé, sans seuil d'utilisateurs ni clause d'usage acceptable à surveiller.

La nuance compte face aux alternatives populaires. La « Llama Community License » de Meta n'est pas une vraie licence open source : elle impose des restrictions au-delà de 700 millions d'utilisateurs mensuels et interdit certains usages. Les conditions de Gemma (Google) encadrent également l'usage via une politique d'utilisation prohibée. Apache 2.0 n'a rien de tout cela : c'est une licence standard que les services juridiques connaissent déjà et approuvent sans négociation.

Usage commercial
Autorisé sans condition de taille ni de secteur. Aucun seuil d'utilisateurs à surveiller.
Modification et fine-tuning
Vous pouvez adapter le modèle et garder vos poids privés, sans obligation de publication.
Redistribution
Intégration possible dans un produit propriétaire, en conservant la mention de licence.
Gouvernance IBM
Modèles signés cryptographiquement, données documentées et certification ISO 42001 — des arguments concrets pour une revue de conformité.
!
Vérifiez toujours la licence de la variante
Apache 2.0 couvre la famille Granite 4 principale, mais un fine-tune tiers redistribué sur Ollama peut être sous d'autres termes. Contrôlez la carte du modèle avant un déploiement en production.

#RAG et function calling, les points forts de Granite

C'est ici que Granite justifie son existence. IBM a spécifiquement entraîné ces modèles pour deux usages d'entreprise : le RAG (répondre à partir de documents fournis) et le function calling (appeler des outils de façon fiable). Ce sont précisément les briques dont on a besoin pour construire un assistant métier utile, et non un simple chatbot.

Sur le RAG, Granite suit de près le contexte fourni et limite les hallucinations : il a tendance à s'appuyer sur les passages injectés plutôt qu'à broder. Couplé à l'architecture hybride qui digère de longs documents sans exploser la VRAM, cela en fait un bon moteur pour interroger une base documentaire en local. La version Micro suffit souvent, ce qui rend le RAG accessible sur du matériel modeste.

Sur les outils, Granite produit des appels de fonction bien formés et respecte les schémas JSON attendus. C'est la fondation d'un agent : le modèle décide d'appeler une fonction, lit le résultat, et enchaîne. Combiné à un contexte long peu coûteux, on obtient des automatisations métier fiables sans dépendre du cloud.

RAG documentaire
Point fort net : bon suivi du contexte, faible taux d'invention, long contexte économe en mémoire. Idéal pour une base de connaissances interne.
Function calling
Appels d'outils fiables et JSON conforme — la brique des agents locaux et des intégrations à un système existant.
Extraction structurée
Transformer un texte libre en champs propres (dates, montants, entités). La version Micro s'en sort déjà très bien.
Conversation généraliste
Honorable sans être exceptionnel. Ce n'est pas là que Granite cherche à gagner.
Exemple — définition d'un outil pour function calling
{
  "type": "function",
  "function": {
    "name": "chercher_facture",
    "description": "Récupère une facture par son numéro",
    "parameters": {
      "type": "object",
      "properties": {
        "numero": { "type": "string", "description": "Numéro de facture" }
      },
      "required": ["numero"]
    }
  }
}

#Dépannage

Le modèle refuse de se charger (erreur d'architecture)
Votre Ollama est trop ancien pour les couches Mamba de Granite 4. Mettez Ollama à jour vers une version récente, puis relancez le pull.
« model not found » au pull
Le tag n'existe pas sous ce nom. Vérifiez l'orthographe exacte sur ollama.com/library — les tags de variantes changent d'une release à l'autre.
Réponses hors sujet en RAG
Le contexte est mal formaté ou trop bruité. Structurez les passages injectés, réduisez leur nombre, et demandez explicitement de répondre uniquement à partir des documents fournis.
Appels d'outils mal formés
Le schéma JSON est ambigu. Simplifiez la définition, rendez les champs requis explicites, et testez d'abord avec un seul outil avant d'en empiler plusieurs.
Vitesse effondrée sur Small-H
Le modèle déborde en RAM faute de VRAM. « ollama ps » montre le partage GPU/CPU. Passez à Tiny-H ou Micro, ou descendez d'un cran de quantization.
« Connection refused »
Le daemon Ollama n'est pas lancé. Vérifiez avec « ollama ps » qu'il écoute bien sur http://localhost:11434.

#Pour aller plus loin

Granite s'appuie sur des briques déjà couvertes sur le site. Ces guides prolongent celui-ci :

Installer Ollama sur Linux
Le prérequis si le daemon n'est pas encore en place : script d'install, service systemd et configuration GPU NVIDIA/AMD.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Pour arbitrer entre qualité et VRAM sur Granite Small-H, là où chaque cran de quantization change ce qui tient sur votre carte.
IA locale en entreprise : RGPD, souveraineté et déploiement
Le complément naturel de la licence Apache 2.0 : comment déployer Granite en conformité dans une organisation.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.