Intermédiaire 10 minGemma

Gemma 4 en local avec Ollama : installation et performances

Gemma 4 est la nouvelle génération de modèles open-weight de Google, sortie en 2026. Multimodal natif, contexte long, licence Apache 2.0, et trois tailles utiles dans la library Ollama : E2B (compacte), 12B et 26B-A4B (un MoE). Ce guide vous montre comment faire tourner Gemma 4 avec Ollama, quelle quantification choisir selon votre VRAM, les ordres de grandeur en tokens/sec sur RTX et Apple Silicon, et ce qui change concrètement par rapport à Gemma 3.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#Pourquoi Gemma 4 en local

Gemma 4 est l'un des meilleurs modèles open-weight de sa taille pour le français. Le 12B Q4 rentre confortablement dans 8 à 12 Go de VRAM, ce qui couvre une RTX 3060, une 4070 ou un Mac M-series mid-range. Le 26B-A4B, un MoE qui n'active que 4B de paramètres, exploite les cartes 24 Go (3090, 4090, 7900 XTX) et les Mac à mémoire unifiée généreuse tout en restant rapide. Sur un usage assistant FR, RAG, code généraliste, c'est un excellent défaut.

L'autre raison de le faire tourner en local : depuis avril 2026 Gemma 4 est publié sous licence Apache 2.0, ce qui lève les contraintes de l'ancienne Gemma Terms of Use (usage commercial, redistribution et fine-tuning libres), et Ollama gère le pull, la quantization et l'inférence sans qu'on touche à Python, CUDA ou llama.cpp directement.

i
En deux mots
Gemma 4 + Ollama, c'est une commande pour le pull, une commande pour discuter, un endpoint OpenAI-compatible sur localhost:11434. Le reste n'est que réglage.

#Ce qui change vs Gemma 3

Gemma 3 (mars 2025) a apporté le multimodal et un contexte de 128k. Gemma 4 garde ces acquis et pousse sur trois axes : qualité (gros bond mesuré sur les benchmarks de raisonnement et de code), efficacité (le 12B remplace avantageusement le 27B de Gemma 3 sur beaucoup de tâches, et le 26B-A4B en MoE fait tourner l'équivalent d'un gros modèle avec la vitesse d'un petit), et tokenizer (vocabulaire plus dense, ce qui réduit le nombre de tokens à génération équivalente — donc plus de tokens utiles par seconde).

Tailles
Gemma 3 : 1B, 4B, 12B, 27B (denses). Gemma 4 : E2B (compacte), 12B (dense) et 26B-A4B (MoE, 4B actifs). La gamme monte en efficacité plutôt qu'en taille brute.
Multimodal
Vision native sur le 12B et le 26B-A4B (texte + images). L'E2B reste la variante compacte orientée texte.
Contexte
128k tokens sur tout le line-up. Mêmes contraintes mémoire qu'avant : le KV-cache pèse vite.
Tokenizer
SentencePiece, vocabulaire revu pour mieux couvrir le français, le code et les langues non-latines. À prompt équivalent, on consomme ~5 à 15 % de tokens en moins.
Licence
Apache 2.0 depuis avril 2026. Usage commercial, redistribution et fine-tuning libres, sans clause d'usage acceptable spécifique — un vrai changement par rapport à la Gemma Terms of Use de Gemma 3.
Quand garder Gemma 3
Si vous avez déjà un pipeline RAG rodé sur Gemma 3 12B et que la qualité vous suffit, ne migrez pas par principe. Gemma 4 12B est meilleur, mais le léger surcoût VRAM (~8 Go vs ~7 Go en Q4) et le re-réglage des prompts ne se justifient que si vous touchez aux limites du 12B de Gemma 3.

#Prérequis

Ollama installé
Version récente (≥ 0.5). Voir les guides d'installation Windows, macOS ou Linux si ce n'est pas déjà fait.
Espace disque
Compter 4,3 Go pour l'E2B, 7,6 Go pour le 12B Q4, 19 Go pour le 26B-A4B Q4. Les variantes Q5 et Q8 du 12B et du 26B pèsent 1,3 à 2× plus.
VRAM ou mémoire unifiée
Minimum pratique : 6 Go pour l'E2B, 8 à 12 Go pour le 12B en Q4, 24 Go pour le 26B-A4B en Q4. En dessous, ça déborde sur CPU et la vitesse s'effondre.
Drivers GPU à jour
CUDA 12.x pour NVIDIA, ROCm 6.x pour AMD, Metal natif pour Apple Silicon. Ollama détecte le backend tout seul.

#1. Pull et lancement en une commande

Le tag Ollama pour Gemma 4 suit la convention habituelle : gemma4 (latest pointe sur le 12B Q4 par défaut), gemma4:e2b-it-qat, gemma4:12b, gemma4:26b. Pour expliciter la quantification, on suffixe : gemma4:12b-instruct-q4_K_M.

Pull et lancement direct
ollama run gemma4:12b

À la première exécution, Ollama télécharge le modèle (~7,6 Go pour le 12B Q4) puis ouvre directement un prompt interactif. Les fois suivantes, le lancement est instantané tant que le modèle reste en cache mémoire.

Pull seul (sans lancer)
ollama pull gemma4:e2b-it-qat
ollama pull gemma4:12b
ollama pull gemma4:26b
i
Choisir explicitement la quantization
Par défaut Ollama sert du Q4_K_M, qui est le meilleur compromis qualité/mémoire dans 95 % des cas. Pour aller plus loin : gemma4:12b-instruct-q5_K_M (qualité légèrement meilleure, +25 % VRAM), gemma4:12b-instruct-q8_0 (proche FP16, +100 % VRAM). L'E2B, lui, est distribué directement en QAT int4 (gemma4:e2b-it-qat) et n'a pas de variante plus lourde utile. Le FP16 brut n'a d'intérêt qu'en fine-tuning.

Pour vérifier ce qui est chargé en VRAM en direct :

État des modèles chargés
ollama ps

La colonne PROCESSOR doit afficher 100% GPU. Si vous voyez 70%/30% GPU/CPU, c'est que le modèle déborde — passez à une quantization plus agressive ou à une taille en dessous.

#2. VRAM par taille et quantification

Les chiffres ci-dessous incluent les poids du modèle plus un KV-cache pour une fenêtre de contexte de 8k tokens (le défaut Ollama). Pour pousser à 32k ou 128k, comptez 2 à 8 Go supplémentaires selon la taille.

Gemma 4 E2B — QAT int4
≈ 4,5 Go VRAM. Variante compacte (QAT, ~2B actifs façon MatFormer). Passe sur n'importe quelle GTX 1660 (6 Go), RTX 3050 (8 Go) ou Mac à 8 Go unifié.
Gemma 4 12B — Q4_K_M
≈ 8 Go VRAM. Cible naturelle : RTX 3060 12 Go, 4070 12 Go, 5070 12 Go, Mac 16 Go+.
Gemma 4 12B — Q5_K_M
≈ 9,5 Go VRAM. Tient sur 12 Go avec un contexte modeste, plus confortable sur 16 Go (4070 Ti Super, 5080).
Gemma 4 12B — Q8_0
≈ 13 Go VRAM. Réservé aux cartes 16 Go+ ou Apple Silicon généreux.
Gemma 4 26B-A4B — Q4_K_M
≈ 19 Go VRAM. Sweet spot : RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio. MoE : ne charge que 4B actifs, donc rapide malgré l'empreinte.
Gemma 4 26B-A4B — Q5_K_M
≈ 23 Go VRAM. Limite haute pour les 24 Go ; viser un Mac à mémoire unifiée 48 Go+ ou multi-GPU sinon.
Gemma 4 26B-A4B — Q8_0
≈ 30 Go VRAM. Pour les 32 Go+ (RTX 5090) ou les Mac à mémoire unifiée 48 Go et plus.
!
Le piège du contexte 128k
Activer la fenêtre maximale (num_ctx=131072) sur le 12B peut ajouter 4 à 6 Go au KV-cache. Si vous tenez tout juste en Q4 à 8k, vous déborderez à 32k. Augmentez le contexte par paliers et surveillez ollama ps.

#3. Tokens/sec : RTX et Apple Silicon

Ordres de grandeur observés avec un Ollama récent, contexte 8k, prompt court, génération de 200 tokens. Les chiffres bougent de ±15 % selon le contenu généré et la version d'Ollama. Le 26B-A4B étant un MoE (4B actifs), il tourne bien plus vite qu'un dense 26B, une fois logé en mémoire.

RTX 3060 12 Go
Gemma 4 E2B : ~90 tok/s. Gemma 4 12B Q4 : ~28 tok/s. 26B-A4B : déborde (19 Go), à éviter.
RTX 4070 12 Go
E2B : ~130 tok/s. 12B Q4 : ~46 tok/s. 26B-A4B : déborde.
RTX 4080 Super 16 Go
12B Q4 : ~66 tok/s. 12B Q8 : ~40 tok/s. 26B-A4B : ne tient pas dans 16 Go.
RTX 4090 24 Go
12B Q4 : ~100 tok/s. 26B-A4B Q4 : ~58 tok/s. 26B-A4B Q5 : ~50 tok/s.
RTX 5090 32 Go
12B Q4 : ~150 tok/s. 26B-A4B Q4 : ~88 tok/s. 26B-A4B Q8 : ~48 tok/s.
Mac M3 Max 64 Go
12B Q4 : ~38 tok/s. 26B-A4B Q4 : ~30 tok/s. Belle régularité grâce à la mémoire unifiée.
Mac M4 Pro 48 Go
12B Q4 : ~34 tok/s. 26B-A4B Q4 : ~24 tok/s. Le MoE tient sans drame et reste vif pour sa taille.
Mac M4 Max 128 Go
26B-A4B Q4 : ~36 tok/s. 26B-A4B Q8 : ~20 tok/s. Le Mac le plus à l'aise avec le 26B au quotidien.
Repère pratique
Au-dessus de 30 tok/s, l'usage interactif est fluide. Entre 15 et 30 tok/s, c'est encore correct pour du chat mais ça gratte sur du long. En dessous de 10 tok/s, réservez à du batch ou des tâches où vous attendez de toute façon la fin.

#4. Premier prompt et réglages utiles

Gemma 4 répond bien en français sans system prompt particulier, mais quelques paramètres méritent d'être ajustés selon le cas d'usage.

Test rapide
ollama run gemma4:12b
>>> Explique la différence entre un index B-tree et un index hash en SQL, en 5 lignes.

Pour régler les paramètres à la volée depuis le prompt interactif :

Paramètres en session
/set parameter temperature 0.3
/set parameter num_ctx 16384
/set parameter num_predict 800
temperature
0.7 par défaut. Descendez à 0.2-0.4 pour du factuel, du code, du RAG. Montez à 0.9-1.1 pour du brainstorming.
num_ctx
Fenêtre de contexte. 4096 ou 8192 par défaut selon les builds. Augmentez selon votre cas d'usage et votre VRAM disponible.
num_predict
Nombre max de tokens générés. -1 pour illimité (jusqu'au stop). Utile pour borner la longueur des réponses.
repeat_penalty
1.1 par défaut. Si Gemma 4 boucle, montez à 1.15-1.2. Si les réponses paraissent trop écrites, descendez à 1.05.
i
Persister les réglages
Pour figer un système prompt et des paramètres, créez un Modelfile : FROM gemma4:12b, puis SYSTEM "...", PARAMETER temperature 0.3, etc. ollama create monassistant -f Modelfile et vous appelez ensuite monassistant comme un modèle normal.

#5. API et intégration depuis votre code

Ollama expose un endpoint OpenAI-compatible sur http://localhost:11434/v1. N'importe quel SDK qui parle OpenAI fonctionne en pointant simplement la base_url chez vous.

Python — SDK openai
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama",  # valeur ignorée, mais le SDK l'exige
)

resp = client.chat.completions.create(
    model="gemma4:12b",
    messages=[
        {"role": "system", "content": "Tu réponds en français, de manière concise."},
        {"role": "user", "content": "Résume la photosynthèse en 3 lignes."},
    ],
    temperature=0.3,
)
print(resp.choices[0].message.content)

Pour la version multimodale (12B et 26B-A4B), on passe l'image en base64 ou par URL locale dans le message — même protocole que GPT-4o.

Vision via curl
curl http://localhost:11434/api/generate -d '{
  "model": "gemma4:12b",
  "prompt": "Décris cette image en français.",
  "images": ["'"$(base64 -w0 photo.jpg)"'"],
  "stream": false
}'

#Dépannage

"Error: model gemma4 not found"
Le tag n'existe pas encore sur votre version d'Ollama, ou typo. Vérifiez avec ollama list les modèles installés et la documentation de la library Ollama pour les tags officiels.
Modèle qui déborde sur CPU
ollama ps affiche 60% GPU / 40% CPU. Passez à une quantization plus agressive (Q4 → Q3_K_S), réduisez num_ctx, ou descendez d'une taille (12B → E2B).
Vitesse divisée par 3 après quelques heures
Le KV-cache se fragmente sur certains drivers. Redémarrez le service Ollama (sudo systemctl restart ollama sur Linux, redémarrer l'app sur Mac/Windows).
Réponses tronquées après ~400 mots
num_predict trop bas. Mettez 2048 ou -1 pour illimité, et augmentez num_ctx en conséquence.
Français approximatif sur l'E2B
C'est attendu : l'E2B est puissant pour sa taille mais reste une variante compacte. Pour du français exigeant, prenez le 12B.
OOM sur RTX 4060 8 Go en 12B
Le 12B Q4 tient tout juste dans 8 Go, sans marge de contexte. Soit gemma4:e2b-it-qat, soit acceptez l'offload CPU (~3-5 tok/s), soit changez de carte.

#Pour aller plus loin

Vous avez Gemma 4 qui tourne. Quelques pistes pour pousser plus loin selon ce que vous voulez en faire :

Ollama c'est quoi et comment ça marche
Si vous découvrez Ollama, ce guide débutant reprend les commandes essentielles et le modèle mental complet.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Pour comprendre exactement ce que vous sacrifiez en passant du Q8 au Q4, et quand ça compte vraiment.
Open WebUI avec Ollama
Pour une interface ChatGPT-like par-dessus Gemma 4 : historique de conversations, RAG intégré, partage multi-utilisateurs.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.