Gemma 4 en local avec Ollama : installation et performances
Gemma 4 est la nouvelle génération de modèles open-weight de Google, sortie en 2026. Multimodal natif, contexte long, licence Apache 2.0, et trois tailles utiles dans la library Ollama : E2B (compacte), 12B et 26B-A4B (un MoE). Ce guide vous montre comment faire tourner Gemma 4 avec Ollama, quelle quantification choisir selon votre VRAM, les ordres de grandeur en tokens/sec sur RTX et Apple Silicon, et ce qui change concrètement par rapport à Gemma 3.
#Pourquoi Gemma 4 en local
Gemma 4 est l'un des meilleurs modèles open-weight de sa taille pour le français. Le 12B Q4 rentre confortablement dans 8 à 12 Go de VRAM, ce qui couvre une RTX 3060, une 4070 ou un Mac M-series mid-range. Le 26B-A4B, un MoE qui n'active que 4B de paramètres, exploite les cartes 24 Go (3090, 4090, 7900 XTX) et les Mac à mémoire unifiée généreuse tout en restant rapide. Sur un usage assistant FR, RAG, code généraliste, c'est un excellent défaut.
L'autre raison de le faire tourner en local : depuis avril 2026 Gemma 4 est publié sous licence Apache 2.0, ce qui lève les contraintes de l'ancienne Gemma Terms of Use (usage commercial, redistribution et fine-tuning libres), et Ollama gère le pull, la quantization et l'inférence sans qu'on touche à Python, CUDA ou llama.cpp directement.
#Ce qui change vs Gemma 3
Gemma 3 (mars 2025) a apporté le multimodal et un contexte de 128k. Gemma 4 garde ces acquis et pousse sur trois axes : qualité (gros bond mesuré sur les benchmarks de raisonnement et de code), efficacité (le 12B remplace avantageusement le 27B de Gemma 3 sur beaucoup de tâches, et le 26B-A4B en MoE fait tourner l'équivalent d'un gros modèle avec la vitesse d'un petit), et tokenizer (vocabulaire plus dense, ce qui réduit le nombre de tokens à génération équivalente — donc plus de tokens utiles par seconde).
- Tailles
- Gemma 3 : 1B, 4B, 12B, 27B (denses). Gemma 4 : E2B (compacte), 12B (dense) et 26B-A4B (MoE, 4B actifs). La gamme monte en efficacité plutôt qu'en taille brute.
- Multimodal
- Vision native sur le 12B et le 26B-A4B (texte + images). L'E2B reste la variante compacte orientée texte.
- Contexte
- 128k tokens sur tout le line-up. Mêmes contraintes mémoire qu'avant : le KV-cache pèse vite.
- Tokenizer
- SentencePiece, vocabulaire revu pour mieux couvrir le français, le code et les langues non-latines. À prompt équivalent, on consomme ~5 à 15 % de tokens en moins.
- Licence
- Apache 2.0 depuis avril 2026. Usage commercial, redistribution et fine-tuning libres, sans clause d'usage acceptable spécifique — un vrai changement par rapport à la Gemma Terms of Use de Gemma 3.
#Prérequis
- Ollama installé
- Version récente (≥ 0.5). Voir les guides d'installation Windows, macOS ou Linux si ce n'est pas déjà fait.
- Espace disque
- Compter 4,3 Go pour l'E2B, 7,6 Go pour le 12B Q4, 19 Go pour le 26B-A4B Q4. Les variantes Q5 et Q8 du 12B et du 26B pèsent 1,3 à 2× plus.
- VRAM ou mémoire unifiée
- Minimum pratique : 6 Go pour l'E2B, 8 à 12 Go pour le 12B en Q4, 24 Go pour le 26B-A4B en Q4. En dessous, ça déborde sur CPU et la vitesse s'effondre.
- Drivers GPU à jour
- CUDA 12.x pour NVIDIA, ROCm 6.x pour AMD, Metal natif pour Apple Silicon. Ollama détecte le backend tout seul.
#1. Pull et lancement en une commande
Le tag Ollama pour Gemma 4 suit la convention habituelle : gemma4 (latest pointe sur le 12B Q4 par défaut), gemma4:e2b-it-qat, gemma4:12b, gemma4:26b. Pour expliciter la quantification, on suffixe : gemma4:12b-instruct-q4_K_M.
À la première exécution, Ollama télécharge le modèle (~7,6 Go pour le 12B Q4) puis ouvre directement un prompt interactif. Les fois suivantes, le lancement est instantané tant que le modèle reste en cache mémoire.
Pour vérifier ce qui est chargé en VRAM en direct :
La colonne PROCESSOR doit afficher 100% GPU. Si vous voyez 70%/30% GPU/CPU, c'est que le modèle déborde — passez à une quantization plus agressive ou à une taille en dessous.
#2. VRAM par taille et quantification
Les chiffres ci-dessous incluent les poids du modèle plus un KV-cache pour une fenêtre de contexte de 8k tokens (le défaut Ollama). Pour pousser à 32k ou 128k, comptez 2 à 8 Go supplémentaires selon la taille.
- Gemma 4 E2B — QAT int4
- ≈ 4,5 Go VRAM. Variante compacte (QAT, ~2B actifs façon MatFormer). Passe sur n'importe quelle GTX 1660 (6 Go), RTX 3050 (8 Go) ou Mac à 8 Go unifié.
- Gemma 4 12B — Q4_K_M
- ≈ 8 Go VRAM. Cible naturelle : RTX 3060 12 Go, 4070 12 Go, 5070 12 Go, Mac 16 Go+.
- Gemma 4 12B — Q5_K_M
- ≈ 9,5 Go VRAM. Tient sur 12 Go avec un contexte modeste, plus confortable sur 16 Go (4070 Ti Super, 5080).
- Gemma 4 12B — Q8_0
- ≈ 13 Go VRAM. Réservé aux cartes 16 Go+ ou Apple Silicon généreux.
- Gemma 4 26B-A4B — Q4_K_M
- ≈ 19 Go VRAM. Sweet spot : RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio. MoE : ne charge que 4B actifs, donc rapide malgré l'empreinte.
- Gemma 4 26B-A4B — Q5_K_M
- ≈ 23 Go VRAM. Limite haute pour les 24 Go ; viser un Mac à mémoire unifiée 48 Go+ ou multi-GPU sinon.
- Gemma 4 26B-A4B — Q8_0
- ≈ 30 Go VRAM. Pour les 32 Go+ (RTX 5090) ou les Mac à mémoire unifiée 48 Go et plus.
#3. Tokens/sec : RTX et Apple Silicon
Ordres de grandeur observés avec un Ollama récent, contexte 8k, prompt court, génération de 200 tokens. Les chiffres bougent de ±15 % selon le contenu généré et la version d'Ollama. Le 26B-A4B étant un MoE (4B actifs), il tourne bien plus vite qu'un dense 26B, une fois logé en mémoire.
- RTX 3060 12 Go
- Gemma 4 E2B : ~90 tok/s. Gemma 4 12B Q4 : ~28 tok/s. 26B-A4B : déborde (19 Go), à éviter.
- RTX 4070 12 Go
- E2B : ~130 tok/s. 12B Q4 : ~46 tok/s. 26B-A4B : déborde.
- RTX 4080 Super 16 Go
- 12B Q4 : ~66 tok/s. 12B Q8 : ~40 tok/s. 26B-A4B : ne tient pas dans 16 Go.
- RTX 4090 24 Go
- 12B Q4 : ~100 tok/s. 26B-A4B Q4 : ~58 tok/s. 26B-A4B Q5 : ~50 tok/s.
- RTX 5090 32 Go
- 12B Q4 : ~150 tok/s. 26B-A4B Q4 : ~88 tok/s. 26B-A4B Q8 : ~48 tok/s.
- Mac M3 Max 64 Go
- 12B Q4 : ~38 tok/s. 26B-A4B Q4 : ~30 tok/s. Belle régularité grâce à la mémoire unifiée.
- Mac M4 Pro 48 Go
- 12B Q4 : ~34 tok/s. 26B-A4B Q4 : ~24 tok/s. Le MoE tient sans drame et reste vif pour sa taille.
- Mac M4 Max 128 Go
- 26B-A4B Q4 : ~36 tok/s. 26B-A4B Q8 : ~20 tok/s. Le Mac le plus à l'aise avec le 26B au quotidien.
#4. Premier prompt et réglages utiles
Gemma 4 répond bien en français sans system prompt particulier, mais quelques paramètres méritent d'être ajustés selon le cas d'usage.
Pour régler les paramètres à la volée depuis le prompt interactif :
- temperature
- 0.7 par défaut. Descendez à 0.2-0.4 pour du factuel, du code, du RAG. Montez à 0.9-1.1 pour du brainstorming.
- num_ctx
- Fenêtre de contexte. 4096 ou 8192 par défaut selon les builds. Augmentez selon votre cas d'usage et votre VRAM disponible.
- num_predict
- Nombre max de tokens générés. -1 pour illimité (jusqu'au stop). Utile pour borner la longueur des réponses.
- repeat_penalty
- 1.1 par défaut. Si Gemma 4 boucle, montez à 1.15-1.2. Si les réponses paraissent trop écrites, descendez à 1.05.
#5. API et intégration depuis votre code
Ollama expose un endpoint OpenAI-compatible sur http://localhost:11434/v1. N'importe quel SDK qui parle OpenAI fonctionne en pointant simplement la base_url chez vous.
Pour la version multimodale (12B et 26B-A4B), on passe l'image en base64 ou par URL locale dans le message — même protocole que GPT-4o.
#Dépannage
- "Error: model gemma4 not found"
- Le tag n'existe pas encore sur votre version d'Ollama, ou typo. Vérifiez avec ollama list les modèles installés et la documentation de la library Ollama pour les tags officiels.
- Modèle qui déborde sur CPU
- ollama ps affiche 60% GPU / 40% CPU. Passez à une quantization plus agressive (Q4 → Q3_K_S), réduisez num_ctx, ou descendez d'une taille (12B → E2B).
- Vitesse divisée par 3 après quelques heures
- Le KV-cache se fragmente sur certains drivers. Redémarrez le service Ollama (sudo systemctl restart ollama sur Linux, redémarrer l'app sur Mac/Windows).
- Réponses tronquées après ~400 mots
- num_predict trop bas. Mettez 2048 ou -1 pour illimité, et augmentez num_ctx en conséquence.
- Français approximatif sur l'E2B
- C'est attendu : l'E2B est puissant pour sa taille mais reste une variante compacte. Pour du français exigeant, prenez le 12B.
- OOM sur RTX 4060 8 Go en 12B
- Le 12B Q4 tient tout juste dans 8 Go, sans marge de contexte. Soit gemma4:e2b-it-qat, soit acceptez l'offload CPU (~3-5 tok/s), soit changez de carte.
#Pour aller plus loin
Vous avez Gemma 4 qui tourne. Quelques pistes pour pousser plus loin selon ce que vous voulez en faire :
- Ollama c'est quoi et comment ça marche
- Si vous découvrez Ollama, ce guide débutant reprend les commandes essentielles et le modèle mental complet.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Pour comprendre exactement ce que vous sacrifiez en passant du Q8 au Q4, et quand ça compte vraiment.
- Open WebUI avec Ollama
- Pour une interface ChatGPT-like par-dessus Gemma 4 : historique de conversations, RAG intégré, partage multi-utilisateurs.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.