Gemma 3 (Google) en local : guide complet 2026
Gemma 3 est la famille de modèles open-weight de Google sortie en mars 2025. Quatre tailles (1B, 4B, 12B, 27B), vision intégrée à partir de 4B, contexte 128k, et un support multilingue solide qui inclut un français correct. Ce guide couvre l'installation Gemma 3 Ollama en local pas à pas, la licence Google à connaître, et où le modèle brille vraiment.
#Pourquoi Gemma 3 ?
Gemma 3 est la troisième itération des modèles open-weight de Google DeepMind, dérivés de la même recherche que Gemini. La famille couvre quatre tailles très distinctes — de 1B à 27B — ce qui permet de viser exactement le palier de matériel que vous avez sous la main, du laptop sans GPU au workstation 24 Go.
Trois choses font sortir Gemma 3 du lot des modèles de cette catégorie : un contexte 128k de série (32k seulement pour la 1B), une vision multimodale intégrée dès la 4B sans avoir à charger un modèle séparé, et un travail explicite sur le multilingue (la doc Google revendique 140+ langues couvertes pour les tailles 4B et au-dessus).
#Les 4 tailles Gemma 3
Choisir la bonne taille est la décision la plus importante. Voici le mapping usage / matériel :
- gemma3:1b
- Texte uniquement, contexte 32k. Pour CPU pur, Raspberry Pi 5, ou un Mac M1 8 Go. Qualité limitée mais réponses instantanées. Bon pour de la classification, de la reformulation courte.
- gemma3:4b
- Multimodal (texte + image), contexte 128k. Le palier "laptop" : tient confortablement sur 6 Go de VRAM ou un Mac M2/M3 16 Go. Qualité raisonnable pour des tâches généralistes.
- gemma3:12b
- Multimodal, contexte 128k. Le palier "PC mid-range" : RTX 3060 12 Go, 4070, M3 Pro 18 Go. Niveau qualitatif vraiment utilisable au quotidien.
- gemma3:27b
- Multimodal, contexte 128k. Le palier "workstation" : RTX 3090/4090, M3 Max. Le meilleur Gemma 3, comparable à des modèles de catégorie supérieure sur beaucoup de tâches.
#Prérequis VRAM (quantization Q4_K_M)
- gemma3:1b
- ≈ 1 Go de VRAM ou de RAM. Tourne sur n'importe quelle machine, y compris un Raspberry Pi 5.
- gemma3:4b
- ≈ 3 Go de VRAM. RTX 3050 6 Go, GTX 1660 6 Go, MacBook Air M2 8 Go suffisent.
- gemma3:12b
- ≈ 8 Go de VRAM. RTX 3060 12 Go, RTX 4070 12 Go, Mac M3 Pro 18 Go unifiés.
- gemma3:27b
- ≈ 17 Go de VRAM en Q4. RTX 3090/4090 24 Go ou Mac M3/M4 Max 36 Go+. En Q3 (qualité dégradée) ça passe sur 16 Go.
Ajoutez environ 1 à 4 Go pour le cache KV selon la longueur de contexte que vous utilisez réellement. Charger le contexte 128k complet d'un 27B demande plus que la VRAM brute du modèle.
#1. Installation Gemma 3 Ollama en local
Si Ollama n'est pas encore installé, suivez d'abord le guide d'installation Ollama pour votre OS. Une fois Ollama en route, le téléchargement de Gemma 3 tient en une commande.
Ollama télécharge le modèle (environ 3,3 Go pour la 4B en Q4), puis le lance directement en mode interactif. Quand le prompt >>> apparaît, vous pouvez tester.
Le daemon Ollama écoute sur http://localhost:11434 — vous pouvez brancher dessus Open WebUI, LM Studio en client, Continue.dev, ou n'importe quel client compatible OpenAI.
#2. Multilingue et qualité française
Le travail de Google sur le multilingue est une vraie différenciation de Gemma 3 face à Phi-4 ou Llama 3.1 8B. Le français est bien représenté dans le corpus d'entraînement — vous ne verrez quasiment jamais le modèle basculer en anglais en cours de réponse, ce qui reste un défaut récurrent de modèles plus petits.
- Gemma 3 4B
- FR correct pour des tâches simples (résumé, reformulation, classification). Pour de la rédaction longue, les tournures restent parfois maladroites.
- Gemma 3 12B
- Niveau "assistant FR utilisable". Bonne maîtrise de la grammaire, vocabulaire varié, peu d'anglicismes parasites. Comparable à Qwen 2.5 14B sur ce critère.
- Gemma 3 27B
- Très bon FR. Au niveau de Mistral Small 24B pour la rédaction, légèrement en dessous sur le raisonnement formel mais souvent meilleur sur la nuance et le style.
#3. Vision multimodale intégrée
À partir de la 4B, Gemma 3 accepte des images en entrée — pas besoin de modèle séparé type LLaVA ou Qwen2.5-VL. Le même binaire fait texte et vision, avec un encodeur SigLIP intégré. Pratique pour de l'OCR, de la description d'image, ou de l'analyse de capture d'écran.
En API Python, on passe l'image au format base64 ou via un chemin local :
#4. Contexte 128k en pratique
Le contexte 128k de Gemma 3 (sauf 1B limitée à 32k) est suffisant pour ingérer un livre court, un dossier de documentation complet, ou plusieurs heures de transcription. Par défaut, Ollama charge un contexte beaucoup plus court (typiquement 4k ou 8k) pour économiser la VRAM — vous devez l'étendre explicitement.
Ou via l'API, en passant l'option num_ctx au moment de la requête :
#Licence Gemma : ce qu'il faut savoir
Gemma 3 n'est PAS sous licence Apache 2.0 ou MIT comme Mistral, Qwen ou DeepSeek. Google utilise sa propre licence : la "Gemma Terms of Use". Elle autorise l'usage commercial, y compris la distribution de modèles dérivés, mais impose deux contraintes que les licences vraiment libres n'ont pas.
- Politique d'usage prohibé
- Vous devez respecter la Gemma Prohibited Use Policy (pas de génération de CSAM, pas de violation flagrante de droits, etc.). Liste révisable unilatéralement par Google.
- Propagation des termes
- Si vous redistribuez le modèle (ou un dérivé), vous devez transmettre la licence Gemma à vos utilisateurs et leur faire accepter les mêmes restrictions.
- Pas de "copyleft"
- Vos applications qui appellent Gemma 3 ne sont PAS contaminées par la licence. Seuls les poids redistribués le sont.
#Gemma 3 27B vs Llama 4 Scout
Les deux modèles se positionnent sur le segment "haut de gamme accessible en local". Pour choisir, il faut comparer ce qui les sépare vraiment :
- Architecture
- Gemma 3 27B est un modèle dense (27B paramètres tous actifs). Llama 4 Scout est un MoE (17B actifs, 109B total) — beaucoup plus performant à VRAM équivalente quand il rentre, mais demande de pouvoir charger l'ensemble des experts.
- VRAM minimale
- Gemma 3 27B Q4 : ≈ 17 Go. Llama 4 Scout Q4 : ≈ 60 Go (tous experts chargés). Sur une seule RTX 4090, seul Gemma 3 27B tient confortablement.
- Contexte
- Gemma 3 : 128k. Llama 4 Scout : 10M (théorique, plus modeste en pratique). Si vous traitez réellement plus de 128k tokens, Scout est devant.
- Vision
- Les deux sont multimodaux nativement. Qualité comparable sur des tâches généralistes.
- FR
- Gemma 3 est légèrement meilleur en français courant. Llama 4 Scout est plus fort sur le raisonnement formel et le code.
- Licence
- Gemma Terms of Use vs Llama 4 Community License. Les deux non-OSI, les deux acceptables en commercial avec contraintes spécifiques.
#Dépannage
- "Out of memory" au chargement
- VRAM insuffisante pour la taille choisie. Descendez d'une taille (gemma3:12b → gemma3:4b) ou passez en quantization plus agressive (Q4 → Q3). Ne forcez pas l'offload CPU sur du 27B : ça devient inutilisable.
- Images refusées
- Vous utilisez probablement gemma3:1b qui est text-only. Passez au minimum sur gemma3:4b pour avoir la vision.
- Contexte ignoré au-delà de 4k
- Ollama charge un num_ctx par défaut très court. Étendez explicitement avec /set parameter num_ctx 32768 ou via l'option API options={'num_ctx': 32768}.
- Génération lente sur 12B/27B avec GPU
- Vérifiez avec ollama ps que la colonne PROCESSOR indique bien 100% GPU. Si vous voyez un pourcentage CPU, c'est que VRAM + contexte ne tiennent pas — réduisez num_ctx.
- Réponses tronquées
- Augmentez num_predict (par défaut 128 dans certains clients). Pour Ollama CLI : /set parameter num_predict 2048.
#Pour aller plus loin
Gemma 3 est un excellent point d'entrée polyvalent. Voici quelques pistes naturelles selon ce que vous voulez en faire :
- Comparer avec Gemma 4
- Le guide "Gemma 4 en local avec Ollama" montre l'évolution de la famille et où l'upgrade vaut le coup.
- Bien choisir la quantization
- Le guide "Choisir sa quantification (Q4, Q5, Q8, FP16)" détaille les compromis qui s'appliquent particulièrement bien aux 4 tailles Gemma 3.
- Exploiter la vision en pipeline
- Le guide "LLM multimodal vision en local" donne des recettes Python concrètes (OCR, description, analyse) directement applicables à Gemma 3 4B/12B/27B.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.