Débutant 9 minOllama

Gemma 3 (Google) en local : guide complet 2026

Gemma 3 est la famille de modèles open-weight de Google sortie en mars 2025. Quatre tailles (1B, 4B, 12B, 27B), vision intégrée à partir de 4B, contexte 128k, et un support multilingue solide qui inclut un français correct. Ce guide couvre l'installation Gemma 3 Ollama en local pas à pas, la licence Google à connaître, et où le modèle brille vraiment.

Par Mohamed Meguedmi·Màj 2026-06-05·Testé sur Windows, macOS, Linux

#Pourquoi Gemma 3 ?

Gemma 3 est la troisième itération des modèles open-weight de Google DeepMind, dérivés de la même recherche que Gemini. La famille couvre quatre tailles très distinctes — de 1B à 27B — ce qui permet de viser exactement le palier de matériel que vous avez sous la main, du laptop sans GPU au workstation 24 Go.

Trois choses font sortir Gemma 3 du lot des modèles de cette catégorie : un contexte 128k de série (32k seulement pour la 1B), une vision multimodale intégrée dès la 4B sans avoir à charger un modèle séparé, et un travail explicite sur le multilingue (la doc Google revendique 140+ langues couvertes pour les tailles 4B et au-dessus).

i
En deux mots
Gemma 3 = la famille "polyvalente" de Google. Pas la plus forte sur un benchmark en particulier, mais l'une des plus complètes : 4 tailles, vision, contexte long, multilingue. Idéale comme modèle par défaut sur une machine donnée.

#Les 4 tailles Gemma 3

Choisir la bonne taille est la décision la plus importante. Voici le mapping usage / matériel :

gemma3:1b
Texte uniquement, contexte 32k. Pour CPU pur, Raspberry Pi 5, ou un Mac M1 8 Go. Qualité limitée mais réponses instantanées. Bon pour de la classification, de la reformulation courte.
gemma3:4b
Multimodal (texte + image), contexte 128k. Le palier "laptop" : tient confortablement sur 6 Go de VRAM ou un Mac M2/M3 16 Go. Qualité raisonnable pour des tâches généralistes.
gemma3:12b
Multimodal, contexte 128k. Le palier "PC mid-range" : RTX 3060 12 Go, 4070, M3 Pro 18 Go. Niveau qualitatif vraiment utilisable au quotidien.
gemma3:27b
Multimodal, contexte 128k. Le palier "workstation" : RTX 3090/4090, M3 Max. Le meilleur Gemma 3, comparable à des modèles de catégorie supérieure sur beaucoup de tâches.
Si vous hésitez
Commencez par la 4B. C'est le plus petit modèle qui inclut la vision et le contexte 128k, et il tourne pratiquement partout. Vous monterez en 12B ou 27B une fois que vous saurez si la qualité vous suffit.

#Prérequis VRAM (quantization Q4_K_M)

gemma3:1b
≈ 1 Go de VRAM ou de RAM. Tourne sur n'importe quelle machine, y compris un Raspberry Pi 5.
gemma3:4b
≈ 3 Go de VRAM. RTX 3050 6 Go, GTX 1660 6 Go, MacBook Air M2 8 Go suffisent.
gemma3:12b
≈ 8 Go de VRAM. RTX 3060 12 Go, RTX 4070 12 Go, Mac M3 Pro 18 Go unifiés.
gemma3:27b
≈ 17 Go de VRAM en Q4. RTX 3090/4090 24 Go ou Mac M3/M4 Max 36 Go+. En Q3 (qualité dégradée) ça passe sur 16 Go.

Ajoutez environ 1 à 4 Go pour le cache KV selon la longueur de contexte que vous utilisez réellement. Charger le contexte 128k complet d'un 27B demande plus que la VRAM brute du modèle.

#1. Installation Gemma 3 Ollama en local

Si Ollama n'est pas encore installé, suivez d'abord le guide d'installation Ollama pour votre OS. Une fois Ollama en route, le téléchargement de Gemma 3 tient en une commande.

Terminal
ollama run gemma3:4b

Ollama télécharge le modèle (environ 3,3 Go pour la 4B en Q4), puis le lance directement en mode interactif. Quand le prompt >>> apparaît, vous pouvez tester.

Pull sans lancer
ollama pull gemma3:1b
ollama pull gemma3:4b
ollama pull gemma3:12b
ollama pull gemma3:27b

Le daemon Ollama écoute sur http://localhost:11434 — vous pouvez brancher dessus Open WebUI, LM Studio en client, Continue.dev, ou n'importe quel client compatible OpenAI.

Choisir la bonne quantization
Le tag par défaut (ex: gemma3:12b) pointe sur Q4_K_M, le meilleur compromis qualité/mémoire pour la plupart des usages. Pour plus de qualité au prix de plus de VRAM, utilisez gemma3:12b-it-q5_K_M ou q8_0.

#2. Multilingue et qualité française

Le travail de Google sur le multilingue est une vraie différenciation de Gemma 3 face à Phi-4 ou Llama 3.1 8B. Le français est bien représenté dans le corpus d'entraînement — vous ne verrez quasiment jamais le modèle basculer en anglais en cours de réponse, ce qui reste un défaut récurrent de modèles plus petits.

Gemma 3 4B
FR correct pour des tâches simples (résumé, reformulation, classification). Pour de la rédaction longue, les tournures restent parfois maladroites.
Gemma 3 12B
Niveau "assistant FR utilisable". Bonne maîtrise de la grammaire, vocabulaire varié, peu d'anglicismes parasites. Comparable à Qwen 2.5 14B sur ce critère.
Gemma 3 27B
Très bon FR. Au niveau de Mistral Small 24B pour la rédaction, légèrement en dessous sur le raisonnement formel mais souvent meilleur sur la nuance et le style.
Test rapide en FR
>>> Résume en 3 points clés les enjeux de la souveraineté numérique européenne.

1. **Dépendance technologique** : 80% du cloud européen repose sur trois acteurs américains...
2. **Conformité réglementaire** : le RGPD et l'AI Act créent un cadre que les fournisseurs hors-UE...
3. **Capacité industrielle** : la course aux semi-conducteurs et aux modèles d'IA...

#3. Vision multimodale intégrée

À partir de la 4B, Gemma 3 accepte des images en entrée — pas besoin de modèle séparé type LLaVA ou Qwen2.5-VL. Le même binaire fait texte et vision, avec un encodeur SigLIP intégré. Pratique pour de l'OCR, de la description d'image, ou de l'analyse de capture d'écran.

CLI Ollama avec image
ollama run gemma3:12b
>>> Décris cette capture d'écran et identifie les éléments d'interface : /chemin/vers/screenshot.png

En API Python, on passe l'image au format base64 ou via un chemin local :

API Python Ollama
import ollama

response = ollama.chat(
    model='gemma3:12b',
    messages=[{
        'role': 'user',
        'content': 'Extrais le texte visible sur cette facture.',
        'images': ['/chemin/vers/facture.jpg'],
    }]
)
print(response['message']['content'])
i
Qualité vision réaliste
Gemma 3 vision est correct sur de la description générale, de l'OCR de documents propres, et de la lecture d'interfaces. Pour de l'OCR sur photos floues ou manuscrites, Qwen2.5-VL reste meilleur. Pour du raisonnement spatial complexe (compter des objets, comprendre un schéma technique), tout reste perfectible — c'est vrai de tous les LLM open-weight.

#4. Contexte 128k en pratique

Le contexte 128k de Gemma 3 (sauf 1B limitée à 32k) est suffisant pour ingérer un livre court, un dossier de documentation complet, ou plusieurs heures de transcription. Par défaut, Ollama charge un contexte beaucoup plus court (typiquement 4k ou 8k) pour économiser la VRAM — vous devez l'étendre explicitement.

Étendre le contexte en CLI
ollama run gemma3:12b
>>> /set parameter num_ctx 32768

Ou via l'API, en passant l'option num_ctx au moment de la requête :

Contexte étendu via API
import ollama

response = ollama.chat(
    model='gemma3:12b',
    messages=[{'role': 'user', 'content': 'Résume ce document : ...'}],
    options={'num_ctx': 32768},
)
!
Le contexte coûte de la VRAM
Chaque token de contexte occupe de la mémoire pour le cache KV. Passer de 8k à 128k sur un 12B peut ajouter 4–6 Go de VRAM consommée. Si vous saturez, le modèle bascule en offload CPU et la vitesse s'écroule. Étendez progressivement : 16k → 32k → 64k selon votre besoin réel.

#Licence Gemma : ce qu'il faut savoir

Gemma 3 n'est PAS sous licence Apache 2.0 ou MIT comme Mistral, Qwen ou DeepSeek. Google utilise sa propre licence : la "Gemma Terms of Use". Elle autorise l'usage commercial, y compris la distribution de modèles dérivés, mais impose deux contraintes que les licences vraiment libres n'ont pas.

Politique d'usage prohibé
Vous devez respecter la Gemma Prohibited Use Policy (pas de génération de CSAM, pas de violation flagrante de droits, etc.). Liste révisable unilatéralement par Google.
Propagation des termes
Si vous redistribuez le modèle (ou un dérivé), vous devez transmettre la licence Gemma à vos utilisateurs et leur faire accepter les mêmes restrictions.
Pas de "copyleft"
Vos applications qui appellent Gemma 3 ne sont PAS contaminées par la licence. Seuls les poids redistribués le sont.
!
Pour un usage professionnel
Pour une simple utilisation en SaaS interne ou produit (l'utilisateur final ne voit jamais les poids), Gemma 3 est utilisable sans souci. Pour publier un fine-tune ou intégrer Gemma 3 dans un produit open-source distribué avec les poids, lisez la licence avant — l'écart avec une vraie licence permissive devient sensible.

#Gemma 3 27B vs Llama 4 Scout

Les deux modèles se positionnent sur le segment "haut de gamme accessible en local". Pour choisir, il faut comparer ce qui les sépare vraiment :

Architecture
Gemma 3 27B est un modèle dense (27B paramètres tous actifs). Llama 4 Scout est un MoE (17B actifs, 109B total) — beaucoup plus performant à VRAM équivalente quand il rentre, mais demande de pouvoir charger l'ensemble des experts.
VRAM minimale
Gemma 3 27B Q4 : ≈ 17 Go. Llama 4 Scout Q4 : ≈ 60 Go (tous experts chargés). Sur une seule RTX 4090, seul Gemma 3 27B tient confortablement.
Contexte
Gemma 3 : 128k. Llama 4 Scout : 10M (théorique, plus modeste en pratique). Si vous traitez réellement plus de 128k tokens, Scout est devant.
Vision
Les deux sont multimodaux nativement. Qualité comparable sur des tâches généralistes.
FR
Gemma 3 est légèrement meilleur en français courant. Llama 4 Scout est plus fort sur le raisonnement formel et le code.
Licence
Gemma Terms of Use vs Llama 4 Community License. Les deux non-OSI, les deux acceptables en commercial avec contraintes spécifiques.
Verdict
Sur un seul GPU 24 Go : Gemma 3 27B. Sur un Mac Studio Ultra ou multi-GPU : Llama 4 Scout devient pertinent pour les avantages du MoE. Beaucoup d'utilisateurs gardent les deux installés et basculent selon la tâche.

#Dépannage

"Out of memory" au chargement
VRAM insuffisante pour la taille choisie. Descendez d'une taille (gemma3:12b → gemma3:4b) ou passez en quantization plus agressive (Q4 → Q3). Ne forcez pas l'offload CPU sur du 27B : ça devient inutilisable.
Images refusées
Vous utilisez probablement gemma3:1b qui est text-only. Passez au minimum sur gemma3:4b pour avoir la vision.
Contexte ignoré au-delà de 4k
Ollama charge un num_ctx par défaut très court. Étendez explicitement avec /set parameter num_ctx 32768 ou via l'option API options={'num_ctx': 32768}.
Génération lente sur 12B/27B avec GPU
Vérifiez avec ollama ps que la colonne PROCESSOR indique bien 100% GPU. Si vous voyez un pourcentage CPU, c'est que VRAM + contexte ne tiennent pas — réduisez num_ctx.
Réponses tronquées
Augmentez num_predict (par défaut 128 dans certains clients). Pour Ollama CLI : /set parameter num_predict 2048.

#Pour aller plus loin

Gemma 3 est un excellent point d'entrée polyvalent. Voici quelques pistes naturelles selon ce que vous voulez en faire :

Comparer avec Gemma 4
Le guide "Gemma 4 en local avec Ollama" montre l'évolution de la famille et où l'upgrade vaut le coup.
Bien choisir la quantization
Le guide "Choisir sa quantification (Q4, Q5, Q8, FP16)" détaille les compromis qui s'appliquent particulièrement bien aux 4 tailles Gemma 3.
Exploiter la vision en pipeline
Le guide "LLM multimodal vision en local" donne des recettes Python concrètes (OCR, description, analyse) directement applicables à Gemma 3 4B/12B/27B.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.