gpt-oss en local : les modèles open-weights d'OpenAI avec Ollama
OpenAI a fini par publier des poids ouverts : gpt-oss-20b et gpt-oss-120b, deux modèles à mélange d'experts sous licence Apache 2.0. Ce guide montre comment faire tourner gpt-oss avec Ollama, combien de VRAM chaque version réclame, comment fonctionne la quantification MXFP4 native et comment régler l'effort de raisonnement. On termine sur ce que valent vraiment ces open-weights face à Qwen et DeepSeek.
#Pourquoi gpt-oss change la donne
Pendant des années, OpenAI a gardé ses modèles fermés. gpt-oss est le premier retour de l'entreprise à des poids réellement téléchargeables depuis GPT-2, et cette fois sous licence Apache 2.0 : usage commercial autorisé, pas de clause de partage forcé, pas de limite d'utilisateurs. Vous téléchargez les poids, ils tournent sur votre machine, et rien ne sort de votre réseau.
Techniquement, gpt-oss repose sur une architecture MoE (Mixture of Experts) : le modèle contient beaucoup de paramètres au total, mais n'en active qu'une petite fraction à chaque token. Résultat : une qualité proche d'un gros modèle dense pour un coût mémoire et une vitesse d'un modèle bien plus petit. Les deux versions ciblent le raisonnement, l'appel d'outils et le suivi d'instructions, avec un contexte de 128k tokens.
- gpt-oss-20b
- ≈ 21 milliards de paramètres au total, ≈ 3,6 B actifs par token. Pensé pour une seule carte grand public de 16 Go.
- gpt-oss-120b
- ≈ 117 milliards de paramètres au total, ≈ 5,1 B actifs par token. Cible une carte data-center 80 Go ou une machine à grosse mémoire unifiée.
- Licence
- Apache 2.0 — commercial, redistribuable, fine-tunable sans restriction d'usage.
- Quantification
- MXFP4 native sur les poids des experts : le format 4 bits fait partie de la publication, pas d'une conversion tierce approximative.
#gpt-oss ollama : 20b ou 120b ?
Le choix se joue presque uniquement sur votre matériel. Les deux modèles partagent la même famille et la même mise en forme des réponses ; la différence de qualité existe mais reste secondaire face à la question « est-ce que ça rentre dans ma VRAM ». Voici le repère simple.
- 20b — le défaut raisonnable
- Environ 14-16 Go une fois chargé en MXFP4. Tient sur une RTX 4080 16 Go ou une RTX 4090, et sur un Mac Apple Silicon à partir de 24 Go de mémoire unifiée. C'est la version à installer en premier.
- 120b — quand vous avez la mémoire
- Environ 60-65 Go en MXFP4. Il vise un GPU 80 Go (classe H100/A100), un poste multi-GPU, ou un Mac à grosse mémoire unifiée (M3/M4 Ultra 96 Go et plus). Inutile de l'essayer sous 64 Go de mémoire disponible pour le modèle.
- Qualité relative
- Le 120b creuse l'écart sur le raisonnement multi-étapes, le code long et les tâches ambiguës. Sur du questions-réponses courant et du français, le 20b s'en sort déjà très bien.
#Prérequis
Rien d'exotique : une installation d'Ollama à jour et assez de mémoire pour la version visée. Ollama gère le téléchargement, la quantification MXFP4 et le déchargement GPU/CPU tout seul.
- Ollama récent
- Version supportant gpt-oss et MXFP4. Mettez à jour avant de commencer — les versions trop anciennes ne connaissent pas le format.
- VRAM / mémoire unifiée
- ≥ 16 Go pour le 20b, ≥ 64 Go pour le 120b. En dessous, Ollama débordera sur la RAM CPU et la vitesse s'effondrera.
- Espace disque
- ≈ 12-14 Go pour le 20b, ≈ 60-65 Go pour le 120b. Les poids sont stockés dans le dossier des modèles Ollama.
- Daemon en écoute
- Ollama expose son API sur http://localhost:11434 par défaut — pratique pour brancher Open WebUI ou du code par-dessus.
#Installer gpt-oss-20b en une commande
La version 20b s'installe et se lance en une seule ligne. Ollama télécharge les poids MXFP4, les charge sur le GPU et ouvre une session de chat.
Au premier lancement, comptez le temps de télécharger ~13 Go. Ensuite le modèle reste en cache. Pour juste récupérer les poids sans ouvrir de session interactive, utilisez pull.
Sur ollama ps, vous voulez voir un pourcentage GPU élevé. Si la colonne affiche « 100% CPU », c'est que le modèle n'a pas tenu en VRAM et a débordé — la génération sera lente. Sur une RTX 4090, attendez-vous à un débit confortable en interactif ; sur une 4080 16 Go, le 20b tient mais sans marge pour un gros contexte.
Pour piloter le modèle par API plutôt qu'en chat, l'endpoint est déjà là. Voici un appel minimal.
#Le 120b, pour quelles machines
La commande est identique, seul le tag change. Mais ne la lancez que si vous disposez réellement de la mémoire : sous 64 Go, Ollama va décharger une partie des experts sur le CPU et vous obtiendrez quelques tokens par seconde au mieux.
- 01Vérifier la mémoire disponibleSur GPU NVIDIA, nvidia-smi doit montrer une carte 80 Go (ou plusieurs cartes cumulant assez de VRAM). Sur Mac, une mémoire unifiée de 96 Go+ laisse la marge pour le modèle et le système.
- 02Lancer le pullLe téléchargement est conséquent (~60 Go) : prévoyez le débit et l'espace disque. Le format MXFP4 évite d'avoir à requantifier soi-même.
- 03Contrôler le placementAprès ollama run, un ollama ps dans un autre terminal confirme le taux de GPU. Un déchargement CPU massif = mémoire insuffisante, revenez au 20b.
- 04Ajuster le contexteLe 120b accepte 128k tokens, mais un contexte plein consomme beaucoup de mémoire supplémentaire. Réduisez num_ctx si vous êtes juste en VRAM.
#Régler l'effort de raisonnement
Particularité de gpt-oss : les modèles produisent une chaîne de raisonnement avant leur réponse, et vous pouvez doser cet effort. Trois niveaux — low, medium, high — arbitrent entre vitesse et profondeur. Un effort bas répond vite pour des tâches simples ; un effort haut réfléchit plus longtemps pour du math, du code ou de la logique multi-étapes.
Le réglage se passe dans le message système. Indiquez le niveau voulu, et le modèle ajuste la longueur de sa réflexion interne.
- Reasoning: low
- Réponses rapides, peu de réflexion visible. Idéal pour de la reformulation, du résumé court, des questions factuelles.
- Reasoning: medium
- Bon compromis par défaut : un peu de raisonnement sans exploser la latence.
- Reasoning: high
- Réflexion approfondie, meilleure sur les problèmes durs — au prix d'une génération plus longue et de plus de tokens consommés.
#Forces et faiblesses face à Qwen et DeepSeek
gpt-oss arrive sur un terrain déjà occupé par des open-weights très solides. Voici où il se distingue et où il reste en retrait, sans complaisance.
- Points forts
- Raisonnement et appel d'outils soignés, effort réglable, licence Apache 2.0 franche, et une empreinte mémoire maîtrisée grâce au MoE + MXFP4. Le 20b offre un rapport qualité/VRAM redoutable sur une seule carte 16 Go.
- Face à Qwen3
- Qwen reste souvent devant en multilingue et en français, avec une gamme de tailles plus large (du 4B au gros MoE). gpt-oss compense par la qualité de sa chaîne de raisonnement et la propreté de son suivi d'instructions.
- Face à DeepSeek
- Les modèles de raisonnement DeepSeek (R1 et V3.2) poussent plus loin sur les problèmes très difficiles, mais réclament beaucoup plus de matériel pour leurs grosses versions. Le 20b de gpt-oss vise le local accessible, là où DeepSeek V3.2 vise le haut de gamme.
- Faiblesse à connaître
- Le français n'est pas la priorité de gpt-oss : la qualité y est bonne mais légèrement en dessous de l'anglais, et parfois de Qwen. Testez sur vos propres prompts avant de trancher.
#Dépannage
- « unknown model » ou format non reconnu
- Votre Ollama est trop ancien pour MXFP4. Mettez à jour vers une version récente, puis relancez le pull.
- Génération très lente sur le 20b
- ollama ps montre du CPU au lieu du GPU : le modèle a débordé. Fermez les autres applis gourmandes en VRAM, réduisez num_ctx, ou vérifiez que le GPU est bien détecté.
- Le 120b crashe ou rame atrocement
- Mémoire insuffisante. Sous 64 Go réellement disponibles pour le modèle, restez sur le 20b — le 120b n'est pas fait pour votre machine.
- Réponses trop lentes en usage courant
- Baissez l'effort de raisonnement à low ou medium dans le message système : high consomme énormément de tokens de réflexion.
- Contexte qui explose la VRAM
- 128k tokens coûtent cher en mémoire. Fixez num_ctx à une valeur raisonnable (par ex. 8192) pour vos usages quotidiens.
#Pour aller plus loin
Une fois gpt-oss en place, ces guides du site aident à peaufiner votre stack locale et à comparer les modèles :
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Pour comprendre où se situe MXFP4 par rapport aux formats GGUF classiques et arbitrer qualité/mémoire sur vos autres modèles.
- Choisir son GPU pour l'IA locale
- Le guide d'achat 2026 pour dimensionner la carte selon que vous visez le 20b sur 16 Go ou des modèles plus gourmands.
- Installer DeepSeek R1 avec Ollama
- Le comparatif direct sur le terrain du raisonnement : installez R1 et jugez-le côte à côte avec gpt-oss.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.