Intermédiaire 10 minOpenAI

gpt-oss en local : les modèles open-weights d'OpenAI avec Ollama

OpenAI a fini par publier des poids ouverts : gpt-oss-20b et gpt-oss-120b, deux modèles à mélange d'experts sous licence Apache 2.0. Ce guide montre comment faire tourner gpt-oss avec Ollama, combien de VRAM chaque version réclame, comment fonctionne la quantification MXFP4 native et comment régler l'effort de raisonnement. On termine sur ce que valent vraiment ces open-weights face à Qwen et DeepSeek.

Par Clara M.·Màj 2026-07-24·Testé sur Windows, macOS, Linux

#Pourquoi gpt-oss change la donne

Pendant des années, OpenAI a gardé ses modèles fermés. gpt-oss est le premier retour de l'entreprise à des poids réellement téléchargeables depuis GPT-2, et cette fois sous licence Apache 2.0 : usage commercial autorisé, pas de clause de partage forcé, pas de limite d'utilisateurs. Vous téléchargez les poids, ils tournent sur votre machine, et rien ne sort de votre réseau.

Techniquement, gpt-oss repose sur une architecture MoE (Mixture of Experts) : le modèle contient beaucoup de paramètres au total, mais n'en active qu'une petite fraction à chaque token. Résultat : une qualité proche d'un gros modèle dense pour un coût mémoire et une vitesse d'un modèle bien plus petit. Les deux versions ciblent le raisonnement, l'appel d'outils et le suivi d'instructions, avec un contexte de 128k tokens.

gpt-oss-20b
≈ 21 milliards de paramètres au total, ≈ 3,6 B actifs par token. Pensé pour une seule carte grand public de 16 Go.
gpt-oss-120b
≈ 117 milliards de paramètres au total, ≈ 5,1 B actifs par token. Cible une carte data-center 80 Go ou une machine à grosse mémoire unifiée.
Licence
Apache 2.0 — commercial, redistribuable, fine-tunable sans restriction d'usage.
Quantification
MXFP4 native sur les poids des experts : le format 4 bits fait partie de la publication, pas d'une conversion tierce approximative.

#gpt-oss ollama : 20b ou 120b ?

Le choix se joue presque uniquement sur votre matériel. Les deux modèles partagent la même famille et la même mise en forme des réponses ; la différence de qualité existe mais reste secondaire face à la question « est-ce que ça rentre dans ma VRAM ». Voici le repère simple.

20b — le défaut raisonnable
Environ 14-16 Go une fois chargé en MXFP4. Tient sur une RTX 4080 16 Go ou une RTX 4090, et sur un Mac Apple Silicon à partir de 24 Go de mémoire unifiée. C'est la version à installer en premier.
120b — quand vous avez la mémoire
Environ 60-65 Go en MXFP4. Il vise un GPU 80 Go (classe H100/A100), un poste multi-GPU, ou un Mac à grosse mémoire unifiée (M3/M4 Ultra 96 Go et plus). Inutile de l'essayer sous 64 Go de mémoire disponible pour le modèle.
Qualité relative
Le 120b creuse l'écart sur le raisonnement multi-étapes, le code long et les tâches ambiguës. Sur du questions-réponses courant et du français, le 20b s'en sort déjà très bien.
i
MoE : peu de paramètres actifs, mais toute la mémoire
L'architecture MoE réduit le calcul par token, pas l'empreinte mémoire : tous les experts doivent être chargés en VRAM même si un seul groupe travaille à chaque étape. C'est pourquoi le 120b réclame ~65 Go alors qu'il n'active que ~5 B de paramètres.

#Prérequis

Rien d'exotique : une installation d'Ollama à jour et assez de mémoire pour la version visée. Ollama gère le téléchargement, la quantification MXFP4 et le déchargement GPU/CPU tout seul.

Ollama récent
Version supportant gpt-oss et MXFP4. Mettez à jour avant de commencer — les versions trop anciennes ne connaissent pas le format.
VRAM / mémoire unifiée
≥ 16 Go pour le 20b, ≥ 64 Go pour le 120b. En dessous, Ollama débordera sur la RAM CPU et la vitesse s'effondrera.
Espace disque
≈ 12-14 Go pour le 20b, ≈ 60-65 Go pour le 120b. Les poids sont stockés dans le dossier des modèles Ollama.
Daemon en écoute
Ollama expose son API sur http://localhost:11434 par défaut — pratique pour brancher Open WebUI ou du code par-dessus.
Vous n'avez pas encore Ollama ?
Suivez d'abord le guide d'installation d'Ollama pour votre OS (Windows, macOS ou Linux), puis revenez ici. Tout le reste de ce guide suppose que la commande ollama répond dans votre terminal.

#Installer gpt-oss-20b en une commande

La version 20b s'installe et se lance en une seule ligne. Ollama télécharge les poids MXFP4, les charge sur le GPU et ouvre une session de chat.

Terminal
# Télécharge et lance gpt-oss-20b
ollama run gpt-oss:20b

Au premier lancement, comptez le temps de télécharger ~13 Go. Ensuite le modèle reste en cache. Pour juste récupérer les poids sans ouvrir de session interactive, utilisez pull.

Terminal
# Récupérer sans lancer le chat
ollama pull gpt-oss:20b

# Vérifier que le modèle est présent
ollama list

# Voir s'il tourne bien sur le GPU
ollama ps

Sur ollama ps, vous voulez voir un pourcentage GPU élevé. Si la colonne affiche « 100% CPU », c'est que le modèle n'a pas tenu en VRAM et a débordé — la génération sera lente. Sur une RTX 4090, attendez-vous à un débit confortable en interactif ; sur une 4080 16 Go, le 20b tient mais sans marge pour un gros contexte.

Pour piloter le modèle par API plutôt qu'en chat, l'endpoint est déjà là. Voici un appel minimal.

API — génération
curl http://localhost:11434/api/generate -d '{
  "model": "gpt-oss:20b",
  "prompt": "Explique la quantification MXFP4 en trois phrases.",
  "stream": false
}'

#Le 120b, pour quelles machines

La commande est identique, seul le tag change. Mais ne la lancez que si vous disposez réellement de la mémoire : sous 64 Go, Ollama va décharger une partie des experts sur le CPU et vous obtiendrez quelques tokens par seconde au mieux.

Terminal
# ~60-65 Go de mémoire nécessaires
ollama pull gpt-oss:120b
ollama run gpt-oss:120b
  1. 01
    Vérifier la mémoire disponible
    Sur GPU NVIDIA, nvidia-smi doit montrer une carte 80 Go (ou plusieurs cartes cumulant assez de VRAM). Sur Mac, une mémoire unifiée de 96 Go+ laisse la marge pour le modèle et le système.
  2. 02
    Lancer le pull
    Le téléchargement est conséquent (~60 Go) : prévoyez le débit et l'espace disque. Le format MXFP4 évite d'avoir à requantifier soi-même.
  3. 03
    Contrôler le placement
    Après ollama run, un ollama ps dans un autre terminal confirme le taux de GPU. Un déchargement CPU massif = mémoire insuffisante, revenez au 20b.
  4. 04
    Ajuster le contexte
    Le 120b accepte 128k tokens, mais un contexte plein consomme beaucoup de mémoire supplémentaire. Réduisez num_ctx si vous êtes juste en VRAM.
!
Multi-GPU grand public : attention aux attentes
Cumuler deux RTX 4090 (48 Go) ne suffit pas au 120b, et le partage inter-GPU sur PCIe ajoute de la latence. Pour ce modèle, une seule carte 80 Go ou une grosse mémoire unifiée reste bien plus fluide qu'un bricolage multi-cartes.

#Régler l'effort de raisonnement

Particularité de gpt-oss : les modèles produisent une chaîne de raisonnement avant leur réponse, et vous pouvez doser cet effort. Trois niveaux — low, medium, high — arbitrent entre vitesse et profondeur. Un effort bas répond vite pour des tâches simples ; un effort haut réfléchit plus longtemps pour du math, du code ou de la logique multi-étapes.

Le réglage se passe dans le message système. Indiquez le niveau voulu, et le modèle ajuste la longueur de sa réflexion interne.

API — effort haut
curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:20b",
  "messages": [
    { "role": "system", "content": "Reasoning: high" },
    { "role": "user", "content": "Résous : un train part à 14h à 120 km/h, un autre à 15h à 150 km/h. Quand se rejoignent-ils ?" }
  ],
  "stream": false
}'
Reasoning: low
Réponses rapides, peu de réflexion visible. Idéal pour de la reformulation, du résumé court, des questions factuelles.
Reasoning: medium
Bon compromis par défaut : un peu de raisonnement sans exploser la latence.
Reasoning: high
Réflexion approfondie, meilleure sur les problèmes durs — au prix d'une génération plus longue et de plus de tokens consommés.
Le raisonnement se paie en tokens
Un effort « high » multiplie les tokens de réflexion avant la réponse finale. Sur des tâches simples, garder « low » ou « medium » divise nettement le temps de réponse sans perte de qualité perçue.

#Forces et faiblesses face à Qwen et DeepSeek

gpt-oss arrive sur un terrain déjà occupé par des open-weights très solides. Voici où il se distingue et où il reste en retrait, sans complaisance.

Points forts
Raisonnement et appel d'outils soignés, effort réglable, licence Apache 2.0 franche, et une empreinte mémoire maîtrisée grâce au MoE + MXFP4. Le 20b offre un rapport qualité/VRAM redoutable sur une seule carte 16 Go.
Face à Qwen3
Qwen reste souvent devant en multilingue et en français, avec une gamme de tailles plus large (du 4B au gros MoE). gpt-oss compense par la qualité de sa chaîne de raisonnement et la propreté de son suivi d'instructions.
Face à DeepSeek
Les modèles de raisonnement DeepSeek (R1 et V3.2) poussent plus loin sur les problèmes très difficiles, mais réclament beaucoup plus de matériel pour leurs grosses versions. Le 20b de gpt-oss vise le local accessible, là où DeepSeek V3.2 vise le haut de gamme.
Faiblesse à connaître
Le français n'est pas la priorité de gpt-oss : la qualité y est bonne mais légèrement en dessous de l'anglais, et parfois de Qwen. Testez sur vos propres prompts avant de trancher.

#Dépannage

« unknown model » ou format non reconnu
Votre Ollama est trop ancien pour MXFP4. Mettez à jour vers une version récente, puis relancez le pull.
Génération très lente sur le 20b
ollama ps montre du CPU au lieu du GPU : le modèle a débordé. Fermez les autres applis gourmandes en VRAM, réduisez num_ctx, ou vérifiez que le GPU est bien détecté.
Le 120b crashe ou rame atrocement
Mémoire insuffisante. Sous 64 Go réellement disponibles pour le modèle, restez sur le 20b — le 120b n'est pas fait pour votre machine.
Réponses trop lentes en usage courant
Baissez l'effort de raisonnement à low ou medium dans le message système : high consomme énormément de tokens de réflexion.
Contexte qui explose la VRAM
128k tokens coûtent cher en mémoire. Fixez num_ctx à une valeur raisonnable (par ex. 8192) pour vos usages quotidiens.

#Pour aller plus loin

Une fois gpt-oss en place, ces guides du site aident à peaufiner votre stack locale et à comparer les modèles :

Choisir sa quantification (Q4, Q5, Q8, FP16)
Pour comprendre où se situe MXFP4 par rapport aux formats GGUF classiques et arbitrer qualité/mémoire sur vos autres modèles.
Choisir son GPU pour l'IA locale
Le guide d'achat 2026 pour dimensionner la carte selon que vous visez le 20b sur 16 Go ou des modèles plus gourmands.
Installer DeepSeek R1 avec Ollama
Le comparatif direct sur le terrain du raisonnement : installez R1 et jugez-le côte à côte avec gpt-oss.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.