Intermédiaire 10 minOllama

Mistral Magistral : installer le modèle de raisonnement français en local

Magistral est le modèle de raisonnement de Mistral AI : un modèle qui « pense à voix haute » avant de répondre, à la manière de DeepSeek R1 ou OpenAI o1, mais avec une qualité native en français qu'aucun autre modèle de raisonnement open-weight n'atteint. Ce guide montre comment installer Mistral Magistral en local via Ollama, le configurer avec le bon prompt template, et le comparer honnêtement à DeepSeek R1 distillé.

Par Mohamed Meguedmi·Màj 2026-06-05·Testé sur Windows, macOS, Linux

#Pourquoi Magistral plutôt qu'un autre modèle de raisonnement ?

Les modèles de raisonnement (reasoning models) génèrent une chaîne de pensée explicite avant la réponse finale. Sur des problèmes complexes — maths, logique, code délicat, analyse juridique — ils gagnent 10 à 30 points sur les benchmarks par rapport à un modèle généraliste de même taille. Le coût : ils sont plus lents et bavards.

Jusqu'à Magistral, les options open-weights étaient surtout chinoises : DeepSeek R1 et ses distillations, Qwen3 en mode thinking, GLM. Toutes raisonnent parfaitement en anglais et en chinois, mais leur chaîne de pensée bascule régulièrement en chinois même quand le prompt est en français. Magistral est entraîné spécifiquement pour garder la trace de raisonnement dans la langue du prompt.

Raisonnement multilingue natif
La chaîne de pensée reste en français quand vous écrivez en français. Pas de bascule sauvage vers le chinois ou l'anglais.
Apache 2.0 sur la version Small
Usage commercial autorisé, fine-tuning libre, redistribution permise. Aucune zone grise comme avec certaines licences "open" restrictives.
Base Mistral Small 3.1
Bonne qualité d'écriture FR héritée de la base, ce qui se voit sur la rédaction de réponses juridiques ou administratives.
Contexte 40k tokens
Suffisant pour un long énoncé de problème, plusieurs articles de code, ou un contrat de quelques dizaines de pages.
i
Raisonnement = tokens supplémentaires
Comptez 500 à 3000 tokens de "thinking" avant chaque réponse finale. Sur GPU modeste, prévoyez de la patience : une question complexe peut prendre 30 à 60 secondes de génération continue avant la première ligne utile.

#Magistral Small vs Magistral Medium

Mistral AI publie Magistral en deux versions, et la confusion est fréquente. Pour installer mistral magistral en local, seule la version Small est exploitable — la Medium n'est disponible que via l'API.

Magistral Small (24B)
Open-weights Apache 2.0. C'est CE modèle qu'on installe en local. 24 milliards de paramètres, dérivé de Mistral Small 3.1.
Magistral Medium
Propriétaire, accessible uniquement via l'API Mistral ou Le Chat. Performances supérieures mais pas auto-hébergeable. Hors-sujet pour ce guide.
Petite astuce de nommage
Sur Ollama Hub, le modèle s'appelle simplement `magistral`. Pas besoin de préciser "small" : la version Medium n'est pas distribuée en local de toute façon.

#Prérequis matériel

Magistral Small fait 24B paramètres. En quantization Q4_K_M (le standard Ollama), comptez environ 14 Go de VRAM pour charger le modèle, plus 1 à 3 Go pour le contexte selon la longueur.

Minimum confortable
RTX 4080 16 Go, RTX 4090 24 Go, RTX 3090 24 Go, ou Mac Apple Silicon avec 24 Go de mémoire unifiée.
Marginal mais jouable
RTX 4070 Ti Super 16 Go (Q4 tient pile, contexte court obligatoire) ou Mac M-series 16 Go avec offload partiel.
Insuffisant
Tout GPU 12 Go ou moins. Le modèle déborde sur la RAM CPU et tombe à 2-4 tokens/sec, inutilisable pour un modèle qui doit en produire des milliers avant de répondre.
Ollama et drivers
Ollama ≥ 0.5.x, drivers NVIDIA récents (CUDA 12), ou Metal sur Mac. Vérifiez avec `ollama --version`.
!
Pas de GPU 24 Go ? Reconsidérez
Magistral n'est pas un modèle à essayer sans GPU musclé. Sur 12 Go ou moins, vous attendrez plusieurs minutes par réponse. Tournez-vous plutôt vers une distillation 7B-14B de DeepSeek R1 — moins bonne en FR, mais utilisable sur du matériel modeste.

#1. Installation via Ollama

Magistral Small est publié sur Ollama Hub depuis la sortie officielle de Mistral. L'installation tient en une commande.

  1. 01
    Vérifiez qu'Ollama tourne
    Sur Windows/macOS, l'application doit être lancée (icône dans la barre des tâches). Sur Linux, `systemctl status ollama` confirme le service actif.
  2. 02
    Télécharger le modèle
    La quantization par défaut servie par Ollama est Q4_K_M. C'est le bon compromis pour 16-24 Go de VRAM.
  3. 03
    Premier lancement
    Ollama télécharge ~14 Go au premier `pull`. Le téléchargement initial peut prendre 10 à 30 minutes selon votre connexion.
  4. 04
    Test de chargement
    Lancez `ollama run magistral` puis une question courte. Si le modèle répond après 5-10 secondes de "warmup", tout va bien.
Terminal
ollama pull magistral
ollama run magistral

Pour vérifier que le modèle utilise bien le GPU et non la RAM CPU, une commande de contrôle :

Statut runtime
ollama ps

Dans la colonne PROCESSOR, vous devez voir `100% GPU`. Si vous voyez `45% CPU / 55% GPU`, votre VRAM est insuffisante : Ollama a fallback partiellement sur la RAM. Le modèle marchera, mais à 1-3 tokens/sec.

#2. Le prompt template officiel

Magistral utilise un format de prompt spécifique pour activer correctement le raisonnement. Ollama embarque déjà ce template dans le Modelfile officiel, mais il vaut mieux le comprendre pour ne pas le sabouler involontairement avec un system prompt mal placé.

La structure attendue, simplifiée :

Format brut (interne au modèle)
<s>[SYSTEM_PROMPT]Vous êtes un assistant qui raisonne soigneusement avant de répondre.[/SYSTEM_PROMPT][INST]Question utilisateur[/INST]
<think>
Chaîne de raisonnement interne...
</think>
Réponse finale</s>

Concrètement, vous n'écrivez jamais ces balises à la main : Ollama les insère automatiquement. Ce qu'il faut savoir : le modèle attend que vous lui demandiez de raisonner. Un system prompt court et clair améliore nettement la qualité.

Configurer le system prompt
ollama run magistral
>>> /set system "Tu es un assistant rigoureux. Avant chaque réponse, analyse le problème étape par étape en français. Réponds de manière concise après ton raisonnement."
Inutile de demander "réfléchis bien"
Contrairement à un modèle généraliste, Magistral raisonne par défaut. Inutile d'écrire "prends ton temps" ou "pense étape par étape" : c'est déjà son mode normal. En revanche, lui demander explicitement de raisonner en français dans le system prompt aide à verrouiller la langue.

#3. Premiers tests pratiques en français

Voici trois prompts pour évaluer rapidement Magistral sur des tâches typiques. Notez que les réponses arrivent en deux temps : d'abord la chaîne de pensée (`<think>...</think>`), puis la réponse finale.

Test 1 — Problème logique
>>> Trois personnes se partagent 17 chevaux selon les proportions 1/2, 1/3, 1/9. Comment faire sans couper aucun cheval ?

Magistral va dérouler le raisonnement classique du chameau emprunté. Comptez 1500 à 2500 tokens de thinking avant la réponse finale claire et numérotée.

Test 2 — Code Python
>>> Écris une fonction Python qui trouve le plus long sous-tableau dont la somme vaut zéro. Complexité O(n).

Bonne occasion de voir la qualité algorithmique. Magistral propose en général la solution avec dictionnaire de sommes préfixes, en commentant son choix de structure de données pendant le thinking.

Test 3 — Rédaction juridique FR
>>> Rédige une clause de non-concurrence pour un CDI de développeur en France, conforme au droit du travail français actuel.

Sur ce type de demande, la qualité linguistique FR de Magistral fait la différence. La clause produite est syntaxiquement correcte, mentionne les conditions de validité (limitation dans le temps, l'espace, contrepartie financière), et utilise le vocabulaire juridique français — pas une traduction maladroite d'anglais.

#4. Performances : AIME, math, code

Mistral AI a communiqué des chiffres officiels sur Magistral Small et Medium. Les valeurs ci-dessous sont les scores Small (la seule version qu'on auto-héberge), arrondies. Elles ne servent que de repères — vos résultats varient selon la quantization et le sampling.

AIME 2024 (maths olympiades)
Magistral Small ~70%, contre ~50% pour Mistral Small 3.1 non-raisonneur. Le gain du mode reasoning est massif sur ce type de problème.
LiveCodeBench (code)
Score équivalent ou légèrement supérieur à Qwen 2.5 Coder 32B sur les problèmes de niveau medium, en deçà sur les niveaux hard.
MMLU FR
Comparable à Mistral Small 3.1 base — le raisonnement n'apporte rien sur les QCM de connaissances générales, où la réponse est soit mémorisée soit non.
GPQA Diamond (raisonnement scientifique)
Gain net du mode thinking, autour de 50-55% contre 35-40% pour la base sans raisonnement.
i
Quantization et perte de qualité
Tous les benchmarks officiels sont mesurés en FP16. En Q4_K_M (le défaut Ollama), comptez 1 à 3 points de perte sur AIME. Si vous avez 24 Go de VRAM, passer en Q5_K_M ou Q6_K récupère cette marge — au prix d'un débit légèrement inférieur.

#5. Magistral Small vs DeepSeek R1 distillé 14B

La comparaison utile pour le francophone est avec DeepSeek-R1-Distill-Qwen-14B, le concurrent direct en open-weights pour qui veut du raisonnement local. Les deux ont leurs forces — voici ce que les tests pratiques montrent.

Empreinte mémoire
DeepSeek R1 14B Q4 ≈ 9 Go, Magistral 24B Q4 ≈ 14 Go. Avantage net DeepSeek si votre GPU plafonne à 12 Go.
Qualité du raisonnement en FR
Magistral garde le français du début à la fin. DeepSeek R1 distillé bascule régulièrement en chinois ou en anglais dans la chaîne de pensée, même avec un system prompt FR strict. Avantage Magistral.
Qualité de la réponse finale FR
Magistral produit du français de meilleure facture (vocabulaire, accords, registre). DeepSeek R1 14B fait des coquilles d'usage typiques d'un modèle traduit. Avantage Magistral.
Maths pures (AIME, AMC)
DeepSeek R1 distillé 14B est légèrement meilleur que Magistral Small sur les problèmes très formels. Avantage DeepSeek.
Code
Match nul en pratique. Les deux génèrent du code correct sur des problèmes medium. Sur du code FR (commentaires, noms de variables), Magistral est plus propre.
Vitesse de génération
DeepSeek 14B est ~1,7× plus rapide à VRAM équivalente, simple effet de la taille. Pour une session interactive, ça compte.
Le verdict pratique
Si vous travaillez majoritairement en français — droit, écriture, support utilisateur, code commenté en FR — Magistral Small est meilleur. Si vous travaillez sur des maths formelles ou un GPU 12 Go, restez sur DeepSeek R1 distillé 14B.

#6. Cas d'usage : analyse juridique en local

Le combo qualité FR + raisonnement + auto-hébergement fait de Magistral un excellent candidat pour des tâches juridiques sensibles. Le contenu juridique ne quitte jamais votre machine — argument décisif face à un cabinet qui ne peut pas envoyer ses dossiers chez OpenAI.

Trois cas concrets qui marchent bien :

Analyse de clause contractuelle
Coller une clause, demander l'identification des risques pour l'une ou l'autre partie. Magistral explicite son raisonnement, ce qui rend l'analyse auditable — un humain peut vérifier où le modèle a vu un problème.
Comparaison de versions
Coller deux versions d'un avenant, demander la liste des différences matérielles (pas cosmétiques) et leur impact. Le mode raisonnement aide à séparer le bruit du substantiel.
Rédaction de note interne
Demander une note de synthèse à partir d'un texte de loi ou d'un arrêt. La qualité linguistique FR est ici le facteur différenciant.
Exemple prompt juridique
>>> /set system "Tu es un juriste qui analyse les contrats en droit français. Raisonne méthodiquement avant de conclure. Cite les principes juridiques mobilisés."
>>> Analyse cette clause de mobilité géographique : [coller le texte]
!
Le LLM ne remplace pas un avocat
Magistral peut halluciner du droit français — citer un article qui n'existe pas, mal référencer un arrêt. Sa valeur est de structurer la pensée juridique et accélérer un premier jet, pas de produire une conclusion à signer en l'état. Tout passage destiné à un client ou un juge doit être validé par un humain compétent.

#Dépannage

Le modèle bascule en anglais dans le thinking
Renforcez le system prompt avec une consigne explicite : "Réfléchis et réponds uniquement en français." Si cela ne suffit pas, ajoutez un premier message court en FR pour ancrer la langue avant la vraie question.
Réponses tronquées avant la conclusion
Le modèle a épuisé son budget de tokens dans le thinking. Augmentez la fenêtre avec `/set parameter num_ctx 16384` et `/set parameter num_predict 4096`.
Génération à 1-2 tokens/sec
Le modèle est sur CPU ou en offload partiel. `ollama ps` confirme. Solutions : libérer de la VRAM (fermer Chrome / Steam), passer à une quantization plus agressive comme Q3_K_M, ou accepter que ce GPU ne suffit pas.
Les balises <think> apparaissent dans la réponse finale
Comportement attendu en mode brut. Une interface comme Open WebUI ou LM Studio les replie automatiquement dans un bloc "reasoning" collapsable. En CLI Ollama, elles restent visibles — c'est par design.
Modèle "hallucine" sur des faits récents
Magistral Small est figé à sa date d'entraînement. Pour des questions factuelles à jour (jurisprudence récente, actualité), il faut un pipeline RAG, pas juste le modèle nu.

#Pour aller plus loin

Magistral est un excellent modèle FR pour qui a le GPU. Quelques pistes pour exploiter au mieux votre installation :

Comparer avec DeepSeek R1 sur votre machine
Le guide d'installation DeepSeek R1 montre comment installer la distillation 14B en parallèle de Magistral pour tester côte à côte sur vos propres prompts.
Brancher Magistral sur vos PDF juridiques
Le guide PrivateGPT v2 décrit un pipeline RAG 100% local qui complète parfaitement Magistral pour de l'analyse documentaire confidentielle.
Choisir la quantification la plus adaptée
Si vous hésitez entre Q4_K_M, Q5_K_M ou Q6_K, le guide "Choisir sa quantification" pose les compromis. Sur un modèle de raisonnement, les pertes de quantization se voient plus que sur un généraliste.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.