Débutant 8 minOllama

Phi-4 de Microsoft en local : le petit modèle qui surprend

Phi-4 est le petit modèle de Microsoft qui a fait beaucoup de bruit fin 2024 : 14 milliards de paramètres seulement, et pourtant des scores en maths et en code qui titillent des modèles trois fois plus gros. Ce guide montre comment installer Phi-4 Ollama en local, ce qu'il vaut vraiment dans la pratique, et où il déçoit — notamment en français.

Par Mohamed Meguedmi·Màj 2026-06-05·Testé sur Windows, macOS, Linux

#Pourquoi Phi-4 ?

Phi-4 est la suite logique de la famille Phi de Microsoft Research : des modèles de petite taille, entraînés majoritairement sur des données synthétiques très soignées, pensés pour rivaliser avec des modèles bien plus gros sur les tâches de raisonnement. La version 4 sortie fin 2024 pousse cette approche à 14B de paramètres et obtient des scores remarquables sur GPQA, MATH et HumanEval — souvent au-dessus de Llama 3.3 70B sur ces benchmarks spécifiques.

Concrètement, c'est un modèle qui rentre dans 9 Go de VRAM en Q4_K_M, donc accessible à un GPU 12 Go d'entrée de gamme comme une RTX 3060 ou une RTX 4070. Et il s'en tire honorablement même en CPU pur si vous avez 16 Go de RAM. C'est cet équilibre taille/qualité qui en fait un excellent candidat pour l'auto-hébergement modeste.

i
En deux mots
Phi-4 = 14B, fort en maths et en code, faible en culture générale et en français, licence MIT. Idéal si vous voulez un "petit costaud" pour des tâches techniques sur un GPU 12 Go.

#Prérequis

Ollama installé
Windows, macOS ou Linux. Si ce n'est pas encore fait, le guide d'installation Ollama prend 3 minutes.
VRAM pour la quantization Q4_K_M
≈ 9 Go. Une RTX 3060 12 Go, RTX 4070 12 Go ou un Mac avec 16 Go de mémoire unifiée passent sans souci.
RAM CPU si pas de GPU
16 Go minimum pour Q4. Comptez 4 à 8 tokens/sec sur un Ryzen 5 ou Core i5 récent — utilisable pour des tests, pas pour du chat fluide.
10 Go d'espace disque
Le modèle Q4_K_M pèse environ 9 Go. Prévoyez plus si vous voulez aussi tester Phi-4-Mini en parallèle.
Cas CPU-only
Phi-4 est l'un des rares 14B vraiment utilisables sans GPU. Sur un Ryzen 7 5800X ou un Intel i7-12700, on tourne autour de 5 tok/sec en Q4 — lent mais OK pour une question à la fois. Pour un usage interactif, visez quand même un GPU.

#1. Installer Ollama

Si Ollama est déjà en place, sautez directement à la section suivante. Sinon, voici l'installation en une commande sur Linux et macOS.

Linux / macOS
curl -fsSL https://ollama.com/install.sh | sh

Sur Windows, téléchargez l'installateur depuis le site officiel.

Lien officiel Windows
https://ollama.com/download/windows

Une fois installé, le daemon Ollama écoute sur le port 11434.

Vérification
ollama --version
curl http://localhost:11434/api/tags

#2. Récupérer Phi-4

Phi-4 est disponible dans le catalogue officiel Ollama. Le tag par défaut récupère la quantization Q4_K_M, qui est le compromis recommandé.

Terminal
ollama pull phi4

Le téléchargement fait environ 9 Go. Pour explicitement viser une autre quantization, précisez le tag.

Variantes
ollama pull phi4:14b-q4_K_M    # ≈ 9 Go  (défaut)
ollama pull phi4:14b-q5_K_M    # ≈ 10 Go
ollama pull phi4:14b-q8_0      # ≈ 15 Go
ollama pull phi4:14b-fp16      # ≈ 29 Go (sans quantization)
Quelle quantization choisir
Pour Phi-4, Q4_K_M reste le meilleur compromis sur du matériel grand public. La différence avec Q5_K_M est marginale en pratique sur ce modèle, et Q8_0 demande 15 Go de VRAM pour un gain qualitatif difficile à percevoir hors benchmarks.

#3. Premiers tests : maths, code, raisonnement

Démarrez une session interactive pour vérifier que le modèle tourne et tester ses points forts.

Session
ollama run phi4

Vous devriez voir un prompt `>>>`. C'est là que Phi-4 brille : les exercices logiques et techniques. Quelques prompts révélateurs :

Test maths
>>> Une boutique vend des stylos à 0,80 € pièce. Si vous en achetez 12 ou plus, le prix tombe à 0,65 € pièce. À partir de combien de stylos est-il plus économique de commander une boîte de 12 ?

Phi-4 va dérouler le raisonnement étape par étape et arriver au résultat. Pour du code, il gère sans broncher Python et JavaScript standards.

Test code
>>> Écris une fonction Python qui prend une liste d'entiers et renvoie le sous-tableau contigu de somme maximale (algorithme de Kadane). Avec docstring et 3 cas de test.
i
Vitesse attendue
Sur RTX 4070 (12 Go) en Q4_K_M, comptez 45–60 tok/sec. Sur RTX 3060 (12 Go), 25–35 tok/sec. Sur Mac M2 24 Go, 20–30 tok/sec. Sur CPU Ryzen 5 5600X, 4–6 tok/sec.

#4. Qualité française : les vraies faiblesses

C'est ici que Phi-4 montre ses limites. Le modèle a été entraîné majoritairement sur de l'anglais (et beaucoup de données synthétiques générées en anglais). Le français est présent dans le corpus mais clairement secondaire.

Grammaire et accords
Bons sur des phrases simples, mais accords fautifs, anglicismes et tournures lourdes dès qu'on demande de la rédaction longue.
Vocabulaire technique FR
Tendance à utiliser les termes anglais ("endpoint", "deployment", "thread") même quand un équivalent français usuel existe.
Compréhension
Comprend très bien un prompt en français. Le souci est la production.
Code commenté en FR
Les commentaires de code basculent fréquemment en anglais en cours de génération. Donnez la consigne explicitement, ça aide mais ne résout pas tout.
Culture FR
Faible. Connaissance superficielle de la jurisprudence, de l'histoire ou des institutions françaises. Tout sauf un modèle pour rédiger une note juridique en FR.
!
Le verdict francophone
Pour de la rédaction française correcte, préférez Mistral Small, Magistral Small ou Qwen 2.5 14B. Phi-4 reste excellent pour des tâches où la sortie est du code ou du raisonnement structuré — et où la langue d'interaction compte peu.

Astuce qui aide un peu : un system prompt strict force le modèle à rester en français, au prix de réponses parfois plus courtes.

System prompt FR
>>> /set system "Tu réponds exclusivement en français, sans jamais basculer en anglais. Les commentaires de code, les noms de variables explicatifs et les titres restent en français."

#5. Phi-4-Mini : la version 3.8B

Microsoft a publié en parallèle Phi-4-Mini, une variante 3.8B qui vise les configurations très contraintes : laptop sans GPU dédié, Raspberry Pi 5, edge devices. Avec 2,5 Go en Q4, elle tourne sur n'importe quelle machine moderne.

Installation
ollama pull phi4-mini
VRAM/RAM nécessaire
≈ 2,5 Go en Q4_K_M. Passe sur un MacBook Air M1 8 Go ou un PC avec un GPU 4 Go.
Vitesse
Très rapide. 80+ tok/sec sur RTX 3060, 30+ tok/sec sur CPU récent.
Forces
Suit bien les instructions courtes, OK pour de l'aide au prompt, de la reformulation simple, de la classification.
Faiblesses
Raisonnement complexe et code long sont au-dessus de ses capacités. C'est un modèle d'appoint, pas un remplaçant de la version 14B.
Cas d'usage Phi-4-Mini
Excellent pour brancher derrière un workflow n8n local, faire de la classification d'e-mails, ou intégrer un LLM dans un script Python qui doit tourner vite et léger. Pas conseillé pour le chat généraliste.

#6. Phi-4 vs Qwen 2.5 14B

À taille égale, le concurrent direct est Qwen 2.5 14B d'Alibaba. Les deux modèles font 14B, occupent à peu près la même VRAM, et ciblent la même catégorie d'utilisateurs. Ce qui les distingue :

Raisonnement et maths
Phi-4 prend l'avantage sur les benchmarks formels (GPQA, MATH). En usage pratique sur des problèmes courants, l'écart est plus mince qu'on ne le croit.
Code
Qwen 2.5 14B est globalement meilleur sur les langages moins courants (Rust, Go, SQL avancé). Phi-4 est compétitif sur Python et JS.
Français
Qwen 2.5 est nettement meilleur. Plus de données multilingues dans son entraînement, vocabulaire plus riche, moins de basculements en anglais. Avantage net Qwen sur ce critère.
Contexte
Qwen 2.5 14B accepte jusqu'à 128k tokens en contexte étendu, Phi-4 plafonne à 16k. Si vous travaillez sur des longs documents, Qwen est plus adapté.
Suivi d'instructions
Phi-4 colle plus précisément à des instructions structurées (format JSON, contraintes strictes). Qwen est un peu plus "créatif" et peut prendre des libertés.
Comment choisir
Travail en anglais sur du raisonnement, du code Python, de la sortie structurée : Phi-4. Travail en français, contexte long, code multi-langage : Qwen 2.5 14B. Sur un GPU 12 Go, vous pouvez de toute façon installer les deux et basculer selon la tâche.

#Dépannage

"Out of memory" au chargement
Votre VRAM ne suffit pas pour la quantization choisie. Passez à Q4_K_M (la plus légère utile), ou laissez Ollama faire l'offload partiel CPU avec `ollama run phi4 --num-gpu N` où N est le nombre de couches à mettre sur GPU.
Génération à 1–2 tokens/sec sur une machine équipée d'un GPU
Le modèle est probablement en CPU. Vérifiez avec `ollama ps` la colonne "PROCESSOR". Si elle indique 100% CPU, libérez de la VRAM (Chrome, jeux, autres modèles chargés) et relancez.
Réponses qui basculent en anglais en cours de route
Comportement attendu sur Phi-4 en français. Renforcer le system prompt aide partiellement. Pour un usage francophone récurrent, changez de modèle plutôt que de lutter.
Contexte tronqué à 4096 tokens
Ollama charge par défaut un contexte court. Étendez-le explicitement : `/set parameter num_ctx 16384`. Au-delà, Phi-4 a été entraîné jusqu'à 16k seulement — inutile de pousser plus haut.
Le modèle hallucine des faits récents
Phi-4 a une connaissance figée à sa date d'entraînement (fin 2024) et une culture générale plus faible que des modèles plus gros. Pour du factuel à jour, il faut un pipeline RAG, pas le modèle nu.

#Pour aller plus loin

Phi-4 est un bon point d'entrée dans les LLM 14B en local. Quelques pistes pour aller plus loin avec votre installation :

Tester un concurrent direct
Le guide de tests Qwen 3 montre des benchmarks comparables sur du matériel grand public, utile pour faire la comparaison sur vos propres prompts.
Choisir la bonne quantization
Le guide "Choisir sa quantification (Q4, Q5, Q8, FP16)" détaille les compromis qualité/mémoire qui s'appliquent aussi à Phi-4.
Faire tourner Phi-4 sans GPU
Si vous êtes en CPU pur, le guide "Faire tourner un LLM en local sans GPU" complète ce qui est décrit ici avec des optimisations spécifiques.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.