Phi-4 de Microsoft en local : le petit modèle qui surprend
Phi-4 est le petit modèle de Microsoft qui a fait beaucoup de bruit fin 2024 : 14 milliards de paramètres seulement, et pourtant des scores en maths et en code qui titillent des modèles trois fois plus gros. Ce guide montre comment installer Phi-4 Ollama en local, ce qu'il vaut vraiment dans la pratique, et où il déçoit — notamment en français.
#Pourquoi Phi-4 ?
Phi-4 est la suite logique de la famille Phi de Microsoft Research : des modèles de petite taille, entraînés majoritairement sur des données synthétiques très soignées, pensés pour rivaliser avec des modèles bien plus gros sur les tâches de raisonnement. La version 4 sortie fin 2024 pousse cette approche à 14B de paramètres et obtient des scores remarquables sur GPQA, MATH et HumanEval — souvent au-dessus de Llama 3.3 70B sur ces benchmarks spécifiques.
Concrètement, c'est un modèle qui rentre dans 9 Go de VRAM en Q4_K_M, donc accessible à un GPU 12 Go d'entrée de gamme comme une RTX 3060 ou une RTX 4070. Et il s'en tire honorablement même en CPU pur si vous avez 16 Go de RAM. C'est cet équilibre taille/qualité qui en fait un excellent candidat pour l'auto-hébergement modeste.
#Prérequis
- Ollama installé
- Windows, macOS ou Linux. Si ce n'est pas encore fait, le guide d'installation Ollama prend 3 minutes.
- VRAM pour la quantization Q4_K_M
- ≈ 9 Go. Une RTX 3060 12 Go, RTX 4070 12 Go ou un Mac avec 16 Go de mémoire unifiée passent sans souci.
- RAM CPU si pas de GPU
- 16 Go minimum pour Q4. Comptez 4 à 8 tokens/sec sur un Ryzen 5 ou Core i5 récent — utilisable pour des tests, pas pour du chat fluide.
- 10 Go d'espace disque
- Le modèle Q4_K_M pèse environ 9 Go. Prévoyez plus si vous voulez aussi tester Phi-4-Mini en parallèle.
#1. Installer Ollama
Si Ollama est déjà en place, sautez directement à la section suivante. Sinon, voici l'installation en une commande sur Linux et macOS.
Sur Windows, téléchargez l'installateur depuis le site officiel.
Une fois installé, le daemon Ollama écoute sur le port 11434.
#2. Récupérer Phi-4
Phi-4 est disponible dans le catalogue officiel Ollama. Le tag par défaut récupère la quantization Q4_K_M, qui est le compromis recommandé.
Le téléchargement fait environ 9 Go. Pour explicitement viser une autre quantization, précisez le tag.
#3. Premiers tests : maths, code, raisonnement
Démarrez une session interactive pour vérifier que le modèle tourne et tester ses points forts.
Vous devriez voir un prompt `>>>`. C'est là que Phi-4 brille : les exercices logiques et techniques. Quelques prompts révélateurs :
Phi-4 va dérouler le raisonnement étape par étape et arriver au résultat. Pour du code, il gère sans broncher Python et JavaScript standards.
#4. Qualité française : les vraies faiblesses
C'est ici que Phi-4 montre ses limites. Le modèle a été entraîné majoritairement sur de l'anglais (et beaucoup de données synthétiques générées en anglais). Le français est présent dans le corpus mais clairement secondaire.
- Grammaire et accords
- Bons sur des phrases simples, mais accords fautifs, anglicismes et tournures lourdes dès qu'on demande de la rédaction longue.
- Vocabulaire technique FR
- Tendance à utiliser les termes anglais ("endpoint", "deployment", "thread") même quand un équivalent français usuel existe.
- Compréhension
- Comprend très bien un prompt en français. Le souci est la production.
- Code commenté en FR
- Les commentaires de code basculent fréquemment en anglais en cours de génération. Donnez la consigne explicitement, ça aide mais ne résout pas tout.
- Culture FR
- Faible. Connaissance superficielle de la jurisprudence, de l'histoire ou des institutions françaises. Tout sauf un modèle pour rédiger une note juridique en FR.
Astuce qui aide un peu : un system prompt strict force le modèle à rester en français, au prix de réponses parfois plus courtes.
#5. Phi-4-Mini : la version 3.8B
Microsoft a publié en parallèle Phi-4-Mini, une variante 3.8B qui vise les configurations très contraintes : laptop sans GPU dédié, Raspberry Pi 5, edge devices. Avec 2,5 Go en Q4, elle tourne sur n'importe quelle machine moderne.
- VRAM/RAM nécessaire
- ≈ 2,5 Go en Q4_K_M. Passe sur un MacBook Air M1 8 Go ou un PC avec un GPU 4 Go.
- Vitesse
- Très rapide. 80+ tok/sec sur RTX 3060, 30+ tok/sec sur CPU récent.
- Forces
- Suit bien les instructions courtes, OK pour de l'aide au prompt, de la reformulation simple, de la classification.
- Faiblesses
- Raisonnement complexe et code long sont au-dessus de ses capacités. C'est un modèle d'appoint, pas un remplaçant de la version 14B.
#6. Phi-4 vs Qwen 2.5 14B
À taille égale, le concurrent direct est Qwen 2.5 14B d'Alibaba. Les deux modèles font 14B, occupent à peu près la même VRAM, et ciblent la même catégorie d'utilisateurs. Ce qui les distingue :
- Raisonnement et maths
- Phi-4 prend l'avantage sur les benchmarks formels (GPQA, MATH). En usage pratique sur des problèmes courants, l'écart est plus mince qu'on ne le croit.
- Code
- Qwen 2.5 14B est globalement meilleur sur les langages moins courants (Rust, Go, SQL avancé). Phi-4 est compétitif sur Python et JS.
- Français
- Qwen 2.5 est nettement meilleur. Plus de données multilingues dans son entraînement, vocabulaire plus riche, moins de basculements en anglais. Avantage net Qwen sur ce critère.
- Contexte
- Qwen 2.5 14B accepte jusqu'à 128k tokens en contexte étendu, Phi-4 plafonne à 16k. Si vous travaillez sur des longs documents, Qwen est plus adapté.
- Suivi d'instructions
- Phi-4 colle plus précisément à des instructions structurées (format JSON, contraintes strictes). Qwen est un peu plus "créatif" et peut prendre des libertés.
#Dépannage
- "Out of memory" au chargement
- Votre VRAM ne suffit pas pour la quantization choisie. Passez à Q4_K_M (la plus légère utile), ou laissez Ollama faire l'offload partiel CPU avec `ollama run phi4 --num-gpu N` où N est le nombre de couches à mettre sur GPU.
- Génération à 1–2 tokens/sec sur une machine équipée d'un GPU
- Le modèle est probablement en CPU. Vérifiez avec `ollama ps` la colonne "PROCESSOR". Si elle indique 100% CPU, libérez de la VRAM (Chrome, jeux, autres modèles chargés) et relancez.
- Réponses qui basculent en anglais en cours de route
- Comportement attendu sur Phi-4 en français. Renforcer le system prompt aide partiellement. Pour un usage francophone récurrent, changez de modèle plutôt que de lutter.
- Contexte tronqué à 4096 tokens
- Ollama charge par défaut un contexte court. Étendez-le explicitement : `/set parameter num_ctx 16384`. Au-delà, Phi-4 a été entraîné jusqu'à 16k seulement — inutile de pousser plus haut.
- Le modèle hallucine des faits récents
- Phi-4 a une connaissance figée à sa date d'entraînement (fin 2024) et une culture générale plus faible que des modèles plus gros. Pour du factuel à jour, il faut un pipeline RAG, pas le modèle nu.
#Pour aller plus loin
Phi-4 est un bon point d'entrée dans les LLM 14B en local. Quelques pistes pour aller plus loin avec votre installation :
- Tester un concurrent direct
- Le guide de tests Qwen 3 montre des benchmarks comparables sur du matériel grand public, utile pour faire la comparaison sur vos propres prompts.
- Choisir la bonne quantization
- Le guide "Choisir sa quantification (Q4, Q5, Q8, FP16)" détaille les compromis qualité/mémoire qui s'appliquent aussi à Phi-4.
- Faire tourner Phi-4 sans GPU
- Si vous êtes en CPU pur, le guide "Faire tourner un LLM en local sans GPU" complète ce qui est décrit ici avec des optimisations spécifiques.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.