NPU : c'est quoi, et est-ce utile pour un LLM local ?
Un NPU, pour Neural Processing Unit, est un processeur spécialisé dans les calculs de réseaux de neurones, intégré à la puce de la plupart des ordinateurs portables vendus depuis 2024. Il exécute de petites tâches d'IA en continu, comme le flou d'arrière-plan ou les sous-titres en direct, pour quelques watts. Son chiffre vedette, les TOPS, sert d'argument sur toutes les étiquettes de « PC IA ». Au 20 septembre 2026, il ne dit pourtant presque rien de la capacité d'une machine à faire tourner un LLM en local. Voici pourquoi, et ce qu'il faut regarder à la place.
#Un NPU, c'est quoi ?
Un réseau de neurones se résume, côté calcul, à d'immenses séries de multiplications de matrices sur des nombres de faible précision. Un processeur classique sait le faire, lentement. Une carte graphique le fait vite, en consommant des dizaines à des centaines de watts. Un NPU est une portion de silicium qui ne fait que cela : des unités de calcul figées pour les entiers sur 8 et 4 bits, de petites mémoires placées juste à côté, et un ordonnanceur qui déplace les données le moins possible. Le résultat : une vitesse de pointe modeste, mais une efficacité par watt excellente.
L'idée est plus ancienne que l'étiquette. Apple intègre un Neural Engine dans ses iPhone depuis 2017 et dans tous ses Mac Apple Silicon. Ce qui a changé en 2024, c'est qu'Intel, AMD et Qualcomm ont tous placé un NPU conséquent dans leurs processeurs pour PC, et que Microsoft y a conditionné une gamme de fonctions de Windows, sous le nom Copilot+ PC.
#CPU, GPU, NPU : les différences
| CPU | GPU | NPU | |
|---|---|---|---|
| Conçu pour | La logique générale, la faible latence | Le calcul massivement parallèle, le graphisme | L'inférence de réseaux de neurones, uniquement |
| Consommation en charge IA | 15 à 125 W | 30 W (intégré) à 575 W (RTX 5090) | 1 à 10 W |
| Mémoire utilisée | La RAM du système | Sa propre VRAM, ou la RAM s'il est intégré | La RAM du système |
| Support logiciel | Universel | Très large : CUDA, ROCm, Metal, Vulkan | Étroit, propre à chaque constructeur |
| Terrain de jeu | L'orchestration, les petits modèles en dépannage | Les LLM, la génération d'images, l'entraînement | L'IA légère et permanente, sur batterie |
Les trois sont complémentaires. Sur un « PC IA », le NPU gère les effets de webcam pendant quatre heures de visioconférence pendant que le GPU dort. Demandez à la même machine de faire tourner un assistant de 14 milliards de paramètres, et le travail part sur le GPU, parce que c'est là que se trouvent la bande passante mémoire et les logiciels.
#Les TOPS : ce qu'ils mesurent, ce qu'ils cachent
TOPS signifie « milliers de milliards d'opérations par seconde », presque toujours mesurées en entiers sur 8 bits. C'est une puissance de calcul de pointe. Elle ne dit rien de la vitesse à laquelle les données arrivent jusqu'à ces unités de calcul, et c'est précisément ce qui limite un modèle de langage.
| Famille de puces | NPU annoncé | Éligible Copilot+ (40 TOPS et plus) |
|---|---|---|
| Intel Core Ultra série 1 (Meteor Lake) | ≈ 11 TOPS | Non |
| Apple M4 (Neural Engine) | 38 TOPS | Sans objet (macOS) |
| Qualcomm Snapdragon X Elite et X Plus | 45 TOPS | Oui |
| Intel Core Ultra 200V (Lunar Lake) | 48 TOPS | Oui |
| AMD Ryzen AI 300 | 50 TOPS | Oui |
| AMD Ryzen AI Max+ 395 (Strix Halo) | 50 TOPS | Oui |
#Pourquoi un NPU n'accélère pas vos LLM
Pour produire un token, un modèle doit relire l'essentiel de ses poids en mémoire. Un modèle de 14 milliards de paramètres en Q4 pèse environ 9 Go : générer 20 tokens par seconde revient à faire transiter 180 Go par seconde. Le calcul lui-même est bon marché en comparaison. La vitesse de génération suit donc la bande passante mémoire, pas la puissance de calcul.
| Où se trouve le modèle | Bande passante | Plafond pour un modèle de 9 Go |
|---|---|---|
| LPDDR5X de portable (ce que partagent NPU et GPU intégré) | ≈ 70 à 135 Go/s | ≈ 8 à 15 tok/s |
| Mémoire unifiée du Ryzen AI Max+ 395 | 256 Go/s | ≈ 28 tok/s |
| RTX 4070 (GDDR6X) | 504 Go/s | ≈ 56 tok/s |
| RTX 5070 Ti (GDDR7) | 896 Go/s | ≈ 100 tok/s |
| RTX 5090 (GDDR7) | 1 792 Go/s | ≈ 200 tok/s |
Un NPU de 50 TOPS se trouve sur la première ligne. Il puise dans la même LPDDR5X que le processeur : quel que soit son nombre de TOPS, il ne peut pas aller plus vite que cette mémoire. Un portable à 45 TOPS et un portable à 50 TOPS écriront du texte à la même vitesse si leur mémoire est identique.
Là où un NPU peut aider, c'est sur la lecture du prompt, phase gourmande en calcul. Des montages hybrides qui confient cette lecture au NPU et la génération au GPU intégré réduisent l'attente avant le premier mot et la consommation, sur de petits modèles. C'est un gain d'autonomie, pas un moyen de faire tourner de plus gros modèles.
#Le vrai frein : le logiciel
- Ollama, llama.cpp, LM Studio
- Ils tournent sur le GPU ou le CPU. Sur un portable Copilot+, ils utilisent le GPU intégré ou le processeur et ignorent le NPU.
- Windows
- Les modèles embarqués de Microsoft et son environnement Foundry Local visent le NPU via ONNX Runtime, avec une sélection de petits modèles.
- AMD
- Ryzen AI Software et le serveur Lemonade exécutent certains modèles ONNX en mode hybride, NPU et GPU intégré.
- Intel
- OpenVINO sait cibler le NPU pour les modèles pris en charge.
- Qualcomm
- La chaîne d'outils QNN et AI Hub fournissent des modèles déjà convertis pour le NPU Hexagon.
- Apple
- Core ML utilise le Neural Engine, mais les outils de LLM réellement utilisés sur Mac (MLX, llama.cpp, Ollama) passent par le GPU, via Metal.
Le point commun : passer par le NPU, c'est choisir dans une courte liste de modèles convertis par le constructeur, en général de 1 à 8 milliards de paramètres, et non télécharger n'importe quel GGUF pour le lancer.
- Ryzen AI 9 HX : ce que donne vraiment le NPU avec un LLM local
- Snapdragon X Elite : LLM local sur PC ARM
#Que regarder à la place avant d'acheter
- 01La mémoire que le GPU peut utiliser
- 02La bande passante de cette mémoire
- 03Le chemin logiciel
- 04Les TOPS du NPU
- Matériel pour l'IA locale : nos fiches machines
- Mini-PC Ryzen AI Max+ 395 : le cas où la mémoire unifiée change la donne
- Quel GPU pour un LLM local ?
- Microsoft : les appareils Copilot+ et leur NPU
#FAQ
Que signifie NPU ?+
Un NPU est-il meilleur qu'un GPU pour l'IA ?+
Ollama ou LM Studio utilisent-ils le NPU ?+
Faut-il un NPU pour faire tourner une IA en local ?+
Combien de TOPS faut-il ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.