Débutant 10 minNPU

NPU : c'est quoi, et est-ce utile pour un LLM local ?

Un NPU, pour Neural Processing Unit, est un processeur spécialisé dans les calculs de réseaux de neurones, intégré à la puce de la plupart des ordinateurs portables vendus depuis 2024. Il exécute de petites tâches d'IA en continu, comme le flou d'arrière-plan ou les sous-titres en direct, pour quelques watts. Son chiffre vedette, les TOPS, sert d'argument sur toutes les étiquettes de « PC IA ». Au 20 septembre 2026, il ne dit pourtant presque rien de la capacité d'une machine à faire tourner un LLM en local. Voici pourquoi, et ce qu'il faut regarder à la place.

Par Mohamed Meguedmi·Màj 2026-09-20·Testé sur Windows, macOS, Linux

#Un NPU, c'est quoi ?

Un réseau de neurones se résume, côté calcul, à d'immenses séries de multiplications de matrices sur des nombres de faible précision. Un processeur classique sait le faire, lentement. Une carte graphique le fait vite, en consommant des dizaines à des centaines de watts. Un NPU est une portion de silicium qui ne fait que cela : des unités de calcul figées pour les entiers sur 8 et 4 bits, de petites mémoires placées juste à côté, et un ordonnanceur qui déplace les données le moins possible. Le résultat : une vitesse de pointe modeste, mais une efficacité par watt excellente.

L'idée est plus ancienne que l'étiquette. Apple intègre un Neural Engine dans ses iPhone depuis 2017 et dans tous ses Mac Apple Silicon. Ce qui a changé en 2024, c'est qu'Intel, AMD et Qualcomm ont tous placé un NPU conséquent dans leurs processeurs pour PC, et que Microsoft y a conditionné une gamme de fonctions de Windows, sous le nom Copilot+ PC.

#CPU, GPU, NPU : les différences

CPUGPUNPU
Conçu pourLa logique générale, la faible latenceLe calcul massivement parallèle, le graphismeL'inférence de réseaux de neurones, uniquement
Consommation en charge IA15 à 125 W30 W (intégré) à 575 W (RTX 5090)1 à 10 W
Mémoire utiliséeLa RAM du systèmeSa propre VRAM, ou la RAM s'il est intégréLa RAM du système
Support logicielUniverselTrès large : CUDA, ROCm, Metal, VulkanÉtroit, propre à chaque constructeur
Terrain de jeuL'orchestration, les petits modèles en dépannageLes LLM, la génération d'images, l'entraînementL'IA légère et permanente, sur batterie

Les trois sont complémentaires. Sur un « PC IA », le NPU gère les effets de webcam pendant quatre heures de visioconférence pendant que le GPU dort. Demandez à la même machine de faire tourner un assistant de 14 milliards de paramètres, et le travail part sur le GPU, parce que c'est là que se trouvent la bande passante mémoire et les logiciels.

#Les TOPS : ce qu'ils mesurent, ce qu'ils cachent

TOPS signifie « milliers de milliards d'opérations par seconde », presque toujours mesurées en entiers sur 8 bits. C'est une puissance de calcul de pointe. Elle ne dit rien de la vitesse à laquelle les données arrivent jusqu'à ces unités de calcul, et c'est précisément ce qui limite un modèle de langage.

Chiffres des constructeurs · les méthodes de mesure diffèrent, un écart de quelques points n'est pas significatif
Famille de pucesNPU annoncéÉligible Copilot+ (40 TOPS et plus)
Intel Core Ultra série 1 (Meteor Lake)≈ 11 TOPSNon
Apple M4 (Neural Engine)38 TOPSSans objet (macOS)
Qualcomm Snapdragon X Elite et X Plus45 TOPSOui
Intel Core Ultra 200V (Lunar Lake)48 TOPSOui
AMD Ryzen AI 30050 TOPSOui
AMD Ryzen AI Max+ 395 (Strix Halo)50 TOPSOui

#Pourquoi un NPU n'accélère pas vos LLM

Pour produire un token, un modèle doit relire l'essentiel de ses poids en mémoire. Un modèle de 14 milliards de paramètres en Q4 pèse environ 9 Go : générer 20 tokens par seconde revient à faire transiter 180 Go par seconde. Le calcul lui-même est bon marché en comparaison. La vitesse de génération suit donc la bande passante mémoire, pas la puissance de calcul.

Plafond théorique = bande passante ÷ taille du modèle (Qwen 3 14B en Q4, 9 Go dans le catalogue QuelLLM). Les systèmes réels s'en approchent sans l'atteindre.
Où se trouve le modèleBande passantePlafond pour un modèle de 9 Go
LPDDR5X de portable (ce que partagent NPU et GPU intégré)≈ 70 à 135 Go/s≈ 8 à 15 tok/s
Mémoire unifiée du Ryzen AI Max+ 395256 Go/s≈ 28 tok/s
RTX 4070 (GDDR6X)504 Go/s≈ 56 tok/s
RTX 5070 Ti (GDDR7)896 Go/s≈ 100 tok/s
RTX 5090 (GDDR7)1 792 Go/s≈ 200 tok/s

Un NPU de 50 TOPS se trouve sur la première ligne. Il puise dans la même LPDDR5X que le processeur : quel que soit son nombre de TOPS, il ne peut pas aller plus vite que cette mémoire. Un portable à 45 TOPS et un portable à 50 TOPS écriront du texte à la même vitesse si leur mémoire est identique.

Là où un NPU peut aider, c'est sur la lecture du prompt, phase gourmande en calcul. Des montages hybrides qui confient cette lecture au NPU et la génération au GPU intégré réduisent l'attente avant le premier mot et la consommation, sur de petits modèles. C'est un gain d'autonomie, pas un moyen de faire tourner de plus gros modèles.

#Le vrai frein : le logiciel

Ollama, llama.cpp, LM Studio
Ils tournent sur le GPU ou le CPU. Sur un portable Copilot+, ils utilisent le GPU intégré ou le processeur et ignorent le NPU.
Windows
Les modèles embarqués de Microsoft et son environnement Foundry Local visent le NPU via ONNX Runtime, avec une sélection de petits modèles.
AMD
Ryzen AI Software et le serveur Lemonade exécutent certains modèles ONNX en mode hybride, NPU et GPU intégré.
Intel
OpenVINO sait cibler le NPU pour les modèles pris en charge.
Qualcomm
La chaîne d'outils QNN et AI Hub fournissent des modèles déjà convertis pour le NPU Hexagon.
Apple
Core ML utilise le Neural Engine, mais les outils de LLM réellement utilisés sur Mac (MLX, llama.cpp, Ollama) passent par le GPU, via Metal.

Le point commun : passer par le NPU, c'est choisir dans une courte liste de modèles convertis par le constructeur, en général de 1 à 8 milliards de paramètres, et non télécharger n'importe quel GGUF pour le lancer.

#Que regarder à la place avant d'acheter

  1. 01
    La mémoire que le GPU peut utiliser
  2. 02
    La bande passante de cette mémoire
  3. 03
    Le chemin logiciel
  4. 04
    Les TOPS du NPU

#FAQ

Que signifie NPU ?+
Neural Processing Unit, ou unité de traitement neuronal. C'est un bloc du processeur dédié à l'exécution efficace de réseaux de neurones, présent dans la plupart des puces récentes de portables et de téléphones.
Un NPU est-il meilleur qu'un GPU pour l'IA ?+
Il est plus économe en énergie pour de petites tâches continues. Un GPU est bien plus rapide et bien mieux pris en charge pour les gros modèles, LLM et générateurs d'images. Ils ne font pas le même travail.
Ollama ou LM Studio utilisent-ils le NPU ?+
Non, au 20 septembre 2026. Ils tournent sur le GPU (CUDA, ROCm, Metal, Vulkan) ou sur le processeur. Exploiter le NPU demande les outils du constructeur, chacun avec sa liste limitée de modèles.
Faut-il un NPU pour faire tourner une IA en local ?+
Non. Toute machine dotée d'un GPU correct ou d'assez de mémoire unifiée fait tourner des modèles locaux sans NPU. Celui-ci n'est exigé que pour les fonctions Copilot+ de Windows.
Combien de TOPS faut-il ?+
40 TOPS est le seuil du label Copilot+ PC de Microsoft, et les puces actuelles de portables se situent entre 45 et 50. Au-delà de ce seuil, l'écart n'a guère d'effet pratique, et aucun sur la vitesse de génération d'un LLM.

Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.