Débutant 9 minConcepts

CUDA : c'est quoi, et faut-il l'installer pour l'IA ?

CUDA est la plateforme logicielle de NVIDIA qui permet d'utiliser une carte graphique pour du calcul général, et plus seulement pour afficher des images. Lancée en 2007, elle ne fonctionne que sur le matériel NVIDIA. Presque tous les logiciels d'IA la visent en premier, ce qui explique que les cartes GeForce soient le chemin le plus simple pour l'IA locale. Au 20 septembre 2026, une confusion reste très répandue : pour faire tourner Ollama ou LM Studio, vous n'avez pas à « installer CUDA ». Cette page explique ce qu'est CUDA, ce qu'il faut réellement installer, et comment lire les numéros de version.

Par Mohamed Meguedmi·Màj 2026-09-20·Testé sur Windows, macOS, Linux

#CUDA, c'est quoi ?

Une carte graphique contient des milliers de petits processeurs conçus pour appliquer la même opération à de très nombreuses données en même temps. À l'origine, on ne pouvait les exploiter qu'à travers les interfaces graphiques : il fallait déguiser un calcul en image. CUDA, pour Compute Unified Device Architecture, a supprimé ce déguisement. Un programmeur écrit du code ordinaire, en C, en C++ ou appelé depuis Python, et il s'exécute directement sur ces processeurs.

Dans l'usage courant, « CUDA » désigne quatre choses à la fois : le modèle de programmation, le compilateur nvcc, la partie du pilote qui exécute le code, et un ensemble de bibliothèques optimisées comme cuBLAS pour l'algèbre linéaire et cuDNN pour les réseaux de neurones. Les frameworks comme PyTorch reposent sur ces bibliothèques, et les applications d'IA reposent sur les frameworks. Quand un outil annonce « compatible CUDA », cela signifie que ses calculs lourds finissent dans ces bibliothèques de NVIDIA.

#Et les « cœurs CUDA » ?

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j

C'est le nom que NVIDIA donne aux processeurs parallèles d'un GPU. Une RTX 4060 en compte 3 072, une RTX 5090 en compte 21 760. Plus de cœurs, c'est plus de calculs par seconde, ce qui compte pour la génération d'images, l'entraînement et la lecture du prompt par un LLM.

Cela compte beaucoup moins pour ce que l'on ressent le plus avec un LLM : la vitesse d'écriture. Là, la limite est la vitesse à laquelle les poids sont lus en mémoire, pas celle à laquelle ils sont multipliés. Une carte avec moins de cœurs mais une VRAM plus grande et plus rapide écrira souvent plus vite que l'inverse.

#Pilote, bibliothèques, Toolkit : que faut-il installer ?

ComposantCe que c'estQui en a besoin
Pilote NVIDIAFait dialoguer le système et la carte ; contient la partie exécution de CUDATout possesseur d'une carte NVIDIA
Bibliothèques d'exécutioncuBLAS, cuDNN et consortsDéjà incluses dans la plupart des applications et dans les paquets PyTorch : vous ne les installez presque jamais vous-même
CUDA ToolkitLe compilateur nvcc, les en-têtes, les outils de profilageUniquement ceux qui compilent du code CUDA, par exemple llama.cpp depuis les sources
En clair
Pour Ollama, LM Studio, ComfyUI Desktop ou un simple pip install torch : mettez le pilote à jour, et c'est tout. Installer le Toolkit de plusieurs gigaoctets « au cas où » est l'étape inutile la plus fréquente des tutoriels d'IA locale.

#Lire ses numéros de version

Deux commandes, deux informations différentes
nvidia-smi        # version du pilote, et version MAXIMALE de CUDA qu'il sait exécuter
nvcc --version    # version du Toolkit, s'il est installé

Ces deux numéros diffèrent légitimement, et le premier trompe presque tout le monde. Quand nvidia-smi affiche « CUDA Version: 13.0 », cela veut dire que votre pilote peut exécuter des logiciels compilés pour CUDA jusqu'à la version 13.0. Cela ne veut pas dire que le Toolkit est installé. Et un logiciel compilé pour une version plus ancienne de CUDA fonctionne sans problème avec un pilote récent.

#La capacité de calcul, génération par génération

Chaque GPU NVIDIA porte un numéro de « capacité de calcul » (compute capability) qui identifie son architecture. Les logiciels sont compilés pour des capacités précises, et les projets abandonnent régulièrement les plus anciennes. C'est cela, plus que la vitesse brute, qui met fin à la carrière d'une carte en IA.

Cartes issues de la base matérielle QuelLLM · 20/09/2026
GénérationCartesCapacité de calculSituation pour l'IA locale en 2026
PascalGTX 1060, 1070, 1080 Ti6.1Fait tourner les outils fondés sur llama.cpp ; pas d'accélération FP16 ; abandonnée par certains frameworks récents
TuringGTX 1660, RTX 2060 à 2080 Ti7.5Minimum requis par vLLM (7.0) ; bien prise en charge
AmpereRTX 3050 à 3090 Ti8.6Pleinement prise en charge ; apporte le BF16
Ada LovelaceRTX 4060 à 40908.9Pleinement prise en charge ; apporte le FP8
BlackwellRTX 5050 à 509012.0Pleinement prise en charge par les logiciels récents ; les anciennes versions doivent être mises à jour ou recompilées ; apporte le FP4

La dernière ligne explique la vague de messages « ma RTX 50 n'est pas détectée » : un binaire compilé avant l'existence de cette architecture ne contient aucun code pour la capacité 12.0. La solution est une version plus récente de l'outil, ou un PyTorch construit pour une version récente de CUDA.

#CUDA face à ROCm, Metal et Vulkan

PlateformeConstructeurMatérielÉtat pour les LLM locaux
CUDANVIDIAGPU NVIDIALa cible de référence : tout la prend en charge en premier
ROCmAMDRadeon récentes et InstinctBon sous Linux sur les cartes prises en charge ; liste de cartes plus étroite
MetalAppleApple SiliconExcellent via llama.cpp et MLX
VulkanKhronos, standard ouvertPresque tous les GPU, y compris intégrésFonctionne presque partout avec llama.cpp ; en général plus lent que la solution native
SYCL / oneAPIIntelIntel Arc et GPU intégrésFonctionnel, écosystème le plus réduit

L'avance de CUDA ne tient pas à ce que les autres seraient incapables de faire les calculs. Elle tient à près de vingt ans de bibliothèques, d'outils et de code éprouvé. Pour l'inférence avec les outils courants, l'écart s'est beaucoup réduit : llama.cpp tourne sur les cinq plateformes. Pour l'entraînement, le fine-tuning et le code de recherche tout juste publié, CUDA reste le seul chemin qui fonctionne dès le premier jour.

#Ce que cela change au moment d'acheter

Vous voulez que tout fonctionne sans dépannage
Prenez une NVIDIA, et privilégiez la capacité de VRAM au nombre de cœurs.
Vous faites surtout tourner des GGUF dans Ollama ou LM Studio
Un Mac, ou une Radeon récente sous Linux, est un choix légitime : vous y perdez peu.
Vous comptez faire du fine-tuning, utiliser vLLM ou suivre des dépôts de recherche
L'absence de CUDA vous coûtera du temps chaque semaine.
Vous achetez d'occasion
Évitez tout ce qui est sous la capacité 7.5, quel que soit le prix.

#FAQ

Que veut dire CUDA ?+
Compute Unified Device Architecture. NVIDIA l'a lancée en 2007 pour que ses GPU puissent être programmés pour du calcul général, et plus seulement pour le graphisme.
Faut-il installer CUDA pour faire tourner une IA en local ?+
En général non. Ollama, LM Studio et les applications comparables embarquent les bibliothèques CUDA dont elles ont besoin : un pilote NVIDIA à jour suffit. Le CUDA Toolkit complet n'est nécessaire que pour compiler un logiciel depuis ses sources.
CUDA fonctionne-t-il sur une carte AMD ou Intel ?+
Non. CUDA ne tourne que sur du matériel NVIDIA. L'équivalent chez AMD est ROCm, chez Apple Metal, chez Intel oneAPI, et Vulkan est une option multi-constructeurs prise en charge par les outils fondés sur llama.cpp.
Pourquoi nvidia-smi et nvcc n'affichent-ils pas la même version ?+
nvidia-smi indique la version maximale de CUDA que le pilote installé sait exécuter. nvcc indique la version du Toolkit que vous avez installé, s'il y en a un. Les deux sont indépendants.
Plus de cœurs CUDA, est-ce mieux pour un LLM ?+
Cela accélère la lecture du prompt et la génération d'images. La vitesse d'écriture d'un LLM dépend plutôt de la capacité et de la bande passante de la mémoire : pour les modèles de langage, la VRAM compte davantage que le nombre de cœurs.

Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.