CUDA : c'est quoi, et faut-il l'installer pour l'IA ?
CUDA est la plateforme logicielle de NVIDIA qui permet d'utiliser une carte graphique pour du calcul général, et plus seulement pour afficher des images. Lancée en 2007, elle ne fonctionne que sur le matériel NVIDIA. Presque tous les logiciels d'IA la visent en premier, ce qui explique que les cartes GeForce soient le chemin le plus simple pour l'IA locale. Au 20 septembre 2026, une confusion reste très répandue : pour faire tourner Ollama ou LM Studio, vous n'avez pas à « installer CUDA ». Cette page explique ce qu'est CUDA, ce qu'il faut réellement installer, et comment lire les numéros de version.
#CUDA, c'est quoi ?
Une carte graphique contient des milliers de petits processeurs conçus pour appliquer la même opération à de très nombreuses données en même temps. À l'origine, on ne pouvait les exploiter qu'à travers les interfaces graphiques : il fallait déguiser un calcul en image. CUDA, pour Compute Unified Device Architecture, a supprimé ce déguisement. Un programmeur écrit du code ordinaire, en C, en C++ ou appelé depuis Python, et il s'exécute directement sur ces processeurs.
Dans l'usage courant, « CUDA » désigne quatre choses à la fois : le modèle de programmation, le compilateur nvcc, la partie du pilote qui exécute le code, et un ensemble de bibliothèques optimisées comme cuBLAS pour l'algèbre linéaire et cuDNN pour les réseaux de neurones. Les frameworks comme PyTorch reposent sur ces bibliothèques, et les applications d'IA reposent sur les frameworks. Quand un outil annonce « compatible CUDA », cela signifie que ses calculs lourds finissent dans ces bibliothèques de NVIDIA.
#Et les « cœurs CUDA » ?
Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
C'est le nom que NVIDIA donne aux processeurs parallèles d'un GPU. Une RTX 4060 en compte 3 072, une RTX 5090 en compte 21 760. Plus de cœurs, c'est plus de calculs par seconde, ce qui compte pour la génération d'images, l'entraînement et la lecture du prompt par un LLM.
Cela compte beaucoup moins pour ce que l'on ressent le plus avec un LLM : la vitesse d'écriture. Là, la limite est la vitesse à laquelle les poids sont lus en mémoire, pas celle à laquelle ils sont multipliés. Une carte avec moins de cœurs mais une VRAM plus grande et plus rapide écrira souvent plus vite que l'inverse.
#Pilote, bibliothèques, Toolkit : que faut-il installer ?
| Composant | Ce que c'est | Qui en a besoin |
|---|---|---|
| Pilote NVIDIA | Fait dialoguer le système et la carte ; contient la partie exécution de CUDA | Tout possesseur d'une carte NVIDIA |
| Bibliothèques d'exécution | cuBLAS, cuDNN et consorts | Déjà incluses dans la plupart des applications et dans les paquets PyTorch : vous ne les installez presque jamais vous-même |
| CUDA Toolkit | Le compilateur nvcc, les en-têtes, les outils de profilage | Uniquement ceux qui compilent du code CUDA, par exemple llama.cpp depuis les sources |
#Lire ses numéros de version
Ces deux numéros diffèrent légitimement, et le premier trompe presque tout le monde. Quand nvidia-smi affiche « CUDA Version: 13.0 », cela veut dire que votre pilote peut exécuter des logiciels compilés pour CUDA jusqu'à la version 13.0. Cela ne veut pas dire que le Toolkit est installé. Et un logiciel compilé pour une version plus ancienne de CUDA fonctionne sans problème avec un pilote récent.
#La capacité de calcul, génération par génération
Chaque GPU NVIDIA porte un numéro de « capacité de calcul » (compute capability) qui identifie son architecture. Les logiciels sont compilés pour des capacités précises, et les projets abandonnent régulièrement les plus anciennes. C'est cela, plus que la vitesse brute, qui met fin à la carrière d'une carte en IA.
| Génération | Cartes | Capacité de calcul | Situation pour l'IA locale en 2026 |
|---|---|---|---|
| Pascal | GTX 1060, 1070, 1080 Ti | 6.1 | Fait tourner les outils fondés sur llama.cpp ; pas d'accélération FP16 ; abandonnée par certains frameworks récents |
| Turing | GTX 1660, RTX 2060 à 2080 Ti | 7.5 | Minimum requis par vLLM (7.0) ; bien prise en charge |
| Ampere | RTX 3050 à 3090 Ti | 8.6 | Pleinement prise en charge ; apporte le BF16 |
| Ada Lovelace | RTX 4060 à 4090 | 8.9 | Pleinement prise en charge ; apporte le FP8 |
| Blackwell | RTX 5050 à 5090 | 12.0 | Pleinement prise en charge par les logiciels récents ; les anciennes versions doivent être mises à jour ou recompilées ; apporte le FP4 |
La dernière ligne explique la vague de messages « ma RTX 50 n'est pas détectée » : un binaire compilé avant l'existence de cette architecture ne contient aucun code pour la capacité 12.0. La solution est une version plus récente de l'outil, ou un PyTorch construit pour une version récente de CUDA.
#CUDA face à ROCm, Metal et Vulkan
| Plateforme | Constructeur | Matériel | État pour les LLM locaux |
|---|---|---|---|
| CUDA | NVIDIA | GPU NVIDIA | La cible de référence : tout la prend en charge en premier |
| ROCm | AMD | Radeon récentes et Instinct | Bon sous Linux sur les cartes prises en charge ; liste de cartes plus étroite |
| Metal | Apple | Apple Silicon | Excellent via llama.cpp et MLX |
| Vulkan | Khronos, standard ouvert | Presque tous les GPU, y compris intégrés | Fonctionne presque partout avec llama.cpp ; en général plus lent que la solution native |
| SYCL / oneAPI | Intel | Intel Arc et GPU intégrés | Fonctionnel, écosystème le plus réduit |
L'avance de CUDA ne tient pas à ce que les autres seraient incapables de faire les calculs. Elle tient à près de vingt ans de bibliothèques, d'outils et de code éprouvé. Pour l'inférence avec les outils courants, l'écart s'est beaucoup réduit : llama.cpp tourne sur les cinq plateformes. Pour l'entraînement, le fine-tuning et le code de recherche tout juste publié, CUDA reste le seul chemin qui fonctionne dès le premier jour.
#Ce que cela change au moment d'acheter
- Vous voulez que tout fonctionne sans dépannage
- Prenez une NVIDIA, et privilégiez la capacité de VRAM au nombre de cœurs.
- Vous faites surtout tourner des GGUF dans Ollama ou LM Studio
- Un Mac, ou une Radeon récente sous Linux, est un choix légitime : vous y perdez peu.
- Vous comptez faire du fine-tuning, utiliser vLLM ou suivre des dépôts de recherche
- L'absence de CUDA vous coûtera du temps chaque semaine.
- Vous achetez d'occasion
- Évitez tout ce qui est sous la capacité 7.5, quel que soit le prix.
#FAQ
Que veut dire CUDA ?+
Faut-il installer CUDA pour faire tourner une IA en local ?+
CUDA fonctionne-t-il sur une carte AMD ou Intel ?+
Pourquoi nvidia-smi et nvcc n'affichent-ils pas la même version ?+
Plus de cœurs CUDA, est-ce mieux pour un LLM ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.