VRAM : c'est quoi, et combien en faut-il pour l'IA ?
La VRAM, ou mémoire vidéo, est la mémoire soudée sur votre carte graphique, réservée au GPU. Elle est beaucoup plus rapide que la RAM de l'ordinateur, et c'est elle qui détermine quels modèles d'IA vous pouvez faire tourner en local : un LLM doit y tenir en entier pour répondre vite. Au 20 septembre 2026, les cartes grand public vont de 8 à 32 Go. Cette page explique ce qu'est la VRAM, comment connaître la vôtre en trente secondes, et ce que chaque palier permet réellement.
#La VRAM en une minute
VRAM signifie Video Random Access Memory. C'est une mémoire vive, comme la RAM, mais placée à quelques millimètres de la puce graphique et reliée à elle par un bus très large. Son rôle d'origine est de stocker ce que le GPU manipule en permanence : les textures, la géométrie et les images d'un jeu. Pour l'IA, elle stocke les poids du modèle et sa mémoire de travail.
Deux chiffres la caractérisent. La capacité, en gigaoctets, dit ce qui peut y tenir. La bande passante, en gigaoctets par seconde, dit à quelle vitesse le GPU peut la lire. En jeu, on regarde surtout la capacité. En IA, les deux comptent : la capacité décide si le modèle se charge, la bande passante décide à quelle vitesse il écrit.
#RAM et VRAM : les différences
Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
| RAM (mémoire système) | VRAM (mémoire vidéo) | |
|---|---|---|
| Emplacement | Barrettes sur la carte mère | Puces soudées sur la carte graphique |
| Au service de | Le processeur (CPU) | Le processeur graphique (GPU) |
| Technologie | DDR4, DDR5 | GDDR6, GDDR6X, GDDR7 |
| Bande passante | 60 à 100 Go/s en DDR5 double canal | 360 Go/s (RTX 3060) à 1 792 Go/s (RTX 5090) |
| Capacité courante | 16 à 64 Go | 8 à 32 Go |
| Évolutive | Oui, on ajoute des barrettes | Non, elle est soudée |
L'écart de bande passante, de l'ordre de dix à vingt fois, explique tout le reste de cette page. Un modèle d'IA relit l'ensemble de ses poids à chaque token qu'il produit. Depuis la VRAM, cela va vite. Depuis la RAM, le même modèle tourne cinq à vingt fois plus lentement.
#Connaître sa VRAM
- Windows, sans rien installer
- Ouvrez le Gestionnaire des tâches (Ctrl + Maj + Échap), onglet Performance, puis GPU dans la colonne de gauche. La ligne « Mémoire GPU dédiée » donne votre VRAM. La « mémoire GPU partagée » affichée à côté n'en est pas : c'est de la RAM que Windows peut prêter au GPU, bien plus lente.
- Windows, méthode alternative
- Touche Windows + R, tapez dxdiag, onglet Affichage : la ligne « Mémoire d'affichage (VRAM) ».
- Windows et Linux avec une carte NVIDIA
- Dans un terminal, la commande nvidia-smi affiche la mémoire totale et la mémoire occupée en temps réel. C'est l'outil à garder ouvert pendant qu'un modèle tourne.
- Linux avec une carte AMD
- La commande rocm-smi --showmeminfo vram, ou l'outil graphique de votre distribution.
- Mac
- Menu Pomme, À propos de ce Mac : la ligne Mémoire. Un Mac Apple Silicon n'a pas de VRAM séparée, voir la section dédiée plus bas.
#Pourquoi l'IA locale dépend de la VRAM
Un LLM occupe la VRAM de trois façons. Les poids, d'abord : le nombre de paramètres multiplié par la précision. En quantification 4 bits, comptez environ 0,6 Go par milliard de paramètres, soit 5 Go pour un modèle 8B. Le cache KV, ensuite, qui conserve la conversation en cours et grossit avec la longueur du contexte. Enfin une marge de fonctionnement, de l'ordre de 1 à 2 Go.
Si le total dépasse la VRAM, les outils comme Ollama ou llama.cpp déportent une partie du modèle en RAM. Le modèle fonctionne toujours, mais la vitesse s'effondre dès que quelques couches passent de l'autre côté. C'est pourquoi une carte plus ancienne avec beaucoup de VRAM, comme une RTX 3090 de 24 Go, reste plus utile en IA qu'une carte récente de 12 Go, pourtant plus rapide en jeu.
- Calculateur de VRAM : poids, contexte et marge pour votre modèle
- Choisir sa quantification : Q4, Q5, Q8 ou FP16
#Combien de VRAM pour quel modèle
Le tableau croise notre base de 90 cartes et puces avec les 249 modèles du catalogue. Pour chaque palier, il indique un modèle représentatif qui tient entièrement en VRAM en Q4_K_M. Gardez 1 à 3 Go de marge pour le contexte : quand le poids du modèle frôle la capacité de la carte, la conversation doit rester courte.
| VRAM | Cartes typiques | Modèle représentatif qui tient | Poids en Q4 | Guide détaillé |
|---|---|---|---|---|
| 6 Go | RTX 2060, GTX 1660, RTX 4050 portable | Qwen 3 8B, à contexte court | 5 Go | Quel LLM pour 6 Go |
| 8 Go | RTX 3060 Ti, RTX 4060, RTX 5060 | Qwen 3 8B à l'aise, Gemma 4 12B à contexte court | 5 et 7 Go | Quel LLM pour 8 Go |
| 12 Go | RTX 3060 12 Go, RTX 4070, RTX 5070 | Qwen 3 14B | 9 Go | Quel LLM pour 12 Go |
| 16 Go | RTX 4060 Ti 16 Go, RTX 5070 Ti, RTX 5080, RX 9070 XT | gpt-oss 20B, Mistral Small 3.2 24B | 13 et 14 Go | Quel LLM pour 16 Go |
| 24 Go | RTX 3090, RTX 4090, RX 7900 XTX | Qwen 3.8 27B, Qwen 3.6 35B-A3B | 16 et 21 Go | Quel LLM pour 24 Go |
| 32 Go | RTX 5090 | Qwen 3.6 35B-A3B en Q5 | 25 Go | Quel LLM pour 32 Go |
| 48 Go | 2 × RTX 3090 ou 4090, Mac 64 Go | Llama 3.3 70B | 40 Go | Voir le calculateur |
| 96 Go | Mac 128 Go | gpt-oss 120B | 70 Go | Voir le calculateur |
- Quel LLM pour 8 Go de VRAM ?
- Quel LLM pour 12 Go de VRAM ?
- Quel LLM pour 16 Go de VRAM ?
- Quel LLM pour 24 Go de VRAM ?
#Peut-on augmenter sa VRAM ?
Sur une carte graphique dédiée, non. Les puces mémoire sont soudées et dimensionnées avec le GPU : la seule façon d'avoir plus de VRAM est de changer de carte, ou d'en ajouter une seconde, ce que les outils d'IA savent exploiter en répartissant le modèle. Les réglages qui promettent d'« augmenter la VRAM » dans Windows ou dans le BIOS concernent deux cas particuliers.
- GPU intégré (iGPU)
- Il n'a pas de VRAM propre et emprunte une part de la RAM. Le BIOS permet souvent d'agrandir cette part (réglage UMA Frame Buffer Size ou équivalent). Cela augmente la capacité, pas la vitesse, qui reste celle de la RAM.
- Mémoire GPU partagée de Windows
- Windows autorise une carte dédiée à déborder dans la RAM. Pour un jeu, cela évite un plantage. Pour un LLM, c'est le scénario lent décrit plus haut.
La vraie marge de manœuvre est logicielle : choisir une quantification plus légère, réduire la fenêtre de contexte, quantifier le cache KV. Ces trois leviers font souvent gagner plusieurs gigaoctets sans toucher au matériel.
- Quantifier le cache KV : gagner de la VRAM sur les longs contextes
- Additionner la VRAM de deux cartes avec llama.cpp
#Le cas des Mac : la mémoire unifiée
Les Mac Apple Silicon n'ont pas de VRAM distincte. Le processeur et le GPU partagent une seule mémoire, dite unifiée, à large bande passante : 120 Go/s sur une puce M4 de base, de 400 à plus de 600 Go/s sur les puces Max. Le GPU peut en utiliser environ les trois quarts. Dans notre base, un Mac de 24 Go compte ainsi pour 16 Go utilisables par un modèle, un Mac de 64 Go pour 48 Go, un Mac de 128 Go pour 96 Go.
C'est ce qui rend les Mac singuliers pour l'IA locale : aucune carte graphique grand public n'offre 96 Go. En contrepartie, à capacité égale, une carte NVIDIA haut de gamme reste plus rapide grâce à une bande passante supérieure.
#FAQ
Quelle est la différence entre la RAM et la VRAM ?+
8 Go de VRAM, est-ce suffisant en 2026 ?+
Pourquoi Windows affiche-t-il plus de mémoire GPU que ma carte n'en a ?+
Deux cartes graphiques additionnent-elles leur VRAM ?+
La VRAM compte-t-elle plus que la puissance du GPU pour l'IA ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.