Débutant 9 minConcepts

VRAM : c'est quoi, et combien en faut-il pour l'IA ?

La VRAM, ou mémoire vidéo, est la mémoire soudée sur votre carte graphique, réservée au GPU. Elle est beaucoup plus rapide que la RAM de l'ordinateur, et c'est elle qui détermine quels modèles d'IA vous pouvez faire tourner en local : un LLM doit y tenir en entier pour répondre vite. Au 20 septembre 2026, les cartes grand public vont de 8 à 32 Go. Cette page explique ce qu'est la VRAM, comment connaître la vôtre en trente secondes, et ce que chaque palier permet réellement.

Par Mohamed Meguedmi·Màj 2026-09-20·Testé sur Windows, macOS, Linux

#La VRAM en une minute

VRAM signifie Video Random Access Memory. C'est une mémoire vive, comme la RAM, mais placée à quelques millimètres de la puce graphique et reliée à elle par un bus très large. Son rôle d'origine est de stocker ce que le GPU manipule en permanence : les textures, la géométrie et les images d'un jeu. Pour l'IA, elle stocke les poids du modèle et sa mémoire de travail.

Deux chiffres la caractérisent. La capacité, en gigaoctets, dit ce qui peut y tenir. La bande passante, en gigaoctets par seconde, dit à quelle vitesse le GPU peut la lire. En jeu, on regarde surtout la capacité. En IA, les deux comptent : la capacité décide si le modèle se charge, la bande passante décide à quelle vitesse il écrit.

#RAM et VRAM : les différences

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j
Bandes passantes : spécifications des constructeurs
RAM (mémoire système)VRAM (mémoire vidéo)
EmplacementBarrettes sur la carte mèrePuces soudées sur la carte graphique
Au service deLe processeur (CPU)Le processeur graphique (GPU)
TechnologieDDR4, DDR5GDDR6, GDDR6X, GDDR7
Bande passante60 à 100 Go/s en DDR5 double canal360 Go/s (RTX 3060) à 1 792 Go/s (RTX 5090)
Capacité courante16 à 64 Go8 à 32 Go
ÉvolutiveOui, on ajoute des barrettesNon, elle est soudée

L'écart de bande passante, de l'ordre de dix à vingt fois, explique tout le reste de cette page. Un modèle d'IA relit l'ensemble de ses poids à chaque token qu'il produit. Depuis la VRAM, cela va vite. Depuis la RAM, le même modèle tourne cinq à vingt fois plus lentement.

#Connaître sa VRAM

Windows, sans rien installer
Ouvrez le Gestionnaire des tâches (Ctrl + Maj + Échap), onglet Performance, puis GPU dans la colonne de gauche. La ligne « Mémoire GPU dédiée » donne votre VRAM. La « mémoire GPU partagée » affichée à côté n'en est pas : c'est de la RAM que Windows peut prêter au GPU, bien plus lente.
Windows, méthode alternative
Touche Windows + R, tapez dxdiag, onglet Affichage : la ligne « Mémoire d'affichage (VRAM) ».
Windows et Linux avec une carte NVIDIA
Dans un terminal, la commande nvidia-smi affiche la mémoire totale et la mémoire occupée en temps réel. C'est l'outil à garder ouvert pendant qu'un modèle tourne.
Linux avec une carte AMD
La commande rocm-smi --showmeminfo vram, ou l'outil graphique de votre distribution.
Mac
Menu Pomme, À propos de ce Mac : la ligne Mémoire. Un Mac Apple Silicon n'a pas de VRAM séparée, voir la section dédiée plus bas.
Surveiller la VRAM pendant qu'un modèle tourne (NVIDIA)
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv -l 2

#Pourquoi l'IA locale dépend de la VRAM

Un LLM occupe la VRAM de trois façons. Les poids, d'abord : le nombre de paramètres multiplié par la précision. En quantification 4 bits, comptez environ 0,6 Go par milliard de paramètres, soit 5 Go pour un modèle 8B. Le cache KV, ensuite, qui conserve la conversation en cours et grossit avec la longueur du contexte. Enfin une marge de fonctionnement, de l'ordre de 1 à 2 Go.

Si le total dépasse la VRAM, les outils comme Ollama ou llama.cpp déportent une partie du modèle en RAM. Le modèle fonctionne toujours, mais la vitesse s'effondre dès que quelques couches passent de l'autre côté. C'est pourquoi une carte plus ancienne avec beaucoup de VRAM, comme une RTX 3090 de 24 Go, reste plus utile en IA qu'une carte récente de 12 Go, pourtant plus rapide en jeu.

#Combien de VRAM pour quel modèle

Le tableau croise notre base de 90 cartes et puces avec les 249 modèles du catalogue. Pour chaque palier, il indique un modèle représentatif qui tient entièrement en VRAM en Q4_K_M. Gardez 1 à 3 Go de marge pour le contexte : quand le poids du modèle frôle la capacité de la carte, la conversation doit rester courte.

Calculé depuis le catalogue et la base matérielle QuelLLM · poids en Q4_K_M · 20/09/2026
VRAMCartes typiquesModèle représentatif qui tientPoids en Q4Guide détaillé
6 GoRTX 2060, GTX 1660, RTX 4050 portableQwen 3 8B, à contexte court5 GoQuel LLM pour 6 Go
8 GoRTX 3060 Ti, RTX 4060, RTX 5060Qwen 3 8B à l'aise, Gemma 4 12B à contexte court5 et 7 GoQuel LLM pour 8 Go
12 GoRTX 3060 12 Go, RTX 4070, RTX 5070Qwen 3 14B9 GoQuel LLM pour 12 Go
16 GoRTX 4060 Ti 16 Go, RTX 5070 Ti, RTX 5080, RX 9070 XTgpt-oss 20B, Mistral Small 3.2 24B13 et 14 GoQuel LLM pour 16 Go
24 GoRTX 3090, RTX 4090, RX 7900 XTXQwen 3.8 27B, Qwen 3.6 35B-A3B16 et 21 GoQuel LLM pour 24 Go
32 GoRTX 5090Qwen 3.6 35B-A3B en Q525 GoQuel LLM pour 32 Go
48 Go2 × RTX 3090 ou 4090, Mac 64 GoLlama 3.3 70B40 GoVoir le calculateur
96 GoMac 128 Gogpt-oss 120B70 GoVoir le calculateur
Le réflexe avant d'acheter
À budget égal, pour l'IA locale, privilégiez la capacité de VRAM avant la génération de la carte. Passer de 12 à 16 Go ouvre la classe des modèles de 20 à 24 milliards de paramètres ; passer de 16 à 24 Go ouvre celle des 27 à 35 milliards. Aucun gain de vitesse ne compense un modèle qui ne se charge pas.

#Peut-on augmenter sa VRAM ?

Sur une carte graphique dédiée, non. Les puces mémoire sont soudées et dimensionnées avec le GPU : la seule façon d'avoir plus de VRAM est de changer de carte, ou d'en ajouter une seconde, ce que les outils d'IA savent exploiter en répartissant le modèle. Les réglages qui promettent d'« augmenter la VRAM » dans Windows ou dans le BIOS concernent deux cas particuliers.

GPU intégré (iGPU)
Il n'a pas de VRAM propre et emprunte une part de la RAM. Le BIOS permet souvent d'agrandir cette part (réglage UMA Frame Buffer Size ou équivalent). Cela augmente la capacité, pas la vitesse, qui reste celle de la RAM.
Mémoire GPU partagée de Windows
Windows autorise une carte dédiée à déborder dans la RAM. Pour un jeu, cela évite un plantage. Pour un LLM, c'est le scénario lent décrit plus haut.

La vraie marge de manœuvre est logicielle : choisir une quantification plus légère, réduire la fenêtre de contexte, quantifier le cache KV. Ces trois leviers font souvent gagner plusieurs gigaoctets sans toucher au matériel.

#Le cas des Mac : la mémoire unifiée

Les Mac Apple Silicon n'ont pas de VRAM distincte. Le processeur et le GPU partagent une seule mémoire, dite unifiée, à large bande passante : 120 Go/s sur une puce M4 de base, de 400 à plus de 600 Go/s sur les puces Max. Le GPU peut en utiliser environ les trois quarts. Dans notre base, un Mac de 24 Go compte ainsi pour 16 Go utilisables par un modèle, un Mac de 64 Go pour 48 Go, un Mac de 128 Go pour 96 Go.

C'est ce qui rend les Mac singuliers pour l'IA locale : aucune carte graphique grand public n'offre 96 Go. En contrepartie, à capacité égale, une carte NVIDIA haut de gamme reste plus rapide grâce à une bande passante supérieure.

#FAQ

Quelle est la différence entre la RAM et la VRAM ?+
La RAM sert le processeur et se trouve sur la carte mère ; la VRAM sert le GPU et est soudée sur la carte graphique. La VRAM est dix à vingt fois plus rapide en bande passante, mais moins abondante et non évolutive. Un modèle d'IA qui tient en VRAM répond beaucoup plus vite que s'il déborde en RAM.
8 Go de VRAM, est-ce suffisant en 2026 ?+
Pour jouer en 1080p, oui dans la plupart des cas. Pour l'IA locale, 8 Go permettent des modèles jusqu'à 12 milliards de paramètres en Q4, comme Gemma 4 12B, à condition de garder un contexte court ; un modèle 8B y est plus à l'aise. C'est un bon point de départ, vite limitant si vous visez les modèles de 20 milliards et plus.
Pourquoi Windows affiche-t-il plus de mémoire GPU que ma carte n'en a ?+
Le Gestionnaire des tâches additionne la mémoire dédiée, votre vraie VRAM, et la mémoire partagée, une part de RAM que le GPU peut emprunter. Seule la mémoire dédiée compte pour évaluer ce qu'un modèle d'IA peut charger à pleine vitesse.
Deux cartes graphiques additionnent-elles leur VRAM ?+
Pour l'IA, oui : llama.cpp, Ollama et vLLM savent répartir un modèle sur plusieurs cartes, et deux cartes de 24 Go permettent de charger un modèle de 40 Go. Pour le jeu, non : chaque carte travaille avec sa propre mémoire.
La VRAM compte-t-elle plus que la puissance du GPU pour l'IA ?+
Pour faire tourner un modèle, oui. La capacité décide de ce qui se charge et la bande passante mémoire fixe la vitesse de génération. La puissance de calcul brute joue surtout sur la lecture du prompt et sur la génération d'images.

Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.