Famille Nemotron NVIDIA, alignement RLHF orienté raisonnement et code.
Idéal pour
RaisonnementGénération codeAgents production
02Mémoire requise
VRAM GPU approximative pour faire tourner ce modèle, overhead contexte de 4k tokens inclus. Pour un contexte plus long, ajoutez ~1 Go par tranche de 8k tokens.
Q4_K_M
Le plus léger, ~5% de perte
19 Go
Q5_K_M
Bon compromis qualité/taille
23 Go
Q8_0
Quasi-indistinguable de FP16
35 Go
FP16
Pleine précision — usage serveur
66 Go
Fallback CPU · Si vous n'avez pas de GPU, comptez 43 Go de RAM minimum pour faire tourner ce modèle à vitesse réduite.
Quel GPU pour faire tourner Nemotron 3 33B ?
Pour exécuter Nemotron 3 33B en local en quantification Q4, il faut environ 19 Go de VRAM. Le meilleur rapport prix/performance : un RTX 4090 (24 Go de VRAM).
Liens affiliés — commission possible sans surcoût pour vous, reco indépendante. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.
Premier téléchargement : entre 2 et 40 Go selon la quantization choisie. Espace disque à prévoir, connexion stable recommandée. Les relances suivantes sont instantanées.