MoE 30B/3.5B actifs NVIDIA : chat, code, raisonnement. 128k ctx, vitesse d'un 3.5B avec capacités d'un 30B. Sortie avril 2026.
🇺🇸 NVIDIA·Licence NVIDIA Open Model License·Contexte 125k tokens·Sortie 11 avril 2026← Catalogue
01Ce qu'il sait faire
Points forts
Vitesse d'un 3.5B avec capacités d'un 30B
128k contexte
Triple usage chat/code/raisonnement
Inférence rapide MoE
Limites à connaître
—RAM CPU 39 Go en offload partiel
—Licence NVIDIA Open Model
—Modèle gated sur Hugging Face
Architecture
MoE · 30B total / 3.5B actifs · 128k contexte
Entraînement
Famille Nemotron 3, distillation et RL alignment orientés raisonnement, code et chat.
Idéal pour
RaisonnementCoding agenticInférence rapide MoE
02Mémoire requise
VRAM GPU approximative pour faire tourner ce modèle, overhead contexte de 4k tokens inclus. Pour un contexte plus long, ajoutez ~1 Go par tranche de 8k tokens.
Q4_K_M
Le plus léger, ~5% de perte
17 Go
Q5_K_M
Bon compromis qualité/taille
21 Go
Q8_0
Quasi-indistinguable de FP16
32 Go
FP16
Pleine précision — usage serveur
60 Go
Fallback CPU · Si vous n'avez pas de GPU, comptez 39 Go de RAM minimum pour faire tourner ce modèle à vitesse réduite.
Quel GPU pour faire tourner Nemotron 3 Nano 30B-A3B ?
Pour exécuter Nemotron 3 Nano 30B-A3B en local en quantification Q4, il faut environ 17 Go de VRAM. Le meilleur rapport prix/performance : un RTX 4090 (24 Go de VRAM).
Liens affiliés — commission possible sans surcoût pour vous, reco indépendante. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.
Premier téléchargement : entre 2 et 40 Go selon la quantization choisie. Espace disque à prévoir, connexion stable recommandée. Les relances suivantes sont instantanées.