Famille Nemotron · 561B paramètres

Nemotron 3 Ultra Base (BF16)

⚠ Checkpoint pré-entraîné (Base BF16) du MoE Nemotron 3 Ultra : 561B / ~55B actifs, 128k ctx, 11 langues. Pour fine-tuning et R&D, pas pour chat direct.

🇺🇸 NVIDIA·Licence NVIDIA Open Model License·Contexte 125k tokens·Sortie 2026-06-03← Catalogue

01Ce qu'il sait faire

Points forts
  • Frontière MoE 561B / 55B actifs en BF16
  • Pré-entraînement multilingue 11 langues (dont français)
  • 128k contexte natif
  • Base ouverte pour fine-tuning et recherche
Limites à connaître
  • Variante Base : non aligné chat/instruct, à fine-tuner avant usage applicatif
  • ~325 Go VRAM en Q4, ~1.1 To en BF16 — multi-GPU H100/MI300 obligatoire
  • Pas de tag Ollama : install via Hugging Face uniquement
  • Licence NVIDIA Open Model (à relire selon usage commercial)
Architecture
Mixture-of-Experts · 561B paramètres totaux · ~55B actifs par token · 128k contexte · poids BF16 · latent-MoE + MTP
Entraînement
Checkpoint Base (pré-entraîné, non-instruct) de la famille Nemotron 3 Ultra. Pré-entraînement multilingue couvrant 11 langues (en, fr, es, it, de, pt, ja, ko, hi, ar, zh). Diffusé en précision BF16 sur Hugging Face.
Idéal pour
Fine-tuning multilingueRecherche MoEPré-alignement custom

02Mémoire requise

VRAM GPU approximative pour faire tourner ce modèle, overhead contexte de 4k tokens inclus. Pour un contexte plus long, ajoutez ~1 Go par tranche de 8k tokens.

Q4_K_M
Le plus léger, ~5% de perte
325 Go
Q5_K_M
Bon compromis qualité/taille
398 Go
Q8_0
Quasi-indistinguable de FP16
600 Go
FP16
Pleine précision — usage serveur
1122 Go
Fallback CPU · Si vous n'avez pas de GPU, comptez 729 Go de RAM minimum pour faire tourner ce modèle à vitesse réduite.

Quel GPU pour faire tourner Nemotron 3 Ultra Base (BF16) ?

Pour exécuter Nemotron 3 Ultra Base (BF16) en local en quantification Q4, il faut environ 325 Go de VRAM. Le meilleur rapport prix/performance : un Mac Studio (64 Go de mémoire unifiée).

Où acheter le Mac Studio
DartyVoir Mac StudioRakutenVoir Mac StudioAmazonVoir Mac Studio

Liens affiliés — commission possible sans surcoût pour vous, reco indépendante. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.

03Vitesse attendue

Tokens générés par seconde en Q4_K_M, contexte 4k. Au-delà de 20 t/s, la lecture est confortable. En dessous de 10 t/s, c'est juste pour tester.

Entrée de gamme
~1.5t/s
GTX 1650, RX 6600, MBA M2 8Go
Milieu de gamme
~2.5t/s
RTX 4060, 4070, MBP M3 Pro
Haut de gamme
~5t/s
RTX 4090, M4 Max, Radeon 7900

04Installer

Le chemin le plus court : Ollama. Une commande, le modèle est téléchargé et lancé.

$# HuggingFace : nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-Base-BF16
Premier téléchargement : entre 2 et 40 Go selon la quantization choisie. Espace disque à prévoir, connexion stable recommandée. Les relances suivantes sont instantanées.