Famille MiniMax M2.5 (MiniMaxAI, Chine). Variante compacte Apache 2.0, focus code et raisonnement multilingue.
Idéal pour
Edge / CPUCode compactRaisonnement multilingue
02Mémoire requise
VRAM GPU approximative pour faire tourner ce modèle, overhead contexte de 4k tokens inclus. Pour un contexte plus long, ajoutez ~1 Go par tranche de 8k tokens.
Q4_K_M
Le plus léger, ~5% de perte
1.4 Go
Q5_K_M
Bon compromis qualité/taille
1.8 Go
Q8_0
Quasi-indistinguable de FP16
2.7 Go
FP16
Pleine précision — usage serveur
5 Go
Fallback CPU · Si vous n'avez pas de GPU, comptez 3.2 Go de RAM minimum pour faire tourner ce modèle à vitesse réduite.
Quel GPU pour faire tourner MiniMax M2.5 2.5B ?
Pour exécuter MiniMax M2.5 2.5B en local en quantification Q4, il faut environ 1.4 Go de VRAM. Le meilleur rapport prix/performance : un RTX 5060 (8 Go de VRAM).
Liens affiliés — commission possible sans surcoût pour vous, reco indépendante. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.
Premier téléchargement : entre 2 et 40 Go selon la quantization choisie. Espace disque à prévoir, connexion stable recommandée. Les relances suivantes sont instantanées.