Famille Qwen · 0.5B paramètres

Activity Generation 0.5B (Qwen)

Fine-tune Qwen 0.5B spécialisé génération d'activités, 32k contexte, ~0,3 Go VRAM Q4. Ultra-léger, tourne même sur CPU. Licence Apache 2.0.

🇨🇳 mjpsm·Licence Apache 2.0·Contexte 32k tokens·Sortie 2026-09-02← Catalogue

01Ce qu'il sait faire

Points forts
  • Ultra-léger : ~0,3 Go VRAM en Q4, tourne même sur CPU
  • Débit très élevé (~220 tok/s Q4)
  • 32k contexte natif
  • Licence Apache 2.0 permissive
Limites à connaître
  • Fine-tune de niche (génération d'activités), non généraliste
  • 0.5B : capacités limitées hors de sa tâche
  • Modèle communautaire non officiel, pas de tag Ollama
Architecture
Transformer dense 0.5B (base Qwen 0.5B, poids fusionnés)
Entraînement
Fine-tune fusionné (merged) de la base Qwen 0.5B, spécialisé génération d'activités. Variante v1.2.
Idéal pour
Génération d'activitésPrototypage ultra-légerInférence CPU / edge

02Mémoire requise

VRAM GPU approximative pour faire tourner ce modèle, overhead contexte de 4k tokens inclus. Pour un contexte plus long, ajoutez ~1 Go par tranche de 8k tokens.

Q4_K_M
Le plus léger, ~5% de perte
0.3 Go
Q5_K_M
Bon compromis qualité/taille
0.4 Go
Q8_0
Quasi-indistinguable de FP16
0.5 Go
FP16
Pleine précision — usage serveur
1 Go
Fallback CPU · Si vous n'avez pas de GPU, comptez 0.7 Go de RAM minimum pour faire tourner ce modèle à vitesse réduite.

Quel GPU pour faire tourner Activity Generation 0.5B (Qwen) ?

Pour exécuter Activity Generation 0.5B (Qwen) en local en quantification Q4, il faut environ 0.3 Go de VRAM. Le meilleur rapport prix/performance : un RTX 5060 Ti 16 Go (16 Go de VRAM, le meilleur €/Go).

Où acheter le RTX 5060 Ti 16 Go
DartyVoir RTX 5060 Ti 16 GoAmazonVoir RTX 5060 Ti 16 Go

Liens affiliés — commission possible sans surcoût pour vous, reco indépendante. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.

En mobilité : Activity Generation 0.5B (Qwen) tourne aussi sur un PC portable RTX (16 Go de VRAM) →

03Vitesse attendue

Tokens générés par seconde en Q4_K_M, contexte 4k. Au-delà de 20 t/s, la lecture est confortable. En dessous de 10 t/s, c'est juste pour tester.

Entrée de gamme
~110t/s
GTX 1650, RX 6600, MBA M2 8Go
Milieu de gamme
~170t/s
RTX 4060, 4070, MBP M3 Pro
Haut de gamme
~220t/s
RTX 4090, M4 Max, Radeon 7900

04Installer

Le chemin le plus court : Ollama. Une commande, le modèle est téléchargé et lancé.

$# HuggingFace : mjpsm/activity-generation-v1.2-qwen0.5b-merged
Premier téléchargement : entre 2 et 40 Go selon la quantization choisie. Espace disque à prévoir, connexion stable recommandée. Les relances suivantes sont instantanées.