LLM 7B, 30B, 70B : que veulent dire ces tailles ?
Sur Hugging Face ou Ollama, chaque modèle traîne un nombre : 1B, 7B, 32B, 70B. Ce chiffre — les milliards de paramètres — décide de ce que le modèle sait faire, de la VRAM qu'il exige et de sa vitesse. Mais un LLM 7B récent peut battre un 70B d'il y a deux ans, et « plus gros » ne veut pas dire « meilleur pour vous ». Ce guide explique ce qu'est un paramètre, ce que chaque palier apporte réellement, et comment arbitrer entre taille, quantification et matériel sans se faire piéger par le marketing.
#Un paramètre, c'est quoi concrètement
Un paramètre est un nombre. Rien de plus : une valeur numérique, souvent codée sur 16 bits, apprise pendant l'entraînement. Un modèle « 7B » en contient 7 milliards. Ces nombres sont les poids des connexions entre les neurones artificiels du réseau — ils encodent tout ce que le modèle « sait » : la grammaire, les faits, les tournures, les associations d'idées.
L'analogie la plus juste est celle des synapses. Un paramètre est comme la force d'une connexion entre deux neurones du cerveau. Plus il y a de connexions, plus le réseau peut mémoriser de nuances et de motifs subtils. Un modèle de 1 milliard de paramètres a environ 1 milliard de ces réglages ; un 70B en a soixante-dix fois plus. Chaque paramètre est minuscule et bête isolément ; c'est leur nombre et leur agencement qui produisent le langage.
Concrètement, ces paramètres occupent de la place. En 16 bits (FP16), chaque paramètre pèse 2 octets : un modèle 7B occupe donc environ 14 Go en pleine précision. C'est cette taille sur disque et en mémoire qui détermine si le modèle tient sur votre machine — nous y reviendrons avec la quantification, qui compresse ces poids.
#L'échelle réelle des capacités, du 1B au 70B
Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
Les capacités ne montent pas de façon linéaire avec la taille : elles franchissent des paliers. Passé un certain seuil de paramètres, de nouvelles aptitudes apparaissent d'un coup — c'est ce qu'on appelle les capacités émergentes. Voici ce qu'on observe en pratique sur les modèles récents.
- 1B – 3B
- Complétion de texte, reformulation simple, classification, extraction de mots-clés. Utile sur mobile ou en edge, mais raisonnement fragile et hallucinations fréquentes dès qu'on complexifie.
- 7B – 8B
- Le premier palier vraiment utile. Conversation cohérente, résumé fiable, code simple, suivi d'instructions correct. C'est le point d'entrée du LLM local sérieux.
- 13B – 14B
- Meilleure tenue sur les tâches longues, moins d'erreurs factuelles, code plus solide. Un cran de finesse au-dessus du 7B, sans exploser la VRAM.
- 30B – 34B
- Raisonnement multi-étapes plus fiable, nuance dans les réponses, bonne qualité de code et de traduction. Le sweet spot qualité/coût pour un usage exigeant en local.
- 70B
- Le haut du panier grand public. Raisonnement proche des modèles cloud sur beaucoup de tâches, réponses détaillées et nuancées. Exige une grosse config ou de l'offload.
À retenir : chaque doublement de taille apporte un gain réel mais décroissant. Le saut de 1B à 7B est spectaculaire ; celui de 30B à 70B est réel mais bien plus subtil, et n'a de sens que si votre tâche en a besoin.
#Ce qu'un LLM 7B sait faire qu'un 1B ne sait pas
C'est la comparaison la plus parlante, parce que le fossé est énorme pour un écart de taille modeste en apparence. Un 1B répète des motifs ; un 7B commence à raisonner. Le passage de l'un à l'autre débloque des aptitudes concrètes que vous sentez immédiatement à l'usage.
- Suivre une consigne en plusieurs parties
- Un 1B oublie souvent la deuxième moitié de votre demande. Un 7B tient une instruction du type « résume ce texte en 3 points, puis traduis-les en anglais ».
- Raisonnement en chaîne
- Un problème logique ou mathématique à deux ou trois étapes reste hors de portée d'un 1B ; un 7B le décompose correctement une bonne partie du temps.
- Cohérence sur un texte long
- Le 1B perd le fil au bout de quelques paragraphes. Le 7B garde le contexte, le ton et les noms propres sur une réponse complète.
- Code fonctionnel
- Un 7B spécialisé écrit des fonctions correctes et corrige des bugs simples ; un 1B produit surtout du code qui « ressemble » à du code.
- Moins d'hallucinations
- Sans les éliminer, le 7B invente nettement moins et sait plus souvent dire qu'il ne sait pas.
#Taille et VRAM : le tableau qui compte
La question pratique n'est pas « quel est le meilleur modèle » mais « quel modèle tient sur ma carte ». La VRAM nécessaire suit directement le nombre de paramètres. Voici les repères en quantification Q4_K_M, le format recommandé par défaut, qui divise la taille par environ quatre par rapport au FP16.
- 3B ≈ 2 Go
- Tourne partout, même sur une carte d'entrée ou en CPU. Idéal mobile et tâches simples.
- 7B ≈ 5 Go
- Confortable sur une RTX 3060 12 Go ou une RTX 4070 12 Go. Le meilleur rapport capacité/accessibilité.
- 14B ≈ 9 Go
- Passe sur 12 Go de VRAM avec un contexte raisonnable, à l'aise sur 16 Go.
- 32B ≈ 19 Go
- Vise une RTX 4090 24 Go, ou une carte 16 Go avec un peu d'offload en RAM.
- 70B ≈ 40 Go
- Hors de portée d'une seule carte grand public : bi-GPU, offload RAM/SSD, ou un Mac Apple Silicon à mémoire unifiée généreuse (M4 Pro 48 Go).
#Taille vs quantification : le vrai arbitrage
Face à une VRAM limitée, deux leviers s'offrent à vous : prendre un modèle plus petit, ou prendre un modèle plus gros mais plus compressé. La quantification réduit la précision des paramètres — de 16 bits à 4 ou 8 bits — pour faire tenir le modèle dans moins de mémoire, au prix d'une légère perte de qualité.
La règle empirique validée par l'usage : un modèle plus gros quantifié plus fort bat presque toujours un modèle plus petit en pleine précision, à VRAM égale. Un 13B en Q4 tient dans la même mémoire qu'un 7B en Q8, et se révèle généralement plus capable. Le nombre de paramètres pèse plus lourd que les derniers bits de précision.
- Q4_K_M
- Le défaut recommandé. Perte de qualité minime, mémoire divisée par ~4. Le choix par défaut pour presque tous les usages.
- Q5_K_M
- Un cran au-dessus en qualité pour un peu plus de VRAM. Bon compromis si la mémoire le permet.
- Q8_0
- Quasi indiscernable du FP16. À réserver aux petits modèles ou aux cartes très fournies.
- FP16
- Pleine précision, deux fois plus lourd que Q8. Utile surtout pour le fine-tuning, rarement nécessaire à l'inférence.
#Pourquoi un petit modèle récent bat un gros ancien
C'est le point qui déroute le plus les débutants : un LLM 7B de 2026 peut surpasser un 70B de 2023. La taille n'est qu'un des facteurs de la qualité — et pas toujours le plus décisif. Trois autres leviers ont énormément progressé.
- Qualité des données
- Les modèles récents sont entraînés sur des corpus mieux filtrés, dédupliqués et enrichis en données synthétiques de haute qualité. À taille égale, ils apprennent bien plus.
- Volume d'entraînement
- Les 7B modernes voient des dizaines de milliers de milliards de tokens, bien plus que les anciens gros modèles. Un petit réseau très entraîné surpasse un gros réseau sous-entraîné.
- Architecture et post-training
- Meilleures architectures, alignement par RLHF, entraînement spécifique au raisonnement : autant de gains qui n'ont rien à voir avec le nombre de paramètres.
La distillation joue aussi un rôle clé : on transfère le savoir d'un très gros modèle vers un petit, qui hérite d'une partie de ses capacités pour une fraction de la taille. C'est ainsi qu'un 7B ou 8B distillé raisonne comme un modèle bien plus lourd. Conséquence pratique : regardez toujours la date de sortie et les benchmarks récents, jamais le seul nombre de paramètres.
#Choisir sa taille en pratique
La bonne taille est celle qui tient sur votre matériel tout en couvrant votre usage. Partez du plus gros modèle récent que votre VRAM accepte en Q4, puis ajustez selon le besoin réel de vitesse ou de finesse.
- 01Mesurez votre VRAMIdentifiez la mémoire de votre GPU (ou la RAM unifiée sur Mac). C'est le plafond dur qui élimine d'emblée les modèles trop gros.
- 02Visez le plus gros modèle récent qui rentre en Q4Sur 12 Go, un 14B récent. Sur 24 Go, un 32B. Sur 8 Go, un bon 7B/8B. Préférez toujours une sortie récente à un ancien plus gros.
- 03Ajustez selon l'usageChat courant et vitesse : restez sur 7B–14B. Raisonnement, code exigeant, traduction fine : montez vers 30B+ si la mémoire suit.
- 04Vérifiez la vitesseSi le débit en tokens/seconde vous frustre, descendez d'un palier. Un 7B rapide bat souvent un 32B poussif pour un usage interactif.
#Comparer deux tailles en 5 minutes
Le meilleur moyen de sentir la différence est de faire tourner deux tailles côte à côte sur votre propre machine. Si Ollama est installé et écoute sur son port par défaut (http://localhost:11434), deux commandes suffisent.
Posez la même question de raisonnement aux deux (par exemple un petit problème logique en plusieurs étapes) et comparez la qualité des réponses et le débit affiché par --verbose. Vous verrez concrètement où se situe le compromis capacité/vitesse sur votre matériel.
#Pour aller plus loin
La taille se comprend mieux en la reliant aux autres notions de base du local. Ces guides prolongent directement celui-ci :
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- L'autre moitié de l'arbitrage mémoire : comment compresser un modèle sans le dégrader, avec un guide visuel.
- MoE expliqué : pourquoi un 30B-A3B tourne comme un petit modèle
- La notation à deux chiffres qui casse le lien entre taille et vitesse, à lire juste après celui-ci.
- Distillation : comment les petits modèles héritent des gros
- Pour comprendre en profondeur pourquoi un petit modèle récent peut battre un gros ancien.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.