Débutant 8 minConcepts

LLM 7B, 30B, 70B : que veulent dire ces tailles ?

Sur Hugging Face ou Ollama, chaque modèle traîne un nombre : 1B, 7B, 32B, 70B. Ce chiffre — les milliards de paramètres — décide de ce que le modèle sait faire, de la VRAM qu'il exige et de sa vitesse. Mais un LLM 7B récent peut battre un 70B d'il y a deux ans, et « plus gros » ne veut pas dire « meilleur pour vous ». Ce guide explique ce qu'est un paramètre, ce que chaque palier apporte réellement, et comment arbitrer entre taille, quantification et matériel sans se faire piéger par le marketing.

Par Clara M.·Màj 2026-09-21·Testé sur Windows, macOS, Linux

#Un paramètre, c'est quoi concrètement

Un paramètre est un nombre. Rien de plus : une valeur numérique, souvent codée sur 16 bits, apprise pendant l'entraînement. Un modèle « 7B » en contient 7 milliards. Ces nombres sont les poids des connexions entre les neurones artificiels du réseau — ils encodent tout ce que le modèle « sait » : la grammaire, les faits, les tournures, les associations d'idées.

L'analogie la plus juste est celle des synapses. Un paramètre est comme la force d'une connexion entre deux neurones du cerveau. Plus il y a de connexions, plus le réseau peut mémoriser de nuances et de motifs subtils. Un modèle de 1 milliard de paramètres a environ 1 milliard de ces réglages ; un 70B en a soixante-dix fois plus. Chaque paramètre est minuscule et bête isolément ; c'est leur nombre et leur agencement qui produisent le langage.

i
Pourquoi le « B »
Le B signifie billion au sens anglais, soit un milliard. 7B = 7 milliards de paramètres. Ce chiffre ne dit rien de la qualité des données d'entraînement ni de l'architecture — juste de la taille brute du réseau.

Concrètement, ces paramètres occupent de la place. En 16 bits (FP16), chaque paramètre pèse 2 octets : un modèle 7B occupe donc environ 14 Go en pleine précision. C'est cette taille sur disque et en mémoire qui détermine si le modèle tient sur votre machine — nous y reviendrons avec la quantification, qui compresse ces poids.

#L'échelle réelle des capacités, du 1B au 70B

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j

Les capacités ne montent pas de façon linéaire avec la taille : elles franchissent des paliers. Passé un certain seuil de paramètres, de nouvelles aptitudes apparaissent d'un coup — c'est ce qu'on appelle les capacités émergentes. Voici ce qu'on observe en pratique sur les modèles récents.

1B – 3B
Complétion de texte, reformulation simple, classification, extraction de mots-clés. Utile sur mobile ou en edge, mais raisonnement fragile et hallucinations fréquentes dès qu'on complexifie.
7B – 8B
Le premier palier vraiment utile. Conversation cohérente, résumé fiable, code simple, suivi d'instructions correct. C'est le point d'entrée du LLM local sérieux.
13B – 14B
Meilleure tenue sur les tâches longues, moins d'erreurs factuelles, code plus solide. Un cran de finesse au-dessus du 7B, sans exploser la VRAM.
30B – 34B
Raisonnement multi-étapes plus fiable, nuance dans les réponses, bonne qualité de code et de traduction. Le sweet spot qualité/coût pour un usage exigeant en local.
70B
Le haut du panier grand public. Raisonnement proche des modèles cloud sur beaucoup de tâches, réponses détaillées et nuancées. Exige une grosse config ou de l'offload.

À retenir : chaque doublement de taille apporte un gain réel mais décroissant. Le saut de 1B à 7B est spectaculaire ; celui de 30B à 70B est réel mais bien plus subtil, et n'a de sens que si votre tâche en a besoin.

#Ce qu'un LLM 7B sait faire qu'un 1B ne sait pas

C'est la comparaison la plus parlante, parce que le fossé est énorme pour un écart de taille modeste en apparence. Un 1B répète des motifs ; un 7B commence à raisonner. Le passage de l'un à l'autre débloque des aptitudes concrètes que vous sentez immédiatement à l'usage.

Suivre une consigne en plusieurs parties
Un 1B oublie souvent la deuxième moitié de votre demande. Un 7B tient une instruction du type « résume ce texte en 3 points, puis traduis-les en anglais ».
Raisonnement en chaîne
Un problème logique ou mathématique à deux ou trois étapes reste hors de portée d'un 1B ; un 7B le décompose correctement une bonne partie du temps.
Cohérence sur un texte long
Le 1B perd le fil au bout de quelques paragraphes. Le 7B garde le contexte, le ton et les noms propres sur une réponse complète.
Code fonctionnel
Un 7B spécialisé écrit des fonctions correctes et corrige des bugs simples ; un 1B produit surtout du code qui « ressemble » à du code.
Moins d'hallucinations
Sans les éliminer, le 7B invente nettement moins et sait plus souvent dire qu'il ne sait pas.
Le seuil 7B
Si votre machine le permet, commencez toujours par un 7B/8B plutôt qu'un 3B. Le gain de fiabilité est disproportionné par rapport au surcoût en VRAM (environ 5 Go en Q4).

#Taille et VRAM : le tableau qui compte

La question pratique n'est pas « quel est le meilleur modèle » mais « quel modèle tient sur ma carte ». La VRAM nécessaire suit directement le nombre de paramètres. Voici les repères en quantification Q4_K_M, le format recommandé par défaut, qui divise la taille par environ quatre par rapport au FP16.

3B ≈ 2 Go
Tourne partout, même sur une carte d'entrée ou en CPU. Idéal mobile et tâches simples.
7B ≈ 5 Go
Confortable sur une RTX 3060 12 Go ou une RTX 4070 12 Go. Le meilleur rapport capacité/accessibilité.
14B ≈ 9 Go
Passe sur 12 Go de VRAM avec un contexte raisonnable, à l'aise sur 16 Go.
32B ≈ 19 Go
Vise une RTX 4090 24 Go, ou une carte 16 Go avec un peu d'offload en RAM.
70B ≈ 40 Go
Hors de portée d'une seule carte grand public : bi-GPU, offload RAM/SSD, ou un Mac Apple Silicon à mémoire unifiée généreuse (M4 Pro 48 Go).
!
Ne pas oublier le contexte
Ces chiffres couvrent les poids du modèle seuls. La fenêtre de contexte (le cache KV) consomme de la VRAM en plus, d'autant plus qu'elle est grande. Prévoyez une marge de 1 à quelques Go au-dessus de la taille du modèle.

#Taille vs quantification : le vrai arbitrage

Face à une VRAM limitée, deux leviers s'offrent à vous : prendre un modèle plus petit, ou prendre un modèle plus gros mais plus compressé. La quantification réduit la précision des paramètres — de 16 bits à 4 ou 8 bits — pour faire tenir le modèle dans moins de mémoire, au prix d'une légère perte de qualité.

La règle empirique validée par l'usage : un modèle plus gros quantifié plus fort bat presque toujours un modèle plus petit en pleine précision, à VRAM égale. Un 13B en Q4 tient dans la même mémoire qu'un 7B en Q8, et se révèle généralement plus capable. Le nombre de paramètres pèse plus lourd que les derniers bits de précision.

Q4_K_M
Le défaut recommandé. Perte de qualité minime, mémoire divisée par ~4. Le choix par défaut pour presque tous les usages.
Q5_K_M
Un cran au-dessus en qualité pour un peu plus de VRAM. Bon compromis si la mémoire le permet.
Q8_0
Quasi indiscernable du FP16. À réserver aux petits modèles ou aux cartes très fournies.
FP16
Pleine précision, deux fois plus lourd que Q8. Utile surtout pour le fine-tuning, rarement nécessaire à l'inférence.
L'arbitrage en une phrase
À mémoire égale, préférez un modèle plus gros en Q4 à un modèle plus petit en Q8. Ne descendez pas sous Q4 sauf nécessité : en dessous, la qualité chute rapidement.

#Pourquoi un petit modèle récent bat un gros ancien

C'est le point qui déroute le plus les débutants : un LLM 7B de 2026 peut surpasser un 70B de 2023. La taille n'est qu'un des facteurs de la qualité — et pas toujours le plus décisif. Trois autres leviers ont énormément progressé.

Qualité des données
Les modèles récents sont entraînés sur des corpus mieux filtrés, dédupliqués et enrichis en données synthétiques de haute qualité. À taille égale, ils apprennent bien plus.
Volume d'entraînement
Les 7B modernes voient des dizaines de milliers de milliards de tokens, bien plus que les anciens gros modèles. Un petit réseau très entraîné surpasse un gros réseau sous-entraîné.
Architecture et post-training
Meilleures architectures, alignement par RLHF, entraînement spécifique au raisonnement : autant de gains qui n'ont rien à voir avec le nombre de paramètres.

La distillation joue aussi un rôle clé : on transfère le savoir d'un très gros modèle vers un petit, qui hérite d'une partie de ses capacités pour une fraction de la taille. C'est ainsi qu'un 7B ou 8B distillé raisonne comme un modèle bien plus lourd. Conséquence pratique : regardez toujours la date de sortie et les benchmarks récents, jamais le seul nombre de paramètres.

!
Le piège marketing
« Plus gros = meilleur » est faux dans l'absolu. Un modèle est bon grâce à ses données, son entraînement et son architecture autant que par sa taille. Méfiez-vous des comparaisons qui n'alignent que les milliards de paramètres.

#Choisir sa taille en pratique

La bonne taille est celle qui tient sur votre matériel tout en couvrant votre usage. Partez du plus gros modèle récent que votre VRAM accepte en Q4, puis ajustez selon le besoin réel de vitesse ou de finesse.

  1. 01
    Mesurez votre VRAM
    Identifiez la mémoire de votre GPU (ou la RAM unifiée sur Mac). C'est le plafond dur qui élimine d'emblée les modèles trop gros.
  2. 02
    Visez le plus gros modèle récent qui rentre en Q4
    Sur 12 Go, un 14B récent. Sur 24 Go, un 32B. Sur 8 Go, un bon 7B/8B. Préférez toujours une sortie récente à un ancien plus gros.
  3. 03
    Ajustez selon l'usage
    Chat courant et vitesse : restez sur 7B–14B. Raisonnement, code exigeant, traduction fine : montez vers 30B+ si la mémoire suit.
  4. 04
    Vérifiez la vitesse
    Si le débit en tokens/seconde vous frustre, descendez d'un palier. Un 7B rapide bat souvent un 32B poussif pour un usage interactif.

#Comparer deux tailles en 5 minutes

Le meilleur moyen de sentir la différence est de faire tourner deux tailles côte à côte sur votre propre machine. Si Ollama est installé et écoute sur son port par défaut (http://localhost:11434), deux commandes suffisent.

Terminal
# Un petit modèle rapide
ollama run llama3.2:3b --verbose

# Le même prompt sur un modèle plus gros
ollama run llama3.1:8b --verbose

Posez la même question de raisonnement aux deux (par exemple un petit problème logique en plusieurs étapes) et comparez la qualité des réponses et le débit affiché par --verbose. Vous verrez concrètement où se situe le compromis capacité/vitesse sur votre matériel.

i
Lire les tokens/seconde
Le drapeau --verbose affiche en fin de réponse le nombre de tokens par seconde. C'est la mesure objective pour arbitrer entre deux tailles sur votre propre GPU.

#Pour aller plus loin

La taille se comprend mieux en la reliant aux autres notions de base du local. Ces guides prolongent directement celui-ci :

Choisir sa quantification (Q4, Q5, Q8, FP16)
L'autre moitié de l'arbitrage mémoire : comment compresser un modèle sans le dégrader, avec un guide visuel.
MoE expliqué : pourquoi un 30B-A3B tourne comme un petit modèle
La notation à deux chiffres qui casse le lien entre taille et vitesse, à lire juste après celui-ci.
Distillation : comment les petits modèles héritent des gros
Pour comprendre en profondeur pourquoi un petit modèle récent peut battre un gros ancien.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.