Débutant 10 minConcepts

Hugging Face : c'est quoi, et comment s'en servir ?

Hugging Face est la plateforme où sont publiés presque tous les modèles d'IA ouverts : Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. On la décrit souvent comme le GitHub du machine learning. Pour qui fait tourner une IA sur sa propre machine, c'est l'entrepôt d'où viennent tous les fichiers, y compris ceux qu'Ollama et LM Studio téléchargent pour vous. Au 20 septembre 2026, le site héberge bien plus d'un million de modèles, sans tri. Cette page vous apprend à le lire : quel dépôt ouvrir, quel fichier prendre pour votre carte graphique, et quoi vérifier avant de cliquer.

Par Mohamed Meguedmi·Màj 2026-09-20·Testé sur Windows, macOS, Linux

#Hugging Face, c'est quoi ?

Hugging Face est une entreprise fondée en 2016 par trois Français, Clément Delangue, Julien Chaumond et Thomas Wolf, et installée entre New York et Paris. Elle a commencé par une application de chatbot pour adolescents, d'où le nom emprunté à l'émoji. Elle s'est ensuite tournée vers l'outillage open source : sa bibliothèque transformers est devenue la façon standard de charger un modèle de langage en Python. L'entreprise a enfin construit le Hub, une plateforme d'hébergement fondée sur Git où chacun peut publier des modèles, des jeux de données et de petites démonstrations web.

Pour l'IA locale, le Hub joue le rôle d'une boutique d'applications, à deux différences près : presque tout y est gratuit, et rien n'est sélectionné pour vous. Savoir s'y repérer est la compétence à acquérir.

#Les trois rayons du Hub

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j
RayonContenuIntérêt pour l'IA locale
ModelsFichiers de poids, configuration, documentationC'est ici que se trouve le fichier que vous ferez tourner
DatasetsDonnées d'entraînement et d'évaluationSeulement si vous faites du fine-tuning ou des tests
SpacesPetites applications web, le plus souvent des démosEssayer un modèle dans le navigateur avant de télécharger 15 Go

#Lire une page de modèle

Chaque modèle vit à une adresse de la forme huggingface.co/organisation/nom-du-modele. Quatre éléments de la page méritent votre attention.

Le nom de l'organisation
Qwen, google, meta-llama, mistralai, openai, deepseek-ai sont les laboratoires eux-mêmes. Tout autre nom désigne un tiers : parfois excellent, mais pas l'original.
La fiche du modèle (model card)
Le fichier README : ce qu'est le modèle, comment il a été entraîné, ses usages prévus, ses scores, son format de prompt, ses limites. La qualité va du très complet au vide.
La licence
Affichée en haut de la fiche. Voir la section dédiée plus bas.
L'onglet Files and versions
Les téléchargements. Un coup d'œil suffit pour savoir dans quel type de dépôt vous êtes.

#Quel dépôt choisir : poids d'origine ou GGUF

Ce que vous voyez dans FilesCe que c'estPour quels outilsTaille pour un modèle 8B
model-00001-of-00004.safetensors…Poids d'origine, en BF16, découpés en plusieurs fichierstransformers, vLLM, outils de fine-tuning≈ 16 Go
…-Q4_K_M.gguf, …-Q8_0.ggufConversions quantifiées, un seul fichier par niveauOllama, LM Studio, llama.cpp, KoboldCpp, Jan≈ 5 Go en Q4
Dépôts …-AWQ, …-GPTQ, …-FP8Quantification pensée pour les serveurs GPUvLLM et moteurs équivalents≈ 5 à 9 Go
Dépôts …-MLX-4bitFormat Apple SiliconMLX, LM Studio sur Mac≈ 5 Go

Les laboratoires publient surtout le premier type. Les GGUF dont les applications de bureau ont besoin sont produits par des convertisseurs : certains laboratoires publient les leurs, et des contributeurs comme bartowski, unsloth ou ggml-org couvrent presque tout le reste quelques heures après une sortie. Pour les trouver, ouvrez la page du modèle d'origine et suivez le lien Quantizations dans l'arbre du modèle, à droite, ou cherchez le nom du modèle suivi de GGUF.

#Choisir le bon fichier pour votre carte

Un dépôt GGUF propose souvent une dizaine de fichiers pour le même modèle, un par niveau de quantification. La taille du fichier correspond, à peu de chose près, à la VRAM que les poids occuperont. Gardez 1 à 3 Go libres pour le contexte.

Calculé depuis le catalogue QuelLLM · 20/09/2026 · tailles arrondies au Go supérieur
ModèleQ4_K_MQ5_K_MQ8_0BF16Carte confortable en Q4
Qwen 3 8B5 Go6 Go9 Go16 Go8 Go
Gemma 4 12B7 Go9 Go13 Go24 Go12 Go
Qwen 3 14B9 Go11 Go16 Go28 Go12 Go
gpt-oss 20B13 Go16 Go23 Go42 Go16 Go
Mistral Small 3.2 24B14 Go17 Go26 Go48 Go16 Go
Qwen 3.8 27B16 Go19 Go29 Go54 Go24 Go
Llama 3.3 70B40 Go48 Go75 Go140 Go2 × 24 Go

#Trois façons de télécharger

La plus simple consiste à laisser votre outil s'en charger. La recherche de LM Studio interroge directement Hugging Face et indique quels fichiers tiennent sur votre machine. Ollama et llama.cpp savent tous deux tirer un dépôt GGUF par son nom.

Depuis Ollama ou llama.cpp
# Ollama : lancer n'importe quel dépôt GGUF du Hub
ollama run hf.co/bartowski/Qwen_Qwen3-8B-GGUF:Q4_K_M

# llama.cpp : télécharger et servir
llama-server -hf bartowski/Qwen_Qwen3-8B-GGUF:Q4_K_M
Avec l'outil en ligne de commande
pip install -U huggingface_hub
hf download bartowski/Qwen_Qwen3-8B-GGUF --include "*Q4_K_M.gguf" --local-dir ./models

Le filtre --include est important : sans lui, vous téléchargez toutes les quantifications du dépôt, souvent plus de 100 Go. Troisième voie, le navigateur : onglet Files and versions, flèche de téléchargement à côté du fichier. Pratique pour un GGUF isolé, inadapté aux poids d'origine découpés.

i
Les modèles à accès conditionnel
Certains laboratoires, dont Meta pour la famille Llama, demandent d'accepter leurs conditions avant le téléchargement. Créez un compte gratuit, cliquez sur le bouton d'accès de la page du modèle, puis authentifiez l'outil en ligne de commande une fois avec hf auth login et un jeton créé dans les réglages du compte. Les conversions GGUF communautaires ne sont en général pas verrouillées, mais la licence d'origine s'applique quand même à vous.

#Licences : ouvert ne veut pas dire sans condition

Licences relevées dans le catalogue QuelLLM · 20/09/2026
LicenceExemples du catalogueUsage commercial
Apache 2.0Famille Qwen 3, Gemma 4 12B, gpt-oss, Mistral Small 3.2Oui, avec mention
MITDistillations DeepSeek R1, GLM 4.7 FlashOui
Llama Community LicenseLlama 3.3 70BOui sous conditions : règles de nommage, politique d'usage, seuil d'utilisateurs
Non commerciale, rechercheDiverses publications de rechercheNon

L'étiquette de la fiche du modèle fait foi, et un modèle dérivé hérite des obligations de son modèle de base. Pour un déploiement en entreprise, ces deux minutes de lecture évitent de bâtir sur une licence inadaptée.

#Est-ce sûr ?

Préférez .safetensors et .gguf
Ce sont des formats de données pures. Les anciens fichiers PyTorch .bin et .pt reposent sur le mécanisme pickle de Python, capable d'exécuter du code au chargement. Le Hub les signale par un avertissement.
Méfiez-vous de « trust remote code »
Certains dépôts embarquent du code Python que le chargeur demande l'autorisation d'exécuter. N'acceptez que pour des organisations que vous connaissez.
Regardez qui publie
Le nombre de téléchargements, les autres dépôts de l'organisation et un lien depuis le site du laboratoire sont de bons signaux. Des comptes imitateurs existent.
Le modèle reste chez vous
Une fois téléchargé, un GGUF exécuté par llama.cpp ou Ollama ne fait aucun appel réseau. Vos prompts ne partent pas chez Hugging Face.

#FAQ

À quoi sert Hugging Face ?+
À publier et télécharger des modèles d'IA ouverts, des jeux de données et des démonstrations. Pour l'IA locale, c'est la source principale des fichiers de modèles, notamment des versions GGUF quantifiées que chargent Ollama, LM Studio et llama.cpp.
Hugging Face est-il gratuit ?+
Consulter et télécharger les modèles publics est gratuit et ne demande pas de compte, sauf pour les modèles à accès conditionnel. L'entreprise facture l'inférence hébergée, la puissance de calcul des Spaces, le stockage privé et les offres entreprise.
Hugging Face est-il une entreprise française ?+
Elle a été fondée par trois Français et garde une équipe importante à Paris, mais son siège est aux États-Unis. C'est l'une des rares plateformes majeures de l'IA à avoir des racines françaises.
Faut-il un compte pour télécharger un modèle ?+
Pas dans la plupart des cas. Un compte et un jeton d'accès ne sont nécessaires que pour les modèles dont le laboratoire exige l'acceptation préalable de ses conditions, comme les Llama de Meta.
Quel fichier télécharger pour Ollama ou LM Studio ?+
Un seul fichier .gguf issu d'un dépôt GGUF, en général la variante Q4_K_M, dont la taille est inférieure de 1 à 3 Go à la mémoire de votre carte graphique. Les fichiers .safetensors découpés du dépôt d'origine sont destinés aux frameworks Python et aux moteurs de serveur.

Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.