Hugging Face : c'est quoi, et comment s'en servir ?
Hugging Face est la plateforme où sont publiés presque tous les modèles d'IA ouverts : Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. On la décrit souvent comme le GitHub du machine learning. Pour qui fait tourner une IA sur sa propre machine, c'est l'entrepôt d'où viennent tous les fichiers, y compris ceux qu'Ollama et LM Studio téléchargent pour vous. Au 20 septembre 2026, le site héberge bien plus d'un million de modèles, sans tri. Cette page vous apprend à le lire : quel dépôt ouvrir, quel fichier prendre pour votre carte graphique, et quoi vérifier avant de cliquer.
#Hugging Face, c'est quoi ?
Hugging Face est une entreprise fondée en 2016 par trois Français, Clément Delangue, Julien Chaumond et Thomas Wolf, et installée entre New York et Paris. Elle a commencé par une application de chatbot pour adolescents, d'où le nom emprunté à l'émoji. Elle s'est ensuite tournée vers l'outillage open source : sa bibliothèque transformers est devenue la façon standard de charger un modèle de langage en Python. L'entreprise a enfin construit le Hub, une plateforme d'hébergement fondée sur Git où chacun peut publier des modèles, des jeux de données et de petites démonstrations web.
Pour l'IA locale, le Hub joue le rôle d'une boutique d'applications, à deux différences près : presque tout y est gratuit, et rien n'est sélectionné pour vous. Savoir s'y repérer est la compétence à acquérir.
#Les trois rayons du Hub
Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
| Rayon | Contenu | Intérêt pour l'IA locale |
|---|---|---|
| Models | Fichiers de poids, configuration, documentation | C'est ici que se trouve le fichier que vous ferez tourner |
| Datasets | Données d'entraînement et d'évaluation | Seulement si vous faites du fine-tuning ou des tests |
| Spaces | Petites applications web, le plus souvent des démos | Essayer un modèle dans le navigateur avant de télécharger 15 Go |
#Lire une page de modèle
Chaque modèle vit à une adresse de la forme huggingface.co/organisation/nom-du-modele. Quatre éléments de la page méritent votre attention.
- Le nom de l'organisation
- Qwen, google, meta-llama, mistralai, openai, deepseek-ai sont les laboratoires eux-mêmes. Tout autre nom désigne un tiers : parfois excellent, mais pas l'original.
- La fiche du modèle (model card)
- Le fichier README : ce qu'est le modèle, comment il a été entraîné, ses usages prévus, ses scores, son format de prompt, ses limites. La qualité va du très complet au vide.
- La licence
- Affichée en haut de la fiche. Voir la section dédiée plus bas.
- L'onglet Files and versions
- Les téléchargements. Un coup d'œil suffit pour savoir dans quel type de dépôt vous êtes.
#Quel dépôt choisir : poids d'origine ou GGUF
| Ce que vous voyez dans Files | Ce que c'est | Pour quels outils | Taille pour un modèle 8B |
|---|---|---|---|
| model-00001-of-00004.safetensors… | Poids d'origine, en BF16, découpés en plusieurs fichiers | transformers, vLLM, outils de fine-tuning | ≈ 16 Go |
| …-Q4_K_M.gguf, …-Q8_0.gguf | Conversions quantifiées, un seul fichier par niveau | Ollama, LM Studio, llama.cpp, KoboldCpp, Jan | ≈ 5 Go en Q4 |
| Dépôts …-AWQ, …-GPTQ, …-FP8 | Quantification pensée pour les serveurs GPU | vLLM et moteurs équivalents | ≈ 5 à 9 Go |
| Dépôts …-MLX-4bit | Format Apple Silicon | MLX, LM Studio sur Mac | ≈ 5 Go |
Les laboratoires publient surtout le premier type. Les GGUF dont les applications de bureau ont besoin sont produits par des convertisseurs : certains laboratoires publient les leurs, et des contributeurs comme bartowski, unsloth ou ggml-org couvrent presque tout le reste quelques heures après une sortie. Pour les trouver, ouvrez la page du modèle d'origine et suivez le lien Quantizations dans l'arbre du modèle, à droite, ou cherchez le nom du modèle suivi de GGUF.
- GGUF et safetensors : comprendre les formats de modèles
- vLLM : le moteur qui utilise les poids d'origine
#Choisir le bon fichier pour votre carte
Un dépôt GGUF propose souvent une dizaine de fichiers pour le même modèle, un par niveau de quantification. La taille du fichier correspond, à peu de chose près, à la VRAM que les poids occuperont. Gardez 1 à 3 Go libres pour le contexte.
| Modèle | Q4_K_M | Q5_K_M | Q8_0 | BF16 | Carte confortable en Q4 |
|---|---|---|---|---|---|
| Qwen 3 8B | 5 Go | 6 Go | 9 Go | 16 Go | 8 Go |
| Gemma 4 12B | 7 Go | 9 Go | 13 Go | 24 Go | 12 Go |
| Qwen 3 14B | 9 Go | 11 Go | 16 Go | 28 Go | 12 Go |
| gpt-oss 20B | 13 Go | 16 Go | 23 Go | 42 Go | 16 Go |
| Mistral Small 3.2 24B | 14 Go | 17 Go | 26 Go | 48 Go | 16 Go |
| Qwen 3.8 27B | 16 Go | 19 Go | 29 Go | 54 Go | 24 Go |
| Llama 3.3 70B | 40 Go | 48 Go | 75 Go | 140 Go | 2 × 24 Go |
- Q4, Q5, Q8 ou FP16 : choisir sa quantification
- VRAM : connaître la vôtre et savoir ce qu'elle permet
- Le calculateur de VRAM
#Trois façons de télécharger
La plus simple consiste à laisser votre outil s'en charger. La recherche de LM Studio interroge directement Hugging Face et indique quels fichiers tiennent sur votre machine. Ollama et llama.cpp savent tous deux tirer un dépôt GGUF par son nom.
Le filtre --include est important : sans lui, vous téléchargez toutes les quantifications du dépôt, souvent plus de 100 Go. Troisième voie, le navigateur : onglet Files and versions, flèche de téléchargement à côté du fichier. Pratique pour un GGUF isolé, inadapté aux poids d'origine découpés.
#Licences : ouvert ne veut pas dire sans condition
| Licence | Exemples du catalogue | Usage commercial |
|---|---|---|
| Apache 2.0 | Famille Qwen 3, Gemma 4 12B, gpt-oss, Mistral Small 3.2 | Oui, avec mention |
| MIT | Distillations DeepSeek R1, GLM 4.7 Flash | Oui |
| Llama Community License | Llama 3.3 70B | Oui sous conditions : règles de nommage, politique d'usage, seuil d'utilisateurs |
| Non commerciale, recherche | Diverses publications de recherche | Non |
L'étiquette de la fiche du modèle fait foi, et un modèle dérivé hérite des obligations de son modèle de base. Pour un déploiement en entreprise, ces deux minutes de lecture évitent de bâtir sur une licence inadaptée.
#Est-ce sûr ?
- Préférez .safetensors et .gguf
- Ce sont des formats de données pures. Les anciens fichiers PyTorch .bin et .pt reposent sur le mécanisme pickle de Python, capable d'exécuter du code au chargement. Le Hub les signale par un avertissement.
- Méfiez-vous de « trust remote code »
- Certains dépôts embarquent du code Python que le chargeur demande l'autorisation d'exécuter. N'acceptez que pour des organisations que vous connaissez.
- Regardez qui publie
- Le nombre de téléchargements, les autres dépôts de l'organisation et un lien depuis le site du laboratoire sont de bons signaux. Des comptes imitateurs existent.
- Le modèle reste chez vous
- Une fois téléchargé, un GGUF exécuté par llama.cpp ou Ollama ne fait aucun appel réseau. Vos prompts ne partent pas chez Hugging Face.
#FAQ
À quoi sert Hugging Face ?+
Hugging Face est-il gratuit ?+
Hugging Face est-il une entreprise française ?+
Faut-il un compte pour télécharger un modèle ?+
Quel fichier télécharger pour Ollama ou LM Studio ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.