Intermédiaire 10 minFalcon

Falcon H1 en local : l'hybride Mamba venu des Émirats

Falcon H1 est la famille de modèles open-weight du Technology Innovation Institute d'Abou Dabi, et la première de TII à mélanger attention classique et couches Mamba dans chaque bloc. Ce guide explique ce que change cette architecture hybride, quelle taille de Falcon H1 installer en local selon votre VRAM, comment mesurer son gain mémoire sur les longs contextes, et s'il vaut la peine de remplacer Mistral Small ou Qwen3 dans votre stack Ollama.

Par Samir K.·Màj 2026-09-27·Testé sur Windows, macOS, Linux

#Pourquoi s'intéresser à Falcon H1

Les premiers Falcon, en 2023, avaient marqué l'open-weight avant de se faire distancer par Llama, Mistral puis Qwen. Falcon H1, publié en mai 2025 par le Technology Innovation Institute (TII) d'Abou Dabi, change de logique : au lieu de courir après les transformeurs classiques, TII repart d'une architecture différente, combinant attention et modèles à espace d'états (Mamba-2), pour obtenir des modèles compacts qui tiennent la comparaison avec des concurrents deux fois plus gros.

Pour un usage local, l'intérêt tient en trois points. La gamme couvre toutes les configurations, de 0,5 milliard de paramètres pour un Raspberry Pi ou un vieux portable jusqu'à 34 milliards pour une RTX 4090 ou un Mac à mémoire unifiée. Le contexte annoncé atteint 256 000 tokens, et l'architecture hybride le rend réellement exploitable en local là où un transformeur classique sature la VRAM. Enfin, Falcon H1 a été entraîné nativement sur 18 langues, dont le français et l'arabe, ce qui en fait un candidat sérieux pour du texte francophone sans passer par un modèle centré sur l'anglais ou le chinois.

i
Falcon H1 et Falcon H1R
Ce guide traite de la famille Falcon H1 de base (Instruct). Falcon H1R 7B, sorti début 2026, est la déclinaison entraînée au raisonnement pas à pas, sur la même architecture. Tout ce qui concerne l'installation et la mémoire s'applique aux deux ; seul le comportement en réponse diffère, H1R étant plus lent car plus bavard.

#L'hybride attention-Mamba en deux mots

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j

Un transformeur classique repose entièrement sur l'attention. À chaque nouveau token, le modèle relit l'ensemble du contexte et conserve pour chaque token passé une paire de vecteurs, le fameux KV cache. Cette mémoire grossit linéairement avec la longueur de la conversation ou du document. C'est elle, et non les poids du modèle, qui fait déborder votre carte graphique quand vous chargez un long rapport.

Mamba appartient à une autre famille, les modèles à espace d'états (state space models). Une couche Mamba ne relit pas le passé : elle maintient un état récurrent de taille fixe qui résume ce qui précède, à la manière d'un réseau récurrent modernisé. La mémoire par token est constante, le débit reste stable quelle que soit la longueur du contexte. La contrepartie connue, c'est un rappel moins précis des détails éloignés : un modèle Mamba pur retrouve moins bien un chiffre précis enfoui dans une page 40.

Les hybrides visent le meilleur des deux. Là où IBM Granite 4 ou Jamba alternent des couches Mamba et des couches d'attention, Falcon H1 adopte un schéma parallèle : dans chaque bloc, des têtes d'attention et des têtes Mamba-2 travaillent côte à côte sur la même entrée, et leurs sorties sont concaténées avant la couche suivante. TII a réglé le ratio entre les deux au profit des canaux Mamba, ce qui garde la mémoire d'attention à un niveau bien inférieur à celle d'un transformeur de taille équivalente, tout en conservant assez d'attention pour retrouver un détail exact.

Transformeur classique (Mistral, Qwen, Llama)
100 % attention. Qualité de rappel maximale, mais KV cache proportionnel au contexte : la VRAM s'envole au-delà de quelques dizaines de milliers de tokens.
Mamba pur (Falcon Mamba 7B)
Mémoire constante par token, très rapide sur flux longs. Rappel des détails lointains plus faible, et support logiciel encore inégal.
Hybride séquentiel (Granite 4, Jamba)
Couches Mamba majoritaires, entrecoupées de couches d'attention. Bon gain mémoire, architecture simple à implémenter dans les runtimes.
Hybride parallèle (Falcon H1)
Attention et Mamba-2 dans chaque bloc, sorties concaténées. Le modèle décide à chaque couche de ce qu'il confie à la mémoire précise ou à la mémoire compressée.
→
Ce que ça change concrètement
Sur un prompt de 2 000 tokens, vous ne verrez aucune différence avec un transformeur classique. Chargez un contrat de 60 pages ou une conversation de trois heures, et l'écart devient visible : Falcon H1 garde une empreinte mémoire presque plate là où Mistral Small ou Qwen3 doivent quantifier leur KV cache ou réduire le contexte.

#Les tailles disponibles : de 0,5B à 34B

TII publie Falcon H1 en six tailles, chacune en version Base (pré-entraînée) et Instruct (chat). Seules les versions Instruct vous intéressent pour un usage Ollama ou LM Studio. Toutes partagent la même architecture et le même tokenizer multilingue.

Falcon H1 0.5B
Le plus petit. Pour l'embarqué, un test de pipeline ou un Raspberry Pi. Ne l'attendez pas sur une tâche de rédaction sérieuse.
Falcon H1 1.5B
Classification, extraction simple, autocomplétion. Tourne sur n'importe quel CPU récent avec moins de 2 Go de mémoire.
Falcon H1 1.5B-Deep
Même nombre de paramètres que le 1.5B, mais beaucoup plus de couches, moins larges. TII le positionne au niveau de modèles de 7 à 10 milliards de paramètres. C'est la variante à essayer sur un portable sans GPU.
Falcon H1 3B
Le compromis pour une carte de 4 à 6 Go ou un Mac 16 Go. Résumé, chat en français, RAG léger.
Falcon H1 7B
Le cœur de gamme. Rivalise avec Qwen3 8B et dépasse les 7B de génération précédente. Une RTX 3060 12GB le fait tourner avec un contexte généreux.
Falcon H1 34B
Le haut de gamme. TII le compare à Qwen3 32B, Gemma 3 27B et Llama 4 Scout. Nécessite 24 Go de VRAM au minimum en Q4, ou un Mac à mémoire unifiée 48 Go pour être à l'aise.

La variante 1.5B-Deep mérite un mot. TII a fait le pari d'un modèle étroit mais très profond, avec près de trois fois plus de couches que le 1.5B standard. Le résultat est plus lent par token, car chaque couche s'exécute en série, mais nettement plus capable. Sur CPU, où la bande passante mémoire limite tout, c'est souvent le meilleur rapport qualité par gigaoctet de toute la gamme.

#Prérequis et VRAM

Côté logiciel, il vous faut un Ollama récent. Le support de l'architecture falcon-h1 a été ajouté dans llama.cpp à l'été 2025, et Ollama l'a hérité dans les versions publiées ensuite. Un Ollama antérieur refusera de charger le modèle avec une erreur d'architecture inconnue. Le daemon écoute par défaut sur http://localhost:11434 ; Open WebUI ou LM Studio se branchent dessus sans réglage particulier.

0.5B et 1.5B en Q4_K_M
Moins de 1,5 Go. CPU seul avec 4 Go de RAM libres. Aucun GPU requis.
3B en Q4_K_M
≈ 2 Go de VRAM. Toute carte de 4 Go ou plus, ou 8 Go de RAM en mode CPU.
7B en Q4_K_M
≈ 5 Go de VRAM pour les poids. RTX 3060 12GB ou RTX 4070 12GB confortables, avec de la marge pour un contexte de 32K tokens ou plus.
7B en Q8_0
≈ 8 Go. Pour une RTX 4080 16GB ou un Mac 24 Go si vous voulez la précision maximale sur de l'extraction.
34B en Q4_K_M
≈ 20 Go. RTX 4090 24GB juste, contexte à surveiller. M4 Pro 48 Go ou Mac Studio bien plus à l'aise.
34B en Q8_0
≈ 36 Go. Réservé aux Mac 64 Go et plus, ou à un bi-GPU.
i
Repère quantification
Q4_K_M reste le défaut recommandé, meilleur ratio qualité sur taille. Passez en Q5_K_M ou Q8_0 uniquement si la VRAM le permet et que vous mesurez une différence sur vos tâches. Sur Falcon H1, la marge libérée par le KV cache réduit vaut souvent plus qu'un cran de quantification supplémentaire.

#Installer Falcon H1 en local selon sa VRAM

TII publie des GGUF officiels pour chaque taille sur Hugging Face, dans des dépôts nommés tiiuae/Falcon-H1-<taille>-Instruct-GGUF. Ollama sait tirer un GGUF directement depuis Hugging Face avec le préfixe hf.co, en précisant la quantification voulue après les deux-points. Vérifiez au passage sur ollama.com/library si un tag officiel falcon-h1 est apparu depuis la rédaction de ce guide ; le cas échéant, préférez-le, il embarque un template de chat validé.

  1. 01
    Mettre Ollama à jour
    Relancez l'installeur officiel ou votre gestionnaire de paquets, puis vérifiez la version. C'est l'étape que tout le monde saute et qui explique la majorité des échecs de chargement.
  2. 02
    Choisir la taille selon la VRAM
    12 Go ou moins : 7B en Q4_K_M. 4 à 6 Go : 3B. Pas de GPU : 1.5B-Deep. 24 Go ou Mac 48 Go : 34B. Ne tirez pas plusieurs tailles d'un coup, chaque GGUF pèse de 1 à 20 Go.
  3. 03
    Tirer le GGUF depuis Hugging Face
    Utilisez ollama pull avec le chemin hf.co du dépôt et le tag de quantification. Ollama télécharge le fichier, lit ses métadonnées et génère le template de chat à partir de celles-ci.
  4. 04
    Lancer une session et tester en français
    ollama run ouvre un chat interactif. Posez une vraie tâche, résumé d'un texte ou extraction de champs, plutôt qu'une devinette. Vérifiez que le modèle répond en français sans glisser vers l'anglais.
  5. 05
    Contrôler la répartition GPU/CPU
    ollama ps indique le pourcentage du modèle chargé sur le GPU. Si une partie est en CPU, réduisez la taille ou la quantification, sinon le débit s'effondre.
Terminal — Falcon H1 7B sur une carte 12 Go
# 1. Vérifier la version d'Ollama (doit dater d'après l'été 2025)
ollama --version

# 2. Tirer le GGUF officiel TII en Q4_K_M (~4,5 Go)
ollama pull hf.co/tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M

# 3. Lancer une session interactive
ollama run hf.co/tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M

# 4. Vérifier que tout est sur le GPU
ollama ps
Terminal — autres tailles
# Sans GPU : la variante 1.5B-Deep, étroite mais très profonde
ollama pull hf.co/tiiuae/Falcon-H1-1.5B-Deep-Instruct-GGUF:Q4_K_M

# Carte 4-6 Go ou Mac 16 Go
ollama pull hf.co/tiiuae/Falcon-H1-3B-Instruct-GGUF:Q4_K_M

# RTX 4090 24 Go ou Mac 48 Go
ollama pull hf.co/tiiuae/Falcon-H1-34B-Instruct-GGUF:Q4_K_M

Le nom complet avec préfixe hf.co est long à taper et peu lisible dans Open WebUI. Créez un alias local avec un Modelfile : vous en profitez pour fixer le contexte et un system prompt en français, et le modèle apparaît sous un nom court dans toutes vos interfaces.

Terminal — alias court avec Modelfile
cat > Modelfile.falcon-h1 <<'EOF'
FROM hf.co/tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M
PARAMETER num_ctx 32768
PARAMETER temperature 0.3
SYSTEM "Tu es un assistant précis. Tu réponds en français, de façon concise."
EOF

ollama create falcon-h1:7b -f Modelfile.falcon-h1
ollama run falcon-h1:7b

Pour un usage applicatif, Ollama expose son API HTTP sur le même port, avec un endpoint compatible OpenAI. Tout client existant fonctionne en changeant l'URL de base et le nom du modèle.

Terminal — appel API local
curl http://localhost:11434/api/chat -d '{
  "model": "falcon-h1:7b",
  "messages": [
    { "role": "user", "content": "Résume ce texte en trois points : ..." }
  ],
  "options": { "num_ctx": 32768 },
  "stream": false
}'
!
Utilisateurs llama.cpp et LM Studio
llama.cpp charge les mêmes GGUF avec l'option -hf, par exemple llama-server -hf tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M. LM Studio s'appuie sur le même moteur : mettez-le à jour avant de chercher Falcon H1 dans son catalogue, une version ancienne ne listera pas le fichier comme compatible.

#L'avantage mémoire sur longs contextes, mesuré

C'est la promesse centrale de Falcon H1 en local, et elle se vérifie en dix minutes. Le protocole est simple : charger le même modèle avec deux tailles de contexte, et comparer la mémoire occupée que rapporte ollama ps. Sur un transformeur classique, passer de 8K à 64K tokens fait grimper la consommation de plusieurs gigaoctets. Sur Falcon H1, la hausse existe, car la part attention conserve un KV cache, mais elle est nettement plus faible.

Terminal — mesurer le coût du contexte
# Contexte 8K : noter la colonne SIZE de ollama ps
OLLAMA_CONTEXT_LENGTH=8192 ollama run falcon-h1:7b "Bonjour" && ollama ps

# Décharger, puis recharger avec 64K
ollama stop falcon-h1:7b
OLLAMA_CONTEXT_LENGTH=65536 ollama run falcon-h1:7b "Bonjour" && ollama ps

# Même exercice avec un transformeur classique pour comparer
ollama stop falcon-h1:7b
OLLAMA_CONTEXT_LENGTH=65536 ollama run qwen3:8b "Bonjour" && ollama ps

Deux précisions pour lire les chiffres. D'abord, Ollama réserve le KV cache à l'avance pour tout le contexte demandé : la mémoire affichée reflète donc la capacité réservée, pas ce que votre prompt utilise réellement. Ensuite, si vous avez activé la quantification du KV cache dans la configuration d'Ollama, elle s'applique aussi à la part attention de Falcon H1, ce qui réduit encore l'écart mesuré mais ne change pas la conclusion : à VRAM égale, Falcon H1 accepte un contexte bien plus long qu'un transformeur de même taille.

En pratique, sur une carte 12 Go, Falcon H1 7B en Q4_K_M laisse la place à un contexte de 64K tokens sans déborder sur le CPU, là où Qwen3 8B ou Mistral 7B obligent à quantifier le KV cache ou à se limiter autour de 32K. Le débit de génération, lui, se dégrade beaucoup moins à mesure que le contexte se remplit : la part Mamba traite chaque nouveau token en temps constant.

!
Long contexte ne veut pas dire rappel parfait
Falcon H1 accepte 256K tokens, mais accepter n'est pas comprendre. Comme tout modèle, sa précision baisse sur les détails enfouis loin dans le prompt, et la part Mamba y contribue. Pour retrouver un chiffre exact dans 200 pages, un RAG avec découpage et recherche reste plus fiable qu'un contexte géant. Le long contexte de Falcon H1 brille sur le résumé, la synthèse et le suivi de conversation, pas sur la recherche d'aiguille.

#Face à Mistral Small et Qwen3 : le verdict

La question que tout le monde se pose : faut-il remplacer son modèle habituel ? La réponse dépend de la taille, parce que Falcon H1 ne joue pas dans la même catégorie selon la variante.

Falcon H1 7B contre Qwen3 8B
Qualité globalement comparable, Qwen3 garde un avantage en code et en raisonnement structuré, Falcon H1 est plus naturel en français et surtout bien plus économe dès que le contexte s'allonge. Pour du résumé de documents et du chat francophone sur 12 Go, Falcon H1 prend l'avantage. Pour coder, restez sur Qwen3.
Falcon H1 7B contre Mistral Small 3.2
Ce n'est pas la même classe : Mistral Small pèse 24 milliards de paramètres et demande 14 à 15 Go en Q4. Si vous avez la VRAM, Mistral Small reste meilleur sur la plupart des tâches. Falcon H1 7B est le choix quand la carte fait 12 Go ou que le contexte doit dépasser 32K.
Falcon H1 34B contre Mistral Small 3.2
Le duel intéressant. Falcon H1 34B est plus fort sur les benchmarks de connaissance et de raisonnement et gère mieux les très longs contextes, mais il coûte 5 Go de plus en Q4 et n'a pas de vision. Mistral Small tient sur une carte 16 Go, lit des images, est sous Apache 2.0 et bénéficie d'un écosystème plus mûr, notamment pour le function calling.
Falcon H1 34B contre Qwen3 32B
À VRAM comparable, Qwen3 32B reste la référence pour le code et les agents. Falcon H1 34B est préférable pour de longs documents en français ou en arabe, et sur Mac où la mémoire unifiée absorbe ses 20 Go sans effort.

Le verdict tient en une phrase : Falcon H1 est le meilleur modèle à installer quand votre problème est la mémoire sur longs contextes, ou quand le français et l'arabe sont vos langues de travail. Il n'est pas le meilleur modèle généraliste tout terrain, et il n'a pas la maturité d'écosystème de Mistral ou Qwen. Sur une station de travail avec 24 Go, Mistral Small reste le choix sûr pour un assistant quotidien ; Falcon H1 34B est celui qu'on ajoute à côté pour les gros documents.

→
Le bon test avant de trancher
Prenez trois documents réels de votre activité, de 20 à 80 pages, et posez la même série de questions à Falcon H1 7B et à votre modèle actuel, à contexte égal. Comparez la qualité des résumés, la fidélité des chiffres cités et le débit indiqué en fin de réponse avec l'option --verbose de ollama run. C'est plus parlant que n'importe quel benchmark public.

#Licence Falcon-LLM : lire avant de déployer

Falcon H1 est publié sous la licence Falcon-LLM de TII. Elle est dérivée d'Apache 2.0 et autorise l'usage commercial, la modification et la redistribution, mais elle y ajoute une politique d'usage acceptable et quelques obligations d'attribution. Ce n'est pas la liberté totale d'Apache 2.0 tel que l'offrent Mistral Small ou Granite, et ce n'est pas non plus une licence restrictive au sens de Llama avec ses seuils d'utilisateurs.

Pour un usage personnel ou interne, la question ne se pose pas. Pour un produit commercial redistribué, prenez dix minutes pour lire le texte sur le site de TII et vérifier que votre cas n'entre pas dans les usages exclus. Le catalogue du site indique la licence pour chaque fiche Falcon, et sa version peut évoluer d'une génération à l'autre.

#Dépannage

Erreur unknown model architecture falcon-h1
Votre Ollama, LM Studio ou llama.cpp est trop ancien pour connaître l'architecture hybride. Mettez à jour, redémarrez le daemon et relancez le pull. Aucun autre contournement : les couches Mamba-2 ne se chargent pas sans le support du moteur.
Le pull hf.co échoue ou ne trouve pas le tag
Vérifiez l'orthographe exacte du dépôt et de la quantification sur la page Hugging Face, en particulier la casse de Q4_K_M. Si le dépôt ne propose pas le tag demandé, ouvrez l'onglet Files pour lire la liste des fichiers GGUF disponibles.
Réponses en anglais alors que vous écrivez en français
Ajoutez un system prompt qui impose la langue, comme dans le Modelfile plus haut. Le tokenizer multilingue de Falcon H1 gère très bien le français, mais l'Instruct sans consigne suit parfois la langue dominante de ses données.
Débit très faible sur 34B
ollama ps montre probablement une répartition partielle sur le CPU. En 24 Go, réduisez le contexte à 16K ou passez en Q4_K_S. Sur Mac, augmentez la limite de mémoire GPU allouable si le système en réserve trop.
Mémoire plus haute qu'attendu en long contexte
Normal : Ollama réserve le KV cache d'attention pour tout le contexte déclaré, même vide. Comparez toujours à contexte égal avec un autre modèle, et activez la quantification du KV cache si vous voulez gagner encore un peu.
Template de chat incorrect, balises visibles dans les réponses
Ollama génère le template depuis les métadonnées du GGUF. Si des balises apparaissent, tirez le GGUF officiel TII plutôt qu'une conversion tierce, ou définissez le TEMPLATE explicitement dans votre Modelfile.

#Pour aller plus loin

Falcon H1 prend tout son sens une fois qu'on maîtrise les notions de contexte et de mémoire qu'il exploite. Ces guides du site complètent celui-ci :

Comprendre la fenêtre de contexte
Ce que représentent 8K, 32K ou 256K tokens, ce que ça coûte en VRAM et pourquoi le KV cache est le vrai goulot d'étranglement des transformeurs classiques.
Quantifier le KV cache pour économiser la VRAM
L'autre levier pour allonger le contexte, cumulable avec l'architecture hybride de Falcon H1.
Granite 4 d'IBM en local
L'autre hybride Mamba du moment, à architecture séquentielle et sous Apache 2.0. Le comparer à Falcon H1 aide à comprendre les choix de TII.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Pour arbitrer entre Q4_K_M et Q8_0 sur chaque taille de Falcon H1 selon votre VRAM.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.