Falcon H1 en local : l'hybride Mamba venu des Émirats
Falcon H1 est la famille de modèles open-weight du Technology Innovation Institute d'Abou Dabi, et la première de TII à mélanger attention classique et couches Mamba dans chaque bloc. Ce guide explique ce que change cette architecture hybride, quelle taille de Falcon H1 installer en local selon votre VRAM, comment mesurer son gain mémoire sur les longs contextes, et s'il vaut la peine de remplacer Mistral Small ou Qwen3 dans votre stack Ollama.
#Pourquoi s'intéresser à Falcon H1
Les premiers Falcon, en 2023, avaient marqué l'open-weight avant de se faire distancer par Llama, Mistral puis Qwen. Falcon H1, publié en mai 2025 par le Technology Innovation Institute (TII) d'Abou Dabi, change de logique : au lieu de courir après les transformeurs classiques, TII repart d'une architecture différente, combinant attention et modèles à espace d'états (Mamba-2), pour obtenir des modèles compacts qui tiennent la comparaison avec des concurrents deux fois plus gros.
Pour un usage local, l'intérêt tient en trois points. La gamme couvre toutes les configurations, de 0,5 milliard de paramètres pour un Raspberry Pi ou un vieux portable jusqu'à 34 milliards pour une RTX 4090 ou un Mac à mémoire unifiée. Le contexte annoncé atteint 256 000 tokens, et l'architecture hybride le rend réellement exploitable en local là où un transformeur classique sature la VRAM. Enfin, Falcon H1 a été entraîné nativement sur 18 langues, dont le français et l'arabe, ce qui en fait un candidat sérieux pour du texte francophone sans passer par un modèle centré sur l'anglais ou le chinois.
#L'hybride attention-Mamba en deux mots
Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
Un transformeur classique repose entièrement sur l'attention. À chaque nouveau token, le modèle relit l'ensemble du contexte et conserve pour chaque token passé une paire de vecteurs, le fameux KV cache. Cette mémoire grossit linéairement avec la longueur de la conversation ou du document. C'est elle, et non les poids du modèle, qui fait déborder votre carte graphique quand vous chargez un long rapport.
Mamba appartient à une autre famille, les modèles à espace d'états (state space models). Une couche Mamba ne relit pas le passé : elle maintient un état récurrent de taille fixe qui résume ce qui précède, à la manière d'un réseau récurrent modernisé. La mémoire par token est constante, le débit reste stable quelle que soit la longueur du contexte. La contrepartie connue, c'est un rappel moins précis des détails éloignés : un modèle Mamba pur retrouve moins bien un chiffre précis enfoui dans une page 40.
Les hybrides visent le meilleur des deux. Là où IBM Granite 4 ou Jamba alternent des couches Mamba et des couches d'attention, Falcon H1 adopte un schéma parallèle : dans chaque bloc, des têtes d'attention et des têtes Mamba-2 travaillent côte à côte sur la même entrée, et leurs sorties sont concaténées avant la couche suivante. TII a réglé le ratio entre les deux au profit des canaux Mamba, ce qui garde la mémoire d'attention à un niveau bien inférieur à celle d'un transformeur de taille équivalente, tout en conservant assez d'attention pour retrouver un détail exact.
- Transformeur classique (Mistral, Qwen, Llama)
- 100 % attention. Qualité de rappel maximale, mais KV cache proportionnel au contexte : la VRAM s'envole au-delà de quelques dizaines de milliers de tokens.
- Mamba pur (Falcon Mamba 7B)
- Mémoire constante par token, très rapide sur flux longs. Rappel des détails lointains plus faible, et support logiciel encore inégal.
- Hybride séquentiel (Granite 4, Jamba)
- Couches Mamba majoritaires, entrecoupées de couches d'attention. Bon gain mémoire, architecture simple à implémenter dans les runtimes.
- Hybride parallèle (Falcon H1)
- Attention et Mamba-2 dans chaque bloc, sorties concaténées. Le modèle décide à chaque couche de ce qu'il confie à la mémoire précise ou à la mémoire compressée.
#Les tailles disponibles : de 0,5B à 34B
TII publie Falcon H1 en six tailles, chacune en version Base (pré-entraînée) et Instruct (chat). Seules les versions Instruct vous intéressent pour un usage Ollama ou LM Studio. Toutes partagent la même architecture et le même tokenizer multilingue.
- Falcon H1 0.5B
- Le plus petit. Pour l'embarqué, un test de pipeline ou un Raspberry Pi. Ne l'attendez pas sur une tâche de rédaction sérieuse.
- Falcon H1 1.5B
- Classification, extraction simple, autocomplétion. Tourne sur n'importe quel CPU récent avec moins de 2 Go de mémoire.
- Falcon H1 1.5B-Deep
- Même nombre de paramètres que le 1.5B, mais beaucoup plus de couches, moins larges. TII le positionne au niveau de modèles de 7 à 10 milliards de paramètres. C'est la variante à essayer sur un portable sans GPU.
- Falcon H1 3B
- Le compromis pour une carte de 4 à 6 Go ou un Mac 16 Go. Résumé, chat en français, RAG léger.
- Falcon H1 7B
- Le cœur de gamme. Rivalise avec Qwen3 8B et dépasse les 7B de génération précédente. Une RTX 3060 12GB le fait tourner avec un contexte généreux.
- Falcon H1 34B
- Le haut de gamme. TII le compare à Qwen3 32B, Gemma 3 27B et Llama 4 Scout. Nécessite 24 Go de VRAM au minimum en Q4, ou un Mac à mémoire unifiée 48 Go pour être à l'aise.
La variante 1.5B-Deep mérite un mot. TII a fait le pari d'un modèle étroit mais très profond, avec près de trois fois plus de couches que le 1.5B standard. Le résultat est plus lent par token, car chaque couche s'exécute en série, mais nettement plus capable. Sur CPU, où la bande passante mémoire limite tout, c'est souvent le meilleur rapport qualité par gigaoctet de toute la gamme.
#Prérequis et VRAM
Côté logiciel, il vous faut un Ollama récent. Le support de l'architecture falcon-h1 a été ajouté dans llama.cpp à l'été 2025, et Ollama l'a hérité dans les versions publiées ensuite. Un Ollama antérieur refusera de charger le modèle avec une erreur d'architecture inconnue. Le daemon écoute par défaut sur http://localhost:11434 ; Open WebUI ou LM Studio se branchent dessus sans réglage particulier.
- 0.5B et 1.5B en Q4_K_M
- Moins de 1,5 Go. CPU seul avec 4 Go de RAM libres. Aucun GPU requis.
- 3B en Q4_K_M
- ≈ 2 Go de VRAM. Toute carte de 4 Go ou plus, ou 8 Go de RAM en mode CPU.
- 7B en Q4_K_M
- ≈ 5 Go de VRAM pour les poids. RTX 3060 12GB ou RTX 4070 12GB confortables, avec de la marge pour un contexte de 32K tokens ou plus.
- 7B en Q8_0
- ≈ 8 Go. Pour une RTX 4080 16GB ou un Mac 24 Go si vous voulez la précision maximale sur de l'extraction.
- 34B en Q4_K_M
- ≈ 20 Go. RTX 4090 24GB juste, contexte à surveiller. M4 Pro 48 Go ou Mac Studio bien plus à l'aise.
- 34B en Q8_0
- ≈ 36 Go. Réservé aux Mac 64 Go et plus, ou à un bi-GPU.
#Installer Falcon H1 en local selon sa VRAM
TII publie des GGUF officiels pour chaque taille sur Hugging Face, dans des dépôts nommés tiiuae/Falcon-H1-<taille>-Instruct-GGUF. Ollama sait tirer un GGUF directement depuis Hugging Face avec le préfixe hf.co, en précisant la quantification voulue après les deux-points. Vérifiez au passage sur ollama.com/library si un tag officiel falcon-h1 est apparu depuis la rédaction de ce guide ; le cas échéant, préférez-le, il embarque un template de chat validé.
- 01Mettre Ollama à jourRelancez l'installeur officiel ou votre gestionnaire de paquets, puis vérifiez la version. C'est l'étape que tout le monde saute et qui explique la majorité des échecs de chargement.
- 02Choisir la taille selon la VRAM12 Go ou moins : 7B en Q4_K_M. 4 à 6 Go : 3B. Pas de GPU : 1.5B-Deep. 24 Go ou Mac 48 Go : 34B. Ne tirez pas plusieurs tailles d'un coup, chaque GGUF pèse de 1 à 20 Go.
- 03Tirer le GGUF depuis Hugging FaceUtilisez ollama pull avec le chemin hf.co du dépôt et le tag de quantification. Ollama télécharge le fichier, lit ses métadonnées et génère le template de chat à partir de celles-ci.
- 04Lancer une session et tester en françaisollama run ouvre un chat interactif. Posez une vraie tâche, résumé d'un texte ou extraction de champs, plutôt qu'une devinette. Vérifiez que le modèle répond en français sans glisser vers l'anglais.
- 05Contrôler la répartition GPU/CPUollama ps indique le pourcentage du modèle chargé sur le GPU. Si une partie est en CPU, réduisez la taille ou la quantification, sinon le débit s'effondre.
Le nom complet avec préfixe hf.co est long à taper et peu lisible dans Open WebUI. Créez un alias local avec un Modelfile : vous en profitez pour fixer le contexte et un system prompt en français, et le modèle apparaît sous un nom court dans toutes vos interfaces.
Pour un usage applicatif, Ollama expose son API HTTP sur le même port, avec un endpoint compatible OpenAI. Tout client existant fonctionne en changeant l'URL de base et le nom du modèle.
#L'avantage mémoire sur longs contextes, mesuré
C'est la promesse centrale de Falcon H1 en local, et elle se vérifie en dix minutes. Le protocole est simple : charger le même modèle avec deux tailles de contexte, et comparer la mémoire occupée que rapporte ollama ps. Sur un transformeur classique, passer de 8K à 64K tokens fait grimper la consommation de plusieurs gigaoctets. Sur Falcon H1, la hausse existe, car la part attention conserve un KV cache, mais elle est nettement plus faible.
Deux précisions pour lire les chiffres. D'abord, Ollama réserve le KV cache à l'avance pour tout le contexte demandé : la mémoire affichée reflète donc la capacité réservée, pas ce que votre prompt utilise réellement. Ensuite, si vous avez activé la quantification du KV cache dans la configuration d'Ollama, elle s'applique aussi à la part attention de Falcon H1, ce qui réduit encore l'écart mesuré mais ne change pas la conclusion : à VRAM égale, Falcon H1 accepte un contexte bien plus long qu'un transformeur de même taille.
En pratique, sur une carte 12 Go, Falcon H1 7B en Q4_K_M laisse la place à un contexte de 64K tokens sans déborder sur le CPU, là où Qwen3 8B ou Mistral 7B obligent à quantifier le KV cache ou à se limiter autour de 32K. Le débit de génération, lui, se dégrade beaucoup moins à mesure que le contexte se remplit : la part Mamba traite chaque nouveau token en temps constant.
#Face à Mistral Small et Qwen3 : le verdict
La question que tout le monde se pose : faut-il remplacer son modèle habituel ? La réponse dépend de la taille, parce que Falcon H1 ne joue pas dans la même catégorie selon la variante.
- Falcon H1 7B contre Qwen3 8B
- Qualité globalement comparable, Qwen3 garde un avantage en code et en raisonnement structuré, Falcon H1 est plus naturel en français et surtout bien plus économe dès que le contexte s'allonge. Pour du résumé de documents et du chat francophone sur 12 Go, Falcon H1 prend l'avantage. Pour coder, restez sur Qwen3.
- Falcon H1 7B contre Mistral Small 3.2
- Ce n'est pas la même classe : Mistral Small pèse 24 milliards de paramètres et demande 14 à 15 Go en Q4. Si vous avez la VRAM, Mistral Small reste meilleur sur la plupart des tâches. Falcon H1 7B est le choix quand la carte fait 12 Go ou que le contexte doit dépasser 32K.
- Falcon H1 34B contre Mistral Small 3.2
- Le duel intéressant. Falcon H1 34B est plus fort sur les benchmarks de connaissance et de raisonnement et gère mieux les très longs contextes, mais il coûte 5 Go de plus en Q4 et n'a pas de vision. Mistral Small tient sur une carte 16 Go, lit des images, est sous Apache 2.0 et bénéficie d'un écosystème plus mûr, notamment pour le function calling.
- Falcon H1 34B contre Qwen3 32B
- À VRAM comparable, Qwen3 32B reste la référence pour le code et les agents. Falcon H1 34B est préférable pour de longs documents en français ou en arabe, et sur Mac où la mémoire unifiée absorbe ses 20 Go sans effort.
Le verdict tient en une phrase : Falcon H1 est le meilleur modèle à installer quand votre problème est la mémoire sur longs contextes, ou quand le français et l'arabe sont vos langues de travail. Il n'est pas le meilleur modèle généraliste tout terrain, et il n'a pas la maturité d'écosystème de Mistral ou Qwen. Sur une station de travail avec 24 Go, Mistral Small reste le choix sûr pour un assistant quotidien ; Falcon H1 34B est celui qu'on ajoute à côté pour les gros documents.
#Licence Falcon-LLM : lire avant de déployer
Falcon H1 est publié sous la licence Falcon-LLM de TII. Elle est dérivée d'Apache 2.0 et autorise l'usage commercial, la modification et la redistribution, mais elle y ajoute une politique d'usage acceptable et quelques obligations d'attribution. Ce n'est pas la liberté totale d'Apache 2.0 tel que l'offrent Mistral Small ou Granite, et ce n'est pas non plus une licence restrictive au sens de Llama avec ses seuils d'utilisateurs.
Pour un usage personnel ou interne, la question ne se pose pas. Pour un produit commercial redistribué, prenez dix minutes pour lire le texte sur le site de TII et vérifier que votre cas n'entre pas dans les usages exclus. Le catalogue du site indique la licence pour chaque fiche Falcon, et sa version peut évoluer d'une génération à l'autre.
#Dépannage
- Erreur unknown model architecture falcon-h1
- Votre Ollama, LM Studio ou llama.cpp est trop ancien pour connaître l'architecture hybride. Mettez à jour, redémarrez le daemon et relancez le pull. Aucun autre contournement : les couches Mamba-2 ne se chargent pas sans le support du moteur.
- Le pull hf.co échoue ou ne trouve pas le tag
- Vérifiez l'orthographe exacte du dépôt et de la quantification sur la page Hugging Face, en particulier la casse de Q4_K_M. Si le dépôt ne propose pas le tag demandé, ouvrez l'onglet Files pour lire la liste des fichiers GGUF disponibles.
- Réponses en anglais alors que vous écrivez en français
- Ajoutez un system prompt qui impose la langue, comme dans le Modelfile plus haut. Le tokenizer multilingue de Falcon H1 gère très bien le français, mais l'Instruct sans consigne suit parfois la langue dominante de ses données.
- Débit très faible sur 34B
- ollama ps montre probablement une répartition partielle sur le CPU. En 24 Go, réduisez le contexte à 16K ou passez en Q4_K_S. Sur Mac, augmentez la limite de mémoire GPU allouable si le système en réserve trop.
- Mémoire plus haute qu'attendu en long contexte
- Normal : Ollama réserve le KV cache d'attention pour tout le contexte déclaré, même vide. Comparez toujours à contexte égal avec un autre modèle, et activez la quantification du KV cache si vous voulez gagner encore un peu.
- Template de chat incorrect, balises visibles dans les réponses
- Ollama génère le template depuis les métadonnées du GGUF. Si des balises apparaissent, tirez le GGUF officiel TII plutôt qu'une conversion tierce, ou définissez le TEMPLATE explicitement dans votre Modelfile.
#Pour aller plus loin
Falcon H1 prend tout son sens une fois qu'on maîtrise les notions de contexte et de mémoire qu'il exploite. Ces guides du site complètent celui-ci :
- Comprendre la fenêtre de contexte
- Ce que représentent 8K, 32K ou 256K tokens, ce que ça coûte en VRAM et pourquoi le KV cache est le vrai goulot d'étranglement des transformeurs classiques.
- Quantifier le KV cache pour économiser la VRAM
- L'autre levier pour allonger le contexte, cumulable avec l'architecture hybride de Falcon H1.
- Granite 4 d'IBM en local
- L'autre hybride Mamba du moment, à architecture séquentielle et sous Apache 2.0. Le comparer à Falcon H1 aide à comprendre les choix de TII.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Pour arbitrer entre Q4_K_M et Q8_0 sur chaque taille de Falcon H1 selon votre VRAM.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.