LLM local sur GPU Intel Arc (B580, A770) avec Ollama et IPEX-LLM
Faire tourner un LLM local sur un GPU Intel Arc n'a rien d'évident : l'écosystème est pensé pour CUDA. Mais avec IPEX-LLM et son backend SYCL, la combinaison intel arc + ollama devient réellement utilisable, et le rapport VRAM/euro d'une A770 16 Go ou d'une B580 12 Go est difficile à battre. Ce guide montre comment installer la stack, ce qu'on obtient concrètement en tokens/sec, et où sont les vraies limites.
#Pourquoi Intel Arc pour l'IA locale ?
En 2026, le poste de dépense qui décide de ce que vous pouvez faire tourner, c'est la VRAM. Or c'est précisément là qu'Intel Arc est agressif : l'Arc A770 embarque 16 Go de GDDR6 et se trouve régulièrement d'occasion sous les 300 €, tandis que la nouvelle Arc B580 (architecture Battlemage) propose 12 Go pour un tarif de lancement autour de 250 €. À ce prix, aucune carte NVIDIA neuve n'offre autant de mémoire.
L'intérêt est donc simple : la VRAM dicte la taille de modèle que vous chargez sans déborder sur le CPU. Avec 16 Go, un Mistral 7B ou un Llama 3.1 8B en Q4_K_M tiennent entièrement en mémoire, et un modèle 14B en Q4 reste jouable. Le compromis est logiciel : Intel n'a pas CUDA, il faut passer par sa propre pile oneAPI/SYCL et par la bibliothèque IPEX-LLM.
#B580 vs A770 : laquelle choisir
Les deux cartes ne jouent pas tout à fait le même rôle. La B580 est plus récente, plus efficace énergétiquement et mieux prise en charge par les pilotes actuels, mais elle plafonne à 12 Go. L'A770 est plus ancienne (Alchemist, 2022) et plus gourmande, mais ses 16 Go ouvrent la porte à des modèles plus gros ou à un contexte plus long.
- Arc B580 (Battlemage)
- 12 Go GDDR6, ~250 € neuf. Meilleure efficacité et pilotes plus mûrs. Le bon choix si vous visez surtout des modèles 7B-8B rapides.
- Arc A770 (Alchemist)
- 16 Go GDDR6, souvent <300 € d'occasion. Plus de VRAM pour du 14B et du contexte étendu, au prix d'une conso plus élevée.
- Arc A750 / B570
- 8 Go / 10 Go : dépannage possible pour du 7B en Q4 serré, mais la marge de VRAM est vite atteinte. À réserver aux petits budgets.
#Prérequis matériel et pilotes
Avant d'installer quoi que ce soit, assurez-vous d'avoir une base saine. Le point le plus important est le Resizable BAR (ReBAR) : sur les GPU Arc, il n'est pas optionnel. Sans lui, les performances s'effondrent et certains chargements échouent.
- 01Activer le Resizable BARDans le BIOS/UEFI de la carte mère, activez « Resizable BAR » (et « Above 4G Decoding »). C'est indispensable pour que l'Arc fonctionne correctement.
- 02Mettre à jour les pilotes GPUSous Windows, installez les derniers pilotes Intel Arc (Intel Arc Control). Sous Linux, utilisez un noyau récent (6.2+) avec le pilote i915/xe et le compute runtime Intel (intel-opencl-icd, level-zero).
- 03Vérifier la détectionSous Linux, la commande clinfo ou sycl-ls doit lister votre GPU Arc en tant que périphérique Level Zero. C'est la preuve que la couche oneAPI voit bien la carte.
#Installer IPEX-LLM et le backend SYCL
IPEX-LLM est la bibliothèque d'Intel qui optimise l'inférence LLM sur ses GPU. Elle s'appuie sur oneAPI et le backend SYCL de llama.cpp, et fournit une version d'Ollama pré-compilée pour Arc. C'est cette version « IPEX-LLM » d'Ollama qu'il faut utiliser, pas le binaire Ollama standard qui, lui, ne connaît que CUDA/ROCm/Metal.
La voie la plus simple passe par le paquet Python ipex-llm[cpp], qui installe une commande init-ollama générant les binaires Ollama liés au backend Intel. Créez un environnement dédié pour ne rien casser.
Sous Windows, Intel distribue aussi une archive « Ollama portable » prête à l'emploi : décompressez-la et lancez directement start-ollama.bat, sans installer Python. C'est l'option la plus rapide pour tester.
#Lancer Ollama sur Arc
Une fois les binaires générés, on lance le daemon Ollama comme d'habitude — il écoute sur http://localhost:11434 — mais en positionnant quelques variables d'environnement qui indiquent à SYCL d'utiliser le GPU et de tout offloader dessus.
Dans un second terminal, tirez un modèle et lancez une conversation. Commencez petit pour valider la chaîne avant de charger un 14B.
Au premier prompt, la compilation des noyaux SYCL introduit un léger délai ; grâce à SYCL_CACHE_PERSISTENT, les lancements suivants sont bien plus rapides. Pour confirmer que le GPU travaille, surveillez son occupation avec l'outil Intel dédié.
#Tokens/sec mesurés sur B580 et A770
Les chiffres ci-dessous sont des ordres de grandeur observés sur des modèles courants en Q4_K_M, contexte court, génération pure (hors temps de chargement). Ils varient selon le pilote, la version d'IPEX-LLM et le refroidissement, mais donnent une image réaliste de ce qu'on obtient.
- Llama 3.2 3B (Q4) — B580
- ≈ 45-55 tok/s. Fluide pour du chat et des tâches rapides.
- Mistral 7B (Q4) — B580
- ≈ 25-32 tok/s. Confortable en usage assistant au quotidien.
- Mistral 7B / Llama 3.1 8B (Q4) — A770
- ≈ 20-28 tok/s. Un cran sous la B580 sur ce format, mais très utilisable.
- Qwen 14B (Q4) — A770
- ≈ 11-16 tok/s. Les 16 Go font la différence : le modèle tient sans offload CPU.
- Qwen 14B (Q4) — B580
- ≈ 9-13 tok/s, à la limite des 12 Go selon le contexte ; un contexte long peut forcer un offload et faire chuter le débit.
Le verdict est net : sur les modèles 7B-8B, les deux cartes offrent une expérience temps réel agréable, souvent comparable à une RTX 3060 12 Go. Sur du 14B, l'A770 garde l'avantage grâce à sa VRAM. Pour situer, la RTX 3060 12 Go reste la référence d'entrée de gamme côté NVIDIA — l'Arc se bat dans cette catégorie, pas contre une RTX 4080.
#Les limites face à NVIDIA
Soyons honnêtes : Arc est une option budget maligne, pas un remplaçant sans compromis d'une carte CUDA. Voici les points à connaître avant d'acheter.
- Écosystème logiciel
- Vous dépendez d'IPEX-LLM et du backend SYCL. Certains projets récents (nouveaux runtimes, features llama.cpp) arrivent avec du retard par rapport à CUDA. La version « standard » d'Ollama ne suffit pas.
- Quantifications supportées
- Les formats GGUF classiques passent (Q4_K_M, Q5_K_M, Q8_0, FP16). En revanche certaines quantifications exotiques ou très récentes peuvent ne pas être optimisées, voire tomber en calcul CPU.
- Fine-tuning et frameworks avancés
- L'entraînement/LoRA est possible via IPEX-LLM mais bien moins documenté et outillé que sur NVIDIA. Pour du fine-tuning sérieux, CUDA reste la voie royale.
- Maturité des pilotes
- La situation s'améliore vite, mais un pilote ou une version d'IPEX-LLM peut introduire une régression. Épinglez une version qui marche avant de mettre à jour à l'aveugle.
#Dépannage courant
- Le modèle tourne sur le CPU au lieu du GPU
- Vérifiez ONEAPI_DEVICE_SELECTOR=level_zero:0 et OLLAMA_NUM_GPU=999, et que sycl-ls liste bien la carte. Un ReBAR désactivé peut aussi forcer le repli CPU.
- Débit très faible malgré le GPU actif
- Presque toujours le Resizable BAR non activé dans le BIOS. C'est le premier réflexe à avoir.
- Erreur « out of memory » à VRAM apparemment suffisante
- Le contexte (num_ctx) gonfle la mémoire. Réduisez la fenêtre de contexte, ou passez à une quantification plus légère (Q4 au lieu de Q5/Q8).
- Premier prompt très lent puis normal
- Compilation des noyaux SYCL. Assurez-vous que SYCL_CACHE_PERSISTENT=1 est bien exporté pour ne pas repayer ce coût à chaque lancement.
- Le GPU n'apparaît pas dans sycl-ls
- Compute runtime manquant : installez intel-opencl-icd et level-zero (Linux), ou réinstallez les pilotes Arc (Windows).
#Pour aller plus loin
Une fois Ollama opérationnel sur votre Arc, la suite est la même que sur n'importe quelle machine. Ces guides du site prolongent celui-ci :
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Décisif sur Arc où la VRAM est comptée : comprendre le compromis qualité/mémoire pour tirer le maximum de vos 12 ou 16 Go.
- Choisir son GPU pour l'IA locale
- Remettre Arc en perspective face aux RTX et aux Mac, pour valider que c'est bien le bon achat selon votre usage.
- Installer Ollama : Windows, macOS et Linux
- Le guide d'installation de base et l'usage de l'API sur le port 11434, utile pour brancher Open WebUI derrière votre Arc.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.