Quel LLM faire tourner sur une carte AMD Radeon 6700XT ?
La recherche « 6700xt llm » revient souvent chez ceux qui ont une carte de la génération RDNA 2 et veulent un modèle local sans racheter de GPU. Bonne nouvelle pour le duo 6700xt llm : les 12 Go de GDDR6 de cette carte suffisent pour des modèles de 7 à 14 milliards de paramètres en quantification 4 bits, avec un débit confortable pour le chat, le code et le résumé de documents. La contrainte principale n'est pas la puissance de calcul mais la mémoire vidéo, et le second obstacle est logiciel : la RX 6700 XT n'est pas officiellement prise en charge par ROCm, ce qui impose un réglage ou le backend Vulkan. Cet article détaille les specs utiles, la VRAM par quantification, les débits réalistes, les licences, puis répond aux questions fréquentes avant de vous orienter vers le configurateur.
La RX 6700 XT face à l'inférence locale
Sur le papier, la Radeon RX 6700 XT est une carte de jeu de 2021. Pour un LLM, trois chiffres comptent réellement.
- VRAM : 12 Go de GDDR6, bus 192 bits.
- Bande passante mémoire : 384 Go/s. C'est ce chiffre qui plafonne le débit en tokens/sec, car chaque token généré relit l'intégralité des poids actifs.
- Architecture : RDNA 2, identifiant
gfx1031, 40 unités de calcul, sans cœurs matriciels dédiés.
À titre de comparaison, une carte 16 Go comme celle décrite dans le guide LLM Radeon RX 6800 XT ouvre les modèles 24B en Q4, et une 24 Go comme la RX 7900 XTX atteint les 32B. La 6700 XT reste dans la classe 12 Go, la même que la RTX 3060 12 Go côté NVIDIA. Le guide dédié à la RX 6700 XT et la sélection meilleur LLM pour Radeon RX 6700 XT listent les modèles du catalogue qui tiennent dans cette enveloppe.
VRAM consommée par quantification : Q4, Q5, Q8, FP16
La règle de calcul est simple : nombre de paramètres × octets par paramètre, plus le cache KV qui grandit avec la longueur de contexte. Les ordres de grandeur ci-dessous supposent un contexte de 8 192 tokens et un cache KV en 8 bits ; ils sont estimés à partir des fichiers GGUF courants.
- Modèle 7 à 8B : Q4 ≈ 5 Go, Q5 ≈ 6 Go, Q8 ≈ 9 Go, FP16 ≈ 16 Go. Tout passe sur 12 Go jusqu'au Q8 inclus, FP16 exclu.
- Modèle 12 à 14B : Q4 ≈ 8 à 9 Go, Q5 ≈ 10 Go, Q8 ≈ 15 Go. Q4 et Q5 tiennent, Q8 déborde sur la RAM système.
- Modèle 24 à 27B : Q4 ≈ 15 à 17 Go. Ne tient pas entièrement ; un Q3 à 12 Go est possible mais dégrade la qualité.
- Modèle MoE 30B avec 3B actifs : Q4 ≈ 18 Go de poids, mais seuls les experts actifs sont lus à chaque token. Avec les experts déportés sur le CPU, le débit reste utilisable.
Le point de bascule est net : au-delà de 12 Go, llama.cpp et Ollama déchargent les couches restantes sur le processeur, et le débit chute d'un facteur 5 à 10. Le guide « quel LLM pour 12 Go de VRAM » détaille les combinaisons taille × quantification × contexte qui restent 100 % sur GPU.
Ce que le haut du catalogue ne fera pas tourner
Une partie du catalogue quelllm.fr est hors de portée d'une 6700 XT, et il vaut mieux le dire clairement plutôt que de laisser espérer un miracle logiciel.
- DeepSeek R1 671B : ~400 Go en Q4, licence MIT. Impossible en local sur PC grand public, quelle que soit la carte.
- Qwen 3 235B-A22B : ~142 Go en Q4, Apache 2.0. Hors de portée même avec 128 Go de RAM.
- DeepSeek V4 Flash 284B : ~170 Go en Q4, MIT. Réservé aux serveurs multi-GPU ou aux Mac à mémoire unifiée haut de gamme.
- GLM 5.3 Flash 320B-A18B : ~186 Go en Q4, MIT. Même verdict.
Le cas limite intéressant est celui des MoE d'environ 120B avec peu de paramètres actifs. Qwen 3.5 122B-A10B pèse ~73 Go en Q4 sous licence Apache 2.0, Qwen3.8 Flash Next 125B-A6B ~72 Go avec seulement 6B actifs, et Mistral Small 4 ~72 Go en Apache 2.0. Avec 64 Go de RAM système et les 12 Go de la carte, llama.cpp peut charger ces modèles en déportant les experts sur le CPU. Le débit obtenu se compte alors en quelques tokens par seconde, estimé entre 3 et 8 selon la RAM et le CPU, à confirmer sur votre configuration. C'est utilisable pour du traitement par lots la nuit, pas pour un chat interactif. Les poids sont publiés sur la page Alibaba sur Hugging Face et la page Mistral sur Hugging Face.
Tokens/sec réels et choix du logiciel
Sur RDNA 2, le débit dépend autant du backend que du modèle. Deux voies fonctionnent.
- Ollama avec ROCm : la 6700 XT n'est pas dans la liste officielle, mais la variable
HSA_OVERRIDE_GFX_VERSION=10.3.0la fait accepter comme une carte de la même famille. La procédure complète est dans le guide Ollama GPU AMD ROCm ; le dépôt Ollama sur GitHub documente les variables d'environnement. - llama.cpp avec Vulkan : aucun pilote spécifique, fonctionne sous Windows comme sous Linux. Le backend est maintenu dans le dépôt llama.cpp. La génération est proche de ROCm, le traitement du prompt est un peu plus lent.
- vLLM : pas une option réaliste sur RDNA 2 ; la documentation vLLM cible les cartes datacenter et les RDNA 3 récentes.
Ordres de grandeur mesurés par la communauté sur 6700 XT, à confirmer sur votre machine :
- 8B en Q4_K_M : 35 à 45 tokens/sec en génération.
- 14B en Q4_K_M : 18 à 25 tokens/sec.
- MoE 30B-A3B avec experts sur CPU : 12 à 20 tokens/sec, estimé.
- 24B en Q4 partiellement déchargé : 4 à 8 tokens/sec, estimé.
Pour une interface de chat au-dessus d'Ollama, Open WebUI se déploie en un conteneur et gère l'historique, les documents et plusieurs modèles.
Licences et cas d'usage concrets
La licence détermine ce que vous pouvez faire des sorties et si le modèle peut servir dans un produit. Le catalogue affiche la licence de chaque fiche ; les grandes familles présentes sur les tailles compatibles 12 Go sont Apache 2.0, MIT, Llama Community et quelques licences maison. Le filtre par licence du catalogue permet d'exclure d'emblée les licences à clause de restriction commerciale.
Ce qu'une 6700 XT fait bien au quotidien :
- Assistant de code : un modèle 7 à 14B en Q4 répond assez vite pour la complétion et la relecture dans un éditeur. Les scores HumanEval et LiveCodeBench des fiches aident à départager les candidats.
- Résumé et RAG sur documents privés : le contexte 8k à 16k tient en VRAM avec un 8B en Q5 ; au-delà, réduire la quantification du cache KV.
- Chat en français : privilégier les modèles dont la fiche indique un score MMLU multilingue ou une évaluation en français, plutôt que le score MMLU anglais seul.
- Traitement par lots hors ligne : classification, extraction de champs, reformulation, où le débit importe moins que la confidentialité.
Pour comparer des scores entre modèles, le Open LLM Leaderboard reste la référence publique, avec la réserve habituelle : un benchmark mesure une tâche précise, pas votre usage.
Faut-il changer de carte ?
Si vous butez sur la limite des 12 Go, trois paliers existent côté AMD.
- 16 Go : RX 6800 XT d'occasion, RX 7800 XT, ou RX 9060 XT neuve. Le benchmark de la 9060 XT 16 Go montre ce qu'apportent 4 Go de plus et RDNA 4 sur les modèles 24B.
- 20 Go : RX 7900 XT, qui fait tenir un 27B en Q5.
- 24 Go : RX 7900 XTX, la seule carte AMD grand public qui charge un 32B en Q4 avec un contexte utile.
Le comparateur met deux fiches côte à côte pour voir ce que la VRAM supplémentaire débloque réellement sur un modèle donné.
FAQ
Q : La RX 6700 XT est-elle compatible ROCm ?
Pas officiellement. AMD ne liste pas le gfx1031 parmi les cibles ROCm supportées. En pratique, Ollama et llama.cpp compilés pour ROCm fonctionnent en forçant HSA_OVERRIDE_GFX_VERSION=10.3.0, qui présente la carte comme un gfx1030. Si ce réglage pose problème, le backend Vulkan de llama.cpp offre un débit comparable sans dépendre de ROCm.
Q : Quelle taille de modèle maximale sur 12 Go ?
Un 14B en Q4 ou Q5 reste entièrement en VRAM avec 8k de contexte. Un 24B ou 27B nécessite un Q3 agressif ou un déchargement partiel sur CPU, avec une chute nette du débit. Les MoE de 30B avec 3B actifs sont le meilleur compromis au-delà de 14B, à condition de déporter les experts sur le processeur.
Q : Peut-on faire tourner DeepSeek R1 671B ou Qwen 3 235B sur une 6700 XT ?
Non. DeepSeek R1 671B demande ~400 Go en Q4, Qwen 3 235B-A22B ~142 Go. Aucune combinaison RAM + 12 Go de VRAM sur PC de bureau n'y suffit. Les MoE d'environ 120B avec 6 à 10B actifs sont la limite absolue, avec 64 Go de RAM et un débit de quelques tokens par seconde.
Q : Windows ou Linux pour un LLM sur 6700 XT ?
Les deux fonctionnent. Sous Windows, le backend Vulkan de llama.cpp et les builds Ollama récents évitent d'installer ROCm. Sous Linux, ROCm avec la variable d'override donne un traitement du prompt un peu plus rapide. La différence de débit en génération reste de l'ordre de 10 %, estimé, et ne justifie pas un changement de système à elle seule.
Q : Combien de RAM système prévoir en complément ?
32 Go suffisent pour les modèles qui tiennent en VRAM et pour un MoE 30B-A3B avec experts sur CPU. Passer à 64 Go n'a d'intérêt que pour tenter les MoE d'environ 120B en déchargement complet, comme Qwen3.8 Flash Next 125B-A6B, au prix d'un débit réduit.
Q : Le contexte long est-il possible sur 12 Go ?
Oui, avec des compromis. Le cache KV d'un 8B occupe environ 1 Go par tranche de 8k tokens en 16 bits ; en le quantifiant en 8 bits, un 8B en Q4 atteint 32k de contexte dans les 12 Go. Un 14B se limite à 16k dans les mêmes conditions. Les fiches du catalogue indiquent le contexte maximal supporté par chaque modèle.
Conclusion
Pour la requête 6700xt llm, la réponse tient en une phrase : un modèle de 7 à 14 milliards de paramètres en Q4 ou Q5, chargé via Ollama avec l'override ROCm ou via llama.cpp en Vulkan, tourne entièrement en VRAM à un débit confortable. Les MoE à experts déchargés étendent la portée, le haut du catalogue reste hors d'atteinte. Pour obtenir la liste exacte des modèles compatibles avec vos 12 Go, votre RAM et votre licence cible, passez par le configurateur quelllm.fr.
Le matériel pour faire tourner un LLM en local
Pour exécuter ces modèles confortablement en local, un RTX 5070 Ti offre un excellent rapport prix/performance. Comparez les prix :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.