Quel LLM faire tourner sur une carte AMD Radeon 6700XT ?

La recherche « 6700xt llm » revient souvent chez ceux qui ont une carte de la génération RDNA 2 et veulent un modèle local sans racheter de GPU. Bonne nouvelle pour le duo 6700xt llm : les 12 Go de GDDR6 de cette carte suffisent pour des modèles de 7 à 14 milliards de paramètres en quantification 4 bits, avec un débit confortable pour le chat, le code et le résumé de documents. La contrainte principale n'est pas la puissance de calcul mais la mémoire vidéo, et le second obstacle est logiciel : la RX 6700 XT n'est pas officiellement prise en charge par ROCm, ce qui impose un réglage ou le backend Vulkan. Cet article détaille les specs utiles, la VRAM par quantification, les débits réalistes, les licences, puis répond aux questions fréquentes avant de vous orienter vers le configurateur.

La RX 6700 XT face à l'inférence locale

Sur le papier, la Radeon RX 6700 XT est une carte de jeu de 2021. Pour un LLM, trois chiffres comptent réellement.

À titre de comparaison, une carte 16 Go comme celle décrite dans le guide LLM Radeon RX 6800 XT ouvre les modèles 24B en Q4, et une 24 Go comme la RX 7900 XTX atteint les 32B. La 6700 XT reste dans la classe 12 Go, la même que la RTX 3060 12 Go côté NVIDIA. Le guide dédié à la RX 6700 XT et la sélection meilleur LLM pour Radeon RX 6700 XT listent les modèles du catalogue qui tiennent dans cette enveloppe.

VRAM consommée par quantification : Q4, Q5, Q8, FP16

La règle de calcul est simple : nombre de paramètres × octets par paramètre, plus le cache KV qui grandit avec la longueur de contexte. Les ordres de grandeur ci-dessous supposent un contexte de 8 192 tokens et un cache KV en 8 bits ; ils sont estimés à partir des fichiers GGUF courants.

Le point de bascule est net : au-delà de 12 Go, llama.cpp et Ollama déchargent les couches restantes sur le processeur, et le débit chute d'un facteur 5 à 10. Le guide « quel LLM pour 12 Go de VRAM » détaille les combinaisons taille × quantification × contexte qui restent 100 % sur GPU.

Ce que le haut du catalogue ne fera pas tourner

Une partie du catalogue quelllm.fr est hors de portée d'une 6700 XT, et il vaut mieux le dire clairement plutôt que de laisser espérer un miracle logiciel.

Le cas limite intéressant est celui des MoE d'environ 120B avec peu de paramètres actifs. Qwen 3.5 122B-A10B pèse ~73 Go en Q4 sous licence Apache 2.0, Qwen3.8 Flash Next 125B-A6B ~72 Go avec seulement 6B actifs, et Mistral Small 4 ~72 Go en Apache 2.0. Avec 64 Go de RAM système et les 12 Go de la carte, llama.cpp peut charger ces modèles en déportant les experts sur le CPU. Le débit obtenu se compte alors en quelques tokens par seconde, estimé entre 3 et 8 selon la RAM et le CPU, à confirmer sur votre configuration. C'est utilisable pour du traitement par lots la nuit, pas pour un chat interactif. Les poids sont publiés sur la page Alibaba sur Hugging Face et la page Mistral sur Hugging Face.

Tokens/sec réels et choix du logiciel

Sur RDNA 2, le débit dépend autant du backend que du modèle. Deux voies fonctionnent.

Ordres de grandeur mesurés par la communauté sur 6700 XT, à confirmer sur votre machine :

Pour une interface de chat au-dessus d'Ollama, Open WebUI se déploie en un conteneur et gère l'historique, les documents et plusieurs modèles.

Licences et cas d'usage concrets

La licence détermine ce que vous pouvez faire des sorties et si le modèle peut servir dans un produit. Le catalogue affiche la licence de chaque fiche ; les grandes familles présentes sur les tailles compatibles 12 Go sont Apache 2.0, MIT, Llama Community et quelques licences maison. Le filtre par licence du catalogue permet d'exclure d'emblée les licences à clause de restriction commerciale.

Ce qu'une 6700 XT fait bien au quotidien :

Pour comparer des scores entre modèles, le Open LLM Leaderboard reste la référence publique, avec la réserve habituelle : un benchmark mesure une tâche précise, pas votre usage.

Faut-il changer de carte ?

Si vous butez sur la limite des 12 Go, trois paliers existent côté AMD.

Le comparateur met deux fiches côte à côte pour voir ce que la VRAM supplémentaire débloque réellement sur un modèle donné.

FAQ

Q : La RX 6700 XT est-elle compatible ROCm ?

Pas officiellement. AMD ne liste pas le gfx1031 parmi les cibles ROCm supportées. En pratique, Ollama et llama.cpp compilés pour ROCm fonctionnent en forçant HSA_OVERRIDE_GFX_VERSION=10.3.0, qui présente la carte comme un gfx1030. Si ce réglage pose problème, le backend Vulkan de llama.cpp offre un débit comparable sans dépendre de ROCm.

Q : Quelle taille de modèle maximale sur 12 Go ?

Un 14B en Q4 ou Q5 reste entièrement en VRAM avec 8k de contexte. Un 24B ou 27B nécessite un Q3 agressif ou un déchargement partiel sur CPU, avec une chute nette du débit. Les MoE de 30B avec 3B actifs sont le meilleur compromis au-delà de 14B, à condition de déporter les experts sur le processeur.

Q : Peut-on faire tourner DeepSeek R1 671B ou Qwen 3 235B sur une 6700 XT ?

Non. DeepSeek R1 671B demande ~400 Go en Q4, Qwen 3 235B-A22B ~142 Go. Aucune combinaison RAM + 12 Go de VRAM sur PC de bureau n'y suffit. Les MoE d'environ 120B avec 6 à 10B actifs sont la limite absolue, avec 64 Go de RAM et un débit de quelques tokens par seconde.

Q : Windows ou Linux pour un LLM sur 6700 XT ?

Les deux fonctionnent. Sous Windows, le backend Vulkan de llama.cpp et les builds Ollama récents évitent d'installer ROCm. Sous Linux, ROCm avec la variable d'override donne un traitement du prompt un peu plus rapide. La différence de débit en génération reste de l'ordre de 10 %, estimé, et ne justifie pas un changement de système à elle seule.

Q : Combien de RAM système prévoir en complément ?

32 Go suffisent pour les modèles qui tiennent en VRAM et pour un MoE 30B-A3B avec experts sur CPU. Passer à 64 Go n'a d'intérêt que pour tenter les MoE d'environ 120B en déchargement complet, comme Qwen3.8 Flash Next 125B-A6B, au prix d'un débit réduit.

Q : Le contexte long est-il possible sur 12 Go ?

Oui, avec des compromis. Le cache KV d'un 8B occupe environ 1 Go par tranche de 8k tokens en 16 bits ; en le quantifiant en 8 bits, un 8B en Q4 atteint 32k de contexte dans les 12 Go. Un 14B se limite à 16k dans les mêmes conditions. Les fiches du catalogue indiquent le contexte maximal supporté par chaque modèle.

Conclusion

Pour la requête 6700xt llm, la réponse tient en une phrase : un modèle de 7 à 14 milliards de paramètres en Q4 ou Q5, chargé via Ollama avec l'override ROCm ou via llama.cpp en Vulkan, tourne entièrement en VRAM à un débit confortable. Les MoE à experts déchargés étendent la portée, le haut du catalogue reste hors d'atteinte. Pour obtenir la liste exacte des modèles compatibles avec vos 12 Go, votre RAM et votre licence cible, passez par le configurateur quelllm.fr.

Le matériel pour faire tourner un LLM en local

Pour exécuter ces modèles confortablement en local, un RTX 5070 Ti offre un excellent rapport prix/performance. Comparez les prix :

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.

Article publié et mis à jour le par Mohamed Meguedmi · Source de données : /api/models.json · Licence contenu : CC BY 4.0.

Une erreur ou une mise à jour à signaler ? Contribuer.