Meilleur LLM pour le service client retail et e-commerce

Mettre en place une IA commerce local pour le service client, c'est faire tourner un LLM sur vos propres machines pour répondre aux clients d'une boutique en ligne sans envoyer catalogue, commandes ni adresses postales vers un service tiers. Le bon modèle pour cette IA commerce local n'est pas le plus gros ni le mieux classé sur un benchmark généraliste : c'est celui qui lit correctement une fiche produit, cite le bon statut de commande, applique la politique de retour à la lettre et passe la main à un humain quand il ne sait pas. Cet article détaille les quatre tâches à couvrir, propose une sélection par palier matériel dans le catalogue quelllm.fr, décrit un protocole d'évaluation de l'ancrage aux données, puis passe en revue licences et déploiement avant une FAQ.

Les quatre tâches d'un LLM de service client e-commerce

Le périmètre est volontairement étroit. Le support multilingue est traité dans le guide dédié au support client multilingue en local et le support informatique interne n'est pas couvert ici. Restent quatre fonctions qui définissent le cahier des charges :

La capacité qui départage les modèles est donc l'ancrage : répondre depuis les données fournies et refuser proprement quand l'information manque. L'architecture recommandée (recherche documentaire, appels d'outils, règles de refus) est décrite dans le guide d'architecture d'agent local.

Sélection pour Mac 128 Go et station bi-GPU (Q4 entre 68 et 75 Go)

Ce palier correspond à un Mac Studio 128 Go de mémoire unifiée ou à une station avec une carte professionnelle 96 Go. Les modèles ci-dessous sont des architectures à experts (MoE) : peu de paramètres actifs par token, donc un débit compatible avec un chat en temps réel malgré la taille des poids. Toutes les valeurs de débit sont des estimations dérivées du nombre de paramètres actifs et de la bande passante mémoire, à confirmer sur votre machine.

Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) - Paramètres : 122B au total, environ 10B actifs par token - VRAM Q4 : ~73 Go ; Q5 ~88 Go (estimé) ; Q8 ~130 Go (estimé) ; FP16 ~245 Go (estimé) - Contexte : 262 000 tokens, largement suffisant pour une politique de retour complète, un historique de conversation et une dizaine de fiches produit - Débit : 30 à 45 tokens/s estimés sur Mac Studio M4 Max 128 Go en Q4 ; 80 tokens/s et plus estimés sur une carte 96 Go sous vLLM - Pourquoi pour l'e-commerce : la famille Qwen suit bien les consignes de format et les appels d'outils, ce qui compte pour les statuts de commande. Poids publiés par Alibaba sur Hugging Face.

Mistral Small 4 (Mistral, Apache 2.0) - Paramètres : 119B - VRAM Q4 : ~72 Go ; Q8 ~127 Go (estimé) ; FP16 ~240 Go (estimé) - Contexte : 256 000 tokens - Débit : à confirmer selon le nombre de paramètres actifs de l'architecture ; comptez un ordre de grandeur comparable au précédent si le modèle est MoE - Pourquoi pour l'e-commerce : qualité du français en rédaction client, licence Apache 2.0 sans clause commerciale. Poids publiés par Mistral sur Hugging Face.

Qwen3.8 Flash Next 125B-A6B (Qwen, licence open weights, termes à vérifier avant usage commercial) - Paramètres : 125B au total, environ 6B actifs - VRAM Q4 : ~72 Go ; Q8 ~133 Go (estimé) - Contexte : 256 000 tokens - Débit : le plus rapide du palier, 50 à 70 tokens/s estimés sur Mac Studio 128 Go - Pourquoi pour l'e-commerce : latence courte pour un chat à fort trafic. Contrepartie : moins de paramètres actifs, donc à tester avec attention sur les questions ambiguës.

Mistral Medium 3.5 128B (Mistral, Modified MIT) - VRAM Q4 : ~74 Go ; Q8 ~136 Go (estimé) - Contexte : 256 000 tokens - Pourquoi pour l'e-commerce : alternative à Mistral Small 4 quand vous voulez un cran de raisonnement supplémentaire sur les cas de litige, au prix d'un débit plus faible (à confirmer).

Pour choisir la machine, la page dédiée aux Mac 128 Go liste les modèles qui tiennent réellement avec du contexte.

Palier serveur : 140 Go et plus

Si vous disposez d'un serveur avec plusieurs cartes ou d'une machine 192 Go et au-delà, trois modèles offrent une marge de qualité sur les cas complexes (réclamations en plusieurs étapes, commandes partiellement expédiées).

Les modèles au-delà de 400 Go du catalogue (DeepSeek V4 Pro, Kimi K3, GLM 5.2) sont hors de portée d'un déploiement de boutique et n'apportent pas de gain mesurable sur des tâches aussi cadrées.

Évaluer l'ancrage et le refus : le protocole qui compte

Les benchmarks publics (MMLU, HumanEval, AIME) mesurent la culture générale, le code ou les maths. Aucun ne mesure « le modèle a-t-il inventé un délai de retour ». Le Open LLM Leaderboard sert à écarter un modèle faible, pas à en choisir un pour ce cas d'usage. Construisez votre propre jeu de test, une demi-journée suffit :

Pour la couche de recherche documentaire, le guide Firecrawl et RAG local montre comment constituer l'index catalogue ; le guide GraphRAG traite le cas des catalogues avec beaucoup de relations entre produits.

Licences et données clients

Un service client traite des données personnelles : nom, adresse, historique d'achat. Le déploiement local supprime le transfert vers un sous-traitant, mais deux points restent à cadrer.

Déploiement : moteur, interface, latence cible

Le guide de déploiement d'un chatbot d'équipe en intranet couvre la mise en service pas à pas.

FAQ

Q : Quel modèle choisir pour démarrer avec un Mac Studio 128 Go ?

Qwen 3.5 122B-A10B en Q4 (~73 Go) est le point de départ le plus équilibré : licence Apache 2.0, bons appels d'outils, débit estimé de 30 à 45 tokens/s. Si la latence prime sur la finesse, Qwen3.8 Flash Next 125B-A6B est plus rapide mais à tester davantage sur les questions ambiguës. Lancez le protocole de 50 questions sur les deux avant de trancher.

Q : Un modèle plus petit qu'un 100B suffirait-il pour ce cas d'usage ?

Souvent oui pour la recherche catalogue et les statuts de commande, où le modèle reformule surtout des données fournies. Le gain des modèles de ce palier se voit sur les cas ambigus et les refus. Le catalogue filtre par VRAM pour comparer avec des modèles plus légers ; le protocole d'évaluation reste le même.

Q : Comment empêcher le modèle d'inventer un délai de livraison ?

Trois couches : le statut vient toujours d'un appel d'outil, jamais de la mémoire du modèle ; le prompt système impose « aucune date sans résultat d'outil » ; une règle applicative bloque toute réponse contenant une date si aucun appel n'a eu lieu. Mesurez ensuite le taux d'invention sur vos 20 questions sans réponse : il doit rester sous 2 %.

Q : Faut-il un contexte de 1 000 000 tokens pour charger tout le catalogue ?

Rarement. Charger un catalogue entier à chaque message multiplie la latence de préremplissage et le coût mémoire du cache. Une recherche qui ramène 5 à 10 fiches pertinentes dans un contexte de 8 000 à 16 000 tokens donne de meilleurs résultats et une réponse plus rapide. Le très long contexte de DeepSeek V4 Flash sert plutôt aux analyses ponctuelles.

Q : Quelle différence avec le guide sur le support multilingue ?

Ce comparatif se limite aux tâches transactionnelles en français : catalogue, commandes, retours, escalade. Le guide support client multilingue traite la détection de langue, la traduction et les jeux de test par langue. Les deux se combinent : choisissez le modèle ici, ajoutez la couche multilingue ensuite si votre boutique livre hors francophonie.

Q : Comment mesurer le débit réel sur ma machine ?

Chargez le modèle en Q4 avec llama.cpp ou vLLM, envoyez dix fois la même conversation type de 8 000 tokens de contexte et relevez tokens/s en génération et temps au premier token. Les chiffres de cet article sont des estimations ; les vôtres dépendent de la bande passante mémoire, de la quantification et du nombre de sessions simultanées. La page benchmark local décrit une méthode reproductible.

Conclusion

Une IA commerce local pour le service client se juge sur l'ancrage et le refus, pas sur un score MMLU. Sur Mac 128 Go ou station 96 Go, Qwen 3.5 122B-A10B et Mistral Small 4 couvrent catalogue, commandes, retours et escalade avec une licence Apache 2.0. Au-delà de 140 Go, Qwen 3 235B-A22B et MiniMax-M2.7 ajoutent de la marge sur les cas complexes. Vérifiez la compatibilité avec votre matériel dans le configurateur, puis validez le modèle retenu avec vos propres 50 questions.

Le matériel pour faire tourner un LLM en local

Pour exécuter ces modèles confortablement en local, un RTX 5070 Ti offre un excellent rapport prix/performance. Comparez les prix :

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.

Article publié et mis à jour le par Mohamed Meguedmi · Source de données : /api/models.json · Licence contenu : CC BY 4.0.

Une erreur ou une mise à jour à signaler ? Contribuer.