LLM-as-a-judge : faire noter un modèle par un modèle
LLM-as-a-judge consiste à faire noter les réponses d'un système par un autre modèle. L'étude fondatrice (Zheng et al., MT-Bench et Chatbot Arena, 2023) montre qu'un juge fort comme GPT-4 atteint plus de 80 % d'accord avec des préférences humaines, comme entre deux humains — avec des biais documentés : position, verbosité, auto-préférence, raisonnement limité. En local, un juge de 13 à 14 milliards de paramètres, avec comparaison par paires, donne des résultats exploitables.
Faire noter les réponses d'un modèle par un autre modèle est devenu la méthode d'évaluation la plus répandue, pour une raison simple : c'est la seule qui passe à l'échelle. Elle est aussi biaisée, manipulable et trompeuse si on la lit comme une note absolue. L'étude qui a posé le cadre de référence, publiée par l'équipe de LMSYS (Chatbot Arena) et présentée à NeurIPS 2023, le dit elle-même : bien utilisée, elle compare deux versions d'un système ; mal utilisée, elle donne un chiffre rassurant qui ne mesure rien.
#Le principe, et son intérêt
On donne à un modèle une question, la réponse produite par le système à évaluer, éventuellement les passages qui ont servi à répondre et une réponse de référence, puis une grille de notation. Il rend une note et une justification. Répété sur cent cas, cela donne un indicateur que l'on peut suivre dans le temps, à chaque changement de prompt, de modèle ou de paramètre de recherche.
L'alternative est l'évaluation humaine, qui reste la référence et ne passe pas à l'échelle : personne ne relira cent réponses à chaque changement de prompt. Le juge automatique permet de répondre à « cette modification a-t-elle amélioré ou dégradé le système » en dix minutes, ce qui change la façon de travailler. L'article fondateur de Zheng et al. a précisément été motivé par ce constat : les benchmarks existants (MMLU et consorts) ne mesurent pas ce qui compte dans une conversation ouverte, et l'évaluation humaine à grande échelle est trop coûteuse pour itérer vite sur un système qui évolue chaque semaine.
#Écrire une grille qui tient
Tes documents, ton IA : un RAG local fiable sur tes PDF, notes et mails — sans rien envoyer dans le cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
- 01Un critère à la foisDemander une note globale ne veut rien dire. On note séparément la fidélité aux sources, la pertinence et la complétude.
- 02Une échelle courte et décriteTrois ou quatre niveaux, avec ce que signifie chacun. Une échelle sur dix produit des notes sans reproductibilité.
- 03Exiger la justification avant la noteUn juge à qui l'on demande de raisonner puis de conclure est nettement plus stable que celui qui lâche un chiffre. C'est la même logique que la « limited reasoning ability » relevée par Zheng et al. : forcer le raisonnement explicite réduit cette limite.
- 04Préférer la comparaison par paires« Laquelle de ces deux réponses est la meilleure » est une question à laquelle un modèle répond bien mieux qu'à « note celle-ci sur cinq » — c'est le format que Chatbot Arena utilise pour comparer les modèles entre eux.
#Les biais, et comment les contenir
L'article de référence sur le sujet nomme précisément trois biais et une limite : le biais de position, le biais de verbosité, le biais d'auto-préférence (self-enhancement), et une capacité de raisonnement limitée. Ce n'est pas une hypothèse de blog, c'est le résultat central de l'étude qui a introduit MT-Bench et Chatbot Arena, deux références encore utilisées aujourd'hui pour classer des modèles.
| Biais | Effet | Contre-mesure |
|---|---|---|
| Position | La réponse présentée en premier est favorisée | Alterner l'ordre et moyenner les deux passages |
| Verbosité | Une réponse plus longue est jugée meilleure, à qualité égale | Le préciser dans la grille, contrôler la longueur des deux côtés |
| Auto-préférence | Un juge favorise les réponses de sa propre famille de modèles | Ne pas juger un modèle avec lui-même ou un proche cousin |
| Raisonnement limité | Le juge se trompe sur des tâches qui demandent un calcul ou une déduction | Exiger une justification écrite avant la note, jamais une note seule |
| Complaisance | Tout est bien noté, les notes s'écrasent en haut de l'échelle | Une grille exigeante et des exemples de mauvaises réponses dans le prompt |
La bonne nouvelle, documentée par la même étude : un juge fort comme GPT-4 atteint plus de 80 % d'accord avec des préférences humaines sur MT-Bench et Chatbot Arena — le même niveau d'accord que celui mesuré entre deux évaluateurs humains entre eux. La règle d'usage qui résume tout ce chapitre : un juge sert à comparer, jamais à certifier une qualité dans l'absolu. Une note de 4,2 sur 5 ne dit rien ; un passage de 3,1 à 3,8 sur le même jeu de test avec le même juge dit quelque chose de réel.
Le biais de verbosité n'est pas une inquiétude théorique : le benchmark AlpacaEval, très utilisé pour comparer des modèles ajustés par instruction, est explicitement connu pour favoriser les modèles qui génèrent des réponses plus longues, à qualité égale. Sa version corrigée de la longueur (« length-controlled ») fait passer la corrélation avec les classements de Chatbot Arena de 0,94 à 0,98 — la preuve chiffrée que neutraliser ce seul biais rapproche mécaniquement le jugement automatique du jugement humain, plutôt que de l'en éloigner.
#Un juge local, est-ce sérieux ?
Oui, sous deux conditions. La première est la taille : en dessous de 14 milliards de paramètres environ, les jugements deviennent instables et le format de sortie casse, ce qui rend la campagne inexploitable — c'est cohérent avec le repère mémoire du site (14B ≈ 9 Go en Q4). La seconde est le contexte : le juge doit contenir la question, les passages et la réponse en une seule fois — un contexte saturé fait noter un texte tronqué, et personne ne s'en aperçoit, puisque le modèle continue de répondre normalement sur ce qu'il a effectivement reçu.
L'intérêt du juge local est évident quand les données évaluées sont confidentielles : envoyer chaque réponse et chaque passage à une API externe pour les noter annule l'intérêt d'avoir gardé le système en local, en particulier sur un cas médical, juridique ou financier où les passages source contiennent eux-mêmes des données sensibles. Et contrairement à la production, une campagne d'évaluation tolère très bien la lenteur : on la lance la nuit, sur un GPU qui sert à autre chose en journée, et on récupère les résultats au matin.
#Les outils pour ne pas réinventer le pipeline
Il n'est pas nécessaire d'écrire son propre harnais de juge depuis zéro. Prometheus, un projet de recherche open source, entraîne spécifiquement un modèle de 13 milliards de paramètres pour cet usage : « We train Prometheus, a 13B evaluator LLM that can assess any given long-form text based on customized score rubric provided by the user » (nous entraînons Prometheus, un LLM évaluateur de 13 milliards de paramètres, capable d'évaluer tout texte long selon une grille de notation personnalisée fournie par l'utilisateur). Les auteurs rapportent une corrélation de Pearson de 0,897 avec des évaluateurs humains sur 45 grilles personnalisées, contre 0,882 pour GPT-4 et seulement 0,392 pour ChatGPT sur le même protocole — un écart qui illustre à quel point un modèle non spécialisé peut mal juger, même quand il génère des réponses par ailleurs correctes en conversation.
- Prometheus
- 13B, ouvert, conçu spécifiquement pour une évaluation fine sur grille personnalisée ; une base solide pour un juge local dédié plutôt qu'un modèle généraliste détourné de son usage premier.
- Un modèle généraliste de 14B et plus
- Qwen, Llama ou Mistral dans cette gamme de taille fonctionnent aussi comme juge, avec une grille écrite soigneusement plutôt qu'un entraînement dédié à cette tâche précise.
- Un framework d'orchestration
- Utile pour lancer la campagne, stocker les résultats et suivre l'évolution du score dans le temps plutôt que de tout recoder à chaque fois qu'un test doit être relancé sur une nouvelle version.
#À quoi ressemble un prompt de juge qui tient
Reprenons les quatre règles de la section précédente sur un cas concret : un système RAG interne qui répond à des questions de procédure. Le prompt de juge doit contenir explicitement la question posée, les passages source retrouvés, la réponse à évaluer, une grille à critères séparés, et une consigne de justification avant la note. C'est plus long à écrire qu'un simple « note cette réponse sur dix », mais c'est ce détail qui distingue une campagne exploitable d'un chiffre qui rassure sans rien mesurer.
Deux détails changent tout dans ce squelette. D'abord, les passages source sont transmis au juge, pas seulement la réponse : sans eux, impossible de vérifier la fidélité, seulement la forme. Ensuite, la justification précède la conclusion dans l'ordre du prompt — un juge auquel on demande la note en premier a tendance à la justifier après coup plutôt qu'à raisonner avant de trancher, ce qui aggrave la capacité de raisonnement limitée relevée par l'étude de référence. Enfin, alterner l'ordre des réponses A et B d'un cas à l'autre, puis moyenner les deux passages, neutralise l'essentiel du biais de position documenté par Zheng et al.
#Quand ne pas s'en servir
- Pour valider un système à enjeu
- Médical, juridique, financier : un juge automatique ne remplace pas une relecture humaine sur les cas qui engagent une responsabilité.
- Pour comparer deux systèmes très différents
- Les biais de style et de longueur dominent dès que les formats de réponse diffèrent, comme le montre le biais de verbosité documenté par Zheng et al.
- Quand un test déterministe existe
- Si la bonne réponse est un chiffre ou une valeur exacte, une simple comparaison est plus juste et infiniment moins chère qu'un juge LLM.
- Sur trop peu de cas
- Sur dix questions, la variance de génération dépasse l'écart que vous cherchez à mesurer.
- Ragas : évaluer son RAG local avec des chiffres
- Langfuse : observer ses LLM locaux (traces, prompts, évals)
- Lire les classements de modèles sans se tromper
- RAG local : introduction (pour situer ce qu'on évalue)
- Source : Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (Zheng et al., 2023)
- Source : Prometheus, un juge open source de 13B (Kim et al., 2023)
- Source : dépôt GitHub officiel de Prometheus
#FAQ
Un modèle peut-il vraiment en juger un autre ?+
Quelle taille de modèle pour le juge ?+
Faut-il un juge différent du modèle évalué ?+
Note ou comparaison par paires ?+
Combien de cas faut-il pour une campagne exploitable ?+
Prometheus vaut-il mieux qu'un modèle généraliste comme juge ?+
Le biais de verbosité est-il vraiment mesurable ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.