Avancé 11 minOptimisation

LLM-as-a-judge : faire noter un modèle par un modèle

Réponse directe

LLM-as-a-judge consiste à faire noter les réponses d'un système par un autre modèle. L'étude fondatrice (Zheng et al., MT-Bench et Chatbot Arena, 2023) montre qu'un juge fort comme GPT-4 atteint plus de 80 % d'accord avec des préférences humaines, comme entre deux humains — avec des biais documentés : position, verbosité, auto-préférence, raisonnement limité. En local, un juge de 13 à 14 milliards de paramètres, avec comparaison par paires, donne des résultats exploitables.

Faire noter les réponses d'un modèle par un autre modèle est devenu la méthode d'évaluation la plus répandue, pour une raison simple : c'est la seule qui passe à l'échelle. Elle est aussi biaisée, manipulable et trompeuse si on la lit comme une note absolue. L'étude qui a posé le cadre de référence, publiée par l'équipe de LMSYS (Chatbot Arena) et présentée à NeurIPS 2023, le dit elle-même : bien utilisée, elle compare deux versions d'un système ; mal utilisée, elle donne un chiffre rassurant qui ne mesure rien.

Par Mohamed Meguedmi·Màj 2026-09-30·Testé sur Windows, macOS, Linux

#Le principe, et son intérêt

On donne à un modèle une question, la réponse produite par le système à évaluer, éventuellement les passages qui ont servi à répondre et une réponse de référence, puis une grille de notation. Il rend une note et une justification. Répété sur cent cas, cela donne un indicateur que l'on peut suivre dans le temps, à chaque changement de prompt, de modèle ou de paramètre de recherche.

L'alternative est l'évaluation humaine, qui reste la référence et ne passe pas à l'échelle : personne ne relira cent réponses à chaque changement de prompt. Le juge automatique permet de répondre à « cette modification a-t-elle amélioré ou dégradé le système » en dix minutes, ce qui change la façon de travailler. L'article fondateur de Zheng et al. a précisément été motivé par ce constat : les benchmarks existants (MMLU et consorts) ne mesurent pas ce qui compte dans une conversation ouverte, et l'évaluation humaine à grande échelle est trop coûteuse pour itérer vite sur un système qui évolue chaque semaine.

#Écrire une grille qui tient

Le kit RAG Local

Tes documents, ton IA : un RAG local fiable sur tes PDF, notes et mails — sans rien envoyer dans le cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j
  1. 01
    Un critère à la fois
    Demander une note globale ne veut rien dire. On note séparément la fidélité aux sources, la pertinence et la complétude.
  2. 02
    Une échelle courte et décrite
    Trois ou quatre niveaux, avec ce que signifie chacun. Une échelle sur dix produit des notes sans reproductibilité.
  3. 03
    Exiger la justification avant la note
    Un juge à qui l'on demande de raisonner puis de conclure est nettement plus stable que celui qui lâche un chiffre. C'est la même logique que la « limited reasoning ability » relevée par Zheng et al. : forcer le raisonnement explicite réduit cette limite.
  4. 04
    Préférer la comparaison par paires
    « Laquelle de ces deux réponses est la meilleure » est une question à laquelle un modèle répond bien mieux qu'à « note celle-ci sur cinq » — c'est le format que Chatbot Arena utilise pour comparer les modèles entre eux.
i
La comparaison par paires est l'astuce la plus rentable
Elle supprime la question de l'échelle, réduit fortement la variance, et répond directement à ce qui vous intéresse : la nouvelle version est-elle meilleure que l'ancienne. Pensez seulement à alterner l'ordre des deux réponses, car les juges ont un biais de position documenté.

#Les biais, et comment les contenir

L'article de référence sur le sujet nomme précisément trois biais et une limite : le biais de position, le biais de verbosité, le biais d'auto-préférence (self-enhancement), et une capacité de raisonnement limitée. Ce n'est pas une hypothèse de blog, c'est le résultat central de l'étude qui a introduit MT-Bench et Chatbot Arena, deux références encore utilisées aujourd'hui pour classer des modèles.

Ce qui fausse une évaluation automatique, d'après Zheng et al. (2023)
BiaisEffetContre-mesure
PositionLa réponse présentée en premier est favoriséeAlterner l'ordre et moyenner les deux passages
VerbositéUne réponse plus longue est jugée meilleure, à qualité égaleLe préciser dans la grille, contrôler la longueur des deux côtés
Auto-préférenceUn juge favorise les réponses de sa propre famille de modèlesNe pas juger un modèle avec lui-même ou un proche cousin
Raisonnement limitéLe juge se trompe sur des tâches qui demandent un calcul ou une déductionExiger une justification écrite avant la note, jamais une note seule
ComplaisanceTout est bien noté, les notes s'écrasent en haut de l'échelleUne grille exigeante et des exemples de mauvaises réponses dans le prompt

La bonne nouvelle, documentée par la même étude : un juge fort comme GPT-4 atteint plus de 80 % d'accord avec des préférences humaines sur MT-Bench et Chatbot Arena — le même niveau d'accord que celui mesuré entre deux évaluateurs humains entre eux. La règle d'usage qui résume tout ce chapitre : un juge sert à comparer, jamais à certifier une qualité dans l'absolu. Une note de 4,2 sur 5 ne dit rien ; un passage de 3,1 à 3,8 sur le même jeu de test avec le même juge dit quelque chose de réel.

Le biais de verbosité n'est pas une inquiétude théorique : le benchmark AlpacaEval, très utilisé pour comparer des modèles ajustés par instruction, est explicitement connu pour favoriser les modèles qui génèrent des réponses plus longues, à qualité égale. Sa version corrigée de la longueur (« length-controlled ») fait passer la corrélation avec les classements de Chatbot Arena de 0,94 à 0,98 — la preuve chiffrée que neutraliser ce seul biais rapproche mécaniquement le jugement automatique du jugement humain, plutôt que de l'en éloigner.

#Un juge local, est-ce sérieux ?

Oui, sous deux conditions. La première est la taille : en dessous de 14 milliards de paramètres environ, les jugements deviennent instables et le format de sortie casse, ce qui rend la campagne inexploitable — c'est cohérent avec le repère mémoire du site (14B ≈ 9 Go en Q4). La seconde est le contexte : le juge doit contenir la question, les passages et la réponse en une seule fois — un contexte saturé fait noter un texte tronqué, et personne ne s'en aperçoit, puisque le modèle continue de répondre normalement sur ce qu'il a effectivement reçu.

L'intérêt du juge local est évident quand les données évaluées sont confidentielles : envoyer chaque réponse et chaque passage à une API externe pour les noter annule l'intérêt d'avoir gardé le système en local, en particulier sur un cas médical, juridique ou financier où les passages source contiennent eux-mêmes des données sensibles. Et contrairement à la production, une campagne d'évaluation tolère très bien la lenteur : on la lance la nuit, sur un GPU qui sert à autre chose en journée, et on récupère les résultats au matin.

#Les outils pour ne pas réinventer le pipeline

Il n'est pas nécessaire d'écrire son propre harnais de juge depuis zéro. Prometheus, un projet de recherche open source, entraîne spécifiquement un modèle de 13 milliards de paramètres pour cet usage : « We train Prometheus, a 13B evaluator LLM that can assess any given long-form text based on customized score rubric provided by the user » (nous entraînons Prometheus, un LLM évaluateur de 13 milliards de paramètres, capable d'évaluer tout texte long selon une grille de notation personnalisée fournie par l'utilisateur). Les auteurs rapportent une corrélation de Pearson de 0,897 avec des évaluateurs humains sur 45 grilles personnalisées, contre 0,882 pour GPT-4 et seulement 0,392 pour ChatGPT sur le même protocole — un écart qui illustre à quel point un modèle non spécialisé peut mal juger, même quand il génère des réponses par ailleurs correctes en conversation.

Prometheus
13B, ouvert, conçu spécifiquement pour une évaluation fine sur grille personnalisée ; une base solide pour un juge local dédié plutôt qu'un modèle généraliste détourné de son usage premier.
Un modèle généraliste de 14B et plus
Qwen, Llama ou Mistral dans cette gamme de taille fonctionnent aussi comme juge, avec une grille écrite soigneusement plutôt qu'un entraînement dédié à cette tâche précise.
Un framework d'orchestration
Utile pour lancer la campagne, stocker les résultats et suivre l'évolution du score dans le temps plutôt que de tout recoder à chaque fois qu'un test doit être relancé sur une nouvelle version.

#À quoi ressemble un prompt de juge qui tient

Reprenons les quatre règles de la section précédente sur un cas concret : un système RAG interne qui répond à des questions de procédure. Le prompt de juge doit contenir explicitement la question posée, les passages source retrouvés, la réponse à évaluer, une grille à critères séparés, et une consigne de justification avant la note. C'est plus long à écrire qu'un simple « note cette réponse sur dix », mais c'est ce détail qui distingue une campagne exploitable d'un chiffre qui rassure sans rien mesurer.

Squelette de prompt de juge (comparaison par paires)
Question de l'utilisateur : {question}
Passages source fournis au système : {passages}

Réponse A : {reponse_a}
Réponse B : {reponse_b}

Pour chaque réponse, évalue séparément :
1. Fidélité aux passages fournis (aucune affirmation absente des sources)
2. Pertinence par rapport à la question posée
3. Complétude (la question est traitée entièrement)

Justifie d'abord ton analyse pour chaque critère, puis conclus par :
Meilleure réponse : A ou B
Raison en une phrase.

Deux détails changent tout dans ce squelette. D'abord, les passages source sont transmis au juge, pas seulement la réponse : sans eux, impossible de vérifier la fidélité, seulement la forme. Ensuite, la justification précède la conclusion dans l'ordre du prompt — un juge auquel on demande la note en premier a tendance à la justifier après coup plutôt qu'à raisonner avant de trancher, ce qui aggrave la capacité de raisonnement limitée relevée par l'étude de référence. Enfin, alterner l'ordre des réponses A et B d'un cas à l'autre, puis moyenner les deux passages, neutralise l'essentiel du biais de position documenté par Zheng et al.

#Quand ne pas s'en servir

Pour valider un système à enjeu
Médical, juridique, financier : un juge automatique ne remplace pas une relecture humaine sur les cas qui engagent une responsabilité.
Pour comparer deux systèmes très différents
Les biais de style et de longueur dominent dès que les formats de réponse diffèrent, comme le montre le biais de verbosité documenté par Zheng et al.
Quand un test déterministe existe
Si la bonne réponse est un chiffre ou une valeur exacte, une simple comparaison est plus juste et infiniment moins chère qu'un juge LLM.
Sur trop peu de cas
Sur dix questions, la variance de génération dépasse l'écart que vous cherchez à mesurer.

#FAQ

Un modèle peut-il vraiment en juger un autre ?+
Suffisamment pour comparer deux versions d'un même système sur un jeu de test constant : l'étude de référence mesure plus de 80 % d'accord entre un juge fort et des préférences humaines, un niveau comparable à l'accord entre deux humains. Pas assez pour délivrer une note absolue ni pour valider seul un usage à enjeu.
Quelle taille de modèle pour le juge ?+
Au moins 13 à 14 milliards de paramètres en pratique, et davantage si les réponses sont longues : c'est la taille du modèle Prometheus conçu spécifiquement pour ce rôle. En dessous, les jugements sont instables et le format de sortie attendu (note, justification) casse fréquemment.
Faut-il un juge différent du modèle évalué ?+
Oui. L'étude de Zheng et al. documente un biais d'auto-préférence (self-enhancement) : un modèle a tendance à mieux noter les réponses de sa propre famille, y compris une version légèrement différente de lui-même. Utiliser le même modèle des deux côtés produit un chiffre flatteur et inutile pour décider quoi que ce soit, en particulier avant un changement de version en production.
Note ou comparaison par paires ?+
La comparaison par paires, presque toujours : moins de variance, pas de problème d'échelle, et elle répond directement à la question « est-ce mieux qu'avant ». C'est le format qu'utilise Chatbot Arena pour classer les modèles. Pensez à alterner l'ordre de présentation pour contrer le biais de position.
Combien de cas faut-il pour une campagne exploitable ?+
Trente à cinquante cas réels constituent une base raisonnable pour commencer à distinguer un vrai écart du bruit de génération, à condition qu'ils couvrent la diversité réelle des questions posées au système. En dessous d'une dizaine de questions, la variabilité de génération dépasse largement les écarts que vous cherchez à mesurer entre deux versions du même système.
Prometheus vaut-il mieux qu'un modèle généraliste comme juge ?+
Sur les grilles personnalisées testées dans l'article, Prometheus (13B) atteint une corrélation de 0,897 avec des humains, contre 0,882 pour GPT-4 et 0,392 pour ChatGPT. C'est un signal fort, mais obtenu sur son propre protocole d'évaluation : le valider sur votre grille reste nécessaire avant de lui faire confiance en production.
Le biais de verbosité est-il vraiment mesurable ?+
Oui : le benchmark AlpacaEval, connu pour favoriser les réponses longues, a mesuré l'effet précisément en corrigeant ce biais. Sa version qui neutralise la longueur fait passer la corrélation avec les classements humains de Chatbot Arena de 0,94 à 0,98, ce qui chiffre concrètement le gain obtenu en éliminant ce seul biais du jugement automatique.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.