Aller au contenu

TechniquePratique

5. Conception des évaluateurs

Pour : ingénieurs et SREPrérequis : Avoir lu le chapitre 4 du guide, en particulier l'étape 5.

Les évaluateurs sont le composant le plus spécifique au domaine d’une plateforme d’observabilité de l’IA. Les évaluateurs prêts à l’emploi (Ragas, DeepEval, Phoenix evals) couvrent les dimensions génériques (fidélité, toxicité, format). La qualité propre à un domaine exige des évaluateurs sur mesure, presque toujours mis en œuvre sous forme d’appels à un LLM juge avec une grille rédigée avec soin. Ce chapitre en couvre la mécanique pratique.

Un point de départ pragmatique pour la plupart des déploiements.

ÉvaluateurS’applique àCe qu’il mesure
Fidélité (faithfulness)RAGLa réponse est-elle étayée par le contexte récupéré ?
Pertinence de la réponseLLM, RAGLa réponse traite-t-elle la question posée ?
Précision du contexteRAGPart des fragments récupérés qui sont pertinents
Rappel du contexteRAGPart des fragments pertinents qui ont été récupérés
ToxicitéLLMPrésence de contenu nuisible, harcelant ou haineux
Fuite de données personnellesLLMPrésence de données d’identification personnelle dans la sortie
Conformité de formatLLMConformité de la sortie au schéma attendu
Taux d’hallucinationLLM, RAGEntités ou affirmations inventées, absentes de la source
Justesse des refusLLMLe modèle a-t-il refusé (ou non) à bon escient ?
Sélection d’outilAgentLe bon outil a-t-il été choisi à chaque étape ?
Validité des argumentsAgentLes arguments d’outil respectent-ils le schéma ?
Borne de boucleAgentL’agent a-t-il dépassé un nombre d’itérations acceptable ?
Grille métierTousCritères sur mesure propres à l’application

Trois familles de mise en œuvre, par ordre de coût et de souplesse.

  • À base de règles : expressions régulières, validation de schéma, présence de mots-clés. Rapide, peu coûteux, déterministe. Limité aux propriétés de surface.
  • À base de classifieurs : petits modèles entraînés pour des tâches précises (toxicité, détection de données personnelles, sentiment). Rapides à l’inférence, déterministes, ils exigent des données d’entraînement étiquetées.
  • LLM juge : un modèle note la sortie d’un autre modèle selon une grille écrite. Souple, coûteux, non déterministe. Indispensable pour tout critère sémantique.

Une erreur courante consiste à utiliser un LLM juge pour tout. La détection de motifs simples (un numéro de carte, un mot interdit) relève d’une expression régulière. La validation de schéma et la conformité de format d’une sortie structurée relèvent d’une vérification par JSON Schema. Réservez le LLM juge aux critères qui exigent réellement une compréhension sémantique.

Trois modèles couvrent la plupart des cas d’usage. Les prompts sont laissés en anglais, langue dans laquelle ils sont généralement rédigés.

Le juge renvoie 0 ou 1. Utilisé pour la détection d’hallucinations ou la justesse des refus. La conformité de format d’une sortie structurée se vérifie plutôt par JSON Schema ; gardez le juge pour les critères de forme qui exigent une lecture sémantique (ton, registre).

SYSTEM:
You are an evaluator. Given a question, a context and an answer, return
exactly one JSON object with the schema:
{"grounded": 0 or 1, "reason": "one short sentence"}
A grounded answer is one where every factual claim is supported by the
context. Inferences that are not stated in the context are not grounded.
USER:
Question: {question}
Context: {context}
Answer: {answer}

Ce prompt demande au juge de renvoyer grounded à 1 seulement si chaque affirmation factuelle est étayée par le contexte ; une inférence non énoncée dans le contexte n’est pas considérée comme ancrée.

Le juge renvoie un score numérique selon une grille écrite. Utilisé pour la pertinence, la complétude, le ton.

SYSTEM:
Score the answer on a scale of 1 to 5 against the following rubric:
1 = irrelevant or off-topic
2 = partially addresses the question, missing key information
3 = addresses the question but with errors or omissions
4 = correct and complete, lacks polish
5 = correct, complete, well-structured
Return JSON: {"score": int, "reason": "short justification"}
USER:
Question: {question}
Answer: {answer}

La grille va de 1 (hors sujet) à 5 (juste, complet et bien structuré), en passant par 2 (réponse partielle, informations clés manquantes), 3 (réponse avec erreurs ou omissions) et 4 (juste et complet, mais perfectible dans la forme).

Le juge choisit la meilleure de deux réponses. Utilisé pour les tests A/B de prompts ou de modèles. Moins sensible à la calibration absolue que la notation d’une réponse isolée.

SYSTEM:
Given a question and two candidate answers, return JSON:
{"winner": "A" or "B" or "tie", "reason": "short justification"}
Judge on factual correctness first, then completeness, then clarity.
USER:
Question: {question}
Answer A: {answer_a}
Answer B: {answer_b}

Le juge tranche d’abord sur l’exactitude factuelle, puis sur la complétude, enfin sur la clarté.

Les juges par paires ont un biais de position : ils tendent à favoriser la réponse présentée en premier (ou en second, selon le modèle). Faites passer chaque paire deux fois en inversant A et B et ne retenez un gagnant que si les deux passages concordent ; sinon, comptez une égalité.

Les scores d’un LLM juge ne sont pas absolus. Ils dépendent du modèle juge, du prompt et de la température. Calibrer, c’est établir dans quelle mesure les scores du juge concordent avec le jugement humain sur un jeu organisé.

  1. Constituez un jeu de calibration dont la vérité terrain a été établie par des humains. Ordre de grandeur : quelques dizaines à quelques centaines de traces (par exemple 50 à 200), avec assez de cas positifs et négatifs ; plus le critère est rare ou subtil, plus il en faut.
  2. Faites tourner le juge sur ce jeu. Mesurez l’accord avec un indicateur corrigé du hasard, comme le kappa de Cohen pour des verdicts binaires ou catégoriels. Le taux d’accord brut est trompeur quand une classe domine : si 90 % des réponses sont ancrées, un juge qui répond toujours « ancré » obtient 90 % d’accord. Pour des scores numériques, utilisez une corrélation de rang ou un kappa pondéré.
  3. Fixez le seuil d’acceptation avant de mesurer, selon l’enjeu. À titre de repère, l’échelle de Landis et Koch (1977) qualifie d’accord important (substantial) un kappa compris entre 0,61 et 0,80 ; un seuil de 0,7 est un exemple, pas une norme. Sous votre seuil, le prompt du juge ou le modèle juge doit être retravaillé.
  4. Recalibrez à chaque changement de modèle juge. Les mises à jour de modèles chez les fournisseurs modifient le comportement des juges.

Les scores par trace servent aux requêtes d’investigation. Les scores agrégés servent à la supervision. Trois modes d’agrégation.

  • Moyenne sur une fenêtre : simple, mais masque la forme de la distribution. Choix par défaut pour les évaluateurs stables.
  • Percentile (souvent p10 ou p25) : fait ressortir la pire traîne plutôt que la moyenne. Plus efficace pour détecter les régressions.
  • Taux sous un seuil : part des traces dont le score est inférieur à une valeur fixe. C’est la base d’un SLO de qualité, qui se formule comme une proportion : par exemple « au moins 95 % des réponses évaluées obtiennent plus de 0,8 en fidélité sur une fenêtre glissante de 7 jours » (valeurs illustratives).

Cette proportion est estimée sur un échantillon de réponses évaluées : on ne compare donc pas sa valeur ponctuelle à la cible, mais la borne inférieure de son intervalle de confiance (borne de Wilson). La définition du SLO de qualité, le dimensionnement de l’échantillon, le budget d’erreur et la méta-observabilité du juge sont traités dans la méthode GenAI, partie IV, qui fait référence sur ce point.

Un appel de juge unique est bruité. Deux stratégies réduisent la variance.

  • Auto-cohérence (self-consistency) : exécuter le même prompt de juge trois ou cinq fois et retenir la majorité. Multiplie le coût du juge par trois (ou cinq) et réduit nettement la variance.
  • Ensembles de juges : utiliser deux modèles juges différents et exiger leur accord. Confiance accrue sur les cas positifs, davantage de désaccords à examiner.

Utilisez l’auto-cohérence pour les évaluateurs à fort enjeu (refus, sûreté). Utilisez des juges à appel unique pour les évaluateurs continus peu coûteux (pertinence).

Exécuter chaque évaluateur sur chaque trace est rarement abordable à grande échelle. Organisez l’évaluation par paliers.

Principe commun à tout le site : ce qui fixe la précision d’un indicateur de qualité, c’est le nombre de jugements par segment (fonctionnalité, locataire, langue, type de requête) et par période, pas le pourcentage échantillonné. Le même taux de 1 % donne 100 000 jugements par jour sur 10 millions de requêtes, mais 20 seulement sur 2 000 requêtes, trop peu pour suivre une proportion. Fixez d’abord le nombre de jugements nécessaire par segment et par fenêtre (la méthode GenAI, partie IV donne la formule de dimensionnement), déduisez-en le taux, puis sur-échantillonnez les segments rares ou à risque. Les paliers ci-dessous illustrent une organisation par coût ; leurs pourcentages sont des exemples.

  • Palier 1 (peu coûteux, toujours actif) : vérifications de format à base de règles, détection de données personnelles et de toxicité par classifieurs. Par exemple sur 100 % des traces.
  • Palier 2 (coût moyen) : petits appels de LLM juge pour la fidélité et la pertinence. Par exemple sur 10 % des traces.
  • Palier 3 (coût élevé) : grands modèles juges ou auto-cohérence pour les grilles métier. Par exemple sur 1 % des traces, plus 100 % des traces signalées par les paliers 1 ou 2.

Ces taux sont des exemples, à ajuster selon votre volume et votre budget : vérifiez qu’ils donnent assez de jugements par segment et par période pour la précision dont vous avez besoin.

Suite : 6. Le paysage des outils.

Révisé le 4 octobre 2026 : SLO de qualité formulé comme une proportion avec renvoi à la méthode GenAI (borne de Wilson), principe d’échantillonnage du juge (nombre de jugements par segment et par période plutôt que pourcentage), paliers présentés comme des exemples.