Aller au contenu

TechniquePratique

Module 3 : les trois dérives

Pour : ingénieurs et SREPrérequis : Avoir suivi le lab 2 du parcours sur le pipeline RAG.

Un modèle en production se dégrade de trois façons, toutes silencieuses et invisibles depuis la supervision d’infrastructure.

DériveCauseExemple
Donnéesles utilisateurs posent des questions différentesun assistant RH conçu pour les congés reçoit des questions sur la mobilité interne
Conceptla réalité externe a changé sans que le système le sacheune convention collective évolue, l’assistant cite toujours l’ancienne version
Pipelineun composant a été modifié sans testtop_k passe de 5 à 1 lors d’un nettoyage de code, le contexte devient insuffisant

La dérive de pipeline ne vient pas seulement de votre équipe. Quand vous appelez un LLM par API, le fournisseur peut changer le modèle servi derrière un même nom ou un même alias, sans que votre code bouge : c’est aussi une dérive de pipeline. Pour la voir, consignez dans chaque span le modèle demandé (gen_ai.request.model) et le modèle effectivement renvoyé par le fournisseur (gen_ai.response.model), ainsi que la version du gabarit de prompt et les réglages de découpage du RAG.

De la cause au signal qui la révèle, puis à la réponse qui lui correspond :

flowchart LR
  C1["Données<br/>les questions changent"] --> S1["Distribution des intentions,<br/>volume hors domaine"] --> A1["Étendre la base documentaire<br/>et le jeu de référence"]
  C2["Concept<br/>la réalité change"] --> S2["Fidélité contre vérité terrain,<br/>retours négatifs"] --> A2["Mettre à jour les sources<br/>et réindexer"]
  C3["Pipeline<br/>un composant change"] --> S3["Attributs de span,<br/>latence par étape"] --> A3["Revenir sur le changement<br/>et le tester"]

À mon avis, la dérive de pipeline est la plus simple à diagnostiquer, à condition d’avoir instrumenté la configuration du pipeline dans les spans : on en trouve la cause dans la trace elle-même, sans avoir à analyser les questions des utilisateurs.

Ce module est la référence du site pour la taxonomie des dérives : le glossaire du guide et les autres contenus s’y alignent. Les termes que vous rencontrerez ailleurs se rangent ainsi dans les trois familles :

Terme rencontréFamille canonique
dérive des entrées, covariate shift, dérive des plongements (détection)données
prior shift (la distribution des étiquettes change)données
virtual drift (la distribution des entrées change sans changer la relation entre entrée et sortie)données
dérive conceptuelle, concept driftconcept
changement silencieux du fournisseur ou du modèle, du gabarit de prompt, du découpage RAGpipeline
dérive des sortiesce n’est pas une famille : c’est le symptôme que révèlent les évaluations, dont la cause est une dérive de données, de concept ou de pipeline
DériveIndicateurMéthodeDéclencheur
Donnéesdistribution des intentionsPSI ou Kolmogorov-Smirnov sur les embeddingsPSI ou statistique KS au-dessus d’un seuil calibré sur une période de référence
Donnéesvolume hors domaineclassifieur d’intention ou similarité avec la baseplus de 15 % du trafic hors domaine
Conceptfidélité contre vérité terrainLLM juge sur un échantillonchute de plus de 10 points
Conceptretours négatifspouce bas explicite ou abandonplus de 5 % sur 24 h
Pipelinedistribution des attributs de spanhistogramme de top_k, du nom de modèleapparition d’une valeur nouvelle
Pipelinelatence par étapehistogramme glissant sur 7 joursvariation de plus de 30 % inexpliquée

Ces seuils sont des points de départ illustratifs, non tirés d’une étude : recalibrez-les sur votre propre trafic après quelques semaines. Le 0,6 du score qualité est celui qu’utilisent tous les labs du kit (détection du lab 3, alerte et SLO du lab 4).

Le signe distinctif d’une dérive est la décorrélation : tous les indicateurs techniques sont normaux, seul le score qualité baisse. Un tableau de bord qui place côte à côte latence, taux d’erreur et score qualité rend cette décorrélation visible d’un coup d’œil.

Une moyenne mobile du score qualité et un seuil suffisent pour démarrer. Les tests statistiques (PSI, KS, Wasserstein) viennent ensuite, quand le volume justifie l’effort. La détection statistique avancée est traitée dans le parcours Au-delà du LLM : GPU et qualité des modèles.

Les dérives de données, de concept et de pipeline n’ont ni la même cause ni la même réponse. La dérive de pipeline se lit dans les attributs de span, à condition d’y avoir mis la configuration. Dans tous les cas, le symptôme à surveiller est le même : une infrastructure verte et un score qualité qui baisse, mesuré contre le contexte récupéré ou, pour la dérive de concept, contre une vérité terrain (la fidélité au contexte, elle, peut rester haute). Pour démarrer, une moyenne mobile et un seuil suffisent.

Révisé le 2 octobre 2026 : affirmation non sourcée sur la fréquence des dérives de pipeline retirée, seuils présentés comme illustratifs et alignés sur 0,6, code de module remplacé par un lien vers le parcours observabilité IA avancée.

Révisé le 4 octobre 2026 : module désigné comme référence du site pour la taxonomie des dérives, table de correspondance des termes ajoutée (dérive des sorties présentée comme un symptôme), changement silencieux du fournisseur ou du modèle rangé dans la dérive de pipeline.