Technique
Module 3 : les trois dérives
Pour : ingénieurs et SREPrérequis : Avoir suivi le lab 2 du parcours sur le pipeline RAG.
Un modèle en production se dégrade de trois façons, toutes silencieuses et invisibles depuis la supervision d’infrastructure.
Données, concept, pipeline
Section intitulée « Données, concept, pipeline »| Dérive | Cause | Exemple |
|---|---|---|
| Données | les utilisateurs posent des questions différentes | un assistant RH conçu pour les congés reçoit des questions sur la mobilité interne |
| Concept | la réalité externe a changé sans que le système le sache | une convention collective évolue, l’assistant cite toujours l’ancienne version |
| Pipeline | un composant a été modifié sans test | top_k passe de 5 à 1 lors d’un nettoyage de code, le contexte devient insuffisant |
La dérive de pipeline ne vient pas seulement de votre équipe. Quand vous appelez un LLM par API, le fournisseur peut changer le modèle servi derrière un même nom ou un même alias, sans que votre code bouge : c’est aussi une dérive de pipeline. Pour la voir, consignez dans chaque span le modèle demandé (gen_ai.request.model) et le modèle effectivement renvoyé par le fournisseur (gen_ai.response.model), ainsi que la version du gabarit de prompt et les réglages de découpage du RAG.
De la cause au signal qui la révèle, puis à la réponse qui lui correspond :
flowchart LR C1["Données<br/>les questions changent"] --> S1["Distribution des intentions,<br/>volume hors domaine"] --> A1["Étendre la base documentaire<br/>et le jeu de référence"] C2["Concept<br/>la réalité change"] --> S2["Fidélité contre vérité terrain,<br/>retours négatifs"] --> A2["Mettre à jour les sources<br/>et réindexer"] C3["Pipeline<br/>un composant change"] --> S3["Attributs de span,<br/>latence par étape"] --> A3["Revenir sur le changement<br/>et le tester"]
À mon avis, la dérive de pipeline est la plus simple à diagnostiquer, à condition d’avoir instrumenté la configuration du pipeline dans les spans : on en trouve la cause dans la trace elle-même, sans avoir à analyser les questions des utilisateurs.
Correspondance des termes
Section intitulée « Correspondance des termes »Ce module est la référence du site pour la taxonomie des dérives : le glossaire du guide et les autres contenus s’y alignent. Les termes que vous rencontrerez ailleurs se rangent ainsi dans les trois familles :
| Terme rencontré | Famille canonique |
|---|---|
| dérive des entrées, covariate shift, dérive des plongements (détection) | données |
| prior shift (la distribution des étiquettes change) | données |
| virtual drift (la distribution des entrées change sans changer la relation entre entrée et sortie) | données |
| dérive conceptuelle, concept drift | concept |
| changement silencieux du fournisseur ou du modèle, du gabarit de prompt, du découpage RAG | pipeline |
| dérive des sorties | ce n’est pas une famille : c’est le symptôme que révèlent les évaluations, dont la cause est une dérive de données, de concept ou de pipeline |
Des indicateurs reproductibles
Section intitulée « Des indicateurs reproductibles »| Dérive | Indicateur | Méthode | Déclencheur |
|---|---|---|---|
| Données | distribution des intentions | PSI ou Kolmogorov-Smirnov sur les embeddings | PSI ou statistique KS au-dessus d’un seuil calibré sur une période de référence |
| Données | volume hors domaine | classifieur d’intention ou similarité avec la base | plus de 15 % du trafic hors domaine |
| Concept | fidélité contre vérité terrain | LLM juge sur un échantillon | chute de plus de 10 points |
| Concept | retours négatifs | pouce bas explicite ou abandon | plus de 5 % sur 24 h |
| Pipeline | distribution des attributs de span | histogramme de top_k, du nom de modèle | apparition d’une valeur nouvelle |
| Pipeline | latence par étape | histogramme glissant sur 7 jours | variation de plus de 30 % inexpliquée |
Ces seuils sont des points de départ illustratifs, non tirés d’une étude : recalibrez-les sur votre propre trafic après quelques semaines. Le 0,6 du score qualité est celui qu’utilisent tous les labs du kit (détection du lab 3, alerte et SLO du lab 4).
Infra verte, qualité dégradée
Section intitulée « Infra verte, qualité dégradée »Le signe distinctif d’une dérive est la décorrélation : tous les indicateurs techniques sont normaux, seul le score qualité baisse. Un tableau de bord qui place côte à côte latence, taux d’erreur et score qualité rend cette décorrélation visible d’un coup d’œil.
Commencer simple
Section intitulée « Commencer simple »Une moyenne mobile du score qualité et un seuil suffisent pour démarrer. Les tests statistiques (PSI, KS, Wasserstein) viennent ensuite, quand le volume justifie l’effort. La détection statistique avancée est traitée dans le parcours Au-delà du LLM : GPU et qualité des modèles.
En résumé
Section intitulée « En résumé »Les dérives de données, de concept et de pipeline n’ont ni la même cause ni la même réponse. La dérive de pipeline se lit dans les attributs de span, à condition d’y avoir mis la configuration. Dans tous les cas, le symptôme à surveiller est le même : une infrastructure verte et un score qualité qui baisse, mesuré contre le contexte récupéré ou, pour la dérive de concept, contre une vérité terrain (la fidélité au contexte, elle, peut rester haute). Pour démarrer, une moyenne mobile et un seuil suffisent.
Révisé le 2 octobre 2026 : affirmation non sourcée sur la fréquence des dérives de pipeline retirée, seuils présentés comme illustratifs et alignés sur 0,6, code de module remplacé par un lien vers le parcours observabilité IA avancée.
Révisé le 4 octobre 2026 : module désigné comme référence du site pour la taxonomie des dérives, table de correspondance des termes ajoutée (dérive des sorties présentée comme un symptôme), changement silencieux du fournisseur ou du modèle rangé dans la dérive de pipeline.