Technique
Annexe : glossaire, références, prochaines étapes
Pour : ingénieurs et SRE · architectesPrérequis : Connaître les niveaux de maturité du chapitre 3.
A.1 Glossaire
Section intitulée « A.1 Glossaire »Ancrage (grounding) : propriété d’une réponse appuyée sur une source vérifiable plutôt que sur les connaissances paramétriques du modèle.
Attribut : paire clé-valeur attachée à un span, utilisée pour filtrer et agréger. Exemple : gen_ai.request.model = "provider-model".
Calibration : processus qui mesure dans quelle mesure les scores d’un LLM juge concordent avec le jugement humain sur un jeu organisé. Préalable indispensable avant de se fier à une métrique issue d’un LLM juge.
Dérive (drift) : changement dans le temps qui peut dégrader les sorties d’un système d’IA. Trois familles : données (les entrées changent : dérive des entrées ou covariate shift, dérive des plongements, prior shift, virtual drift), concept (la réalité que le système décrit change : dérive conceptuelle ou concept drift), pipeline (un composant change : modèle ou fournisseur modifié en silence, gabarit de prompt, découpage du RAG). La dérive des sorties n’est pas une quatrième famille : c’est le symptôme que révèlent les évaluations, dont la cause relève de l’une des trois. La taxonomie et sa table de correspondance sont dans le module 3 des labs, qui fait référence.
Échantillonnage en queue (tail sampling) : décision d’échantillonnage prise à la fin de la trace, selon des règles. Exige de mettre en mémoire tampon les traces complètes, mais permet de sélectionner selon le résultat.
Échantillonnage en tête (head sampling) : décision d’échantillonnage prise au début de la trace, par hachage ou par probabilité. Sans état et peu coûteux, mais incapable de sélectionner selon le résultat.
Fidélité (faithfulness) : la réponse est-elle ancrée dans le contexte fourni ? Une réponse fidèle peut néanmoins être fausse si le contexte est faux. Distincte de l’exactitude factuelle.
Hallucination : sortie qui affirme des faits non étayés par les données d’entraînement, le contexte fourni ou toute source vérifiable.
Jeu de non-régression (regression set) : jeu de données d’entrées qui ont échoué par le passé, utilisé pour conditionner les changements futurs. S’enrichit au fil du tri des nouvelles défaillances.
Jeu de référence (gold set) : jeu de données organisé d’entrées dont la sortie idéale est connue, utilisé pour l’évaluation hors ligne.
LLM juge (LLM-as-judge) : méthode d’évaluation dans laquelle un modèle note la sortie d’un autre modèle selon une grille. Une approche courante pour la qualité sémantique, à calibrer contre un jugement humain.
OpenInference : conventions sémantiques et bibliothèques d’instrumentation issues d’Arize, conçues pour le traçage de l’IA. Elles exportent en OTLP, mais avec leurs propres attributs (openinference.span.kind, llm.*) et non les attributs gen_ai.* d’OpenTelemetry : il faut convertir les attributs (processeur transform du Collector) ou choisir une seule convention.
OpenTelemetry GenAI : conventions sémantiques qui étendent OpenTelemetry aux opérations des modèles de langage. Encore au statut « en développement », maintenues depuis juin 2026 dans un dépôt dédié.
Span : opération unique et chronométrée, par exemple un appel LLM, une recherche, une invocation d’outil. Les spans s’imbriquent pour former des arbres de traces.
Trace : chemin d’exécution complet d’une requête, composé de spans reliés par leurs identifiants parents. L’unité fondamentale de l’observabilité de l’IA.
A.2 Documentation de référence
Section intitulée « A.2 Documentation de référence »- Première version de ce guide, « Understanding AI Observability » (mai 2026) : forge.erythix.tech/labstraining/training/AIOBS
- Conventions sémantiques OpenTelemetry GenAI (statut « en développement », dépôt dédié depuis semantic-conventions v1.42.0, juin 2026) : github.com/open-telemetry/semantic-conventions-genai
- Spécification OpenInference : github.com/Arize-ai/openinference
- Documentation Phoenix : arize.com/docs/phoenix
- Documentation Langfuse (racheté par ClickHouse en janvier 2026) : langfuse.com/docs
- Documentation Ragas : docs.ragas.io
- Documentation DeepEval : deepeval.com/docs/getting-started
- OpenLLMetry (Traceloop, racheté par ServiceNow en mars 2026) : github.com/traceloop/openllmetry
- Documentation VictoriaMetrics : docs.victoriametrics.com
- Processeur d’échantillonnage en queue de l’OpenTelemetry Collector : github.com/open-telemetry/opentelemetry-collector-contrib/tree/main/processor/tailsamplingprocessor
A.3 Prochaines étapes selon votre niveau de départ
Section intitulée « A.3 Prochaines étapes selon votre niveau de départ »Si vous êtes au niveau 0
Section intitulée « Si vous êtes au niveau 0 »Visez le niveau 1 en deux semaines. Ajoutez une journalisation structurée autour de chaque appel LLM. Capturez le prompt, la réponse, le modèle, le nombre de jetons, la latence, l’erreur et un identifiant de requête. Agrégez la consommation de jetons dans un tableau de bord de coûts élémentaire. Ne commencez ni par OpenTelemetry, ni par l’évaluation : livrez d’abord les journaux.
Si vous êtes au niveau 1
Section intitulée « Si vous êtes au niveau 1 »Visez le niveau 2 en un à deux mois. Adoptez les conventions OpenTelemetry GenAI et migrez votre journalisation sur mesure vers des attributs de span. Déployez un OpenTelemetry Collector et un dorsal de traces. Si vous voulez une interface propre à l’IA sans intégration supplémentaire, un outil comme Phoenix ou Langfuse auto-hébergé est un bon point de départ ; si vous exploitez déjà Tempo ou Jaeger, commencez par lui. Vérifiez que vous savez répondre aux questions de l’étape 1 du chapitre 4.
Si vous êtes au niveau 2
Section intitulée « Si vous êtes au niveau 2 »Visez le niveau 3 en deux à trois mois. Ajoutez l’évaluation en ligne sur le chemin le plus critique. Commencez par trois évaluateurs : conformité de format, toxicité et un évaluateur métier. Branchez les scores sur des alertes. Instaurez une revue hebdomadaire des traces en échec et à faible score.
Si vous êtes au niveau 3
Section intitulée « Si vous êtes au niveau 3 »Visez le niveau 4 en trois mois. Ajoutez la surveillance de la dérive des plongements. Faites remonter les retours utilisateurs dans le magasin de traces. Constituez et entretenez un jeu de référence pour l’évaluation du RAG. Lancez l’évaluation hors ligne en intégration continue pour conditionner les changements de modèle et de prompt.
Si vous êtes au niveau 4
Section intitulée « Si vous êtes au niveau 4 »Visez le niveau 5 en un trimestre. Formalisez le jeu de non-régression, l’ensemble d’exemples few-shot et le contrôle des mises à niveau. Automatisez la réindexation en cas de dérive. Faites de la plateforme d’observabilité la source de vérité pour l’itération sur les modèles et les prompts.
Retour à la présentation.
Révisé le 2 octobre 2026 : lien des conventions GenAI vers le dépôt semantic-conventions-genai, liens Phoenix et DeepEval mis à jour, rachats de Langfuse et de Traceloop, attributs propres d’OpenInference précisés, première version du guide citée.
Révisé le 4 octobre 2026 : définition de la dérive alignée sur les trois familles du site (données, concept, pipeline), avec renvoi au module 3 des labs.