Technique
Comprendre l'observabilité de l'IA générative
Pour : ingénieurs et SRE · architectesPrérequis : Bonne connaissance de l'observabilité classique (journaux, métriques, traces) et bases des applications LLM.
Périmètre : ce guide traite de l’observabilité de l’IA générative, c’est-à-dire des LLM, des chaînes RAG, des agents et des outils MCP ; le ML classique et la vision n’en font pas partie, voir Au-delà du LLM : GPU et qualité des modèles.
Public : équipes SRE, plateforme et ingénierie ML qui exploitent, ou s’apprêtent à exploiter, des fonctionnalités d’IA en production. Prérequis : une bonne connaissance de l’observabilité classique (journaux, métriques, traces) et des bases des applications LLM. Objectif : savoir quoi mesurer, dans quel ordre, avec quels outils et comment exploiter la plateforme dans la durée.
Un système d’IA peut être disponible, rapide et faux. Le guide part de là et descend dans le détail : les signaux à capturer, des niveaux de maturité pour découper l’effort, une plateforme construite en sept étapes, des évaluateurs auxquels on peut se fier. Il traite aussi l’exploitation au quotidien, avec deux contraintes qui reviennent partout, le budget et les données personnelles.
Le guide résumé en quinze points
Section intitulée « Le guide résumé en quinze points »- Disponible, rapide et faux. L’observabilité classique couvre la santé du système (l’axe horizontal). L’observabilité de l’IA ajoute la qualité des sorties (l’axe vertical) : la réponse est-elle correcte, fidèle et sûre ?
- Cinq propriétés invalident les hypothèses classiques : le non-déterminisme, des charges utiles en langage naturel, une qualité qui ne se constate qu’à l’exécution, la dérive et un coût variable par requête (une seule boucle d’agent peut consommer le coût de milliers de requêtes).
- Cinq signaux, une seule clé. Journaux, métriques et traces, plus les évaluations et les retours utilisateurs. L’identifiant de trace relie chaque span, chaque score et chaque retour en un seul objet interrogeable.
- Chaque couche de la pile d’IA émet ses propres signaux, de l’application au modèle, en passant par la recherche documentaire et les outils. Tous se corrèlent par identifiant de trace.
- Quatre types de systèmes qui se recouvrent : LLM seul, RAG, agents, outils MCP. Les applications réelles les combinent, donc la plateforme doit gérer les quatre.
- Un arbre de trace raconte l’histoire d’une requête. Les évaluations vivent dans la même trace que la requête qu’elles notent ; les retours utilisateurs s’y rattachent plus tard, indexés par identifiant de trace.
- Une échelle de maturité à six niveaux. Situez-vous honnêtement : sans stratégie d’observabilité explicite, une fonctionnalité d’IA reste au niveau 0. À mon avis, le niveau 3 (évaluation en ligne) est un objectif réaliste à six mois.
- Sept étapes ordonnées : définir les questions, instrumenter, collecter, stocker, évaluer, visualiser et alerter, fermer la boucle. On instrumente pour répondre à des questions déjà posées ; instrumenter d’abord en espérant que les questions viendront ensuite ne marche pas.
- L’OpenTelemetry Collector est le point d’intégration. Il caviarde, enrichit, échantillonne en queue, regroupe et exporte. L’ordre compte : le caviardage passe avant le regroupement.
- Une architecture de référence auto-hébergeable, dont chaque couche est remplaçable indépendamment, avec ses alternatives : OpenInference, Collector, VictoriaMetrics, Phoenix, Tempo, VictoriaLogs, Ragas, Grafana, à comparer couche par couche avec Prometheus, Mimir, Langfuse, Loki ou des services gérés.
- Trois types d’évaluateurs, de coûts très différents. Règles, classifieurs, LLM juge. Par exemple : vérifications peu coûteuses sur 100 % des traces, petits juges sur 10 %, grands juges sur 1 % plus les traces signalées. Évaluez toujours chaque erreur et chaque retour négatif.
- Évaluation en ligne et hors ligne sont toutes deux nécessaires. La première détecte la dérive en production ; la seconde sert de garde-fou avant chaque mise à niveau.
- Exploiter la plateforme : échantillonnage en queue par défaut, dimensions de métriques bornées, forte cardinalité réservée aux traces, caviardage dans le collecteur, RBAC et journal d’audit sur les requêtes de traces, liste blanche des flux sortants vers les juges.
- Versionner, rejouer, expérimenter. Versionnez chaque artefact qui influence la sortie, rejouez d’anciennes traces sur les nouvelles versions, utilisez le mode fantôme, les tests A/B et les canaris et bloquez la construction dès qu’un score régresse.
- Éviter les anti-modèles et fermer la boucle. Sans revue hebdomadaire qui transforme les traces en échec en tests de non-régression, la plateforme n’est qu’une archive coûteuse en lecture seule. Partez de votre niveau actuel (voir l’annexe).
Sommaire
Section intitulée « Sommaire »- Fondations : les deux axes, les cinq signaux, le vocabulaire.
- Périmètre et typologie des systèmes d’IA : LLM seul, RAG, agents, MCP et la forme de leurs traces.
- La feuille de route de maturité : du niveau 0 (exploitation à l’aveugle) au niveau 5 (boucle fermée).
- La mise en œuvre en sept étapes : des questions à la boucle fermée, avec les attributs OpenTelemetry GenAI.
- Conception des évaluateurs : catalogue, modèles de prompts pour LLM juge, calibration, agrégation, échantillonnage.
- Le paysage des outils : auto-hébergement ou service géré, licences, piles de référence.
- Exploiter la plateforme : échantillonnage, coûts, cardinalité, données personnelles, sécurité, responsabilités.
- Versionnage, rejeu et expérimentation : itérer sans risque à grande échelle.
- Anti-modèles et pièges courants : douze pièges et leurs remèdes.
- Annexe : glossaire, références, prochaines étapes par niveau.
Les sujets dont ce guide est la référence
Section intitulée « Les sujets dont ce guide est la référence »Sur le site, plusieurs contenus parlent d’observabilité de l’IA générative. Pour éviter les versions divergentes, chaque sujet a une seule maison ; les autres contenus le résument en une phrase et renvoient ici.
| Sujet | Leçon de référence |
|---|---|
| Les cinq signaux (journaux, métriques, traces, évaluations, retours utilisateurs) | 1. Fondations |
| Les quatre types de systèmes (LLM seul, RAG, agents, MCP) | 2. Périmètre et typologie |
| Les niveaux de maturité 0 à 5 | 3. Feuille de route de maturité |
| Conception des évaluateurs, LLM juge, échantillonnage du juge, évaluation en ligne et hors ligne | 5. Conception des évaluateurs (et chapitre 8 pour le rejeu et le blocage en intégration continue) |
| Paysage des outils et licences des briques | 6. Le paysage des outils |
| Coût de l’observabilité | 7. Exploiter la plateforme, section 7.2 |
| Anti-modèles | 9. Anti-modèles et pièges courants |
Les autres sujets ont leur maison ailleurs et le guide y renvoie : la taxonomie des dérives (données, concept, pipeline) dans le module 3 des labs ; les conventions OpenTelemetry GenAI (versions, historique des renommages, capture du contenu, MCP) dans l’article de mise en production ; les SLO de qualité, le coût de la non-observabilité, l’AI Act et le RACI dans la méthode GenAI.
Et ensuite
Section intitulée « Et ensuite »- Pratiquer : Observabilité des LLM : les labs met en œuvre les chapitres 4 et 5 sur une pile autohébergée (instrumentation, RAG, dérives, coût).
- Mettre en production : l’article Observer un système LLM donne les conventions OpenTelemetry GenAI à jour et les playbooks de déploiement (Collector, échantillonnage, RAG, MCP, confidentialité), puis VictoriaMetrics pour l’observabilité des LLM.
- Maîtriser : la méthode GenAI traite les SLO de qualité, l’impact chiffré, la conformité et l’organisation.
- Aller au-delà : Au-delà du LLM : GPU et qualité des modèles pour l’infrastructure GPU, le ML classique et la dérive statistique.
Révisé le 4 octobre 2026 : titre « Comprendre l’observabilité de l’IA générative », périmètre explicite (LLM, RAG, agents, MCP), encart de progression, table des sujets dont le guide est la référence et liens vers les labs, l’article de mise en production et la méthode.