Aller au contenu

TechniquePratique

Comprendre l'observabilité de l'IA générative

Pour : ingénieurs et SRE · architectesPrérequis : Bonne connaissance de l'observabilité classique (journaux, métriques, traces) et bases des applications LLM.

Mode de lecture

Périmètre : ce guide traite de l’observabilité de l’IA générative, c’est-à-dire des LLM, des chaînes RAG, des agents et des outils MCP ; le ML classique et la vision n’en font pas partie, voir Au-delà du LLM : GPU et qualité des modèles.

Public : équipes SRE, plateforme et ingénierie ML qui exploitent, ou s’apprêtent à exploiter, des fonctionnalités d’IA en production. Prérequis : une bonne connaissance de l’observabilité classique (journaux, métriques, traces) et des bases des applications LLM. Objectif : savoir quoi mesurer, dans quel ordre, avec quels outils et comment exploiter la plateforme dans la durée.

Un système d’IA peut être disponible, rapide et faux. Le guide part de là et descend dans le détail : les signaux à capturer, des niveaux de maturité pour découper l’effort, une plateforme construite en sept étapes, des évaluateurs auxquels on peut se fier. Il traite aussi l’exploitation au quotidien, avec deux contraintes qui reviennent partout, le budget et les données personnelles.

  1. Disponible, rapide et faux. L’observabilité classique couvre la santé du système (l’axe horizontal). L’observabilité de l’IA ajoute la qualité des sorties (l’axe vertical) : la réponse est-elle correcte, fidèle et sûre ?
  2. Cinq propriétés invalident les hypothèses classiques : le non-déterminisme, des charges utiles en langage naturel, une qualité qui ne se constate qu’à l’exécution, la dérive et un coût variable par requête (une seule boucle d’agent peut consommer le coût de milliers de requêtes).
  3. Cinq signaux, une seule clé. Journaux, métriques et traces, plus les évaluations et les retours utilisateurs. L’identifiant de trace relie chaque span, chaque score et chaque retour en un seul objet interrogeable.
  4. Chaque couche de la pile d’IA émet ses propres signaux, de l’application au modèle, en passant par la recherche documentaire et les outils. Tous se corrèlent par identifiant de trace.
  5. Quatre types de systèmes qui se recouvrent : LLM seul, RAG, agents, outils MCP. Les applications réelles les combinent, donc la plateforme doit gérer les quatre.
  6. Un arbre de trace raconte l’histoire d’une requête. Les évaluations vivent dans la même trace que la requête qu’elles notent ; les retours utilisateurs s’y rattachent plus tard, indexés par identifiant de trace.
  7. Une échelle de maturité à six niveaux. Situez-vous honnêtement : sans stratégie d’observabilité explicite, une fonctionnalité d’IA reste au niveau 0. À mon avis, le niveau 3 (évaluation en ligne) est un objectif réaliste à six mois.
  8. Sept étapes ordonnées : définir les questions, instrumenter, collecter, stocker, évaluer, visualiser et alerter, fermer la boucle. On instrumente pour répondre à des questions déjà posées ; instrumenter d’abord en espérant que les questions viendront ensuite ne marche pas.
  9. L’OpenTelemetry Collector est le point d’intégration. Il caviarde, enrichit, échantillonne en queue, regroupe et exporte. L’ordre compte : le caviardage passe avant le regroupement.
  10. Une architecture de référence auto-hébergeable, dont chaque couche est remplaçable indépendamment, avec ses alternatives : OpenInference, Collector, VictoriaMetrics, Phoenix, Tempo, VictoriaLogs, Ragas, Grafana, à comparer couche par couche avec Prometheus, Mimir, Langfuse, Loki ou des services gérés.
  11. Trois types d’évaluateurs, de coûts très différents. Règles, classifieurs, LLM juge. Par exemple : vérifications peu coûteuses sur 100 % des traces, petits juges sur 10 %, grands juges sur 1 % plus les traces signalées. Évaluez toujours chaque erreur et chaque retour négatif.
  12. Évaluation en ligne et hors ligne sont toutes deux nécessaires. La première détecte la dérive en production ; la seconde sert de garde-fou avant chaque mise à niveau.
  13. Exploiter la plateforme : échantillonnage en queue par défaut, dimensions de métriques bornées, forte cardinalité réservée aux traces, caviardage dans le collecteur, RBAC et journal d’audit sur les requêtes de traces, liste blanche des flux sortants vers les juges.
  14. Versionner, rejouer, expérimenter. Versionnez chaque artefact qui influence la sortie, rejouez d’anciennes traces sur les nouvelles versions, utilisez le mode fantôme, les tests A/B et les canaris et bloquez la construction dès qu’un score régresse.
  15. Éviter les anti-modèles et fermer la boucle. Sans revue hebdomadaire qui transforme les traces en échec en tests de non-régression, la plateforme n’est qu’une archive coûteuse en lecture seule. Partez de votre niveau actuel (voir l’annexe).
  1. Fondations : les deux axes, les cinq signaux, le vocabulaire.
  2. Périmètre et typologie des systèmes d’IA : LLM seul, RAG, agents, MCP et la forme de leurs traces.
  3. La feuille de route de maturité : du niveau 0 (exploitation à l’aveugle) au niveau 5 (boucle fermée).
  4. La mise en œuvre en sept étapes : des questions à la boucle fermée, avec les attributs OpenTelemetry GenAI.
  5. Conception des évaluateurs : catalogue, modèles de prompts pour LLM juge, calibration, agrégation, échantillonnage.
  6. Le paysage des outils : auto-hébergement ou service géré, licences, piles de référence.
  7. Exploiter la plateforme : échantillonnage, coûts, cardinalité, données personnelles, sécurité, responsabilités.
  8. Versionnage, rejeu et expérimentation : itérer sans risque à grande échelle.
  9. Anti-modèles et pièges courants : douze pièges et leurs remèdes.
  10. Annexe : glossaire, références, prochaines étapes par niveau.

Sur le site, plusieurs contenus parlent d’observabilité de l’IA générative. Pour éviter les versions divergentes, chaque sujet a une seule maison ; les autres contenus le résument en une phrase et renvoient ici.

SujetLeçon de référence
Les cinq signaux (journaux, métriques, traces, évaluations, retours utilisateurs)1. Fondations
Les quatre types de systèmes (LLM seul, RAG, agents, MCP)2. Périmètre et typologie
Les niveaux de maturité 0 à 53. Feuille de route de maturité
Conception des évaluateurs, LLM juge, échantillonnage du juge, évaluation en ligne et hors ligne5. Conception des évaluateurs (et chapitre 8 pour le rejeu et le blocage en intégration continue)
Paysage des outils et licences des briques6. Le paysage des outils
Coût de l’observabilité7. Exploiter la plateforme, section 7.2
Anti-modèles9. Anti-modèles et pièges courants

Les autres sujets ont leur maison ailleurs et le guide y renvoie : la taxonomie des dérives (données, concept, pipeline) dans le module 3 des labs ; les conventions OpenTelemetry GenAI (versions, historique des renommages, capture du contenu, MCP) dans l’article de mise en production ; les SLO de qualité, le coût de la non-observabilité, l’AI Act et le RACI dans la méthode GenAI.

Révisé le 4 octobre 2026 : titre « Comprendre l’observabilité de l’IA générative », périmètre explicite (LLM, RAG, agents, MCP), encart de progression, table des sujets dont le guide est la référence et liens vers les labs, l’article de mise en production et la méthode.