Aller au contenu

TechniquePratique

1. Fondations

Pour : ingénieurs et SRE · architectes · métiers et produitPrérequis : Avoir une idée de ce que sont les journaux, les métriques et les traces.

L’observabilité de l’IA est la discipline qui consiste à mesurer, enregistrer et interpréter le comportement des systèmes d’IA en production. Elle étend l’observabilité classique avec des signaux propres aux systèmes non déterministes et à contenu sémantique : prompts, complétions (completions), plongements (embeddings), contextes de recherche, appels d’outils et évaluations de qualité.

La question centrale n’est plus de savoir si le système est disponible et répond dans les budgets de latence. Le système peut être disponible, rapide et faux. L’observabilité de l’IA ajoute un second axe : la sortie est-elle correcte, fidèle et sûre ?

Deux axes : la santé du système en abscisse, la qualité des sorties en ordonnée, avec quatre quadrants

Figure 1. Les deux axes de l’observabilité de l’IA. L’observabilité classique couvre l’axe horizontal. L’observabilité de l’IA ajoute l’axe vertical.

Si votre supervision sait vous dire que le système est disponible, mais pas que les réponses sont justes, vous opérez dans le quadrant inférieur droit. C’est précisément le mode de défaillance que l’observabilité de l’IA doit empêcher.

1.2 Pourquoi l’observabilité classique ne suffit pas

Section intitulée « 1.2 Pourquoi l’observabilité classique ne suffit pas »

Cinq propriétés structurelles des systèmes d’IA invalident les hypothèses sur lesquelles repose l’observabilité classique.

  • Non-déterminisme : des entrées identiques produisent des sorties différentes d’une exécution à l’autre. La reproductibilité ne peut pas être supposée.
  • Charges utiles sémantiques : requêtes et réponses sont en langage naturel, pas des données structurées aux schémas stables. La forme de la charge utile, c’est la réponse elle-même.
  • La qualité est une propriété d’exécution : aucune garantie de justesse n’existe à la compilation. Un système qui a rendu 100 réponses parfaites peut produire une hallucination à la 101e sans le moindre changement de code.
  • Dérive (drift) : les fournisseurs mettent à jour les poids de leurs modèles, les plongements se déplacent quand les documents changent, les distributions de données évoluent avec le comportement des utilisateurs. Le même code peut produire des sorties différentes d’une semaine à l’autre.
  • Coût variable par requête : le nombre de jetons (tokens) dépend de la longueur des entrées et des sorties, sans borne supérieure prévisible. Une seule boucle d’agent peut consommer le coût de milliers de requêtes normales.

Une réponse 200 OK d’un point d’accès LLM ne dit rien sur la justesse de la réponse, ni sur une éventuelle hallucination, une fuite de données personnelles ou un biais. L’observabilité classique ne sait pas répondre aux questions qui comptent pour une fonctionnalité d’IA en production.

1.3 Les cinq signaux de l’observabilité de l’IA

Section intitulée « 1.3 Les cinq signaux de l’observabilité de l’IA »

L’observabilité traditionnelle compte trois signaux : journaux, métriques, traces. L’observabilité de l’IA en ajoute deux : les évaluations et les retours utilisateurs (feedback). Ces deux signaux ferment la boucle entre ce que le système a fait et ce que cela a réellement apporté.

Les cinq signaux : journaux, métriques et traces issus de l'observabilité classique, évaluations et retours utilisateurs propres à l'IA

Figure 2. Les cinq signaux. L’observabilité classique fournit les trois premiers. Les évaluations et les retours utilisateurs sont les apports propres à l’IA et constituent la capacité distinctive de la discipline.

Les cinq signaux sont corrélés par un identifiant unique, l’identifiant de trace (trace ID). Chaque span, chaque score, chaque retour utilisateur appartient à une trace. C’est ce qui rend la plateforme interrogeable de bout en bout. Sans l’identifiant de trace comme clé commune, les signaux dégénèrent en silos déconnectés.

Quelques termes reviennent tout au long de ce guide et dans l’ensemble de l’outillage. Leurs définitions ne varient pas d’un éditeur à l’autre : employez-les avec précision.

  • Trace : le chemin d’exécution complet d’une requête, composé de spans reliés par leurs identifiants parents.
  • Span : une opération unique et chronométrée, par exemple un appel LLM, une recherche, une invocation d’outil.
  • Attribut : une paire clé-valeur attachée à un span, utilisée pour filtrer et agréger.
  • Évaluation en ligne : notation exécutée sur les traces de production en direct, généralement de façon asynchrone.
  • Évaluation hors ligne : notation exécutée sur un jeu de données figé, typiquement en intégration continue ou en lot planifié.
  • LLM juge (LLM-as-judge) : méthode d’évaluation dans laquelle un modèle note la sortie d’un autre modèle selon une grille.
  • Dérive : un changement dans le temps des entrées, de la réalité que le système décrit ou du pipeline lui-même, qui peut dégrader les sorties. Trois familles : données, concept, pipeline (voir le glossaire).
  • Ancrage (grounding) : propriété d’une réponse appuyée sur une source vérifiable plutôt que sur les connaissances paramétriques du modèle.
  • Hallucination : sortie qui affirme des faits non étayés par les données d’entraînement, le contexte fourni ou toute source vérifiable.
  • Fidélité (faithfulness) : propriété d’une réponse ancrée dans le contexte fourni, notée comme une qualité continue.
  • Jeu de référence (gold set) : jeu de données organisé d’entrées dont la sortie idéale est connue, utilisé pour l’évaluation hors ligne.
  • Jeu de non-régression (regression set) : jeu de données d’entrées qui ont échoué par le passé, utilisé pour conditionner les changements futurs.

1.5 Ce que l’observabilité de l’IA n’est pas

Section intitulée « 1.5 Ce que l’observabilité de l’IA n’est pas »

Trois confusions fréquentes à lever dès le départ.

  • L’observabilité de l’IA n’est pas du MLOps. Le MLOps couvre l’entraînement, le conditionnement et le déploiement des modèles. L’observabilité de l’IA couvre ce qui se passe après le déploiement.
  • L’observabilité de l’IA n’est pas une simple journalisation coûteuse. Capturer les prompts dans des journaux est le point de départ, pas l’état final. Sans évaluation, détection de dérive et corrélation des retours utilisateurs, les données s’accumulent et rien ne s’améliore.
  • L’observabilité de l’IA n’est pas un produit unique. C’est une pile assemblée à partir de l’instrumentation, de la collecte, du stockage, de l’évaluation et de la visualisation. Aucun outil ne couvre correctement ces cinq fonctions pour les quatre types de systèmes.

Suite : 2. Périmètre et typologie des systèmes d’IA.

Révisé le 4 octobre 2026 : les cinq signaux présentés comme le modèle de référence du site, avec la correspondance des axes des labs, des événements de contenu de la méthode et des plans de l’article.