Aller au contenu

L'observabilité, du signal à la décision

Un site ouvert, en français et en anglais, pour que les équipes techniques, la finance, les métiers et la direction parlent enfin de la même chose quand elles parlent de production.
trace 7d3c…5f60200 OK2,78 s
  1. POST /api/ask
  2. invoke_agent support-assistant
  3. embeddings mistral-embed
  4. query kb_support_frtop_k=1, config modifiée
  5. chat grand-modele-v1
  6. execute_tool get_order_status
  7. chat grand-modele-v1
  8. evaluate faithfulness0,34 < 0,7
200 OK en 2,8 s. Et une réponse fausse.

MTTL veut dire Mean Time To Learn, le temps moyen pour comprendre. Le nom fait écho au MTTR (mean time to recovery), le temps moyen de rétablissement après un incident : on ne rétablit vite que ce qu’on a d’abord compris. Ce site sert à raccourcir ce temps d’apprentissage, pour les équipes techniques comme pour la finance, les métiers et la direction (pourquoi ce site).

Si vous ne savez pas où vous en êtes, l’auto-diagnostic prend dix minutes et propose un plan d’action. Sinon, partez de votre rôle :

Lire le texte de la vidéo

L’observabilité. Comprendre un système à partir de ce qu’il laisse voir.

Une très vieille idée.

  • Antiquité : En Égypte, les nilomètres mesurent la crue du Nil pour anticiper la récolte et fixer l’impôt.
  • 1788 : Le régulateur à boules de Watt ajuste seul la vitesse de la machine à vapeur.
  • 1868 : Maxwell met en équations le fonctionnement de ces régulateurs.
  • 1960 : Rudolf Kálmán définit l’observabilité : déduire l’état interne d’un système de ses sorties.
  • 1988 : SNMP : on interroge les équipements du réseau.
  • 1999 : NetSaint, futur Nagios : le monitoring par sondes et seuils.
  • 2010 : Google décrit Dapper : suivre une requête à travers des services distribués.
  • 2012 : Prometheus naît chez SoundCloud : des métriques étiquetées, interrogées à la volée.
  • 2019 : OpenTelemetry : un standard ouvert pour collecter la télémétrie.
  • Aujourd’hui : Observer aussi les systèmes d’IA, qui peuvent répondre vite et faux.

Du monitoring à l’observabilité. Monitoring : Est-ce que ça marche ? Des métriques et des seuils fixés d’avance. Observabilité : Pourquoi ça se comporte ainsi ? Des questions qu’on n’avait pas prévues. Les signaux : Métriques, Logs, Traces, Profils, Événements.

Les objectifs : Détecter, Comprendre, Décider, Apprendre. Réduire le temps entre l’incident et la leçon : Mean Time To Learn.

Les enjeux :

  • Business : Le coût des pannes et celui de la télémétrie.
  • Organisation : Les preuves exigées par NIS2, DORA, l’AI Act.
  • Humain : Des équipes et des astreintes soutenables.
  • Métiers : La confiance des clients et des utilisateurs.

Les couches de l’observabilité :

  1. Terrain : OT industrielle, automates, capteurs, IoT
  2. Réseau : liens, protocoles, latence
  3. Infrastructure : serveurs, stockage, GPU
  4. Plateforme : conteneurs, cloud, calcul haute performance
  5. Applications : services, API, expérience utilisateur
  6. Données : pipelines, qualité, fraîcheur
  7. IA et modèles : LLM, agents, évaluation

Sécurité, Coût et valeur métier : à travers toutes les couches.

MTTL, Mean Time To Learn : L’observabilité, du signal à la décision. www.meantimetolearn.com : Lancement le 7 octobre 2026.

Musique : « In the Aftermath », Michael Rothery (Epidemic Sound).

Pour aller plus loin, le schéma interactif des couches détaille chaque couche, du terrain industriel aux modèles d’IA : ce qu’on y observe, les signaux, les indicateurs et les outils.

Pourquoi ce site existe et comment il est écrit : la page À propos et le manifeste.

Un même signal n’a pas la même valeur selon qui le lit. La latence du paiement intéresse l’astreinte ; le directeur commercial, lui, veut savoir combien de paniers ont été abandonnés à cette étape.

Le signal techniqueCe qu’il devient pour les autres
latence du service de paiementmétier : paniers abandonnés à l’étape paiement
jetons consommés par une fonctionnalité d’IAfinance : coût par conversation client
traces et journaux conservésconformité : preuve opposable lors d’un audit
alertes de nuit par personnemanagement : soutenabilité de l’équipe

La démarche complète est sur la page Passerelles et chaque article se termine par un encadré qui dit ce qu’il change au-delà de l’équipe technique.

  1. Ce qu'un responsable métier ou produit peut demander à l'observabilitéBusiness
  2. Schéma en 3D : l'IA en coupeTechnique
  3. Le tableau de bord de directionOrganisation
  4. Schéma explorable : un cluster HPC IATechnique
  5. Modèles d'équipe pour l'observabilitéOrganisation
  6. Gouverner la télémétrieOrganisation

Pour suivre les nouvelles publications : le flux RSS.

Les labs déjà publiés sont en accès libre sur la forge Labs & Trainings, le dépôt de code public où je publie le code des labs et des supports de formation ; la page Labs dit lesquels existent et lesquels sont en préparation. Mes vidéos, sur des projets voisins de MTTL, sont sur la chaîne YouTube ; les démonstrations des labs sont prévues (voir Vidéos).