L'observabilité, du signal à la décision
- POST /api/ask
- invoke_agent support-assistant
- embeddings mistral-embed
- query kb_support_frtop_k=1, config modifiée
- chat grand-modele-v1
- execute_tool get_order_status
- chat grand-modele-v1
- evaluate faithfulness0,34 < 0,7
MTTL veut dire Mean Time To Learn, le temps moyen pour comprendre. Le nom fait écho au MTTR (mean time to recovery), le temps moyen de rétablissement après un incident : on ne rétablit vite que ce qu’on a d’abord compris. Ce site sert à raccourcir ce temps d’apprentissage, pour les équipes techniques comme pour la finance, les métiers et la direction (pourquoi ce site).
Reprendre là où vous en étiez
Toutes mes formationsPar où commencer
Section intitulée « Par où commencer »Si vous ne savez pas où vous en êtes, l’auto-diagnostic prend dix minutes et propose un plan d’action. Sinon, partez de votre rôle :
- Ingénieur, SRE, développeurLes fondamentaux des signaux, puis OpenTelemetry et les labs.Le parcours →
- ArchitectePipelines de télémétrie, coût, choix de pile.Le parcours →
- Manager d’équipeAstreinte, SLO, adoption par les équipes.Le parcours →
- Responsable métier ou produitLes questions à poser et les indicateurs à demander.Le parcours →
- Finance, risque, conformitéCoût unitaire et preuve par la télémétrie.Le parcours →
- Direction, DSI, achatsBusiness case, souveraineté, réversibilité.Le parcours →
L’observabilité en une minute et demie
Section intitulée « L’observabilité en une minute et demie »Lire le texte de la vidéo
L’observabilité. Comprendre un système à partir de ce qu’il laisse voir.
Une très vieille idée.
- Antiquité : En Égypte, les nilomètres mesurent la crue du Nil pour anticiper la récolte et fixer l’impôt.
- 1788 : Le régulateur à boules de Watt ajuste seul la vitesse de la machine à vapeur.
- 1868 : Maxwell met en équations le fonctionnement de ces régulateurs.
- 1960 : Rudolf Kálmán définit l’observabilité : déduire l’état interne d’un système de ses sorties.
- 1988 : SNMP : on interroge les équipements du réseau.
- 1999 : NetSaint, futur Nagios : le monitoring par sondes et seuils.
- 2010 : Google décrit Dapper : suivre une requête à travers des services distribués.
- 2012 : Prometheus naît chez SoundCloud : des métriques étiquetées, interrogées à la volée.
- 2019 : OpenTelemetry : un standard ouvert pour collecter la télémétrie.
- Aujourd’hui : Observer aussi les systèmes d’IA, qui peuvent répondre vite et faux.
Du monitoring à l’observabilité. Monitoring : Est-ce que ça marche ? Des métriques et des seuils fixés d’avance. Observabilité : Pourquoi ça se comporte ainsi ? Des questions qu’on n’avait pas prévues. Les signaux : Métriques, Logs, Traces, Profils, Événements.
Les objectifs : Détecter, Comprendre, Décider, Apprendre. Réduire le temps entre l’incident et la leçon : Mean Time To Learn.
Les enjeux :
- Business : Le coût des pannes et celui de la télémétrie.
- Organisation : Les preuves exigées par NIS2, DORA, l’AI Act.
- Humain : Des équipes et des astreintes soutenables.
- Métiers : La confiance des clients et des utilisateurs.
Les couches de l’observabilité :
- Terrain : OT industrielle, automates, capteurs, IoT
- Réseau : liens, protocoles, latence
- Infrastructure : serveurs, stockage, GPU
- Plateforme : conteneurs, cloud, calcul haute performance
- Applications : services, API, expérience utilisateur
- Données : pipelines, qualité, fraîcheur
- IA et modèles : LLM, agents, évaluation
Sécurité, Coût et valeur métier : à travers toutes les couches.
MTTL, Mean Time To Learn : L’observabilité, du signal à la décision. www.meantimetolearn.com : Lancement le 7 octobre 2026.
Musique : « In the Aftermath », Michael Rothery (Epidemic Sound).
Pour aller plus loin, le schéma interactif des couches détaille chaque couche, du terrain industriel aux modèles d’IA : ce qu’on y observe, les signaux, les indicateurs et les outils.
Pourquoi ce site existe et comment il est écrit : la page À propos et le manifeste.
Quatre plans de lecture
Section intitulée « Quatre plans de lecture »Signaux, OpenTelemetry, pipelines de collecte, backends, SLO, observabilité de l’IA, intégrité des journaux.
BusinessPourquoi et à quel prix ?Coût de la télémétrie, modèles de tarification, business case, souveraineté, réversibilité des contrats.
HumainQui le fait vivre ?Astreinte, fatigue d’alerte, post-mortems, compétences, adoption par les équipes.
OrganisationComment le faire durer ?Modèles d’équipe, gouvernance et contrats de données, maturité, conformité (DORA, NIS2, AI Act).
Des passerelles, pas des silos
Section intitulée « Des passerelles, pas des silos »Un même signal n’a pas la même valeur selon qui le lit. La latence du paiement intéresse l’astreinte ; le directeur commercial, lui, veut savoir combien de paniers ont été abandonnés à cette étape.
| Le signal technique | Ce qu’il devient pour les autres |
|---|---|
| latence du service de paiement | métier : paniers abandonnés à l’étape paiement |
| jetons consommés par une fonctionnalité d’IA | finance : coût par conversation client |
| traces et journaux conservés | conformité : preuve opposable lors d’un audit |
| alertes de nuit par personne | management : soutenabilité de l’équipe |
La démarche complète est sur la page Passerelles et chaque article se termine par un encadré qui dit ce qu’il change au-delà de l’équipe technique.
Récemment publié
Section intitulée « Récemment publié »- Ce qu'un responsable métier ou produit peut demander à l'observabilitéBusiness
- Schéma en 3D : l'IA en coupeTechnique
- Le tableau de bord de directionOrganisation
- Schéma explorable : un cluster HPC IATechnique
- Modèles d'équipe pour l'observabilitéOrganisation
- Gouverner la télémétrieOrganisation
Pour suivre les nouvelles publications : le flux RSS.
Manipuler plutôt que lire
Section intitulée « Manipuler plutôt que lire »Les labs déjà publiés sont en accès libre sur la forge Labs & Trainings, le dépôt de code public où je publie le code des labs et des supports de formation ; la page Labs dit lesquels existent et lesquels sont en préparation. Mes vidéos, sur des projets voisins de MTTL, sont sur la chaîne YouTube ; les démonstrations des labs sont prévues (voir Vidéos).