Business
4. FinOps de l'observabilité
Pour : architectes · finance, risque et conformité · direction et DSIPrérequis : Notions de base sur les métriques, les logs et les traces.
L’observabilité a longtemps été vendue comme une assurance. Avec la facturation au volume ingéré, elle peut devenir un poste qui double sans que personne l’ait décidé. Cette leçon donne au DSI le cadre pour reprendre la main : comprendre la facture, activer les leviers, installer une gouvernance.
Pourquoi la facture dérive
Section intitulée « Pourquoi la facture dérive »Un modèle qui récompense la verbosité. Les plateformes facturent selon une combinaison d’unités : hôtes ou conteneurs, volume ingéré (logs, traces, métriques personnalisées), volume indexé, utilisateurs, modules. Quand l’unité est le volume, chaque décision d’ingénierie a un coût : un niveau de log passé en débogage, un traçage complet laissé actif, une étiquette ajoutée. Une application qui émet beaucoup d’erreurs émet aussi beaucoup de logs : la dette technique se paie deux fois.
La cardinalité. Une métrique décrite par la route, le code de retour et la méthode reste raisonnable. Ajoutez un identifiant d’utilisateur ou de session et le nombre de séries change d’ordre de grandeur. Le simulateur de cardinalité le montre en direct.
L’absence de boucle de rétroaction. Ceux qui instrumentent ne voient pas la facture et ceux qui la paient ne voient pas les décisions qui la font. Sans ce lien, la dérive est la pente naturelle.
Ces mécanismes valent pour toutes les solutions. En autogéré, la dérive ne se lit pas sur une facture mais dans le stockage, le calcul et le temps d’équipe : elle est seulement moins visible.
Lire une facture ligne par ligne
Section intitulée « Lire une facture ligne par ligne »Une facture d’observabilité se décompose généralement en sept à dix lignes. Leur poids relatif varie selon l’éditeur et votre usage, d’où l’intérêt de le mesurer chez vous.
| Ligne | Unité courante | Ce qui la fait dériver |
|---|---|---|
| Hôtes, conteneurs | forfait par unité supervisée | autoscaling, environnements de test laissés allumés |
| Ingestion des logs | volume ingéré | niveau de débogage, logs dupliqués, environnements hors production |
| Indexation et rétention des logs | volume indexé, durée | tout indexer au lieu d’archiver |
| Métriques personnalisées | séries actives | cardinalité |
| Traces | spans ingérés ou indexés | traçage complet, rétention longue |
| Modules optionnels | par unité ou par test | modules activés pour un essai et jamais revus |
| Utilisateurs | par siège | faible en valeur, utile en négociation |
| Sécurité, SIEM, automatisations | variable | lignes récentes, à partager avec le budget du RSSI |
Le premier exercice est simple et rarement fait : demander la facture détaillée par ligne, par équipe et par environnement sur douze mois glissants. Sans cette vision, aucune discussion sérieuse n’est possible.
Les leviers techniques
Section intitulée « Les leviers techniques »L’échantillonnage des traces. L’échantillonnage en tête décide au début de la trace : simple, mais il perd les traces rares, celles en erreur ou lentes. L’échantillonnage en queue décide à la fin : il garde toutes les erreurs, toutes les traces au-delà d’un seuil de latence et une fraction du trafic nominal. Il demande un étage de collecte intermédiaire, typiquement un Collector OpenTelemetry. Le simulateur d’échantillonnage compare les deux à volume égal.
Les niveaux de rétention des logs. Un journal d’authentification et un log de débogage n’ont ni la même valeur ni la même durée de vie. Un schéma à trois niveaux fonctionne bien : chaud (indexé, recherche immédiate, quelques jours à quelques semaines), tiède (archivé compressé, récupérable sous un jour), froid (stockage objet peu coûteux, pour la conformité). Les durées de chaque catégorie suivent la grille de la leçon 2.
La maîtrise de la cardinalité. Pas d’identifiant unique comme dimension de métrique : ces informations appartiennent aux traces. Un plafond de séries par service, affiché et un contrôle automatique qui refuse une métrique au-delà du seuil.
L’agrégation en amont. Agréger à la source, ou au Collector, plutôt que chez le fournisseur : une métrique par seconde au lieu d’un point par requête, sans perte pour les tableaux de bord classiques.
L’intention de mesure. Quelques dizaines de métriques métier bien choisies valent mieux que des milliers de métriques émises par défaut par un framework. Chaque métrique devrait répondre à trois questions : que veut-on mesurer, pour quelle décision, pour qui ? Une métrique sans destinataire est une dépense pure.
Le simulateur de coût au Collector chiffre ces leviers sur votre volume.
Les leviers contractuels
Section intitulée « Les leviers contractuels »L’engagement. Les éditeurs consentent des remises contre un engagement pluriannuel ou un volume engagé. Le piège : s’engager sur une trajectoire surestimée. La prudence consiste à s’engager en deçà de l’usage observé sur les douze derniers mois et à négocier de la souplesse, à la hausse comme à la baisse.
Les clauses à demander systématiquement :
- un plafond de facturation, avec notification et possibilité de suspendre l’ingestion plutôt que de payer un pic anormal ;
- un préavis long avant toute hausse tarifaire ;
- l’audit de son usage par API, sans restriction ;
- la réversibilité documentée, avec export dans un format ouvert ;
- le maintien des prix unitaires en cas de changement d’offre ou de rachat de l’éditeur ;
- l’interdiction d’entraîner des modèles sur vos données sans accord explicite.
Garder une capacité de négociation. Une instrumentation OpenTelemetry qui envoie vers un ou plusieurs backends interchangeables est la façon la plus simple de rester libre. Elle permet aussi de séparer les usages : un backend pour l’exploitation courante, un stockage froid pour la conformité.
Le comparatif de marché. Arriver en renouvellement avec deux ou trois offres comparables, sur le même périmètre et le même cahier des charges, change la posture de l’éditeur en place. L’exercice demande quelques semaines.
La gouvernance FinOps
Section intitulée « La gouvernance FinOps »La FinOps Foundation décrit trois niveaux de maturité, Crawl, Walk et Run, évalués capacité par capacité. Elle précise que viser Run partout n’est pas un but en soi (modèle de maturité FinOps). La correspondance ci-dessous est ma lecture de ce modèle appliquée à l’observabilité, pas une définition de la Foundation :
- Crawl, la visibilité : savoir ce qu’on dépense, par équipe, application et environnement. Prérequis : des étiquettes imposées à l’ingestion (équipe, application, environnement, criticité).
- Walk, la responsabilisation : chaque équipe voit son coût mensuel (showback) et en répond lors d’une revue.
- Run, l’optimisation continue : refacturation interne (chargeback), budgets par équipe, arbitrages comme pour le cloud.
Qui le fait. Trois modèles coexistent : centralisé dans l’équipe plateforme (lisible, mais goulet d’étranglement), fédéré avec un référent par équipe et une cellule centrale, ou délégué à l’éditeur. Le dernier est confortable, mais l’éditeur n’a pas intérêt à réduire durablement sa facture : il ne peut pas être le mode principal.
Les rituels. Une revue mensuelle des dérives (trente minutes, les plus fortes hausses du mois, leurs causes, les décisions). Un comité trimestriel (prévisions d’usage, engagements). Et après toute surprise de facturation, un post-mortem sans blâme avec l’équipe concernée.
Quatre indicateurs.
| Indicateur | Ce qu’il dit | Tendance attendue |
|---|---|---|
| Coût par transaction métier | le coût de l’observabilité rapporté à l’activité | stable ou décroissant |
| Part engagée de la facture | ce qui est couvert par des engagements négociés | à fixer selon votre prévisibilité |
| Coût par équipe ou par service | qui consomme quoi | comparé d’un mois sur l’autre |
| Ratio observabilité sur infrastructure | la dépense d’observabilité rapportée à la dépense d’infrastructure | suivi dans le temps, comparé entre entités |
Quatre pièges
Section intitulée « Quatre pièges »- L’effet de cliquet : un palier d’usage atteint lors d’un pic reste facturé quand l’usage redescend. Négociez la baisse dès le contrat initial, pas seulement la hausse.
- Les environnements hors production : développement, test et préproduction sont souvent instrumentés comme la production et laissés allumés la nuit. Mesurez leur part ; elle surprend souvent.
- Les tableaux de bord abandonnés : ils consomment des requêtes, donc du budget. Une revue annuelle de suppression est un levier facile.
- La dérive du traçage : un traçage complet activé pour un incident et jamais redescendu, comme dans le journal ci-dessus.
Exercices
Section intitulée « Exercices »- Audit express de facture (deux heures) : tracez sur douze mois la courbe de chaque ligne, identifiez les trois qui ont le plus augmenté et, pour chacune, trouvez la décision qui l’explique. Si vous ne la trouvez pas, la visibilité est votre premier chantier.
- Comparatif rapide (quelques semaines) : demandez une offre à trois alternatives sur un périmètre identique au vôtre et comparez à votre facture.
- Gouvernance (un trimestre) : écrivez un RACI FinOps d’une page (qui optimise, qui répond du budget, qui est consulté, qui est informé), diffusez-le, lancez la revue mensuelle.
Liste de contrôle
- Coûts ventilés par équipe, application et environnement
- Étiquettes normées obligatoires à l’ingestion
- Traces en échantillonnage en queue plutôt qu’à 100 %
- Logs classés en niveaux chaud, tiède, froid, avec des durées justifiées
- Clauses de plafond, de réversibilité et de non-entraînement au contrat
- Au moins deux offres comparables connues avant le prochain renouvellement
- Revue mensuelle des dérives avec les équipes
- Coût par transaction métier suivi
Pour aller plus loin
Section intitulée « Pour aller plus loin »- Le simulateur de coût au Collector, pour chiffrer chaque levier sur votre volume.
- Le plan business.