Aller au contenu

BusinessPratique

4. FinOps de l'observabilité

Pour : architectes · finance, risque et conformité · direction et DSIPrérequis : Notions de base sur les métriques, les logs et les traces.

Mode de lecture

L’observabilité a longtemps été vendue comme une assurance. Avec la facturation au volume ingéré, elle peut devenir un poste qui double sans que personne l’ait décidé. Cette leçon donne au DSI le cadre pour reprendre la main : comprendre la facture, activer les leviers, installer une gouvernance.

Un modèle qui récompense la verbosité. Les plateformes facturent selon une combinaison d’unités : hôtes ou conteneurs, volume ingéré (logs, traces, métriques personnalisées), volume indexé, utilisateurs, modules. Quand l’unité est le volume, chaque décision d’ingénierie a un coût : un niveau de log passé en débogage, un traçage complet laissé actif, une étiquette ajoutée. Une application qui émet beaucoup d’erreurs émet aussi beaucoup de logs : la dette technique se paie deux fois.

La cardinalité. Une métrique décrite par la route, le code de retour et la méthode reste raisonnable. Ajoutez un identifiant d’utilisateur ou de session et le nombre de séries change d’ordre de grandeur. Le simulateur de cardinalité le montre en direct.

L’absence de boucle de rétroaction. Ceux qui instrumentent ne voient pas la facture et ceux qui la paient ne voient pas les décisions qui la font. Sans ce lien, la dérive est la pente naturelle.

Ces mécanismes valent pour toutes les solutions. En autogéré, la dérive ne se lit pas sur une facture mais dans le stockage, le calcul et le temps d’équipe : elle est seulement moins visible.

Une facture d’observabilité se décompose généralement en sept à dix lignes. Leur poids relatif varie selon l’éditeur et votre usage, d’où l’intérêt de le mesurer chez vous.

LigneUnité couranteCe qui la fait dériver
Hôtes, conteneursforfait par unité superviséeautoscaling, environnements de test laissés allumés
Ingestion des logsvolume ingéréniveau de débogage, logs dupliqués, environnements hors production
Indexation et rétention des logsvolume indexé, duréetout indexer au lieu d’archiver
Métriques personnaliséesséries activescardinalité
Tracesspans ingérés ou indexéstraçage complet, rétention longue
Modules optionnelspar unité ou par testmodules activés pour un essai et jamais revus
Utilisateurspar siègefaible en valeur, utile en négociation
Sécurité, SIEM, automatisationsvariablelignes récentes, à partager avec le budget du RSSI

Le premier exercice est simple et rarement fait : demander la facture détaillée par ligne, par équipe et par environnement sur douze mois glissants. Sans cette vision, aucune discussion sérieuse n’est possible.

L’échantillonnage des traces. L’échantillonnage en tête décide au début de la trace : simple, mais il perd les traces rares, celles en erreur ou lentes. L’échantillonnage en queue décide à la fin : il garde toutes les erreurs, toutes les traces au-delà d’un seuil de latence et une fraction du trafic nominal. Il demande un étage de collecte intermédiaire, typiquement un Collector OpenTelemetry. Le simulateur d’échantillonnage compare les deux à volume égal.

Les niveaux de rétention des logs. Un journal d’authentification et un log de débogage n’ont ni la même valeur ni la même durée de vie. Un schéma à trois niveaux fonctionne bien : chaud (indexé, recherche immédiate, quelques jours à quelques semaines), tiède (archivé compressé, récupérable sous un jour), froid (stockage objet peu coûteux, pour la conformité). Les durées de chaque catégorie suivent la grille de la leçon 2.

La maîtrise de la cardinalité. Pas d’identifiant unique comme dimension de métrique : ces informations appartiennent aux traces. Un plafond de séries par service, affiché et un contrôle automatique qui refuse une métrique au-delà du seuil.

L’agrégation en amont. Agréger à la source, ou au Collector, plutôt que chez le fournisseur : une métrique par seconde au lieu d’un point par requête, sans perte pour les tableaux de bord classiques.

L’intention de mesure. Quelques dizaines de métriques métier bien choisies valent mieux que des milliers de métriques émises par défaut par un framework. Chaque métrique devrait répondre à trois questions : que veut-on mesurer, pour quelle décision, pour qui ? Une métrique sans destinataire est une dépense pure.

Le simulateur de coût au Collector chiffre ces leviers sur votre volume.

L’engagement. Les éditeurs consentent des remises contre un engagement pluriannuel ou un volume engagé. Le piège : s’engager sur une trajectoire surestimée. La prudence consiste à s’engager en deçà de l’usage observé sur les douze derniers mois et à négocier de la souplesse, à la hausse comme à la baisse.

Les clauses à demander systématiquement :

  1. un plafond de facturation, avec notification et possibilité de suspendre l’ingestion plutôt que de payer un pic anormal ;
  2. un préavis long avant toute hausse tarifaire ;
  3. l’audit de son usage par API, sans restriction ;
  4. la réversibilité documentée, avec export dans un format ouvert ;
  5. le maintien des prix unitaires en cas de changement d’offre ou de rachat de l’éditeur ;
  6. l’interdiction d’entraîner des modèles sur vos données sans accord explicite.

Garder une capacité de négociation. Une instrumentation OpenTelemetry qui envoie vers un ou plusieurs backends interchangeables est la façon la plus simple de rester libre. Elle permet aussi de séparer les usages : un backend pour l’exploitation courante, un stockage froid pour la conformité.

Le comparatif de marché. Arriver en renouvellement avec deux ou trois offres comparables, sur le même périmètre et le même cahier des charges, change la posture de l’éditeur en place. L’exercice demande quelques semaines.

La FinOps Foundation décrit trois niveaux de maturité, Crawl, Walk et Run, évalués capacité par capacité. Elle précise que viser Run partout n’est pas un but en soi (modèle de maturité FinOps). La correspondance ci-dessous est ma lecture de ce modèle appliquée à l’observabilité, pas une définition de la Foundation :

  • Crawl, la visibilité : savoir ce qu’on dépense, par équipe, application et environnement. Prérequis : des étiquettes imposées à l’ingestion (équipe, application, environnement, criticité).
  • Walk, la responsabilisation : chaque équipe voit son coût mensuel (showback) et en répond lors d’une revue.
  • Run, l’optimisation continue : refacturation interne (chargeback), budgets par équipe, arbitrages comme pour le cloud.

Qui le fait. Trois modèles coexistent : centralisé dans l’équipe plateforme (lisible, mais goulet d’étranglement), fédéré avec un référent par équipe et une cellule centrale, ou délégué à l’éditeur. Le dernier est confortable, mais l’éditeur n’a pas intérêt à réduire durablement sa facture : il ne peut pas être le mode principal.

Les rituels. Une revue mensuelle des dérives (trente minutes, les plus fortes hausses du mois, leurs causes, les décisions). Un comité trimestriel (prévisions d’usage, engagements). Et après toute surprise de facturation, un post-mortem sans blâme avec l’équipe concernée.

Quatre indicateurs.

IndicateurCe qu’il ditTendance attendue
Coût par transaction métierle coût de l’observabilité rapporté à l’activitéstable ou décroissant
Part engagée de la facturece qui est couvert par des engagements négociésà fixer selon votre prévisibilité
Coût par équipe ou par servicequi consomme quoicomparé d’un mois sur l’autre
Ratio observabilité sur infrastructurela dépense d’observabilité rapportée à la dépense d’infrastructuresuivi dans le temps, comparé entre entités
  1. L’effet de cliquet : un palier d’usage atteint lors d’un pic reste facturé quand l’usage redescend. Négociez la baisse dès le contrat initial, pas seulement la hausse.
  2. Les environnements hors production : développement, test et préproduction sont souvent instrumentés comme la production et laissés allumés la nuit. Mesurez leur part ; elle surprend souvent.
  3. Les tableaux de bord abandonnés : ils consomment des requêtes, donc du budget. Une revue annuelle de suppression est un levier facile.
  4. La dérive du traçage : un traçage complet activé pour un incident et jamais redescendu, comme dans le journal ci-dessus.
  • Audit express de facture (deux heures) : tracez sur douze mois la courbe de chaque ligne, identifiez les trois qui ont le plus augmenté et, pour chacune, trouvez la décision qui l’explique. Si vous ne la trouvez pas, la visibilité est votre premier chantier.
  • Comparatif rapide (quelques semaines) : demandez une offre à trois alternatives sur un périmètre identique au vôtre et comparez à votre facture.
  • Gouvernance (un trimestre) : écrivez un RACI FinOps d’une page (qui optimise, qui répond du budget, qui est consulté, qui est informé), diffusez-le, lancez la revue mensuelle.

Liste de contrôle

  • Coûts ventilés par équipe, application et environnement
  • Étiquettes normées obligatoires à l’ingestion
  • Traces en échantillonnage en queue plutôt qu’à 100 %
  • Logs classés en niveaux chaud, tiède, froid, avec des durées justifiées
  • Clauses de plafond, de réversibilité et de non-entraînement au contrat
  • Au moins deux offres comparables connues avant le prochain renouvellement
  • Revue mensuelle des dérives avec les équipes
  • Coût par transaction métier suivi