Aller au contenu

BusinessPratique

1. Construire le business case

Pour : finance, risque et conformité · direction et DSIPrérequis : Aucun.

Mode de lecture

Sans chiffrage, l’observabilité reste un projet IT de plus et c’est le premier budget coupé en période de tension. Cette leçon donne une méthode pour construire un dossier qu’une direction financière reconnaît comme sérieux.

Tout business case commence par le coût des incidents des douze derniers mois. Ce chiffre manque presque toujours dans les tableaux de bord existants et son absence est déjà un argument : on ne pilote pas ce qu’on ne mesure pas.

Quatre indicateurs structurent le calcul :

  • MTTD (mean time to detect) : temps entre le début d’une anomalie et sa détection ;
  • MTTA (mean time to acknowledge) : temps entre l’alerte et sa prise en charge ;
  • MTTR (mean time to recovery) : temps entre la détection et le rétablissement ;
  • impact financier : marge perdue pendant l’indisponibilité, pénalités contractuelles, compensations client.

Le coût par minute : votre chiffre, pas celui d’une étude

Section intitulée « Le coût par minute : votre chiffre, pas celui d’une étude »

Le chiffre le plus cité est celui de Gartner : 5 600 dollars par minute d’indisponibilité réseau en moyenne, soit environ 300 000 dollars par heure. Il vient d’une estimation publiée en 2014 par Andrew Lerner, analyste chez Gartner. C’est une moyenne, en dollars, ancienne, qui mélange des entreprises de toutes tailles. Elle peut servir à montrer qu’un ordre de grandeur existe, jamais à chiffrer votre cas.

Votre chiffre se calcule avec le contrôle de gestion, en marge perdue, pas en coût IT :

coût horaire d'un arrêt = marge horaire perdue
+ pénalités contractuelles par heure
+ coûts de rattrapage (heures supplémentaires, rebuts, relances)
coût direct annuel = somme des heures d'arrêt x coût horaire du système concerné

Ajoutez à part les coûts indirects (perte de confiance d’un client, heures d’équipe mobilisées) en les présentant comme une estimation, avec leur hypothèse. Mélanger un coût direct validé et un coût indirect supposé affaiblit tout le chiffre.

ROI (%) = (gains - coûts) / coûts x 100
délai de récupération (mois) = investissement initial / gain mensuel

Les gains se construisent à partir de quatre sources, à chiffrer séparément :

  1. la réduction du coût des incidents : moins d’heures d’arrêt, détectées plus tôt, rétablies plus vite ;
  2. la rationalisation de l’outillage : licences redondantes supprimées ;
  3. le temps d’équipe récupéré : moins de bruit d’alerte, diagnostics plus courts ;
  4. les économies sur la télémétrie elle-même : voir la leçon 4.

Les coûts comprennent les licences ou l’infrastructure, le stockage, les personnes (exploitation de la plateforme, instrumentation), la formation, la conduite du changement et la migration.

Un comité de direction est souvent plus sensible au délai de récupération qu’au ROI : « en combien de mois récupère-t-on la mise ? » parle davantage qu’un pourcentage à cinq ans. Pour l’estimer sur vos propres hypothèses, le business case du MTTR calcule le retour, le délai de récupération et la sensibilité aux hypothèses.

L’ordre compte. Sauter une étape ou l’inverser produit des dossiers qui ne convainquent pas.

flowchart LR
  E1["1. Coût des<br/>incidents"] --> E2["2. Gains<br/>attendus"] --> E3["3. Coût<br/>complet"] --> E4["4. ROI et<br/>récupération"] --> E5["5. Trois ans,<br/>trois scénarios"] --> E6["6. Pitch au<br/>comité"]
  1. Chiffrer le coût des incidents des douze derniers mois : nombre, durée, coût horaire par système, pénalités.
  2. Identifier les gains attendus, source par source. Posez une hypothèse de réduction du temps d’arrêt que vous justifiez (par exemple les incidents que vous auriez détectés plus tôt avec une alerte sur le symptôme utilisateur).
  3. Totaliser le coût complet sur trois ans, pas seulement les licences.
  4. Calculer le ROI et le délai de récupération et la valeur actuelle nette si votre direction financière l’utilise.
  5. Projeter sur trois ans avec trois scénarios (prudent, central, favorable) et au moins deux architectures comparées avec les mêmes critères (voir la leçon 3).
  6. Pitcher au comité : cinq diapositives, dix minutes, une décision demandée (voir la leçon 7).

Un business case qui n’affiche que les licences est disqualifié au premier arbitrage sérieux. Six postes sont régulièrement sous-estimés :

PosteCe qu’il faut compterLevier principal
Stockage des métriquesvolume de séries actives, rétention, réplicationmaîtrise de la cardinalité
Stockage des logsvolume ingéré et indexé, rétention par catégorieniveaux chaud, tiède, froid
Tracesspans ingérés, rétentionéchantillonnage en queue
Personnesexploitation de la plateforme, astreinte, instrumentationautomatisation, configuration versionnée
Abonnements SaaSunités facturées (hôtes, volume, utilisateurs, modules)négociation, plafonds, revue d’usage
Conduite du changementformation, accompagnement, documentationréférents internes, procédures écrites

Je ne donne pas ici de prix au gigaoctet ni de fourchette de coût total par taille d’entreprise. Ils varient trop selon l’architecture et le contrat pour être utiles hors contexte. Le simulateur de coût au Collector permet de chiffrer votre propre volume, avec des prix unitaires que vous saisissez.

Six leviers d’économie à prévoir dès le départ

Section intitulée « Six leviers d’économie à prévoir dès le départ »

Ces leviers se décident à la conception. Activés tôt, ils pèsent sur les trois années du business case.

  1. Échantillonnage intelligent des traces : garder toutes les traces en erreur ou lentes et seulement une fraction du trafic nominal.
  2. Rétention différenciée : toutes les données n’ont pas la même valeur dans le temps ; un log de débogage n’a pas la durée de vie d’un journal d’authentification.
  3. Cardinalité contrôlée : pas d’identifiant unique (utilisateur, requête) comme label de métrique.
  4. Un tableau de bord du coût de l’observabilité : coût par gigaoctet ingéré, par service, par équipe, avec alerte sur les dérives.
  5. Négociation contractuelle : engagement, plafonds, clause de sortie, toujours avec des offres comparables en main.
  6. Architecture choisie sur critères : open source autogéré, SaaS ou mixte, comparés avec la même grille (voir la grille d’évaluation des solutions).

L’effet de chaque levier dépend de votre volume et de votre contrat. Plutôt qu’un pourcentage générique, mesurez-le : le simulateur de coût au Collector montre la facture avant et après chaque levier.

Un modèle à remplir, dont la colonne « méthode » compte autant que la valeur : c’est elle qu’un DAF interroge.

Coût des incidents (douze derniers mois)

PosteMéthode de calculValeur
Incidents majeurstickets de priorité 1 et 2
Durée d’indisponibilitésomme des durées d’arrêt, par systèmeheures
Coût horaire d’un arrêtmarge horaire perdue, validée par le contrôle de gestion€/h
Coût directdurée x coût horaire, par système€
Coût indirect estiméhypothèse explicite, validée ou non€
Exposition réglementaireligne séparée, non additionnée aux gainsqualitatif

Gains projetés sur trois ans

AnnéeHypothèse de réduction du temps d’arrêt (à justifier)Gain annuelCumul
1
2
3

Synthèse

IndicateurFormuleValeur
ROI à trois ans(gains - coûts) / coûts x 100%
Délai de récupérationinvestissement initial / gain mensuelmois
Ratio gains sur coûtsgains totaux / coûts totauxpour 1

Durée : 45 minutes, seul ou à deux.

  1. Chiffrez les incidents des douze derniers mois : nombre, durée totale, coût cumulé.
  2. Obtenez ou estimez le coût horaire d’un arrêt pour votre système le plus critique, avec son hypothèse.
  3. Formulez une hypothèse de réduction du temps d’arrêt et justifiez-la incident par incident.
  4. Calculez les gains annuels, le ROI à trois ans et le délai de récupération dans le business case du MTTR.
  5. Notez vos deux plus grandes incertitudes : ce sont les premières questions du comité.

Ma prochaine action : quelle action, pour quelle date, avec qui ?