Business
Partie V. Analyse d'impact quantifiée
Pour : architectes · finance, risque et conformité · direction et DSIPrérequis : Avoir lu la partie I (modèle de la défaillance silencieuse).
18. Le modèle de coût de la non-surveillance
Section intitulée « 18. Le modèle de coût de la non-surveillance »Principe unificateur : le coût d’un angle mort est le produit d’un taux d’accumulation par un délai de détection. Sans le signal, le délai de détection est celui d’un canal externe (facture mensuelle, plainte client) ; on retient par hypothèse un cycle de facturation, soit 30 jours. Avec le signal, il tombe à quelques minutes ou heures.
valeur_d_un_signal ~= taux_d_accumulation x (delai_sans_signal - delai_avec_signal)Notation : V requêtes ou tâches par jour, t_in et t_out tokens entrée et sortie moyens, p_in et p_out prix par token.
cout_par_appel = t_in * p_in + t_out * p_outcout_base_mensuel = V * cout_par_appel * 30Chiffrage des angles morts principaux :
- Boucle d’agent. Tâche normale à K étapes, taux de boucle r, étapes en boucle L. Surcoût mensuel
= V * r * (L - K) * cout_etape * 30. Scénario d’emballement nocturne : un agent bloqué à R requêtes par minute pendant H heures coûteR * 60 * H * cout_par_appel. - Gonflement de prompt. Croissance mensuelle g des tokens entrée non détectée pendant M mois. Surcoût cumulé approché
cout_base_mensuel_in * g * M * (M + 1) / 2, oùcout_base_mensuel_in = V * t_in * p_in * 30. - Cache de réponses non exploité. Taux de hit atteignable h non capturé : économie manquée
= h * cout_base_mensuel. La formule vaut pour un cache de réponses, où un hit évite tout l’appel. Un cache de prompt ne fait que réduire le prix des tokens d’entrée lus en cache : l’économie est alors plus faible. - Hallucination. Coût espéré
= P_hallucination * N_incidents_exposes * cout_par_incident, le coût par incident intégrant remédiation, atteinte réputationnelle et exposition réglementaire.
19. Exemple chiffré
Section intitulée « 19. Exemple chiffré »Les prix changent vite et varient selon les contrats : ce guide n’en donne pas ; utilisez la grille datée de votre fournisseur. L’exemple chiffre donc les angles morts en jetons et en appels ; pour obtenir des euros, multipliez les jetons d’entrée par p_in et les jetons de sortie par p_out (voir l’annexe D pour construire votre table).
Paramètres illustratifs :
- V = 50 000 appels par jour, t_in = 1 500, t_out = 400 tokens.
- Volume quotidien : 50 000 x 1 500 = 75 millions de tokens d’entrée et 50 000 x 400 = 20 millions de tokens de sortie.
- Volume mensuel, base du coût : 2 250 millions de tokens d’entrée et 600 millions de tokens de sortie, soit
cout_base_mensuel = 2 250 M x p_in + 600 M x p_out.
Angles morts, sur ces mêmes paramètres :
- Gonflement de prompt non détecté, g = 8 pour cent par mois sur M = 4 mois : surconsommation cumulée de l’ordre de
2 250 M x 0,08 x 4 x 5 / 2 = 1 800 millions de tokens d'entréesur quatre mois, à multiplier par p_in, jamais alertée. - Cache de réponses atteignable h = 30 pour cent non exploité :
0,30 x 50 000 x 30 = 450 000 appelsévitables par mois, soit 675 millions de tokens d’entrée et 180 millions de tokens de sortie, c’est-à-dire 30 pour cent du coût de base. - Un seul agent emballé une nuit, R = 20 requêtes par minute pendant 8 heures :
20 x 60 x 8 = 9 600 appelsen une nuit, soit 14,4 millions de tokens d’entrée et 3,84 millions de tokens de sortie, multipliés par la fréquence des incidents.
Lecture : aucune de ces pertes ne déclenche d’alerte de latence ou d’erreur. Elles matérialisent précisément le modèle de la défaillance silencieuse et justifient l’investissement d’observabilité en euros, une fois vos prix appliqués, pas en courbes.
20. Outil : le calculateur d’exposition économique
Section intitulée « 20. Outil : le calculateur d’exposition économique »Le modèle ci-dessus est opérationnalisé dans un calculateur interactif, destiné à un échange avec une direction financière ou un comité risque. On entre le volume, les tokens, les prix, le profil agent et les hypothèses de dérive ; il restitue le coût de base, l’exposition de chaque angle mort et l’exposition totale de la non-surveillance sur douze mois, c’est-à-dire la valeur que l’observabilité peut éviter. Le calculateur simplifie ce modèle sur certains postes ; sa page détaille chaque écart.
21. Matrice de priorisation
Section intitulée « 21. Matrice de priorisation »quadrantChart title Priorisation des angles morts x-axis "Bruyant" --> "Silencieux" y-axis "Gravité faible" --> "Gravité critique" quadrant-1 "Priorité 1 : surveiller d'abord" quadrant-2 "Couvert par le monitoring classique" quadrant-3 "À faible enjeu" quadrant-4 "À instrumenter ensuite" "Hallucination": [0.85, 0.9] "Dérive de coût": [0.9, 0.7] "Tool poisoning MCP": [0.8, 0.95] "Boucle d'agent": [0.75, 0.65] "Dérive de qualité": [0.88, 0.6] "Rate-limit fournisseur": [0.25, 0.55] "Erreur serveur 500": [0.15, 0.5] "Latence ponctuelle": [0.3, 0.25]
Révisé le 2 octobre 2026 : prix retirés ; l’exemple chiffré est exprimé en tokens et en appels.