Transverse
Annexes
Pour : ingénieurs et SRE · architectesPrérequis : Avoir parcouru les parties de la méthode.
Annexe A. Récapitulatif des métriques par composant et par axe
Section intitulée « Annexe A. Récapitulatif des métriques par composant et par axe »| Composant | Fiabilité | Disponibilité | Coût |
|---|---|---|---|
| LLM | finish_reasons, taux refus, hallucination, dérive | TTFT, latence E2E, taux erreur, saturation GPU et KV cache | tokens in/out, coût par requête, hit cache |
| RAG | context precision et recall, fidélité, pertinence, couverture | latence recherche, santé index, fraîcheur base | coût embeddings, coût base vectorielle, reranking |
| Agent | succès de tâche, sélection d’outil, planification, garde-fous | latence par étape et par tâche, taux échec outil | nombre d’étapes, coût par tâche, détection boucle |
| MCP | mutations serveur, tool poisoning, échecs auth, injections | disponibilité serveur, santé session, latence outil | rate-limiting invocations |
Annexe B. Outils
Section intitulée « Annexe B. Outils »Le paysage des outils (auto-hébergement ou service géré, pile de référence, critères de choix, licences) est au chapitre 6 du guide. Outils cités par la méthode et absents de ce chapitre : sécurité MCP (mcp-scan, Cisco mcp-scanner, passerelle MCP avec audit), métriques GPU (exportateur DCGM), métriques d’inférence (métriques Prometheus de vLLM et de TGI), plateformes d’évaluation Laminar et Confident AI, suivi du coût multi-fournisseur (Helicone).
Annexe C. Termes propres à la méthode
Section intitulée « Annexe C. Termes propres à la méthode »Les termes généraux (TTFT, fidélité, LLM juge, golden set, burn rate, borne de Wilson, tool poisoning, défaillance silencieuse, OTLP) sont définis dans le glossaire du site. Restent ici ceux qu’il ne couvre pas :
- TPOT : time per output token, temps moyen par token de sortie après le premier, calculé par requête : (latence totale moins TTFT) divisée par (tokens de sortie moins un).
- ITL : inter-token latency, délai entre deux tokens consécutifs, mesuré pour chaque paire ; on en suit la distribution (p95, p99) pour voir les saccades que la moyenne du TPOT lisse.
- KV cache : cache clé-valeur du serveur d’inférence, déterminant pour la latence.
- Context precision et recall : qualité de la recherche dans un RAG.
- Rug pull : mise à jour malveillante d’un outil MCP de confiance.
- Tool shadowing : faux outil dupliquant un outil légitime.
- Spanmetrics : dérivation de métriques à partir des spans, au collecteur OTel.
Annexe D. Construire sa table de prix datée
Section intitulée « Annexe D. Construire sa table de prix datée »Les prix des modèles changent souvent et dépendent du fournisseur, de la région, du mode d’appel (synchrone, par lot) et du cache. Les prix changent vite et varient selon les contrats : ce guide n’en donne pas ; utilisez la grille datée de votre fournisseur. Construisez votre propre table, versionnée comme du code, avec ces champs :
| Champ | Contenu |
|---|---|
| Modèle | identifiant exact, tel qu’il apparaît dans gen_ai.request.model |
| Fournisseur | valeur de gen_ai.provider.name |
| Prix entrée | par million de tokens |
| Prix sortie | par million de tokens |
| Prix entrée lue en cache | si le fournisseur facture à part la lecture d’un cache de prompt |
| Devise | devise de la grille ; en cas de conversion, taux et date du taux |
| Source | URL de la grille officielle du fournisseur ou référence du contrat |
| Date de relevé | jour où le prix a été vérifié |
| Date d’effet | à partir de quand le prix s’applique, pour recalculer le passé avec le bon prix |
Gabarit à remplir avec la grille datée de votre fournisseur :
| Modèle | Fournisseur | Entrée (€ / M tokens) | Sortie (€ / M tokens) | Devise | Source | Date de relevé |
|---|---|---|---|---|---|---|
| demo-llm (grand modèle) | fournisseur-a | à renseigner | à renseigner | EUR | à renseigner | à renseigner |
| demo-llm-small (petit modèle) | fournisseur-a | à renseigner | à renseigner | EUR | à renseigner | à renseigner |
Conversion pour les règles de coût : un prix de P € par million de tokens fait P x 1e-6 € par token. Un job relit la table et publie les séries price_in_eur_per_token et price_out_eur_per_token utilisées par les recording rules de la partie II ; les mêmes valeurs servent de paramètres au calculateur d’exposition.
Révisé le 2 octobre 2026 : prix retirés de l’annexe D, remplacés par un gabarit à remplir.
Révisé le 4 octobre 2026 : l’annexe B renvoie au chapitre 6 du guide et ne garde que les outils qu’il ne cite pas ; l’annexe C renvoie au glossaire du site et ne garde que les termes propres à la méthode ; l’annexe D, qui ne contient aucun prix, est conservée.