Aller au contenu

TransverseExpert

Annexes

Pour : ingénieurs et SRE · architectesPrérequis : Avoir parcouru les parties de la méthode.

Annexe A. Récapitulatif des métriques par composant et par axe

Section intitulée « Annexe A. Récapitulatif des métriques par composant et par axe »
ComposantFiabilitéDisponibilitéCoût
LLMfinish_reasons, taux refus, hallucination, dériveTTFT, latence E2E, taux erreur, saturation GPU et KV cachetokens in/out, coût par requête, hit cache
RAGcontext precision et recall, fidélité, pertinence, couverturelatence recherche, santé index, fraîcheur basecoût embeddings, coût base vectorielle, reranking
Agentsuccès de tâche, sélection d’outil, planification, garde-fouslatence par étape et par tâche, taux échec outilnombre d’étapes, coût par tâche, détection boucle
MCPmutations serveur, tool poisoning, échecs auth, injectionsdisponibilité serveur, santé session, latence outilrate-limiting invocations

Le paysage des outils (auto-hébergement ou service géré, pile de référence, critères de choix, licences) est au chapitre 6 du guide. Outils cités par la méthode et absents de ce chapitre : sécurité MCP (mcp-scan, Cisco mcp-scanner, passerelle MCP avec audit), métriques GPU (exportateur DCGM), métriques d’inférence (métriques Prometheus de vLLM et de TGI), plateformes d’évaluation Laminar et Confident AI, suivi du coût multi-fournisseur (Helicone).

Les termes généraux (TTFT, fidélité, LLM juge, golden set, burn rate, borne de Wilson, tool poisoning, défaillance silencieuse, OTLP) sont définis dans le glossaire du site. Restent ici ceux qu’il ne couvre pas :

  • TPOT : time per output token, temps moyen par token de sortie après le premier, calculé par requête : (latence totale moins TTFT) divisée par (tokens de sortie moins un).
  • ITL : inter-token latency, délai entre deux tokens consécutifs, mesuré pour chaque paire ; on en suit la distribution (p95, p99) pour voir les saccades que la moyenne du TPOT lisse.
  • KV cache : cache clé-valeur du serveur d’inférence, déterminant pour la latence.
  • Context precision et recall : qualité de la recherche dans un RAG.
  • Rug pull : mise à jour malveillante d’un outil MCP de confiance.
  • Tool shadowing : faux outil dupliquant un outil légitime.
  • Spanmetrics : dérivation de métriques à partir des spans, au collecteur OTel.

Les prix des modèles changent souvent et dépendent du fournisseur, de la région, du mode d’appel (synchrone, par lot) et du cache. Les prix changent vite et varient selon les contrats : ce guide n’en donne pas ; utilisez la grille datée de votre fournisseur. Construisez votre propre table, versionnée comme du code, avec ces champs :

ChampContenu
Modèleidentifiant exact, tel qu’il apparaît dans gen_ai.request.model
Fournisseurvaleur de gen_ai.provider.name
Prix entréepar million de tokens
Prix sortiepar million de tokens
Prix entrée lue en cachesi le fournisseur facture à part la lecture d’un cache de prompt
Devisedevise de la grille ; en cas de conversion, taux et date du taux
SourceURL de la grille officielle du fournisseur ou référence du contrat
Date de relevéjour où le prix a été vérifié
Date d’effetà partir de quand le prix s’applique, pour recalculer le passé avec le bon prix

Gabarit à remplir avec la grille datée de votre fournisseur :

ModèleFournisseurEntrée (€ / M tokens)Sortie (€ / M tokens)DeviseSourceDate de relevé
demo-llm (grand modèle)fournisseur-aà renseignerà renseignerEURà renseignerà renseigner
demo-llm-small (petit modèle)fournisseur-aà renseignerà renseignerEURà renseignerà renseigner

Conversion pour les règles de coût : un prix de P € par million de tokens fait P x 1e-6 € par token. Un job relit la table et publie les séries price_in_eur_per_token et price_out_eur_per_token utilisées par les recording rules de la partie II ; les mêmes valeurs servent de paramètres au calculateur d’exposition.


Révisé le 2 octobre 2026 : prix retirés de l’annexe D, remplacés par un gabarit à remplir.

Révisé le 4 octobre 2026 : l’annexe B renvoie au chapitre 6 du guide et ne garde que les outils qu’il ne cite pas ; l’annexe C renvoie au glossaire du site et ne garde que les termes propres à la méthode ; l’annexe D, qui ne contient aucun prix, est conservée.