Aller au contenu

Transverse

Glossaire

Chaque terme est donné avec son équivalent anglais, parce que la documentation des outils est presque toujours en anglais.

ADKAR : modèle de conduite du changement publié par Prosci, en cinq étapes vécues par chaque personne : prise de conscience (awareness), envie (desire), connaissance (knowledge), capacité (ability), ancrage (reinforcement).

Borne de Wilson (Wilson score interval) : borne d’intervalle de confiance robuste pour une proportion estimée sur un petit échantillon. Sert à comparer un SLO de qualité à sa cible sans fausse précision.

Budget d’erreur (error budget) : part de non-fiabilité tolérée par un SLO sur une période. Un SLO de 99,9 % sur 30 jours laisse environ 43 minutes d’indisponibilité.

Burn rate (taux de consommation) : vitesse à laquelle le budget d’erreur d’un SLO est consommé. Un burn rate de 1 épuise le budget exactement à la fin de la fenêtre.

Cardinalité (cardinality) : nombre de séries temporelles distinctes produites par une métrique, c’est-à-dire de combinaisons uniques de ses labels. Facteur de coût majeur d’un système de métriques.

Chargeback (refacturation interne) : imputation réelle du coût de l’observabilité ou du cloud au budget de chaque équipe.

Collector : composant qui reçoit, transforme et exporte la télémétrie. Désigne le plus souvent l’OpenTelemetry Collector.

Contrat de données (data contract) : règle écrite, vérifiée en intégration continue, qui définit pour un signal les attributs autorisés, le budget de cardinalité, la rétention et la destination.

Convention sémantique (semantic convention) : nom et signification standardisés des attributs OpenTelemetry, comme http.response.status_code ou gen_ai.operation.name.

DCGM (Data Center GPU Manager) : outil NVIDIA de supervision des GPU ; son exportateur expose aux formats Prometheus l’utilisation, la mémoire, la température et l’énergie de chaque GPU.

Défaillance silencieuse (silent failure) : défaillance sans erreur technique (hallucination, dérive de coût, boucle d’agent) qui s’accumule jusqu’à sa détection tardive.

Délai de récupération (payback period) : nombre de mois nécessaires pour que les gains cumulés d’un investissement égalent son coût.

Dérive (drift) : dégradation progressive d’un modèle en production. On distingue la dérive des données (les questions changent), du concept (la réalité change) et du pipeline (un composant change).

eBPF : technologie du noyau Linux qui exécute des programmes vérifiés sur des points d’accroche (appels système, fonctions, réseau) pour observer ou filtrer sans modifier le code.

Échantillonnage en queue (tail sampling) : décision de conserver ou non une trace, prise une fois la trace complète. Permet de garder toutes les erreurs et une fraction du trafic nominal.

Entité essentielle (essential entity) : catégorie d’organisations soumises à NIS2 au régime le plus strict, selon leur secteur et leur taille ; plafond de sanction d’au moins 10 M€ ou 2 % du chiffre d’affaires mondial.

Entité importante (important entity) : catégorie d’organisations soumises à NIS2 avec une supervision a posteriori ; plafond de sanction d’au moins 7 M€ ou 1,4 % du chiffre d’affaires mondial.

Exemplar : lien d’un point de métrique vers une trace précise, pour passer d’un pic de latence à la requête qui l’a causé.

Faithfulness (fidélité) : part des affirmations d’une réponse effectivement soutenues par le contexte récupéré. Métrique centrale de qualité d’un RAG.

Forge : plateforme d’hébergement de dépôts de code (Git), avec suivi des tickets et des versions, comme GitLab ou GitHub. Sur ce site, « la forge » désigne la forge Labs & Trainings, où le code des labs est publié en accès libre.

Golden set (jeu de référence) : jeu de questions et de réponses annotées par des humains, utilisé pour l’évaluation hors ligne et pour calibrer un LLM juge.

Interconnect : réseau très rapide reliant les nœuds d’un cluster HPC, par exemple InfiniBand.

LLM juge (LLM as a judge) : utilisation d’un modèle de langage pour noter les réponses d’un autre. Rapide et reproductible, mais sujet à des biais connus.

Log (journal) : enregistrement horodaté d’un événement discret, structuré ou non.

Métrique (metric) : mesure numérique agrégée dans le temps, identifiée par un nom et des labels.

MIG (Multi-Instance GPU) : découpage d’un GPU NVIDIA en plusieurs instances isolées en calcul et en mémoire : chaque instance GPU a ses propres chemins mémoire (cache L2, contrôleurs, bande passante), selon la documentation NVIDIA. Les instances de calcul créées dans une même instance GPU partagent sa mémoire et ses moteurs (concepts MIG).

MTTL (Mean Time To Learn) : temps moyen pour comprendre ce qui se passe, ce qui précède toute réparation. Le nom de ce site, en écho au MTTR.

MTTR (mean time to recovery) : durée moyenne de rétablissement après un incident.

NCCL : bibliothèque NVIDIA de communications collectives entre GPU (AllReduce, broadcast) utilisée par l’entraînement distribué.

OTLP (OpenTelemetry Protocol) : protocole de transport de la télémétrie défini par OpenTelemetry.

Profil (profile) : échantillonnage de l’activité d’un programme (CPU, mémoire) permettant de localiser le code coûteux. Quatrième signal d’OpenTelemetry, encore en développement (non stable) au 2 octobre 2026 selon la page de statut de la spécification.

RACI : matrice qui indique, pour chaque activité, qui réalise (R), qui rend compte et valide (A, un seul par activité), qui est consulté (C) et qui est informé (I).

RAG (retrieval augmented generation) : génération augmentée par récupération : on cherche des documents pertinents puis on les fournit au modèle comme contexte.

RDMA (Remote Direct Memory Access) : accès direct à la mémoire d’une autre machine par la carte réseau, sans passer par le noyau ; base d’InfiniBand et de RoCE.

SBOM (software bill of materials) : nomenclature logicielle, c’est-à-dire la liste des composants inclus dans un produit, avec leurs versions.

Showback (affichage des coûts) : présentation à chaque équipe de ce qu’elle consomme, sans imputation à son budget ; première étape de la responsabilisation.

SLI (service level indicator) : mesure de la qualité de service vue par l’utilisateur, par exemple la part de requêtes servies en moins de 300 ms.

SLO (service level objective) : objectif fixé sur un SLI, par exemple 99,5 % des requêtes en moins de 300 ms sur 30 jours.

Slurm : ordonnanceur de référence des clusters HPC ; il met les jobs en file, alloue les ressources et comptabilise l’usage par compte.

Span : unité de travail dans une trace, avec un début, une fin, des attributs et un parent.

Stockage immuable (immutable storage) : stockage, dit WORM (write once, read many), où une donnée écrite ne peut plus être modifiée ni supprimée avant la fin de sa durée de conservation ; condition nécessaire d’une preuve, pas suffisante (voir l’intégrité des journaux).

Tool poisoning (empoisonnement d’outil) : instructions malveillantes cachées dans la définition d’un outil MCP pour manipuler l’agent qui l’utilise.

Trace : ensemble des spans qui décrivent le parcours d’une requête à travers un système distribué.

Traînard (straggler) : GPU ou nœud plus lent que les autres, qui fait attendre tout le cluster à chaque barrière de synchronisation.

TTFT (time to first token) : temps entre l’envoi de la requête et la réception du premier jeton généré. Indicateur de latence perçue en streaming.

Révisé le 2 octobre 2026 : cardinalité présentée comme un facteur de coût majeur plutôt que le premier, définition de MIG précisée et sourcée sur la documentation NVIDIA.