Aller au contenu

TechniqueExpert

Au-delà du LLM : GPU et qualité des modèles

Pour : ingénieurs et SRE · architectesPrérequis : Avoir suivi « Observabilité des LLM : les labs » ; expérience de l'industrialisation de modèles d'IA en production.

Mode de lecture

Ce parcours est la dernière étape de la progression : il va au-delà du LLM, vers l’infrastructure GPU puis la qualité des modèles dans la durée. Il s’adresse aux ML engineers, ingénieurs plateforme, SRE et équipes MLOps déjà confrontés à l’industrialisation de modèles.

Prérequis : la formation Observabilité des LLM : les labs (instrumentation GenAI, RAG, dérives, coût, alertes), que ce parcours suppose acquise et ne reprend pas. Pour les concepts, voir le guide.

Périmètre propre : le ML classique, la dérive statistique (PSI, KS, Wasserstein), le registre de modèles (MLflow) et le réentraînement relèvent de ce parcours ; le guide, centré sur l’IA générative, les exclut de son périmètre.

  1. Monitoring GPU et infrastructure IA : DCGM, exportateurs NVIDIA, Slurm, Kubernetes. Module en préparation ; Observabilité HPC : les fondamentaux et l’architecture de référence HPC IA en couvrent déjà une partie.
  2. Détection de dérive avancée et qualité des modèles : PSI, KS, Wasserstein, Evidently, MLflow, réentraînement. Module en préparation.

Sur une infrastructure GPU, le taux d’utilisation dit peu de chose. Un GPU affiché à 80 % peut cacher une bande passante mémoire saturée, des tensor cores sous-employés ou un goulot réseau entre nœuds. Scénario illustratif : un entraînement affiche 85 % d’utilisation alors que la bande passante mémoire est à 99 % ; le goulot est la mémoire et le chiffre d’utilisation ne le montre pas.

Objectifs

  • cartographier les couches d’une infrastructure IA : GPU, mémoire, interconnect, ordonnanceur, application ;
  • déployer l’exportateur DCGM et collecter les métriques NVIDIA avancées : occupation des SM, utilisation des tensor cores, bande passante mémoire, bridage thermique, NVLink et NCCL, énergie ;
  • instrumenter les jobs Slurm et les pods Kubernetes IA avec les bons labels ;
  • construire un tableau de bord exploitable par un SRE non spécialiste de l’IA ;
  • détecter les schémas problématiques : bande passante saturée, NCCL lent, mémoire insuffisante à l’entraînement ;
  • définir les SLO d’une infrastructure IA : disponibilité, taux de dépassement mémoire, temps d’attente, débit.

Labs prévus (en préparation) : pile DCGM avec un dorsal de métriques compatible Prometheus et détection de tensor cores sous-utilisés sur un job synthétique ; puis Slurm ou Kubernetes supervisé, avec métriques par job, taux d’échec et répartition des coûts par équipe.

Module 2 : détection de dérive avancée et qualité des modèles

Section intitulée « Module 2 : détection de dérive avancée et qualité des modèles »

Repérer une dérive ne suffit pas. Il faut encore la qualifier statistiquement, distinguer un vrai changement d’un faux positif, choisir entre alerter, réentraîner ou laisser passer, puis garder la trace de ces décisions.

Objectifs

  • distinguer formellement les types de dérive et les ranger dans les trois familles du site (données, concept, pipeline), dont le module 3 de la formation LLM est la référence : changement de covariables (covariate shift), changement de distribution a priori (prior shift) et dérive virtuelle relèvent des données, la dérive de concept du concept ; puis leurs formes : soudaine, graduelle, incrémentale, récurrente ;
  • implémenter PSI, Kolmogorov-Smirnov, Chi², Wasserstein et MMD sur des variables tabulaires et des embeddings, en connaissant les forces et limites de chacun ;
  • configurer Evidently ou un équivalent en production ;
  • définir une stratégie de réentraînement déclenchée par la dérive, la performance ou le calendrier, avec champion et challenger et retour arrière sûr ;
  • tenir un registre de modèles avec MLflow ou un équivalent et le lignage de production ;
  • installer un comité qualité IA et ses rituels et préparer la documentation technique exigée par l’AI Act pour les systèmes à haut risque. Depuis le règlement (UE) 2026/1744, ces obligations s’appliquent au 2 décembre 2027 pour les systèmes de l’annexe III et au 2 août 2028 pour ceux de l’annexe I.

Labs prévus (en préparation) : détection sur variables tabulaires avec gestion des fausses alertes saisonnières ; détection sur embeddings textuels intégrée à un pipeline RAG ; chaîne complète alerte Evidently, webhook, job MLflow, validation et déploiement contrôlé.

Révisé le 2 octobre 2026 : calendrier de l’AI Act mis à jour après le règlement (UE) 2026/1744, modules 2 et 3 et leurs labs signalés comme en préparation, exemple GPU présenté comme scénario illustratif, mention d’un parcours sécurité inexistant retirée.

Révisé le 4 octobre 2026 : parcours renommé « Au-delà du LLM : GPU et qualité des modèles », la formation sur les LLM devient un prérequis et non plus un module, modules renumérotés, termes de dérive rangés dans la taxonomie du site (données, concept, pipeline) avec renvoi au module 3 de la formation LLM, périmètre propre précisé (ML classique, MLflow, réentraînement), page passée en MDX avec l’encart de progression.