Technique
Schéma explorable : un cluster HPC IA
Pour : ingénieurs et SRE · architectesPrérequis : Notions de base sur les GPU et l'entraînement distribué.
Un cluster d’entraînement IA empile cinq couches : des nœuds GPU, un interconnect, un stockage parallèle, un ordonnanceur et une pile logicielle. Ce schéma en montre une version réduite à deux nœuds de 8 GPU NVIDIA H100 SXM. Chaque élément ouvre une fiche : ce qu’il est, ce qu’on y observe et avec quel outil, ce qui le menace. Le mode Observer place les collecteurs et leurs signaux, le mode Menaces pose les six vecteurs d’attaque du chapitre de référence sur les parties qu’ils visent.
Cliquez sur un élément du schéma, ou parcourez-le au clavier (Tab, puis Entrée ou Espace) : sa fiche s’ouvre sous le schéma.
Faites glisser le schéma horizontalement pour le voir en entier.
Où sont les collecteurs
Les six vecteurs de menace
- Chargement
- Passe avant
- Passe arrière
- AllReduce NCCL
- Optimiseur
- Attente à la barrière
Exemple illustratif : durées construites d'après l'ordre de grandeur du chapitre 2 (un pas d'environ 42 ms) ; le traînard met deux fois plus de temps pour sa passe arrière. Pour le détail : le pas d'entraînement animé et le simulateur d'effet traînard.
À essayer
Section intitulée « À essayer »- Ouvrez un GPU puis le nœud qui le contient. Le GPU expose ses compteurs par dcgm-exporter ; c’est le label
hpc_job, écrit par les scripts prolog et epilog de Slurm, qui permet de rattacher ces compteurs à un job, puis à un utilisateur et à un compte. - Jouez un pas sans traînard, puis avec. Avec un GPU traînard, tous les autres s’arrêtent à la barrière avant l’AllReduce : la durée du pas s’aligne sur le plus lent, alors que chaque GPU semble occupé.
- Passez en mode Menaces et ouvrez le vecteur 3. Le trafic RDMA contourne le noyau : ni pare-feu ni eBPF ne le voient. Les seuls signaux sont les compteurs InfiniBand, les mêmes que ceux de l’exploitation.
- Ouvrez les poids du modèle. Les six vecteurs convergent vers eux ; les collecteurs qui les protègent sont ceux du mode Observer.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- HPC IA : observabilité et sécurité, architecture de référence, la formation dont ce schéma est tiré
- Architecture d’un cluster HPC IA : les cinq couches
- Anatomie d’un pas d’entraînement distribué : les cinq phases et l’effet traînard
- La pile d’observabilité HPC IA : collecte, stockage, visualisation, eBPF
- Surface d’attaque du HPC IA : les six vecteurs et leur détection
- Le pas d’entraînement animé : le ring AllReduce et la barrière en détail
- Le simulateur de l’effet traînard : l’efficacité perdue de 8 à 1024 GPU