Mode de lecture Ingénieur Décideur
Lecture décideur : les passerelles d’abord.
Dix questions pour vérifier ce que vous retenez de la formation. Chaque réponse est corrigée immédiatement, avec une explication et un lien vers la leçon concernée. Rien n’est envoyé : votre meilleur score reste dans ce navigateur.
Question 1 sur 10 Dans un nœud GPU, par quel lien les GPU communiquent-ils entre eux ? Une seule réponse Revoir : Leçon 1 : Architecture d'un cluster HPC IA
Question 2 sur 10 Parmi ces familles de signaux, lesquelles font partie des quatre familles à collecter sur un cluster HPC IA ? Plusieurs réponses possibles GPU : utilisation des SM, bande passante HBM, erreurs ECC C'est la première famille, exposée par dcgm-exporter.
Facturation : coût horaire de chaque nœud Ce n'est pas une famille de signaux de la leçon ; la refacturation découle du rattachement des métriques au job et au compte.
Modèle : perte, norme des gradients, durée de pas, latence AllReduce C'est la famille qu'on oublie le plus souvent, alors que c'est elle qui dit si l'entraînement progresse.
Stockage : débit Lustre, latence des métadonnées Le stockage est l'une des quatre familles, avec le GPU, le réseau et le modèle.
Revoir : Leçon 1 : Architecture d'un cluster HPC IA
Question 3 sur 10 Passerelle : business Dans l'exemple illustratif de la leçon (valeurs construites, pas une mesure), un GPU affiché à 87 % d'utilisation ne calcule utilement qu'environ 19 % du pas. Que mesure réellement l'utilisation GPU ? Une seule réponse Revoir : Leçon 2 : Anatomie d'un pas d'entraînement distribué
Question 4 sur 10 Pour repérer un traînard qui ralentit tout l'entraînement, quels indicateurs la leçon recommande-t-elle de mesurer ? Plusieurs réponses possibles Revoir : Leçon 2 : Anatomie d'un pas d'entraînement distribué
Question 5 sur 10 Passerelle : organisation Comment rattacher concrètement chaque métrique GPU à un job, un utilisateur et un compte, base de la refacturation ? Une seule réponse Revoir : Leçon 3 : La pile d'observabilité HPC IA
Question 6 sur 10 Vous voulez tracer avec bpftrace les appels à cuMemAlloc_v2 de la bibliothèque libcuda. Quel type de sonde faut-il utiliser ? Une seule réponse Revoir : Leçon 3 : La pile d'observabilité HPC IA
Question 7 sur 10 Quelles affirmations sur Falco et Tetragon sont exactes ? Plusieurs réponses possibles Revoir : Leçon 3 : La pile d'observabilité HPC IA
Question 8 sur 10 Le trafic RDMA sur InfiniBand contourne le noyau. D'où peut alors venir la visibilité sur ce trafic ? Une seule réponse Revoir : Leçon 4 : Surface d'attaque du HPC IA
Question 9 sur 10 Passerelle : métiers Votre cluster est partagé entre plusieurs clients. Quelle parade la leçon propose-t-elle contre la lecture, par un job, des poids laissés en mémoire GPU par le job précédent ? Une seule réponse Revoir : Leçon 4 : Surface d'attaque du HPC IA
Question 10 sur 10 Passerelle : humain Selon la formation, pourquoi les équipes sécurité et exploitation ont-elles intérêt à travailler ensemble sur un cluster HPC IA ? Une seule réponse Revoir : Leçon 4 : Surface d'attaque du HPC IA
Recommencer
Passerelles Ce que cette page change au-delà de l'équipe technique.
BusinessValeur, coût, risque Vous savez distinguer l'utilisation GPU affichée du calcul utile et donc argumenter un achat de matériel sur l'efficacité réelle.
OrganisationQui décide, qui possède Vous savez rattacher chaque métrique à un job, un utilisateur et un compte, ce qui fonde la refacturation et la réponse à l'auditeur.
HumainÉquipes, astreinte, compétences Vous voyez pourquoi sécurité et exploitation gagnent à partager une même pile et à travailler ensemble.
MétiersProduit, finance, risque, relation client Vous savez protéger les poids et les données de chaque client sur une infrastructure partagée et expliquer aux équipes de recherche où passe leur temps d'entraînement. Pourquoi des passerelles →