Technique
Simulateur : l'effet traînard en entraînement distribué
Pour : ingénieurs et SRE · architectesPrérequis : Notions de base sur l'entraînement distribué sur GPU.
En entraînement distribué synchrone (parallélisme de données), chaque GPU calcule ses gradients sur son lot, puis tous se retrouvent à une barrière pour l’AllReduce qui en fait la moyenne. Le pas ne peut finir que lorsque le plus lent a terminé : un seul GPU dégradé, un straggler (traînard), impose son rythme à tous les autres. Et pendant qu’ils l’attendent, les GPU sont comptés « occupés ».
Les prix changent vite et varient selon les contrats : ce guide n’en donne pas ; utilisez la grille datée de votre fournisseur. Sans prix, le simulateur exprime la perte en GPU-heures ; saisissez votre prix d’une GPU-heure, ou votre coût interne, pour la voir en euros.
Paramètres
Résultat
- Chargement
- Calcul
- Attente à la barrière
- AllReduce
Valeurs des GPU affichés
| GPU | Vitesse | Calcul | Attente |
|---|
Modèle simplifié de parallélisme de données : chaque GPU calcule son lot, tous attendent le plus lent à la barrière, puis l’AllReduce dure le même temps pour tous. L’idéal suppose tous les GPU à la vitesse nominale, sans variabilité. Le pas d’optimiseur et le recouvrement calcul et communication sont ignorés. La variabilité est un tirage unique et reproductible (graine fixe), pas une moyenne : l’efficacité attendue peut différer de quelques points. Ordres de grandeur.
À essayer
Section intitulée « À essayer »- Un seul GPU à 70 % sur 64 GPU (réglage par défaut) : l’efficacité tombe à environ 76 %, soit 367 GPU-heures perdues par jour sur 1 536 disponibles et 11 001 sur 30 jours. Passez à 1 024 GPU : l’efficacité est la même, mais les GPU-heures perdues sont multipliées par seize (5 867 par jour, 176 008 sur 30 jours). Le coût d’un traînard croît avec la taille du cluster.
- Aucun GPU défaillant, mais de la variabilité : mettez 0 GPU ralenti et une variabilité de 5 %. Comparez 8 GPU et 1 024 GPU : l’efficacité affichée passe d’environ 99 % à environ 90 %, car plus il y a de GPU, plus le maximum s’éloigne de la moyenne. Le simulateur fait un seul tirage, reproductible (graine fixe) et ce tirage est favorable à 8 GPU : en moyenne sur de nombreux tirages, l’efficacité attendue est plutôt d’environ 95 % à 8 GPU et 89 % à 1 024 GPU. L’écart se resserre, la tendance reste. Même un parc sain perd de l’efficacité en grandissant, simplement parce qu’il y a toujours un GPU un peu en retard.
- Utilisation affichée contre calcul utile : avec un traînard, l’utilisation affichée reste proche de 100 % alors que le calcul utile baisse. Aucune alerte fondée sur l’utilisation GPU ne se déclenchera.
- Une communication plus lourde : portez l’AllReduce à 200 ms. L’efficacité par rapport à l’idéal remonte même un peu (le traînard pèse moins dans un pas plus long), mais le calcul utile baisse encore : le réseau devient le sujet et l’optimisation ne se joue plus sur les GPU.
La règle à retenir
Section intitulée « La règle à retenir »La durée d’un pas synchrone est le maximum des durées de calcul, pas leur moyenne. Le maximum de N valeurs aléatoires augmente avec N : le phénomène est structurel et s’aggrave avec l’échelle. Ce qu’il faut observer, c’est la durée de pas et sa décomposition par rang et l’écart entre le rang le plus lent et la médiane, plutôt que le taux d’utilisation des GPU.
Pour aller plus loin : anatomie d’un pas d’entraînement, le plan technique, le coût de l’observabilité pour le business et les passerelles entre les plans.
Révisé le 2 octobre 2026 : prix retirés ; la perte s’affiche en GPU-heures et en euros seulement avec votre prix.