Aller au contenu

TechniqueDécouverte

HPC et IA

Pour : ingénieurs et SRE · architectes · managers d’équipe · direction et DSIPrérequis : Avoir lu la leçon 2 du parcours.

Avant (jusque vers 2018)Aujourd’hui
HPC : grappes de processeurs, simulation en double précision, MPIdes milliers de GPU et un interconnect très rapide
IA : quelques GPU, petits jeux de donnéesstockage parallèle et ordonnanceur partagés
matériel, outils et conférences distinctsobservabilité et exploitation comparables

L’IA à grande échelle tourne donc sur la même fondation que le HPC classique. Ce sont surtout les termes et les indicateurs suivis qui changent.

Précision numérique. Le HPC classique exige souvent la double précision (FP64) pour la stabilité. L’IA tolère le 16 bits, voire le 8 bits : les GPU vont plus vite, mais des questions de précision et de reproductibilité apparaissent.

Échelle des données. Les jeux d’entraînement atteignent des centaines de téraoctets. Alimenter des milliers de GPU sans interruption est un défi de stockage et de réseau à part entière.

Observabilité. L’IA ajoute ses propres indicateurs : courbe de perte, normes de gradient, durée des pas, utilisation GPU par rang, énergie par jeton traité. Observer un entraînement devient une spécialité.

Un ordre de grandeur, à titre illustratif : un entraînement de 7 jours sur 64 GPU consomme 64 x 7 x 24 = 10 752 heures-GPU. Ce volume est à multiplier par le prix horaire de votre fournisseur ou votre coût interne. Le même calcul appliqué aux plus grands entraînements, sur des milliers de GPU pendant des semaines, donne des centaines de milliers, voire des millions d’heures-GPU. Une dégradation silencieuse d’un seul GPU qui fait perdre un point de reprise peut coûter des heures, voire des jours de calcul, selon la fréquence des points de reprise. À ce niveau de consommation, l’observabilité devient une question économique autant que technique.

Les prix changent vite et varient selon les contrats : ce guide n’en donne pas ; utilisez la grille datée de votre fournisseur.

Vous connaissez maintenant les cinq composants d’un cluster (nœud de connexion, ordonnanceur, nœuds de calcul, interconnect, stockage parallèle) et les trois schémas de parallélisme (trivial, couplage serré, parallélisme de données). Vous savez aussi pourquoi l’IA à grande échelle repose sur la même fondation que le HPC classique.

  • Lire les premières pages de la documentation sbatch de Slurm : les abstractions deviennent concrètes.
  • Parcourir le classement Top500 des supercalculateurs.
  • Essayer un programme MPI ou OpenMP sur votre poste : vous ne battrez pas de record, mais vous sentirez le parallélisme.
  • Continuer avec Observabilité HPC : les fondamentaux.

Révisé le 2 octobre 2026 : coût d’un entraînement recalculé de façon explicite et présenté comme illustratif (64 GPU pendant 7 jours, soit 10 752 heures-GPU). Ce calcul remplace la mention « centaines de milliers d’euros » ; prix retirés.