Aller au contenu

TechniqueDécouverte

Comprendre le calcul haute performance

Pour : ingénieurs et SRE · architectes · managers d’équipe · direction et DSIPrérequis : Aucun.

Mode de lecture

Public : débutants, profils non techniques. Prérequis : aucun, ni code ni réseau. Objectif : suivre n’importe quelle discussion sur le HPC.

  • les idées de base, avec des analogies ;
  • le vocabulaire courant ;
  • les cinq composants d’un cluster ;
  • le cycle de vie d’un job, étape par étape ;
  • le lien entre HPC et IA moderne.

Vous ne trouverez ni code source, ni configuration système. Pour la supervision d’un cluster, voir Observabilité HPC : les fondamentaux.

Trois propriétés caractérisent les problèmes qu’un poste de travail ne peut pas traiter seul.

PropriétéCe que cela veut dire
Volume de calcul énormele nombre d’opérations dépasse de plusieurs ordres de grandeur ce qu’un processeur fait en temps raisonnable
Données très grandesles jeux de données ne tiennent pas dans la mémoire d’une seule machine : il faut les répartir
Délai contraintune prévision météo qui arrive deux semaines après ne sert à rien

On relie alors de nombreuses machines pour qu’elles travaillent ensemble comme une seule. C’est ce qu’on appelle un système HPC, un supercalculateur, ou plus simplement un cluster.

Faire beaucoup de choses en même temps, sur beaucoup de machines, sur le même problème.

On y gagne en vitesse (faire en quelques heures ce qui prendrait des semaines) et en taille, puisqu’on peut traiter des problèmes qui ne tiennent pas dans une seule machine.

  1. Anatomie d’un cluster : les cinq composants et la vie d’un job.
  2. Le parallélisme : trois schémas et les limites du passage à l’échelle.
  3. HPC et IA : deux mondes devenus un et ce que cela change pour l’observabilité.