Aller au contenu

TechniqueDécouverte

Anatomie d'un cluster

Pour : ingénieurs et SRE · architectes · managers d’équipe · direction et DSIPrérequis : Aucun.

ComposantRôle
Nœud de connexionpréparer et soumettre le travail
Ordonnanceurfile d’attente, priorités, allocation des ressources
Nœuds de calculles serveurs qui calculent, avec processeurs et accélérateurs
Interconnectle réseau très rapide entre les nœuds
Stockage parallèlele système de fichiers partagé et performant

Le travail suit toujours le même chemin. L’utilisateur le prépare sur le nœud de connexion et le soumet à l’ordonnanceur, qui réserve des nœuds de calcul. Ces nœuds communiquent par l’interconnect et lisent ou écrivent sur le stockage parallèle.

flowchart TB
  U["Utilisateur"] --> L["Nœud de<br/>connexion"]
  L -->|"soumet"| S["Ordonnanceur"]
  S -->|"réserve"| C1["Nœud de calcul 1<br/>CPU, GPU"]
  S -->|"réserve"| C2["Nœud de calcul 2<br/>CPU, GPU"]
  C1 <--> IC["Interconnect"]
  C2 <--> IC
  C1 <--> FS[("Stockage<br/>parallèle")]
  C2 <--> FS

Un nœud est un serveur puissant : processeurs, mémoire, lien réseau. Un cluster en compte de quelques centaines à plusieurs milliers. Chaque nœud peut fonctionner seul ; la puissance vient de leur coopération sur un même problème. Si un nœud est une maison, le cluster est la ville.

Les accélérateurs, le plus souvent des GPU, contiennent des milliers de petits cœurs spécialisés. Conçus à l’origine pour le graphisme, ils excellent dans le calcul mathématique répétitif, simulation comme IA. Sur la bonne charge, un GPU dépasse un processeur classique d’un facteur dix ou plus. Un nœud en porte souvent plusieurs.

L’interconnect vise une latence de l’ordre de la microseconde, soit, en ordre de grandeur, cent à mille fois moins qu’un réseau de bureau, selon la pile logicielle. On y trouve surtout InfiniBand et de l’Ethernet haut débit.

Le stockage parallèle est un système de fichiers partagé par tous les nœuds. Son débit agrégé va de quelques dizaines de Go/s à plusieurs To/s selon la taille du système. Les données sont réparties sur de nombreux disques et serveurs. Les solutions courantes sont Lustre, IBM Storage Scale (anciennement Spectrum Scale, ou GPFS) et BeeGFS.

Avec des milliers d’utilisateurs et de jobs, personne ne peut lancer ce qu’il veut quand il veut. L’ordonnanceur :

  • met en file d’attente les jobs soumis ;
  • décide des priorités et applique des règles d’équité ;
  • réserve les ressources et démarre les jobs ;
  • comptabilise l’usage par projet ou par utilisateur.

L’outil de référence est Slurm, où l’on soumet un job avec la commande sbatch. Autres solutions : PBS ou OpenPBS, IBM LSF.

ÉtapeCe qui se passe
1. Écrire le scriptprogramme, ressources demandées, durée prévue
2. Soumettresbatch sur Slurm
3. Mise en filele job rejoint la file d’attente
4. Décisionpriorité et équité appliquées
5. Allocationdes nœuds sont réservés au job
6. Exécutioncalcul, communication, écriture
7. Libérationcomptabilité et notification

Les mêmes étapes vues comme les états successifs du job :

stateDiagram-v2
  state "Script écrit" as Script
  state "Soumis" as Soumis
  state "En file" as EnFile
  state "Priorisé" as Decide
  state "Alloué" as Alloue
  state "En exécution" as Exec
  state "Libéré" as Libere
  [*] --> Script
  Script --> Soumis: sbatch
  Soumis --> EnFile
  EnFile --> Decide: priorité et équité
  Decide --> Alloue: nœuds réservés
  Alloue --> Exec
  Exec --> Libere: fin du calcul
  Libere --> [*]: comptabilité, notification

L’utilisateur ne choisit pas lui-même un nœud de calcul pour y lancer son travail : il passe par le nœud de connexion, d’où il soumet son job à l’ordonnanceur. Beaucoup de sites autorisent ensuite une connexion SSH aux nœuds alloués à l’un de ses jobs en cours, pour suivre son exécution, mais pas aux autres.

Révisé le 2 octobre 2026 : latence de l’interconnect présentée comme un ordre de grandeur (de l’ordre de la microseconde, cent à mille fois moins qu’un réseau de bureau selon la pile logicielle). Affirmation non sourcée sur son coût retirée ; IBM Storage Scale à la place de Spectrum Scale, débits du stockage parallèle harmonisés avec la formation de référence.