Technique
Anatomie d'un cluster
Pour : ingénieurs et SRE · architectes · managers d’équipe · direction et DSIPrérequis : Aucun.
Les cinq composants d’un cluster
Section intitulée « Les cinq composants d’un cluster »| Composant | Rôle |
|---|---|
| Nœud de connexion | préparer et soumettre le travail |
| Ordonnanceur | file d’attente, priorités, allocation des ressources |
| Nœuds de calcul | les serveurs qui calculent, avec processeurs et accélérateurs |
| Interconnect | le réseau très rapide entre les nœuds |
| Stockage parallèle | le système de fichiers partagé et performant |
Le travail suit toujours le même chemin. L’utilisateur le prépare sur le nœud de connexion et le soumet à l’ordonnanceur, qui réserve des nœuds de calcul. Ces nœuds communiquent par l’interconnect et lisent ou écrivent sur le stockage parallèle.
flowchart TB
U["Utilisateur"] --> L["Nœud de<br/>connexion"]
L -->|"soumet"| S["Ordonnanceur"]
S -->|"réserve"| C1["Nœud de calcul 1<br/>CPU, GPU"]
S -->|"réserve"| C2["Nœud de calcul 2<br/>CPU, GPU"]
C1 <--> IC["Interconnect"]
C2 <--> IC
C1 <--> FS[("Stockage<br/>parallèle")]
C2 <--> FS
Nœuds de calcul et accélérateurs
Section intitulée « Nœuds de calcul et accélérateurs »Un nœud est un serveur puissant : processeurs, mémoire, lien réseau. Un cluster en compte de quelques centaines à plusieurs milliers. Chaque nœud peut fonctionner seul ; la puissance vient de leur coopération sur un même problème. Si un nœud est une maison, le cluster est la ville.
Les accélérateurs, le plus souvent des GPU, contiennent des milliers de petits cœurs spécialisés. Conçus à l’origine pour le graphisme, ils excellent dans le calcul mathématique répétitif, simulation comme IA. Sur la bonne charge, un GPU dépasse un processeur classique d’un facteur dix ou plus. Un nœud en porte souvent plusieurs.
Interconnect et stockage parallèle
Section intitulée « Interconnect et stockage parallèle »L’interconnect vise une latence de l’ordre de la microseconde, soit, en ordre de grandeur, cent à mille fois moins qu’un réseau de bureau, selon la pile logicielle. On y trouve surtout InfiniBand et de l’Ethernet haut débit.
Le stockage parallèle est un système de fichiers partagé par tous les nœuds. Son débit agrégé va de quelques dizaines de Go/s à plusieurs To/s selon la taille du système. Les données sont réparties sur de nombreux disques et serveurs. Les solutions courantes sont Lustre, IBM Storage Scale (anciennement Spectrum Scale, ou GPFS) et BeeGFS.
L’ordonnanceur, contrôleur aérien du cluster
Section intitulée « L’ordonnanceur, contrôleur aérien du cluster »Avec des milliers d’utilisateurs et de jobs, personne ne peut lancer ce qu’il veut quand il veut. L’ordonnanceur :
- met en file d’attente les jobs soumis ;
- décide des priorités et applique des règles d’équité ;
- réserve les ressources et démarre les jobs ;
- comptabilise l’usage par projet ou par utilisateur.
L’outil de référence est Slurm, où l’on soumet un job avec la commande sbatch. Autres solutions : PBS ou OpenPBS, IBM LSF.
La vie d’un job en sept étapes
Section intitulée « La vie d’un job en sept étapes »| Étape | Ce qui se passe |
|---|---|
| 1. Écrire le script | programme, ressources demandées, durée prévue |
| 2. Soumettre | sbatch sur Slurm |
| 3. Mise en file | le job rejoint la file d’attente |
| 4. Décision | priorité et équité appliquées |
| 5. Allocation | des nœuds sont réservés au job |
| 6. Exécution | calcul, communication, écriture |
| 7. Libération | comptabilité et notification |
Les mêmes étapes vues comme les états successifs du job :
stateDiagram-v2 state "Script écrit" as Script state "Soumis" as Soumis state "En file" as EnFile state "Priorisé" as Decide state "Alloué" as Alloue state "En exécution" as Exec state "Libéré" as Libere [*] --> Script Script --> Soumis: sbatch Soumis --> EnFile EnFile --> Decide: priorité et équité Decide --> Alloue: nœuds réservés Alloue --> Exec Exec --> Libere: fin du calcul Libere --> [*]: comptabilité, notification
L’utilisateur ne choisit pas lui-même un nœud de calcul pour y lancer son travail : il passe par le nœud de connexion, d’où il soumet son job à l’ordonnanceur. Beaucoup de sites autorisent ensuite une connexion SSH aux nœuds alloués à l’un de ses jobs en cours, pour suivre son exécution, mais pas aux autres.
Révisé le 2 octobre 2026 : latence de l’interconnect présentée comme un ordre de grandeur (de l’ordre de la microseconde, cent à mille fois moins qu’un réseau de bureau selon la pile logicielle). Affirmation non sourcée sur son coût retirée ; IBM Storage Scale à la place de Spectrum Scale, débits du stockage parallèle harmonisés avec la formation de référence.