Aller au contenu

Transverse

Labs

Lire une configuration ne suffit pas à la comprendre. L’objectif du site est que chaque article technique renvoie vers un lab qui la reproduit sur un poste de travail. Ce n’est pas encore le cas partout : voici l’état réel.

LabSujetÉtat
labs/VMLLMVictoriaMetrics comme backend d’observabilité des LLM, support de la formation VictoriaMetricspublié sur la forge
labs/HPCOBSpreuve de concept d’observabilité HPC, avec un simulateur d’entraînementpublié sur la forge
labs/genaiotelapplication RAG instrumentée avec OpenTelemetry, avec un module d’évaluationpublié sur la forge
labs/cardinality-cost-labexplosion de cardinalité et son coût, avec des profils de chargepublié sur la forge
labs/llm-observabilitykit des labs d’observabilité des LLM (OpenTelemetry, VictoriaMetrics, Tempo, Grafana, Phoenix, Qdrant, Ollama)en cours de correction, pas encore publié

Les articles qui n’ont pas encore de lab le disent et une configuration publiée sans avoir été exécutée de bout en bout porte un encadré qui le signale.

Les kits à venir fourniront un dossier .devcontainer/ ; les labs déjà publiés sur la forge n’en ont pas encore. Une fois le kit publié, la pile pourra s’ouvrir dans VS Code (Dev Containers), ou dans GitHub Codespaces si le dépôt est aussi publié sur GitHub.

Le vrai tableau de bord Grafana du lab HPCOBS, filmé en direct (1 min 36). Les données viennent du simulateur du lab : un entraînement sur 4 GPU, puis deux pannes provoquées volontairement. L’utilisation GPU reste au-dessus de 90 % pendant que l’attente des données monte et que le MFU chute ; ensuite les gradients explosent alors que l’infrastructure paraît normale. Sous-titres en anglais, la langue du tableau de bord. Le code du lab est en accès libre sur la forge (dépôt de code public).Musique : « Radar Focus », Blue Saga (Epidemic Sound).
  1. Cloner le dépôt du lab depuis la forge.

  2. Lancer la pile avec docker compose up. Aucun compte n’est nécessaire, mais il faut télécharger les images de conteneurs et, pour les labs d’IA, les modèles locaux, soit plusieurs gigaoctets au premier lancement.

  3. Suivre le scénario décrit dans README.md. On y provoque l’incident, on l’observe, puis on le corrige.

  4. Vérifier le résultat avec les contrôles indiqués dans le README.md, quand le lab en fournit.