Aller au contenu

TechniqueDécouverte

Schéma en 3D : l'IA en coupe

Pour : ingénieurs et SRE · architectes · managers d’équipe · métiers et produitPrérequis : Aucun.

Mode de lecture

Une application d’IA générative ressemble à un gâteau à cinq étages : les données en bas, puis l’infrastructure de calcul, le modèle, l’orchestration (prompts, recherche documentaire, agents) et enfin l’application que voit l’utilisateur. Chaque couche peut dériver, chaque couche peut être attaquée. Ce schéma en vue éclatée ouvre la pile : cliquez sur une dalle pour lire sa fiche, basculez entre les signaux à Observer et les Risques, puis envoyez une requête pour suivre sa trace de haut en bas, aller et retour.

Faites glisser la pile pour la tourner, puis cliquez sur une couche (ou Entrée au clavier) pour ouvrir sa fiche. Les couches vont de la donnée, en bas, à l’application, en haut.

Données
Infrastructure
Modèle
Orchestration
Application

Ce qu’il faut observer, couche par couche

Ce qui peut mal tourner, couche par couche

  • Application
    • Retours des utilisateurs et abandons
    • Violations de la politique de contenu
    • Données personnelles détectées en sortie
    • OWASP LLM02Fuite d’informations sensibles en sortie
    • Contournement des garde-fous
    • Perte de confiance avant toute plainte
  • Orchestration
    • Trace de bout en bout de chaque requête (OpenTelemetry)
    • Pertinence des documents retrouvés
    • Tokens et appels d’outils par requête
    • OWASP LLM01Injection de prompt
    • Dérive de pipeline : découpage ou gabarit modifié en silence
    • OWASP LLM06Agent aux droits trop larges
  • Modèle
    • Score qualité par évaluation automatique
    • Écart par rapport à un jeu de référence
    • Version exacte du modèle à chaque appel
    • OWASP LLM09Hallucinations et désinformation
    • Dérive de concept : le monde change, pas le modèle
    • Mise à jour silencieuse chez le fournisseur
  • Infrastructure
    • Latence du premier token (TTFT)
    • Tokens par seconde, file d’attente, mémoire GPU
    • Coût par requête
    • Saturation et files d’attente
    • OWASP LLM10Consommation non bornée : coût qui s’emballe
    • Un GPU occupé ne dit rien de la qualité
  • Données
    • Fraîcheur et couverture des sources
    • Distribution des entrées par rapport à la référence
    • Données personnelles détectées dans les journaux
    • Dérive des données : les questions des utilisateurs changent
    • OWASP LLM04Empoisonnement des données ou du modèle
    • Sources périmées ou incomplètes

  1. Ouvrez la couche Modèle. Il prédit le mot suivant le plus probable sans vérifier les faits : sa qualité ne se lit ni dans la latence ni dans l’occupation des GPU, mais dans un score d’évaluation automatique.
  2. Passez en mode Risques et repérez les identifiants OWASP. L’injection de prompt (LLM01) vise l’orchestration, la fuite d’informations sensibles (LLM02) l’application, l’empoisonnement (LLM04) les données.
  3. Envoyez une requête. Elle traverse les cinq couches à l’aller puis au retour : c’est la trace qui relie leurs signaux et dit où chercher.

La même coupe en 2 min 21, couche par couche, avec une requête qui traverse toute la pile.

Lire le texte de la vidéo

Votre tableau de bord est au vert. Pourtant, votre assistant d’IA répond faux depuis des semaines. Une IA ne tombe pas en panne : elle se dégrade en silence. Une application d’IA générative, c’est une pile de cinq couches. Chacune peut dériver, chacune peut être attaquée. Ouvrons-la, couche par couche, en partant du bas.

Couche 1 : Données. Le carburant : documents internes, bases de connaissances, données d’entraînement et de RAG.

Ce qui peut mal tourner : Dérive des données : les questions des utilisateurs changent ; Empoisonnement des données ou du modèle (OWASP LLM04) ; Sources périmées ou incomplètes.

Ce qu’il faut observer : Fraîcheur et couverture des sources ; Distribution des entrées par rapport à la référence ; Données personnelles détectées dans les journaux.

Couche 2 : Infrastructure. La puissance de calcul : GPU, serveurs d’inférence, cloud ou cluster.

Ce qui peut mal tourner : Saturation et files d’attente ; Consommation non bornée : coût qui s’emballe (OWASP LLM10) ; Un GPU occupé ne dit rien de la qualité.

Ce qu’il faut observer : Latence du premier token (TTFT) ; Tokens par seconde, file d’attente, mémoire GPU ; Coût par requête.

Couche 3 : Modèle. Il prédit le mot suivant le plus probable ; il ne vérifie pas les faits.

Ce qui peut mal tourner : Hallucinations et désinformation (OWASP LLM09) ; Dérive de concept : le monde change, pas le modèle ; Mise à jour silencieuse chez le fournisseur.

Ce qu’il faut observer : Score qualité par évaluation automatique ; Écart par rapport à un jeu de référence ; Version exacte du modèle à chaque appel.

Couche 4 : Orchestration. La colle : prompts, recherche documentaire (RAG), agents et appels d’outils.

Ce qui peut mal tourner : Injection de prompt (OWASP LLM01) ; Dérive de pipeline : découpage ou gabarit modifié en silence ; Agent aux droits trop larges (OWASP LLM06).

Ce qu’il faut observer : Trace de bout en bout de chaque requête (OpenTelemetry) ; Pertinence des documents retrouvés ; Tokens et appels d’outils par requête.

Couche 5 : Application. Ce que voit l’utilisateur : assistant, chatbot, fonction métier.

Ce qui peut mal tourner : Fuite d’informations sensibles en sortie (OWASP LLM02) ; Contournement des garde-fous ; Perte de confiance avant toute plainte.

Ce qu’il faut observer : Retours des utilisateurs et abandons ; Violations de la politique de contenu ; Données personnelles détectées en sortie.

Une requête traverse les cinq couches, aller et retour. La trace relie leurs signaux : c’est elle qui dit où chercher.

Observer l’IA, de la donnée à la réponse : www.meantimetolearn.com.

Musique : « Radar Focus », Blue Saga (Epidemic Sound).

Une fois les cinq couches repérées, l’étape suivante est de comprendre ce qu’on observe à chacune : le guide Comprendre l’observabilité de l’IA générative pose les signaux, les types de systèmes et les niveaux de maturité.

Sources : OWASP Top 10 for LLM Applications 2025.

Révisé le 4 octobre 2026 : encart de progression ajouté, étape suivante vers le guide.