Aller au tableau des menaces
Accueil

COMPRENDRE LES RISQUES

Glossaire des menaces IA

Les bons mots pour reconnaître les risques, de l’invite aux poids du modèle. Pour chaque menace : l’attaque type, la parade de référence, les outils libres, l’état de l’art, et ce que couvre le POC AI Guard.

Tableau des menaces

Filtrer par usage IA

Filtrer par couverture AI Guard

Couvert : un contrôle livré bloque ou retient l’action sur le chemin supervisé. Partiel : il détecte, orchestre un outil tiers, atteste une mesure ou ne tient qu’une facette. Non couvert : aucun contrôle AI Guard.

77 menaces affichées sur 77

Menaces cyber de l’IA : attaque type, parade de référence, outils libres, état de l’art et couverture AI Guard. Chaque nom de menace ouvre son détail.
MenaceAttaque type · conséquenceParade de référenceOutils libresÉtat de l’artAI Guard
Prompts & instructions 9
LLM01:2025Un utilisateur demande au modèle d’ignorer les règles du développeur ou du système.Frontières d’instructions strictes, filtrage des entrées, moindre privilège, validation des sorties, red teaming.
  • NeMo Guardrails
  • garak
  • Promptfoo
  • PyRIT
  • Giskard
AtténuéAtténué, pas résoluPartiel
LLM01:2025Une consigne malveillante est cachée dans une page web, un e-mail, un PDF, un enregistrement de base ou un document RAG.Traiter les données récupérées comme non fiables ; séparer instructions et contenu ; permissions d’outils ; confirmation.
  • NeMo Guardrails
  • Promptfoo
  • garak
Non résoluProblème difficile, non résoluCouvert
LLM01:2025Un texte malveillant stocké en mémoire ou dans une base vectorielle influence les sessions suivantes.Provenance, assainissement à l’ingestion, zones de confiance, ACL sur la recherche.
  • Promptfoo
  • Filtres RAG sur mesure
AtténuéPartiel
LLM01:2025Des prompts adverses contournent les protections du modèle.Alignement de sécurité, classifieurs, garde-fous à l’exécution et tests continus.
  • garak
  • PyRIT
  • Promptfoo
  • DeepTeam
Non résoluPas de solution universellePartiel
LLM07:2025Le modèle est amené à révéler ses instructions cachées ou sa configuration.Ne jamais placer de vrai secret dans un prompt ; isoler les secrets ; filtrer les sorties.
  • garak
  • Promptfoo
  • PyRIT
AtténuéPartiel
LLM01:2025Un contenu moins fiable prend le pas sur les instructions de confiance.Hiérarchie des instructions et segmentation du contexte.
  • Guardrails
  • Moteur de policy maison
AtténuéPartiel
LLM01:2025Base64, Unicode, homoglyphes, ROT ou caractères invisibles déjouent les filtres.Canoniser et normaliser les entrées ; décoder avant d’analyser.
  • PyRIT
  • Promptfoo
  • Bibliothèques de sécurité Unicode
AtténuéPartiel
LLM01:2025L’attaque est formulée dans une langue peu dotée pour échapper aux filtres de sécurité.Classifieurs de sécurité multilingues et tests adverses.
  • garak
  • Promptfoo
AtténuéPartiel
LLM01:2025Des instructions sont cachées dans une image, un son ou une vidéo.Séparer perception et exécution ; OCR et inspection du contenu ; pas d’usage autonome des outils.
  • Outils de recherche
  • Red teaming multimodal
Non résoluÉmergentNon couvert
Agents 11
LLM06:2025L’agent dispose de plus de droits que sa tâche n’en exige.Moindre privilège, portées par outil, approbation humaine, bac à sable.
  • Open Policy Agent (OPA)
  • Conteneurs
MaîtriséParades solidesCouvert
LLM06:2025Un prompt pousse le modèle à appeler des fonctions dangereuses.Schémas explicites, validation, contrôle de policy autour de chaque appel.
  • OPA
  • Guardrails
AtténuéCouvert
LLM06:2025L’IA met son autorité légitime au service d’un attaquant.Lier l’autorisation à l’utilisateur, pas au modèle ; jetons de capacité.
  • OPA
  • Portées OAuth
MaîtriséSchéma de sécurité établiCouvert
LLM06:2025L’agent atteint des API d’administration, des fichiers ou des ressources cloud.RBAC ou ABAC, bac à sable, comptes de service distincts.
  • OPA
  • SELinux
  • AppArmor
  • Conteneurs
MaîtriséCouvert
LLM06:2025L’IA envoie un e-mail ou de l’argent, supprime des données ou modifie l’infrastructure.Approbation humaine des opérations lourdes de conséquences ; plafonds de transaction.
  • Moteurs de workflow
  • OPA
MaîtriséCouvert
LLM10:2025Un agent récursif consomme des ressources ou répète ses actions sans fin.Nombre maximal d’étapes, budgets d’exécution, délais, coupe-circuits.
  • Contrôles applicatifs
MaîtriséPartiel
LLM01:2025Un agent compromis transmet des instructions malveillantes à un autre agent.Authentifier les messages entre agents ; protocoles structurés ; séparation des niveaux de confiance.
  • OPA
  • Validation sur mesure
AtténuéPartiel
Un attaquant implante de faux souvenirs ou des consignes malveillantes dans la mémoire longue de l’agent.Provenance, autorisation d’écriture, expiration, journaux immuables.
  • ACL de base vectorielle
  • Contrôles sur mesure
AtténuéPartiel
LLM03:2025Un serveur d’outils cache des consignes dans sa description, ou la modifie discrètement après validation.Épingler et relire les définitions d’outils ; détecter leurs changements ; liste blanche de serveurs.
  • mcp-scan
  • Épinglage des outils
AtténuéCouvert
L’agent emprunte les accès d’une personne ; après coup, rien ne distingue ce qu’il a fait de ce qu’elle a fait.Identités propres aux agents, accès de courte durée, journaux attribués.
  • SPIFFE/SPIRE
  • Comptes de service dédiés
AtténuéCouvert
Un agent en appelle un autre, qui en appelle un troisième ; plus personne ne vérifie au nom de qui agit le dernier.Propager le mandat d’origine et le vérifier à chaque étape.
  • OPA
  • Échange de jetons OAuth
Non résoluÉmergentPartiel
RAG 5
LLM08:2025Un attaquant dépose des documents malveillants que l’IA ira ensuite chercher.Sources de confiance en liste blanche, signature des documents, provenance, détection d’anomalies.
  • Promptfoo
  • Giskard
AtténuéPartiel
LLM08:2025Des embeddings ou des contenus altérés faussent la recherche.Authentification, validation des documents, contrôles d’intégrité.
  • Qdrant (ACL)
  • Milvus (ACL)
Selon le contextePartiel
LLM08:2025Des informations sensibles sont reconstituées à partir des embeddings.Limiter les embeddings sensibles ; chiffrement et contrôle d’accès.
  • Chiffrement et contrôle d’accès standard
AtténuéNon couvert
LLM08:2025Un utilisateur obtient des documents qu’il n’a pas le droit de consulter.Autorisation avant la recherche ; ACL par document.
  • OPA
  • ACL de base vectorielle
MaîtriséNon couvert
LLM08:2025Le client A récupère les données du client B.Cloisonnement strict des espaces de noms et authentification liée au client.
  • ACL de base de données et vectorielle
MaîtriséNon couvert
Modèle & entraînement 9
LLM04:2025Un attaquant injecte des échantillons manipulés dans les données d’entraînement.Provenance des jeux de données, assainissement, détection d’anomalies, écriture restreinte.
  • Frameworks de validation de données
  • ART
AtténuéPartiel
LLM04:2025Des exemples malveillants modifient délibérément le comportement du modèle.Jeux de données de confiance, tests différentiels, évaluation du modèle.
  • garak
  • Giskard
  • ART
AtténuéPartiel
LLM04:2025Un déclencheur caché active un comportement malveillant.Provenance du modèle, analyse, tests comportementaux.
  • ModelScan
  • Fickling
  • garak
AtténuéNon couvert
LLM03:2025Le modèle ou son code est modifié avant le déploiement.Empreintes, signatures, chaînes de build reproductibles.
  • Sigstore/cosign
  • Signature Git
MaîtriséNon couvert
LLM03:2025Un modèle pickle ou PyTorch exécute du code au chargement.Préférer des formats sûrs comme safetensors ; bac à sable ; analyser les modèles.
  • ModelScan
  • Fickling
MaîtriséParade solideNon couvert
Un attaquant dérobe les poids du modèle sur disque ou dans le cloud.IAM, chiffrement, isolement réseau, journalisation.
  • Pile IAM et sécurité open source
Selon le contexteNon couvert
LLM10:2025Des requêtes répétées permettent d’approcher un modèle propriétaire.Limites de débit, contrôle des sorties, détection, recherche sur le tatouage.
  • Passerelles d’API
  • Limitation de débit
AtténuéNon couvert
Des propriétés ou des exemples sont retrouvés à partir des sorties du modèle.Confidentialité différentielle ; sorties moins détaillées, sans scores de confiance.
  • Opacus
  • TensorFlow Privacy
AtténuéNon couvert
Un attaquant détermine si les données d’une personne ont servi à l’entraînement.Confidentialité différentielle, régularisation, sorties limitées.
  • ART
  • Opacus
AtténuéNon couvert
Attaques adverses 4
Une infime perturbation de l’entrée change la classification.Entraînement adverse, prétraitement robuste, ensembles de modèles.
  • IBM Adversarial Robustness Toolbox (ART)
Non résoluDépend du domaineNon couvert
Un autocollant, un patch ou un panneau trompe une caméra ou un modèle.Fusion de capteurs, entraînement adverse, contrôles de robustesse.
  • ART
AtténuéNon couvert
Un motif ajouté à l’image renverse la décision d’un détecteur ou d’un classifieur.Détection et entraînement robuste.
  • ART
AtténuéNon couvert
Une attaque conçue contre un modèle fonctionne aussi sur un autre.Évaluation adverse et ingénierie de la robustesse.
  • ART
AtténuéNon couvert
Sorties 7
LLM05:2025La sortie de l’IA devient directement du SQL, du HTML ou une commande shell.Traiter la sortie du modèle comme une entrée non fiable ; paramétrer ; encoder et valider.
  • Semgrep
  • Bibliothèques OWASP
MaîtriséPartiel
LLM05:2025Du code ou des commandes générés par l’IA partent sans relecture suffisante et introduisent une faille.Relecture, analyse statique (SAST) en CI, maintien des contrôles de sécurité du projet.
  • Semgrep
  • Bandit
AtténuéPartiel
LLM05:2025Le SQL généré par le modèle embarque la saisie de l’attaquant.Requêtes paramétrées et interface de requête restreinte.
  • SQLAlchemy
  • Droits de base de données
MaîtriséPartiel
LLM05:2025L’IA génère et exécute des commandes shell.Éviter le shell ; API en liste blanche ; bac à sable.
  • seccomp
  • Conteneurs
MaîtriséPartiel
LLM05:2025Le HTML ou le Markdown généré contient du JavaScript malveillant.Encodage et assainissement des sorties selon leur contexte.
  • DOMPurify
  • OWASP Java Encoder
MaîtriséNon couvert
Un navigateur ou un outil de l’IA atteint des adresses internes ou le service de métadonnées cloud.Liste blanche de sortie, isolement réseau, validation des URL.
  • Pare-feu et proxys
  • OPA
MaîtriséNon couvert
Un nom de fichier produit par l’agent atteint un fichier non prévu.Canonisation des chemins et répertoires cloisonnés.
  • Codage sécurisé standard
MaîtriséNon couvert
Confidentialité 5
LLM02:2025L’IA divulgue des données personnelles, des identifiants ou des secrets.Minimisation des données, DLP, filtrage, contrôle d’accès.
  • Microsoft Presidio
Selon le contextePartiel
LLM02:2025Des prompts et des secrets finissent stockés dans les outils d’observabilité ou de traces.Masquage, journalisation restreinte, chiffrement.
  • Presidio
  • Filtres OpenTelemetry
MaîtriséCouvert
LLM02:2025Des utilisateurs collent des clés d’API, des mots de passe ou du code source dans un prompt.Détection des secrets avant l’envoi.
  • Gitleaks
  • TruffleHog
MaîtriséCouvert
LLM02:2025Le modèle recrache des exemples confidentiels vus à l’entraînement.Dédoublonnage, entraînement confidentiel, confidentialité différentielle, filtres de sortie.
  • Opacus
  • Presidio
AtténuéNon couvert
LLM02:2025L’IA déduit des attributs qui n’ont jamais été communiqués.Minimisation des données, sorties restreintes, tests de confidentialité.
  • ART
  • Outils de confidentialité
AtténuéNon couvert
Chaîne d’approvisionnement 5
LLM03:2025Un modèle malveillant est publié sur un hub de modèles.Vérifier l’éditeur, l’empreinte et la signature ; analyser l’artefact.
  • ModelScan
  • Fickling
  • Sigstore
MaîtriséNon couvert
LLM03:2025Une dépendance Python ou npm malveillante atteint la pile IA.Fichiers de verrouillage, SBOM, signature, analyse.
  • Syft
  • Grype
  • Trivy
  • osv-scanner
MaîtriséPartiel
LLM03:2025Un attaquant publie une bibliothèque IA au nom presque identique.Registre interne, contrôle des espaces de noms, fichiers de verrouillage.
  • Contrôles pip et npm
  • Analyseurs de dépendances
MaîtriséPartiel
LLM03:2025PyTorch, une bibliothèque ou la chaîne d’outils sont altérés.Builds de confiance, empreintes, SBOM, artefacts signés.
  • Sigstore
  • Outillage SLSA
MaîtriséNon couvert
LLM03:2025Un format de type pickle embarque une charge exécutable.Safetensors ou une autre représentation non exécutable.
  • ModelScan
  • Fickling
MaîtriséNon couvert
Infrastructure 5
Un notebook compromis expose des identifiants cloud.Identité de charge de travail, identifiants de courte durée, coffre à secrets.
  • OpenBao / Vault
  • Outillage des secrets Kubernetes
MaîtriséNon couvert
Une clé fuit par le code, les journaux ou le modèle.Gestion des secrets, rotation des clés, portées limitées.
  • OpenBao / Vault
  • Gitleaks
  • TruffleHog
MaîtriséPartiel
Une vulnérabilité de la pile de service du modèle est exploitée.Gestion des correctifs, isolement des conteneurs, authentification.
  • Trivy
  • Falco
  • Kubernetes
MaîtriséNon couvert
Un modèle ou du code malveillant s’échappe de son bac à sable.seccomp, espaces de noms, isolement par VM.
  • Docker
  • Kata Containers
  • gVisor
Selon le contexteNon couvert
Un serveur Jupyter permet d’exécuter du code arbitraire.Authentification, isolement réseau, bac à sable par utilisateur.
  • JupyterHub
  • Conteneurs
MaîtriséNon couvert
Disponibilité & coûts 4
LLM10:2025Des prompts extrêmement coûteux saturent le modèle.Quotas, limites de débit, plafonds de taille et de jetons.
  • NGINX
  • Envoy
  • Kong
MaîtriséPartiel
LLM10:2025Un attaquant fait délibérément exploser la facture d’API ou de cloud.Budgets et limites par utilisateur ; alertes de dépense.
  • Passerelles d’API
  • Suivi de facturation
MaîtriséPartiel
LLM10:2025Des entrées sont conçues pour maximiser la charge d’inférence.Plafonds de jetons et de taille d’entrée, délais.
  • Contrôles de passerelle standard
MaîtriséNon couvert
LLM10:2025Des tâches malveillantes accaparent tous les accélérateurs.Quotas Kubernetes et limites d’ordonnancement.
  • Kubernetes
MaîtriséNon couvert
Intégrité & confiance 3
LLM09:2025Un attaquant compte sur la confiance accordée à une information inventée.Ancrage dans des sources, recherche, vérification, approbation avant d’agir.
  • Giskard
  • Frameworks d’évaluation
AtténuéPas entièrement résoluPartiel
LLM09:2025Le modèle invente des URL ou des sources.Résoudre et vérifier les sources citées par programme.
  • Validateurs sur mesure
Selon le contexteNon couvert
Un attaquant modifie une source d’information qui fait autorité.Données signées, provenance, pondération des sources.
  • Sigstore
  • Contrôles sur mesure
MaîtriséNon couvert
Abus humains 5
L’IA produit à grande échelle une ingénierie sociale personnalisée.Sécurité de la messagerie, DMARC, vérification des utilisateurs, détection d’anomalies.
  • SpamAssassin
AtténuéPartiel
Un faux audio ou une fausse vidéo sert à frauder ou à contourner une authentification.Authentification hors bande, détection du vivant, provenance cryptographique.
  • C2PA
AtténuéPartiel
Une voix de synthèse imite un collaborateur ou un proche.Ne jamais accepter une voix seule comme authentification.
  • MFA standard
MaîtriséPartiel
L’IA réduit l’effort nécessaire pour écrire ou modifier du code malveillant.Détection endpoint et réseau existante, surveillance des abus.
  • YARA
  • Sigma
  • Suricata
  • ClamAV
AtténuéNon couvert
L’IA accélère la reconnaissance et l’exploitation.Gestion de la surface d’attaque, IDS, correctifs.
  • Nuclei
  • Wazuh
  • Suricata
AtténuéNon couvert
Gouvernance 5
Des collaborateurs envoient des données de l’entreprise vers des outils IA non autorisés.Inventaire des applications, contrôles sur les postes, services approuvés.
  • Surveillance DNS et proxy
  • DLP
MaîtriséPartiel
LLM03:2025L’organisation ignore l’origine, les données ou la version de ses modèles.Inventaire IA et ML, provenance, SBOM et ML-BOM.
  • CycloneDX
MaîtriséPartiel
Les vulnérabilités ne sont découvertes qu’après le déploiement.Évaluation adverse continue dans la CI/CD.
  • garak
  • PyRIT
  • Promptfoo
  • Giskard
MaîtriséNon couvert
Une nouvelle version du modèle ou du prompt réintroduit des vulnérabilités.Suite de non-régression de sécurité avant chaque mise en production.
  • Promptfoo
  • garak
  • Giskard
MaîtriséNon couvert
Personne ne peut prouver après coup ce que l’agent a fait, pourquoi, ni qui l’a approuvé ; les journaux sont réécrivables.Journaux en ajout seul et infalsifiables, décisions signées, preuves exportables.
  • Sigstore Rekor
  • OpenTelemetry
MaîtriséCouvert

La colonne AI Guard décrit le POC tel qu’il est livré, pas une promesse : seul « Couvert » signifie que l’action n’a pas lieu. Les outils cités sont libres ou open source, à titre indicatif. Explorer le relevé de couverture