COMPRENDRE LES RISQUES
Glossaire des menaces IA
Les bons mots pour reconnaître les risques, de l’invite aux poids du modèle. Pour chaque menace : l’attaque type, la parade de référence, les outils libres, l’état de l’art, et ce que couvre le POC AI Guard.
Tableau des menaces
77 menaces affichées sur 77
| Menace | Attaque type · conséquence | Parade de référence | Outils libres | État de l’art | AI Guard |
|---|---|---|---|---|---|
| Prompts & instructions 9 | |||||
| LLM01:2025 | Un utilisateur demande au modèle d’ignorer les règles du développeur ou du système. | Frontières d’instructions strictes, filtrage des entrées, moindre privilège, validation des sorties, red teaming. |
| AtténuéAtténué, pas résolu | Partiel |
| LLM01:2025 | Une consigne malveillante est cachée dans une page web, un e-mail, un PDF, un enregistrement de base ou un document RAG. | Traiter les données récupérées comme non fiables ; séparer instructions et contenu ; permissions d’outils ; confirmation. |
| Non résoluProblème difficile, non résolu | Couvert |
| LLM01:2025 | Un texte malveillant stocké en mémoire ou dans une base vectorielle influence les sessions suivantes. | Provenance, assainissement à l’ingestion, zones de confiance, ACL sur la recherche. |
| Atténué | Partiel |
| LLM01:2025 | Des prompts adverses contournent les protections du modèle. | Alignement de sécurité, classifieurs, garde-fous à l’exécution et tests continus. |
| Non résoluPas de solution universelle | Partiel |
| LLM07:2025 | Le modèle est amené à révéler ses instructions cachées ou sa configuration. | Ne jamais placer de vrai secret dans un prompt ; isoler les secrets ; filtrer les sorties. |
| Atténué | Partiel |
| LLM01:2025 | Un contenu moins fiable prend le pas sur les instructions de confiance. | Hiérarchie des instructions et segmentation du contexte. |
| Atténué | Partiel |
| LLM01:2025 | Base64, Unicode, homoglyphes, ROT ou caractères invisibles déjouent les filtres. | Canoniser et normaliser les entrées ; décoder avant d’analyser. |
| Atténué | Partiel |
| LLM01:2025 | L’attaque est formulée dans une langue peu dotée pour échapper aux filtres de sécurité. | Classifieurs de sécurité multilingues et tests adverses. |
| Atténué | Partiel |
| LLM01:2025 | Des instructions sont cachées dans une image, un son ou une vidéo. | Séparer perception et exécution ; OCR et inspection du contenu ; pas d’usage autonome des outils. |
| Non résoluÉmergent | Non couvert |
| Agents 11 | |||||
| LLM06:2025 | L’agent dispose de plus de droits que sa tâche n’en exige. | Moindre privilège, portées par outil, approbation humaine, bac à sable. |
| MaîtriséParades solides | Couvert |
| LLM06:2025 | Un prompt pousse le modèle à appeler des fonctions dangereuses. | Schémas explicites, validation, contrôle de policy autour de chaque appel. |
| Atténué | Couvert |
| LLM06:2025 | L’IA met son autorité légitime au service d’un attaquant. | Lier l’autorisation à l’utilisateur, pas au modèle ; jetons de capacité. |
| MaîtriséSchéma de sécurité établi | Couvert |
| LLM06:2025 | L’agent atteint des API d’administration, des fichiers ou des ressources cloud. | RBAC ou ABAC, bac à sable, comptes de service distincts. |
| Maîtrisé | Couvert |
| LLM06:2025 | L’IA envoie un e-mail ou de l’argent, supprime des données ou modifie l’infrastructure. | Approbation humaine des opérations lourdes de conséquences ; plafonds de transaction. |
| Maîtrisé | Couvert |
| LLM10:2025 | Un agent récursif consomme des ressources ou répète ses actions sans fin. | Nombre maximal d’étapes, budgets d’exécution, délais, coupe-circuits. |
| Maîtrisé | Partiel |
| LLM01:2025 | Un agent compromis transmet des instructions malveillantes à un autre agent. | Authentifier les messages entre agents ; protocoles structurés ; séparation des niveaux de confiance. |
| Atténué | Partiel |
| Un attaquant implante de faux souvenirs ou des consignes malveillantes dans la mémoire longue de l’agent. | Provenance, autorisation d’écriture, expiration, journaux immuables. |
| Atténué | Partiel | |
| LLM03:2025 | Un serveur d’outils cache des consignes dans sa description, ou la modifie discrètement après validation. | Épingler et relire les définitions d’outils ; détecter leurs changements ; liste blanche de serveurs. |
| Atténué | Couvert |
| L’agent emprunte les accès d’une personne ; après coup, rien ne distingue ce qu’il a fait de ce qu’elle a fait. | Identités propres aux agents, accès de courte durée, journaux attribués. |
| Atténué | Couvert | |
| Un agent en appelle un autre, qui en appelle un troisième ; plus personne ne vérifie au nom de qui agit le dernier. | Propager le mandat d’origine et le vérifier à chaque étape. |
| Non résoluÉmergent | Partiel | |
| RAG 5 | |||||
| LLM08:2025 | Un attaquant dépose des documents malveillants que l’IA ira ensuite chercher. | Sources de confiance en liste blanche, signature des documents, provenance, détection d’anomalies. |
| Atténué | Partiel |
| LLM08:2025 | Des embeddings ou des contenus altérés faussent la recherche. | Authentification, validation des documents, contrôles d’intégrité. |
| Selon le contexte | Partiel |
| LLM08:2025 | Des informations sensibles sont reconstituées à partir des embeddings. | Limiter les embeddings sensibles ; chiffrement et contrôle d’accès. |
| Atténué | Non couvert |
| LLM08:2025 | Un utilisateur obtient des documents qu’il n’a pas le droit de consulter. | Autorisation avant la recherche ; ACL par document. |
| Maîtrisé | Non couvert |
| LLM08:2025 | Le client A récupère les données du client B. | Cloisonnement strict des espaces de noms et authentification liée au client. |
| Maîtrisé | Non couvert |
| Modèle & entraînement 9 | |||||
| LLM04:2025 | Un attaquant injecte des échantillons manipulés dans les données d’entraînement. | Provenance des jeux de données, assainissement, détection d’anomalies, écriture restreinte. |
| Atténué | Partiel |
| LLM04:2025 | Des exemples malveillants modifient délibérément le comportement du modèle. | Jeux de données de confiance, tests différentiels, évaluation du modèle. |
| Atténué | Partiel |
| LLM04:2025 | Un déclencheur caché active un comportement malveillant. | Provenance du modèle, analyse, tests comportementaux. |
| Atténué | Non couvert |
| LLM03:2025 | Le modèle ou son code est modifié avant le déploiement. | Empreintes, signatures, chaînes de build reproductibles. |
| Maîtrisé | Non couvert |
| LLM03:2025 | Un modèle pickle ou PyTorch exécute du code au chargement. | Préférer des formats sûrs comme safetensors ; bac à sable ; analyser les modèles. |
| MaîtriséParade solide | Non couvert |
| Un attaquant dérobe les poids du modèle sur disque ou dans le cloud. | IAM, chiffrement, isolement réseau, journalisation. |
| Selon le contexte | Non couvert | |
| LLM10:2025 | Des requêtes répétées permettent d’approcher un modèle propriétaire. | Limites de débit, contrôle des sorties, détection, recherche sur le tatouage. |
| Atténué | Non couvert |
| Des propriétés ou des exemples sont retrouvés à partir des sorties du modèle. | Confidentialité différentielle ; sorties moins détaillées, sans scores de confiance. |
| Atténué | Non couvert | |
| Un attaquant détermine si les données d’une personne ont servi à l’entraînement. | Confidentialité différentielle, régularisation, sorties limitées. |
| Atténué | Non couvert | |
| Attaques adverses 4 | |||||
| Une infime perturbation de l’entrée change la classification. | Entraînement adverse, prétraitement robuste, ensembles de modèles. |
| Non résoluDépend du domaine | Non couvert | |
| Un autocollant, un patch ou un panneau trompe une caméra ou un modèle. | Fusion de capteurs, entraînement adverse, contrôles de robustesse. |
| Atténué | Non couvert | |
| Un motif ajouté à l’image renverse la décision d’un détecteur ou d’un classifieur. | Détection et entraînement robuste. |
| Atténué | Non couvert | |
| Une attaque conçue contre un modèle fonctionne aussi sur un autre. | Évaluation adverse et ingénierie de la robustesse. |
| Atténué | Non couvert | |
| Sorties 7 | |||||
| LLM05:2025 | La sortie de l’IA devient directement du SQL, du HTML ou une commande shell. | Traiter la sortie du modèle comme une entrée non fiable ; paramétrer ; encoder et valider. |
| Maîtrisé | Partiel |
| LLM05:2025 | Du code ou des commandes générés par l’IA partent sans relecture suffisante et introduisent une faille. | Relecture, analyse statique (SAST) en CI, maintien des contrôles de sécurité du projet. |
| Atténué | Partiel |
| LLM05:2025 | Le SQL généré par le modèle embarque la saisie de l’attaquant. | Requêtes paramétrées et interface de requête restreinte. |
| Maîtrisé | Partiel |
| LLM05:2025 | L’IA génère et exécute des commandes shell. | Éviter le shell ; API en liste blanche ; bac à sable. |
| Maîtrisé | Partiel |
| LLM05:2025 | Le HTML ou le Markdown généré contient du JavaScript malveillant. | Encodage et assainissement des sorties selon leur contexte. |
| Maîtrisé | Non couvert |
| Un navigateur ou un outil de l’IA atteint des adresses internes ou le service de métadonnées cloud. | Liste blanche de sortie, isolement réseau, validation des URL. |
| Maîtrisé | Non couvert | |
| Un nom de fichier produit par l’agent atteint un fichier non prévu. | Canonisation des chemins et répertoires cloisonnés. |
| Maîtrisé | Non couvert | |
| Confidentialité 5 | |||||
| LLM02:2025 | L’IA divulgue des données personnelles, des identifiants ou des secrets. | Minimisation des données, DLP, filtrage, contrôle d’accès. |
| Selon le contexte | Partiel |
| LLM02:2025 | Des prompts et des secrets finissent stockés dans les outils d’observabilité ou de traces. | Masquage, journalisation restreinte, chiffrement. |
| Maîtrisé | Couvert |
| LLM02:2025 | Des utilisateurs collent des clés d’API, des mots de passe ou du code source dans un prompt. | Détection des secrets avant l’envoi. |
| Maîtrisé | Couvert |
| LLM02:2025 | Le modèle recrache des exemples confidentiels vus à l’entraînement. | Dédoublonnage, entraînement confidentiel, confidentialité différentielle, filtres de sortie. |
| Atténué | Non couvert |
| LLM02:2025 | L’IA déduit des attributs qui n’ont jamais été communiqués. | Minimisation des données, sorties restreintes, tests de confidentialité. |
| Atténué | Non couvert |
| Chaîne d’approvisionnement 5 | |||||
| LLM03:2025 | Un modèle malveillant est publié sur un hub de modèles. | Vérifier l’éditeur, l’empreinte et la signature ; analyser l’artefact. |
| Maîtrisé | Non couvert |
| LLM03:2025 | Une dépendance Python ou npm malveillante atteint la pile IA. | Fichiers de verrouillage, SBOM, signature, analyse. |
| Maîtrisé | Partiel |
| LLM03:2025 | Un attaquant publie une bibliothèque IA au nom presque identique. | Registre interne, contrôle des espaces de noms, fichiers de verrouillage. |
| Maîtrisé | Partiel |
| LLM03:2025 | PyTorch, une bibliothèque ou la chaîne d’outils sont altérés. | Builds de confiance, empreintes, SBOM, artefacts signés. |
| Maîtrisé | Non couvert |
| LLM03:2025 | Un format de type pickle embarque une charge exécutable. | Safetensors ou une autre représentation non exécutable. |
| Maîtrisé | Non couvert |
| Infrastructure 5 | |||||
| Un notebook compromis expose des identifiants cloud. | Identité de charge de travail, identifiants de courte durée, coffre à secrets. |
| Maîtrisé | Non couvert | |
| Une clé fuit par le code, les journaux ou le modèle. | Gestion des secrets, rotation des clés, portées limitées. |
| Maîtrisé | Partiel | |
| Une vulnérabilité de la pile de service du modèle est exploitée. | Gestion des correctifs, isolement des conteneurs, authentification. |
| Maîtrisé | Non couvert | |
| Un modèle ou du code malveillant s’échappe de son bac à sable. | seccomp, espaces de noms, isolement par VM. |
| Selon le contexte | Non couvert | |
| Un serveur Jupyter permet d’exécuter du code arbitraire. | Authentification, isolement réseau, bac à sable par utilisateur. |
| Maîtrisé | Non couvert | |
| Disponibilité & coûts 4 | |||||
| LLM10:2025 | Des prompts extrêmement coûteux saturent le modèle. | Quotas, limites de débit, plafonds de taille et de jetons. |
| Maîtrisé | Partiel |
| LLM10:2025 | Un attaquant fait délibérément exploser la facture d’API ou de cloud. | Budgets et limites par utilisateur ; alertes de dépense. |
| Maîtrisé | Partiel |
| LLM10:2025 | Des entrées sont conçues pour maximiser la charge d’inférence. | Plafonds de jetons et de taille d’entrée, délais. |
| Maîtrisé | Non couvert |
| LLM10:2025 | Des tâches malveillantes accaparent tous les accélérateurs. | Quotas Kubernetes et limites d’ordonnancement. |
| Maîtrisé | Non couvert |
| Intégrité & confiance 3 | |||||
| LLM09:2025 | Un attaquant compte sur la confiance accordée à une information inventée. | Ancrage dans des sources, recherche, vérification, approbation avant d’agir. |
| AtténuéPas entièrement résolu | Partiel |
| LLM09:2025 | Le modèle invente des URL ou des sources. | Résoudre et vérifier les sources citées par programme. |
| Selon le contexte | Non couvert |
| Un attaquant modifie une source d’information qui fait autorité. | Données signées, provenance, pondération des sources. |
| Maîtrisé | Non couvert | |
| Abus humains 5 | |||||
| L’IA produit à grande échelle une ingénierie sociale personnalisée. | Sécurité de la messagerie, DMARC, vérification des utilisateurs, détection d’anomalies. |
| Atténué | Partiel | |
| Un faux audio ou une fausse vidéo sert à frauder ou à contourner une authentification. | Authentification hors bande, détection du vivant, provenance cryptographique. |
| Atténué | Partiel | |
| Une voix de synthèse imite un collaborateur ou un proche. | Ne jamais accepter une voix seule comme authentification. |
| Maîtrisé | Partiel | |
| L’IA réduit l’effort nécessaire pour écrire ou modifier du code malveillant. | Détection endpoint et réseau existante, surveillance des abus. |
| Atténué | Non couvert | |
| L’IA accélère la reconnaissance et l’exploitation. | Gestion de la surface d’attaque, IDS, correctifs. |
| Atténué | Non couvert | |
| Gouvernance 5 | |||||
| Des collaborateurs envoient des données de l’entreprise vers des outils IA non autorisés. | Inventaire des applications, contrôles sur les postes, services approuvés. |
| Maîtrisé | Partiel | |
| LLM03:2025 | L’organisation ignore l’origine, les données ou la version de ses modèles. | Inventaire IA et ML, provenance, SBOM et ML-BOM. |
| Maîtrisé | Partiel |
| Les vulnérabilités ne sont découvertes qu’après le déploiement. | Évaluation adverse continue dans la CI/CD. |
| Maîtrisé | Non couvert | |
| Une nouvelle version du modèle ou du prompt réintroduit des vulnérabilités. | Suite de non-régression de sécurité avant chaque mise en production. |
| Maîtrisé | Non couvert | |
| Personne ne peut prouver après coup ce que l’agent a fait, pourquoi, ni qui l’a approuvé ; les journaux sont réécrivables. | Journaux en ajout seul et infalsifiables, décisions signées, preuves exportables. |
| Maîtrisé | Couvert | |
La colonne AI Guard décrit le POC tel qu’il est livré, pas une promesse : seul « Couvert » signifie que l’action n’a pas lieu. Les outils cités sont libres ou open source, à titre indicatif. Explorer le relevé de couverture ↗