Caesar AI Atlas

Sécurité des LLM

Un hub centré sur la sécurité pour les risques et contrôles liés aux grands modèles de langage, systèmes de récupération, prompts, guardrails et sorties de modèles.

security teamsdevelopersAI governance leadslegal and compliance teams

34

Termes

9

Comparaisons

8

Questions

À propos de ce sujet

Aperçu

La sécurité des LLM couvre les façons dont les applications fondées sur des modèles de langage peuvent être attaquées, détournées ou mal configurées. Elle combine la sécurité applicative classique avec les contrôles de prompts, la gouvernance de la récupération, le contrôle d’accès et l’évaluation des sorties.

Pourquoi c'est important

Les défaillances des LLM peuvent exposer des fichiers confidentiels, produire des conseils dangereux, faire fuiter des données via les prompts ou affaiblir la confiance dans les workflows automatisés. Les équipes sécurité ont besoin d’un vocabulaire qui relie le comportement du modèle aux contrôles pratiques.

Contexte de conformité

Pertinent pour la due diligence fournisseurs, les revues de déploiement sécurisé, les preuves d’audit IA, les programmes de red team et la réponse aux incidents pour les applications LLM.

Points clés

  • 1Le prompt injection n’est pas la même chose qu’un jailbreak.
  • 2Le RAG améliore le grounding uniquement lorsque la récupération et le contrôle d’accès sont gouvernés.
  • 3Les guardrails sont utiles, mais ne remplacent pas une conception sécurisée.
  • 4La revue de sécurité doit couvrir les prompts, les outils, les sources de récupération, les logs et l’escalade humaine.

Termes clés

Comparaisons associées

Alternative technique

RAG vs ajustement fin

Comparaison côte à côte entre la génération augmentée par récupération (RAG) et l’ajustement fin. Comprendre quand récupérer un contexte externe au moment de l’exécution et quand adapter un modèle préentraîné au moyen d’un entraînement supplémentaire.

Hiérarchie

Injection de prompt vs jailbreak

Distinguer l’injection de prompt, qui détourne le comportement du modèle au moyen d’une entrée malveillante, du jailbreak, qui contourne les garde-fous de sécurité pour produire du contenu restreint. Les deux sont des menaces de sécurité pour les LLM, mais diffèrent par leur mécanisme et leur objectif.

Attaque / Défaillance

Injection de prompt vs empoisonnement des données

Comparaison côte à côte entre l’injection de prompt et l’empoisonnement des données. Comprendre comment la manipulation d’instructions à l’exécution diffère des attaques visant les données d’entraînement ou le processus d’entraînement.

Risque vs Contrôle

Garde-fous vs modération de contenu / filtres de sécurité

Comparaison côte à côte des garde-fous et de la modération de contenu / filtres de sécurité. Comprendre la différence entre des limites larges du système d’IA et des contrôles spécifiques des contenus préjudiciables ou interdits.

Architecture

Prompt système vs prompt utilisateur

Comparaison côte à côte du prompt système et du prompt utilisateur. Elle explique comment les instructions de comportement au niveau de l’application diffèrent de la tâche ou question immédiate fournie par un utilisateur.

Gouvernance

Red teaming vs Audit d’IA

Comparaison côte à côte entre red teaming et audit d’IA. Elle explique comment des tests adversariaux structurés diffèrent d’une évaluation formelle d’un système, d’un modèle ou d’un processus de gouvernance par rapport à des critères définis.

Risque vs Contrôle

Sécurité dès la conception vs Garde-fous

Comparaison côte à côte entre la sécurité dès la conception et les garde-fous. Elle explique en quoi la planification de la sécurité sur tout le cycle de vie diffère des contrôles spécifiques qui maintiennent les systèmes d’IA dans des limites acceptables.

Confusion fréquente

Hallucination vs confabulation

Comparaison côte à côte de l’hallucination et de la confabulation. Comprendre comment les deux décrivent des sorties d’IA plausibles mais non étayées ou fabriquées, et pourquoi hallucination est souvent le terme opérationnel plus large.

Confusion fréquente

Ancrage vs caractère ancré

Comparaison côte à côte de l’ancrage et du caractère ancré. Comprendre la différence entre le processus de connexion des sorties à des sources et la propriété d’une sortie soutenue par des preuves.

Questions fréquentes

Pourquoi le RAG peut-il créer des risques pour la vie privée et la sécurité ?

La génération augmentée par récupération (RAG) est une technique qui combine l’IA générative avec la récupération d’informations depuis des sources de données externes. Le modèle utilise des documents, passages ou enregistrements récupérés comme contexte d’ancrage pour produire des réponses plus actuelles, spécifiques et vérifiables.

1 termes associésintermediate

Que sont les garde-fous dans un système LLM ?

Les garde-fous sont des contrôles techniques, procéduraux ou de politique conçus pour maintenir les systèmes d’IA dans des limites acceptables. Ils peuvent réduire des risques tels que les sorties nuisibles, les fuites de données, les accès non autorisés, les violations de politiques ou les comportements dangereux.

1 termes associésintermediate

Qu’est-ce que l’ancrage dans l’IA générative ?

L’ancrage est le processus qui consiste à relier la sortie d’un modèle d’IA à des sources d’information fiables et vérifiables au moment de l’inférence. Dans l’IA générative, il contribue à améliorer la fiabilité factuelle en fournissant un contexte pertinent sans modifier les poids sous-jacents du modèle.

1 termes associésintermediate

Qu’est-ce qu’une hallucination dans un système d’IA ?

Une hallucination est une sortie générée par l’IA qui semble plausible ou confiante, mais qui est fausse, non étayée, trompeuse ou fabriquée. Dans l’IA générative, les hallucinations peuvent inclure des faits incorrects, des sources inventées, de fausses citations ou un raisonnement qui n’est pas ancré dans des preuves fiables.

1 termes associésintermediate

En quoi un prompt système diffère-t-il d’un prompt utilisateur ?

Utilisez le prompt système pour les instructions et contraintes durables de l’application ; utilisez le prompt utilisateur pour la demande immédiate de l’utilisateur, son contexte et le résultat souhaité.

1 termes associésintermediate

Qu’est-ce que le red teaming pour les LLM ?

Le red teaming est un processus structuré de test adversarial utilisé pour identifier les faiblesses, les comportements dangereux ou les sorties nuisibles d’un système d’IA. Il consiste à sonder délibérément le système avec des entrées difficiles, malveillantes ou limites afin que les développeurs puissent évaluer et améliorer les protections.

1 termes associésintermediate

Qu’est-ce que l’empoisonnement des données dans les systèmes d’IA ?

L’empoisonnement des données est une attaque adversariale dans laquelle un acteur malveillant interfère avec les données ou le processus d’entraînement utilisés pour construire un modèle. En insérant, modifiant ou corrompant des exemples d’entraînement, l’attaquant cherche à manipuler le comportement du modèle, à dégrader ses performances ou à créer des défaillances ciblées.

1 termes associésadvanced

Qu’est-ce que la modération du contenu pour les sorties d’IA ?

La modération du contenu et les filtres de sécurité sont des contrôles conçus pour détecter, bloquer, réduire ou escalader les contenus nuisibles, illégaux ou interdits par les politiques. Dans les systèmes d’IA, ils sont souvent combinés à des règles de politique, des classificateurs basés sur des modèles, une journalisation et une revue humaine pour les cas à plus haut risque.

1 termes associésadvanced