Débutant
Qu’est-ce que la sécurité des LLM ?
Un LLM, ou grand modèle de langage, est un modèle de langage doté d’un grand nombre de paramètres, entraîné sur de vastes données textuelles ou multimodales pour comprendre et générer du langage.
Qu’est-ce qu’une injection de prompt ?
L’injection de prompt est une technique adversariale qui manipule un modèle de langage en plaçant des instructions malveillantes ou non prévues dans une entrée utilisateur, des documents, des pages web ou d’autres contenus traités par le modèle.
Qu’est-ce qu’un jailbreak dans un système LLM ?
L’injection de prompt ou le jailbreak désigne une entrée adversariale destinée à contourner les instructions, les politiques de sécurité ou les contrôles opérationnels d’un modèle. Les mesures d’atténuation incluent le filtrage des entrées, l’isolation du retrieval, l’accès aux outils selon le moindre privilège, l’application de politiques et des garde-fous en couches.
En quoi le RAG diffère-t-il du fine-tuning ?
Utilisez le RAG lorsque le modèle a besoin d’informations actuelles, fondées sur des sources ; utilisez le fine-tuning lorsque le modèle doit apprendre un comportement spécialisé, une performance de tâche, une adaptation de domaine ou un style à partir de données.
Intermédiaire
Pourquoi le RAG peut-il créer des risques pour la vie privée et la sécurité ?
La génération augmentée par récupération (RAG) est une technique qui combine l’IA générative avec la récupération d’informations depuis des sources de données externes. Le modèle utilise des documents, passages ou enregistrements récupérés comme contexte d’ancrage pour produire des réponses plus actuelles, spécifiques et vérifiables.
Que sont les garde-fous dans un système LLM ?
Les garde-fous sont des contrôles techniques, procéduraux ou de politique conçus pour maintenir les systèmes d’IA dans des limites acceptables. Ils peuvent réduire des risques tels que les sorties nuisibles, les fuites de données, les accès non autorisés, les violations de politiques ou les comportements dangereux.
Qu’est-ce que l’ancrage dans l’IA générative ?
L’ancrage est le processus qui consiste à relier la sortie d’un modèle d’IA à des sources d’information fiables et vérifiables au moment de l’inférence. Dans l’IA générative, il contribue à améliorer la fiabilité factuelle en fournissant un contexte pertinent sans modifier les poids sous-jacents du modèle.
Qu’est-ce qu’une hallucination dans un système d’IA ?
Une hallucination est une sortie générée par l’IA qui semble plausible ou confiante, mais qui est fausse, non étayée, trompeuse ou fabriquée. Dans l’IA générative, les hallucinations peuvent inclure des faits incorrects, des sources inventées, de fausses citations ou un raisonnement qui n’est pas ancré dans des preuves fiables.
En quoi un prompt système diffère-t-il d’un prompt utilisateur ?
Utilisez le prompt système pour les instructions et contraintes durables de l’application ; utilisez le prompt utilisateur pour la demande immédiate de l’utilisateur, son contexte et le résultat souhaité.
Qu’est-ce que le red teaming pour les LLM ?
Le red teaming est un processus structuré de test adversarial utilisé pour identifier les faiblesses, les comportements dangereux ou les sorties nuisibles d’un système d’IA. Il consiste à sonder délibérément le système avec des entrées difficiles, malveillantes ou limites afin que les développeurs puissent évaluer et améliorer les protections.
Avancé
Qu’est-ce que l’empoisonnement des données dans les systèmes d’IA ?
L’empoisonnement des données est une attaque adversariale dans laquelle un acteur malveillant interfère avec les données ou le processus d’entraînement utilisés pour construire un modèle. En insérant, modifiant ou corrompant des exemples d’entraînement, l’attaquant cherche à manipuler le comportement du modèle, à dégrader ses performances ou à créer des défaillances ciblées.
Qu’est-ce que la modération du contenu pour les sorties d’IA ?
La modération du contenu et les filtres de sécurité sont des contrôles conçus pour détecter, bloquer, réduire ou escalader les contenus nuisibles, illégaux ou interdits par les politiques. Dans les systèmes d’IA, ils sont souvent combinés à des règles de politique, des classificateurs basés sur des modèles, une journalisation et une revue humaine pour les cas à plus haut risque.