Un hub risques et sécurité pour comprendre comment les systèmes d’IA échouent, comment les dommages émergent et comment les contrôles réduisent les comportements dangereux.
30
Termes
7
Comparaisons
8
Questions
La sécurité et les risques de l’IA visent à prévenir, détecter et traiter les défaillances susceptibles de nuire aux personnes, aux organisations ou à la confiance du public. Le thème couvre la fiabilité technique, les contrôles organisationnels, les usages abusifs prévisibles, le monitoring et l’escalade des incidents.
Les défaillances de sécurité apparaissent souvent après le déploiement, lorsque des utilisateurs réels, des données changeantes et des contextes inattendus révèlent des faiblesses invisibles dans un benchmark.
Utile pour les safety cases, les évaluations des risques IA, les playbooks d’incident, le monitoring post-commercialisation, les revues IA dans la santé et le secteur public, ainsi que la gouvernance des déploiements à haut risque.
Concepts centraux pour distinguer sécurité, éthique, risque, dommage et problèmes d’alignement.
Termes décrivant la façon dont les systèmes se dégradent, deviennent peu fiables ou se comportent différemment après déploiement.
Méthodes utilisées pour tester, surveiller et répondre aux problèmes de sécurité sur tout le cycle de vie de l’IA.
Comparaison côte à côte de la sécurité [IA] et de l’éthique [IA]. Comprendre comment les pratiques de prévention des dommages se rattachent aux questions plus larges de valeurs humaines, de droits et de conception responsable.
Comparaison côte à côte entre risque et préjudice. Elle explique en quoi une évaluation fondée sur la probabilité et la gravité diffère de l’effet défavorable subi par une personne, un groupe, une organisation ou un système.
Comparaison côte à côte de la dérive des données et de la dérive du modèle. Comprendre en quoi les changements de distribution des données d’entrée diffèrent des changements ou de la dégradation des performances du modèle au fil du temps.
Comparaison côte à côte de la dérive des données et de la dérive du concept. Comprendre si un problème de modèle provient d’une évolution des distributions d’entrée ou d’une évolution des relations entre les entrées et les résultats.
Comparaison côte à côte entre la dérive du modèle et la dérive conceptuelle. Elle explique en quoi la dégradation des performances dans le temps diffère d’un changement dans la relation statistique entre les entrées et les résultats cibles.
Comparaison côte à côte du dossier de sécurité et de l’évaluation des risques IA. Elle explique en quoi les concepts diffèrent, quand chaque terme s’applique et pourquoi cette distinction compte pour la gouvernance, l’évaluation ou la conception des systèmes d’IA.
Distinguer l’injection de prompt, qui détourne le comportement du modèle au moyen d’une entrée malveillante, du jailbreak, qui contourne les garde-fous de sécurité pour produire du contenu restreint. Les deux sont des menaces de sécurité pour les LLM, mais diffèrent par leur mécanisme et leur objectif.
Utilisez la dérive des données lorsque la distribution des données d’entrée change ; utilisez la dérive de concept lorsque la relation entre les entrées et le résultat cible change.
L’alignement est la pratique consistant à concevoir, entraîner et gouverner un système d’IA de manière à ce que ses objectifs, ses sorties et son comportement restent cohérents avec les intentions humaines, les valeurs et les contraintes d’usage acceptable.
Un incident d’IA est un événement ou une série d’événements dans lesquels le développement, le déploiement, l’utilisation ou le dysfonctionnement d’un système d’IA cause ou pourrait causer un préjudice. Ce préjudice peut concerner la sécurité, la discrimination, la confidentialité, la conformité juridique, les infrastructures critiques, les biens, les communautés ou l’environnement.
HITL, ou humain dans la boucle, est une approche dans laquelle les personnes restent impliquées dans l’orientation, la revue, l’approbation ou l’amélioration des sorties ou décisions d’un système d’IA. Elle est utilisée pour combiner l’efficacité de la machine avec le jugement humain, en particulier dans les tâches à risque plus élevé ou sensibles au contexte.
La toxicité de l’IA désigne les sorties nuisibles, offensantes, fausses, biaisées ou autrement inappropriées générées ou amplifiées par un système d’IA. Elle peut provenir des données d’entraînement, de la conception du système, du contexte du prompt, d’un mauvais alignement ou de protections insuffisantes.
Un système de suivi après commercialisation comprend les activités des fournisseurs de systèmes d’IA visant à collecter et examiner l’expérience issue des systèmes mis sur le marché ou mis en service. Son objectif est d’identifier si une action corrective ou préventive est nécessaire après le déploiement.
La détection d’anomalies est le processus d’identification d’observations, d’événements ou de motifs qui diffèrent fortement du comportement attendu. En IA et en analyse de données, elle sert à signaler des valeurs aberrantes pouvant indiquer des erreurs, fraudes, incidents de sécurité, défaillances système ou autres conditions inhabituelles.
La sécurité dès la conception est une approche dans laquelle les exigences et protections de sécurité sont intégrées dès le début du développement du système. Pour les systèmes d’IA, cela inclut l’anticipation des mauvais usages, la protection des données et des modèles, ainsi que l’intégration des contrôles d’accès, de la surveillance et de la résilience tout au long du cycle de vie.