Also known as: Content Moderation and Safety Filters · Content Moderation Safety Filters
La modération de contenu et les filtres de sécurité sont des contrôles conçus pour détecter, bloquer, réduire ou faire remonter les contenus nuisibles, illégaux ou interdits par une politique. Dans les systèmes d’IA, ils sont souvent combinés avec des règles de politique, des classificateurs fondés sur des modèles, la journalisation et une revue humaine pour les cas à plus haut risque.
Controls that reduce harmful or disallowed outputs (e.g., hate speech, self-harm). Often combined with human review for higher-risk contexts.