Also known as: Content Moderation and Safety Filters · Content Moderation Safety Filters
Модерация контента и фильтры безопасности — это controls, предназначенные для обнаружения, блокирования, снижения или эскалации вредного, незаконного или запрещенного политиками контента. В системах ИИ они часто сочетаются с policy rules, model-based classifiers, logging и human review для случаев повышенного риска.
Controls that reduce harmful or disallowed outputs (e.g., hate speech, self-harm). Often combined with human review for higher-risk contexts.